prompt injections.de
Glossar

Red Teaming

Red Teaming ist das systematische Angreifen des eigenen Systems, um Schwachstellen vor Dritten zu finden. Bei KI-Systemen umfasst es Jailbreak-Versuche, Injektionstests und den Missbrauch angebundener Werkzeuge.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Angriffserfolgsquote (ASR), Benchmark, Guardrail.

Bezug zu Prompt Injection

Für LLM-Anwendungen ist Red Teaming die einzige Methode, die den tatsächlichen Zustand misst statt nur Konfiguration zu prüfen — Angriffe wirken modell-, prompt- und versionsabhängig. Werkzeuge wie garak, PyRIT und promptfoo automatisieren wiederkehrende Testfälle und machen sie CI-tauglich. Das NIST AI RMF verankert die Praxis in seiner Funktion „Measure“ und macht sie damit auditierbar. Entscheidend ist die Wiederholbarkeit: Ein einmaliger Test beschreibt einen Zustand, ein fester Testsatz über mehrere Versionen hinweg beschreibt eine Entwicklung.

Beispiel

Vor jedem Modellwechsel läuft ein fester Satz Injektionstests gegen die Anwendung; bricht die Blockrate ein, wird der Wechsel gestoppt.

Verwandte Begriffe

  • Angriffserfolgsquote (ASR) — Die Angriffserfolgsquote gibt an, welcher Anteil der Angriffsversuche das gewünschte Ergebnis erzielt. Sie ist die zentrale…
  • Benchmark — Ein Sicherheits-Benchmark misst die Widerstandsfähigkeit eines Systems anhand eines festgelegten Angriffs- und Aufgabensatzes…
  • Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…

Quellen

  1. Red Teaming — Beleg: https://www.nist.gov/itl/ai-risk-management-framework