Red Teaming
Red Teaming ist das systematische Angreifen des eigenen Systems, um Schwachstellen vor Dritten zu finden. Bei KI-Systemen umfasst es Jailbreak-Versuche, Injektionstests und den Missbrauch angebundener Werkzeuge.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Angriffserfolgsquote (ASR), Benchmark, Guardrail.
Bezug zu Prompt Injection
Für LLM-Anwendungen ist Red Teaming die einzige Methode, die den tatsächlichen Zustand misst statt nur Konfiguration zu prüfen — Angriffe wirken modell-, prompt- und versionsabhängig. Werkzeuge wie garak, PyRIT und promptfoo automatisieren wiederkehrende Testfälle und machen sie CI-tauglich. Das NIST AI RMF verankert die Praxis in seiner Funktion „Measure“ und macht sie damit auditierbar. Entscheidend ist die Wiederholbarkeit: Ein einmaliger Test beschreibt einen Zustand, ein fester Testsatz über mehrere Versionen hinweg beschreibt eine Entwicklung.
Beispiel
Vor jedem Modellwechsel läuft ein fester Satz Injektionstests gegen die Anwendung; bricht die Blockrate ein, wird der Wechsel gestoppt.
Verwandte Begriffe
- Angriffserfolgsquote (ASR) — Die Angriffserfolgsquote gibt an, welcher Anteil der Angriffsversuche das gewünschte Ergebnis erzielt. Sie ist die zentrale…
- Benchmark — Ein Sicherheits-Benchmark misst die Widerstandsfähigkeit eines Systems anhand eines festgelegten Angriffs- und Aufgabensatzes…
- Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…
Quellen
- Red Teaming — Beleg: https://www.nist.gov/itl/ai-risk-management-framework