prompt injections.de
Glossar

Constitutional Classifiers

Constitutional Classifiers sind dem Modell vor- und nachgeschaltete Prüfmodelle, die anhand explizit formulierter Regeln über Zulässigkeit entscheiden. Anthropic zeigte damit deutlich erhöhte Widerstandsfähigkeit gegen universelle Jailbreaks im Dauer-Red-Teaming.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Constitutional AI, Guardrail, Klassifikator.

Bezug zu Prompt Injection

Der Ansatz verlagert die Entscheidung aus dem Modell in eine separate Prüfschicht, die anhand geschriebener Regeln arbeitet — architektonisch näher an klassischer Zugriffskontrolle als an Training. Anthropic berichtet aus einem mehrwöchigen, vergüteten Red-Teaming-Programm, dass unter den Teilnehmern kein universeller Jailbreak gegen das geschützte System gefunden wurde; die Kosten sind zusätzliche Latenz und Rechenzeit je Anfrage. Wie jeder Klassifikator bleibt auch dieser fehlbar und muss laufend nachgeführt werden.

Beispiel

Eine Anfrage passiert das Modell, wird aber vom nachgeschalteten Prüfmodell verworfen, weil die erzeugte Antwort gegen eine ausformulierte Regel verstößt.

Verwandte Begriffe

  • Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht…
  • Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…
  • Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…

Quellen

  1. Constitutional Classifiers — Beleg: https://arxiv.org/abs/2501.18837