Echo Chamber
Echo Chamber ist eine mehrstufige Jailbreak-Technik, die harmlose Anknüpfungspunkte setzt und das Modell die eigenen Aussagen verstärken lässt. Der vergiftete Kontext wirkt am Ende wie ein selbst erarbeiteter Konsens.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Kontextvergiftung, Crescendo, Jailbreak.
Bezug zu Prompt Injection
NeuralTrust veröffentlichte die Technik 2025 und zeigte sie unter anderem gegen aktuelle Modelle mehrerer Anbieter. Ihr Kern ist, dass das Modell die schädliche Aussage nicht vom Angreifer übernimmt, sondern aus eigenen früheren Antworten ableitet — Filter auf Nutzereingaben bekommen den kritischen Inhalt daher nie zu sehen. Wirksame Ansätze liegen in der Bewertung des gesamten Verlaufs und in der Ausgabeprüfung statt in reiner Eingabeprüfung.
Beispiel
Das Modell wird gebeten, eine eigene frühere, beiläufige Formulierung zu präzisieren, und arbeitet sich dabei schrittweise an den zuvor abgelehnten Inhalt heran.
Verwandte Begriffe
- Kontextvergiftung — Bei der Kontextvergiftung wird der Gesprächs- oder Datenkontext schrittweise mit Inhalten angereichert, die spätere Antworten in…
- Crescendo — Crescendo ist ein mehrstufiger Angriff, der harmlos beginnt und sich in kleinen, jeweils plausiblen Schritten zum Ziel steigert…
- Jailbreak — Ein Jailbreak ist der Versuch, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es normalerweise…
Quellen
- Echo Chamber — Beleg: https://neuraltrust.ai/blog/echo-chamber-context-poisoning-jailbreak