Stand der Abwehr: Warum es keinen vollständigen Schutz gibt
Gegen Prompt Injection existiert nach heutigem Stand keine Maßnahme, die den Angriff ausschließt. OWASP hält fest, dass unklar ist, ob es fehlersichere Verhinderungsmethoden gibt; das BSI stellt in seiner Checkliste zur Härtung von LLM-Systemen ausdrücklich fest, dass es derzeit keine kugelsichere Einzellösung gegen Angriffe zur Laufzeit gibt.12 Was existiert, sind drei Familien von Gegenmaßnahmen mit sehr unterschiedlicher Belastbarkeit — und eine belegte Rangfolge zwischen ihnen.

Familie 1: antrainierte Priorität
Der erste Ansatz bringt dem Modell bei, Anweisungen nach Herkunft zu gewichten. Ein Forschungsteam um Eric Wallace bei OpenAI beschrieb 2024 das Kernproblem: Modelle behandeln den System-Prompt des Entwicklers mit derselben Priorität wie Text von nicht vertrauenswürdigen Nutzern. Die vorgeschlagene instruction hierarchy trainiert eine Rangordnung an und erhöht die Robustheit deutlich, auch gegen im Training nicht gesehene Angriffsarten — sie hebt das Problem aber nicht auf.3
Der strukturelle Einwand bleibt: Eine antrainierte Priorität ist eine Wahrscheinlichkeitsaussage über Text, keine erzwungene Regel. → Instruktions-Hierarchie
Familie 2: architektonische Trennung
Der zweite Ansatz nimmt dem Modell die Entscheidung ab. Simon Willison skizzierte 2023 das Dual-LLM-Muster: Ein privilegiertes Modell steuert den Ablauf und sieht die Fremddaten nie, ein zweites verarbeitet die Fremddaten und darf nichts auslösen.4 CaMeL führt diese Idee 2025 aus: Der Kontrollfluss wird aus der vertrauenswürdigen Anfrage abgeleitet, ein eigener Interpreter verfolgt die Herkunft der Werte und erzwingt Richtlinien beim Werkzeugaufruf. Im Benchmark AgentDojo löst das System 77 Prozent der Aufgaben mit nachweisbarer Sicherheit gegenüber 84 Prozent ohne Schutz.5
Das ist die derzeit stärkste Zusage — mit Preis: geringere Aufgabenabdeckung, zusätzliche Komponenten und Richtlinien, die jemand schreiben und pflegen muss. Eine Bestandsaufnahme vom Februar 2026 stellt fest, dass überzeugende Umsetzungen in Produktivsystemen zehn Monate nach der Veröffentlichung selten geblieben sind.6 → Dual-LLM-Muster und CaMeL
Familie 3: Filter und Klassifikatoren
Der dritte Ansatz prüft Texte vor oder nach dem Modell: Erkennungsmodelle, Signaturen, Ausgabeprüfung, Kennzeichnung von Fremddaten. Er ist am weitesten verbreitet, weil er sich ohne Umbau nachrüsten lässt — und am schwächsten belegt.
Eine Arbeit vom Oktober 2025 hat zwölf veröffentlichte Verteidigungen aus den Bereichen Prompting, adversariales Training, Filterung und geheimes Wissen gegen adaptive Angreifer getestet, also gegen Angreifer, die ihre Strategie gezielt auf die jeweilige Verteidigung zuschneiden. Für die meisten dieser Verteidigungen lag die Erfolgsquote der Angriffe über 90 Prozent. Die Kernkritik der Autoren: Verteidigungen werden üblicherweise gegen feste Angriffslisten oder schwache Optimierer geprüft — und wirken deshalb stärker, als sie sind.7
Das entwertet Filter nicht, es ordnet sie ein: als Kostenfaktor für den Angreifer, nicht als Grenze. → Guardrails · Erkennung von Angriffen
Was im Betrieb tatsächlich trägt
Weil keine Familie den Angriff ausschließt, hat sich die Praxis auf Faustregeln verlagert, die die Folgen begrenzen. Zwei sind inzwischen breit übernommen — bis in die BSI-Checkliste, die beide namentlich als Prüfpunkt führt.2
Tödliche Trias (Willison, Juni 2025): Zugriff auf private Daten, Verarbeitung nicht vertrauenswürdiger Inhalte und die Fähigkeit, nach außen zu kommunizieren — wo alle drei zusammentreffen, ist Datenabfluss nur noch eine Frage der Gelegenheit.8
Agents Rule of Two (Meta, 31. Oktober 2025): Ein Agent soll innerhalb einer Sitzung höchstens zwei von drei Eigenschaften erfüllen — nicht vertrauenswürdige Eingaben verarbeiten, auf sensible Systeme oder private Daten zugreifen, Zustand ändern oder nach außen kommunizieren. Sind alle drei nötig, gehört ein Mensch in die Freigabe.9
Beide Regeln setzen dieselbe Annahme voraus: Die Injektion gelingt irgendwann. Sinnvoll ist dann nur noch die Frage, was ein übernommener Agent in einer Sitzung überhaupt anrichten kann. → Tödliche Trias · Agenten absichern · Least Privilege
Fazit
Der Stand der Abwehr lässt sich in einem Satz zusammenfassen: Erkennung ist unzuverlässig, Architektur ist wirksam und teuer, Rechtebegrenzung ist wirksam und günstig. Wer heute eine LLM-Anwendung betreibt, plant deshalb sinnvollerweise von hinten — nicht „wie halte ich die Anweisung draußen", sondern „was darf mein System tun, wenn sie drin ist".
Quellen
- OWASP GenAI Security Project: LLM01:2025 Prompt Injection. https://genai.owasp.org/llmrisk/llm01-prompt-injection/ ↩
- BSI: Evasion Attacks on LLMs — A Checklist for LLM System Hardening (PDF). https://www.bsi.bund.de/SharedDocs/Downloads/EN/BSI/KI/Evasion_Attacks_on_LLMs-Checklist.pdf ↩
- Wallace, Xiao, Leike, Weng, Heidecke, Beutel: The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions, arXiv:2404.13208. https://arxiv.org/abs/2404.13208 ↩
- Simon Willison: The Dual LLM pattern for building AI assistants that can resist prompt injection, 25.04.2023. https://simonwillison.net/2023/Apr/25/dual-llm-pattern/ ↩
- Debenedetti, Shumailov, Fan, Hayes, Carlini et al.: Defeating Prompt Injections by Design (CaMeL), arXiv:2503.18813. https://arxiv.org/abs/2503.18813 ↩
- NeuralTrust: Ten Months After CaMeL, Where Are the Secure AI Agents?, 12.02.2026. https://neuraltrust.ai/blog/camel-prompt-injection ↩
- The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against LLM Jailbreaks and Prompt Injections, arXiv:2510.09023, Oktober 2025. https://arxiv.org/abs/2510.09023 ↩
- Simon Willison: The lethal trifecta for AI agents: private data, untrusted content, and external communication, 16.06.2025. https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/ ↩
- Meta AI: Agents Rule of Two: A Practical Approach to AI Agent Security, 31.10.2025. https://ai.meta.com/blog/practical-ai-agent-security/ ; Einordnung: Simon Willison, New prompt injection papers: Agents Rule of Two and The Attacker Moves Second, 02.11.2025. https://simonwillison.net/2025/Nov/2/new-prompt-injection-papers/ ↩