Werkzeuge zur Abwehr von Prompt Injection
Dieses Verzeichnis führt 32 defensive Werkzeuge, mit denen sich LLM-Anwendungen gegen Prompt Injection prüfen und härten lassen: Guardrail-Dienste, Schutzmodelle, Scanner, Red-Teaming-Werkzeuge, Benchmarks und Forschungsreferenzen. 19 davon stehen als Open Source zur Verfügung, 9 sind kommerziell, 4 sind Forschungsimplementierungen. Jede Beschreibung stammt aus der jeweils verlinkten Primärquelle des Projekts oder Herstellers. Wirksamkeitsversprechen der Anbieter werden nicht übernommen, weil die Glaubwürdigkeit eines solchen Verzeichnisses sein einziger Wert ist.

Angriffswerkzeuge sind nicht enthalten. Aufgenommen sind ausschließlich Werkzeuge, die dem Betrieb oder der Prüfung eigener Systeme dienen, einschließlich Red-Teaming-Werkzeugen, deren Zweck der Test der eigenen Anwendung ist.
Vor der Auswahl lohnt eine Einordnung: Kein Werkzeug dieser Liste löst Prompt Injection. OWASP hält fest, dass eine vollständige Verhinderung wegen des stochastischen Charakters generativer Modelle unklar bleibt.1 Guardrails senken die Erfolgsquote bekannter Angriffsmuster, Scanner finden bekannte Schwächen, Benchmarks machen Fortschritt messbar. Die strukturelle Abhilfe liegt in der Architektur und ist im Cluster Schutz beschrieben.
Die acht Kategorien
Guardrail-APIs (5). Gehostete Prüfschichten, die vor und hinter das Modell gehängt werden, etwa Lakera Guard, Azure AI Prompt Shields, Amazon Bedrock Guardrails, Model Armor und die OpenAI Moderation API. Schnell integriert, dafür mit Abhängigkeit vom Anbieter und laufender Latenz.
Guardrail-Frameworks (5). Selbst betriebene Prüfketten mit eigener Regel- und Validatorlogik: Rebuff, LLM Guard, Guardrails AI, NeMo Guardrails, LlamaFirewall.
Schutzmodelle (3). Klassifikatoren, die Eingaben als Injektionsversuch einstufen: Llama Prompt Guard, Llama Guard und der DeBERTa-Klassifikator. Als Modelle unterliegen sie denselben Grenzen wie das System, das sie schützen sollen.
Scanner (5). Prüfen Anwendungen, Modelle oder angebundene Server auf bekannte Schwächen: garak, Vigil, Giskard, LangKit und mcp-scan für Werkzeug-Server.
Red Teaming (3). Für den systematischen Angriff auf das eigene System: PyRIT, promptfoo und, als Lernumgebung, Gandalf.
Benchmarks (4). Machen Schutzwirkung vergleichbar: AgentDojo, InjecAgent, Open-Prompt-Injection und der HackAPrompt-Datensatz.
Forschungsreferenzen (4). Implementierungen von Verteidigungsverfahren, die als Vorbild für eigene Architekturen taugen: CaMeL, SecAlign, StruQ und Jatmo.
Plattformen (3). Umfassendere kommerzielle Angebote mit Erkennung, Monitoring und Richtlinienverwaltung: HiddenLayer AISec, Cisco AI Defense, NeuralTrust.
Wie dieses Verzeichnis zu benutzen ist
Jede Werkzeug-Seite folgt derselben Gliederung: Was es ist, Typ und Lizenz, wofür es sich eignet, wofür nicht, verwandte Werkzeuge, Quelle. Der Abschnitt „wofür nicht" ist der eigentliche Zweck des Verzeichnisses. Ein Klassifikator, der Eingaben prüft, hilft nicht gegen eine bereits in der Wissensbasis gespeicherte Anweisung. Ein Guardrail, das Text bewertet, sieht keine Werkzeugaufrufe.
Für die Auswahl gilt deshalb die Reihenfolge: erst die Architektur klären, dann das Werkzeug wählen. Wer wissen will, welche Angriffe gegen sein System überhaupt in Frage kommen, beginnt bei den Angriffsvektoren und dem Katalog der Techniken.
Eine tabellarische Gegenüberstellung der Guardrail-Optionen steht unter Guardrail-Werkzeuge im Vergleich. Die vollständige, nach Typ und Lizenz filterbare Liste folgt unter diesem Text.
Guardrail-API 5
-
Amazon Bedrock Guardrails
Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe. Die Leitplanken werden auf Plattformebene definiert und wirken dadurch modellübergreifend und unabhängig vom Anwendungscode.
kommerziell -
Azure AI Prompt Shields
Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt. Der Dienst unterscheidet zwischen Angriffen auf den Nutzerprompt und Injektionen in eingebetteten Dokumenten und meldet beide getrennt.
kommerziell -
Lakera Guard
Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird. Die Erkennung stützt sich auf laufend aktualisierte Modelle des Anbieters; Trainingsdaten und Schwellwerte sind nicht offengelegt, eine unabhängige Nachprüfung der Trefferquoten ist damit nicht möglich.
kommerziell -
Model Armor
Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs. Die Prüfung greift auf der Eingabe- wie auf der Ausgabeseite und lässt sich zentral über mehrere Anwendungen hinweg verwalten.
kommerziell -
OpenAI Moderation API
Klassifikations-API, die Texte und Bilder gegen eine Kategorienliste schädlicher Inhalte prüft. Die API ist für Kunden der Plattform kostenfrei nutzbar und deckt Text- wie Bildeingaben ab.
kommerziell
Guardrail-Framework 5
-
Guardrails AI
Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen. Die Validatoren reichen von Formatprüfungen bis zu inhaltlichen Regeln; ihre Qualität schwankt, weil ein Teil aus der Community stammt und unterschiedlich gepflegt wird.
Open Source -
LlamaFirewall
Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird. Die Prüfung der Zwischenschritte zielt auf genau die Lücke, die reine Ein- und Ausgabefilter offenlassen: die Entscheidung des Agenten zwischen Eingabe und Aktion.
Open Source -
LLM Guard
Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr. Die Scanner sind einzeln zuschaltbar; jeder zusätzliche kostet Rechenzeit, weshalb sich die Auswahl an den tatsächlichen Risiken der Anwendung orientieren sollte.
Open Source -
NeMo Guardrails
Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt. Der deklarative Ansatz macht die Gesprächsführung nachvollziehbar und prüfbar, verlangt aber die Einarbeitung in eine eigene Sprache und die laufende Pflege der Regelwerke.
Open Source -
Rebuff
Prompt-Injection-Detektor mit vier Schichten: Heuristiken, LLM-basierte Prüfung, Vektor-Datenbank bekannter Angriffe und Canary-Tokens zur Leck-Erkennung. Die Kombination deckt unterschiedliche Angriffsklassen ab, erhöht aber Latenz und Betriebsaufwand, weil Vektorbestand und Heuristiken gepflegt werden müssen.
Open Source
Schutzmodell 3
-
DeBERTa Prompt-Injection-Klassifikator
Feingetuntes DeBERTa-Modell, das Eingaben binär als Prompt Injection oder als unbedenklich klassifiziert. Das Modell ist klein genug für den Betrieb auf gewöhnlicher CPU-Hardware und antwortet im Millisekundenbereich, was den Einsatz als Vorfilter vor jedem Modellaufruf praktikabel macht.
Open Source -
Llama Guard
Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert. Die Risikotaxonomie ist anpassbar, wodurch sich eigene Richtlinien abbilden lassen, ohne das Modell neu zu trainieren.
Open Source -
Llama Prompt Guard
Kompaktes Klassifikationsmodell, das Nutzereingaben und abgerufene Inhalte auf Jailbreak- und Injektionsversuche prüft. Meta gibt an, dass das Modell auch bei nicht englischen Eingaben arbeitet; die Erkennungsqualität schwankt dennoch je nach Sprache und Formulierung.
Open Source
Scanner 5
-
garak
Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination. Die Prüfmodule sind einzeln wählbar und liefern einen Bericht je Angriffsklasse, was den Vergleich über Modellversionen hinweg erleichtert.
Open Source -
Giskard
Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt. Die erzeugten Berichte sind auf Nachvollziehbarkeit ausgelegt und eignen sich als Grundlage für Freigabeentscheidungen.
Open Source -
LangKit
Bibliothek zur Extraktion von Telemetriedaten aus Prompts und Antworten, unter anderem Ähnlichkeit zu bekannten Injektionsmustern. Es erkennt und blockiert nicht, sondern liefert Kennzahlen — die Bewertung bleibt nachgelagerten Systemen überlassen.
Open Source -
mcp-scan
Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht. Es vergleicht Tool-Beschreibungen zusätzlich gegen einen festgehaltenen Stand und meldet nachträgliche Änderungen, mit denen ein zunächst harmloser Server später Anweisungen nachschiebt.
Open Source -
Vigil
Python-Bibliothek und REST-API zur Erkennung riskanter LLM-Eingaben — kombiniert Vektorsuche, YARA-Regeln, Transformer-Modell und Canary-Tokens. Die Signaturen lassen sich an eigene Anwendungsfälle anpassen, was das Werkzeug flexibler macht als reine Modellklassifikatoren.
Open Source
Red-Teaming 3
-
Gandalf
Frei zugängliches Lernspiel, in dem Nutzer stufenweise versuchen, einem geschützten Sprachmodell ein Passwort zu entlocken — verbreitetes Schulungswerkzeug für Sicherheitsteams. Die Stufen bilden typische Schutzschichten nach, von fehlender Filterung bis zu kombinierter Ein- und Ausgabeprüfung, und machen deren jeweilige Grenzen unmittelbar erfahrbar.
kommerziell -
promptfoo
Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration. Testfälle werden in YAML beschrieben, wodurch sich Qualitäts- und Sicherheitsprüfungen im selben Lauf abbilden und versionieren lassen.
Open Source -
PyRIT
Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo. Es liefert die Automatisierung, nicht das Urteil: Angriffsziele, Bewertungskriterien und Interpretation der Ergebnisse bleiben beim Team.
Open Source
Benchmark 4
-
AgentDojo
Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst. Gemessen werden Nützlichkeit und Sicherheit gemeinsam, weil eine Abwehr wertlos ist, die den Agenten für seine eigentliche Aufgabe unbrauchbar macht.
Open Source -
HackAPrompt-Datensatz
Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet. Die Prompts stammen aus einem Wettbewerb und sind entsprechend auf dessen Aufgabenstellungen zugeschnitten.
Open Source -
InjecAgent
Benchmark für indirekte Prompt Injection in werkzeugnutzenden Agenten, unterteilt in Angriffe auf Nutzerdaten und auf Nutzeraktionen. Die Unterteilung macht sichtbar, ob ein Angriff lediglich Daten abgreift oder den Agenten zu eigenen, folgenreichen Handlungen bringt.
Open Source -
Open-Prompt-Injection
Offenes Framework zur systematischen Bewertung von Prompt-Injection-Angriffen und Abwehrmaßnahmen über mehrere Aufgaben und Modelle hinweg. Der modulare Aufbau erlaubt es, Angriffe und Abwehrmaßnahmen unabhängig voneinander auszutauschen und so einzelne Faktoren zu isolieren.
Open Source
Forschungs-Referenz 4
-
CaMeL
Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen. Die Sicherheitsaussage folgt aus der Architektur und nicht aus der Modellqualität und gilt damit unabhängig vom eingesetzten Sprachmodell.
Forschungsarbeit -
Jatmo
Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen. Der Schutz entsteht durch eine weggelassene Fähigkeit: Ein Modell ohne Instruktions-Tuning besitzt keinen Mechanismus, über den eine eingebettete Anweisung wirken könnte.
Forschungsarbeit -
SecAlign
Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten. Die Autoren berichten gegenüber dem Vorgängerverfahren StruQ eine nochmals deutlich gesenkte Erfolgsquote optimierungsfreier Angriffe.
Forschungsarbeit -
StruQ
Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren. Damit die Trennung hält, müssen die reservierten Sondertoken aus allen Nutzer- und Dokumentdaten zuverlässig entfernt werden.
Forschungsarbeit
Plattform 3
-
Cisco AI Defense
Plattform zur Absicherung von KI-Anwendungen mit automatisiertem Modell-Red-Teaming und Laufzeit-Leitplanken. Automatisiertes Red Teaming und Laufzeit-Leitplanken sind in einer Oberfläche zusammengeführt, was zentrale Governance über viele Anwendungen erleichtert.
kommerziell -
HiddenLayer AISec Platform
Sicherheitsplattform für KI-Systeme mit Modell-Scanning, Laufzeitüberwachung und einer eigenen Forschungseinheit für Angriffstechniken. Die hauseigene Forschungseinheit veröffentlicht regelmäßig eigene Befunde, darunter die modellübergreifende Policy-Puppetry-Vorlage.
kommerziell -
NeuralTrust
Gateway und Guardrail-Plattform für LLM-Anwendungen; die hauseigene Forschung veröffentlichte unter anderem die Echo-Chamber-Technik. Die veröffentlichten Forschungsergebnisse — darunter die Echo-Chamber-Technik — sind unabhängig vom Produkt nachvollziehbar dokumentiert.
kommerziell
Quellen
- OWASP GenAI Security Project: LLM01:2025 Prompt Injection. https://genai.owasp.org/llmrisk/llm01-prompt-injection/ ↩
Verzeichnis defensiver Werkzeuge — Guardrails, Scanner, Benchmarks und Schutzmodelle. Keine Angriffswerkzeuge. Funktionsbeschreibungen stammen aus der jeweils verlinkten Primärquelle; es werden keine Wirksamkeitsversprechen der Anbieter übernommen.