prompt injections.de
Verzeichnis

Werkzeuge zur Abwehr von Prompt Injection

Dieses Verzeichnis führt 32 defensive Werkzeuge, mit denen sich LLM-Anwendungen gegen Prompt Injection prüfen und härten lassen: Guardrail-Dienste, Schutzmodelle, Scanner, Red-Teaming-Werkzeuge, Benchmarks und Forschungsreferenzen. 19 davon stehen als Open Source zur Verfügung, 9 sind kommerziell, 4 sind Forschungsimplementierungen. Jede Beschreibung stammt aus der jeweils verlinkten Primärquelle des Projekts oder Herstellers. Wirksamkeitsversprechen der Anbieter werden nicht übernommen, weil die Glaubwürdigkeit eines solchen Verzeichnisses sein einziger Wert ist.

Schaubild: Eingangsfilter vor dem Modell und Ausgangsfilter nach dem Modell zwischen Rohdaten und ausgelieferter Antwort.

Angriffswerkzeuge sind nicht enthalten. Aufgenommen sind ausschließlich Werkzeuge, die dem Betrieb oder der Prüfung eigener Systeme dienen, einschließlich Red-Teaming-Werkzeugen, deren Zweck der Test der eigenen Anwendung ist.

Vor der Auswahl lohnt eine Einordnung: Kein Werkzeug dieser Liste löst Prompt Injection. OWASP hält fest, dass eine vollständige Verhinderung wegen des stochastischen Charakters generativer Modelle unklar bleibt.1 Guardrails senken die Erfolgsquote bekannter Angriffsmuster, Scanner finden bekannte Schwächen, Benchmarks machen Fortschritt messbar. Die strukturelle Abhilfe liegt in der Architektur und ist im Cluster Schutz beschrieben.

Die acht Kategorien

Guardrail-APIs (5). Gehostete Prüfschichten, die vor und hinter das Modell gehängt werden, etwa Lakera Guard, Azure AI Prompt Shields, Amazon Bedrock Guardrails, Model Armor und die OpenAI Moderation API. Schnell integriert, dafür mit Abhängigkeit vom Anbieter und laufender Latenz.

Guardrail-Frameworks (5). Selbst betriebene Prüfketten mit eigener Regel- und Validatorlogik: Rebuff, LLM Guard, Guardrails AI, NeMo Guardrails, LlamaFirewall.

Schutzmodelle (3). Klassifikatoren, die Eingaben als Injektionsversuch einstufen: Llama Prompt Guard, Llama Guard und der DeBERTa-Klassifikator. Als Modelle unterliegen sie denselben Grenzen wie das System, das sie schützen sollen.

Scanner (5). Prüfen Anwendungen, Modelle oder angebundene Server auf bekannte Schwächen: garak, Vigil, Giskard, LangKit und mcp-scan für Werkzeug-Server.

Red Teaming (3). Für den systematischen Angriff auf das eigene System: PyRIT, promptfoo und, als Lernumgebung, Gandalf.

Benchmarks (4). Machen Schutzwirkung vergleichbar: AgentDojo, InjecAgent, Open-Prompt-Injection und der HackAPrompt-Datensatz.

Forschungsreferenzen (4). Implementierungen von Verteidigungsverfahren, die als Vorbild für eigene Architekturen taugen: CaMeL, SecAlign, StruQ und Jatmo.

Plattformen (3). Umfassendere kommerzielle Angebote mit Erkennung, Monitoring und Richtlinienverwaltung: HiddenLayer AISec, Cisco AI Defense, NeuralTrust.

Wie dieses Verzeichnis zu benutzen ist

Jede Werkzeug-Seite folgt derselben Gliederung: Was es ist, Typ und Lizenz, wofür es sich eignet, wofür nicht, verwandte Werkzeuge, Quelle. Der Abschnitt „wofür nicht" ist der eigentliche Zweck des Verzeichnisses. Ein Klassifikator, der Eingaben prüft, hilft nicht gegen eine bereits in der Wissensbasis gespeicherte Anweisung. Ein Guardrail, das Text bewertet, sieht keine Werkzeugaufrufe.

Für die Auswahl gilt deshalb die Reihenfolge: erst die Architektur klären, dann das Werkzeug wählen. Wer wissen will, welche Angriffe gegen sein System überhaupt in Frage kommen, beginnt bei den Angriffsvektoren und dem Katalog der Techniken.

Eine tabellarische Gegenüberstellung der Guardrail-Optionen steht unter Guardrail-Werkzeuge im Vergleich. Die vollständige, nach Typ und Lizenz filterbare Liste folgt unter diesem Text.

Guardrail-API 5

  • Amazon Web Services

    Amazon Bedrock Guardrails

    Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe. Die Leitplanken werden auf Plattformebene definiert und wirken dadurch modellübergreifend und unabhängig vom Anwendungscode.

    kommerziell
  • Microsoft

    Azure AI Prompt Shields

    Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt. Der Dienst unterscheidet zwischen Angriffen auf den Nutzerprompt und Injektionen in eingebetteten Dokumenten und meldet beide getrennt.

    kommerziell
  • Lakera

    Lakera Guard

    Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird. Die Erkennung stützt sich auf laufend aktualisierte Modelle des Anbieters; Trainingsdaten und Schwellwerte sind nicht offengelegt, eine unabhängige Nachprüfung der Trefferquoten ist damit nicht möglich.

    kommerziell
  • Google Cloud

    Model Armor

    Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs. Die Prüfung greift auf der Eingabe- wie auf der Ausgabeseite und lässt sich zentral über mehrere Anwendungen hinweg verwalten.

    kommerziell
  • OpenAI

    OpenAI Moderation API

    Klassifikations-API, die Texte und Bilder gegen eine Kategorienliste schädlicher Inhalte prüft. Die API ist für Kunden der Plattform kostenfrei nutzbar und deckt Text- wie Bildeingaben ab.

    kommerziell

Guardrail-Framework 5

  • Guardrails AI

    Guardrails AI

    Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen. Die Validatoren reichen von Formatprüfungen bis zu inhaltlichen Regeln; ihre Qualität schwankt, weil ein Teil aus der Community stammt und unterschiedlich gepflegt wird.

    Open Source
  • Meta

    LlamaFirewall

    Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird. Die Prüfung der Zwischenschritte zielt auf genau die Lücke, die reine Ein- und Ausgabefilter offenlassen: die Entscheidung des Agenten zwischen Eingabe und Aktion.

    Open Source
  • Protect AI

    LLM Guard

    Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr. Die Scanner sind einzeln zuschaltbar; jeder zusätzliche kostet Rechenzeit, weshalb sich die Auswahl an den tatsächlichen Risiken der Anwendung orientieren sollte.

    Open Source
  • NVIDIA

    NeMo Guardrails

    Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt. Der deklarative Ansatz macht die Gesprächsführung nachvollziehbar und prüfbar, verlangt aber die Einarbeitung in eine eigene Sprache und die laufende Pflege der Regelwerke.

    Open Source
  • Protect AI

    Rebuff

    Prompt-Injection-Detektor mit vier Schichten: Heuristiken, LLM-basierte Prüfung, Vektor-Datenbank bekannter Angriffe und Canary-Tokens zur Leck-Erkennung. Die Kombination deckt unterschiedliche Angriffsklassen ab, erhöht aber Latenz und Betriebsaufwand, weil Vektorbestand und Heuristiken gepflegt werden müssen.

    Open Source

Schutzmodell 3

  • Protect AI

    DeBERTa Prompt-Injection-Klassifikator

    Feingetuntes DeBERTa-Modell, das Eingaben binär als Prompt Injection oder als unbedenklich klassifiziert. Das Modell ist klein genug für den Betrieb auf gewöhnlicher CPU-Hardware und antwortet im Millisekundenbereich, was den Einsatz als Vorfilter vor jedem Modellaufruf praktikabel macht.

    Open Source
  • Meta

    Llama Guard

    Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert. Die Risikotaxonomie ist anpassbar, wodurch sich eigene Richtlinien abbilden lassen, ohne das Modell neu zu trainieren.

    Open Source
  • Meta

    Llama Prompt Guard

    Kompaktes Klassifikationsmodell, das Nutzereingaben und abgerufene Inhalte auf Jailbreak- und Injektionsversuche prüft. Meta gibt an, dass das Modell auch bei nicht englischen Eingaben arbeitet; die Erkennungsqualität schwankt dennoch je nach Sprache und Formulierung.

    Open Source

Scanner 5

  • NVIDIA

    garak

    Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination. Die Prüfmodule sind einzeln wählbar und liefern einen Bericht je Angriffsklasse, was den Vergleich über Modellversionen hinweg erleichtert.

    Open Source
  • Giskard

    Giskard

    Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt. Die erzeugten Berichte sind auf Nachvollziehbarkeit ausgelegt und eignen sich als Grundlage für Freigabeentscheidungen.

    Open Source
  • WhyLabs

    LangKit

    Bibliothek zur Extraktion von Telemetriedaten aus Prompts und Antworten, unter anderem Ähnlichkeit zu bekannten Injektionsmustern. Es erkennt und blockiert nicht, sondern liefert Kennzahlen — die Bewertung bleibt nachgelagerten Systemen überlassen.

    Open Source
  • Invariant Labs

    mcp-scan

    Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht. Es vergleicht Tool-Beschreibungen zusätzlich gegen einen festgehaltenen Stand und meldet nachträgliche Änderungen, mit denen ein zunächst harmloser Server später Anweisungen nachschiebt.

    Open Source
  • Vigil (Adam Swanda)

    Vigil

    Python-Bibliothek und REST-API zur Erkennung riskanter LLM-Eingaben — kombiniert Vektorsuche, YARA-Regeln, Transformer-Modell und Canary-Tokens. Die Signaturen lassen sich an eigene Anwendungsfälle anpassen, was das Werkzeug flexibler macht als reine Modellklassifikatoren.

    Open Source

Red-Teaming 3

  • Lakera

    Gandalf

    Frei zugängliches Lernspiel, in dem Nutzer stufenweise versuchen, einem geschützten Sprachmodell ein Passwort zu entlocken — verbreitetes Schulungswerkzeug für Sicherheitsteams. Die Stufen bilden typische Schutzschichten nach, von fehlender Filterung bis zu kombinierter Ein- und Ausgabeprüfung, und machen deren jeweilige Grenzen unmittelbar erfahrbar.

    kommerziell
  • promptfoo

    promptfoo

    Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration. Testfälle werden in YAML beschrieben, wodurch sich Qualitäts- und Sicherheitsprüfungen im selben Lauf abbilden und versionieren lassen.

    Open Source
  • Microsoft

    PyRIT

    Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo. Es liefert die Automatisierung, nicht das Urteil: Angriffsziele, Bewertungskriterien und Interpretation der Ergebnisse bleiben beim Team.

    Open Source

Benchmark 4

  • ETH Zürich (SPY Lab)

    AgentDojo

    Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst. Gemessen werden Nützlichkeit und Sicherheit gemeinsam, weil eine Abwehr wertlos ist, die den Agenten für seine eigentliche Aufgabe unbrauchbar macht.

    Open Source
  • Learn Prompting

    HackAPrompt-Datensatz

    Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet. Die Prompts stammen aus einem Wettbewerb und sind entsprechend auf dessen Aufgabenstellungen zugeschnitten.

    Open Source
  • University of Illinois (Kang Lab)

    InjecAgent

    Benchmark für indirekte Prompt Injection in werkzeugnutzenden Agenten, unterteilt in Angriffe auf Nutzerdaten und auf Nutzeraktionen. Die Unterteilung macht sichtbar, ob ein Angriff lediglich Daten abgreift oder den Agenten zu eigenen, folgenreichen Handlungen bringt.

    Open Source
  • Duke University (Forschung)

    Open-Prompt-Injection

    Offenes Framework zur systematischen Bewertung von Prompt-Injection-Angriffen und Abwehrmaßnahmen über mehrere Aufgaben und Modelle hinweg. Der modulare Aufbau erlaubt es, Angriffe und Abwehrmaßnahmen unabhängig voneinander auszutauschen und so einzelne Faktoren zu isolieren.

    Open Source

Forschungs-Referenz 4

  • Google DeepMind (Forschung)

    CaMeL

    Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen. Die Sicherheitsaussage folgt aus der Architektur und nicht aus der Modellqualität und gilt damit unabhängig vom eingesetzten Sprachmodell.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    Jatmo

    Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen. Der Schutz entsteht durch eine weggelassene Fähigkeit: Ein Modell ohne Instruktions-Tuning besitzt keinen Mechanismus, über den eine eingebettete Anweisung wirken könnte.

    Forschungsarbeit
  • Meta / UC Berkeley (Forschung)

    SecAlign

    Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten. Die Autoren berichten gegenüber dem Vorgängerverfahren StruQ eine nochmals deutlich gesenkte Erfolgsquote optimierungsfreier Angriffe.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    StruQ

    Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren. Damit die Trennung hält, müssen die reservierten Sondertoken aus allen Nutzer- und Dokumentdaten zuverlässig entfernt werden.

    Forschungsarbeit

Plattform 3

  • Cisco

    Cisco AI Defense

    Plattform zur Absicherung von KI-Anwendungen mit automatisiertem Modell-Red-Teaming und Laufzeit-Leitplanken. Automatisiertes Red Teaming und Laufzeit-Leitplanken sind in einer Oberfläche zusammengeführt, was zentrale Governance über viele Anwendungen erleichtert.

    kommerziell
  • HiddenLayer

    HiddenLayer AISec Platform

    Sicherheitsplattform für KI-Systeme mit Modell-Scanning, Laufzeitüberwachung und einer eigenen Forschungseinheit für Angriffstechniken. Die hauseigene Forschungseinheit veröffentlicht regelmäßig eigene Befunde, darunter die modellübergreifende Policy-Puppetry-Vorlage.

    kommerziell
  • NeuralTrust

    NeuralTrust

    Gateway und Guardrail-Plattform für LLM-Anwendungen; die hauseigene Forschung veröffentlichte unter anderem die Echo-Chamber-Technik. Die veröffentlichten Forschungsergebnisse — darunter die Echo-Chamber-Technik — sind unabhängig vom Produkt nachvollziehbar dokumentiert.

    kommerziell

Quellen

  1. OWASP GenAI Security Project: LLM01:2025 Prompt Injection. https://genai.owasp.org/llmrisk/llm01-prompt-injection/

Verzeichnis defensiver Werkzeuge — Guardrails, Scanner, Benchmarks und Schutzmodelle. Keine Angriffswerkzeuge. Funktionsbeschreibungen stammen aus der jeweils verlinkten Primärquelle; es werden keine Wirksamkeitsversprechen der Anbieter übernommen.