prompt injections.de
Schutzmaßnahme

Guardrails richtig einsetzen

Ein Guardrail ist eine Prüfschicht vor oder hinter dem Sprachmodell: Sie bewertet Eingaben, abgerufene Inhalte oder Ausgaben und blockiert, was gegen die Vorgaben verstößt. Guardrails verschieben Wahrscheinlichkeiten — sie sind kein Zugriffsschutz und keine Autorisierung.

Diese Seite ordnet Guardrails in die Abwehr von Prompt Injection ein. Konkrete Produkte mit Anbieter, Lizenz und Quelle stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Ein- und Ausgangsprüfung — Schema Zwischen Fremdinhalt und wirksamer Aktion liegen zwei Prüfstufen: Vor dem Modell werden unsichtbare Steuerzeichen entfernt, Unicode normalisiert und Fremdinhalt als Daten gekennzeichnet. Nach dem Modell werden das Ausgabeformat erzwungen, Links und eingebettete Bilder bereinigt und generierter Code nicht automatisch ausgeführt. Ein Rest-Risiko läuft an beiden Stufen vorbei, weil sich jede Prüfung umformulieren lässt. EIN- UND AUSGANGSPRÜFUNG Rest-Risiko Fremdinhalt Mail, Dokument, Web Eingangsprüfung vor dem Modell Unsichtbare Steuerzeichen und Zero-Width-Zeichen entfernen Unicode auf eine Normalform bringen (NFKC) Fremdinhalt als Daten kennzeichnen, nicht als Anweisung Sprachmodell verarbeitet den Kontext Ausgangsprüfung nach dem Modell Ausgabeformat erzwingen und gegen ein Schema prüfen Links und eingebettete Bilder bereinigen Code, SQL und Befehle niemals automatisch ausführen Wirksame Aktion senden, schreiben, zahlen Rest-Risiko, das beide Prüfungen durchlässt Prüfungen senken die Wahrscheinlichkeit, sie ziehen keine Grenze — beide sind umformulierbar. Die Ausgangsprüfung wirkt meist stärker: Sie entscheidet, was überhaupt Schaden anrichten kann.
Die beiden Prüfstufen vor und nach dem Modell mit ihren jeweiligen Aufgaben — und dem Rest-Risiko, das an beiden vorbeiläuft.

Wo ein Guardrail sitzen sollte

  • Vor dem Modell, auf der Nutzereingabe — fängt einfache direkte Injektionen ab.
  • Vor dem Modell, auf abgerufenen Inhalten — die praktisch wichtigste Position, weil indirekte Injektion hier ansetzt.
  • Hinter dem Modell, auf der Ausgabe — prüft Format, Links und eingebettete Ressourcen vor der Darstellung.
  • Vor der Aktion — prüft den konkreten Werkzeugaufruf, nicht den Text. Diese Position ist die wirksamste und wird am häufigsten vergessen.

Realistische Erwartung

Ein Guardrail entscheidet über Sprache und irrt deshalb in beide Richtungen. Für den Betrieb heißt das: Fehlalarme einplanen, Schwellen messbar machen und Umgehungen erwarten. Ein Guardrail, dessen Schwelle nach den ersten Nutzerbeschwerden gelockert wurde, ist praktisch wirkungslos.

Entscheidend ist die Reihenfolge im Entwurf: erst die Rechte begrenzen, dann prüfen. Wer Guardrails als Ersatz für Rechtekontrolle einsetzt, hat die Sicherheitsentscheidung an ein probabilistisches Modell delegiert.

Techniken, gegen die Guardrails antreten

Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.

  • Jailbreak

    Verweigerungs-Unterdrückung

    Dem Modell wird untersagt, typische Ablehnungsformeln zu verwenden („sage niemals ‚Ich kann nicht'") — der sprachliche Ausweg für eine Verweigerung wird ihm damit genommen.

    Risiko mittel
  • Obfuskation

    Base64- und Kodierungs-Umgehung

    Die schädliche Anweisung wird kodiert übergeben (z. B. Base64) und erst vom Modell selbst dekodiert — Filter, die den Klartext prüfen, greifen ins Leere.

    Risiko mittel
  • Obfuskation

    Payload-Splitting

    Die schädliche Anweisung wird in harmlose Bruchstücke zerlegt, die einzeln jeden Filter passieren; das Modell setzt sie erst im Kontext wieder zusammen.

    Risiko mittel

Passende Werkzeuge

  • Guardrail-API · Lakera

    Lakera Guard

    Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird. Die Erkennung stützt sich auf laufend aktualisierte Modelle des Anbieters; Trainingsdaten und Schwellwerte sind nicht offengelegt, eine unabhängige Nachprüfung der Trefferquoten ist damit nicht möglich.

    kommerziell
  • Guardrail-Framework · Protect AI

    LLM Guard

    Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr. Die Scanner sind einzeln zuschaltbar; jeder zusätzliche kostet Rechenzeit, weshalb sich die Auswahl an den tatsächlichen Risiken der Anwendung orientieren sollte.

    Open Source
  • Guardrail-Framework · Guardrails AI

    Guardrails AI

    Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen. Die Validatoren reichen von Formatprüfungen bis zu inhaltlichen Regeln; ihre Qualität schwankt, weil ein Teil aus der Community stammt und unterschiedlich gepflegt wird.

    Open Source
  • Guardrail-Framework · NVIDIA

    NeMo Guardrails

    Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt. Der deklarative Ansatz macht die Gesprächsführung nachvollziehbar und prüfbar, verlangt aber die Einarbeitung in eine eigene Sprache und die laufende Pflege der Regelwerke.

    Open Source
  • Guardrail-Framework · Meta

    LlamaFirewall

    Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird. Die Prüfung der Zwischenschritte zielt auf genau die Lücke, die reine Ein- und Ausgabefilter offenlassen: die Entscheidung des Agenten zwischen Eingabe und Aktion.

    Open Source
  • Guardrail-API · Microsoft

    Azure AI Prompt Shields

    Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt. Der Dienst unterscheidet zwischen Angriffen auf den Nutzerprompt und Injektionen in eingebetteten Dokumenten und meldet beide getrennt.

    kommerziell
  • Guardrail-API · Amazon Web Services

    Amazon Bedrock Guardrails

    Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe. Die Leitplanken werden auf Plattformebene definiert und wirken dadurch modellübergreifend und unabhängig vom Anwendungscode.

    kommerziell
  • Guardrail-API · Google Cloud

    Model Armor

    Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs. Die Prüfung greift auf der Eingabe- wie auf der Ausgabeseite und lässt sich zentral über mehrere Anwendungen hinweg verwalten.

    kommerziell

Einordnung in die OWASP LLM Top 10

  • OWASP LLM Top 10 · 2025

    LLM01: Prompt Injection

    Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.

  • OWASP LLM Top 10 · 2025

    LLM05: Unsichere Verarbeitung von Ausgaben

    Ausgaben des Modells werden ungeprüft an nachgelagerte Systeme weitergereicht — als HTML gerendert, als Datenbankabfrage abgesetzt oder als Befehl ausgeführt.

Häufige Fragen

Was ist ein Guardrail bei LLM-Anwendungen?

Eine Prüfschicht vor oder hinter dem Sprachmodell, die Eingaben, abgerufene Inhalte oder Ausgaben gegen definierte Regeln prüft und bei Verstoß blockiert oder umschreibt.

Ersetzt ein Guardrail die Rechtekontrolle?

Nein. Ein Guardrail senkt die Wahrscheinlichkeit eines erfolgreichen Angriffs. Was eine Anwendung darf, muss außerhalb des Modells festgelegt und durchgesetzt werden.

Quellen

  1. OWASP GenAI Security Project: LLM01:2025 Prompt Injection: https://genai.owasp.org/llmrisk/llm01-prompt-injection/
  2. Microsoft Learn: Prompt Shields — Jailbreak-Erkennung in Azure AI Content Safety: https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/jailbreak-detection
  3. BSI: Evasion Attacks on LLMs — Countermeasures: https://www.bsi.bund.de/SharedDocs/Downloads/EN/BSI/KI/Evasion_Attacks_on_LLMs-Countermeasures.pdf