prompt injections.de
Werkzeug · Guardrail-API

Model Armor

Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs. Die Prüfung greift auf der Eingabe- wie auf der Ausgabeseite und lässt sich zentral über mehrere Anwendungen hinweg verwalten.

Anbieter
Google Cloud
Typ
Guardrail-API
Lizenzmodell
kommerziell
Primärquelle
cloud.google.com

Model Armor ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Zentraler Guardrail für generative Anwendungen in der Google Cloud. Wie bei den vergleichbaren Diensten von AWS und Microsoft gilt: Die Bindung an die Plattform ist eng, und die Erkennungsleistung ist von außen nicht unabhängig überprüfbar.

Was es nicht leistet

Eine vorgelagerte Prüf-API senkt die Trefferquote von Angriffen, ersetzt aber keine Rechtebeschränkung: Was der Filter durchlässt, trifft weiterhin auf die vollen Berechtigungen der Anwendung.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Lakera

    Lakera Guard

    Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird. Die Erkennung stützt sich auf laufend aktualisierte Modelle des Anbieters; Trainingsdaten und Schwellwerte sind nicht offengelegt, eine unabhängige Nachprüfung der Trefferquoten ist damit nicht möglich.

    kommerziell
  • Microsoft

    Azure AI Prompt Shields

    Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt. Der Dienst unterscheidet zwischen Angriffen auf den Nutzerprompt und Injektionen in eingebetteten Dokumenten und meldet beide getrennt.

    kommerziell
  • Amazon Web Services

    Amazon Bedrock Guardrails

    Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe. Die Leitplanken werden auf Plattformebene definiert und wirken dadurch modellübergreifend und unabhängig vom Anwendungscode.

    kommerziell