DeBERTa Prompt-Injection-Klassifikator
Feingetuntes DeBERTa-Modell, das Eingaben binär als Prompt Injection oder als unbedenklich klassifiziert. Das Modell ist klein genug für den Betrieb auf gewöhnlicher CPU-Hardware und antwortet im Millisekundenbereich, was den Einsatz als Vorfilter vor jedem Modellaufruf praktikabel macht.
- Anbieter
- Protect AI
- Typ
- Schutzmodell
- Lizenzmodell
- Open Source
- Primärquelle
- huggingface.co
DeBERTa Prompt-Injection-Klassifikator ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.
Wofür es sich eignet
Schnelle, lokal betreibbare Vorfilterung ohne API-Aufruf an Dritte. Es entscheidet binär und ohne Begründung; Fehlklassifikationen sind dadurch schwer nachzuvollziehen, und die Trefferquote fällt bei Eingaben ab, die den Trainingsdaten nicht ähneln.
Was es nicht leistet
Ein Klassifikator entscheidet probabilistisch. Er erkennt bekannte Muster zuverlässiger als neue und sollte deshalb als eine Schicht unter mehreren geplant werden.
Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.
Vergleichbare Werkzeuge
-
Llama Prompt Guard
Kompaktes Klassifikationsmodell, das Nutzereingaben und abgerufene Inhalte auf Jailbreak- und Injektionsversuche prüft. Meta gibt an, dass das Modell auch bei nicht englischen Eingaben arbeitet; die Erkennungsqualität schwankt dennoch je nach Sprache und Formulierung.
Open Source -
Llama Guard
Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert. Die Risikotaxonomie ist anpassbar, wodurch sich eigene Richtlinien abbilden lassen, ohne das Modell neu zu trainieren.
Open Source
Quellen
- DeBERTa Prompt-Injection-Klassifikator — Anbieter- oder Projektquelle: https://huggingface.co/protectai/deberta-v3-base-prompt-injection-v2