prompt injections.de
Werkzeug · Forschungs-Referenz

SecAlign

Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten. Die Autoren berichten gegenüber dem Vorgängerverfahren StruQ eine nochmals deutlich gesenkte Erfolgsquote optimierungsfreier Angriffe.

Anbieter
Meta / UC Berkeley (Forschung)
Typ
Forschungs-Referenz
Lizenzmodell
Forschungsarbeit
Primärquelle
github.com

SecAlign ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Modellseitige Härtung als Ergänzung zu externen Guardrails. Voraussetzung sind Zugriff auf Modellgewichte und Trainingsinfrastruktur; für Anwendungen auf fremden APIs kommt der Ansatz nicht in Frage.

Was es nicht leistet

Forschungsarbeiten liefern das Prinzip, keinen betriebsfertigen Baustein. Die Übertragung in ein Produktivsystem ist eigene Ingenieursarbeit.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Google DeepMind (Forschung)

    CaMeL

    Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen. Die Sicherheitsaussage folgt aus der Architektur und nicht aus der Modellqualität und gilt damit unabhängig vom eingesetzten Sprachmodell.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    StruQ

    Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren. Damit die Trennung hält, müssen die reservierten Sondertoken aus allen Nutzer- und Dokumentdaten zuverlässig entfernt werden.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    Jatmo

    Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen. Der Schutz entsteht durch eine weggelassene Fähigkeit: Ein Modell ohne Instruktions-Tuning besitzt keinen Mechanismus, über den eine eingebettete Anweisung wirken könnte.

    Forschungsarbeit