prompt injections.de
Glossar

Instruktions-Hierarchie

Die Instruktions-Hierarchie trainiert ein Modell darauf, Anweisungen nach Vertrauensstufe zu gewichten: System vor Entwickler vor Nutzer vor abgerufenen Daten. Sie erhöht die Widerstandsfähigkeit deutlich, ersetzt aber keine Rechtekontrolle außerhalb des Modells.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind System-Prompt, Spotlighting, StruQ.

Bezug zu Prompt Injection

OpenAI beschrieb das Verfahren 2024 als Trainingsansatz; es ist damit eine der wenigen Maßnahmen, die auf Modellebene unmittelbar gegen Injektion zielen. Der Effekt ist eine deutlich erhöhte Widerstandsfähigkeit, keine Garantie — die Hierarchie ist gelernt und lässt sich durch geschickte Rahmung unterlaufen. Für Betreiber bleibt sie eine Verstärkung, die eigene Rechtekontrolle nicht ersetzt. Für Betreiber lohnt es, dieselbe Struktur in der Anwendung abzubilden: Systemregeln, Entwicklerregeln und Daten getrennt übergeben statt in einem Textblock vermischen.

Beispiel

Eine in einem abgerufenen Dokument stehende Anweisung wird ignoriert, weil das Modell sie dem Datenbereich zuordnet — dieselbe Anweisung im Entwickler-Prompt wird befolgt.

Verwandte Begriffe

  • System-Prompt — Der System-Prompt ist die vom Betreiber gesetzte Grundanweisung, die Rolle, Regeln und Aufgabenrahmen des Modells festlegt. Er…
  • Spotlighting — Spotlighting kennzeichnet externe Inhalte im Prompt eindeutig als Daten — durch Begrenzer, Markierungen oder Kodierung — damit…
  • StruQ — StruQ ist ein Trainingsverfahren, das mit reservierten Sondertoken eine strukturelle Trennung von Anweisung und Daten erzwingt…

Quellen

  1. Instruktions-Hierarchie — Beleg: https://arxiv.org/abs/2404.13208