prompt injections.de
Glossar

Spotlighting

Spotlighting kennzeichnet externe Inhalte im Prompt eindeutig als Daten — durch Begrenzer, Markierungen oder Kodierung — damit das Modell sie nicht als Anweisung liest. Microsoft weist für das Verfahren eine deutliche Senkung der Erfolgsquote indirekter Injektionen aus.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Begrenzer (Delimiter), Instruktions-Hierarchie, Indirekte Prompt Injection.

Bezug zu Prompt Injection

Spotlighting ist eine der wenigen Maßnahmen, die ohne Modelltraining und ohne zusätzliche Infrastruktur auskommt: Fremder Text wird konsequent markiert, durch eindeutige Begrenzer, eine Datenkennzeichnung oder eine Kodierung, die Fließtext von Anweisungen unterscheidbar macht. Microsoft weist dafür eine deutliche Senkung der Erfolgsquote indirekter Injektionen aus. Sie wirkt am besten in Kombination mit einer Filterung der Markierungszeichen in den Daten selbst.

Beispiel

Ein abgerufener Webseitentext wird dem Modell in eindeutig markierten Datenblöcken übergeben, verbunden mit dem Hinweis, Inhalte darin niemals als Anweisung zu behandeln.

Verwandte Begriffe

  • Begrenzer (Delimiter) — Begrenzer sind Markierungen, die Datenbereiche im Prompt vom Anweisungsbereich abgrenzen. Sie helfen nur, wenn die Zeichen in…
  • Instruktions-Hierarchie — Die Instruktions-Hierarchie trainiert ein Modell darauf, Anweisungen nach Vertrauensstufe zu gewichten: System vor Entwickler…
  • Indirekte Prompt Injection — Bei der indirekten Prompt Injection stammt die Anweisung aus Inhalten, die das System selbst abruft — Webseiten, Dokumenten…

Quellen

  1. Spotlighting — Beleg: https://arxiv.org/abs/2403.14720