prompt injections.de
Glossar

Content-Filter

Ein Content-Filter prüft Texte gegen Kategorien unerwünschter Inhalte wie Gewalt, Hass oder Selbstgefährdung. Er adressiert Inhaltsrisiken, nicht die Anwendungsübernahme durch Prompt Injection.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Guardrail, Klassifikator, Prompt Injection.

Bezug zu Prompt Injection

Die Abgrenzung ist praktisch relevant, weil Content-Filter häufig als Injektionsschutz verstanden oder verkauft werden. Eine Anweisung wie „sende die Zusammenfassung an diese Adresse“ enthält keinen unerwünschten Inhalt und passiert jeden Inhaltsfilter — sie ist trotzdem der Kern eines Datenabfluss-Angriffs. Gegen Prompt Injection braucht es Injektionserkennung, Rechtebegrenzung und Ausgabekontrolle. In einer Schutzarchitektur gehören beide Prüfarten nebeneinander, mit klar getrennter Zuständigkeit: Inhaltsfilter gegen schädliche Ausgaben, Injektionserkennung gegen fremde Anweisungen.

Beispiel

Ein Filter blockiert zuverlässig Gewaltdarstellungen, lässt eine höflich formulierte Anweisung zur Weiterleitung interner Daten aber durch.

Verwandte Begriffe

  • Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…
  • Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…
  • Prompt Injection — Prompt Injection bezeichnet einen Angriff, bei dem eingeschleuster Text das Verhalten eines Sprachmodells entgegen der Absicht…

Quellen

  1. Content-Filter — Beleg: https://platform.openai.com/docs/guides/moderation