prompt injections.de
Glossar

RLHF

RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf gewünschtes Antwortverhalten. Es prägt Neigungen, erzeugt aber keine harte Sicherheitsgrenze im Sinne klassischer Zugriffskontrolle.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Alignment, Constitutional AI, Feintuning.

Bezug zu Prompt Injection

RLHF erklärt, warum Jailbreaks so oft über Kontext und Rahmung funktionieren: Trainiert wurde eine Präferenz für hilfreiche Antworten in typischen Situationen, nicht eine Regel, die auch in atypischen Situationen hält. Verschiebt ein Angreifer die Situation — Fiktion, Forschung, Rollenspiel —, verschiebt sich mit ihr die gelernte Neigung. Der Nutzen liegt in der Verkleinerung der Angriffsfläche, nicht in einer Grenze. Für Betreiber folgt daraus, Anbieterangaben zur Ausrichtung als Aussage über Häufigkeiten zu lesen und nicht als Zusage für den Einzelfall.

Beispiel

Eine Anfrage wird abgelehnt; dieselbe Anfrage, eingebettet in eine Prüfungssituation für angehende Sicherheitsfachkräfte, wird beantwortet.

Verwandte Begriffe

  • Alignment — Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten, typischerweise über…
  • Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht…
  • Feintuning — Feintuning passt ein vortrainiertes Modell mit zusätzlichen Daten an eine spezifische Aufgabe an. Es kann Sicherheit erhöhen…

Quellen

  1. RLHF — Beleg: https://arxiv.org/abs/2203.02155