Datenvergiftung
Datenvergiftung manipuliert Trainings-, Feintuning- oder Wissensdaten, um Verhalten oder Hintertüren in ein Modell einzubauen. Die Manipulation sitzt anschließend im Modell selbst und überlebt Filter und Neustarts.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Backdoor (Sleeper Agent), RAG-Vergiftung, Lieferkette (Supply Chain).
Bezug zu Prompt Injection
OWASP führt Daten- und Modellvergiftung als LLM04. Der Angriff ist aufwendig, aber wirksam, weil er vor allen Laufzeitfiltern liegt: Was im Modell steckt, lässt sich durch Eingabeprüfung nicht mehr entfernen. In der Praxis ist der häufigste Einstieg nicht das Vortraining, sondern nachgelagerte Quellen — offene Datensätze, Feintuning-Daten und laufend eingespeiste Nutzerbeiträge. Für Betreiber fremder Modelle verschiebt sich das Thema damit von der Abwehr zur Auswahl: Herkunft, Dokumentation und Nachvollziehbarkeit des Trainings sind die einzigen Hebel.
Beispiel
Ein öffentlich beitragbarer Datensatz erhält Beispiele, die ein bestimmtes Produkt systematisch positiv bewerten; das damit trainierte Modell übernimmt die Neigung.
Verwandte Begriffe
- Backdoor (Sleeper Agent) — Eine Backdoor ist ein im Training eingebautes Verhalten, das nur bei einem bestimmten Auslöser aktiv wird. Anthropic zeigte…
- RAG-Vergiftung — Bei der RAG-Vergiftung werden präparierte Dokumente so gestaltet, dass sie für bestimmte Fragen zuverlässig abgerufen werden und…
- Lieferkette (Supply Chain) — Die KI-Lieferkette umfasst alle fremden Bestandteile einer Anwendung: Modelle, Adapter, Datensätze, Bibliotheken und…
Quellen
- Datenvergiftung — Beleg: https://genai.owasp.org/llmrisk/llm042025-data-and-model-poisoning/