
Backdoors in LLM-Agenten: Sicherheitsstacks übersehen stille Manipulationen
Sicherheitsteams, die LLM-Modelle in Enterprise-Umgebungen einsetzen, vertrauen auf eine Annahme, die sich als unzureichend erweist: dass böswillige Manipulation in den Eingabe-Tokens sichtbar wird. Laut Help Net Security zeigen aktuelle Backdoor-Attacken ein anderes Bild — die gefährlichsten Manipulationen finden in den internen Modell-Schichten statt und hinterlassen keine erkennbaren Spuren bei der Token-Filterung oder Input-Validierung. Diese "stille Manipulation" umgeht damit die meisten bestehenden Sicherheitsstacks.
Parallel dazu beschreiben aktuelle arXiv-Arbeiten zwei weitere Dimensionen des Problems. "Hidden in Memory: Sleeper Memory Poisoning" zeigt, wie agentenbasierte LLM-Systeme über persistente Speicher-Module manipulierbar sind. Während das Modell selbst fair agiert, können Angreifer Gedächtnis-Layer mit Bias infizieren, sodass sich böswillige Effekte erst bei längerfristigen Interaktionen manifestieren. Ein zweiter arXiv-Beitrag dokumentiert das Phänomen der "Causal Potency": Modelle zeigen behaviorale Fairness in ihren Outputs, während interne Repräsentationen tiefe Biases für Hochrisiko-Entscheidungen (Kreditvergabe, Medizin, Hiring) speichern. Diese versteckten Biases sind durch klassische Output-Tests nicht erkennbar.
Für den deutschsprachigen Raum ist dies unmittelbar relevant. Unter der EU-AI-Act-Klassifizierung fallen Hochrisiko-Systeme unter strenge Transparency- und Audit-Anforderungen. Wenn interne Biases und Memory-Poisoning nicht gemessen werden können, entsteht eine Compliance-Lücke: Unternehmen können formal faire Outputs nachweisen, während das System faktisch diskriminiert. Zudem verstärkt sich das Problem bei lokal betriebenen Modellen oder Fine-Tuning, wo Supply-Chain-Verifikation schwächer ausfällt als bei API-basierten Services.
Die praktische Konsequenz ist eine Neuausrichtung der LLM-Sicherheitstests. Input-Validierung allein ist nicht ausreichend. Unternehmen müssen zusätzlich interne Aktivierungsmuster überwachen, Speicher-Injektions-Szenarien testen und bei agentenbasierten Systemen gezielt nach Memory-Poisoning suchen — ähnlich wie im KI-Pentesting mit strukturierten Checklisten. Gleichzeitig gewinnen Safety-Pipelines mit Output-Audit-Komponenten an Bedeutung, um stille Manipulationen überhaupt erst erkennen zu können.