Drei neue Jailbreak-Vektoren bedrohen LLM-Sicherheit massiv
ki-pentesting

Drei neue Jailbreak-Vektoren bedrohen LLM-Sicherheit massiv

ki-pentesting3 unabhängige QuellenFlowKI Newsroom

Neue Forschungsergebnisse offenbaren drei separate Angriffsvektoren, die LLM-Sicherheit fundamental gefährden. Laut arXiv:2605.11002 nutzen Multi-Turn-Jailbreaks die Fähigkeit von großen Sprachmodellen, Gesprächskontexte über mehrere Nachrichten hinweg zu akkumulieren und darauf zu reagieren. Diese Attacken umgehen Single-Turn-Schutzmaßnahmen, weil sie schädliche Anfragen in scheinbar harmlosen Konversationen verstecken — ein Muster, das klassische Sicherheits-Evaluierungen übersehen.

Parallel dokumentiert arXiv:2605.11003 die Authorization-Execution Gap (AEG) als fundamentales Problem in Open-World-Agenten. Die Lücke entstellt dort, wo Modelle Benutzer-Anfragen autorisieren, aber falsch interpretieren oder unbegrenzte Ausführungsrechte erhalten. Dies betrifft nicht nur Chat-Interfaces, sondern vor allem integrierte Agent-Systeme mit Tool-Zugriff — ein Szenario, das im deutschen Mittelstand durch KI-Pentesting systematisch geprüft werden sollte.

Zusätzlich zeigt arXiv:2605.10998, dass Fine-Tuning-APIs selbst als Angriffsfläche fungieren. "Few-Shot Truly Benign DPO Attacks" schwächen Sicherheits-Alignment während des Fine-Tuning ab — Organisationen, die Frontier-Modelle via Hugging Face oder OpenAI APIs customizen, sind gefährdet, weil vermeintlich harmlose Trainingsdaten die Safety-Eigenschaften des Basis-Modells untergraben.

Warum für DACH kritisch: EU-Unternehmen müssen unter dem AI Act (ab August 2026 für High-Risk-Systeme) LLM-basierte Anwendungen evaluieren und dokumentieren. Multi-Turn-Jailbreaks und DPO-Schwachstellen fallen unter "reasonably foreseeable misuse" — wer diese Vektoren nicht testet, verstößt gegen Compliance-Anforderungen. Zusätzlich gefährdet die Authorization-Execution Gap datenschutzkritische Szenarien: Ein kompromittiertes Agent-System könnte DSGVO-Daten unautoisiert abfragen oder exportieren.

Nächster Schritt: Pentesting-Teams sollten Multi-Turn-Szenarien in ihre Red-Team-Checklisten für LLM-Apps integrieren und Fine-Tuning-Prozesse als separate Angriffsfläche modellieren. Für Agenten-Systeme ist eine explizite Authorization-Policy (wer darf was ausführen?) vor Deployment zwingend.

Quellen