
Mehrstufige KI-Angriffe knacken selbst Frontier-Modelle
Frontier-Modelle wie GPT-4o und Claude 3.5 zeigen erhebliche Schwachstellen gegenüber mehrstufigen Angriffen, die über mehrere Gesprächsturnusse hinweg aufgebaut werden. Laut Cisco-Sicherheitsforschern nutzen Angreifer dabei Techniken wie Kontextwechsel, Rollen-Adoption und schrittweise Eskalation, um die Sicherheitsmechanismen zu umgehen, die einzelne Anfragen blockieren würden. Die Modelle "kollabieren", wenn Attacken nicht isoliert, sondern als langfristige Konversation strukturiert werden — ein Phänomen, das die Branche bislang unterschätzt hat.
Das Problem verschärft sich durch den Aufstieg von Agentic-AI-Systemen. Während Unternehmen vermehrt auf autonome KI-Agenten setzen, um Workflows zu automatisieren, warnen Sicherheitsexperten vor fehlenden Schutzmaßnahmen. Wie Dark Reading meldet, bleibt "Security die größte Herausforderung für Agentic AI in Unternehmen" — Tools zur sicheren Implementierung entstehen erst jetzt. Hinzu kommt: KI-gesteuerte Exploit-Entwicklung verringert die Zeit von Schwachstellen-Erkennung bis zum funktionierenden Angriff dramatisch, wie weitere Dark-Reading-Recherchen zeigen. Im DeFi-Sektor führt dies bereits zu Milliardenverlusten — OpenZeppelin-Chef warnt, dass autonome KI-Coding-Agenten Smart Contracts "tödlich anfällig" machen.
Für deutsche Unternehmen und Mittelstand ist dies kritisch, da viele KI-Agenten für interne Prozesse evaluieren oder bereits einsetzen. Die umfassende KI-Pentesting-Strategie erfordert jetzt explizit Multi-Turn-Szenarien im Testansatz — nicht nur isolierte Anfragen. Besonders relevant: Unternehmen, die unter DSGVO operieren, müssen auch die 50-Punkte-Red-Team-Checkliste für LLM-Apps um ein Kapitel "Agentic Escalation" erweitern. Der EU-AI-Act macht Hochrisiko-Systeme (Kategorie 3-4) haftbar für solche Schwächen — wer heute nicht testet, trägt morgen Compliance- und Schadensersatzrisiken.
Take-Away: Beauftragte einen externen Red-Team-Anbieter mit Multi-Turn-Attack-Szenarien für jede KI-Anwendung, bevor diese in Produktion geht. Die Einzelturntests genügen nicht mehr.
Quellen
- Help Net Security: Frontier AI models collapse under multi-turn AI attacks
- Dark Reading: For Enterprises, Security Remains Agentic AI's Biggest Challenge
- Dark Reading: AI-Assisted Exploit Development Outpaces Scanner Detection
- CoinDesk: DeFi isn't safe anymore because AI is becoming 'superhuman' at hacking
- arXiv: HARP: Measuring Harm Amplification in Multi-Agent LLM Systems