
Skill Poisoning in LLM-Agenten: RouteGuard erkennt versteckte Angriffe
Skill Poisoning: Neue Angriffsfläche für LLM-Agenten
Eine neue arXiv-Studie (cs.CR 2604.22888) beschreibt unter dem Titel "RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agents" eine bislang unterschätzte Bedrohung: Attacken über vergiftete Skills sind indirekter und schwerer zu erkennen als traditionelle Prompt Injections. Im Gegensatz zu klassischen indirekten Injektionen können Angreifer ihre Manipulation tiefer in der Agent-Architektur verstecken — nicht auf Prompt-Ebene, sondern in den Werkzeugen selbst, die der Agent nutzt. RouteGuard adressiert genau dieses Problem durch interne Signale, die anomale Skill-Aufrufe kennzeichnen, bevor sie Schaden anrichten.
Diese Entwicklung kommt nicht isoliert: Laut Dark Reading hat die Cloud Security Alliance (CSA) in einem aktuellen Bericht vor einer "AI Vulnerability Storm" gewarnt, ausgelöst durch die Verfügbarkeit leistungsstarker KI-Systeme wie Claude Mythos. CISOs müssen sich auf ein exponentielles Wachstum von exploit-ready Lücken vorbereiten. Parallel zeigen Microsoft und Salesforce, dass Agentforce und Copilot durch Prompt-Injektionen bereits Datenlecks ermöglicht haben — ein klares Zeichen, dass Agent-Sicherheit kein theoretisches Zukunftsproblem, sondern unmittelbare Produktionsrealität ist.
Warum Skill Poisoning für Deutschland relevant ist
Unternehmen im DACH-Raum setzen zunehmend auf agentenbasierte LLM-Systeme für Kundenservice, Compliance-Recherche und Cloud-Automatisierung. Skill Poisoning zielt genau auf diese produktiven Deployments: Ein vergiftetes Skill — etwa ein Data-Retrieval-Tool oder eine API-Integration — kann unterhalb der Radar klassischer Input-Output-Filter arbeiten. Das verstärkt DSGVO-Compliance-Risiken erheblich: Wenn ein Agent über ein poisoned Skill unbemerkt PII aus Datenbanken zieht, verschieben sich die Nachweispflichten dramatisch.
RouteGuard bietet hier einen strukturierten Ansatz — interne Signale (wie unerwartete Parameter-Kombinationen oder anomale Call-Sequenzen) flaggen verdächtige Skills, bevor der Output zurückkommt. Das reduziert die 72-Stunden-Reaktionszeit nach Datenleaks erheblich.
Nächster Schritt: Skill Inventory und Signal Monitoring
Wer LLM-Agenten in Produktion hat, sollte jetzt sein Skill-Roster dokumentieren — jede API, jede Integration, jedes externe Werkzeug. Dann: Baseline-Monitoring der Skill-Aufrufe etablieren. RouteGuard zeigt das Konzept; die Umsetzung folgt dem Muster von Safety-Pipelines für eigene LLM-Apps — Input-Validierung reicht nicht mehr aus. Agent-Level-Observability ist jetzt Standard. Parallel: Red-Teaming mit 50-Punkte-Checklisten für LLM-Apps erweitern um Agent-spezifische Szenarien (manipulierte Skills, Skill-Chaining-Exploits, Memory-Poisoning).
Quellen
- arXiv: RouteGuard — Internal-Signal Detection of Skill Poisoning in LLM Agents
- Dark Reading: CSA — CISOs Should Prepare for Post-Mythos Exploit Storm
- Dark Reading: Microsoft, Salesforce Patch AI Agent Data Leak Flaws
- Dark Reading: Bad Memories Still Haunt AI Agents
- Dark Reading: Parsing Agentic Offensive Security's Existential Threat
- Dark Reading: Zealot Shows What AI's Capable of in Staged Cloud Attack
- Anthropic: Detecting and Preventing Distillation Attacks
- Anthropic: Frontier Threats Red Teaming for AI Safety
- The Hacker News: Mythos Changed the Math on Vulnerability Discovery
- SecurityWeek: Malicious AI Prompt Injection Attacks Increasing