
Messfehler bei LLM-Agent-Sicherheit: Warum ASR-Metriken täuschen
Was passiert
Forschende an führenden Institutionen haben eine fundamentale Messproblem in der Sicherheitsevaluierung von LLM-Agenten identifiziert. Laut einer neuen arXiv-Publikation ist die Attack Success Rate (ASR) — die Standardmetrik in nahezu jeder veröffentlichten Sicherheitsstudie zu KI-Agenten — als eigenständige Messgröße unzureichend und irreführend.
Das Kern-Problem: ASR gibt nur an, ob ein Angriff funktioniert oder nicht, ohne dabei zu berücksichtigen, wie robust die Messung selbst ist, wie zufällig die Ergebnisse sein könnten oder ob die Attacke tatsächlich das misst, was Forschende zu messen glauben. Die arXiv-Studie cs.CR 2609.25173 demonstriert, dass dieser Ansatz zu systematischen Fehlbewertungen führt. Beispiele: Kleine Stichprobengrößen führen zu unreliablen Aussagen über echte Verwundbarkeiten; Varianz in LLM-Ausgaben wird ignoriert; der Kontext, in dem ein Angriff stattfindet, wird nicht berücksichtigt.
Parallel dazu präsentiert eine zweite arXiv-Publikation (cs.CR 2609.22510) konkrete Erkenntnisse zu Trigger-basierten Prompt-Injection-Angriffen (IPI — Indirect Prompt Injection). Diese Angriffe funktionieren so: Ein LLM-Agent integriert externe Tools oder Datenquellen (etwa APIs, Web-Scraping, Datenbanken). Ein Angreifer platziert versteckte, bösartige Anweisungen in einer dieser Quellen. Wenn der Agent die Quelle verarbeitet, werden diese Anweisungen ausgeführt — oft ohne dass der Benutzer es bemerkt. Die Forschung zeigt, dass solche "Trigger-basierten" Varianten besonders effektiv sind, weil sie temporär aktiviert werden können und Detektionslogik umgehen, die auf statische Signaturen setzt.
Eine dritte Studie (cs.CR 2609.22664) wirft ein systematisches Problem in der Evaluierung autonomer Penetration-Testing-Agenten auf: Die meisten Arbeiten konzentrieren sich rein auf Capability ("Kann der Agent ein Flag capturen?"), nicht auf Assurance ("Wie zuverlässig und sicher ist diese Fähigkeit unter realen Bedingungen?"). Die Forschenden schlagen einen formalen Rahmen vor, um diese Lücke zu schließen.
Warum für DACH relevant
In Deutschland, Österreich und der Schweiz haben Sicherheitsevaluierungen von KI-Systemen zunehmend regulatorische Bedeutung. Der EU AI Act verpflichtet Anbieter hochriskanter KI-Systeme (Kategorie 3 und 4) zu umfassenden Sicherheitstests, bevor sie in den Markt gehen. Die Luftfahrtbranche, der Finanzsektor und kritische Infrastrukturen müssen Penetration-Testing-Ergebnisse dokumentieren und Behörden vorweisen können.
Das Problem der ASR-Metriken ist hier besonders kritisch: Wenn ein deutsches Unternehmen einen LLM-Agenten für die Kreditscore-Berechnung oder die Medikamentenentwicklung einsetzt und zur Regulatorischen Prüfung eine Sicherheitsevaluierung vorlegt, muss diese Evaluierung valide sein. Werden Schwachstellen mit fehlerhaften Metriken bewertet, besteht das Risiko, dass unsichere Systeme als sicher zertifiziert werden — und später zu Schaden führen.
Ferner verweisen die Studien auf ein praktisches DACH-Problem: Viele Mittelstandsunternehmen in der Region beauftragen externe Penetration-Testing-Labs, um ihre KI-Systeme zu prüfen. Wenn diese Labs ASR-basierte Berichte liefern, ohne statistische Validität, Varianzanalyse oder formale Assurance-Rahmenbedingungen zu dokumentieren, entsteht eine Compliance-Falle. Der Auftraggeber hält ein Testat in der Hand, das möglicherweise keine echte Sicherheit garantiert.
Der EU AI Act und die nationale KI-Verordnung erwarten, dass solche Tests methodisch robust sind. Die neue arXiv-Forschung signalisiert: Der aktuelle Standard ist das nicht.
Was du jetzt wissen solltest
Die zentrale Erkenntnis ist nicht, dass LLM-Agenten unsicher sind — sondern dass wir bisher nicht verlässlich gemessen haben, wie unsicher sie tatsächlich sind. Das erfordert eine Umstellung: Statt sich auf einzelne ASR-Zahlen zu verlassen, sollten Pentesting-Reports künftig folgende Elemente enthalten: Statistische Konfidenzintervalle (nicht nur Punkt-Schätzungen); Reproduzierbarkeit und Varianzquellen (wie stark schwanken die Ergebnisse je nach LLM-Run?); formale Definitionen dessen, was ein "erfolgreicher Angriff" im jeweiligen Kontext bedeutet; und eine explizite Trennung zwischen "der Agent kann diese Aufgabe lösen" und "der Agent löst sie sicher, auch unter Angriff".
Für Organisationen im DACH-Raum heißt das konkret: Bei der Auftragsvergabe für Penetration Testing sollte gefordert werden, dass Berichte diese methodischen Standards erfüllen. Und bei der Bewertung von Sicherheitsstudien in der Literatur sollte kritisch hinterfragt werden, ob ASR allein als Beweis herangezogen wird. Die Forschung zeigt, dass echte Sicherheitsgarantie für autonome Agenten noch in den Kinderschuhen steckt — und dass dieser Reifegrad in den nächsten Audit-Zyklen deutlich steigen muss.
Mehr zum Thema autonomer KI-Agenten im Sicherheitskontext findet sich in der Pillar-Übersicht zu KI-Pentesting sowie in der Analyse zu autonomen Penetration-Testing-Agenten und Assurance-Frameworks.
Quellen
- arXiv cs.CR 2609.25173: Attack Success Rate Is Not a Number — On Measurement Validity in Agentic AI Security Evaluation
- arXiv cs.CR 2609.22510: Defusing Explosive Prompts — Understanding and Preventing Trigger-Based Prompt Injections in LLM Agents
- arXiv cs.CR 2609.22664: From Capability to Assurance in Autonomous Penetration-Testing Harnesses — A Framework and Reference Implementation