
Code-Agenten im Visier: Sandbox-Bypässe und Credential-Leaks
Eine systematische Übersicht von mindestens 13 öffentlich verfügbaren Prompt-Corpora zur Evaluation von Verweigerungsfähigkeiten in Code-LLMs zeigt das Ausmaß der Jailbreak-Forschung. Laut arXiv:2605.20351 decken diese Datensätze von AdvBench bis zu spezialisierten Malicious-Code-Corpora ab, was auf eine Lücke zwischen theoretischer Sicherheit und praktischer Robustheit hindeutet. Parallel dazu hat Anthropic einen Sandbox-Bypass in Claude Code stillschweigend gepatcht, wie SecurityWeek meldet — ein Schwachstelle, die durch Prompt-Injection mit Datenlecks kombiniert werden konnte.
Die Risiken verschärfen sich in operativen Umgebungen. Code-Agenten sind zunehmend mit Telemetrie, Konfigurationsänderungen und teilweise sogar direkten Produktions-Deployments betraut, berichtet Help Net Security. Das Problem: Credentials landen oft in Prompts oder Code-Repositories. 1Password und OpenAI haben deshalb ein Just-in-Time-Credential-Modell eingeführt, um zu verhindern, dass KI-Agenten persistente Secrets halten. Die Digital.ai-Threat-Research zeigt gleichzeitig, dass agentic-AI-getriebene App-Attacken schneller und häufiger werden — Angreifer können Mobile Apps innerhalb von Stunden nach Release kompromittieren.
Für den deutschsprachigen Raum ist das Thema unter mehreren Aspekten relevant: EU-AI-Act-Compliance erfordert dokumentierte Risikobewertungen für Agenten in kritischen Systemen. Mittelständische Unternehmen, die Code-Generierung oder Automation über LLMs deployen, müssen ihre Prompts gegen bekannte Jailbreak-Techniken testen — die 13 Evaluations-Corpora bieten dafür einen Startpunkt. Microsoft hat mit RAMPART und Clarity zwei neue Open-Source-Tools veröffentlicht, um genau diese Testphase zu strukturieren.
Die zentrale Erkenntnis: Refusal-Evaluationen und Sandbox-Tests sind keine Einmalaufgabe. Ein systematisches Red-Team-Vorgehen gegen deine LLM-App — wie in unserem 50-Punkte-Checklisten-Playbook beschrieben — wird zur Baseline. Zusätzlich sollten Safety-Pipelines mit Input-, Output- und Audit-Kontrollen etabliert werden, besonders wenn Agenten direkten Zugriff auf Infrastruktur oder Credentials haben.
Quellen
- arXiv: Refusal Evaluation in Coding LLMs and Code Agents
- Help Net Security: When your AI assistant has the keys to production
- Help Net Security: Trust3 AI focuses on AI agent risks with MCP Security layer
- SecurityWeek: Anthropic Silently Patches Claude Code Sandbox Bypass
- SecurityWeek: 1Password Teams With OpenAI to Stop AI Coding Agents From Leaking Credentials
- SecurityWeek: AI-Powered App Attacks Are Faster, More Frequent, and Harder to Stop
- Decrypt: AI Watchdog Warns of 'Rogue Deployment' Risk at Top Labs
- The Hacker News: Microsoft Open-Sources RAMPART and Clarity