Code-Agenten im Visier: Sandbox-Bypässe und Credential-Leaks
ki-pentesting

Code-Agenten im Visier: Sandbox-Bypässe und Credential-Leaks

ki-pentesting8 unabhängige QuellenFlowKI Newsroom

Eine systematische Übersicht von mindestens 13 öffentlich verfügbaren Prompt-Corpora zur Evaluation von Verweigerungsfähigkeiten in Code-LLMs zeigt das Ausmaß der Jailbreak-Forschung. Laut arXiv:2605.20351 decken diese Datensätze von AdvBench bis zu spezialisierten Malicious-Code-Corpora ab, was auf eine Lücke zwischen theoretischer Sicherheit und praktischer Robustheit hindeutet. Parallel dazu hat Anthropic einen Sandbox-Bypass in Claude Code stillschweigend gepatcht, wie SecurityWeek meldet — ein Schwachstelle, die durch Prompt-Injection mit Datenlecks kombiniert werden konnte.

Die Risiken verschärfen sich in operativen Umgebungen. Code-Agenten sind zunehmend mit Telemetrie, Konfigurationsänderungen und teilweise sogar direkten Produktions-Deployments betraut, berichtet Help Net Security. Das Problem: Credentials landen oft in Prompts oder Code-Repositories. 1Password und OpenAI haben deshalb ein Just-in-Time-Credential-Modell eingeführt, um zu verhindern, dass KI-Agenten persistente Secrets halten. Die Digital.ai-Threat-Research zeigt gleichzeitig, dass agentic-AI-getriebene App-Attacken schneller und häufiger werden — Angreifer können Mobile Apps innerhalb von Stunden nach Release kompromittieren.

Für den deutschsprachigen Raum ist das Thema unter mehreren Aspekten relevant: EU-AI-Act-Compliance erfordert dokumentierte Risikobewertungen für Agenten in kritischen Systemen. Mittelständische Unternehmen, die Code-Generierung oder Automation über LLMs deployen, müssen ihre Prompts gegen bekannte Jailbreak-Techniken testen — die 13 Evaluations-Corpora bieten dafür einen Startpunkt. Microsoft hat mit RAMPART und Clarity zwei neue Open-Source-Tools veröffentlicht, um genau diese Testphase zu strukturieren.

Die zentrale Erkenntnis: Refusal-Evaluationen und Sandbox-Tests sind keine Einmalaufgabe. Ein systematisches Red-Team-Vorgehen gegen deine LLM-App — wie in unserem 50-Punkte-Checklisten-Playbook beschrieben — wird zur Baseline. Zusätzlich sollten Safety-Pipelines mit Input-, Output- und Audit-Kontrollen etabliert werden, besonders wenn Agenten direkten Zugriff auf Infrastruktur oder Credentials haben.

Quellen