Wenn LLM-Ausgaben zu Systemzugriffen werden
Die Forschung zu OpenClaw adressiert ein grundlegendes Sicherheitsproblem: Während frühe LLM-Systeme nur Text generieren konnten, führen heutige agentic Systeme tatsächliche Operationen aus – Shell-Commands, Browser-Automation, API-Aufrufe. Das verlagert die Sicherheitsfrage vom Alignment allein auf Systemarchitektur und Vertrauensgrenzen.
Die Zahlen sind alarmierend
Die Analyse zeigt klare Skalierungsprobleme:
- Einzelner Agent: Compromise-Wahrscheinlichkeit von 0,24
- Sieben Agenten: Steigt auf 0,86, wenn jeder Agent eine Aktion vorschlagen kann
- Attack Surface: Entropie wächst von 0,42 auf 0,71 – breitere Exploit-Pfade
- Privilege Drift: Durchschnittlich 0,21 (von 0,03) – unbeabsichtigte Autoritätsgewinne
Das kritische Erkenntnisproblem: Die Modelle selbst ändern sich nicht. Die Verschlechterung kommt aus Output-Aggregation – je mehr Agenten entscheiden können, desto höher das Risiko.
Prompt Injection bleibt kritisch
Prompt-Injection-Anfälligkeitsraten unterscheiden sich je nach Modell: GPT-5.2 (0,37), Llama-4-Maverick (0,35), DeepSeek-R1 (0,31). Injections propagieren sich über das gesamte System und destabilisieren mehrere Agenten gleichzeitig.
Abwehrmaßnahmen helfen, reichen aber nicht
Policy Gating und Execution Filtering reduzieren die Metrics signifikant (p < 0,0001):
- Compromise-Wahrscheinlichkeit: -0,10
- Boundary Failures: -0,10
- Privilege Drift: -0,02
Allerdings nicht ohne Kosten: Task-Utility fällt von 0,93 auf 0,89, die Latenz steigt von 420 ms auf 468 ms.
Das Kernproblem: Der schwächste Agent bestimmt die Systemsicherheit
Wenn alle Agenten Aktionen auslösen können, wird die Sicherheit durch die vulnerabelste Komponente definiert – ein klassisches Schwachstellenproblem in verteilten Systemen. Das erfordert fundamentale Designentscheidungen:
- Strikte Agent-Hierarchien statt "any-can-execute"
- Isolated Execution Sandboxes für Agent-Outputs
- Dynamische Vertrauensbewertung je Agent
- Explizite Boundary-Enforcement zwischen Trust-Level und verfügbaren Operationen
Fazit
OpenClaw-Analyse zeigt: Multi-Agent-LLM-Systeme sind nicht einfach mehrfach unsicherer. Die Sicherheitskurve ist exponentiell. Defensive Controls wirken, aber ihr Overhead und begrenzte Wirksamkeit deuten darauf hin, dass Architekturdesign kritischer ist als nachträgliche Mitigationen. Unternehmen, die solche Systeme deployen, müssen Trust-Boundaries als primäre Design-Constraint behandeln – nicht als optionale Härtungsebene.

