Sozialwissenschaftliche Studien mit KI-Agenten reproduzieren
Die Reproduzierbarkeit wissenschaftlicher Ergebnisse ist ein Grundpfeiler guter Forschung — und gleichzeitig ein bekanntes Problem. Forscher haben nun untersucht, ob LLM-Agenten diese Aufgabe bewältigen können: Können sie Studienergebnisse allein anhand der Methodenbeschreibung und der Originaldaten rekonstruieren, ohne Zugriff auf den originalen Code zu haben?
Das Experiment
Die Wissenschaftler entwickelten ein agentic Reproduction System, das:
- Strukturierte Methodenbeschreibungen aus Papers automatisch extrahiert
- Agenten diese Beschreibungen umsetzen lässt — ohne Zugriff auf Original-Code, Ergebnisse oder das Paper selbst
- Die reproduzierten Outputs auf Cell-Level mit den Originalergebnissen vergleicht
- Abweichungen durch das System zurückverfolgt, um Fehlerursachen zu identifizieren
Getestet wurde das System auf 48 wissenschaftlichen Papieren mit menschlich verifizierten Reproduzierbarkeitsergebnissen. Vier verschiedene Agent Scaffolds wurden mit vier LLMs kombiniert.
Ergebnisse: Modelle und Papers sind unterschiedlich schwierig
Das Fazit ist differenziert: Agenten können veröffentlichte Ergebnisse größtenteils rekonstruieren — aber die Erfolgsquote variiert erheblich zwischen:
- Verschiedenen LLMs: Nicht alle Modelle sind gleich gut für diese Aufgabe geeignet
- Verschiedenen Agent Scaffolds: Die Architektur des Agenten-Systems macht einen Unterschied
- Verschiedenen Papers: Manche Studien sind einfach schwerer zu reproduzieren als andere
Warum Fehler entstehen
Die Root-Cause-Analyse zeigt zwei Kategorien von Problemen:
- Agent-Fehler: Die KI macht Fehler bei der Umsetzung oder Interpretation
- Underspecification in Papers: Viele wissenschaftliche Papiere beschreiben ihre Methoden nicht detailliert genug
Dieser zweite Punkt ist interessant: Er zeigt, dass nicht nur die KI-Fähigkeiten ein Limit sind, sondern auch die Qualität der wissenschaftlichen Dokumentation.
Relevanz für die Praxis
Das Forschungsergebnis hat mehrere Implikationen:
- Qualitätskontrolle: KI-Agenten könnten helfen, die Reproduzierbarkeit von Studien zu überprüfen
- Standards für Papiere: Es wird deutlich, dass Methodenbeschreibungen präziser sein müssen
- Modellvergleiche: Für solch spezialisierte Tasks gibt es deutliche Unterschiede zwischen verfügbaren LLMs
Das System demonstriert, dass es möglich ist, LLM-Agenten ohne direkten Code-Zugriff zur Reproduktion einzusetzen — aber es ist kein automatisches Verfahren, sondern eine Aufgabe, bei der viele Faktoren zusammenwirken.

