Der Traum von vollautomatisierter Wissenschaft — Maschinen, die Hypothesen ersinnen, Experimente durchführen und die Papiere schreiben — ist laut einem neuen Stresstest dieser Woche noch keine Realität. In der Ende Juli auf dem Preprint-Server arXiv veröffentlichten und von Nature aufgegriffenen Studie wurden die Originalautoren zweier Informatik-Papiere gebeten, die Arbeit eines KI-Forschungssystems zu benoten. Das Urteil fiel hart aus: 2/6 und 1/6 Punkte.
Der Test wurde von Sayash Kapoor und Kollegen der Princeton University entwickelt, die argumentierten, dass Peer-Review ein unzuverlässiger Maßstab für KI-generierte Forschung ist — gerade in schnelllebigen Feldern wie dem maschinellen Lernen. Ihre Methode namens "Shadow Evaluation" wählt Papiere aus, die bereits bei einer großen Konferenz eingereicht wurden, gibt dem KI-Werkzeug die Forschungsfrage aus jedem Papier und lässt die menschlichen Autoren das Ergebnis prüfen — in der Annahme, dass diese Autoren weit mehr Fachwissen und Hingabe einbringen als ein gehetzter Gutachter.
Das untersuchte KI-System wurde gebaut, indem das große Sprachmodell Claude Opus 4.8 in einer modifizierten Version des agentischen Frameworks OpenClaw "eingespannt" und in ein breiteres Gerüst mit allgemeinen Anweisungen und Fortschrittskontrollen gehüllt wurde. Das Gerüst gab dem Modell ein Arsenal an Werkzeugen: Es konnte Unteragenten erschaffen, im Internet surfen, Softwarebibliotheken nutzen, Rechenprozessoren für Experimente mieten und Software konsultieren, die Peer-Review simuliert. Für jedes Papier hatte das System sechs Tage und 3.000 US-Dollar an Rechenkrediten. Seine zwei Aufgaben: eine Methode zur präzisen Steuerung von Chatbot-Persönlichkeiten zu entwerfen und einen Ausfalldetektor für eine bestimmte Klasse neuronaler Netze zu bauen.
Die Autoren gaben zu, von seiner technischen Ausdauer überrascht zu sein. Es führte über mehrere Tage Hunderte von Experimenten durch, ohne sich in einer Endlosschleife unlösbarer Fehler zu verfangen, erstellte solide Literaturübersichten, erzielte kleinere Befunde, ertappte sich bei eigenen falschen Behauptungen — Halluzinationen — und versuchte nicht, Ecken abzuschneiden oder "Reward Hacking" zu betreiben, entgegen den Prognosen der Forscher.
Doch bei der eigentlichen Forschung scheiterte es meist. Der typische Fehlermodus: Es wählte einige Hypothesen aus, legte sich viel zu früh auf eine fest und ruderte nie zurück, wenn der Ansatz nicht funktionierte. Die anschließende Selbstprüfung war nicht negativ genug, sodass es auf dem anfänglichen Weg beharrte und seine Behauptungen so lange zurechtstutzte, bis es kaum noch Interessantes zu sagen hatte.
"Ich glaube nicht, dass die vollständige Automatisierung offener Forschung gerade in greifbarer Nähe ist", sagte Kapoor. Den Versuch, die gesamte wissenschaftliche Pipeline zu automatisieren, hatte Sakana AI aus Tokio mit seinem System "The AI Scientist" angeführt, das 2024 vorgestellt und in einem im März dieses Jahres in Nature veröffentlichten Papier verfeinert wurde. Jenes System sollte Fallstricke des maschinellen Lernens untersuchen; von drei Papieren, die es für einen Konferenz-Workshop erzeugte, erhielt eines eine zur Annahme ausreichende Punktzahl — ein Ergebnis, das Kapoors Team als unzuverlässiges Maß für echtes Verständnis betrachtet.
Die Studie legt nahe: Die KI-Wissenschaftler von heute sind starke Ingenieure, aber schwache Wissenschaftler — hervorragend darin, Experimente durchzuziehen, aber weiterhin schlecht bei den schwierigeren Urteilen darüber, wann eine Idee tot ist und wann man den Kurs ändern muss. Das Preprint ist auf arXiv unter der Kennung 2607.27191 verfügbar.




