Als die ICML 2026 6.352 Arbeiten annahm — etwa doppelt so viele wie im Vorjahr — war die Frage nicht mehr, ob KI-Forschung reproduzierbar ist, sondern ob überhaupt jemand überprüfen kann. Hugging Face beschloss, es herauszufinden, indem es die Gemeinschaft auf das Problem losschickte.

Zwischen dem 15. Juli und dem 2. August 2026 brachten 1.221 Freiwillige ihre eigenen Coding-Agenten mit — Claude Code, Codex, Cursor und andere — und versuchten, 2.226 ICML-Arbeiten Anspruch für Anspruch zu reproduzieren. Das Ergebnis, auf dem HuggingFace-Blog veröffentlicht, ist die größte offene, anspruchsbasierte Prüfung einer wissenschaftlichen Konferenz, die je durchgeführt wurde.

Die Zahlen erzählen eine komplexe Geschichte. Von 35.908 einzelnen geprüften Ansprüchen:

51 % der untersuchten Arbeiten hatten mindestens einen unabhängig bestätigten Anspruch. Von diesen wurden 266 Arbeiten vollständig reproduziert, wobei jeder extrahierte Anspruch bestätigt wurde, und 632 weitere hatten partielle Evidenz, ohne dass etwas falsifiziert wurde. Insgesamt wurden 3.978 einzelne Ansprüche mit realen Experimenten verifiziert.

23 % der untersuchten Arbeiten hatten mindestens einen falsifizierten oder bestrittenen Anspruch. Dazu gehören 49 Arbeiten, bei denen alle Ansprüche falsifiziert und nichts verifiziert werden konnte, sowie 242 Arbeiten, bei denen unabhängige Reproduktionsteams gegensätzliche Urteile zu denselben Ansprüchen fällten.

Der Rest befand sich in einem Graubereich: 502 Arbeiten mit nur spielzeugmaßstäblicher Evidenz und 280, bei denen nichts in die eine oder andere Richtung festgestellt werden konnte, meist wegen fehlender Artefakte — nicht veröffentlichte Checkpoints, proprietäre Datensätze oder unvollständiger Code.

Zu den bemerkenswertesten Befunden:

Eine Paging-Algorithmus-Arbeit behauptete, ihre Robustheit sei durch einen konstanten Term begrenzt. Ein Teilnehmer fand, dass der additive Term tatsächlich logarithmisch wuchs. Die Organisatoren erweiterten den Test auf k = 1.024 und bestätigten das Wachstum bei etwa neun Sigma. Die wahre Robustheit ist schlechter als behauptet.

In einer Arbeit über Attention-Mechanismen und Frank-Wolfe-Optimierung fanden drei unabhängige Teams Gegenbeispiele zu einem zentralen Theorem, wobei Verstöße erstmals bei Schritt 224 auftraten — was erklärt, warum frühere Gutachter, die früher mit dem Überprüfen aufhörten, den Fehler übersehen hatten.

Eine Transformer-Evaluierungs-Arbeit hatte etwa 66 % der bewerteten Label-Positionen mit EOS-Padding-Token gefüllt, die zu nahezu Null Loss trainierten und Perplexity künstlich drückten. Die Schlagzeilen-Behauptung einer 3,1 %igen Qualitätskosten für 50 % Cache-Reduktion wurde nach Korrektur zu etwa 9,4 %.

In einem Fall fing die Challenge auch eine falsche Falsifizierung: Ein Teilnehmer behauptete, eine Methode sei 2x langsamer als der Baseline, hatte aber versehentlich pro-Trajektorie-Zeit gegen pro-Batch-Zeit verglichen. Nach Normalisierung hielt das Original stand.

Die stärksten Ergebnisse kamen nicht von vollständig autonomen Agenten-Läufen, sondern von menschlich gelenkten Workflows. Agenten gerieten in lokale Schleifen, lasen skalierungsabhängiges Fehlverhalten falsch und bauten gelegentlich ganze Falsifizierungen auf Rechenfehlern auf. Die zuverlässigsten Reproduktionen beinhalteten einen Menschen, der den Agenten lenkte — ihn neu ausrichtete, Annahmen hinterfragte und entschied, wann die Prämisse eines Experiments falsch war, bevor Rechenleistung darauf verbrannt wurde.

Hugging Face hat begonnen, die Autoren jedes bestätigten Befunds zu kontaktieren. Frühe Antworten waren positiv: Mehrere Autoren haben die Ergebnisse bestätigt, zwei arXiv-Korrekturen sind in Arbeit, und in einem Fall hatte ein Autor den Fehler einen Monat vor der Challenge leise behoben.

Das Projekt wirft eine fundamentale Frage über die Zukunft des Peer Reviews auf. Wenn die ICML 2026 doppelt so viele Arbeiten annimmt wie im Jahr zuvor, kann das traditionelle, auf Freiwillige basierende Reviewing nicht Schritt halten. Die Challenge zeigt, dass Coding-Agenten helfen können, aber nur in Verbindung mit menschlichem Urteilsvermögen — insbesondere für qualitative Bewertung, experimentelles Design und das Aufspüren subtiler Fehler, die das Verstehen von Kontext erfordern, nicht nur das Ausführen von Code.