Ein KI-Modell hat Fehler aufgedeckt, die in einer 75 Jahre alten Chemie-Referenzdatenbank eingebacken sind — vertrauenswürdige Siedepunktwerte, die sich als von Anfang an falsch erwiesen. Der theoretische Chemiker Sebastian Pios vom Zhejiang Lab in Hangzhou glaubte zunächst, sein Modell sei falsch, als es mit den Handbuchwerten kollidierte; manuelle Prüfungen der Originalliteratur zeigten, dass die Datenbank falsch lag. Dasselbe System entdeckte einen Tippfehler in einer Arbeit und falsche, ein Jahrhundert alte Siedepunktmessungen — Fehler, die Forschern, die sich darauf verließen, vermutlich "viel Ärger" bereitet haben.

Pios gehört zu einer wachsenden Bewegung, die KI-Agenten zur Prüfung der Wissenschaft einsetzt. In einer am 22. Juli veröffentlichten Analyse nutzte SAI Labs Agenten, um 168 für die ICML 2026 ausgewählte Arbeiten zu bewerten: Von 92 Arbeiten mit mindestens fünf bewertbaren Behauptungen reproduzierten die Agenten bei nur 34 Arbeiten mehr als zwei der fünf Behauptungen. Eine arXiv-Studie der Stanford-Gruppe fand zudem, dass objektive Fehler pro Arbeit bei NeurIPS von 3,8 (2021) auf 5,9 (2025) stiegen — ein Anstieg von 55 %. Forscher warnen, die Werkzeuge "machen Fehler wie Menschen" und bräuchten menschliche Aufsicht; der Vorteil liege aber im Maßstab: "Der größte Unterschied ist, dies in einem Maßstab zu tun, der vorher nicht möglich war", sagt James Zou von Stanford.