Bir yapay zekâ modeli, 75 yıllık bir kimya referans veritabanına işlenmiş hataları ortaya çıkardı — güvenilen kaynama noktası değerlerinin aslında baştan beri yanlış olduğu anlaşıldı. Hangzhou'daki Zhejiang Laboratuvarı'ndan kuramsal kimyager Sebastian Pios, modeli el kitabı değerleriyle çelişince ilk başta hatanın modelde olduğunu sandı; orijinal literatürü elle kontrol ettiğinde yanlış olanın veritabanı olduğunu gördü. Aynı sistem bir makaledeki yazım hatasını ve yüzyıllık kaynama noktası ölçümlerindeki hatalı değerleri de yakaladı; bu hatalar muhtemelen onlara güvenen araştırmacılara "çok sorun" yaratmıştı.
Pios, bilimi denetlemek için yapay zekâ ajanları kullanan büyüyen bir hareketin parçası. 22 Temmuz'da yayımlanan bir analizde SAI Labs, ICML 2026'da sunulmak üzere seçilen 168 makaleyi değerlendirmek için ajanlar kullandı: en az beş denetlenebilir iddiası olan 92 makaleden yalnızca 34'ünde ajanlar beş iddiadan ikiden fazlasını yeniden üretebildi. Ayrıca Stanford ekibinin arXiv çalışması, NeurIPS'te makale başına düşen nesnel hata sayısının 2021'deki 3,8'den 2025'te 5,9'a — %55 artışla — yükseldiğini buldu. Araştırmacılar araçların hâlâ "insanlar gibi hata yaptığını" ve insan denetimi gerektirdiğini, ancak avantajın ölçek olduğunu söylüyor: Stanford'dan James Zou, "En büyük fark, bunu daha önce mümkün olmayan bir ölçekte yapabilmek" diyor.




