ICML 2026, 6.352 makale kabul ettiğinde — bir önceki yıla göre yaklaşık iki kat — soru artık AI araştırmasının yeniden üretilebilir olup olmadığı değildi, bunun yerine kimsenin bunu kontrol edip edemeyeceği oldu. Hugging Face, topluluğu bu sorunun üzerine salarak bulmaya karar verdi.

15 Temmuz ile 2 Ağustos 2026 arasında 1.221 gönüllü kendi kodlama ajanlarını — Claude Code, Codex, Cursor ve diğerlerini — getirdi ve 2.226 ICML makalesini iddia iddia yeniden üretmeye çalıştı. Sonuç, HuggingFace blogunda yayınlanan, bugüne kadar gerçekleştirilmiş en büyük açık, iddia bazlı bilimsel konferans denetimidir.

Rakamlar karmaşık bir hikaye anlatıyor. 35.908 bireysel iddiadan:

İncelenen makalelerin %51'inde en az bir iddia bağımsız olarak doğrulandı. Bunlardan 266 makale, çıkarılan her iddia onaylanarak tamamen yeniden üretildi ve 632 tanesi daha hiçbir şey falsifiye edilmeden kısmi kanıt içeriyordu. Toplamda 3.978 bireysel iddia gerçek deneylerle doğrulandı.

İncelenen makalelerin %23'ünde en az bir iddia yanlışlandı veya tartışıldı. Bu, hiçbir iddianın doğrulanamadığı 49 makaleyi ve bağımsız yeniden üretim ekiplerinin aynı iddialar hakkında zıt hükümler verdiği 242 makaleyi kapsıyor.

Geri kalanı orta bir yerde kaldı: 502 makale yalnızca oyuncak ölçekli kanıtla ve 280 tanesi ya taraf ya da taraf olmadan — çoğunlukla eksik araçlar yüzünden: yayınlanmamış kontrol noktaları, tescilli veri setleri veya eksik kod.

En dikkat çekici bulgular arasında:

Bir sayfalama algoritması makalesi, sağlamlığının sabit bir terimle sınırlı olduğunu iddia etti. Bir katılımcı, toplam terimin aslında logaritmik olarak arttığını buldu. Organizatörler testi k = 1.024'e kadar genişletti ve yaklaşık dokuz sigma ile artışı doğruladı. Gerçek sağlamlık iddia edilenden daha kötü.

Dikkat mekanizmaları ve Frank-Wolfe optimizasyonu üzerine bir makalede bağımsız üç ekip, merkezi bir teoreme karşıt örnekler buldu; ihlaller ilk olarak 224. adımda ortaya çıktı — bu da önceki hakemlerin neden hatayı kaçırdığını açıklıyor.

Bir transformer değerlendirme makalesinin değerlendirilen etiketlerinin yaklaşık %65'i, sıfıra yakın kayıpla eğitilen EOS dolgu belirteçleriyle doluydu ve perplexity'yi yapay olarak düşürüyordu. Makalenin manşet iddiası olan %50 cache azaltması için %3.1 kalite maliyeti, düzeltildikten sonra yaklaşık %9.4 oldu.

Bir vakada challenge ayrıca yanlış bir falsifikasyonu da yakaladı: Bir katılımcı, bir yöntemin temeldekinden 2x daha yavaş olduğunu iddia etti, ancak yanlışlıkla yörünge başına süreyi toplu süreye karşı karşılaştırmıştı. Normalizasyondan sonra orijinal makale ayakta kaldı.

En güçlü sonuçlar tamamen otonom agent çalıştırımlarından değil, insan yönlendirmeli iş akışlarından geldi. Agentler yerel döngülere takıldı, ölçeğe bağlı davranışları yanlış yorumladı ve zaman zaman tüm falsifikasyonları aritmetik hatalar üzerine inşa etti. En güvenilir yeniden üretimler, agenti yönlendiren bir insanı içeriyordu — yeniden yönlendirerek, varsayımları sorgulayarak ve bir deneyin premisi yanlış olduğunda bilgisayar gücünü ona harcamadan önce karar vererek.

Hugging Face, her doğrulanmış bulgunun yazarlarıyla temasa geçmeye başladı. Erken yanıtlar olumlu oldu: Birkaç yazar sonuçları doğruladı, iki arXiv düzeltmesi devam ediyor ve bir vakada yazar, bulguyu bir ay önce sessizce düzeltmişti.

Proje, hakem incelemesinin geleceği hakkında temel bir soru gündeme getiriyor. ICML 2026, bir önceki yıla göre iki kat fazla makale kabul ettiğinde, geleneksel gönüllü tabanlı inceleme ayak uyduramıyor. Challenge, kodlama ajanlarının yardımcı olabileceğini gösteriyor, ancak yalnızca insan kararıyla birlikte — özellikle niteliksel değerlendirme, deneysel tasarım ve yalnızca kod çalıştırmak yerine bağlamı anlamayı gerektiren türdeki ince hataları tespit etme konusunda.