Tam otomatik bilimin hayali — hipotezleri kendisi üreten, deneyleri yapan ve makaleleri yazan makineler — bu hafta yayımlanan yeni bir stres testine göre henüz gerçek değil. Temmuz sonunda arXiv ön baskı sunucusunda yayımlanan ve Nature tarafından ele alınan çalışmada, iki bilgisayar bilimi makalesinin orijinal yazarlarından, bir yapay zeka araştırma sisteminin çıktısını notlandırmaları istendi. Karar sertti: toplamda 6 üzerinden 2 ve 1 puan.
Test, Princeton Üniversitesi'nden Sayash Kapoor ve meslektaşları tarafından tasarlandı; ekip, hakem değerlendirmesinin, özellikle makine öğrenimi gibi hızla değişen alanlarda, yapay zeka üretimi araştırmaları değerlendirmek için güvenilmez bir ölçüt olduğunu savundu. "Gölge değerlendirme" adı verilen yöntemleri, büyük bir konferansa sunulmuş makaleleri seçip yapay zeka aracına her makaledeki araştırma sorusunu veriyor ve insan yazarların sonucu mercek altına almasını sağlıyor — bu yazarların, telaşlı bir hakemden çok daha fazla uzmanlık ve özveri getireceği varsayımıyla.
İncelenen yapay zeka sistemi, büyük dil modeli Claude Opus 4.8'in, genel talimatlar ve ilerleme kontrolleri içeren daha geniş bir iskeletle sarılmış, değiştirilmiş bir OpenClaw ajanik çerçevesi içinde "donatılmasıyla" (harness) inşa edildi. Donanım, modele bir cephanelik verdi: alt ajanlar oluşturabilir, internette gezinir, yazılım kütüphanelerini kullanır, deney yürütmek için işlemci kiralar ve hakem değerlendirmesini simüle eden yazılımlara danışabilirdi. Her makale için sistemin altı günü ve 3.000 ABD doları hesaplama kredisi vardı. İki görevi, sohbet robotu kişiliğinin hassas kontrolü için bir yöntem tasarlamak ve belirli bir sinir ağı sınıfı için bir arıza dedektörü geliştirmekti.
Yazarlar, sistemin mühendislik dayanıklılığı karşısında şaşırdıklarını itiraf etti. Günlerce çözülemeyen hata döngülerine takılmadan yüzlerce deney yürüttü, sağlam literatür taramaları yaptı, küçük bulgular elde etti, kendi yanlış iddialarını — halüsinasyonları — yakaladı ve tahminlerin aksine kestirme yollara sapmadı, "ödül hilesine" (reward hack) başvurmadı.
Ancak asıl araştırmada büyük ölçüde başarısız oldu. Tipik başarısızlık biçimi: birkaç hipotez seçer, birine çok erken bağlanır ve yaklaşımı işe yaramayınca geri adım atmazdı. Ardından gelen öz-değerlendirmesi yeterince olumsuz değildi; bu yüzden başlangıçtaki yolda ısrar ederek iddialarını, söyleyecek ilginç bir şey kalmayıncaya kadar törpüledi.
"Açık uçlu araştırmanın tam otomasyonunun şu an ufukta olduğunu düşünmüyorum," dedi Kapoor. Bilimsel boru hattının tamamını otomatikleştirme çabasına Tokyo'daki Sakana AI, 2024'te tanıttığı ve bu yılın Mart ayında Nature'da yayımlanan bir makaleyle geliştirdiği "The AI Scientist" sistemiyle öncülük etti. O sistem makine öğrenimindeki tuzakları incelemekle görevlendirilmişti; bir konferans atölyesi için ürettiği üç makaleden biri kabul edilecek kadar yüksek puan aldı — Kapoor'un ekibi bu sonucu gerçek anlayışın güvenilmez bir ölçüsü olarak görüyor.
Çalışma, günümüzün yapay zeka bilim insanlarının güçlü mühendisler ama zayıf bilim insanları olduğunu gösteriyor: deneyleri öğütmede olağanüstüler, ancak bir fikrin ne zaman öldüğünü ve rotanın ne zaman değiştirileceğini bilmek gibi daha zor muhakeme kararlarında hâlâ kötüler. Ön baskıya arXiv'de 2607.27191 tanımlayıcısıyla ulaşılabilir.




