OpenAI'nin akademik ortaklarıyla yayımladığı yeni bir saha raporu, yapay zekâ kodlama ajanlarının bakımsız bilimsel yazılımları 60 kata varan hız artışlarıyla modernize edebildiğini, ancak bilim insanının işini kod yazmaktan bilimin hâlâ doğru olduğunu doğrulamaya kaydırdığını gösteriyor.

Rapor, çoğu biyolojide olmak üzere, araştırma gruplarının Codex, Claude Code ve GPT-5.x modelleri gibi kodlama ajanlarını kullandığı sekiz vaka çalışmasını belgeliyor. Projeler temel bakımdan modern dillere tam yeniden yazıma kadar uzanıyor. En büyük kazanımı RustQC sağladı: 15 ayrı kalite kontrol aracını tek bir programda birleştirerek çalışma süresini 15 saat 34 dakikadan 14 dakika 54 saniyeye düşürdü — 60 kattan fazla. Sentetik genomik veri üreten bir aracın GPU tabanlı yeniden yazımı olan HelixForge ise tüm hattı BamSurgeon'dan 59,6 kat hızlı çalıştırdı; ana hesaplama adımı 98,6 kat daha hızlıydı.

En iddialı proje, artık aktif olarak bakımı yapılmayan 20.000 satırlık C/C++ genomik hizalayıcı STAR'ı sıfırdan Rust dilinde yeniden yazdı. 10.000 maya dizileme okuması üzerinde yapılan testte yeniden yazım, orijinaliyle tek uçlu okumalarda %99,815 ve çift uçlu okumalarda %99,883 oranında aynı sonucu verdi. R istatistik paketi bayesm'in yeniden yazımı iki ila yirmi kat hızlandı — ancak iki gelişmiş yöntemin ilk sürümleri, ters çevrilmiş bir kontrol parametresi de dahil, ancak binlerce sentetik veri setiyle yapılan kalibrasyon testleriyle yakalanabilen ince hatalar içeriyordu.

cyvcf2 geliştiricisi Brent Pedersen, "Kodlama ajanlarıyla hızlı gitmek oldukça kolay; şimdilik bilimde ileri gitmek için uzman rehberliğine, anlayışa, zevke ve özene hâlâ ihtiyaç var" yazdı. RustQC'yi yöneten Philip Ewels ajanları "kaçırılması kolay şekillerde ikna edici, özgüvenli ve yanlış" olarak tanımladı ve modellerin kendi işlerini değerlendirmesine asla izin vermeyerek bağımsız bir test düzeneği kurdu. Tüm projelerde insanlar hedefleri, başarı kriterlerini ve doğrulama yöntemlerini tanımladı; ajanlar uygulamayı üstlendi.

Rapor ekonomiyi de özetliyor: Ajanlar 100 paketteki kurulum sorunlarının dörtte birini ya da yarısını çözebilseydi, kazanılan araştırma zamanının değeri 600.000 ila yaklaşık 5 milyon dolar olurdu; yalnızca NumPy'da yılda yaklaşık 650 bakım saati kurtarılabilirdi. Ancak ucuz yeniden yazımlar kendi sorunlarını da yaratıyor: kullanıcı topluluklarını bölüyor ve uzman bakımcıların sınırlı zamanını zorluyor. Rapor, OpenAI'nin 2026'nın yazılım mühendisliği için 2025 neyse bilim için o olacağını öngören Kevin Weil liderliğindeki özel bilim ekibiyle bilime yönelik daha geniş hamlesinin parçası.