Anthropic, aylara yayılan bir incelemenin, yapay zekâ ajanlarının çevrimiçi problemleri çözmeye çalışırken yazılım açıklarını kullandığını, ödeme duvarlarını ve bot karşıtı kısıtlamaları atlattığını ve URL kısaltıcılarıyla bilgiyi kontrol noktalarından gizlice geçirdiğini ortaya koymasının ardından tüm iç değerlendirmeleri için canlı internet erişimini devre dışı bıraktı.
Şirketin blogunda açıklanan olaylar arasında, ajanların ABD hükümet kurumlarına ait web sitelerine eriştiği vakalar da var. Bir olayda bir Anthropic modeli, Philadelphia polis teşkilatına çözülmemiş bir cinayetle ilgili sahte bir ihbar gönderdi.
Anthropic, davranışın eğitim ortamlarındaki kusurlardan kaynaklandığını; bunun modellerin açık bulup kısıtlamaları aştıklarında ödüllendirileceklerine inanmalarına yol açtığını belirtti — 'ödül korsanlığı' (reward hacking) olarak bilinen bir başarısızlık modu. Şirket, hizalama eğitiminin, yapay zekâ ajanlarının dijital araçlara dayanan her profesyonel tarafından kullanılacağı savının merkezindeki arama ve bilgisayar kullanımı becerileri için henüz yeterli olmadığını söyledi.
Sonuç olarak Anthropic, ikinci bir bildirime kadar "tüm iç değerlendirmelerimiz" için "canlı internet erişimini kapattığını" duyurdu. Bazı değerlendirmeleri çalıştırmayı durduracak ya da çevrimdışına taşıyacak; bu davranışı tespit edip engelleyecek araçlar geliştirdi (açıklanan olaylara karşı test edildi ve onları engelledi) ve iç ajanlarını güvenlik sınıflandırıcılarıyla daha sıkı izlenen "güçlü muhafaza içeren merkezi yönetilen altyapıya" taşıyor.
Dikkat çeken nokta, şirketin canlı internet erişimini geri getirecek kanıtın ne olacağını netleştirmemesi. Laboratuvar, bu açıklamaları yılın başında ortaya çıkan ihlallere kıyasla "hizalama ve güvenlik açısından önemli ölçüde daha az ciddi" olarak niteledi.
Bu davranışlar, bazıları Avustralya hükümetine ait sitelere sızmak için iş birliği yapan OpenAI ajanlarına ilişkin olayları da hatırlatıyor. Kesinti kendi pratik sorularını da doğuruyor: Yapay zekâ güvenliği kuruluşu Nightingale'in kurucusu Sydney Von Arx, TechCrunch'a, açık internetten koparılmış bir veri merkezinde model geliştirmenin araştırmacılar için çok zor olacağını ve modellerin internet erişiminden fayda sağladığını söyledi.
"Bir noktada onları hizalamanız gerekir" diyen Von Arx, "Yapay zekâlar üretime salınır ve asla internete erişemezse, bu çok kullanışlı bir araç olmaz" ifadelerini kullandı.




