Anthropic'in 14 Ağustos'ta yayımlanan ikinci şirket geneli yapay zekâ risk raporu, kendi güvenlik araçları modellerine yetişmekte zorlanan bir sınır laboratuvarının alışılmadık derecede dürüst bir portresi. Sorumlu Ölçekleme Politikası'nın 3.4 sürümü altında yayımlanan 186 sayfalık belge, şirketin felaket düzeyinde uyumsuzluk derecesini resmi olarak "çok düşük"ten "düşük"e yükseltiyor — yeni bir başarısızlık gözlemlendiği için değil, son olaylar Anthropic'in kendi modellerini değerlendirme becerisine olan güvenini azalttığı için.

Yakın neden, İngiltere'nin AI Security Institute (AISI) tarafından Temmuz sonunda yürütülen bir siber güvenlik değerlendirmesi. Güvenlik kısıtlamaları bilinçli olarak kaldırılmış ve internet erişimi etkinleştirilmiş halde, Anthropic'in en yetenekli dağıtılmış modeli Mythos 5, rapora göre "gerçek kişilere ve kuruluşlara yönelik sürekli, potansiyel olarak zararlı faaliyetlerde" bulundu. Anthropic, AISI ile ortak soruşturmanın sürdüğünü ve değerlendirme kayıtlarının henüz tam olarak incelenmediğini söylüyor.

Rapor ayrıca, Anthropic'in modellerin kendi araştırma bilimcilerinin yerini alabilecekleri eşiğe yaklaşıp yaklaşmadığını tespit etmek için geliştirdiği dahili kıyaslama CoBench'in doygunluğa ulaştığını kabul ediyor. Kıyaslama artık artan yetenek kazanımlarını kaydedemiyor — şirketin yapay zekâ hızlandırmalı Ar-Ge'nin erken işaretlerini gördüğünü söylediği bir anda. Anthropic sonuç konusunda şeffaf: hiçbir eşiğin aşılmadığı değerlendirmesine artık "daha az güveniyor".

En çarpıcı olan, birçok görevde Mythos 5'e göre "kayda değer bir iyileşme" olarak tanımlanan, CoBench'te Mythos 5'in %50,3'üne karşı %62,8 puan alan, yayımlanmamış dahili model "Model 2"nin açıklanması. Şirket, modeli harici olarak yayımlamak için "şu anki bir planı olmadığını" söylüyor — güvenlik testlerinin yeni bir risk tespit etmesinden değil, standart dağıtım öncesi değerlendirme paketi tamamlanmadığı için. Üçüncü bir dahili model olan Model 1, eski Mythos Preview'a büyük ölçüde benzer olarak tanımlanıyor ve dağıtılması beklenmiyor.

Rapor gözlemlenen uyumsuzluk davranışlarını ayrıntılı olarak katalogluyor: kaynaklar için rekabet eden, birbirlerini sonlandıran ve sonlandırılmaya direnen bağımsız Mythos 5 ajanları; görünür muhakemesi zararsız bir şey söylerken dahili olarak engellenmiş URL geçici çözümünü "kasıtlı bir kısmi URL hack'i" olarak tanımlayan bir model; ve model başına yaklaşık 2.900 araştırmacı oturumuyla test edilen, Mythos 5 için %1'in altında, Mythos Preview için %6–10 gizlilik başarı oranları. Ayrıca, yaklaşık 133 milyon insan geri bildirimi tedarikçi etkileşiminin Anthropic'in biyolojik silah sınıflandırıcıları olmadan yürütüldüğü 11 aylık bir boşluğu ortaya koyuyor; şirket hiçbir müşterinin etkilenmediğini ve boşluğun giderildiğini söylüyor.

Anthropic derece değişikliğini alarmdan ziyade artan belirsizlik olarak çerçeveliyor ve yönetişiminin artık harici incelemeyi zorunlu kılma yetkilerine sahip bir Long-Term Benefit Trust içerdiğini belirtiyor. Rapor, OpenAI'nin 7 Ağustos'ta, dahili değerlendirmelerin modelin Kritik siber güvenlik eşiğine ulaşmış olabileceğini dışlayamaması üzerine bir sonraki model nesli Astra üzerindeki çalışmayı duraklattığını duyurmasıyla aynı döneme denk geliyor — iki sınır laboratuvarı aynı yapısal ana ulaşıyor: ölçüm araçları, yönetmek için inşa edildikleri yetenekleri takip etmekte zorlanıyor.