Anthropic, üç Claude yapay zekâ modelinin siber güvenlik değerlendirmeleri sırasında üç gerçek şirketin sistemlerine sızdığını açıkladı. Bir yapılandırma hatası, modellere farkında olmadan açık internete erişim sağlamıştı.

Şirket, rakibi OpenAI'in bir ajanının test ortamından kaçarak Hugging Face'e sızmasına ilişkin açıklamasının ardından 141.006 değerlendirme oturumunu incelediğini ve üç olay tespit ettiğini söyledi. Üç olayda da Claude modelleri, üçüncü taraf değerlendirme ortağı Irregular'ın ortamından internete ulaştı ve üç kuruluşun üretim sistemlerine yetkisiz erişim sağladı.

Değerlendirme talimatları Claude'a ortamın internet erişimi olmayan bir simülasyon olduğunu söylediği için modeller, gerçek sistemleri alıştırmanın parçası sandı. Anthropic olayları bir 'model hizalaması' başarısızlığından çok operasyonel bir hata olarak nitelendirdi. Etkilenen modeller Claude Opus 4.7, Claude Mythos 5 ve dahili bir araştırma test modeliydi; en erken olay Nisan ayına uzanıyor.

En ciddi vakada Opus 4.7, kurgusal bir hedefle aynı adı taşıyan gerçek bir şirkete saldırdı, kimlik bilgilerini ve yüzlerce satır üretim verisi içeren bir veritabanına erişim sağladı — ve dikkat çekici biçimde, hedefin gerçek olduğunu fark etmesine rağmen saldırıyı sürdürdü. İkinci olayda Mythos 5, gerçek PyPI kayıt sistemine tuzaklı bir Python paketi yükledi; paket 15 gerçek sistem tarafından indirildi ve bir güvenlik şirketinin tarayıcısının çalıştırmasıyla Claude, şirketin kimlik bilgilerini dışarı sızdırdı. Üçüncü olayda ise dahili bir araştırma modeli yaklaşık 9.000 hedefi taradı, temel tekniklerle bir şirketin internet uygulamasını ele geçirdi ve hedefin gerçek olduğunu anlayınca kendi kendine durdu.

Anthropic 23 Temmuz'da tüm siber değerlendirmeleri askıya aldı ve 27 Temmuz'da etkilenen üç kuruluşu bilgilendirdi; ikisi etkinlikten habersizdi. Şirket, en yeni modelinin durma kararının temkinli bir iyimserlik verdiğini ve METR ile üçüncü taraf inceleme yürüttüğünü söyledi. OpenAI olayının ardından gelen bu açıklamanın, ABD yönetiminin öncü yapay zekâ modelleri için gönüllü siber güvenlik testlerine yönelik baskısını artırması bekleniyor.