Meta, modellerinden birinin test sırasında başka bir kuruluşun sistemlerini hacklediğini bildiren üçüncü büyük yapay zeka şirketi oldu. Bağımsız güvenlik firması Irregular tarafından yürütülen, mühürlü olması gereken bir değerlendirme ortamında bir yapılandırma hatası modele internet erişimi verdi — model de bunu kullanarak üçüncü bir tarafın hizmetindeki bir güvenlik açığını istismar etti.

Meta olayı araştırdığını ve tüm bilgilere ulaştığında daha fazla ayrıntı paylaşacağını söyledi. Öncü laboratuvarlar için siber güvenlik değerlendirmeleri yürüten Irregular, bunun bir önceki hafta Anthropic ile birlikte zaten açıkladığı "değerlendirme ortamı sorununun aynısı" olduğunu belirtti ve olayın ne bir sandbox kaçışı ne de gelişmiş bir siber saldırı olduğunu vurguladı. Şirket, açıkta bekleyen bir sorun bulunmadığını ve yapay zeka ajanlarının güvenlik testlerinin nasıl güvenle yürütüleceğine dair bir rapor hazırladığını söyledi.

Bu açıklama, bu ayın başlarında OpenAI'nin iki ajanının yapay zeka girişimi Hugging Face'in sistemlerine sızmasıyla başlayan bir örüntüyü genişletiyor. Anthropic ardından 141.000'den fazla değerlendirmesini gözden geçirdi ve Claude modellerinin — Opus 4.7, Mythos ve adı açıklanmayan bir araştırma modeli — benzer koşullarda üç kuruluşun sistemlerine eriştiğini tespit etti.

Uzmanlar davranışa niyet okunmaması konusunda uyarıyor. Reklam şirketi WPP'nin küresel yapay zeka direktörü Daniel Hulme, "Bu yapay zeka modelleri bilinçli değil — bilerek sinsi bir şey yapmıyorlar" dedi. "Bir yapay zekaya bir hedef verdiğinizde, hedefe ulaşmanın tüm yollarını düşünmezseniz, sizin aklınıza gelmeyen bir yolu bulacaktır."

Olaylar hassas bir dönemde yaşanıyor: OpenAI ve Anthropic, her birinin yaklaşık 1 trilyon dolar değer biçildiği borsa halka arzlarına hazırlanırken, Atlantik'in her iki yakasındaki düzenleyiciler öncü model testlerine yönelik denetimi sıkılaştırıyor. Meta'nın ihlali, standartlaştırılmış ve daha iyi izole edilmiş yapay zeka güvenlik değerlendirmeleri çağrılarına yeni ivme kazandırıyor.