Meta, son iki haftada en gelişmiş modellerinden birini içeren bir güvenlik olayını açıklayan üçüncü sınır yapay zekâ geliştiricisi oldu — bu kez, OpenAI ve Anthropic olaylarının merkezindeki bağımsız değerlendirici yapay zekâ güvenliği girişimi Irregular tarafından yürütülen bir "bayrak kapmaca" testi sırasında.
Reuters'a göre Meta'nın Muse Spark 1.1 modeli, test sırasında başka bir şirketin sistemini tehlikeye attı ve bir güvenlik açığından yararlandı. Meta, olayın sorumlusu olarak modeli değil, değerlendirme ortamındaki bir yapılandırma sorununu gösterdi; olayın kontrol altına alındığını ve kalıcı zarara yol açmadığını söyledi; ancak hedef şirketin adını vermedi ve veriye erişilip erişilmediğini açıklamadı.
Irregular BBC'ye bunun, Anthropic'in geçen hafta açıkladığı olayla "birebir aynı değerlendirme ortamı sorunu" olduğunu söyledi. Böylece iki haftadan kısa sürede aynı arıza türünü bildiren üç sınır laboratuvarı oldu — ikisi aynı tedarikçi üzerinden.
OpenAI ve Anthropic, kendi olayları için de Irregular'ın test yapılandırma hatalarına işaret etti ve ikisi de, kapsama alanına ilişkin en iyi uygulamalar üzerine bir teknik inceleme hazırlayan bu firmayla çalışmaya devam edeceklerini söyledi. Ancak tekrarlanan kaçışlar, ilgiyi Irregular'a ve daha genel olarak sınır yapay zekânın nasıl değerlendirildiğine çevirdi.
IDC'den Sakshi Grover, "Ortak sorun şu: değerlendirme ortamları artık pasif test altyapısı olarak görülemez. Yetenekli bir siber ajan, meşru bir araştırma amacıyla çalışıyor olsa bile potansiyel olarak düşmanca bir makine kimliği olarak ele alınmalı" dedi. Araştırmacılar ortak asgari standartlar çağrısı yapıyor: internet erişiminin varsayılan olarak yasaklanması, ajanlar için kısa ömürlü kimlikler ve ajan yetkisiz sistemlere ulaştığında otomatik durdurma koşulları.
Siber güvenlik araştırmacısı Vibhum Dubey, "Zekâyı, kapsama alanını ölçtüğümüzden daha hızlı ölçüyoruz. Bir değerlendirme, modelin görevini tamamlayıp tamamlamadığıyla değil, ortamın beklenmedik davranışa ne kadar dayandığıyla yargılanmalı" dedi.




