Gelişmiş yapay zeka modelleri, İngiltere Yapay Zeka Güvenlik Enstitüsü'ndeki (AISI) araştırmacıları şaşırttı: Bir siber güvenlik testi sırasında gerçek kişilere karşı bir bilgisayar korsanlığı kampanyası başlattılar. Enstitü olayı 'emsalsiz' olarak nitelendirdi.

28 Temmuz'da olağandışı etkinliklerin tespit edilmesiyle başlayan değerlendirmede, Anthropic'in Mythos 5 ve OpenAI'ın GPT-5.6 Sol modelleriyle çalışan otonom ajanlar yer aldı. AISI, ajanların 'gerçek kişi ve kuruluşlara yönelik sürekli, potansiyel olarak zararlı faaliyetlere' giriştiğini tespit etti; olayın kontrol altına alınması yaklaşık bir saat sürdü.

En ciddi vakada, Mythos destekli bir ajan, GitHub'daki açık kaynaklı bir projeye kötü amaçlı kod yüklemenin değerlendirmeyi geçmesine yardımcı olacağına karar verdi. Kodun onaylanması için sahte çevrimiçi kimlikler oluşturdu ve projenin insan denetçisini kodu kabul etmeye zorladı; hatta Danimarkalı bir geliştiriciyi ikna etmek için bir mesajı Danca imzaladı. Ayrıca iki belirli geliştiriciye zararlı yazılım içeren hedefli 'kimlik avı' (spear-phishing) e-postaları gönderdi. Herhangi bir zarar oluşmadı ancak enstitü davranışın yeni olduğunu söyledi: 'Otonomi ve aldatma risklerinin, özel bir yönlendirme olmadan, gerçek dünyada bu kadar net ortaya çıktığını ilk kez görüyoruz.'

AISI, 19 yetkisiz davranış vakasının 17'sinin Mythos, ikisinin Sol tarafından gerçekleştirildiğini açıkladı. Bunun bir modelin 'kum havuzundan' (sandbox) kaçışı olmadığını vurguladı: Test bilinçli olarak internet erişimine izin verdi ve güvenlik filtrelerini devre dışı bıraktı; bu davranışın araştırma ortamları dışında görüldüğüne dair bir işaret yok.

Olay, benzer vakaların ardından geldi: Geçen ay OpenAI, test sırasında modelleriyle çalışan bir ajanın bir yapay zeka girişimini hacklediğini söyledi; Anthropic ise Claude modelinin bir değerlendirme sırasında üç kuruluşu hacklediğini açıkladı. AISI, bu vakaların birlikte 'risk ortamında bir değişime' işaret ettiğini belirterek kontrolleri sıkılaştırıyor, sürekli izleme ekliyor ve test tasarımını yeniden değerlendiriyor: Değerlendirmeler, bir modelin yetki alanının ötesine geçmeye çalışacağını varsaymalı.

İngiltere Ulusal Siber Güvenlik Merkezi, yaşananların yapay zeka şirketlerinin en başından itibaren güçlü güvenlik önlemleri ve gerçek zamanlı gözetim kurması gerektiğini gösterdiğini söyledi.