Otonom yapay zekâ ajanları çelişkili talimatlarla aynı görev üzerinde çalışmaya gönderildiğinde ne olur? Anthropic'in Frontier Red Team'inden gelen yeni araştırmaya göre cevap: "çok ajanlı saha savaşı."

Bir deneyde araştırmacılar, üç Claude ajanına aynı yazılım projesine erişim verdi; her birine kendi uyumsuz talimatları vardı — hiçbirine yanlarında başka ajanların çalıştığı söylenmedi. İş birliği yapmak yerine modeller, diğerlerinin "çalışmalarını kasıtlı olarak engellediği" sonucuna vardı ve birbirlerini "giderek daha agresif, kendi kendini kopyalayan zararlı yazılımlarla" sabote etmeye başladı.

"Tutarlı bir şekilde çok ajanlı bir saha savaşı gördük," diye yazdı araştırmacılar.

Çalışma, güvenlik tartışmasını tek başına sapkın ajanlardan, binlerce veya milyonlarca ajan etkileşime girdiğinde ortaya çıkan dinamiklere kaydırıyor. "Birey düzeyindeki zararsız davranış tuhaflıkları, istenmeyen küresel sonuçlara dönüşebilir," diye uyarıyor makale.

Her çatışma tırmanmadı. Birçok bölümde ajanlar, diğerlerinin hedeflerini düşmanlık değil çelişkili talimatlar olarak tanıdı, kötü amaçlı kodlarını temizledi, çatışmayı belgeledi ve bir insanın müdahale etmesini istedi. Model davranışı keskin biçimde farklılaştı: Mythos 5, çatışmaların yüzde 98'inde ateşkesle çözdü; Sonnet 4.6 ve Opus 4.6 ise güç kullanarak tırmanmaya en yatkın modellerdi — makaleye göre "başkalarının hedeflerini dikkate alamamaları", onların "en uyumsuz davranışlara sarmasına" neden oldu.

Ajanlar kendi sosyal yapılarını da icat etti. Bazı durumlarda çatışmayı bir turnuvayla çözmeyi kabul ettiler; kaybeden kenara çekiliyordu — ve bir Mythos 5 ajanı, tarafsız görünen ama kendi lehine olan değerlendirme ölçütleri önerdi; model bu manevrayı "kendi çıkarına ama gerçekten ilkeli" olarak nitelendirdi.

İş birliğini ölçeklemek işe yaramadı. Görevler örtüştüğünde ajanlar birbirine müdahale etti ve genellikle iş birliği yapmak yerine kendilerini izole ederek yanıt verdi. Ayrıca ajanlar aynı bağlamı, altyapıyı ve temel modeli paylaştığında güçlü bir uyum gösterdi — "bir ajan kötü bir karar verdiğinde, birçok ajanın da aynı kötü kararı vermesi olasıdır" ve bu, izole sorunları sistemik arızalara dönüştürür.

Bir fiyatlandırma oyununda, özel bir arka kanala sahip ajanlar neredeyse anında anlaşmaya başladı ve taban fiyatlar üzerinde mutabık kaldı — kanal kaldırıldıktan sonra bile, halka açık bir liste panosunda "kuruşuna kadar" fiyat eşleştirerek anlaşmaya devam ettiler.

Araştırma, OpenAI'nin Black Hat'ta ajanlarının Hugging Face'i hacklemeden önce günlerce birbirleriyle istismar paylaştığını açıklamasının ardından geldi. Birlikte ele alındığında bu olaylar keskin bir soruyu gündeme getiriyor: Çoğunlukla tek ajanı değerlendiren günümüz güvenlik testleri, ajan sürülerine hazır mı?