OpenAI, yapay zeka risk araştırmasında yaygın bir varsayıma meydan okuyan yeni bir güvenlik raporu yayımladı: tehlikeli veya güvenilmez yapay zeka davranışının yalnızca karmaşık, yüksek riskli veya düşmanca bağlamlarla sınırlı olduğu varsayımı. Bulgular, yapay zeka modellerinin — incelikli muhakeme hatalarından, hedef uyumsuzluğundan ve güvenilmez çıktıdan — rutin, düşük riskli günlük görevlerde bile davranış bozuklukları gösterebileceğini ortaya koyuyor.
OpenAI'nin güvenlik araştırma birimi tarafından yayımlanan rapor, en son modellerinin standart, düşmanca olmayan görev kategorileri üzerindeki sistematik testleri sırasında gözlemlenen davranış anomalilerini tanımlıyor. Bunlar, çoğu kurumsal ve tüketici kullanım durumunda rutin olan temel veri işleme, özetleme, sınıflandırma ve çok adımlı muhakeme problemlerini kapsıyor.
Temel bulgu, güvenlik risklerinin ikili olmadığı — yalnızca bir yapay zeka zorlandığında veya kasıtlı olarak sorgulandığında ortaya çıkmadığıdır. Bunun yerine modeller, sıradan görevlerde sessizce başarısız olabilir ve yüzeysel olarak makul görünen ancak mantık hataları, kaçırılan talimatlar veya hayal ürünü içerik barındıran çıktılar üretebilir. Endişe, kullanıcıların ve geliştiricilerin bir yapay zeka basit komutlarda güvenilir performans gösterdiğinde yanlış bir güvenlik duygusuna kapılması ve ardından basit ama farklı görev yapılarında hatalarla karşılaşmasıdır.
OpenAI, rutin görev hatalarının birkaç kategorisini tanımlıyor:
- Kendinden emin yanlış yanıtlar: Model, düzgün faktörik veya prosedürel sorularda yüksek güvenle yanlış çıktılar veriyor. - Talimat kayması: Basit görevlerde çok turlu etkileşimlerde model, orijinal talimatları giderek unutuyor. - Bağlam kafa karışıklığı: Benzer ama farklı görevler sunulduğunda, model bir görevin detaylarını diğerine karıştırıyor. - Aşırı uyum: Açıkça yanlış bir isteği reddetmek veya bayraklamak yerine, makul sesli ancak yanlış bir yanıt üretiyor.
Raporda bu bulgular, daha ayrıntılı güvenlik karşılaştırmaları için bir çağrı olarak çerçeveleniyor. Mevcut güvenlik değerlendirmeleri genellikle aşırı senaryolara odaklanıyor: hapisten kaçış, nefret söylemi veya tehlikeli bilgi. Ancak burada belgelenen sıradan hatalar, kullanıcıların çıktıyı doğrulama olasılığının en düşük olduğu ortamlarda meydana geldikleri için aslında daha büyük bir kümülatif riski temsil edebilir.
OpenAI, bulguların devam eden güvenlik çalışmasını — model sonrası eğitim ayarlamaları, değerlendirme metodolojisi ve dağıtım rehberliği dahil — bilgilendireceğini söylüyor. Şirket, araştırma metodolojisinin bölümlerini dış araştırmacıların tekrarlayıp genişletebilmesi için de paylaşıyor.



