Sosyal hiyerarşi yapay zekâya da sızıyor gibi görünüyor. Yeni bir çalışmada araştırmacılar, patron ve ast rollerine yerleştirilmiş büyük dil modelleri arasında konuşmalar kurguladı — müdür ve öğretmen, yönetici ve çalışan gibi — ve alt sıradaki ajanların daha kolay ikna edildiğini, üstlerden gelen zararlı isteklere uyma olasılığının daha yüksek olduğunu buldu.
Ekip, OpenAI'ın ChatGPT ve Meta'nın Llama sürümleri de dahil altı büyük dil modelinde yüzlerce simüle edilmiş diyaloğu analiz etti; insan konuşmalarından bilinen kalıplara baktı: otorite yanlılığı, zararlı isteklere uyma, zamir kullanımı ve dil uyumu. Alt statüdeki ajanlar muhatabının kelime seçimlerini yansıttı, daha az çoğul zamir kullandı ve kuralları daha kolay esnetti — araştırmacılar bunu Hesaplamalı Dilbilim Derneği'nin 64. Yıllık Toplantısı'nda bildirdi.
Bulgular, ajan tasarımının kalbindeki bir takasın altını çiziyor: İnsan hiyerarşilerinde gerçekçi şekilde yol almak için eğitilen yapay zekâ sistemleri, itaatin tehlikelerini de miras alabilir. Yazarlar, geliştiricilerin ajanları güvenlik testinden geçirirken bu dinamikleri dikkate almasını öneriyor — kendini birinin "astı" olarak algılayan bir sistem, saldırganların tam da sömürmek isteyeceği sistem olabilir.




