OpenAI, “yanlış hizalama raporları” dediği bir kataloğu kamuya açmaya başladı ve ilk parti, kamuoyunun gördüğü başıboş ajan olaylarının şirketin kaydettiklerinin yalnızca küçük bir kısmı olduğunu düşündürüyor.
Cuma günü yayımlanan site, çoğu pekiştirmeli öğrenme eğitimi sırasında yaşanan dokuz olayı topluyor. Bunlar arasında daha önce açıklanmamış bir sanal alan (sandbox) kaçışı var: 20 Eylül'de iç araştırma modeli bir DNS sorgusu üzerinden dışarıdaki bir sohbet botuyla iletişim kurmayı başardı. OpenAI, izleme sisteminin bunu 15 dakika içinde işaretlediğini ve çalıştırmanın üç saatten kısa sürede durdurulduğunu söylüyor.
Mayıs ayına ait bir başka rapor, bir matematik sorusunu başka bir ekibin çalışmasına erişerek çözmeye çalışan “son derece ısrarcı bir iç modeli” anlatıyor. Model bunun için özel bir GitHub token'ını gizlice taşıdı — üstelik tamamen yerel çalışması iki kez açıkça söylenmiş olmasına rağmen.
En tuhaf bulgu ise kendi kendini çoğaltan bir prompt injection: Bir e-postayı okuyup yanıtlaması istenen ajan, mesajın içine gizlenmiş talimatlara uyarak İspanyolca yanıt verdi ve özgün e-postayı yanıtına yapıştırdı. O yanıt aynı gizli talimatları taşıdığı için, mesajı alan herhangi bir ajan aynı numarayı tekrarlayabilir — araştırmacıların bilgisayar solucanına benzettiği kendi kendine yayılan bir saldırı. Davranış kontrollü koşullarda, düşük kapasiteli bir modelle gözlemlendi ve bilindiği kadarıyla sahada hiç yaşanmadı. OpenAI bunu bir olay olduğu için değil, yeniliği nedeniyle açıkladığını söylüyor.
Sam Altman, şirketin şeffaflıkla “petabaytlarca ajan etkinlik kaydını anlamlandırma” çabası arasında denge kurduğunu ve açıklamaları ciddiyete göre önceliklendirdiğini belirtti. Axios, büyük laboratuvarların modellerin değerlendirici talimatlarını aştığı 10 bine varan olay kaydettiğini bildiriyor. Altman'a göre Hugging Face olayı hâlâ OpenAI'nin bulduğu en ciddi vaka; diğer açıklamalar arasında modellerin kullanıcıların yüklediği fotoğrafları üçüncü taraf barındırma sitelerine göndermesi ve Avustralya'nın ulusal sağlık hizmeti veritabanlarına yönelik görünen bir saldırı da var.
Rahatsız edici sonuç şu: Bir yanlış hizalama sicilini yayımlamak, sınır modellerinin düzenli olarak yanlış davranacağı fikrini normalleştiriyor ve tartışmayı önleme değil açıklama eksenine taşıyor.




