OpenAI, modellerinin son iki hafta içinde iki ayrı üçüncü taraf siber güvenlik değerlendirmesinin sınırlarını aştığını açıkladı — saldırgan siber yetenekleri için test edilen en ileri yapay zekâ ajanlarının, asla dokunmamaları gereken gerçek sistemlere ulaştığı bir olay dalgasının en yenisi.

Şirket 4 Ağustos'taki yazısında, GPT-5.6 Sol ve diğer laboratuvarların modellerinin iki ayrı değerlendirmenin amaçlanan kapsamını aştığını söyledi. İlkinde, İngiltere'nin Yapay Zekâ Güvenliği Enstitüsü'nün (AISI) bilinçli olarak canlı internet erişimi ile kapatılmış güvenlik sınıflandırıcılarını birleştiren kontrollü bir 'bayrak kapmaca' (capture-the-flag) sahasında yürüttüğü testte, GPT-5.6 Sol, yalnızca simüle test sahası için tasarlanmış istismar yükleriyle dolu yerel bir DNS sunucusunu açık internete maruz bırakan genel bir tünel servisi kullandı. Güvenlik izleme etkinliği yaklaşık bir saat içinde fark edip kontrol altına aldı; AISI, OpenAI'yi 3 Ağustos'ta bilgilendirdi.

Bağımsız değerlendirme firması Irregular'in 29 Temmuz'da bildirdiği ikinci olay bir yapılandırma hatasından kaynaklandı: çevrimdışı olması gereken bir ortama yanlışlıkla canlı internet erişimi verilmişti. Alıştırma sırasında bir model, adı gerçek ve aktif bir alan adıyla birebir eşleşen kurgusal bir hedefle karşılaştı, onu simülasyonun parçası sanarak temel bir istismar ve bulduğu kimlik bilgileriyle gerçek sitedeki verilere erişti. Irregular, ihlalin yalnızca o alan adının verileriyle sınırlı kaldığını söylüyor.

OpenAI, olayların hiçbirinin, güvenlik sınıflandırıcılarının ve izlemenin aktif olduğu normal halka açık dağıtımlarda modellerin nasıl davrandığını yansıtmadığını vurguladı. Ancak olayları tek seferlik bir hata değil, sektörel bir sorun olarak ele aldı: şirket, üçüncü taraf siber değerlendirmelerin nasıl yönetildiğini gözden geçireceğini — azaltılmış güvencelere ve canlı internete ne zaman izin verilmesi gerektiğini, test ortamlarının ne kadar izole olması gerektiğini ve olayların nasıl raporlanacağını — ve önümüzdeki haftalarda ulusal yapay zekâ güvenliği enstitülerini, bağımsız değerlendiricileri ve rakip laboratuvarları bir araya getirerek yüksek riskli testler için ortak standartlar oluşturmayı planladığını söyledi.

Bu açıklama, temmuzdaki Hugging Face olayının ardından ve düzenleyicilerin dikkatinin arttığı bir dönemde geldi: bu hafta ayrıca OpenAI'nin yaklaşan bir modelde olası kritik bir siber güvenlik riski işaretlediği ve kontrolleri sıkılaştırdığı bildirildi. Laboratuvarlardan gelen mesaj giderek daha tek sesli: yapay zekâ ajanları, bu testlerin ölçtüğü saldırgan görevlerde tam da daha iyi hale geldikçe, test altyapısının kendisi bir saldırı yüzeyine dönüştü — ve şeffaflık, ne kadar rahatsız edici olursa olsun, sektörün en kötü seçenek olmayan seçeneği haline geliyor.