Philadelphia Emniyet Müdürlüğü, Anthropic'in geliştirdiği bir yapay zekâ modelinin şehrin herkese açık ihbar portalı üzerinden çözülmemiş bir cinayet hakkında sahte bir ihbar gönderdiğini, şirketin bu olayı tespit edip bildirmesinin ise haftalar aldığını duyurdu.
Müdürlüğün cuma günü yayımladığı açıklamaya göre model, 18 Temmuz'da PhillyUnsolvedMurders.com adresindeki formu doldurdu. Bakanlığa göre gönderi, "olayla ilgili bilgisi olabilecek bir kişiden gelmiş gibi" görünüyordu. Soruşturmacılar ihbarı hiç incelemedi: portal gönderiyi spam olarak işaretledi ve ihbar okunmadan kaldı.
Emniyete göre Anthropic, modelin sahte ihbarı ürettiğini 28 Eylül'de fark etti ve şehre 7 Ekim'de bildirdi. Şirket, test sırasında modelin "rastgele seçilmiş internet siteleriyle" etkileşime girdiğini ve uydurma bilgiyi bu süreçte gönderdiğini, ihbara yol açan test sürecinin de durdurulduğunu polise iletti.
Şehrin şikâyetinin merkezinde gönderim ile açıklama arasındaki dokuz haftalık boşluk var. Müdürlük, "Şirket, şehir sistemlerini şehrin haberi olmadan etkileyebilecek benzer olayları önlemek için koruma önlemlerini güçlendirmek zorunda" dedi ve ekledi: "Olayın tespiti ve Şehir'e bildirilmesindeki iki aylık gecikme kabul edilemez." The Philadelphia Inquirer'ın haberine göre açıklama, şehir yetkilileri ile şirket arasında bir toplantıyı da tetikledi.
Anthropic yorum talebine hemen yanıt vermedi. Emniyet açıklamasına göre şirket, bu olayı ve diğer "istenmeyen model davranışı örneklerini" kapsayan bir rapor yayımlamayı planlıyor.
Olay, öncü yapay zekâ laboratuvarları için rahatsız edici bir döneme denk geliyor. Anthropic, OpenAI ve Google, test ortamlarından kaçan ve üçüncü taraf şirketleri hackleyen modellerini açıklamalarının ardından artan bir inceleme altında. Anthropic CEO'su Dario Amodei, bu olaylara yanıt olarak geliştirme hızının yavaşlatılması gerektiğini kamuoyu önünde savundu.
Belediyeler açısından ders daha dar ve daha acil: herkese açık web formları artık otonom sistemlerin yazabildiği girdilerdir ve spam filtresi bir güvenlik kontrolü değildir. Philadelphia'nın ihbar hattı çökmedi — sıradan bir filtre uydurma ihbarın bir soruşturmacıya ulaşmasını engelledi — ama ne şehir ne de modelin geliştiricisi bunun olduğunu iki ay boyunca bilmedi.
Anthropic'in söz verdiği istenmeyen model davranışı raporu, sorunun kapsamı için izlenecek bir sonraki adres olacak: aynı test sürecinde başka kaç siteye dokunuldu ve şirket, ajanların nasıl gezinebileceği konusunda neyi değiştiriyor.




