Google'ın tıbbi yapay zekâsı AMIE, manşetlerin tek bir sayıya indirgediği bir eşiği geçti. Beth Israel Deaconess Tıp Merkezi'nde (BIDMC) yürütülen ve Lancet'te yayımlanan prospektif bir çalışmada, konuşma tabanlı teşhis sistemi 100 gerçek hastayla — hekim gözetiminde — görüştü ve önerileri, hastaların sonunda aldığı teşhislerle karşılaştırıldı.

İşte haberlerin bulanıklaştığı yer tam olarak bu karşılaştırma. AMIE nihai teşhisi vakaların yüzde 90'ında ilk yedi olasılık arasında, yüzde 75'inde ilk üç arasında sıraladı; değerlendirilebilen 98 hastanın yüzde 56'sında ise ilk tercih olarak doğru bildi. Yani "yüzde 90 teşhis doğruluğu", yapay zekânın önde gelen cevabının isabet oranı değil, ilk yedi arasında bulma oranı. Çalışmayı inceleyen hekimler bu farkı açıkça dile getiriyor: mahalleyi genel olarak doğru bilen bir asistan faydalıdır, ama cevabı ilk denemede bilen bir asistanla aynı şey değildir.

Bu ayrım önemli, çünkü çalışma AMIE'nin simülasyonda ya da geriye dönük bir ölçütte değil, gerçek bir klinikte ilk prospektif değerlendirmesi; dolayısıyla hekime dönük bir yapay zekânın sıradan pratikte işe yarayıp yaramayacağına dair şimdiye kadarki en ağır kanıt. AMIE'nin buradaki rolü hazırlıktı: hekim hastayı görmeden önce öykü alıp bir ayırıcı tanı listesi üretmek — yani hastanelerin ilk denemek istediği türden düşük riskli, yüksek getirili bir görev.

Google Research sonuçlarını ihtiyatla çerçeveledi. Çalışma, AMIE'nin "hekimlerin teşhis muhakemesini ve zor vakalardaki doğruluğunu iyileştirme potansiyeli taşıdığını ve daha fazla gerçek dünya değerlendirmesini hak ettiğini" öne sürüyor — yani hekimlerin yerini almakla değil, onlara yardım etmekle ilgili bir iddia. Sınırlılıklar da ciddi: tek merkez, yüz hasta, baştan sona hekim gözetimi ve sahaya kurulmuş bir klinik akışı değil, tek bir kesit görüntü.

Genel tablo, yapay zekâyı hekimlerin önüne koyma yarışının tıkandığını gösteriyor. Google'ın kendi daha eski çalışmaları AMIE'nin canlı video konsültasyonlarında doktorlarla başa baş gittiğini simüle ortamlarda göstermişti; şirketler artık ölçüt sonuçlarını gerçek dünya pilotlarıyla karıştıran çalışmaları rutin olarak yayımlıyor. Bu Lancet makalesinin kabul tartışmasındaki hastaneler için pratik soru, bir modelin doğru hastalığı bir listenin içinde söyleyip söyleyemediği değil; hekimin ne yaptığını değiştirip değiştirmediği, daha azını kaçırıp kaçırmadığı ve zarar verip vermediğidir — bunu yalnızca saha ölçeğinde kanıt yanıtlayabilir.