Bir dil modeline nadir bir bağış organının kime verilmesi gerektiğine karar vermesi istendiğinde, genellikle tek bir faktöre — içme alışkanlıkları gibi — takılır ve hatta sanal bir yazı tura atması istendiğinde bile kesin bir güvenle kararını verir. Buna karşılık, insan karar vericiler hastaların birden fazla niteliğini tartar ve net bir doğru yanıtın olmadığı durumları açıkça kabul eder.

Bu, Pennsylvania Eyalet Üniversitesi'nden Hadi Hosseini liderliğindeki bir araştırma ekibinin temel bulgusudur ve ekip, çeşitli LLM'lerin çıktılarını böbrek tahsis senaryolarında gerçek insan kararlarına ilişkin mevcut veri setleriyle karşılaştırmıştır. Çalışma yakın zamanda bir akademik konferansta sunulmuştur.

Araştırmacılar iki temel fark tespit etti: Birincisi, insanların rekabet niteliklerini — yaş, sağlık durumu, yaşam tarzı faktörleri, organ kabul etme olasılığı — tarttığı durumlarda, yapay zeka modelleri tek bir niteliğe takılma ve tüm yargılarını onun üzerine kurma eğilimindeydi. İkincisi, LLM'ler belirsizlik ifadesi göstermedi. Açıkça sanal bir yazı tura atmaları ve rastgele bir alıcı seçmeleri istendiğinde bile modeller, durumun rastgeleliğini kabul etmek yerine "kendinden emin, determinist bir yanıt" verdi.

"Sınırı kaynakları tahsis ettiğimizde — ister bir böbrek, ister bir iş, ister başka bir kaynağa erişim olsun — her zaman tek bir nesnel olarak doğru yanıt yoktur," diyerek çalışmaya katkıda bulunan ve Mozilla'nın güvenilir yapay zeka girişiminin başında olan John Dickerson özetledi. "İnsanlar bu belirsizliği tanır ve tahsis sürecinde açık bir tartışma dahilinde hesaba katar; LLM'ler bunu çoğu zaman yapmaz."

Hosseini, ekibin organ tahsisinde insan yargısının yerini almayla ilgili savunuculuk yapmadığını, ancak bu sistemler karar alma süreçlerine giderek daha fazla dahil oldukça yapay zeka davranışının anlaşılmasının kritik olduğunu vurguladı. "Yaşamı ve ölümü belirleyen kararlarda yapay zeka yer alıyorsa, rolünü yanlış konumlandırmak bir seçenek değildir," dedi.

Araştırma, sağlık hizmetlerinden işe almaya ve afet yardımına kadar her yüksek riskli kaynak tahsis senaryosunda LLM'lerin dağıtılması hakkında daha geniş sorular ortaya koyuyor — ahlaki belirsizliğin bir hata değil, bir özellik olduğu yerlerde.