Yıllarca AI algılama yazılımı güvenilirlik sorunu yaşadı. Erken dönem araçlar basit istatistiksel ölçümlere — perplexity ve burstiness — dayanıyordu ve sık sık insan tarafından yazılmış metinleri yanlışlıkla makine tarafından üretilmiş olarak işaretliyordu. Şimdi yeni nesil algılama yazılımı kuralları yeniden yazıyor.
Stanford mezunu Max Spero ve Bradley Emi tarafından kurulan New York merkezli girişim Pangram Labs, İngilizce metinlerde %99,98 doğruluk oranı iddia eden bir araç geliştirdi. Dilbilimsel belirtileri saymak yerine Pangram, milyonlarca insan tarafından yazılmış metin ve bunların AI tarafından üretilen yansımaları üzerinde bir makine öğrenimi modeli eğitiyor ve iki arasındaki farkı insan tarafından okunabilir açıklamaların ötesinde bir düzeyde ayırt etmeyi öğreniyor. Epoch AI'nin bağımsız testi, 495 insan tarafından yazılmış metinde sıfır yanlış pozitif sonucu buldu. Araç zaten akademik yayıncılığı dönüştürüyor. NeurIPS, Pangram ile tarama yaptıktan sonra başvurularının %18'ini reddetti. arXiv ön baskı sunucusu artık alphaXiv adlı bir yansıma sitesi aracılığıyla Pangram puanlarını gösteriyor. Chicago Üniversitesi, öğrenci ödevlerini değerlendirmek için aracı kullanmaya başladı. Ve unutulmaz bir vakada, bir hakem — AACR dergisi operasyonları direktörü Daniel Evanko tarafından yüzleştirilmiş — zamanı dolduktan sonra bir LLM kullandığını itiraf ederek Wow, siz gerçekten iyisiniz! diye yanıt verdi.
Rakip GPTZero da New York merkezli olarak benzer bir yaklaşım izliyor ve %99 doğruluk oranı bildiriyor. Beş bilgisayar bilimleri konferansı ve üç üniversite şimdiye kadar kayıt oldu.
Ancak araçların en büyük zorluğu henüz önünde. AI destekli yazma norm haline geldikçe — bir insan taslak yazıp bir AI düzelttiğinde veya tersi — algılama bir spektruma dönüşüyor, ikili bir karar değil. Temmuz 2026'da yayınlanan Pangram'ın en son modeli Pangram 4, metni daha ince parçalara bölüyor (30-40 kelime kadar küçük) ve segmentleri insan, AI veya karışık olarak sınıflandırmaya çalışıyor. Genel olarak %0,34 yanlış negatif oran bildiriyor.
Yine de gri alan hâlâ sorunlu. Nature, Scholarly Kitchen blog gönderisini Pangram'dan geçirdiğinde araç başlangıçta onu %100 AI olarak işaretledi. Yazar, fikirlerin ve taslağın tamamen insan tarafından oluşturulduğunu ve AI'ın yalnızca düzeltme için kullanıldığını — çoğu kişinin kabul ettiği bir uygulama — ısrarla savundu. Pangram 4'ün yayınlanmasıyla puan %96 AI'ya düştü, ancak gerilim devam ediyor.
AI ve insan yazısının homojen bir şekilde karıştığı gerçek dünya vakalarını değerlendirmede hâlâ geliştirilmesi gereken çok alan var diyor Spero. Küçük düzenlemeler puanları dramatik şekilde değiştirebilir — jitter olarak bilinen bir sorun. Ve tüketiciler tarafından kullanılan AI, insan tarafından yazılmış denemeleri önemli ölçüde değiştirdiğinde, Pangram hâlâ sonuçların %41'ini tamamen insan olarak sınıflandırıyor.
Stakes yükseliyor. Spero personal olarak gazetecileri eleştirdi ve hatta Papa'nın sosyal medya gönderilerini AI tarafından yazılmış olarak işaretledi. Substack, Temmuz ayında Pangram'ı platformu genelinde entegre ederek okuyucuların gönderilerin AI tarafından üretilip üretilmediğini görmesini sağlıyor. Birinin AI kullanarak yazdığını söylemek tabu ise, o zaman işlerini savsaklayan insanların daha fazla göreceğimizi düşünüyorum diyor Spero.
Bağımsız araştırmacılar temkinli olmaya çağırıyor. NYU Langone'den Tim Requarth, araçların çöp üreten yerleri elemek için iyi olduğunu söylüyor, ancak AI destekli metinlerdeki yüzde puanlarının çok ciddiye alınmaması gerekiyor. Her iki firma da önceliğin, insan-AI işbirliğinin sürekliliğini denetlemek yerine, tamamen AI tarafından üretilen içeriği — ihlalin en net durumunu — tespit etmesi gerektiği konusunda hemfikir.
Algılama silah yarışı henüz bitmedi. Hem Pangram hem de GPTZero, yeni LLM'ler çıktıkça yılda düzinelerce model güncellemesi yayınlıyor. Üçüncü taraf değerlendirmeleri her zaman en son algılayıcıların gerisinde kalacak. Şimdilik araçlar, nihai hüküm olarak değil, soruşturmalara başlangıç noktası olarak en iyi şekilde çalışıyor.




