Vals AI, geleneksel testlerin yapay zeka modellerinin son hızına artık yetişemediğini söylüyor. Andreessen Horowitz liderliğinde 40 milyon dolarlık Serie A yatırımını alan girişim, yeni bir yaklaşım benimsiyor: Yapay zeka sistemlerini genel bilgi üzerinden değil, hukuk, finans, yazılım geliştirme ve diğer alanlarda gerçek işleri gerçekten yapıp yapamayacaklarını test ederek değerlendiriyor.

Sınavlar, yapay zeka yeteneklerini doğrulamanın standart yolu haline geldi. Ama aynı zamanda giderek bir PR oyununa dönüştü. Bugünkü modeller için tasarlanmayan eski testlerin nasıl alınacağı öğrenildi.

2024'te kurulan Vals bunu değiştirmeye çalışıyor. 8VC ve Bloomberg Beta liderliğinde bir tohum turu alan şirket, geçen ay Andreessen Horowitz liderliğinde 40 milyon dolarlık Serie A turunu kapattı. Gelir bir yıl öncesine göre sekiz katına çıktı ve çalışan sayısı 8'den 25'e yükseldi.

Temel teklif basit: Soyut zekayı ölçmeyi bırakın, bir modelin belirli bir meslek alanında insan kalitesinde iş üretip üretemeyeceğini test edin.

Vals, test materyallerini herkese açmak yerine — bu, model üreticilerinin doğrudan sınav verilerine çalışmasına olanak tanır — değerlendirme setlerini gizli tutuyor. Şirket sadece olumlu sonuçları değil, zihinsel sağlık, siber güvenlik, biyogüvenlik ve hatta Cenevre Sözleşmesi uygulamaları dahil olası zararları da test ediyor.

Şirketler, öğrencilerin SAT sınavı için College Board'a ödeme yapması gibi, modellerini test ettirmek için Vals'a ödeme yapıyor. Değerlendirmeler ayrıca hangi modellerin dağıtılacağına karar veren kuruluşlar için satın alma araçlarına dönüşüyor.

Krishnan, yapay zeka şirketleri halka açıldıkça ve yapay zeka modelleri temel ekonomik altyapılara dahil oldukça test pazarının hızla büyüyeceğini öngörüyor.