Amazon Web Services, önceden tanımlı seçenekler arasından seçim yapan ve metin üretmek yerine güven skoru döndüren 2 milyar parametreli bir "karar modeli" olan Strands Decider 2B'yi yayınladı. Model, bu ayın başında bu kategorinin fitilini ateşleyen TypeSafe AI'ın Jev'ine AWS'nin yanıtı.
Model, yapay zeka ajanlarını devreye almak için araç ve protokoller geliştiren AWS grubu Strands Labs tarafından yayımlandı. Tamamen açık kaynak: kod GitHub'da, ağırlıklar Hugging Face'te ve alışılmadık biçimde modeli eğitmek için kullanılan veri ve betikler de paylaşıldı. AWS, 2B'lik modelin bir CPU veya GPU üzerinde yerel olarak çalışabilecek kadar küçük olduğunu ve cevapları onlarca milisaniyede döndürdüğünü söylüyor.
KARAR MODELİ NEDİR?
İstenen her türlü çıktıyı üretebilen büyük dil modellerinin aksine karar modeli, kendisine sunulan seçenekler arasından seçim yapmak ("'sihamba ngokushesha' ifadesi İngilizce, Zuluca yoksa Hollandaca mı?") ve bu seçime sayısal bir güvenilirlik skoru eklemek üzere tasarlanıyor. AWS'ye göre bu esneklik kaybı karşılığında bu modeller belirli bir boyutta daha hızlı ve daha yetkin, her zaman sunulan seçeneklerden birini döndürüyor ve çok düşük gecikmeyle çalışıyor. Bedeli ise karmaşık akıl yürütmede daha zayıf olmaları ve metin üretememeleri; bu da onları kodlama, sohbet botları veya özetleme için uygunsuz kılıyor.
MİMARİ VE SONUÇLAR
Strands Decider 2B, Qwen3.5-2B'nin "gövdesi" üzerine kurulu: dil modeli başlığı kaldırılıyor ve yerine sunulan her seçeneği cevap konumuna göre puanlayan küçük bir işaretçi başlık (bir milyonun biraz üzerinde parametre) konuyor. Gövde, rank-16 LoRA adaptörüyle ince ayarlanıyor. Bu, mimarinin on dokuzuncu yinelemesi ve ikinci büyük sürümü; ilki belirgin biçimde daha kötü performans gösteren bir slot başlık kullanıyordu.
AWS'ye göre model, JevBench'in açık veri kümesinde doğruluk ve kalibrasyonda 2B sınıfında 33 model arasında üçüncü, 2B'yi hemen aşan modeller hariç tutulduğunda 30 model arasında birinci. Ortanca gecikme bir Nvidia RTX 3090'da yaklaşık 115 ms, M3 MacBook'ta küçük görevler için yaklaşık 153 ms.
KÖKENİ VE BAĞLAMI
AWS'nin önde gelen mühendislerinden Marc Brooker, ilk sürümü Jev'i gördükten sonra geliştirdi ve model bir süreliğine kendi boyutunda Jevbench sıralamasında zirveye çıktı. Ardından AWS mühendisleri projeyi Strands Labs çatısı altında yayınlanmak üzere düzenledi. Brooker, TechCrunch'a ihtiyacın, ajan iş akışları her zaman tam bir LLM'in maliyetini ya da gecikmesini gerektirmeyen müşteri görüşmelerinde ortaya çıktığını söyledi: bir karar modeli, "burada sıradaki işim ne?" diye soran bir iş akışı adımı için "mükemmel" bir adım oluşturuyor.
Sürüm, OpenAI'ın benzer teklifi Decisions API'yi duyurduğu haftada ve araştırmacıların TypeSafe'in Jev'i tanıtmasından bu yana onlarca benzer model ürettiği bir dönemde geldi. TypeSafe CEO'su Diogo Almeida ciddi bir rekabet görmediğini belirtti: "Şu anki grup, zekayı gerçekten kullanışlı hale getirmeye kendini adamış bir ekipten çok, havalı bir mimari uygulamak isteyen makine öğrenmesi insanlarına benziyor."
NEDEN ÖNEMLİ
AWS bu sınıfı model yönlendirme, araç seçimi, değerlendirmeler, koruma bariyerleri, bellek ve bağlam yönetimi ile politika sınıflandırması için konumlandırıyor; ayrıca en zor kararlarda LLM'leri, rutin kararlarda ise karar modellerini kullanan ve maliyet ile gecikmeyi düşüren melez ajanlar için. İddia şu: bir ajanın iş akışının her adımı sınır modeli gerektirmez; küçük sorularda güvenilir biçimde emin olan ucuz, hızlı ve yerelde çalıştırılabilen bir model birçoğu için yeterli olabilir.




