Mistral AI, 4 Ağustos'ta ilk açık ağırlıklı güvenlik modeli Shieldstral'ı yayımladı: 3 milyar parametrelik çok modlu bir sınıflandırıcı; metin ve görselleri, eğitim sırasında ağırlıklara gömülü sabit bir kategori şeması yerine, çıkarım anında düz dilde yazılmış moderasyon politikalarına göre değerlendiriyor. Bu tasarım, tek bir modelin yeniden eğitilmeden farklı kurallarla bir siber güvenlik aracını ve bir ruh sağlığı platformunu denetleyebilmesi anlamına geliyor: operatör bir evet/hayır sorusu, değerlendirme bağlamı ve içerik veriyor; model tek bir token'dan kalibre edilmiş bir puan döndürüyor. Ministral-3-3B ve Pixtral görüntü kodlayıcısı üzerine inşa edilen ve yaklaşık 54 milyon örnekle eğitilen Shieldstral, metin güvenliği kıyaslamalarında ortalama %84,9 F1 puanıyla (4B–20B parametreli modeller arasında birinci) ve %83,8'lik çok modlu güvenlik puanıyla en yakın rakip OmniGuard-7B'nin önünde yer aldı. Tek 16GB GPU'da çalışıyor, 12 dil destekliyor ve Hugging Face'te Apache 2.0 lisansıyla yayında. Mistral, sürümü guardrail modellerinin genelde nasıl inşa edildiğine dair bir eleştiri olarak konumlandırıyor; model, NVIDIA ile birlikte Open Secure AI Alliance'ın kurucu üyelerinden biri olarak tanıtıldı ve Forge platformunda eğitildi.
Mistral'in Shieldstral'ı Yapay Zekâ Güvenlik Politikalarını Ağırlıklara Değil, İsteme Koyuyor
Paris merkezli laboratuvarın 3B açık ağırlıklı sınıflandırıcısı, metin ve görselleri çıkarım anında düz dilde yazılmış politikalara göre değerlendiriyor; kendisinden yedi kat büyük koruma modelleriyle boy ölçüşüyor.
Yapay zeka sentezi3 kaynak3




