NVIDIA, Nemotron 3.5 ailesinin ilk modeli olan Nemotron 3.5 Lightning'i yayınladı — yalnızca yaklaşık 3 milyar aktif parametreye sahip, açık 30 milyar parametreli bir uzman karışımı (MoE) modeli. Model, sürekli çalışan yapay zeka ajanları için tasarlandı.

'Lightning, günün her saati çalışan ajanların yürütme katmanı için üretildi' diye açıklıyor NVIDIA bir blog yazısında. LLM destekli ajanlarda — araçları bağımsız kullanan, kod yazan veya veritabanlarını sorgulayan sistemlerde — genellikle yürütme hızı belirleyicidir: Model sonraki token'ları ne kadar hızlı üretebilir? Lightning tam da burada öne çıkmayı hedefliyor: NVIDIA'ya göre ajan iş yüklerinde karşılaştırılabilir açık modellerden 4 kata kadar daha hızlı.

Teknik olarak Lightning, 3 milyar aktif parametreli 30B MoE modeli ve 1 milyon token'lık bağlam penceresi sunuyor — boyut sınıfındaki en büyük pencere. Model, Hugging Face'te tam hassasiyetli (BF16) ve nicelenmiş NVFP4 varyantı olarak, ayrıca NVIDIA NIM, DeepInfra ve Ollama üzerinden yayınlandı. NGC kataloğundaki küresel sürüm tarihi 11 Ağustos 2026.

Bu yaklaşım daha geniş bir sektör trendini izliyor: Giderek büyüyen yoğun modeller yerine geliştiriciler, tek bir dizüstü GPU'sunda çalışırken sınır seviyesine yakın kalite sunan seyrek MoE mimarilerine yöneliyor. Nemotron 3.5 Lightning, NVIDIA'nın Nano-30B'den 550 milyar parametreli duyurulan Ultra modeline uzanan yeni Nemotron ailesinin bir parçası.

Gözlemciler bunu, Meta (Muse Glimmer), Alibaba (Qwen3.8-27B) ve diğerlerinin benzer kompakt ajan modelleri yayınladığı bir dönemde açık model ortamını şekillendirme girişimi olarak görüyor.