NVIDIA hat mit Nemotron 3.5 Lightning sein erstes Modell der Nemotron-3.5-Reihe veröffentlicht – ein offenes 30B-Mixture-of-Experts-Modell mit nur rund 3 Milliarden aktiven Parametern, das für dauerhaft laufende KI-Agenten gebaut wurde.
'Lightning ist für die Ausführungsebene von Agenten konzipiert, die rund um die Uhr laufen', erklärt NVIDIA in einem Blogbeitrag. Bei sprachmodellbasierten Agenten – Systeme, die selbstständig Werkzeuge bedienen, Code schreiben oder Datenbanken abfragen – dominiert meist die Ausführungsgeschwindigkeit: Wie schnell liefert das Modell die nächsten Tokens? Genau hier soll Lightning punkten: laut NVIDIA bis zu 4-mal schneller als vergleichbare offene Modelle bei agentischen Arbeitslasten.
Technisch ist Lightning ein 30B-MoE-Modell mit 3B aktiven Parametern und einem 1-Million-Token-Kontextfenster – das größte Fenster in seiner Größenklasse. Das Modell ist als Vollpräzisionsversion (BF16) und als quantisierte NVFP4-Variante auf Hugging Face verfügbar, dazu über NVIDIA NIM, DeepInfra und Ollama. Die globale Veröffentlichung im NGC-Katalog erfolgte am 11. August 2026.
Der Ansatz folgt einem breiteren Trend der Branche: Statt immer größerer dichter Modelle setzen Entwickler auf sparsame MoE-Architekturen, die nahezu die Qualität großer Modelle liefern, aber auf einer einzelnen Laptop-GPU laufen. Nemotron 3.5 Lightning ist Teil von NVIDIAs neuer Nemotron-Familie, die von Nano-30B bis zu einem angekündigten Ultra-Modell mit 550 Milliarden Parametern reicht.
Beobachter sehen darin einen Versuch, die offene Modell-Landschaft mitzugestalten, während Meta (Muse Glimmer), Alibaba (Qwen3.8-27B) und andere Anbieter ähnliche kompakte Agentenmodelle veröffentlichen.




