NVIDIA gab auf Hot Chips bekannt, dass der Groq 3 LPX interaktive KI-Inferenz-Beschleuniger jetzt in der vollen Produktion ist — ein Meilenstein fuer NVIDIAs Agentic-AI-Strategie.

Groq 3 LPX erweitert die Inferenzleistung der Vera Rubin NVL72-Systeme durch drastische Erhoehung der Token-Generierungsraten. Der Unterschied ist wichtig, weil KI-Agenten-Systeme — Software-Agenten, die Reasoning betreiben, programmieren, Tools aufrufen und komplexe Aufgaben iterativ bearbeiten — riesige Token-Volumen ueber Hunderte oder Tausende von Inferenz-Schritten generieren koennen.

In kuenstlicher Analysen-Benchmarks lieferte Groq 3 LPX mit Gemma 4 31B ein Rekord von 3.400 Output-Token pro Sekunde bei einem 100.000-Token-Kontextfenster — die schnellste jemals fuer dieses Modell gemessene Leistung. NVIDIA sagt, dies entspricht 4x schnellerer Reaktionsfaehigkeit als die naechste Alternative.

"Inferenz ist die Wachstumsmaschine der KI", sagte Jensen Huang. "Vera Rubin erweitert diese Vision mit arbeitslastoptimierten KI-Factory-Konfigurationen fuer das Zeitalter der Agentic AI."

Nebius ist der erste Cloud-Anbieter, der Groq 3 LPX ueber seine Token-Factory-Plattform in die Produktion bringt.