NVIDIAs quelloffene Bibliothek Model Optimizer dokumentiert eine durchgängige Rezeptur für W4A4-NVFP4-Inferenz: Post-Training-Quantisierung auf 4 Bit für Gewichte und Aktivierungen, kombiniert mit quantisierungsbewusster Destillation (QAD), demonstriert an Qwen3.6-35B-A3B. Das Ergebnis, das NVIDIA in den Release-Notizen nennt: bis zu 1,30-facher vLLM-Durchsatz gegenüber BF16 und 3,1-fach kleinere Checkpoints – bei weitgehend wiederhergestellter Genauigkeit, die die aggressive Quantisierung kostet.

Der interessantere Teil ist die Zielgröße. 4-Bit-Gewichte sind seit Längerem Standard; der Schritt zu 4-Bit-Aktivierungen (W4A4) war der schwierige. Aktivierungen streuen stärker als Gewichte und reagieren empfindlich auf Ausreißer, weshalb viele Produktionsrezepte bei W4A16 oder W8A8 stehen bleiben. NVFP4 fügt dem eine Block-Skalierung hinzu, die die Quantisierung für Blackwell-Hardware mit nativer FP4-Unterstützung praktikabel macht.

QAD ist der Mechanismus, mit dem die Genauigkeit zurückkommt: Das quantisierte Modell wird nicht nur einmalig kalibriert, sondern gegen das ursprüngliche Verhalten nachtrainiert, sodass sich die Fehler der aggressiven Quantisierung korrigieren. Bereits im Juni hatte NVIDIA mit derselben Bibliothek Nemotron 3 Ultra (550B) auf NVFP4 quantisiert und dabei bis zu 5,9-fach höheren Durchsatz bei dekodelastiger Inferenz gegenüber einem 754B-FP4-Modell bei vergleichbarer BF16-Genauigkeit angegeben. Weitere Bausteine derselben Toolchain betreffen lokale Hessische Gewichtsskalen und AutoQuantize, eine automatische Zuweisung gemischter Präzision.

Die Bibliothek selbst ist breit aufgestellt: Sie nimmt Hugging-Face-, PyTorch- oder ONNX-Modelle entgegen und kombiniert Quantisierung, Destillation, Pruning, Neural Architecture Search, Speculative Decoding und Sparsity; exportiert wird für TensorRT-LLM, TensorRT, vLLM und SGLang. Die praktische Bedeutung ist die Inferenzrechnung: 4-Bit-Checkpoints, die drei Viertel Speicher sparen und den Durchsatz erhöhen, ohne die Genauigkeit zu opfern, entscheiden darüber, welche Modelle auf welcher Hardware wirtschaftlich betreibbar sind.

Einordnen sollte man die Zahlen als Herstellerangaben – NVIDIA berichtet über eigene Benchmarks und eigene Modelle. Der Trend ist dennoch eindeutig: Nach dem Siegeszug der 4-Bit-Inferenz beginnt die Arbeit an den Aktivierungen, und das Werkzeug dafür liegt offen.