DeepSeek hat still ein großes Update für sein V4-Flash-Modell ausgerollt – und das kleine, günstige Modell übertrifft nun sein eigenes, deutlich größeres Geschwistermodell.

Das Update, das am 31. Juli mit offenen Gewichten auf Hugging Face (deepseek-ai/DeepSeek-V4-Flash-0731) veröffentlicht wurde, markiert einen ungewöhnlichen Moment für das effizienzorientierte Modell. DeepSeeks eigene Benchmarks zeigen, dass V4-Flash das Flaggschiff V4 Pro (Preview) mit 1,6 Billionen Parametern beim agentischen Kodieren schlägt. Unabhängige Prüfungen von Artificial Analysis fanden zudem Verbesserungen bei anderen Benchmarks wie GPQA Diamond – ohne berichtete Regressionen.

V4-Flash ist ein Mixture-of-Experts-Modell mit 284 Milliarden Gesamtparametern, aber nur 13 Milliarden aktiven Parametern pro Token, mit einem Kontextfenster von 1 Million Token. Bei OpenRouter kostet es rund 0,087 US-Dollar pro Million Eingabe-Token und 0,17 US-Dollar pro Million Ausgabe-Token – ein Bruchteil der Kosten von Frontier-Konkurrenten. Daher wurde es diese Woche als Modell beschrieben, das 50-mal teurere Modelle schlägt.

Die Veröffentlichung setzt DeepSeeks Muster fort, Gewichte sofort statt später zu veröffentlichen. Das Unternehmen betont, dass das Update für Agenten-Workflows, Coding-Assistenten und Hochdurchsatz-Chat optimiert und in Tools wie Claude Code, OpenClaw und OpenCode integriert ist.

Beobachter sehen V4-Flash-0731 als vielversprechendes Zeichen für das nächste V4-Pro-Update – und als Erinnerung daran, dass sich die Preis-Leistungs-Grenze mitten in der breiteren Debatte über KI-Ausgaben rasant verschiebt.