Das chinesische KI-Labor Z.ai – früher Zhipu AI – hat am 14. August GLM-5.3 veröffentlicht, nach eigener Aussage sein leistungsfähigstes Coding-Modell und, wie das Unternehmen selbst einräumt, ein Cybersicherheits-Werkzeug, dessen Fähigkeiten schneller wuchsen als erwartet.

Statt ein neues Basismodell zu trainieren, hat Z.ai das Post-Training auf derselben 743-Milliarden-Parameter-Basis skaliert, die schon GLM-5.2 zugrunde lag. Die Trainingsumgebungen ähneln zunehmend vollständigen Ingenieursaufträgen: Agenten erhalten Zugriff auf Codebasen, Dokumentation, Rechencluster, Speichersysteme und Versuchsergebnisse und müssen Probleme diagnostizieren, Systeme verändern, Experimente durchführen und messbare Verbesserungen nachweisen, ohne die Korrektheit zu gefährden. Manche Aufgaben entsprechen in etwa mehreren Arbeitstagen eines erfahrenen Ingenieurs. „Post-Training zu skalieren war alles, was wir für GLM-5.3 getan haben", schrieb das Unternehmen in seiner technischen Ankündigung.

Die Benchmark-Sprünge sind groß: Im Terminal-Bench 3.0 steigt der Wert von 4,6 auf 28,3, im DeepSWE v1.1 von 46,2 auf 66,9 und im AutomationBench von 26,2 auf 48,2. Auf Z.ais eigenem Code Bench erreicht GLM-5.3 bei Max-Reasoning 34,5 % und verbraucht dabei etwa 75.000 Ausgabe-Token pro Aufgabe – gegenüber 23,4 % bei GLM-5.2 mit rund 96.000 Token. Das deutet auch auf erhebliche Effizienzgewinne hin.

Die ungewöhnlichere Entwicklung betrifft die Cybersicherheit. „Mit der Skalierung des Post-Trainings entwickelten sich Cyber-Fähigkeiten schneller als erwartet", schrieb Z.ai. Im CyberGym erreicht GLM-5.3 84,5 %, und die Zusammenarbeit mit Sicherheitsteams in China hat nach Expertenprüfung und Deduplizierung 2.436 Schwachstellenfunde in 269 Projekten erbracht – 1.097 davon als kritisch oder hoher Schweregrad eingestuft. Das Modell soll bereits eine „potenziell ernste Schwachstelle" in Cursor gefunden haben, dem kürzlich von SpaceX übernommenen KI-Coding-Startup, wie Z.ai-Developer-Advocate Lou auf X mitteilte.

Genau diese Sensibilität ist der Grund für die gestaffelte Veröffentlichung. GLM-5.3 ist zunächst nur über Z.ais GLM Coding Plan und die ZCode-Umgebung verfügbar; API-Zugang und offene Gewichte folgen laut Unternehmen in etwa zwei Wochen, „sobald Sicherheitsbewertung und Härtung abgeschlossen sind". Reuters berichtete am Freitag, Z.ai führe zudem Kontrollen für fortgeschrittene Fähigkeiten ein, darunter einen „Trusted Access"-Ansatz für sensible Funktionen.

Entwickler müssen eine inkompatible API-Änderung beachten: Anders als bei früheren GLM-Modellen lässt sich das „Thinking" nicht deaktivieren. Anwendungen, die thinking.type „disabled" senden, müssen auf „enabled" umstellen und einen Reasoning-Aufwand angeben – GLM-5.3 wird damit für manche Produktionssysteme zu einer echten Migration.

Der Launch setzt Z.ais schnellen Vorstoß in Richtung langlaufender autonomer Softwareentwicklung fort, gestützt auf rund 4 Milliarden Dollar, die das Unternehmen vergangenen Monat über einen Börsengang in Hongkong einsammelte. Er zeigt zugleich, wie weit sich ein Basismodell an der Spitzenklasse ohne einen weiteren teuren Pretraining-Zyklus treiben lässt – und warum die Frage, wie solche Agenten verteilt werden, genauso wichtig werden könnte wie die Frage, wie sie trainiert werden.