Chinas Wettlauf um KI-Modelle der nächsten Generation tritt in eine neue Phase – und die Bedrohung sind nicht mehr nur Chips. Chinesische KI-Experten warnen zunehmend, dass der Mangel an hochwertigen Trainingsdaten zum nächsten großen Engpass für die technologischen Ambitionen des Landes werden könnte – einer, der sich nicht einfach durch Hardware umgehen lässt.

Die Sorge ist global. Laut Epoch AI, einem US-Forschungsinstitut, könnte das weltweite Angebot an hochwertigen, öffentlich verfügbaren menschengemachten Texten innerhalb der nächsten sechs Jahre erschöpft sein. OpenAI-Mitbegründer Andrej Karpathy warnt vor einer drohenden 'Datenmauer' bis zum Ende dieses Jahrzehnts, jenseits derer die Fähigkeiten von Modellen ein Plateau erreichen könnten, wenn sie nicht mit frischen, verlässlichen Informationen versorgt werden.

Für China ist das Problem besonders akut. Chinesisch macht nur etwa 1,3 Prozent der Webinhalte aus, Englisch dagegen rund 49 Prozent – doch chinesischsprachige Daten stellen mehr als 60 Prozent der Trainingsdaten der meisten chinesischen KI-Modelle. Je größer die Modelle werden, desto stärker übersteigt die Nachfrage nach qualitativ hochwertigen chinesischen Texten das Angebot.

Peking reagiert bereits: Berichten zufolge planen die Behörden bis 2028 nationale Datensätze, und chinesische Labore setzen zunehmend auf synthetische Daten und mehrsprachige Quellen. Unterdessen geben führende US-Labore viel Geld aus, um offline vorhandenes menschliches Wissen zu erschließen – ein Wettlauf, der eine heftige ethische Debatte darüber entfacht hat, wie weit Unternehmen gehen dürfen, um ihre Modelle zu füttern.

Die Datenkrise kommt, nachdem chinesische Open-Weight-Modelle wie Moonshots Kimi K3, Alibabas Qwen3.8-Max und DeepSeek V4-Flash einen Großteil der Fähigkeitslücke zu US-Systemen geschlossen haben – und sie droht, genau in dem Moment an Schwung zu verlieren, in dem das Land an die Spitze drängen will.