Das wirtschaftliche Versprechen von KI-Coding-Werkzeugen war immer Durchsatz: mehr Code erzeugen, mehr Features ausliefern, schneller werden. Eine Golem-Analyse zur Softwareentwicklung greift genau diese Annahme an — mit dem Befund, dass die Branche mehr Code und weniger Fortschritt bekommt.
Die These lautet nicht, generierter Code sei wertlos. Sie lautet, dass Umfang nie das richtige Maß war. Jahrzehntelang war Code teuer in der Herstellung, also galt seine Menge als grobes Abbild der investierten Arbeit und, grob, des Fortschritts. Wenn die Generierung diese Kosten einbrechen lässt, verschwindet die Beschränkung nicht — sie wandert nachgelagert dorthin, wo ohnehin Knappheit herrscht: Code lesen, entscheiden, ob er korrekt ist, verstehen, warum er so geformt ist, und jahrelang damit leben.
Die Folgen kennen viele Teams bereits. Das Review wird zum Durchsatzlimit: Wer tausend Zeilen plausibel aussehenden, generierten Codes prüfen muss, ist selten schneller als bei hundert handgeschriebenen Zeilen — oft langsamer. Es entsteht Verständnisschuld: Code, den niemand geschrieben, niemand vollständig gelesen und niemand sicher ändern kann. Tests können grün bleiben, während das Design leise verrottet.
Es gibt ein ernstzunehmendes Gegenargument, und Golems Rahmung lässt Raum dafür: Werkzeuge, Tests, statische Analyse und Modellqualität verbessern sich, und heute angehäufte Schulden könnten morgen billiger zu tilgen sein. Das ist aber eine Wette auf künftige Fähigkeiten, kein Beleg für gegenwärtigen Fortschritt — und die Rendite muss gemessen, nicht angenommen werden.
Die unbequeme Lesart: Die Branche hat den billigsten Teil der Pipeline optimiert und das Beschleunigung genannt. Fortschritt am Codevolumen zu messen, ist ungefähr so aussagekräftig wie ein Krankenhaus an der Zahl der verschriebenen Rezepte zu messen.
Die vollständige Argumentation samt Belegen und Beispielen steht im Originalartikel.




