Von allen Wegen, einen KI-Coding-Assistenten billiger zu machen, wäre „den Assistenten anknurren" nicht der, den die meisten Entwickler vorhergesagt hätten. Genau das aber ist die Prämisse von Caveman, einer viralen Skill samt Proxy, die diese Woche unter den GitHub-Trending-Repos stand – mit rund 108.900 Sternen, 271 davon an einem einzigen Tag, und einer README, die die These in gebrochenem Englisch formuliert: „why use many token when few token do trick".
Der Mechanismus ist simpel. Sich selbst überlassen verwendet ein Coding-Agent einen großen Teil seiner Ausgabe auf Vorreden, Wiederholungen und höfliche Zusammenfassungen – die Verbindungsprosa um den Code herum. Caveman weist das Modell an, darauf zu verzichten und komprimiert, im Telegrammstil zu antworten; das soll die Output-Tokens um rund 65 % senken, ohne Code und technische Aussagen anzutasten. Version 2.0 ging weiter und komprimierte auch die Eingabeseite des Gesprächs; Version 3.0, in den vergangenen Wochen veröffentlicht, stellte das gesamte Repository – Engine, Proxy, Browser-Werkzeuge, einen MCP-Server, ein Kompressionsmodul und den „cavemem"-Speicherkern – unter Apache 2.0.
Die Idee hat längst ein einzelnes Repository verlassen. Auf GitHub-Trending findet sich inzwischen ein ganzes Genre von Kontext-Ökonomie-Werkzeugen: Proxies, die Prompts verkleinern, vorindizierte Wissensgraphen, die verhindern, dass ein Agent eine Codebasis erneut liest, und Skills, die die Sitzungsausgabe kürzen. Mehrere der am schnellsten wachsenden Repos dieser Woche beruhten auf genau diesem Versprechen.
Die Skepsis ist ebenso sichtbar. Ein wiederkehrender Einwand lautet, dass Output-Tokens nur einen kleinen Teil der Kosten einer typischen Sitzung ausmachen – manche Schätzungen beziffern die sichtbare Prosa auf rund 1 bis 10 % –, sodass selbst ein drastisch kürzeres Transkript die Rechnung kaum verändert. Ein viel geteilter Beitrag trug den Titel: „Caveman verspricht 65 % weniger Tokens – meine Rechnung bewegte sich nicht."
Genau diese Spannung ist der interessante Teil. Caveman funktioniert in dem engen Sinn, dass es das Modellverhalten exakt wie beworben verändert; ob es spart, was ein Entwickler tatsächlich zahlt, hängt davon ab, wohin die Tokens vorher flossen. Je autonomer Agenten werden und je länger ihre Schleifen, desto ungebrochener ist die Nachfrage nach Werkzeugen, die diese Schleife verkürzen.




