Transformer sind berüchtigt schlecht im Rechnen. Ein neues Open-Source-Projekt argumentiert, dass nicht die Architektur der Flaschenhals ist — sondern das Training.
Der unabhängige Forscher Robert Porter hat Torchwright veröffentlicht, einen Compiler, der einen in normalem Python geschriebenen Rechengraphen nimmt und die Gewichte eines handelsüblichen Transformers erzeugt, der ihn ausführt. In der gesamten Pipeline gibt es kein Training: Jedes Gewicht wird von Hand berechnet, Schicht für Schicht, und dann in einen Standard-Phi-3-Checkpoint geschrieben, der sich mit normalem Hugging-Face-Code laden lässt.
Das Werkzeug entstand aus einer einfachen Frage: Kann ein Transformer überhaupt Grundschularithmetik ausdrücken, oder liegt das außerhalb der Architektur? Obwohl Transformer in idealisierten Beweisen Turing-vollständig sind, wollte Porter wissen, ob die exakten Gewichte für einen bestimmten Algorithmus tatsächlich existieren. Torchwrights Antwort ist ein eindeutiges Ja: Kompilierte Modelle erreichen 100 % Genauigkeit bei allen 3.000.000 unterstützten Ausdrücken für Multiplikation mit bis zu 12 Stellen — kein Gradientenabstieg, keine Daten.
Der Compiler baut auf einem Jahrzehnt Interpretierbarkeitsforschung auf. Er übernimmt Ideen von RASP, der Programmiersprache, die Weiss, Goldberg und Yahav zur Beschreibung von Transformer-Berechnungen einführten, und von DeepMinds Tracr, das RASP-Programme in echte Gewichte kompilierte. Torchwright geht weiter und zielt auf eine moderne Standardarchitektur: kausale Softmax-Attention, rotierende Positions-Einbettungen (RoPE), RMSNorm und gegatete SwiGLU-Feed-Forward-Schichten — genau wie bei Produktions-LLMs.
Intern behandelt der Compiler den Residualstrom als Notizblock: Er reserviert Spalten für Zwischenwerte, nutzt die Skip-Verbindung als Addierer und gibt Spalten frei, indem er die Negation eines Werts schreibt. Multiplikation erweist sich unter SwiGLU als sauberer als unter ReLU — die Symmetrie des Gates macht a*b exakt ausdrückbar.
Das Repository enthält zwölf Beispielgraphen, darunter drei Addierer, Ziffernsortierung, eine Caesar-Chiffre, Fibonacci und vier Taschenrechner, die dieselben Ausdrücke auf radikal unterschiedliche Weise berechnen — einer davon memoriert jede Antwort. Der nächste Beitrag des Autors wird beziffern, was jede Strategie an Schichten, Parametern und Tokens kostet.
Das Projekt ist ein Proof of Concept — niemand braucht einen Transformer-Taschenrechner. Aber als Labor für Interpretierbarkeit bietet es etwas Seltenes: exaktes Wissen darüber, was jedes Gewicht in einem Modell tut.




