Die meisten KI-Hardware-Projekte sind geschlossen, groß – oder beides. openTPU ist das Gegenteil: ein kleines Monorepo mit dem gesamten Stack, von Befehlssatz und SystemVerilog-RTL über einen bitgenauen Simulator und eine Kernelsprache samt Compiler bis zu einem Profiler, der Läufe im Browser abspielt. Die Autoren formulieren es als Frage, nicht als Produkt: Wie weit kommen KI-Agenten beim Hardware-Design – und können sie den Beschleuniger bauen, auf dem ihre eigene Inferenz läuft?

Das Design ist bewusst einfach. Ein Sequencer gibt pro Takt eine Instruktion an wenige Einheiten aus: DMA bewegt Daten, eine systolische Matrixeinheit multipliziert int8-Gewichte aus dem DRAM, eine Vektoreinheit rechnet in fp32, ein Quantizer schreibt Ergebnisse als int8 zurück. Es gibt keinen Cache und kein verstecktes Scheduling – jedes bewegte Byte ist eine Instruktion, jeder Takt aus einer Trace erklärbar, eine Debug-Eigenschaft, die gängige NPUs selten bieten.

Auf einer Inspur-YPCB-00338-Karte mit Xilinx Kintex-7 xc7k480t und zwei DDR3-Kanälen meldet das Projekt zehn moderne Modelle mit ihren echten Gewichten, deren Token bitgenau mit dem Simulator übereinstimmen. LFM2.5-230M dekodiert 59 Token/s in int8 und 85,8 in 4 Bit; Qwen3-0.6B 21,6; Qwen3.5-4B 5,88 in 4 Bit. Der DRAM ist der Flaschenhals, und die Karte erreicht bereits 82 bis 94 Prozent der DDR3-1066-Spitze.

Modelle, die größer als die 4 GB Speicher der Karte sind, laufen per Experten-Offload: Ein Mixture-of-Experts-Modell hält seine Experten in Slots pro Schicht, die Karte routet jedes Token und rechnet jeden Experten, der Host streamt nur die fehlenden Experten über PCIe nach. LFM2.5-8B-A1B (8,5 Mrd. Parameter, 1,7 Mrd. aktiv) erreicht 10,6 Token/s bei 98,5 Prozent Slot-Trefferrate; Qwen3.5-35B-A3B (34,7 Mrd. Parameter, 3 Mrd. aktiv) erreicht 3,95 Token/s.

Das Projekt steht unter Apache-2.0 und ist von vorne bis hinten lesbar – sein eigentlicher Beitrag. Es ist ebenso Lehrmaterial wie Benchmark: Der Simulator dient als Spezifikation, die das RTL erfüllen muss, Tests halten beide deckungsgleich, und ISA-Dokumentation plus Kernel-Beispiele lassen einen Entwickler eine Matmul von Python bis zu den Leitungen verfolgen. Alles außer der Karte läuft auf dem Laptop – `otpu-chat` kann auch ohne FPGA über den ISA-Simulator mit einem Modell sprechen.

Warum es zählt: Wenn agentengesteuertes Hardware-Design einen funktionierenden, verifizierbaren Beschleuniger für einen FPGA hervorbringen kann, der vor Jahren erschien, wird dieselbe Schleife zu einem plausiblen Weg, Beschleunigerdesign schneller zu erkunden – und kleine Modelle auf Hardware laufen zu lassen, für die sonst niemand einen Compiler schreiben würde. Es ist zugleich eine saubere Antwort auf die Frage, ob hinter „von KI entworfenem Silizium“ mehr steckt als Pressemitteilungen: Hier sind RTL, Simulator und die bitgenaue Übereinstimmung.