Yapay zekâ donanım projelerinin çoğu kapalı, devasa ya da her ikisidir. openTPU ise tam tersi: komut kümesinden SystemVerilog RTL'e, bite bit eşleşen bir simülatörden derleyicisiyle birlikte bir çekirdek diline ve koşuları tarayıcıda oynatan bir profilleyiciye kadar tüm yığını tek bir küçük monorepoda barındırıyor. Yazarları bunu bir ürün değil, bir soru olarak çerçeveliyor: Yapay zekâ ajanları donanım tasarımında ne kadar ileri gidebilir ve kendi çıkarımını çalıştıran hızlandırıcıyı inşa edebilir mi?
Tasarım kasten basit. Bir sekanslayıcı her çevrimde az sayıda birime tek komut gönderiyor: DMA veriyi taşıyor, sistolik matris birimi DRAM'den akan int8 ağırlıkları çarpıyor, vektör birimi fp32 matematiği yapıyor ve niceleyici sonuçları int8 olarak geri yazıyor. Önbellek ve gizli zamanlama yok; dolayısıyla taşınan her bayt bir komut ve her çevrim bir iz üzerinden açıklanabiliyor — geleneksel NPU'ların nadiren sunduğu bir hata ayıklama özelliği.
Xilinx Kintex-7 xc7k480t ve iki DDR3 kanalı taşıyan bir Inspur YPCB-00338 kartında proje, gerçek ağırlıklarıyla çalışan on modern modelin simülatörle bite bit aynı tokenleri ürettiğini bildiriyor. LFM2.5-230M int8'de saniyede 59, 4 bit'te 85,8 token çözüyor; Qwen3-0.6B 21,6; Qwen3.5-4B 4 bit'te 5,88. Darboğaz DRAM ve kart DDR3-1066 tepe değerinin yüzde 82-94'üne ulaşmış durumda.
Kartın 4 GB belleğinden büyük modeller uzman aktarımıyla çalışıyor: bir uzmanlar karışımı (MoE) modeli uzmanlarını katman başına slotlarda tutuyor, kart her tokeni yönlendirip her uzmanı hesaplıyor, ana makine yalnızca eksik uzmanları PCIe üzerinden aktarıyor. LFM2.5-8B-A1B (8,5 milyar parametre, 1,7 milyarı aktif) yüzde 98,5 slot isabet oranıyla saniyede 10,6 token; Qwen3.5-35B-A3B (34,7 milyar parametre, 3 milyarı aktif) saniyede 3,95 token'a ulaşıyor.
Proje Apache-2.0 lisanslı ve baştan sona okunabilir — asıl katkısı da bu. Bir kıyaslama olduğu kadar bir öğretim aracı: simülatör, RTL'in uymak zorunda olduğu şartname işlevini görüyor, testler ikisini hizada tutuyor, ISA dokümantasyonu ve çekirdek örnekleri geliştiricinin bir matmul işlemini Python'dan tellere kadar izlemesini sağlıyor. Kart dışındaki her şey dizüstünde çalışıyor — `otpu-chat` FPGA olmadan ISA simülatörü üzerinden bir modelle konuşabiliyor.
Neden önemli: Ajan güdümlü donanım tasarımı, yıllar önce piyasaya çıkmış bir FPGA için çalışan ve doğrulanabilir bir hızlandırıcı üretebiliyorsa, aynı döngü hızlandırıcı tasarımını daha hızlı keşfetmenin ve kimsenin derleyici yazmayacağı donanımda küçük modelleri çalıştırmanın makul bir yolu hâline geliyor. Aynı zamanda 'yapay zekâ tasarımı silikon' söyleminin arkasında basın bültenlerinden fazlası var mı sorusuna temiz bir yanıt: RTL, simülatör ve bite bit eşleşme ortada.




