Ein 27B-Modell, das auf ein Handy passt
PrismML, ein von Caltech-Forschern gegründetes und von Professor Babak Hassibi geleitetes Startup, hat am Donnerstag Bonsai 2 27B veröffentlicht — eine komprimierte Version von Alibabas weit verbreitetem Qwen3.8 27B, die das Modell von etwa 54 GB auf nur 5,9 GB reduziert. Das Ergebnis: ein reasoning-fähiges LLM, das lokal auf einem PC oder potenziell einem High-End-Smartphone läuft und 98 % der aggregierten Benchmark-Werte des Originals beibehält.
Die Kerninnovation ist die ternäre Gewichtskompression. Während traditionelle Modelle jedes Gewicht in 16 Bit speichern, reduziert PrismML jeden auf einen von drei Werten: +1, -1 oder 0. Diese 9- bis 10-fache Speicherreduktion tauscht minimale Benchmark-Treue gegen enorme Portabilitätsgewinne ein.
Bereits Traktion vorhanden
Das ursprüngliche Bonsai, im März veröffentlicht, erreichte 95 % der Benchmarks und wurde über 11 Millionen Mal heruntergeladen. PrismMLs kleinere Modelle wurden weitere 2,6 Millionen Mal heruntergeladen. Das Startup sammelte eine 22,25-Millionen-Dollar-Seed-Runde mit Khosla Ventures, Cerberus Capital und Caltech.
Das größere Spiel
Hassibi teilte TechCrunch mit, dass die nächsten Releases Modelle im Bereich mehrere hundert Milliarden Parameter anvisieren werden. Je größer das Modell, desto mehr Raum gibt es, ohne Intelligence zu verlieren zu komprimieren.
Berater Ion Stoica rahmt die Bedeutung in Konsumententermen: Sie werden Intelligence an ihren Fingerspitzen haben, und sie wird kostenlos sein, weil sie auf dem Gerät läuft, das Sie bereits gekauft haben. Und sie wird privat sein, weil Sie nichts in die Cloud senden müssen.
Was es bedeutet
Wenn die Kompressionsqualität mit der Modellgröße skaliert, ändern sich die Ökonomien der KI-Inferenz grundlegend. Cloud-GPU-Kosten werden optional statt obligatorisch. Lokale Verarbeitung umgeht außerdem die Datenschutzbedenken, die die Unternehmens- und Gesundheitsadoption von Cloud-KI verlangsamt haben.




