Cactus Compute hat Whistle veröffentlicht — ein Spracherkennungsmodell, das in eine einzige Datei von 16,9 Megabyte passt, ohne Abhängigkeiten auf einer CPU läuft und sieben Sprachen abdeckt: Englisch, Deutsch, Französisch, Spanisch, Italienisch, Niederländisch und Polnisch. Veröffentlicht wurde es am 2. Oktober; derzeit steigt es auf Hacker News.

Die Kernzahlen stammen aus den eigenen Benchmarks des Unternehmens auf einer Apple M4 Pro CPU. Bei zehn Sekunden Audio erreicht Whistle sein erstes Ausgabe-Token nach 11,1 Millisekunden; Whisper base braucht 73,2 ms. Es dekodiert rund 1.319 Token pro Sekunde gegenüber 266 bei Whisper base — aus einer Datei, die mit 16,9 MB gegen 145,3 MB 8,6-mal kleiner ist. Bei der Wortfehlerrate liegt Whistle laut Unternehmen vorn auf LibriSpeech test-clean und test-other, SPGISpeech, Earnings-22 und im FLEURS-Durchschnitt; Whisper base bleibt vorn bei TED-LIUM, AMI und im MLS-Durchschnitt. Wo ein Modell für einen Benchmark nie Werte veröffentlicht hat, bleibt der Vergleich leer statt gefüllt.

Für Geräte zählen drei Fähigkeiten. Whistle transkribiert bis zu 30 Sekunden 16-kHz-Mono-Audio in einem Durchgang und erkennt die Sprache selbst; es liefert Wort-Zeitstempel; und es kann das Sprach-Embedding des Encoders zurückgeben, eine Zeile pro 80-ms-Frame, ohne ein Transkript zu dekodieren.

Das strategischste Detail ist architektonisch: Whistle lädt in dieselbe C++-Engine wie Needle, Cactus' Funktionsaufruf-Modell. So kann ein einziges kleines Binary einen Clip transkribieren und ihn unmittelbar in Tool-Aufrufe verwandeln — das Muster hinter lokaler Sprachsteuerung für Wearables, Roboter und Smart-Home-Hardware. Die Engine wird vorkompiliert für 17 Zielplattformen ausgeliefert, von macOS, Linux, Android, iOS und watchOS bis Windows on ARM, RISC-V, MIPS, Browser und eine WASI-Komponente.

Das sind die Messungen des Anbieters, also gilt der übliche Vorbehalt: Der eigentliche Test ist die unabhängige Nachprüfung. Bemerkenswert ist die Richtung. Unter 20 Megabyte große, abhängigkeitsfreie Spracherkennung auf einer gewöhnlichen CPU macht Sprache zu etwas, das man in einer Footprint-Klasse für Mikrocontroller ausliefern kann — statt Audio an ein Cloud-Abo zu schicken.