Amazon Web Services hat Strands Decider 2B veröffentlicht — ein "Entscheidungsmodell" mit 2 Milliarden Parametern, das zwischen vordefinierten Optionen wählt und einen Konfidenzwert zurückgibt, statt Text zu erzeugen. Es ist die Antwort des Konzerns auf Jev von TypeSafe AI, das Modell, das diese Kategorie Anfang dieses Monats angestoßen hat.
Veröffentlicht wurde das Modell von Strands Labs, der AWS-Gruppe, die Werkzeuge und Protokolle für den Einsatz von KI-Agenten entwickelt. Es ist vollständig quelloffen: Code auf GitHub, Gewichte auf Hugging Face und — ungewöhnlich — auch die Trainingsdaten und Skripte, mit denen es gebaut wurde. Laut AWS ist das 2B-Modell klein genug, um lokal auf einer CPU oder GPU zu laufen, und liefert Antworten in Zehntelsmillisekunden.
WAS EIN ENTSCHEIDUNGSMODELL IST
Anders als ein großes Sprachmodell, das beliebige Ausgaben erzeugen kann, ist ein Entscheidungsmodell darauf ausgelegt, aus einer vorgegebenen Optionsmenge zu wählen ("Ist der Ausdruck 'sihamba ngokushesha' Englisch, Zulu oder Niederländisch?") und dieser Wahl einen numerischen Zuverlässigkeitswert beizufügen. Als Gegenleistung für diesen Verlust an Flexibilität seien solche Modelle bei gegebener Größe schneller und leistungsfähiger, lieferten immer eine der angebotenen Optionen und liefen mit sehr geringer Latenz, so AWS. Der Preis: Sie sind schwächer im komplexen Schlussfolgern und können keinen Text erzeugen, was sie für Programmierung, Chatbots oder Zusammenfassungen ungeeignet macht.
ARCHITEKTUR UND ERGEBNISSE
Strands Decider 2B baut auf dem "Torso" von Qwen3.5-2B auf: Der Sprachmodell-Kopf wird entfernt und durch einen kleinen Zeiger-Kopf (knapp über eine Million Parameter) ersetzt, der jede angebotene Option gegen die Antwortposition bewertet. Der Torso wird mit einem LoRA-Adapter vom Rang 16 feinabgestimmt. Es ist die neunzehnte Iteration der Architektur und die zweite große — die erste nutzte einen Slot-Kopf, der deutlich schlechter abschnitt.
Auf dem öffentlichen JevBench-Datensatz rangiert das Modell laut AWS bei Genauigkeit und Kalibrierung auf Platz drei von 33 in der 2B-Klasse und auf Platz eins von 30, wenn Modelle knapp über 2B ausgeschlossen werden. Die mediane Latenz liegt bei etwa 115 ms auf einer Nvidia RTX 3090 und bei rund 153 ms für kleine Aufgaben auf einem M3-MacBook.
HERKUNFT UND KONTEXT
Der AWS-Distinguished-Engineer Marc Brooker baute die erste Version, nachdem er Jev gesehen hatte, und sie erreichte kurzzeitig Platz eins der Jevbench-Rangliste ihrer Größenklasse. Anschließend bereinigten AWS-Ingenieure das Projekt für die Veröffentlichung unter Strands Labs. Brooker sagte gegenüber TechCrunch, der Bedarf sei in Gesprächen mit Kunden entstanden, deren agentische Workflows nicht immer Kosten oder Latenz eines vollwertigen LLM rechtfertigten: Ein Decider sei ein "perfekter" Schritt für einen Workflow mit der Frage "Was ist hier als Nächstes zu tun?".
Die Veröffentlichung fällt in dieselbe Woche, in der OpenAI mit der Decisions API ein ähnliches Angebot ankündigte, und folgt auf Dutzende vergleichbarer Modelle, die Forscher seit dem Debüt von Jev produziert haben. TypeSafe-CEO Diogo Almeida sagte, er sehe noch keine ernsthafte Konkurrenz: "Der aktuelle Schwung wirkt eher wie ML-Leute, die eine coole Architektur umsetzen wollen, als wie ein Team, das sich ernsthaft der Frage widmet, Intelligenz nützlich zu machen."
WARUM DAS WICHTIG IST
AWS positioniert die Klasse für Modell-Routing, Werkzeugauswahl, Evaluierungen, Guardrails, Speicher- und Kontextverwaltung sowie Policy-Klassifizierung — und für hybride Agenten, die LLMs für die schwierigsten Entscheidungen und Decider für Routineentscheidungen nutzen, um Kosten und Latenz zu senken. Die Wette lautet: Nicht jeder Schritt im Workflow eines Agenten braucht ein Frontier-Modell; ein günstiges, schnelles, lokal lauffähiges Modell, das bei kleinen Fragen verlässlich sicher ist, kann für viele davon genügen.




