ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Strands Decider 2B als Open Source: Ein 2B-Modell, das nur auswählt — mit Sicherheitsscore in Millisekunden

Strands Decider 2B als Open Source: Ein 2B-Modell, das nur auswählt — mit Sicherheitsscore in Millisekunden

KI-Informationen • Admin • • 5 Aufrufe

Strands Decider 2B wurde am 7. Oktober 2026 vom Strands-Agents-Team als Open Source veröffentlicht. Das Modell schreibt keine Texte und führt keine Gespräche. Es tut nur eines: aus einer vorgegebenen Menge eine Option auswählen und angeben, wie sicher es sich dabei ist. Mit 2 Milliarden Parametern, lokaler Latenz im zweistelligen Millisekundenbereich sowie vollständig öffentlichen Gewichten und Trainingsdaten beansprucht diese Klasse kleiner Entscheidungsmodelle einen Teil der Agenten-Workflows, der bisher großen Modellen gehörte.

Worin es sich von einem gewöhnlichen LLM unterscheidet

Ein gewöhnliches LLM erzeugt seine Antwort Token für Token, ohne begrenzten Antwortraum. Ein Entscheidungsmodell dreht das um: Die Kandidaten stehen vorher fest, ein einziger paralleler Durchlauf bewertet jede Option, und ausgegeben werden nur Auswahl und Scores. Der Preis ist klar benannt: Es kann keinen Text erzeugen, ist bei komplexem Schließen deutlich schwächer als Reasoning-Modelle und taugt nicht für Coding, Zusammenfassungen oder Chat. Der Gegenwert ist ebenso klar: Die Antwort bleibt immer innerhalb der vorgegebenen Optionen, sie kommt schnell, und jedes Urteil trägt einen kalibrierten Zuverlässigkeitsscore — eine Schätzung, wie wahrscheinlich die Entscheidung richtig ist. Frontier-APIs liefern so etwas in der Regel nicht direkt.

Eine Architektur durch Weglassen

Strands Decider 2B nutzt Qwen3.5-2B als Rumpf, entfernt den Sprachmodellkopf für die Texterzeugung und ersetzt ihn durch einen Pointer-Head mit gut einer Million Parametern. Dieser Kopf bewertet jede Option, indem er den internen Zustand an der Optionsposition mit dem Zustand an einer Antwortmarkierung vergleicht. Der Rumpf selbst wird mit einem LoRA-Adapter vom Rang 16 feinjustiert. Nach Angaben des Teams ist die Veröffentlichung die 19. Iteration; das Repository dokumentiert jede Änderung, auch warum ein früherer Slot-Head, der deutlich schlechter abschnitt, verworfen wurde.

Werte und Tempo

Auf dem öffentlichen JevBench-Set liegt das Modell auf Platz 3 von 33 in der 2B-Klasse und auf Platz 1 von 30, wenn Modelle knapp über 2B ausgeklammert werden; die Kalibrierungsqualität wird per Brier-Score zusammen mit der Genauigkeit veröffentlicht. Die Latenz beträgt im Median rund 115 Millisekunden auf einer lokalen RTX 3090 und rund 153 Millisekunden für kleine Aufgaben auf einem M3-MacBook, mit annähernd linearem Anstieg nach Aufgabengröße. Für Workflows, die vor jedem Tool-Aufruf ein Urteil brauchen, passt diese Größenordnung tatsächlich in die Aufrufkette, statt für jede kleine Entscheidung eine volle Großmodell-Inferenz zu bezahlen.

Was es in einem Agenten konkret tut

Als Einsatzfelder nennt das Team Modell-Routing, Tool-Auswahl, automatische Bewertung, Leitplanken, Speicherverwaltung, Kontextmanagement und Richtlinienklassifikation. Das mitgelieferte Beispiel zeigt das Muster gut: Ein Agent will ein Wetter-Tool aufrufen, obwohl der Nutzer nie eine Stadt genannt hat. Bevor der Aufruf läuft, beantwortet Decider zwei Ja-Nein-Fragen — beruhen die Argumentwerte auf etwas, das der Nutzer wirklich gesagt hat, und ist der Aufruf jetzt verfrüht? Wenige Zeilen Code machen daraus Freigabe, Ablehnung, menschliche Bestätigung oder die Rückgabe des Zuges ans Modell samt Feedback. Das größere Muster ist hybride Arbeitsteilung: Die schwersten Urteile bleiben beim großen Modell, die vielen wiederkehrenden, klar umrissenen gehen an das Entscheidungsmodell — Kosten und Latenz sinken zusammen.

Für Teams, die Agenten bauen, lautet das Signal: Die Arbeitsteilung wird feiner, nicht jedes Urteil verdient ein Frontier-Modell. Die Grenze ist ebenso deutlich — die Optionen muss ein Mensch oder ein übergeordnetes System vorgeben, Decider wählt nur. Sind die Optionen selbst falsch, hilft auch korrektes Wählen nicht. Installierbar ist es per pip install strands-decider, die Gewichte liegen auf Hugging Face, Trainingsdaten und Skripte sind öffentlich — ein vollständiger Startpunkt für alle, die einen eigenen kleinen Entscheider trainieren wollen.

Empfohlene Tools

Mehr