Strands Decider 2B a été publié en open source par l'équipe Strands Agents le 7 octobre 2026. Il n'écrit pas de texte et ne tient pas de conversation. Il fait une seule chose : choisir une option parmi un ensemble donné et indiquer son niveau de certitude. Avec 2 milliards de paramètres, une latence locale de quelques dizaines de millisecondes, des poids et des données d'entraînement entièrement publics, cette famille de petits modèles de décision revendique une part des flux d'agents qui revenait jusqu'ici aux grands modèles.
Ce qui le distingue d'un LLM ordinaire
Un LLM ordinaire génère sa réponse token par token, sans espace de réponse borné. Un modèle de décision inverse la logique : les options candidates sont fixées d'avance, un seul passage parallèle note chacune d'elles, et la sortie se limite au choix et à ses scores. Les contreparties sont explicites : il ne génère pas de texte, il est nettement plus faible en raisonnement complexe que les modèles de raisonnement, et il ne sert ni à coder, ni à résumer, ni à discuter. En échange, la réponse reste toujours dans les options fournies, elle arrive vite, et chaque jugement porte un score de fiabilité calibré, c'est-à-dire une estimation de la probabilité que le choix soit correct — une information que les API des modèles de pointe ne livrent généralement pas directement.
Une architecture par soustraction
Strands Decider 2B part d'un tronc Qwen3.5-2B, retire la tête de modélisation du langage qui génère le texte et la remplace par une tête pointeur d'un peu plus d'un million de paramètres. Cette tête note chaque option en comparant l'état interne à la position de l'option avec l'état à un marqueur de réponse. Le tronc lui-même est ajusté par un adaptateur LoRA de rang 16. L'équipe présente cette version comme la 19e itération, et le dépôt documente chaque changement, y compris la raison de l'abandon d'une tête à emplacements antérieure, nettement moins performante.
Résultats et vitesse
Sur le jeu public JevBench, le modèle se classe 3e sur 33 dans la classe 2B, et 1er sur 30 si l'on exclut les modèles légèrement au-dessus de 2B ; la qualité de calibration, mesurée par le score de Brier, est publiée avec la précision. La latence médiane est d'environ 115 millisecondes sur une RTX 3090 locale et d'environ 153 millisecondes pour de petites tâches sur un MacBook M3, avec une croissance à peu près linéaire selon la taille de la tâche. Pour des flux qui exigent un jugement avant chaque appel d'outil, cet ordre de grandeur peut réellement tenir dans la chaîne d'appels, au lieu de payer une inférence complète de grand modèle pour chaque petite décision.
Ce qu'il fait concrètement dans un agent
Les usages cités comprennent le routage de modèles, la sélection d'outils, l'évaluation automatique, les garde-fous, la gestion de la mémoire et du contexte et la classification de politiques. L'exemple fourni illustre bien le schéma : un agent s'apprête à appeler un outil météo alors que l'utilisateur n'a jamais nommé de ville ; avant l'exécution, Decider répond à deux questions fermées — les valeurs des arguments reposent-elles sur quelque chose que l'utilisateur a réellement dit, et l'appel est-il prématuré ? Quelques lignes de code transforment ces réponses en autorisation, refus, confirmation humaine ou renvoi du tour au modèle avec un retour. Le schéma plus large est une répartition hybride : les jugements les plus difficiles restent au grand modèle, les nombreux jugements répétitifs et bien cadrés vont au modèle de décision, avec des gains conjoints en coût et en latence.
Pour les équipes qui construisent des agents, le signal est celui d'une division du travail qui s'affine : tous les jugements ne méritent pas un modèle de pointe. La limite est tout aussi nette : les options doivent être définies par une personne ou un système amont, Decider ne fait que choisir. Si les options elles-mêmes sont fausses, choisir juste ne sert à rien. Il s'installe avec pip install strands-decider, ses poids sont sur Hugging Face, et les données comme les scripts d'entraînement sont publics : un point de départ complet pour qui veut entraîner son propre petit modèle de décision.