ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Microsoft-Decision-1 arrive : pas de longs textes, juste des notes pour chaque option

Microsoft-Decision-1 arrive : pas de longs textes, juste des notes pour chaque option

Informations sur l’IA • Admin • • 31 vues

Microsoft-Decision-1 a été présenté par Microsoft sur son blog officiel le 9 octobre 2026, est disponible dès maintenant dans Microsoft Foundry et arrivera bientôt sur OpenRouter. Il ne rédige pas de longs textes et ne raisonne pas librement. Son seul travail : attribuer à chaque option d'un ensemble fixe une probabilité calibrée, afin que le logiciel puisse agir immédiatement à partir de ce score.

Un rôle différent de celui d'un modèle généraliste

Microsoft-Decision-1 est issu d'un post-entraînement de Qwen3.5-9B pour une notation de décision rapide en un seul passage, et Microsoft prévoit de le réadosser ensuite à ses modèles MAI et à ceux d'OpenAI. Il gère le oui/non, les choix multiples et les échelles de notation, et peut aussi noter des réponses d'IA et des actions d'agents selon une grille de critères, le tout via une API structurée simple. Pourquoi un modèle dédié au seul jugement ? La raison avancée est pratique : chaque décision ajoute de la latence, et 100 millisecondes de plus sur 20 décisions enchaînées ajoutent deux secondes au processus. Demander à un grand modèle généraliste de réfléchir longuement à chaque jugement devient trop lent et trop coûteux à grande échelle.

Deux chiffres à regarder d'abord : la latence et la stabilité

Sur 36 bancs d'essai et près de 150 000 questions tenues à l'écart de l'entraînement — routage, classement, contexte long, multilingue, sécurité —, Microsoft-Decision-1 a obtenu la meilleure précision selon les mesures de Microsoft. Sa latence P50 est environ 35 fois inférieure à celle de GPT-6 Sol et 4,5 fois inférieure à celle du deuxième, Quyet-1.0-Large. La stabilité a fait l'objet d'un test séparé : la même requête a été perturbée de huit façons (reformulation, réordonnancement, changement de clés, bruit de formatage) et la décision n'a basculé que dans 1,3 % des cas en moyenne, avec zéro bascule quand la description des options était reformulée ou leur ordre inversé. La probabilité fait partie de la sortie de l'API : une prédiction à 90 % doit se vérifier environ neuf fois sur dix sur des cas représentatifs, pour que l'application puisse décider d'exécuter, de différer ou de demander une relecture humaine. Côté sécurité, 5 250 requêtes réparties sur 11 bancs d'essai (contenus nuisibles, contournements, injection de prompt) ont été testées, avec un refus des comportements nuisibles tout en conservant une bonne utilité, selon Microsoft.

Où Microsoft l'utilise déjà en interne

L'équipe de recherche Xbox s'en est servie pour classer plus de 10 000 retours de joueurs dans des thèmes fixes, avec une qualité équivalente à GPT-6 Sol, une vitesse plus de 14 fois supérieure et un coût d'environ un deux-centième. L'équipe Copilot l'utilise pour évaluer les réponses de chat et d'agents, avec une qualité annoncée comme comparable à GPT-5.6 Luna pour une vitesse 100 fois supérieure. Les ingénieurs d'astreinte l'emploient pour la recherche de connaissances en cas d'incident, et Microsoft Discovery s'en sert pour noter des plans d'expérience et piloter une replanification adaptative, avec des notes 46 fois plus cohérentes qu'une notation par grand modèle et une boucle près de quatre fois plus rapide. Microsoft n'est pas seul sur cette voie : OpenAI a déjà transformé ce type de jugement en interface, comme nous l'avons raconté dans notre article sur la bêta publique de la Decisions API. La différence, c'est que Microsoft fait du jugement un modèle à part entière plutôt qu'un mode d'un grand modèle.

Le tarif est de 0,042 dollar par million de jetons en entrée, la sortie étant gratuite. Le modèle convient aux décisions dont les options sont déjà définies : routage de modèles, classification, priorisation, validation, contrôle de flux et vérification de la prochaine action d'un agent. Il ne convient pas aux questions ouvertes, où il n'y a rien à noter. Les équipes qui traitent de gros volumes de jugements structurés gagneront à vérifier deux points sur leurs propres données avant de l'adopter : si la décision résiste à une reformulation, et si les probabilités affichées correspondent à la précision réelle. Le classement dans les bancs d'essai vient ensuite.

Outils Recommandés

Plus