ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
MiMo-V2.6 entre dans l’Agent Arena : Pro 5e open source, 2e en Confirmed Success

MiMo-V2.6 entre dans l’Agent Arena : Pro 5e open source, 2e en Confirmed Success

Informations sur l’IA • Admin • • 6 vues

Le 1er octobre 2026, Arena a officiellement annoncé l'arrivée de MiMo-V2.6-Pro et MiMo-V2.6-Flash de Xiaomi sur le classement Agent Arena. C'est le premier test à grande échelle en sessions d'agents réelles pour la série MiMo-V2.6 depuis sa sortie le 21 septembre et sa publication en open source sous licence MIT.

Commençons par le bulletin de Pro : sur plus de 8 100 sessions d'agents réelles, Pro affiche une amélioration nette de +3,17 %, soit la 5e place parmi les modèles open source. La comparaison est éloquente — la génération précédente, MiMo-V2.5-Pro, occupe la 13e place du même classement avec une amélioration nette de −7,23 %. En une génération : 9 places gagnées, 10,4 points de progression. Plus remarquable encore, le signal Confirmed Success : Pro y atteint +7,35 %, 2e des modèles open source. Flash joue la carte du rapport qualité-prix : 9e des modèles open source avec une amélioration nette de −0,57 %, mais un coût médian par tâche de 0,04 dollar seulement — 56 % moins cher que Pro — ce qui le place aussi sur la frontière coût-performance d'Arena.

Confirmed Success mérite sa propre explication. Agent Arena n'évalue pas au QCM : les modèles travaillent sur de vraies tâches, et Confirmed Success mesure le signal qualité des tâches confirmées comme accomplies — plus strict qu'un simple « ça a tourné ». Que Pro se classe 2e des modèles open source sur ce signal signifie qu'il ne se contente pas d'accumuler du volume de sessions : il est réellement plus fiable sur les tâches exigeant des décisions en plusieurs étapes. Nous avions déjà couvert la publication en open source de MiMo-V2.6, lorsqu'il avait pris la tête des classements open source avec 46 points ; ce résultat Agent Arena complète le puzzle avec la pièce « exécution de tâches réelles ».

Une mise en garde sur les limites des classements s'impose : les scores d'Arena proviennent de votes sur des sessions d'utilisateurs réels et varient avec la taille de l'échantillon et la distribution des tâches — +3,17 % est une amélioration nette relative à une base de référence, pas un taux de victoire absolu. Le lire comme la preuve que « chaque génération est plus forte » tient la route ; le lire comme « déjà imbattable » va trop loin.

Pour le paysage des modèles open source, le signal est clair : la compétition dans les scénarios d'agents est passée des « paramètres et scores de classements » à la « livraison fiable sur des tâches réelles ». MiMo-V2.6-Pro a fait basculer son amélioration nette du négatif au positif en une génération et hissé Confirmed Success dans le top 2 open source — signe que l'approche d'apprentissage par renforcement à grande échelle de Xiaomi porte ses fruits dans les flux agentiques. Pour les utilisateurs, le choix se clarifie aussi : Pro pour le plafond, Flash pour le budget — les paliers de performance et de prix sont désormais nettement séparés au sein d'une même série.

Outils Recommandés

Plus