Le 22 septembre 2026, Xiaomi a simultanément annoncé la série MiMo-V2.6 via son compte officiel MiMo X et son compte public WeChat, incluant deux versions : MiMo-V2.6-Pro et MiMo-V2.6-Flash. L’aspect le plus remarquable de cette mise à jour n’est pas le nombre de paramètres, mais la façon dont Xiaomi a transformé les capacités multimodales, passant de la « compréhension des images » à la base des tâches d’Agent — le codage, l’utilisation de l’ordinateur, le raisonnement 3D et la création sont tous listés dans une seule liste de fonctionnalités.
Pro et Flash : Une double sortie avec des divisions claires des tâches
Pro gère les plafonds de capacité, tandis que Flash gère les appels à haute fréquence. L’accent officiel est que les deux versions ont suivi un entraînement à grande échelle à l’apprentissage par renforcement et sont multimodales natives. Cette combinaison « un fort, un rapide » est familière : actuellement, la répartition commune du travail dans l’infrastructure des agents consiste à planifier de grands modèles et à l’exécution à l’aide de modèles petits et rapides, que Xiaomi a intégrés directement dans sa gamme officielle de produits. Pour les développeurs, la question de la sélection passe de « quel modèle utiliser » à « comment combiner » :P RO gère la planification et les tâches complexes nécessitant un raisonnement approfondi, tandis que Flash gère les appels d’outils à haute fréquence et les étapes d’exécution. Les deux partagent les mêmes capacités de compréhension multimodale, avec des définitions de contexte et d’outils réutilisables.
L’apprentissage par renforcement en modal complet plus apprentissage par renforcement à grande échelle est la déclaration directionnelle de Xiaomi
MiMo-V2.6 est défini comme un modèle natif entièrement modal, ce qui signifie qu’au-delà du texte et des images, des capacités de compréhension spatiale comme le raisonnement 3D sont également intégrées dans le même système d’entraînement. L’accent officiel sur « l’apprentissage par renforcement à grande échelle » est au cœur, indiquant que cette génération ne se concentre pas sur la concurrence à l’échelle des paramètres, mais sur l’alignement des capacités multimodales avec des tâches réelles, en particulier dans les scénarios Agent nécessitant des opérations en plusieurs étapes et des appels d’outils. Pour les chercheurs en modèles, MiMo-V2.6 est un autre exemple de l’approche « apprentissage par renforcement à l’échelle » : à mesure que la capacité multimodale s’améliore du pré-entraînement au post-entraînement, l’objectif de l’évaluation doit passer des benchmarks à point unique aux véritables taux d’achèvement de longues tâches. Les poids des modèles ont été publiés simultanément par les canaux officiels, et la performance des tâches promues peut être testée et vérifiée.
Qui devrait revenir ?
Les équipes travaillant sur des applications agents peuvent se concentrer directement sur l’utilisation de l’ordinateur et les capacités de codage et effectuer une comparaison pratique avec la version Flash ; Les développeurs intéressés par l’écosystème open source peuvent vérifier les performances réelles après l’ouverture du poids ; Les équipes qui sélectionnent encore des fondations multimodales peuvent considérer la division Pro/Flash comme un cadre de sélection prêt à l’emploi pour référence. Pour comprendre l’historique des versions précédentes de la série MiMo, vous pouvez consulter le sujet spécial Xiaomi MiMo.