1. Résumé
La série Xiaomi MiMo-V2.5 est officiellement open source, utilisant la licence MIT, et les poids ainsi que les cartes modèles sont publiés sur Hugging Face. La série comprend MiMo-V2.5 et MiMo-V2.5-Pro, tous deux destinés à des scénarios à 1M de jetons longs. MiMo-V2.5 est partiellement multimodal natif, couvrant la compréhension du texte, de l’image, de la vidéo et de l’audio. MiMo-V2.5-Pro est destiné aux agents complexes, à l’ingénierie de code et aux tâches à long terme, et il est officiellement reconnu comme ayant des performances exceptionnelles dans les évaluations de modèles open source telles que GDPVal-AA et ClawEval.
2. Caractéristiques principales
- Contexte long : Les deux modèles maîtres prennent en charge jusqu’à 1 million de jetons contextuels, ce qui convient aux documents longs, dépôts de code et appels d’outils multi-tours.
- Architecture MoE : MiMo-V2.5 compte 310B de paramètres totaux et 15B de paramètres d’activation ; Pro est de 1,02T de paramètres totaux, 42B de paramètres d’activation.
- Capacité multimodale : MiMo-V2.5 supporte la compréhension unifiée du texte, des images, de la vidéo et de l’audio.
- Agent et code : La version Pro améliore l’ingénierie logicielle complexe, les appels d’outils et l’exécution de tâches à longue distance.
- Optimisation par inférence : La carte modèle mentionne une attention mixte et la conception MTP pour réduire la pression du cache KV à long contexte et améliorer l’efficacité de la génération.
3. Installation
- Accéder à la collection Hugging Face et sélectionner les poids MiMo-V2.5 ou MiMo-V2.5-Pro.
- Installer SGLang ou vLLM selon la carte modèle, et activer les paramètres recommandés tels que la quantification trust_remote_code et FP8.
- Avant le déploiement en production, il est recommandé d’utiliser de petits lots de tâches pour vérifier la stabilité de la mémoire, le débit, la longueur du contexte et l’appel de l’outil.
4. Cas d’usage typiques
- Analyse des dépôts de code : Comprendre la structure des grands projets, générer des correctifs et effectuer des revues de code.
- Flux de travail de l’agent : combinez les appels d’outils pour compléter la récupération, la planification, l’exécution et le résumé en plusieurs étapes.
- Questions-réponses multimodales : Traiter des entrées mixtes d’images, de vidéos, d’audio et de texte.
- Base de connaissances d’entreprise : lire les contrats, documents, journaux et données techniques dans un contexte long.
- Poursuivre la formation : Basée sur le protocole MIT pour l’ajustement fin des données industrielles ou l’amélioration interne des capacités.
5. Écologie et produits concurrents
- Écologie : Fournit officiellement des poids de face d’étreinte, des blogs, une plateforme API, un AI Studio, et fournit des exemples de déploiement SGLang et vLLM dans la carte modèle.
- Produits concurrents : Comparé aux modèles open source tels que DeepSeek, Kimi, Qwen et GLM, le point de divergence de MiMo-V2.5 se situe dans le contexte de 1M de long, multimodalité native et combinaison de tâches d’agents complexes. L’effet spécifique devrait toujours être soumis à un retest des données métier.
6. Limitations et précautions
- L’échelle du modèle est grande, et le déploiement en contexte long nécessite des exigences élevées pour les GPU, la mémoire vidéo, le réseau et les cadres d’inférence.
- Le contexte 1M ne signifie pas que toutes les longues tâches peuvent être accomplies de manière stable, et doivent encore être bloquées, récupérées et évaluées.
- La compréhension multimodale peut être affectée par la qualité de l’entrée, le langage, le bruit et la scène.
- Le protocole MIT est relativement souple, mais les sources de données, les exigences de conformité et les dépendances tierces doivent tout de même être examinées avant une utilisation commerciale.
7. Adresse du projet
https://huggingface.co/collections/XiaomiMiMo/mimo-v25
8. Questions fréquemment posées
Q : Le Xiaomi MiMo-V2.5 supporte-t-il le déploiement commercial ?
R : La page modèle est marquée d’une licence MIT, qui peut généralement être utilisée pour le déploiement commercial, la formation continue et l’ajustement, mais les entreprises doivent tout de même effectuer leur propre examen de conformité.
Q : Quelle est la différence entre le MiMo-V2.5 et le MiMo-V2.5-Pro ?
R : MiMo-V2.5 est plus une compréhension multimodale native, tandis que Pro est plus complexe pour des agents, de l’ingénierie de code et des appels d’outils à longue portée.
Q : MiMo-V2.5 est-il adapté au déploiement sur site ?
R : Il peut être déployé, mais le volume de modèles est important, il est donc recommandé de se référer d’abord à la configuration SGLang ou vLLM dans la carte officielle du modèle.
Q : Pour quelles tâches le contexte 2,5M du MiMo-V1 convient-il ?
R : Il convient à des scénarios tels que de longues questions-réponses sur de documents, une analyse de base de code importante, de longues vidéos ou la compréhension de la trajectoire d’agents en plusieurs tours.