ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Xiaomi dévoile HySparse2, l'architecture cœur de MiMo-V3 : calcul Prefill réduit à 1/5, pensée pour les agents multi-tours longue distance

Xiaomi dévoile HySparse2, l'architecture cœur de MiMo-V3 : calcul Prefill réduit à 1/5, pensée pour les agents multi-tours longue distance

Informations sur l’IA Admin 3 vues

Le 24 septembre 2026, l'équipe MiMo de Xiaomi a dévoilé HySparse2, l'architecture cœur du futur MiMo-V3. Il s'agit d'une évolution du HySparse précédemment publié, conçue pour les tâches d'agents multi-tours de longue haleine, avec trois objectifs : moins de calcul Prefill, un KV Cache plus petit et une recherche plus précise dans les longs contextes.

Ce que fait HySparse2

HySparse2 divise le modèle en deux moitiés : la première est un Self-Decoder combinant Full Attention et Sliding Window Attention (SWA) ; la seconde est un Cross-Decoder combinant Full Attention et Sparse Attention. S'y ajoutent deux niveaux de partage des KV.

Le premier niveau, KV Bridging, enjambe les deux moitiés : chaque couche Full Attention de la seconde moitié génère son propre KV Cache directement à partir des états cachés d'entrée de la couche Full Attention correspondante de la première moitié, tout en conservant ses propres projections K/V. Les KV de la seconde moitié n'ont plus à attendre que l'entrée traverse toutes les couches.

Le second niveau, KV Reuse, opère à l'intérieur de chaque Hybrid Block : une couche Full Attention suivie de plusieurs couches Sparse Attention forme un bloc ; la couche Full Attention sélectionne les positions importantes d'après les scores d'attention pendant son calcul, et les couches éparses suivantes réutilisent directement son KV Cache et ses indices de sélection — sans sélecteur entraîné séparément.

Autre changement clé, la granularité de la sélection passe du « sélectionner un bloc » au « sélectionner un token ». Le HySparse de première génération utilisait une sélection par blocs, qui embarquait souvent tout un bloc environnant pour atteindre un seul token important ; HySparse2 passe à la sélection au niveau du token pour allouer le même budget d'attention avec plus de précision. La fenêtre locale est conservée : les 128 tokens les plus récents sont toujours sélectionnés, plus 1 024 tokens globaux hors fenêtre, les deux lisant le KV Cache partagé fourni par les couches Full Attention. La branche SWA indépendante est supprimée, avec ses paramètres de projection et son surcoût de KV Cache.

Le Prefill s'arrête à mi-chemin

Grâce au partage des KV à deux niveaux et à la fenêtre locale fusionnée, tout le KV Cache requis par la seconde moitié peut être construit à partir des états cachés de la première. Dans le modèle à 49 couches, le Prefill n'a plus qu'à exécuter les 25 premières couches du Self-Decoder plus les projections KV de pont — dont une seule couche Full Attention. Dans un déploiement Prefill–Decode désagrégé, les nœuds Prefill n'ont qu'à héberger cette portion de Self-Decoder, ce qui divise presque par deux le stockage des poids. La phase de génération utilise toujours le réseau complet et conserve les capacités de recherche globale et de modélisation de la seconde moitié.

Les chiffres mesurés

Sur un modèle MoE 80B-A3B, avec les mêmes données et le même protocole d'entraînement, l'équipe a comparé Hybrid SWA, HySparse et HySparse2 (HySparse2 utilise en outre une configuration MQA plus compacte). À un million de tokens, face à Hybrid SWA, HySparse2 réduit le calcul Prefill à 1/5 et fait passer le KV Cache de 12 Go à 2,7 Go ; face au HySparse de première génération, le calcul Prefill tombe à 1/3 et le KV Cache de 6,7 Go à 2,7 Go.

Après le même post-entraînement léger, jusqu'à 256k de longueur évaluée, HySparse2 obtient des scores MRCR-v2 et RULER-v2 supérieurs à chaque longueur testée, avec des AgentPPL et LongPPL plus faibles. Par rapport au HySparse de première génération, les scores moyens progressent de 11,30 et 19,81 points de pourcentage sur MRCR-v2 et RULER-v2 respectivement. La conclusion officielle : un KV Cache plus petit et un Prefill plus court peuvent coexister avec une meilleure recherche en contexte long.

Pourquoi les agents en ont besoin

Sur une tâche longue, chaque appel d'outil d'un agent peut ramener une page web entière, un document ou un long journal d'exécution. L'historique ne cesse de croître, le KV Cache de gonfler, et chaque Prefill sur les nouvelles entrées coûte plus cher. HySparse2 répond à trois questions à la fois : ingestion plus rapide, mémoire moins chère et recherche de preuves plus précise dans les longs historiques — les trois postes les plus coûteux des charges de travail d'agents multi-tours.

Notre lecture

D'abord, la continuité : du Hybrid SWA de la série MiMo-V2 au HySparse de première génération puis à HySparse2, l'équipe MiMo poursuit la même ligne — améliorer ensemble la capacité du modèle et l'efficacité du calcul. La version double multimodale de MiMo-V2.6 procédait de la même logique.

Ensuite, la complémentarité : le précédent MiMo-UltraSpeed accélérait le décodage par quantification bas-bit et décodage spéculatif, tandis que HySparse2 comprime les coûts de Prefill et de cache — les deux extrémités sont optimisées séparément.

Les réserves doivent être dites : il s'agit d'une annonce d'architecture, MiMo-V3 lui-même n'est pas encore sorti, et les chiffres ci-dessus sont des comparaisons internes de l'équipe, sans évaluation indépendante pour l'instant. La direction reste claire : le coût des agents de longue haleine est en train d'être réduit au niveau de l'architecture.

Outils Recommandés

Plus