ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Xiaomi stellt HySparse2 vor, die Kernarchitektur von MiMo-V3: Prefill-Aufwand auf 1/5 gesenkt, für lang laufende Multi-Turn-Agenten

Xiaomi stellt HySparse2 vor, die Kernarchitektur von MiMo-V3: Prefill-Aufwand auf 1/5 gesenkt, für lang laufende Multi-Turn-Agenten

KI-Informationen Admin 10 Aufrufe

Am 24. September 2026 hat das MiMo-Team von Xiaomi HySparse2 vorgestellt, die Kernarchitektur des kommenden MiMo-V3. Es ist die Weiterentwicklung des zuvor veröffentlichten HySparse, ausgelegt für lang laufende Multi-Turn-Agentenaufgaben, mit drei Zielen: weniger Prefill-Rechenaufwand, kleinerer KV Cache und präziseres Retrieval aus langen Kontexten.

Was HySparse2 tut

HySparse2 teilt das Modell in zwei Hälften: Die erste Hälfte ist ein Self-Decoder aus Full Attention und Sliding Window Attention (SWA), die zweite Hälfte ein Cross-Decoder aus Full Attention und Sparse Attention. Darauf aufbauend führt die Architektur zwei Ebenen von KV-Sharing ein.

Die erste Ebene, KV Bridging, überspannt beide Hälften: Jede Full-Attention-Schicht der zweiten Hälfte erzeugt ihren eigenen KV Cache direkt aus den Eingangs-Hidden-States der entsprechenden Full-Attention-Schicht der ersten Hälfte – mit eigenen K/V-Projektionen. Die KV der zweiten Hälfte müssen nicht mehr warten, bis die Eingabe alle Schichten durchlaufen hat.

Die zweite Ebene, KV Reuse, wirkt innerhalb jedes Hybrid Blocks: Eine Full-Attention-Schicht gefolgt von mehreren Sparse-Attention-Schichten bildet einen Block; die Full-Attention-Schicht wählt während der Berechnung anhand der Attention-Scores wichtige Positionen aus, und die folgenden Sparse-Schichten übernehmen ihren KV Cache und die Auswahlindizes direkt – ohne separat trainierten Selektor.

Eine weitere Schlüsseländerung ist die Granularität der Auswahl: weg vom „Block wählen“, hin zum „Token wählen“. HySparse der ersten Generation arbeitete mit Auswahl auf Blockebene und zog oft einen ganzen umgebenden Block in die Berechnung, um ein einzelnes wichtiges Token zu treffen; HySparse2 wechselt zur Auswahl auf Token-Ebene, sodass dasselbe Attention-Budget präziser verteilt werden kann. Das lokale Fenster bleibt erhalten: Die jüngsten 128 Token werden immer ausgewählt, dazu 1.024 globale Token von außerhalb des Fensters – beide lesen den gemeinsamen KV Cache der Full-Attention-Schichten. Der eigenständige SWA-Zweig entfällt samt seiner Projektionsparameter und seines KV-Cache-Overheads.

Prefill endet nach der Hälfte

Dank zweistufigem KV-Sharing und zusammengeführtem lokalem Fenster lässt sich der gesamte für die zweite Hälfte benötigte KV Cache aus den Hidden States der ersten Hälfte aufbauen. Im 49-schichtigen Modell muss Prefill nur die ersten 25 Self-Decoder-Schichten plus die Bridging-KV-Projektionen ausführen – darunter nur eine einzige Full-Attention-Schicht. Bei getrenntem Prefill–Decode-Betrieb müssen die Prefill-Knoten nur diesen Self-Decoder-Anteil hosten, was den Modellspeicher fast halbiert. Die Generierungsphase nutzt weiterhin das vollständige Netz und behält so das globale Retrieval und die Modellierungsstärke der zweiten Hälfte.

Die gemessenen Zahlen

Auf einem 80B-A3B-MoE-Modell verglich das Team bei identischen Daten und Trainingsrezepten Hybrid SWA, HySparse und HySparse2 (HySparse2 nutzt zusätzlich eine kompaktere MQA-Konfiguration). Bei einer Million Token senkt HySparse2 gegenüber Hybrid SWA den Prefill-Rechenaufwand auf 1/5 und schrumpft den KV Cache von 12 GB auf 2,7 GB; gegenüber HySparse der ersten Generation fällt Prefill auf 1/3 und der KV Cache von 6,7 GB auf 2,7 GB.

Nach demselben leichten Post-Training erzielte HySparse2 bis zur maximalen Testlänge von 256k auf allen gemessenen Längen höhere MRCR-v2- und RULER-v2-Werte sowie niedrigere AgentPPL und LongPPL. Gegenüber HySparse der ersten Generation stiegen die Durchschnittswerte um 11,30 bzw. 19,81 Prozentpunkte bei MRCR-v2 und RULER-v2. Die offizielle Schlussfolgerung: Kleinerer KV Cache und kürzerer Prefill lassen sich mit besserem Langkontext-Retrieval vereinbaren.

Warum Agenten das brauchen

Bei einer langen Aufgabe kann jeder Tool-Aufruf eines Agenten eine ganze Webseite, ein Dokument oder ein langes Ausführungsprotokoll zurückbringen. Die Historie wächst, der KV Cache schwillt an, und jeder Prefill über neue Eingaben wird teurer. HySparse2 beantwortet drei Fragen auf einmal: schnelleres Einlesen, sparsamerer Speicher und präziseres Finden von Belegen in langen Historien – die drei teuersten Posten bei Multi-Turn-Agenten.

Unsere Einordnung

Erstens Kontinuität: Vom Hybrid SWA der MiMo-V2-Serie über HySparse der ersten Generation bis zu HySparse2 verfolgt das MiMo-Team weiter dieselbe Linie – Modellfähigkeit und Recheneffizienz gemeinsam zu steigern. Auch das vollmodale MiMo-V2.6 in zwei Versionen folgte diesem Denken.

Zweitens Arbeitsteilung: Das frühere MiMo-UltraSpeed beschleunigte Decode per Low-Bit-Quantisierung und Speculative Decoding, während HySparse2 Prefill- und Cache-Kosten drückt – beide Enden werden getrennt optimiert.

Auch die Grenzen gehören dazu: Veröffentlicht wurde die Architektur, MiMo-V3 selbst ist noch nicht erschienen; die Zahlen oben sind interne Vergleiche des Teams, unabhängige Dritt-Evaluierungen gibt es noch nicht. Die Richtung ist dennoch klar – die Kosten lang laufender Agenten werden auf Architekturebene gesenkt.

Empfohlene Tools

Mehr