ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
MiMo-V2.6 landet in der Agent Arena: Pro auf Open-Source-Rang 5, Rang 2 bei Confirmed Success

MiMo-V2.6 landet in der Agent Arena: Pro auf Open-Source-Rang 5, Rang 2 bei Confirmed Success

KI-Informationen • Admin • • 6 Aufrufe

Am 1. Oktober 2026 hat Arena offiziell bekannt gegeben, dass Xiaomis MiMo-V2.6-Pro und MiMo-V2.6-Flash auf dem Agent-Arena-Leaderboard gelandet sind. Es ist der erste groß angelegte Test in echten Agent-Sitzungen für die MiMo-V2.6-Serie seit dem Release am 21. September und der anschließenden Open-Source-Veröffentlichung unter MIT-Lizenz.

Zuerst Pros Zeugnis: In über 8.100 echten Agent-Sitzungen erzielte Pro eine Nettoverbesserung von +3,17 % und Rang 5 unter den Open-Source-Modellen. Der Vergleich spricht für sich — die Vorgängergeneration MiMo-V2.5-Pro liegt auf demselben Board auf Rang 13 bei einer Nettoverbesserung von −7,23 %. In einer Generation: 9 Plätze nach oben, 10,4 Prozentpunkte Zuwachs. Noch beachtenswerter ist das Confirmed-Success-Signal: Pro erreichte dort +7,35 % — Rang 2 unter den Open-Source-Modellen. Flash fährt die Preis-Leistungs-Schiene: Rang 9 unter den Open-Source-Modellen bei −0,57 % Nettoverbesserung, aber medianen Task-Kosten von nur 0,04 US-Dollar — 56 % günstiger als Pro — und landet ebenfalls auf Arenas Preis-Leistungs-Frontier.

Confirmed Success verdient eine eigene Erklärung. Agent Arena prüft nicht per Multiple Choice; Modelle arbeiten an echten Aufgaben, und Confirmed Success misst das Qualitätssignal bestätigt abgeschlossener Aufgaben — strenger als bloßes „es lief durch". Dass Pro bei diesem Signal Rang 2 unter den Open-Source-Modellen belegt, heißt: Es farmt nicht nur Sitzungsvolumen, sondern ist bei Aufgaben mit mehrstufigen Entscheidungen tatsächlich verlässlicher. Wir haben bereits über die Open-Source-Veröffentlichung von MiMo-V2.6 berichtet, als das Modell mit 46 Punkten die Open-Source-Charts anführte; dieses Agent-Arena-Ergebnis fügt das Puzzleteil „echte Aufgabenausführung" hinzu.

Ein Hinweis zu den Grenzen von Leaderboards: Arena-Scores stammen aus Votes über echte Nutzersitzungen und schwanken mit Stichprobengröße und Aufgabenverteilung — +3,17 % ist die Nettoverbesserung gegenüber einer Baseline, keine absolute Siegquote. Als Beleg für „jede Generation wird stärker" trägt das; als Beleg für „bereits unschlagbar" trägt es zu weit.

Für die Open-Source-Landschaft ist das Signal klar: Der Wettbewerb in Agent-Szenarien hat sich von „Parametern und Leaderboard-Punkten" zu „verlässlicher Auslieferung bei echten Aufgaben" verlagert. MiMo-V2.6-Pro hat die Nettoverbesserung in einer Generation von negativ auf positiv gedreht und Confirmed Success in die Open-Source-Top-2 gebracht — ein Zeichen, dass Xiaomis skalierter Reinforcement-Learning-Ansatz in Agent-Workflows Früchte trägt. Für Anwender wird auch die Wahl klarer: Pro für die Obergrenze, Flash fürs Budget — Leistungs- und Preisstufen sind innerhalb derselben Serie nun sauber getrennt.

Empfohlene Tools

Mehr