ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Xiaomi veröffentlichte MiMo-V2.6: duale Versionen der vollständigen Modalität, wobei die Agent-Ausführungsschicht in das Modell integriert wurde

Xiaomi veröffentlichte MiMo-V2.6: duale Versionen der vollständigen Modalität, wobei die Agent-Ausführungsschicht in das Modell integriert wurde

KI-Informationen Admin 5 Aufrufe

Am 22. September 2026 kündigte Xiaomi gleichzeitig die MiMo-V2.6-Serie über sein offizielles MiMo X-Konto und das öffentliche WeChat-Konto an, darunter zwei Versionen: MiMo-V2.6-Pro und MiMo-V2.6-Flash. Der bemerkenswerteste Aspekt dieses Updates sind nicht die Parameterzahlen, sondern wie Xiaomi multimodale Fähigkeiten von "Bilderverständnis" zur Grundlage für Agentenaufgaben gemacht hat – Programmierung, Computernutzung, 3D-Denken und Erstellung sind alle in einer Fähigkeitsliste aufgeführt.

Pro und Flash: Eine Doppelversion mit klarer Arbeitsteilung

Pro kümmert sich um Capability-Ceilings, während Flash Hochfrequenzanrufe übernimmt. Der offizielle Schwerpunkt liegt darauf, dass beide Versionen groß angelegtes Reinforcement-Learning-Training durchlaufen haben und multimodal native sind. Diese Kombination "eine starke, eine schnelle" ist vertraut: Derzeit ist die übliche Arbeitsteilung in der Agenteninfrastruktur die Planung großer Modelle und die Ausführung mit kleinen, schnellen Modellen, die Xiaomi direkt in seine offizielle Produktlinie integriert hat. Für Entwickler verlagert sich die Auswahlfrage von "welches Modell zu verwenden" zu "Wie man kombiniert":P RO übernimmt Planung und komplexe Aufgaben, die tiefgehendes Denken erfordern, während Flash hochfrequente Werkzeugaufrufe und Ausführungsschritte übernimmt. Beide teilen die gleichen multimodalen Verständnisfähigkeiten, wobei Kontext und Werkzeugdefinitionen wiederverwendbar sind.

Full-modal plus groß angelegtes Reinforcement Learning ist Xiaomis Richtungsaussage

MiMo-V2.6 ist als ein natives vollmodales Modell definiert, was bedeutet, dass neben Text und Bildern auch räumliche Verständnisfähigkeiten wie 3D-Schlussfolgerung in dasselbe Trainingssystem integriert sind. Der offizielle Fokus auf "skaliertes Verstärkungslernen" steht im Mittelpunkt, was darauf hinweist, dass der Fokus dieser Generation nicht auf Parameterskala liegt, sondern darauf, multimodale Fähigkeiten mit realen Aufgaben in Einklang zu bringen, insbesondere in Agentenszenarien, die mehrstufige Operationen und Werkzeugaufrufe erfordern. Für Modellforscher ist MiMo-V2.6 ein weiteres Beispiel für den Ansatz des "Skalierens von Verstärkungslernen": Da sich die multimodale Fähigkeit vom Vortraining zum Nachtraining verbessert, sollte sich der Fokus der Bewertung von Einzelpunkt-Benchmarks hin zu tatsächlichen Abschlussraten langer Aufgaben verlagern. Modellgewichte wurden gleichzeitig über offizielle Kanäle veröffentlicht, und ob die Leistung der geförderten Aufgabe geliefert wird, kann getestet und überprüft werden.

Wer sollte nachhaken?

Teams, die an Agentenanwendungen arbeiten, können sich direkt auf Computernutzung und Programmiermöglichkeiten konzentrieren und einen praktischen Vergleich mit der Flash-Version durchführen; Entwickler, die sich für das Open-Source-Ökosystem interessieren, können die tatsächliche Leistung nach dem Gewichtsöffnungsprozess überprüfen; Teams, die noch multimodale Grundlagen auswählen, können die Pro/Flash-Division als fertiges Auswahlmodell als Referenz betrachten. Um die bisherige Versionshistorie der MiMo-Serie zu verstehen, können Sie das Xiaomi MiMo-Spezialthema lesen.

Empfohlene Tools

Mehr