1. 要旨
Xiaomi MiMo-V2.5シリーズは公式にオープンソース化されており、MITライセンスを使用しており、重量とモデルカードはHugging Faceに公開されています。 このシリーズにはMiMo-V2.5とMiMo-V2.5-Proが含まれており、どちらも100万トークンの長いコンテキストシナリオを対象としています。 MiMo-V2.5は部分的にネイティブなマルチモーダルであり、テキスト、画像、ビデオ、音声の理解をカバーしています。 MiMo-V2.5-Proは複雑なエージェント、コードエンジニアリング、長距離タスクを対象としており、GDPVal-AAやClawEvalなどのオープンソースモデル評価で優れた性能を持つと公式に評価されています。
2. コア機能
- 長いコンテキスト:両マスターモデルとも最大100万トークンコンテキストをサポートしており、これは長い文書、コードリポジトリ、複数ラウンドのツール呼び出しに適しています。
- MoEアーキテクチャ:MiMo-V2.5は合計310Bのパラメータと15Bの活性化パラメータで構成されています。 Proは合計パラメータ1.02T、アクティベーションパラメータ42Bです。
- マルチモーダル機能:MiMo-V2.5はテキスト、画像、動画、音声の統一理解をサポートします。
- エージェントとコード:Proバージョンは複雑なソフトウェアエンジニアリング、ツール呼び出し、長距離タスク実行を強化します。
- 推論最適化:モデルカードは、長いコンテキストKVキャッシュの負荷を軽減し、生成効率を向上させるために混合注意とMTP設計を行っていると述べています。
3. 設置
- ハギングフェイスコレクションにアクセスし、MiMo-V2.5またはMiMo-V2.5-Proのウェイトを選択してください。
- モデルカードに応じてSGLangまたはvLLMをインストールし、trust_remote_codeやFP8クオンタイズなどの推奨パラメータを有効にします。
- 本番展開前に、メモリの安定性、スループット、コンテキスト長、ツール呼び出しの検証のために、タスクの小規模なバッチを使用することが推奨されます。
4. 典型的なユースケース
- コードリポジトリ分析:大規模プロジェクトの構造を理解し、パッチを作成し、コードレビューを行います。
- エージェントワークフロー:ツール呼び出しを組み合わせて、多段階の検索、計画、実行、要約を完成させます。
- マルチモーダルQ&A:画像、動画、音声、テキストの混合入力を処理する。
- エンタープライズナレッジベース:契約書、文書、ログ、技術データを長い文脈で読むこと。
- 継続訓練:MITプロトコルに基づく業界データの微調整や内部能力強化。
5. 生態系と競合製品
- Ecology:公式にHugging Faceの重み、ブログ、APIプラットフォーム、AI Studioを提供し、モデルカードにSGLangやvLLMのデプロイ例を提供します。
- 競合製品:DeepSeek、Kimi、Qwen、GLMなどのオープンソースモデルと比べて、MiMo-V2.5の違いは1Mの長さの文脈、ネイティブのマルチモーダリティ、複雑なエージェントタスクの組み合わせにあります。 具体的な効果は依然としてビジネスデータの再テスト対象となるべきです。
6. 制限事項と注意事項
- モデルのスケールが大きく、長期コンテキストでの展開にはGPU、ビデオメモリ、ネットワーク、推論フレームワークの要件が高いことが必要です。
- 100万のコンテキストは、すべての長期タスクを安定的に完了でき、ブロック、取得、評価が必要なことを意味しません。
- マルチモーダルの理解は入力品質、言語、ノイズ、シーンによって影響を受けることがあります。
- MITプロトコルは比較的緩いですが、データソース、コンプライアンス要件、第三者依存関係は商用利用前に確認されるべきです。
7. プロジェクトアドレス
https://huggingface.co/collections/XiaomiMiMo/mimo-v25
8. よくある質問
Q: Xiaomi MiMo-V2.5は商用展開に対応していますか?
A: モデルページにはMITライセンスが記載されており、通常は商用展開、継続的なトレーニング、微調整に利用できますが、企業側は独自のコンプライアンスレビューを行う必要があります。
Q: MiMo-V2.5とMiMo-V2.5-Proの違いは何ですか?
A: MiMo-V2.5はよりネイティブなマルチモーダル理解が特徴ですが、Proはより複雑なエージェント、コードエンジニアリング、長距離ツールコールに対応しています。
Q: MiMo-V2.5はオンプレミス展開に適していますか?
A: 展開は可能ですが、モデル容量が非常に大きいため、まず公式モデルカードのSGLangまたはvLLM構成を参照することをお勧めします。
Q: MiMo-V1の250万台のコンテキストはどのような作業に適していますか?
A: 長文のQ&A、大規模なコードベース分析、長い動画、または複数ラウンドのエージェントの軌道理解などのシナリオに適しています。