ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Xiaomi、MiMo-V3 のコアアーキテクチャ HySparse2 を公開:Prefill 計算を 1/5 に、長程マルチターン Agent 向けに

Xiaomi、MiMo-V3 のコアアーキテクチャ HySparse2 を公開:Prefill 計算を 1/5 に、長程マルチターン Agent 向けに

AI情報 Admin 3 回閲覧

2026年9月24日、Xiaomi の MiMo チームは、次世代モデル MiMo-V3 のコアアーキテクチャ「HySparse2」を公開しました。既に公開されていた初代 HySparse のアップグレード版で、長程・マルチターンのエージェントタスク向けに設計されています。狙いは3つです。Prefill 計算の削減、KV Cache の縮小、そして長文脈検索の精度向上です。

HySparse2 がやったこと

HySparse2 はモデルを前後2つに分けます。前半は Full Attention と Sliding Window Attention(SWA)を混ぜた Self-Decoder、後半は Full Attention と Sparse Attention を混ぜた Cross-Decoderです。その上で2段階の KV 共有を導入しました。

1段階目の KV Bridging は前後をまたぎます。後半の各 Full Attention 層は、前半の対応する Full Attention 層の入力隠れ状態から、自分の KV Cache を直接作ります。各ターゲット層は独立した K/V 投影を持つため、同じソース隠れ状態から異なる KV を構築できます。後半の KV は、入力が全層を通過するのを待つ必要がなくなります。

2段階目の KV Reuse は各 Hybrid Block の内部で起きます。1層の Full Attention と、それに続く複数層の Sparse Attention で1ブロックを構成します。Full Attention 層は計算と同時にアテンションスコアから重要な位置を選び、後続のスパース層はその KV Cache と選択インデックスをそのまま再利用します。独立したセレクタを別途学習する必要はありません。

もう1つの重要な変更は、選択の粒度が「ブロックを選ぶ」から「トークンを選ぶ」に変わったことです。初代 HySparse はブロック単位の選択で、1つの重要トークンを拾うために周囲のブロック全体を計算に含めがちでした。HySparse2 はトークン単位の選択に変え、同じアテンション予算をより精密に配分します。ローカルウィンドウは維持されます。直近128トークンは必ず選び、ウィンドウ外から1,024のグローバルトークンを選びます。どちらも Full Attention 層が提供する共有 KV Cache を読みます。独立した SWA ブランチは廃止され、その投影パラメータと KV Cache のコストも消えました。

Prefill は半分で終わる

2段階の KV 共有とローカルウィンドウの統合により、後半に必要な KV Cache はすべて前半の隠れ状態から構築できます。49層のモデルでは、Prefill は最初の25層の Self-Decoder とブリッジ KV 投影だけを実行すればよく、その中の Full Attention は1層だけです。Prefill と Decode を分離してデプロイする場合、Prefill ノードはこの Self-Decoder 部分だけを持てばよく、モデルの重みストレージはほぼ半減します。生成フェーズでは引き続き完全なネットワークを使い、後半のグローバル検索とモデリング能力を保ちます。

実測の数字

80B-A3B の MoE モデルで、同じデータと同じ学習レシピを使い、Hybrid SWA、HySparse、HySparse2 を比較しました(HySparse2 はよりコンパクトな MQA 構成も使用)。100万トークンでは、Hybrid SWA に対して HySparse2 の Prefill 計算量は 1/5 に、KV Cache は 12GB から 2.7GB に減少。初代 HySparse に対しては Prefill 計算量が 1/3 に、KV Cache が 6.7GB から 2.7GB になりました。

同じ軽量な事後学習の後、最大 256k の評価範囲で、HySparse2 はテストしたすべての長さで MRCR-v2 と RULER-v2 が向上し、AgentPPL と LongPPL は低下しました。初代 HySparse と比べ、MRCR-v2 と RULER-v2 の各長さの平均スコアはそれぞれ 11.30 ポイント、19.81 ポイント向上しています。公式の結論はこうです。より小さな KV Cache とより短い Prefill は、より良い長文脈検索と両立できる、と。

なぜエージェントに必要なのか

エージェントが長いタスクをこなすとき、1回のツール呼び出しで1ページ分の Web ページ、1つのファイル、長い実行ログが返ってくることがあります。履歴は増え続け、KV Cache は膨らみ、新しい入力を読むたびの Prefill は高くつきます。HySparse2 は3つの問いに同時に答えます。読み込みを速く、メモリを安く、長い履歴からの証拠探しを正確に。マルチターンエージェントで最もコストがかかる3点です。

どう見るか

まず継続性です。MiMo-V2 シリーズの Hybrid SWA から初代 HySparse、そして HySparse2 へ。MiMo チームは「モデルの能力と計算効率をともに高める」という路線を進め続けています。全モーダル2バージョンの MiMo-V2.6も同じ発想の産物です。

次に役割分担です。以前の MiMo-UltraSpeed は低ビット量子化や投機的デコーディングで Decode を高速化し、HySparse2 は Prefill とキャッシュのコストを圧縮します。両端を別々に最適化する形です。

留保も明記します。今回公開されたのはアーキテクチャで、MiMo-V3 本体はまだリリースされていません。上の数字はチーム内の内部比較であり、第三者による独立評価はまだありません。それでも方向は明確です。長程エージェントのコストは、アーキテクチャの面から引き下げられつつあります。

おすすめツール

もっと見る