ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Mellum2.1公開:JetBrainsが強化学習で12Bオープンソースモデルをコーディングエージェントに鍛えた

Mellum2.1公開:JetBrainsが強化学習で12Bオープンソースモデルをコーディングエージェントに鍛えた

AI情報 • Admin • • 6 回閲覧

Mellum2.1は、JetBrainsが2026年10月8日に公開したオープンソースのコーディングモデルで、コーディングエージェントの中で働く実務担当という位置づけだ。コードベースを探索し、ファイルを編集し、自分の変更を検証できる。Hugging FaceでApache 2.0ライセンスのもと公開されている。この版で注目すべきはパラメータ数ではなく、JetBrainsが夏の間を強化学習に投じ、大規模モデルでは高くて遅いというデプロイの勘定を小さなモデルで解こうとした点にある。

アーキテクチャは不動、勝負は事後学習

Mellum2.1はMellum2のアーキテクチャをそのまま使う。120億パラメータの混合エキスパートモデルで、トークンごとに活性化するのは25億パラメータだ。公式ブログによれば、前版は速かったものの、リポジトリの中で求める水準の作業はできなかった。今回の変化はほぼすべて事後学習にある。強化学習は最後の短い段階から訓練の主体へと格上げされ、JetBrainsは数千の強化学習環境を自前で構築し、訓練全体で数百万回のサンドボックス実行を行った。訓練タスクには数学、競技プログラミング、科学、ツール利用、ソフトウェア工学が加わり、オープンデータは壊れたテスト、検証できない答え、易しすぎる・不可能な課題を訓練前に除去している。

スコアの読み方:強みは明るく、弱点も隠れていない

JetBrains公表の同一条件の評価では、Mellum2.1は掲載17ベンチマーク中15で前版を上回り、最も伸びたのはエージェント的コーディングだ。LiveCodeBench v6では82.0を記録し、同格のQwen3.5-9Bの75.4を上回る。一方、エンドツーエンドの作業能力を問うTerminal-Bench 2.1では17.4にとどまり、Qwen3.5-9Bの21.7を下回った。速度の主張のほうが堅い。アーキテクチャ不変のため推論は遅くなっておらず、マルチトークン予測で単一リクエストは約1.6倍高速化し、H200 1枚での公式テストでは高負荷時のスループットがQwen3.5-9Bのほぼ2倍だった。つまり、速さと安さで勝ち、最も難しい長手順タスクではまだ後れを取る。

向いている人、向いていない人

最も向いているのは、エージェントシステムの中のサブエージェントとして使う方法だ。失敗したテストの根本原因の特定、修正案の作成、変更の検証といった境界のはっきりした仕事は、まさに訓練で繰り返し練習した内容である。次に向くのがプライベートなセルフホストで、コードとデータを自社インフラの内側に留められるため、コンプライアンス要件の厳しいチームにとって外部の大規模モデルを呼ぶより説明しやすい。llama.cpp、Ollama、LM Studio向けのGGUFビルドとマルチトークン予測コンポーネントは近日提供予定とされ、現時点ではHugging Faceから重みを取得して自分でデプロイする形だ。避けるべき期待も明確で、最も複雑なエンドツーエンドのソフトウェア工学を単独で担わせることや、知識幅の最も広い汎用アシスタントとして使うことは、Terminal-Benchのスコアがすでに戒めている。

おすすめツール

もっと見る