Magistral Small 1.2 と Medium 1.2 が正式にリリースされ、新しいビジュアル エンコーダーが追加され、テキストと画像のマルチモーダル分析がサポートされました。AIME や LiveCodeBench などのベンチマークで、1.1 と比較して 10% 以上のパフォーマンス向上を実現しています。Web 検索、コード解釈、画像生成などの強化されたツールにより、より明確で自然な出力が得られるため、ナレッジ ワークやエンジニアリング シナリオに最適です。 I. アップグレードのハイライト: 1.2 が価値のある理由 1. マルチモーダル: テキストと画像のネイティブ統合 Magistral 1.2 には、ドキュメントのスクリーンショット、数式画像、画像を伴うコード スニペットに基づいた推論と回答を可能にする組み込みのビジュアル エンコーダーが搭載されています。この機能は、製品レビュー、表認識、チャート Q&A などの高頻度タスクをカバーします。この機能は、公式ドキュメントと発表で確認されています。
2.パフォーマンスの向上:数学とプログラミングの安定性が向上
Magistral 1.2 は、AIME 24、AIME 25、LiveCodeBench v5、v6 などのベンチマークにおいて、1.1 と比較して約 15% のパフォーマンス向上を実現しています。複雑な推論や長いチェーンの問題解決の信頼性が向上し、教育、研究、競技会、コード生成のシナリオに適しています。
(1) 推論チェーンの強化と収束性の向上
教師あり微調整と強化学習の組み合わせに基づき、1.2 では長いステップの導出におけるミスが減り、より読みやすい回答が提供され、有限生成をサポートすることで「無限継続」が抑制されます。
(2) トーンとフォーマットの最適化
より自然な応答、より標準化された Markdown および LaTeX 表現、ナレッジベース、論文の下書き、技術文書への直接貼り付けが容易になりました。
II. エンジニアリングの実践:1.2 を実際のワークフローに接続する
1. よりスマートなツール呼び出し
Magistral 1.2 は、Web ページの検索、コード インタープリター、および画像生成のスケジュールをより積極的に実行します。サブタスクを自動的に分割し、データを取得してコード サンドボックスで検証し、構造化された回答にマージすることで、手作業によるラウンドトリップを削減します。
2. データベースと知識ベースの統合
R&D ドキュメント、要件ライブラリ、および欠陥ライブラリでは、マルチモーダル質問応答を使用して最初に重要なポイントを抽出し、次にプログラミング ツールを使用してインターフェースとサンプル コードの整合性をチェックし、最後にレビュー リストと変更提案を生成します。
(1) 数学シナリオの実装
AIME タイプの問題の場合、1.2 は最初にソリューション フレームワークを提供し、その後、徐々に公式を導出して自己チェックを行うことができます。エラーを減らすため、LaTeX の結果には等価変換説明が与えられています。
(2) コーディング シナリオの実装
LiveCodeBench パラダイムでは、自然言語の質問がテスト ケースに変換されます。コード インタープリターを実行して合格率を検証します。失敗は、バイナリの場所とロールバック プロンプトを使用して検出されます。
III. 選択に関する推奨事項: Small vs Medium と展開の重要なポイント
1. 選択方法
Small 1.2 は計算効率が高く、ローカルまたは小中規模の推論に適しています。 Medium 1.2 は、より高い定常状態の精度を追求し、サーバー側の集中推論や複雑なプロジェクトのレビューに適しています。
2. 展開とガバナンス
量子化後、Small 1.2 は単一の GPU または大容量メモリの軽量デバイスで実行できます。本番環境では、リクエストのタイムアウト、最大ステップ数、ツールのホワイトリストを設定し、監査用に思考チェーンの概要を記録することをお勧めします。
(1) プロンプトワードテンプレート
マルチモーダルタスクのテンプレートを固め、入力構造、出力形式、ツールの権限を明確にし、ドリフトを減らします。
(2) 評価回帰
AIME と LiveCodeBench のサブセットを含む回帰セットを作成します。各アップグレードの精度、実行時間、ツール呼び出し回数を比較して、メリットを定量化します。
よくある質問 (Q&A)
Q: Magistral 1.2 のマルチモーダリティはどのような実用的な用途に使用できますか?
A: 製品のスクリーンショットから要件を抽出し、問題の画像から数式を再構築して問題を解決し、エラーのスクリーンショットからスタック情報を探し、コードインタープリターを使用して問題を再現して修正できます。 Q: 1.1 と比較して、Magistral 1.2 の主な利点は何ですか? A: マルチモーダリティと数理プログラミング ベンチマークの二重の改善、より安定したツール呼び出しと改善されたタイポグラフィにより、運用ワークフローに直接統合するのに適しています。 Q: Small 1.2 はプライベート データ用にローカルに展開できますか? A: はい。量子化後、単一の GPU または大容量メモリを搭載した軽量デバイスで実行できます。オフラインツールチェーンと組み合わせることで、制御可能な検索と実行を維持しながら、分断された推論が可能になります。Q: 15% のパフォーマンス向上が私のシナリオに当てはまるかどうかを確認するにはどうすればよいですか?A: チームタスクを用いて、数学的推論、コード生成、検索と質問への回答を含む小規模なベンチマークを作成しました。1.1 と 1.2 で同じプロンプトとツール権限を実行し、精度とレイテンシの違いを記録しました。