DeepSeek V4.1 Flashの最新成績は2026年10月6日、ARC Prizeによって公表された。独立評価機関である同団体はARC-AGI(Verified)評価で、ARC-AGI-1で94.5%、ARC-AGI-2で72.9%というスコアを付けた。抽象推論はまた一歩前進したが、1問を解くコストも目立って上がっている。
伸び幅を分解する
前世代V4 Flashの同評価における最良成績と比べると、ARC-AGI-1は5.5ポイント、ARC-AGI-2は11.5ポイント上昇した。ARC-AGIは暗記を測る試験ではない。各課題は入力と出力の例を数個だけ示し、モデル自身が変換ルールを推測して、見たことのない新しい図形に適用させる。ARC-AGI-2ではさらに、絡み合う複数のルールを同時に扱う必要があり、だからこそ第2世代の伸びの方が意味を持つ。コスト面はもう一つの側面だ。ARC-AGI-1は1問あたり約0.07ドル、ARC-AGI-2は約0.13ドルで、前世代の最良成績に付随したコストの数倍に達する。つまり今回の進歩は、推論計算により多くを投じて買ったものであり、タダではない。
なぜコスト数字がスコアと同じくらい重要なのか
ARC Prizeがコストとスコアを並べて公表すること自体、一つの姿勢である。スコアだけを示して請求書を示さない評価は、実際にモデルを運用する人にとって参考価値が限られる。開発者にとってARC-AGI-2で72.9%という成績は、未知のルール型タスクを処理する選択肢が増えたことを意味し、しかも1問あたりコストは10数セントの水準で、トップクラスのクローズドモデルが1回数ドルに達する推論コストとは桁が違う。ただしタスク量が巨大になれば、数倍になったコストは総予算に入れなければならない。とりわけ試行錯誤を繰り返して正答率を積み上げるエージェント型ワークフローでは、請求額の膨らみ方が最も速い。
この数字を読む際の二つの注意
第一に、これは評価機関が自前の検証セットと固定設定で出した結果であり、プロンプトの方式や推論レベルを変えればスコアもコストも動くため、業務場面への約束として直接読むことはできない。第二に、抽象推論が強いことは、コードや長文ドキュメントといった日常タスクで全面的に先行していることを意味しない。選定時には自前のタスクセットで再検証が必要だ。この結果が示す本当のシグナルは、中国のオープンモデル陣営が最も難しい汎用推論評価で第一集団に迫り続けていること、そして競争の焦点が単なるスコア争いから、1ドルでどれだけの推論能力が買えるかへ移りつつあることである。