2026年9月14日、AI推論プラットフォームのFireworks AIはDeepSeek V4.1 Flashのレビューを発表しました。DeepSWEコードタスクでは最大74.34%のスコアを獲得し、平均コストは1タスクあたり$0.430でした。GPT-6 Astraはxハイ推論範囲で74.12%のスコアを獲得し、コストは6.524ドルでした。これらの結果に基づき、前者の単一タスクコストは後者の約15分の1ですが、これは特定のプラットフォームやベンチマークに基づく比較であり、すべての開発シナリオが同じ差を保っているわけではありません。
4つのモデルの結果はどの程度近いのでしょうか?
| モデル | DeepSWEスコア | タスクごとのコスト |
|---|---|---|
| DeepSeek V4.1 フラッシュ | 74.34% | $0.430 |
| GPT-6 アストラxハイ | 74.12% | 6.524ドル |
| ジェミニ3.8フラッシュ | 73.83% | 2,362ドル |
| クロード作品5 | 73.65% | 11,838ドル |
Fireworksはまた、DeepSWEは1回の実行で約1.4〜3.2ポイントの変動があり、4つのモデルで最も高いスコアはわずか0.69ポイント差であることを強調しています。したがって、この表だけではコード能力で絶対的に優れているかを断定するには不十分です。品質が同じ範囲にある場合、推論コストがルーティングや調達の意思決定における重要な変数であることをよりよく示しています。
低コストはどこから来るのでしょうか?
DeepSeek V4.1 Flashは、5520億のパラメータを持つハイブリッドエキスパートアーキテクチャを採用しており、入力時にトークンあたり約80億パラメータ、出力時に約160億パラメータを有効化します。DeepSWEも典型的な入力集約型タスクで、各タスクは平均約3,690万の入力トークンと211,000の出力トークンを処理し、約174:1の比率で、入力ヒットの99.6%がキャッシュに含まれています。Fireworksの請求内訳によると、キャッシュ入力は総コストの約59.9%、出力は約32.5%を占めています。これはモデルアーキテクチャ、キャッシュ価格設定、ワークロードフォームが組み合わさることで、総パラメータだけでは説明できない結果を生み出していることを意味します。
ベンチマーク間での閲覧では、結論は同じではありません
Terminal Bench 2.1では、DeepSeek V4.1 Flashが86.5%、Astraが87.5%、Fireworksは合計コスト差が約12倍と報告されていました。しかしHumanity's Last Examでは、両スコアはそれぞれ34.52%と50.40%であり、能力の明確な差を示しています。レポートはまた、「Oracle Routing」の理論上の上限を54.80%と示しており、理想的な結果である「Oracle Routing」を常に正しいモデルを選択することが理想的であると仮定していますが、実際のルーターではそれが難しい場合があります。
企業はこのデータをどのように活用すべきでしょうか?
より安全な方法は、コードベース、コンテキスト長、キャッシュヒット率、失敗再試行ルールを用いて小規模な再テストを行い、完了率、手動再作業時間、遅延、最終請求も記録することです。非常に反復的なコードレビューや倉庫理解タスクを入力することで、キャッシュボーナスの獲得が容易になる場合があります。推論が難しいタスクやキャッシュヒット数が少ないタスクは、コスト曲線が全く異なる場合があります。この評価の価値は、企業向けの独自のモデルを選ぶことではなく、マルチモデルルーティングが品質区間と真の総コストの両方を考慮すべきであることを示すことです。