2026年9月14日,AI推理平台Fireworks AI发布DeepSeek V4.1 Flash评测。在其运行的DeepSWE代码任务中,该模型最高得分为74.34%,平均每项任务成本0.430美元;GPT-6 Astra在xhigh推理档位得分74.12%,成本6.524美元。按这组结果计算,前者单任务成本约为后者的十五分之一,但这只是特定平台、特定基准下的对比,不等于所有开发场景都能保持同样差距。
四款模型的结果有多接近
| 模型 | DeepSWE得分 | 每任务成本 |
|---|---|---|
| DeepSeek V4.1 Flash | 74.34% | 0.430美元 |
| GPT-6 Astra xhigh | 74.12% | 6.524美元 |
| Gemini 3.8 Flash | 73.83% | 2.362美元 |
| Claude Opus 5 | 73.65% | 11.838美元 |
Fireworks同时强调,DeepSWE单次运行波动约为1.4至3.2个百分点,而四款模型的最高成绩只相差0.69个百分点。因此,这张表不足以宣布谁在代码能力上绝对领先;它更能说明,当质量处在相近区间时,推理成本会成为路由和采购决策的重要变量。
低成本从哪里来
DeepSeek V4.1 Flash采用5520亿参数的混合专家架构,输入阶段每个token激活约80亿参数,输出阶段激活约160亿参数。DeepSWE又是典型的输入密集任务:平均每项任务处理约3690万输入token和21.1万输出token,比例约174比1,其中99.6%的输入命中缓存。Fireworks给出的账单拆分显示,缓存输入约占总成本59.9%,输出约占32.5%。这意味着模型架构、缓存价格和工作负载形态共同造就了结果,不能只用参数总量解释。
跨基准看,结论并不相同
在Terminal Bench 2.1中,DeepSeek V4.1 Flash得分86.5%,Astra为87.5%,Fireworks称总成本相差约12倍;但在Humanity's Last Exam中,两者分别为34.52%和50.40%,能力差距明显。报告还给出54.80%的“Oracle路由”理论上限,它是假设总能选中正确模型的理想结果,真实路由器未必可以实现。
企业该如何使用这组数据
更稳妥的做法是拿自己的代码库、上下文长度、缓存命中率和失败重试规则做小规模复测,同时记录完成率、人工返工时间、延迟与最终账单。输入高度重复的代码审查或仓库理解任务,可能更容易获得缓存红利;要求高难推理或低缓存命中的任务,则可能出现完全不同的成本曲线。这次评测的价值不是替企业选定唯一模型,而是说明多模型路由应同时考察质量区间与真实总成本。