ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
DeepSeek V4.1 Flash新评测:代码任务成本约为Astra十五分之一

DeepSeek V4.1 Flash新评测:代码任务成本约为Astra十五分之一

AI资讯 Admin 3 次浏览

2026年9月14日,AI推理平台Fireworks AI发布DeepSeek V4.1 Flash评测。在其运行的DeepSWE代码任务中,该模型最高得分为74.34%,平均每项任务成本0.430美元;GPT-6 Astra在xhigh推理档位得分74.12%,成本6.524美元。按这组结果计算,前者单任务成本约为后者的十五分之一,但这只是特定平台、特定基准下的对比,不等于所有开发场景都能保持同样差距。

四款模型的结果有多接近

模型DeepSWE得分每任务成本
DeepSeek V4.1 Flash74.34%0.430美元
GPT-6 Astra xhigh74.12%6.524美元
Gemini 3.8 Flash73.83%2.362美元
Claude Opus 573.65%11.838美元

Fireworks同时强调,DeepSWE单次运行波动约为1.4至3.2个百分点,而四款模型的最高成绩只相差0.69个百分点。因此,这张表不足以宣布谁在代码能力上绝对领先;它更能说明,当质量处在相近区间时,推理成本会成为路由和采购决策的重要变量。

低成本从哪里来

DeepSeek V4.1 Flash采用5520亿参数的混合专家架构,输入阶段每个token激活约80亿参数,输出阶段激活约160亿参数。DeepSWE又是典型的输入密集任务:平均每项任务处理约3690万输入token和21.1万输出token,比例约174比1,其中99.6%的输入命中缓存。Fireworks给出的账单拆分显示,缓存输入约占总成本59.9%,输出约占32.5%。这意味着模型架构、缓存价格和工作负载形态共同造就了结果,不能只用参数总量解释。

跨基准看,结论并不相同

在Terminal Bench 2.1中,DeepSeek V4.1 Flash得分86.5%,Astra为87.5%,Fireworks称总成本相差约12倍;但在Humanity's Last Exam中,两者分别为34.52%和50.40%,能力差距明显。报告还给出54.80%的“Oracle路由”理论上限,它是假设总能选中正确模型的理想结果,真实路由器未必可以实现。

企业该如何使用这组数据

更稳妥的做法是拿自己的代码库、上下文长度、缓存命中率和失败重试规则做小规模复测,同时记录完成率、人工返工时间、延迟与最终账单。输入高度重复的代码审查或仓库理解任务,可能更容易获得缓存红利;要求高难推理或低缓存命中的任务,则可能出现完全不同的成本曲线。这次评测的价值不是替企业选定唯一模型,而是说明多模型路由应同时考察质量区间与真实总成本。

推荐工具

更多