DeepSeek正式发布DeepSeek-V4.1-Flash。官方将其定义为新架构系列中最小的模型,原生支持多模态视觉理解,并把更高能力上限、更快推理、更高吞吐和向更大模型扩展列为核心目标。Flash不再只是“便宜版”,而正在成为下一代架构的首个落点。
新架构先在小模型落地
官方基准中,V4.1 Flash取得GPQA Diamond 90.9、Codeforces 3471、Terminal-Bench 2.1 90.6、DeepSWE v1.1 74.2。视觉相关的BabyVision(w/tools)为89.6,Chartography(w/tools)为78.9。
这些成绩来自DeepSeek官方测试,不能直接等同于独立第三方验证。但方向已经清晰:DeepSeek正尝试把推理、代码、Agent与视觉能力压进同一个高吞吐模型,而不是继续拆分多个专用入口。
Flash开始接管Pro任务
DeepSeek V4.1 Flash现已上线API,模型名调整为deepseek-flash。上一代V4 Flash和V4 Flash Vision Exp已经退役,旧模型名暂时保留兼容,并统一路由至V4.1 Flash。
更关键的是Pro线。DeepSeek称,经广泛测试,V4.1 Flash在性能、费用、速度和总用时上均超过V4 Pro。9月14日12:00起,在V4.1 Pro发布前,deepseek-v4-pro请求将转由V4.1 Flash处理,并按Flash价格计费。
推理成本继续向下压
API规格也体现了AI推理效率的优先级:V4.1 Flash支持1M上下文、最高384K输出,API并发上限达到2500;作为对比,当前V4 Pro并发上限为500。
非高峰期每百万Token缓存命中输入价格为0.003美元,缓存未命中为0.15美元,输出为0.6美元,高峰期价格翻倍。能力向Pro靠拢、价格继续留在Flash档位,是这次升级最直接的商业信号。
V4.1 Flash更像DeepSeek新架构的先行版本:先用小模型验证原生视觉、高吞吐和推理效率,再向更大模型扩展。接下来关键在于V4.1 Pro会把这套架构的能力上限推到什么位置。