返回AI资讯
DeepSeek V4正式发布:1M上下文与开源权重成焦点

DeepSeek V4正式发布:1M上下文与开源权重成焦点

AI资讯 Admin 558 次浏览

2026年4月24日,DeepSeek V4 已正式浮出水面。和几个小时前还只能依据媒体传闻判断不同,现在 DeepSeek 官方 Hugging Face 组织已经上线 DeepSeek-V4-Pro、DeepSeek-V4-Flash 及对应 Base 模型,官方 API 价格页也同步出现 deepseek-v4-flash 和 deepseek-v4-pro。这意味着 DeepSeek V4 不再只是“待发布传闻”,而是已经进入公开可验证阶段。

这次发布的重点很清楚:DeepSeek V4 主打百万 token 长上下文、开源权重、MoE 架构和更低长上下文推理成本。它对开发者的意义,不只是“又多了一个强模型”,而是给长文档、代码库、Agent 工作流和本地/私有化部署带来了新的选择。

两条产品线:Pro和Flash

官方模型卡显示,DeepSeek V4 系列包含两个主要版本:DeepSeek-V4-Pro 总参数量 1.6T,激活参数 49B;DeepSeek-V4-Flash 总参数量 284B,激活参数 13B。两者都支持 1M 上下文长度,并提供 Base 与指令模型权重。

从定位看,Pro 是旗舰版本,面向复杂推理、代码、Agent 和长上下文任务;Flash 则更偏速度和成本,适合常规问答、批量处理和对延迟敏感的应用。官方还提到 V4-Pro-Max 是 Pro 的最高推理努力模式,目标是在开源模型中拉高知识、代码和代理任务上限。

API价格和接口也已同步

DeepSeek 官方 API 价格页已经列出 V4 模型:deepseek-v4-flash 和 deepseek-v4-pro 都使用 https://api.deepseek.com 作为 OpenAI 格式 Base URL,也提供 Anthropic 格式 Base URL。两者都支持思考和非思考模式、JSON 输出、工具调用、Chat Prefix Completion,FIM Completion 仅限非思考模式。

价格方面,deepseek-v4-flash 每百万输入 token 缓存命中 0.028 美元、缓存未命中 0.14 美元、输出 0.28 美元;deepseek-v4-pro 对应为 0.145 美元、1.74 美元和 3.48 美元。旧的 deepseek-chat 和 deepseek-reasoner 名称未来会弃用,但目前为了兼容,分别对应 deepseek-v4-flash 的非思考模式和思考模式。

技术看点:长上下文成本下降

DeepSeek V4 模型卡把核心升级放在长上下文效率上。官方称 V4 使用混合注意力架构,将 Compressed Sparse Attention 和 Heavily Compressed Attention 结合起来。在 1M token 上下文场景下,DeepSeek-V4-Pro 相比 DeepSeek-V3.2 只需要 27% 的单 token 推理 FLOPs 和 10% 的 KV cache。

这对真实应用很关键。过去百万上下文往往听起来很强,但成本、显存和延迟会让它难以常态化使用。如果 V4 的长上下文效率能在社区部署和云 API 中稳定体现,它会直接影响代码仓库理解、法律合同审阅、科研资料整理、企业知识库和多轮代理任务。

现在该怎么看

这次 DeepSeek V4 的发布,最值得关注的不是单个榜单数字,而是“开放权重 + API 可用 + 1M 上下文 + 低价缓存”的组合。对国内开发者来说,它还会继续带动国产 AI 芯片和推理框架适配;对全球开源社区来说,V4-Pro 和 V4-Flash 会成为评测、量化、部署和 Agent 框架接入的新基准。

但落地时仍要保持一点谨慎:大模型刚发布时,第三方跑分、实际吞吐、工具调用稳定性和不同推理框架适配还需要时间验证。生产环境可以先做 A/B 测试,不要只凭参数规模直接替换现有模型。

信息来源:DeepSeek-V4-Pro 官方模型卡DeepSeek 官方 Hugging Face 组织页DeepSeek API 模型与价格页DeepSeek 官方公众号发布链接

推荐工具

更多