ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
DeepSeek V4 Flash Vision 开放权重:多模态 Agent 走向本地部署

DeepSeek V4 Flash Vision 开放权重:多模态 Agent 走向本地部署

AI资讯 Admin 2 次浏览

2026年8月31日,DeepSeek 在官方 Hugging Face 组织 deepseek-ai 上线 DeepSeek-V4-Flash-Vision-Exp 开放权重。模型仓库创建于当日 06:16(UTC),采用 MIT 许可证,提供模型文件、Tokenizer、提示编码参考与最小化 PyTorch 推理实现。这不是 8 月21日 API 上线消息的重复:此前解决的是云端可调用,这次才把权重与关键参考代码交到开发者手里。

从“看图接口”变成可检查的模型资产

官方模型卡显示,该模型约 3050 亿参数,在纯文本 Agent 任务上保持与 DeepSeek-V4-Flash-0731 接近的水平,同时加入视觉理解。它能把图片、图表、软件界面与文字指令放进同一任务链,适合做网页操作、图表分析、截图排障和视觉质检。想了解前一阶段的 API 能力,可对照DeepSeek-V4-Flash-Vision-Exp 上线解读。

DeepSeek 公布的自测中,ApexBench Pass@1 从文本版的 26.2 提升到 36.5,Chartography 得分 64.3,ZeroBench Pass@5 为 35.0。它还在 Terminal Bench 2.1 得到 83.9、DeepSWE 得到 59.3。不过这些数字来自官方模型卡,不能直接等同于所有真实业务的稳定性。

开放权重不等于普通电脑即装即用

对团队而言,价值在于可审计、可微调,也能围绕私有截图和内部界面搭建受控 Agent;限制则是部署门槛仍高。3050 亿参数意味着权重存储、显存、推理框架与多卡通信都不是消费级电脑能轻松承担的,仓库里的最小推理代码也不是现成生产服务。

因此,这次开放更像把多模态 Agent 的研究底座交给云厂商、推理框架团队和有算力的企业。中小开发者短期仍适合先用 API 验证任务,再决定是否采用量化、托管推理或私有集群。真正值得关注的不是“模型能下载”,而是视觉 Agent 从封闭接口走向可检查、可改造的工程资产。

推荐工具

更多