一、摘要
DeepSeek-OCR 2 是 DeepSeek 开源的 OCR/文档理解模型版本升级,项目以 “DeepSeek-OCR 2: Visual Causal Flow” 为主题,强调更贴近人类的视觉编码方式,面向复杂版式(文档、图表、混排页面等)提供更强的结构化抽取与理解能力。官方仓库与模型卡提供了 Transformers 与 vLLM 两条推理路径,并给出“将文档转换为 Markdown”“图像 OCR”“目标定位”等提示词模板。
二、核心特性
1、Visual Causal Flow 方向:官方表述为更“人类化”的视觉编码;一些解读会将其概括为更符合语义/版式逻辑的视觉 token 组织方式(具体算法细节建议直接阅读随仓库提供的论文 PDF)。
2、动态分辨率与 token 预算:支持 Dynamic resolution,默认配置示例为多块 768×768 + 1 块 1024×1024 的输入组合,对应固定的视觉 token 预算(官方示例约 256 tokens),便于在速度、显存与精度之间做权衡。
3、面向文档的结构化输出:内置提示词示例支持“Convert the document to markdown”,适合将 PDF/图片文档转为可编辑文本与轻量结构。
4、定位与通用理解:提示词示例包含 rec(定位某个参考对象)与通用描述,意味着它不仅是“读字”,也可用于图文混合场景的理解与检索。
三、安装
1、环境建议:官方测试环境为 CUDA 11.8 + PyTorch 2.6.0,Python 3.12.9。
2、Transformers 推理:从 Hugging Face 直接加载 deepseek-ai/DeepSeek-OCR-2,并建议启用 FlashAttention(示例为 flash-attn==2.7.3)与 bfloat16 推理。
3、vLLM 推理:仓库提供 vLLM 相关说明与脚本,包含图片流式输出、PDF 并发处理、以及基准批量评测脚本;需要按配置文件修改输入/输出路径等参数。
四、典型用例
1、文档转 Markdown:扫描件、论文、说明书等图片/页面,一键导出 Markdown 便于二次编辑与检索。
2、复杂版式 OCR:表格、图文混排、流程图注释等传统 OCR 容易乱序的场景,尝试用“带版式/grounding”的提示词获得更稳的结构。
3、图表与插图解析:对文档中的 figure 单独解析,适合知识库构建与报告自动化。
4、目标定位与引用:用定位提示词在图中找元素(例如某个标注、按钮或区域),用于文档审阅、数据标注与自动质检。
五、生态与竞品
1、生态:模型权重在 Hugging Face 发布,仓库提供推理脚本与 PDF 并发处理入口,便于接入离线流水线或服务化部署。
2、竞品/参考:官方致谢与对标链路中出现 Vary、GOT-OCR2.0、MinerU、PaddleOCR 等项目,可作为你在“速度、版式还原、开源可控、部署成本”维度的对比对象。
3、选型建议:如果你关注“文档结构化输出(Markdown)+ 并发批处理(PDF)+ 统一多模态提示词”,DeepSeek-OCR 2 的工程入口更贴近流水线;如果你更偏传统 OCR 引擎与规则后处理,PaddleOCR/MinerU 等生态更成熟。
六、局限与注意事项
1、论文细节需核对:仓库提供论文 PDF,但模型卡/README 对算法细节描述较克制;涉及“视觉因果流/动态组织”等关键机制,建议以论文与代码实现为准。
2、显存与吞吐:动态分辨率与视觉 token 预算会直接影响显存占用与速度,建议先用小批量验证再上并发。
3、输出质量依赖提示词:同一张文档,“Free OCR”“带 grounding 的 Markdown 转换”“figure 解析”会得到不同粒度结果,建议为业务固化提示词模板与评估集。
4、复杂文档仍需校对:对数学公式、极端排版、低清扫描件,仍建议人工抽检或引入二次校验流程。
七、项目地址
https://github.com/deepseek-ai/DeepSeek-OCR-2
八、常见问题
Q: DeepSeek-OCR 2 的核心关键词是什么?Visual Causal Flow 到底指什么?
A: 官方将其描述为更“人类化”的视觉编码方向;更具体的机制需要以仓库论文 PDF 与代码实现为准。
Q: DeepSeek-OCR 2 如何把图片文档转换为 Markdown?
A: 使用提示词示例 <image>\n<|grounding|>Convert the document to markdown. 并按示例调用 model.infer(...) 输出到指定目录。
Q: DeepSeek-OCR 2 是否支持批量跑 PDF?
A: 支持。仓库给出 vLLM 的 PDF 并发脚本入口,并提示在配置文件中修改输入/输出路径等参数。
Q: DeepSeek-OCR 2 的开源许可是什么?能否商用?
A: 仓库与模型卡标注为 Apache-2.0;具体合规仍建议结合你的分发方式与依赖项做一次许可证清单核对。
Q: Dynamic resolution 与视觉 token 预算对效果有什么影响?
A: 分辨率更高或切块更多通常更利于复杂版式,但也更耗显存/更慢;建议围绕你的文档类型做“速度-精度”曲线测试后定档。