返回Ai开源
DeepSeek-OCR 2 发布:Visual Causal Flow 让文档与图表识别更“像人类阅读”

DeepSeek-OCR 2 发布:Visual Causal Flow 让文档与图表识别更“像人类阅读”

Ai开源 Admin 198 次浏览

一、摘要

DeepSeek-OCR 2 是 DeepSeek 开源的 OCR/文档理解模型版本升级,项目以 “DeepSeek-OCR 2: Visual Causal Flow” 为主题,强调更贴近人类的视觉编码方式,面向复杂版式(文档、图表、混排页面等)提供更强的结构化抽取与理解能力。官方仓库与模型卡提供了 Transformers 与 vLLM 两条推理路径,并给出“将文档转换为 Markdown”“图像 OCR”“目标定位”等提示词模板。

二、核心特性

1、Visual Causal Flow 方向:官方表述为更“人类化”的视觉编码;一些解读会将其概括为更符合语义/版式逻辑的视觉 token 组织方式(具体算法细节建议直接阅读随仓库提供的论文 PDF)。

2、动态分辨率与 token 预算:支持 Dynamic resolution,默认配置示例为多块 768×768 + 1 块 1024×1024 的输入组合,对应固定的视觉 token 预算(官方示例约 256 tokens),便于在速度、显存与精度之间做权衡。

3、面向文档的结构化输出:内置提示词示例支持“Convert the document to markdown”,适合将 PDF/图片文档转为可编辑文本与轻量结构。

4、定位与通用理解:提示词示例包含 rec(定位某个参考对象)与通用描述,意味着它不仅是“读字”,也可用于图文混合场景的理解与检索。

三、安装

1、环境建议:官方测试环境为 CUDA 11.8 + PyTorch 2.6.0,Python 3.12.9。

2、Transformers 推理:从 Hugging Face 直接加载 deepseek-ai/DeepSeek-OCR-2,并建议启用 FlashAttention(示例为 flash-attn==2.7.3)与 bfloat16 推理。

3、vLLM 推理:仓库提供 vLLM 相关说明与脚本,包含图片流式输出、PDF 并发处理、以及基准批量评测脚本;需要按配置文件修改输入/输出路径等参数。

四、典型用例

1、文档转 Markdown:扫描件、论文、说明书等图片/页面,一键导出 Markdown 便于二次编辑与检索。

2、复杂版式 OCR:表格、图文混排、流程图注释等传统 OCR 容易乱序的场景,尝试用“带版式/grounding”的提示词获得更稳的结构。

3、图表与插图解析:对文档中的 figure 单独解析,适合知识库构建与报告自动化。

4、目标定位与引用:用定位提示词在图中找元素(例如某个标注、按钮或区域),用于文档审阅、数据标注与自动质检。

五、生态与竞品

1、生态:模型权重在 Hugging Face 发布,仓库提供推理脚本与 PDF 并发处理入口,便于接入离线流水线或服务化部署。

2、竞品/参考:官方致谢与对标链路中出现 Vary、GOT-OCR2.0、MinerU、PaddleOCR 等项目,可作为你在“速度、版式还原、开源可控、部署成本”维度的对比对象。

3、选型建议:如果你关注“文档结构化输出(Markdown)+ 并发批处理(PDF)+ 统一多模态提示词”,DeepSeek-OCR 2 的工程入口更贴近流水线;如果你更偏传统 OCR 引擎与规则后处理,PaddleOCR/MinerU 等生态更成熟。

六、局限与注意事项

1、论文细节需核对:仓库提供论文 PDF,但模型卡/README 对算法细节描述较克制;涉及“视觉因果流/动态组织”等关键机制,建议以论文与代码实现为准。

2、显存与吞吐:动态分辨率与视觉 token 预算会直接影响显存占用与速度,建议先用小批量验证再上并发。

3、输出质量依赖提示词:同一张文档,“Free OCR”“带 grounding 的 Markdown 转换”“figure 解析”会得到不同粒度结果,建议为业务固化提示词模板与评估集。

4、复杂文档仍需校对:对数学公式、极端排版、低清扫描件,仍建议人工抽检或引入二次校验流程。

七、项目地址

https://github.com/deepseek-ai/DeepSeek-OCR-2

八、常见问题

Q: DeepSeek-OCR 2 的核心关键词是什么?Visual Causal Flow 到底指什么?

A: 官方将其描述为更“人类化”的视觉编码方向;更具体的机制需要以仓库论文 PDF 与代码实现为准。

Q: DeepSeek-OCR 2 如何把图片文档转换为 Markdown?

A: 使用提示词示例 <image>\n<|grounding|>Convert the document to markdown. 并按示例调用 model.infer(...) 输出到指定目录。

Q: DeepSeek-OCR 2 是否支持批量跑 PDF?

A: 支持。仓库给出 vLLM 的 PDF 并发脚本入口,并提示在配置文件中修改输入/输出路径等参数。

Q: DeepSeek-OCR 2 的开源许可是什么?能否商用?

A: 仓库与模型卡标注为 Apache-2.0;具体合规仍建议结合你的分发方式与依赖项做一次许可证清单核对。

Q: Dynamic resolution 与视觉 token 预算对效果有什么影响?

A: 分辨率更高或切块更多通常更利于复杂版式,但也更耗显存/更慢;建议围绕你的文档类型做“速度-精度”曲线测试后定档。

DeepSeek开源DeepSeek-OCR 2升级:Visual Causal Flow强化文档理解 DeepSeek-OCR 2发布:面向复杂版式的结构化抽取能力大幅增强 DeepSeek-OCR 2解读:Visual Causal Flow为何更像人类视觉编码 DeepSeek-OCR 2支持文档转Markdown:PDF图片一键可编辑输出 DeepSeek-OCR 2上线动态分辨率:速度显存精度怎么权衡 DeepSeek-OCR 2给出256视觉token预算示例:吞吐提升的代价是什么 DeepSeek-OCR 2提供Transformers与vLLM两条推理路径:部署更灵活 DeepSeek-OCR 2 vLLM脚本支持PDF并发处理:流水线批量OCR更省事 DeepSeek-OCR 2新增定位提示词rec:不只读字还能找目标 DeepSeek-OCR 2适配图表与混排页面:传统OCR乱序痛点被瞄准 DeepSeek-OCR 2模型卡公布提示词模板:grounding让结构更稳 DeepSeek-OCR 2工程化亮点:图片流式输出与批量评测脚本齐备 DeepSeek-OCR 2安装环境曝光:CUDA 11.8+PyTorch 2.6.0成推荐组合 DeepSeek-OCR 2建议启用FlashAttention:推理提速但兼容要注意 DeepSeek-OCR 2用bfloat16推理:显存压力下降但效果如何 DeepSeek-OCR 2把扫描件转Markdown:知识库构建效率为何提升 DeepSeek-OCR 2复杂表格OCR:结构化输出能否减少后处理 DeepSeek-OCR 2流程图与图注解析:文档理解从文字走向版式 DeepSeek-OCR 2 figure单独解析:报告自动化的新入口 DeepSeek-OCR 2目标定位与引用:文档审阅与质检更可控 DeepSeek-OCR 2开源Apache-2.0:商用合规仍需做许可证清单 DeepSeek-OCR 2论文PDF随仓库提供:算法细节需以代码为准 DeepSeek-OCR 2算法争议点:README克制描述与可复现细节缺口 DeepSeek-OCR 2动态切块768x768+1024x1024:配置选错会翻车吗 DeepSeek-OCR 2提示词决定输出质量:Free OCR与grounding差在哪 DeepSeek-OCR 2输出仍需校对:公式极端排版低清扫描是难点 DeepSeek-OCR 2吞吐评估指南:先小批量再上PDF并发更稳 DeepSeek-OCR 2适合离线流水线:结构化Markdown+批处理一体化 DeepSeek-OCR 2服务化部署要点:路径配置与权限隔离别忽视 DeepSeek-OCR 2对比PaddleOCR:规则引擎成熟度与结构化能力谁强 DeepSeek-OCR 2对比MinerU:开源可控与部署成本怎么选 DeepSeek-OCR 2对标GOT-OCR2.0与Vary:版式还原路线分歧在哪 DeepSeek-OCR 2生态盘点:Hugging Face权重+GitHub脚本快速落地 DeepSeek-OCR 2提示词示例公开:Convert the document to markdown怎么用 DeepSeek-OCR 2用Transformers加载deepseek-ai/DeepSeek-OCR-2:上手更简单 DeepSeek-OCR 2 vLLM并发跑PDF:配置文件输入输出路径如何改 DeepSeek-OCR 2图片流式输出:实时OCR对交互产品意味着什么 DeepSeek-OCR 2结构化抽取瞄准混排:文档RAG的数据清洗更轻 DeepSeek-OCR 2定位能力rec:做数据标注与自动质检更高效 DeepSeek-OCR 2视觉token预算可控:成本曲线如何画出来 DeepSeek-OCR 2更人类化视觉编码:对复杂版式理解为何重要 DeepSeek-OCR 2把OCR变文档理解:从识别到结构化的升级点 DeepSeek-OCR 2实践建议:固化提示词模板与评估集避免漂移 DeepSeek-OCR 2风险提示:并发失败重试与日志体系要先搭 DeepSeek-OCR 2部署成本解析:显存带宽与吞吐如何估算 DeepSeek-OCR 2适用场景清单:论文说明书与扫描件转可编辑文本 DeepSeek-OCR 2图表解析能力:知识库与报告生成的关键一环 DeepSeek-OCR 2开源更新背后:文档结构化输出成为新战场 DeepSeek-OCR 2快速上手:三种提示词覆盖OCR Markdown与定位 DeepSeek-OCR 2全解析:Visual Causal Flow动态分辨率工程脚本与局限

推荐工具

更多