OCR 文字识别
扫描件、表格、截图里的字得先被认出来,后面的问答才有意义。这里围绕版面分析、多语种识别与 PDF 结构化输出,也讨论 PaddleOCR、HunyuanOCR 这类模型的取舍。
OCR 早已不只是认字:版面要判断标题和表格边界,双栏内容要定阅读顺序,错一步下游问答就会拼出看似合理的假话。PaddleOCR 的 PP-StructureV3 负责版面与表格,HunyuanOCR 用约十亿参数覆盖街景与手写,DeepSeek-OCR 则把整页压成视觉 token 省上下文。
扫描件、表格、截图里的字得先被认出来,后面的问答才有意义。这里围绕版面分析、多语种识别与 PDF 结构化输出,也讨论 PaddleOCR、HunyuanOCR 这类模型的取舍。
OCR 是 Optical Character Recognition 的缩写,中文通常叫光学字符识别。它做的事情很直接:把图片里的字、扫描件里的字、截图里的字尽量变成机器能继续处理的文本。很多人以为 AI 能看懂 PDF,是模型直接把文档“读懂”了,但对大量扫描版 PDF、发票、表格截图来说,第一...
一、摘要 PaddleOCR 是基于飞桨(PaddlePaddle)的开源 OCR 与文档解析工具箱,面向图片与 PDF 的“文字识别 + 结构化抽取”。在 3.x 体系中,PP-OCRv5 覆盖通用文字检测与识别,PP-StructureV3 进一步提供复杂文档版面解析能力,可输出更接近原版式的结...
一、摘要 HunyuanOCR 是腾讯混元团队开源的端到端 OCR 专家模型,基于混元原生多模态架构与训练策略,仅用约 10 亿参数在 OCRBench(<3B 规模)与 OmniDocBench 上取得领先表现。模型覆盖文字检测、识别、版面理解与翻译等完整链路,兼顾精度与推理成本,适合在实际业务中...