ToolNavs 发现实用AI工具
提交工具 登录

OCR 文字识别

扫描件、表格、截图里的字得先被认出来,后面的问答才有意义。这里围绕版面分析、多语种识别与 PDF 结构化输出,也讨论 PaddleOCR、HunyuanOCR 这类模型的取舍。

OCR 早已不只是认字:版面要判断标题和表格边界,双栏内容要定阅读顺序,错一步下游问答就会拼出看似合理的假话。PaddleOCR 的 PP-StructureV3 负责版面与表格,HunyuanOCR 用约十亿参数覆盖街景与手写,DeepSeek-OCR 则把整页压成视觉 token 省上下文。