OCR 是什么?为什么 AI 读扫描版 PDF、表格和截图前通常都得先过它
OCR 是 Optical Character Recognition 的缩写,中文通常叫光学字符识别。它做的事情很直接:把图片里的字、扫描件里的字、截图里的字尽量变成机器能继续处理的文本。很多人以为 AI 能看懂 PDF,是模型直接把文档“读懂”了,但对大量扫描版 PDF、发票、表格截图来说,第一...
AI百科 • Admin •
77
找到 3 篇相关文章
OCR 是 Optical Character Recognition 的缩写,中文通常叫光学字符识别。它做的事情很直接:把图片里的字、扫描件里的字、截图里的字尽量变成机器能继续处理的文本。很多人以为 AI 能看懂 PDF,是模型直接把文档“读懂”了,但对大量扫描版 PDF、发票、表格截图来说,第一...
扣子知识库上传失败,最容易让人误判成“文件坏了”,但公开 issue 里更常见的情况是:解析、embedding、存储这三层里的某一层没对齐。你会看到的报错可能是 num_rows 不一致、 column size not match 、 batch size is invalid ,也可能是加载 ...
Coze 知识库上传失败,最容易让人误判成“文件坏了”,但公开 issue 里更常见的情况是:解析、embedding、存储这三层里的某一层没对齐。你会看到的报错可能是 num_rows 不一致、 column size not match 、 batch size is invalid ,也可能是...