OCR 是什么?为什么 AI 读扫描版 PDF、表格和截图前通常都得先过它
OCR 是 Optical Character Recognition 的缩写,中文通常叫光学字符识别。它做的事情很直接:把图片里的字、扫描件里的字、截图里的字尽量变成机器能继续处理的文本。很多人以为 AI 能看懂 PDF,是模型直接把文档“读懂”了,但对大量扫描版 PDF、发票、表格截图来说,第一...
AI百科 • Admin •
77
找到 3 篇相关文章
OCR 是 Optical Character Recognition 的缩写,中文通常叫光学字符识别。它做的事情很直接:把图片里的字、扫描件里的字、截图里的字尽量变成机器能继续处理的文本。很多人以为 AI 能看懂 PDF,是模型直接把文档“读懂”了,但对大量扫描版 PDF、发票、表格截图来说,第一...
视觉语言模型,也就是 VLM,是最近讨论度很高的一类模型。很多人会把它和“多模态模型”混着说,其实两者关系很近,但不完全一样。VLM 更强调模型能够同时处理图像和文本,并把视觉信息和语言信息放进同一个理解与生成过程里。也正因为这样,它被广泛用在看图问答、文档理解、图像描述、视觉检索和界面理解等场景里...
多模态模型这个词最近经常出现在 AI 产品介绍里,但很多人其实并不清楚它到底比普通聊天模型多了什么能力。简单说,多模态模型不是只理解文字,它还能同时处理图片、语音、视频甚至文档页面等不同类型的信息,再把这些内容放到同一个推理过程里。也正因为这样,它和只能处理文本的 AI 在使用场景上会有明显差别。 ...