ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Perplexity 开源多模态嵌入模型:文本和图片共用一个检索空间

Perplexity 开源多模态嵌入模型:文本和图片共用一个检索空间

AI资讯 • Admin • • 6 次浏览

Perplexity 的新嵌入模型把文本和图片放进了同一个检索空间。2026 年 10 月 7 日,Perplexity 首席执行官阿拉温德·斯里尼瓦斯宣布开源 pplx-embed-v2-late,权重已发布到 Hugging Face,采用 MIT 许可。这是一组多向量嵌入模型,包含 9B 与 0.6B 两个尺寸:大的负责给多模态资料建索引,小的可以跑在设备端发查询,两者共用同一套向量空间,建库和查询不必用同一个模型。

它和普通嵌入模型差在哪

普通嵌入模型把整段文本压成一个向量,快,但细节容易丢。pplx-embed-v2-late 用的是后期交互(late-interaction)做法:为每个 token 保留一个 128 维向量,查询时把问题里的每个词逐一去找最匹配的对应,用 MaxSim 方式打分。代价是索引体积和计算量都更大,换来的是长查询、技术文档这类场景下的匹配精度。模型卡显示,两个尺寸都基于 Qwen3.5 构建、使用双向注意力,并由一个内部 18B 教师模型蒸馏而来。

免 OCR 检索 PDF,是它最想打的场景

按 Perplexity 的介绍,9B 模型可以直接索引多模态数据,PDF 页面不必先做 OCR 转成纯文本,页面原样就能被检索。斯里尼瓦斯在发布帖中给出的成绩包括 MADQA 92.4%、BrowseComp+ 64%。在公开的 ViDoRe v3 视觉文档检索测试中,模型卡给出的 nDCG@10 为:9B 模型在图片类文档上 65.2%、Markdown 类 64.7%,0.6B 模型分别为 62.3% 和 61.2%。需要提醒的是,这些都是官方自报成绩,社区独立复现还没有跟上。

对做 RAG 的团队意味着什么

企业知识库、合同与手册检索是最直接的落点:表格、版面这类信息不必在 OCR 环节先丢一轮,端侧小模型发查询、大模型建索引的分工也能压低在线服务成本。要提前算的账是索引体积:token 级向量存进向量数据库后,占用空间远大于每篇文档一个向量,召回延迟也要重新测。值不值得换,取决于你的资料里图片和版式的占比有多高。

推荐工具

更多