Perplexity의 새 임베딩 모델은 텍스트와 이미지를 하나의 검색 공간에 넣었다. 2026년 10월 7일, Perplexity CEO 아라빈드 스리니바스는 pplx-embed-v2-late의 오픈소스 공개를 발표했고, 가중치는 MIT 라이선스로 Hugging Face에 올라갔다. 다중 벡터 임베딩을 쓰는 모델군으로 9B와 0.6B 두 가지 크기가 있다. 큰 모델은 멀티모달 자료의 색인을 만들고, 작은 모델은 기기에서 질의를 실행할 수 있으며, 두 모델이 같은 임베딩 공간을 공유하므로 색인과 검색에 같은 모델을 쓸 필요가 없다.
일반 임베딩 모델과 무엇이 다른가
대부분의 임베딩 모델은 문단 전체를 벡터 하나로 압축한다. 빠르지만 세부 정보가 사라진다. 후기 상호작용(late-interaction) 방식은 토큰마다 128차원 벡터를 유지하고, 질의 시점에는 질의 토큰 각각에 대해 가장 잘 맞는 상대를 대조하는데, 이를 MaxSim 점수 계산이라 한다. 대가는 더 큰 색인과 더 많은 연산이며, 보상은 길고 기술적인 질의에서의 매칭 정확도다. 모델 카드에 따르면 두 모델 모두 Qwen3.5를 기반으로 양방향 어텐션을 사용하고, 내부 18B 교사 모델에서 증류됐다.
OCR 없이 PDF 페이지를 검색하는 것이 핵심 사용 사례
Perplexity에 따르면 9B 모델은 멀티모달 데이터를 직접 색인할 수 있어, PDF 페이지를 먼저 OCR로 일반 텍스트로 바꾸지 않고 있는 그대로 검색할 수 있다. 스리니바스가 공개 글에서 제시한 성적에는 MADQA 92.4%, BrowseComp+ 64%가 포함된다. 시각 문서 검색 공개 벤치마크 ViDoRe v3에서 모델 카드가 밝힌 nDCG@10은 9B 모델이 이미지 문서 65.2%, Markdown 64.7%이고, 0.6B 모델은 각각 62.3%와 61.2%다. 이는 공급자가 직접 밝힌 수치이며, 커뮤니티의 독립적인 재현은 아직 나오지 않았다.
RAG 시스템을 만드는 팀에게 주는 의미
계약서, 매뉴얼 같은 기업 문서 저장소가 가장 직접적인 적용 대상이다. 표 같은 레이아웃 정보가 검색이 시작되기도 전에 OCR 단계에서 사라지지 않고, 기기 측 소형 모델이 질의를, 대형 모델이 색인을 맡는 분업은 온라인 서빙 비용도 낮춘다. 예산에 넣어야 할 대가는 색인 크기다. 토큰 단위 벡터는 문서당 벡터 하나보다 훨씬 많은 저장 공간을 쓰고, 회수 지연 시간도 다시 측정해야 한다. 전환이 값을 하는지는 자료의 가치가 일반 텍스트가 아닌 이미지와 레이아웃에 얼마나 담겨 있는지에 달려 있다.