ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Perplexityがマルチモーダル埋め込みモデルをオープンソース化:テキストと画像が一つの検索空間に

Perplexityがマルチモーダル埋め込みモデルをオープンソース化:テキストと画像が一つの検索空間に

AI情報 • Admin • • 6 回閲覧

Perplexity の新しい埋め込みモデルは、テキストと画像を一つの検索空間に収めた。2026年10月7日、Perplexity の CEO アラヴィンド・スリニヴァス氏は pplx-embed-v2-late のオープンソース公開を発表し、重みは MIT ライセンスで Hugging Face に公開された。多ベクトル埋め込みを採用するモデル群で、9B と 0.6B の2サイズがある。大きい方はマルチモーダル資料のインデックス作成に、小さい方は端末側でクエリ発行に使え、両者が同じ埋め込み空間を共有するため、インデックスと検索で同じモデルを使う必要がない。

通常の埋め込みモデルと何が違うのか

一般的な埋め込みモデルは文章全体を一つのベクトルに圧縮する。高速だが細部は失われる。レイトインタラクション方式はトークンごとに128次元のベクトルを保持し、検索時にクエリ側の各トークンと最も合う相手を突き合わせる。MaxSim と呼ばれるスコア計算だ。代償としてインデックスは大きくなり計算も増えるが、長く技術的なクエリでの照合精度が上がる。モデルカードによれば、両モデルとも Qwen3.5 を基盤に双方向アテンションを用い、社内の18B教師モデルから蒸馏された。

OCRなしでPDFページを検索できることが最大の売り

Perplexity によれば、9B モデルはマルチモーダルデータを直接インデックス化でき、PDF ページを先に OCR でプレーンテキスト化しなくても、そのままの形で検索できる。スリニヴァス氏が公開投稿で示した成績には、MADQA で92.4%、BrowseComp+ で64%が含まれる。視覚文書検索の公開ベンチマーク ViDoRe v3 では、モデルカード上の nDCG@10 は9Bモデルが画像文書65.2%、Markdown 64.7%、0.6Bモデルがそれぞれ62.3%と61.2%だ。これらは提供元自身の公表値であり、コミュニティによる独立した再現はこれからになる。

RAGを構築するチームにとっての意味

契約書やマニュアルなどの企業文書が最も直接的な適用先になる。表などのレイアウト情報が、検索が始まる前の OCR 段階で失われずに済み、端末側の小モデルがクエリを担い、大モデルがインデックスを担う分業はオンライン提供コストも下げる。見積もるべき代償はインデックスの容量だ。トークン単位のベクトルは文書あたり一つのベクトルよりはるかに多くの保存領域を使い、呼び出しの遅延も測り直す必要がある。切り替えが見合うかどうかは、資料の価値がプレーンテキストではなく画像やレイアウトにどれだけ宿っているかで決まる。

おすすめツール

もっと見る