Perplexitys neue Embedding-Modelle legen Text und Bilder in einen gemeinsamen Suchraum. Am 7. Oktober 2026 kündigte Perplexity-Chef Aravind Srinivas die quelloffene Veröffentlichung von pplx-embed-v2-late an; die Gewichte liegen unter MIT-Lizenz auf Hugging Face. Die Familie nutzt Multi-Vektor-Embeddings und erscheint in zwei Größen, 9B und 0.6B: Das größere Modell indiziert multimodales Material, das kleinere kann Anfragen direkt auf dem Gerät stellen, und weil beide denselben Embedding-Raum teilen, müssen Indizierung und Suche nicht dasselbe Modell verwenden.
Worin es sich von üblichen Embedding-Modellen unterscheidet
Die meisten Embedding-Modelle pressen einen ganzen Abschnitt in einen einzigen Vektor – schnell, aber Details gehen verloren. Ein Late-Interaction-Design behält dagegen einen 128-dimensionalen Vektor pro Token und gleicht bei der Anfrage jedes Anfragetoken mit seinem besten Gegenstück ab, ein Verfahren namens MaxSim. Der Preis sind größere Indizes und mehr Rechenaufwand; der Gewinn ist Präzision bei langen, technischen Anfragen. Laut Modellkarte bauen beide Modelle auf Qwen3.5 mit bidirektionaler Attention auf und wurden aus einem internen 18B-Lehrermodell destilliert.
PDF-Seiten ohne OCR durchsuchen ist der wichtigste Anwendungsfall
Nach Angaben von Perplexity kann das 9B-Modell multimodale Daten direkt indizieren, sodass PDF-Seiten so abgerufen werden, wie sie sind, statt zuvor per OCR in reinen Text verwandelt zu werden; zu den Werten, die Srinivas in seinem Beitrag zur Veröffentlichung nannte, gehören 92,4 % auf MADQA und 64 % auf BrowseComp+. Im öffentlichen ViDoRe-v3-Benchmark für visuelle Dokumentensuche meldet die Modellkarte nDCG@10-Werte von 65,2 % bei Bilddokumenten und 64,7 % bei Markdown für das 9B-Modell sowie 62,3 % beziehungsweise 61,2 % für das 0.6B-Modell. Das sind die vom Anbieter selbst berichteten Zahlen; eine unabhängige Nachmessung durch die Community steht noch aus.
Was das für Teams bedeutet, die RAG-Systeme bauen
Unternehmensdokumente wie Verträge und Handbücher sind der direkteste Einsatzbereich: Layoutinformationen wie Tabellen müssen nicht mehr erst eine OCR-Stufe überstehen, bevor die Suche überhaupt beginnt, und die Arbeitsteilung zwischen einem kleinen Anfragemodell auf dem Gerät und einem großen Indizierungsmodell senkt die laufenden Bereitstellungskosten. Einzupreisen ist die Indexgröße: Token-Vektoren brauchen deutlich mehr Speicher als ein Vektor pro Dokument, und die Abruf-Latenz muss neu gemessen werden. Ob sich der Wechsel lohnt, hängt davon ab, wie viel des Werts einer Sammlung in Bildern und Layout steckt statt in reinem Text.