ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Perplexity stellt multimodale Embedding-Modelle als Open Source bereit: Text und Bilder teilen sich einen Suchraum

Perplexity stellt multimodale Embedding-Modelle als Open Source bereit: Text und Bilder teilen sich einen Suchraum

KI-Informationen • Admin • • 6 Aufrufe

Perplexitys neue Embedding-Modelle legen Text und Bilder in einen gemeinsamen Suchraum. Am 7. Oktober 2026 kündigte Perplexity-Chef Aravind Srinivas die quelloffene Veröffentlichung von pplx-embed-v2-late an; die Gewichte liegen unter MIT-Lizenz auf Hugging Face. Die Familie nutzt Multi-Vektor-Embeddings und erscheint in zwei Größen, 9B und 0.6B: Das größere Modell indiziert multimodales Material, das kleinere kann Anfragen direkt auf dem Gerät stellen, und weil beide denselben Embedding-Raum teilen, müssen Indizierung und Suche nicht dasselbe Modell verwenden.

Worin es sich von üblichen Embedding-Modellen unterscheidet

Die meisten Embedding-Modelle pressen einen ganzen Abschnitt in einen einzigen Vektor – schnell, aber Details gehen verloren. Ein Late-Interaction-Design behält dagegen einen 128-dimensionalen Vektor pro Token und gleicht bei der Anfrage jedes Anfragetoken mit seinem besten Gegenstück ab, ein Verfahren namens MaxSim. Der Preis sind größere Indizes und mehr Rechenaufwand; der Gewinn ist Präzision bei langen, technischen Anfragen. Laut Modellkarte bauen beide Modelle auf Qwen3.5 mit bidirektionaler Attention auf und wurden aus einem internen 18B-Lehrermodell destilliert.

PDF-Seiten ohne OCR durchsuchen ist der wichtigste Anwendungsfall

Nach Angaben von Perplexity kann das 9B-Modell multimodale Daten direkt indizieren, sodass PDF-Seiten so abgerufen werden, wie sie sind, statt zuvor per OCR in reinen Text verwandelt zu werden; zu den Werten, die Srinivas in seinem Beitrag zur Veröffentlichung nannte, gehören 92,4 % auf MADQA und 64 % auf BrowseComp+. Im öffentlichen ViDoRe-v3-Benchmark für visuelle Dokumentensuche meldet die Modellkarte nDCG@10-Werte von 65,2 % bei Bilddokumenten und 64,7 % bei Markdown für das 9B-Modell sowie 62,3 % beziehungsweise 61,2 % für das 0.6B-Modell. Das sind die vom Anbieter selbst berichteten Zahlen; eine unabhängige Nachmessung durch die Community steht noch aus.

Was das für Teams bedeutet, die RAG-Systeme bauen

Unternehmensdokumente wie Verträge und Handbücher sind der direkteste Einsatzbereich: Layoutinformationen wie Tabellen müssen nicht mehr erst eine OCR-Stufe überstehen, bevor die Suche überhaupt beginnt, und die Arbeitsteilung zwischen einem kleinen Anfragemodell auf dem Gerät und einem großen Indizierungsmodell senkt die laufenden Bereitstellungskosten. Einzupreisen ist die Indexgröße: Token-Vektoren brauchen deutlich mehr Speicher als ein Vektor pro Dokument, und die Abruf-Latenz muss neu gemessen werden. Ob sich der Wechsel lohnt, hängt davon ab, wie viel des Werts einer Sammlung in Bildern und Layout steckt statt in reinem Text.

Empfohlene Tools

Mehr