ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Perplexity publie ses modèles d'embedding multimodaux en open source : textes et images partagent un même espace de recherche

Perplexity publie ses modèles d'embedding multimodaux en open source : textes et images partagent un même espace de recherche

Informations sur l’IA • Admin • • 6 vues

Les nouveaux modèles d'embedding de Perplexity placent textes et images dans un seul espace de recherche. Le 7 octobre 2026, le PDG de Perplexity, Aravind Srinivas, a annoncé la publication en open source de pplx-embed-v2-late, dont les poids sont disponibles sur Hugging Face sous licence MIT. La famille repose sur des embeddings multi-vecteurs et se décline en deux tailles, 9B et 0.6B : le grand modèle indexe les contenus multimodaux, le petit peut émettre des requêtes directement sur l'appareil, et comme les deux partagent le même espace d'embedding, l'indexation et la recherche n'ont pas à utiliser le même modèle.

Ce qui le distingue des modèles d'embedding ordinaires

La plupart des modèles d'embedding compressent tout un passage en un seul vecteur : c'est rapide, mais le détail se perd. Une architecture à interaction tardive conserve au contraire un vecteur de 128 dimensions par token et, au moment de la requête, confronte chaque token de la question à son meilleur correspondant — un calcul appelé MaxSim. Le prix à payer : des index plus volumineux et davantage de calcul ; le gain : une précision d'appariement sur les requêtes longues et techniques. Selon la fiche du modèle, les deux tailles reposent sur Qwen3.5 avec attention bidirectionnelle et ont été distillées à partir d'un modèle enseignant interne de 18B.

Chercher dans des pages PDF sans OCR, voilà l'usage mis en avant

D'après Perplexity, le modèle 9B peut indexer directement des données multimodales : les pages PDF sont retrouvées telles quelles, sans être d'abord aplaties en texte brut par OCR. Parmi les scores cités par Srinivas dans son message de lancement figurent 92,4 % sur MADQA et 64 % sur BrowseComp+. Sur le benchmark public ViDoRe v3, dédié à la recherche dans les documents visuels, la fiche du modèle affiche un nDCG@10 de 65,2 % sur les documents images et 64,7 % sur le Markdown pour le modèle 9B, et respectivement 62,3 % et 61,2 % pour le 0.6B. Ce sont les chiffres publiés par l'éditeur lui-même ; leur reproduction indépendante par la communauté reste à venir.

Ce que cela change pour les équipes qui construisent des systèmes RAG

Les fonds documentaires d'entreprise — contrats, manuels, procédures — sont le terrain le plus direct : les informations de mise en page, comme les tableaux, n'ont plus à survivre à une étape d'OCR avant même que la recherche commence, et la répartition entre un petit modèle de requête sur l'appareil et un grand modèle d'indexation réduit les coûts de service en ligne. La contrepartie à budgéter est la taille de l'index : les vecteurs par token occupent bien plus d'espace qu'un vecteur unique par document, et la latence de rappel doit être remesurée. L'intérêt du basculement dépend de la part de la valeur d'un fonds qui réside dans les images et la mise en page plutôt que dans le texte brut.

Outils Recommandés

Plus