Les modèles de langage visuel, ou VLM, sont parmi les modèles les plus évoqués récemment. Beaucoup de gens le confondent avec le « modèle multimodal », mais en réalité, la relation entre les deux est très proche, mais pas exactement la même. La VLM souligne que le modèle peut traiter à la fois les images et le texte, et intégrer les informations visuelles et verbales dans le même processus de compréhension et de génération. Pour cette raison, il est largement utilisé dans des situations telles que la Q&A d’images, la compréhension des documents, la description d’images, la récupération visuelle et la compréhension d’interfaces.
Si les grands modèles de langage ordinaires ne sont bons qu’en texte, alors le développement central de la VLM est de « faire en sorte que le modèle soit vraiment lu ». Il peut non seulement lire ce qui se trouve dans une image, mais aussi juger les points clés en fonction de vos problèmes de texte, c’est pourquoi sa valeur dans les applications pratiques ne cesse de croître.
Quelle est sa relation avec les modèles multimodaux ?
Les modèles multimodaux sont des concepts plus larges qui peuvent inclure plusieurs entrées telles que du texte, des images, de l’audio, de la vidéo, etc. ; VLM ressemble davantage à une branche qui se concentre sur la « vision + langage ». Autrement dit, tous les modèles multimodaux ne sont pas égaux aux VLM, mais beaucoup peuvent être classés comme multimodaux.
Pourquoi VLM reçoit une attention particulière en ce moment
Parce qu’un grand nombre de scènes réelles ne sont pas du texte brut. Les utilisateurs téléchargent des captures d’écran, scannent des contrats, analysent des images produit, lisent des tableaux et comprennent des graphiques, ce qui nécessite que le modèle comprenne à la fois la vision et le langage, plutôt que de forcer à convertir les images en texte avant le traitement.
Quelles sont les applications courantes ?
- Dépannage des captures d’écran et compréhension de l’interface
- Pages de documents, formulaires et identification du billet
- Description de l’image, séance de questions-réponses visuelles et récupération
- Compréhension visuelle chez les bots et agents
Ainsi, l’importance des modèles de langage visuel ne réside pas dans le fait qu’ils « regardent simplement des images », mais qu’ils permettent à l’IA de traiter l’information du monde réel plus naturellement. C’est aussi l’un des fondements fondamentaux de nombreux produits d’IA multimodaux de nouvelle génération.