ToolNavs Outils IA à découvrir
Proposer Connexion

Qwen3-VL

Une analyse de la gamme multimodale Qwen3-VL d'Alibaba, des variantes Dense 2B aux versions MoE 235B, pour voir quelle taille convient au repérage d'événements vidéo longs, à l'OCR multilingue et à la recherche image-texte.

Qwen3-VL est la gamme vision-langage open source de l'équipe Qwen d'Alibaba, qui réunit images, vidéos et texte dans un même cadre de compréhension. Le contexte natif de 256K s'étend jusqu'à 1M, tandis que le repérage d'événements dans de longues vidéos et l'OCR en 32 langues constituent les principaux points forts. De la version légère 2B aux variantes MoE 235B-A22B et 30B-A3B, la gamme couvre le déploiement en périphérie et la recherche multimodale.