ToolNavs 发现实用AI工具
提交工具 登录

Qwen3-VL

拆解阿里通义 Qwen3-VL 这条多模态模型线,从 2B 到 235B 的密集与 MoE 变体,讲清长视频事件定位、多语种 OCR 与图文检索各适合哪些场景。

Qwen3-VL 是阿里云通义团队开源的视觉语言模型系列,把图像、视频与文本放进同一套理解框架,原生 256K 上下文可扩展到 1M,长视频事件定位与 32 语种 OCR 是主要差异点。从 2B 轻量版到 235B-A22B、30B-A3B 的 MoE 组合,一条线覆盖端侧部署到多模态检索。