Qwen3-VL 开源发布:256K–1M 长上下文与长视频事件精定位
一、摘要 Qwen3-VL 是阿里云 Qwen 团队开源的视觉-语言模型,面向图像、视频与文本的统一理解与推理。其亮点包括:原生 256K(可扩展至 1M)上下文、最长期约 2 小时视频的事件“精定位”、OCR 语种由 19 扩展至 32(含稀有字符与倾斜文本)、在真实场景风险检测上的领先表现;并展...
Ai开源 • Admin •
187
找到 2 篇相关文章
一、摘要 Qwen3-VL 是阿里云 Qwen 团队开源的视觉-语言模型,面向图像、视频与文本的统一理解与推理。其亮点包括:原生 256K(可扩展至 1M)上下文、最长期约 2 小时视频的事件“精定位”、OCR 语种由 19 扩展至 32(含稀有字符与倾斜文本)、在真实场景风险检测上的领先表现;并展...
通义千问推出新一代视觉语言模型 Qwen3-VL ,旗舰 Qwen3-VL-235B-A22B 以开源形式提供 Instruct 与 Thinking 两个版本。官方材料显示,Instruct 在多项视觉基准上优于 Gemini 2.5 Pro,Thinking 在多模态推理任务取得领先成绩。模型支...