ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Qwen3.8-Omni-Flash发布:全模态AI开始直接执行音视频任务

Qwen3.8-Omni-Flash发布:全模态AI开始直接执行音视频任务

AI资讯 Admin 6 次浏览

Qwen 发布 Qwen3.8-Omni-Flash,将它定义为首个围绕代理能力构建的全模态模型。它不只处理文本、图像、音频和视频,还把理解、推理、规划与工具调用连到同一条工作流里,目标是让音视频 AI 从“看懂内容”进一步走向“把任务做完”。

从理解视频到执行任务

全模态模型过去的重点多是识别、问答和摘要,Qwen3.8-Omni-Flash 把重心推向执行。官方展示的场景包括自动剪辑视频日志、翻译短视频、生成电影摘要,以及围绕长视频持续调用工具完成多步任务。

阿里云文档显示,该模型支持 Function Calling、Web Search 和默认开启的推理模式,输入覆盖文本、图像、音频与视频,输出为文本。对开发者而言,这意味着音视频内容可以直接成为 Agent 的任务上下文,而不是单独的素材附件。

100万Token不只是“塞得更多”

Qwen3.8-Omni-Flash 提供 100万 Token 上下文。更关键的变化是“代理式观看”:面对长视频,模型可先粗粒度搜索,再主动定位需要细看的片段,而非把整段内容从头处理到尾。

Qwen 公布的 OmniVideoBench 数据显示,这种方式在提升准确率的同时显著减少 Token 消耗。官方还称,其在 WildClawBench-MM、UniClawBench 等代理评测上较上一代取得明显提升,音视频能力已逼近 Gemini 3.8 Flash,但这些结果目前仍主要来自厂商测试。

成本下降,插件开始补齐生态

价格可能比榜单更影响落地。Qwen 称,Qwen3.8-Omni-Flash 相比 Qwen3.5-Omni-Plus 大幅降低视频输入成本,让会议分析、长视频检索和持续型音视频 Agent 更容易从 Demo 进入高频调用。

同步开源的 Qwen-MM-Plugins 已覆盖视频转笔记、长视频记忆、视频剪辑和 Omni Skill Creator,并支持 Claude Code、Codex、Gemini CLI、OpenClaw、Qwen Code 等 Agent Harness。Qwen-Live Harness 则继续瞄准实时音视频交互与任务编排。

Qwen3.8-Omni-Flash 真正值得关注的并非“又一个更强多模态模型”,而是它开始把音视频理解变成 Agent 可持续调用的工作能力。下一轮竞争,很可能从谁看得更准,转向谁能以更低成本完成更长、更复杂的现实任务。

推荐工具

更多