ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Gemini 推出智能体式视频理解:长视频分析不再逐帧硬看

Gemini 推出智能体式视频理解:长视频分析不再逐帧硬看

AI资讯 Admin 5 次浏览

2026 年 9 月 1 日,Google DeepMind 在官方博客发布 Gemini 智能体式视频理解能力,首批覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。变化不只是“模型能看视频”,而是它不再必须按固定帧率把大量无关画面一并送入上下文。

它不是“多看几帧”,而是先决定看哪里

传统视频分析通常按固定帧率抽帧,Gemini API 的静态处理默认是每秒 1 帧。面对长教程、讲座或数小时录像,这种做法要么消耗大量 token,要么因降低采样密度而错过短暂动作。

新能力把推理与原生视频工具结合起来。模型会围绕问题动态搜索、扫描和重看片段,并在画面、音频与转写文本之间选择所需信号。定位一秒内发生的变化时,它可以提高局部采样率;寻找一句关键表述时,则不必把全片逐段精读。这也是 AI Agent 和固定工作流的区别:模型开始决定下一步调用什么工具。

“最多节省 88% token”不能当成固定折扣

Google 公布的标准视频分析基准显示,开启后 token 消耗最多下降 88%,分析成本最多下降 66%,准确率最多提升 7%。这些数字都有“最多”条件,且来自特定模型、视频长度和问题类型,不能直接套到每个业务。更可靠的做法是拿自己的视频与查询集合做 A/B 测试,同时记录 token、延迟、召回率和错误定位。

官方认为 Gemini 3.7 Flash 在测试模型中给出了更好的准确率与成本组合;短视频或只做粗略摘要的任务,未必获得同等收益。优势更可能出现在快速动作、异常检测、精确计数和跨数小时检索。相关能力边界可参考站内的 多模态模型实际用途梳理

开发者接入前先做四项检查

该功能已支持上传视频和 YouTube 视频,入口包括 Google AI Studio 的 Gemini API 与 Gemini Enterprise Agent Platform。把视频处理方式设为 agentic 即可启用,不另收功能费,但仍按常规 API token 计费。

上线前要确认:业务是否需要定位细节而非只做摘要;答案是否应带时间点供人工复核;音频、字幕和画面冲突时采用什么规则;批量任务是否有成本与时长上限。Google 计划随后把能力带到 Gemini 应用和 YouTube 的 Ask YouTube,当前不能把 API 可用等同于所有终端都已上线。

推荐工具

更多