谷歌正在为其 Gemini Flash 系列模型引入基于代理的视频分析功能,该功能不再以固定帧率逐帧扫描视频,而是由模型自主决定分析哪些片段以及如何分析。据谷歌称,这一方法可削减高达 88% 的令牌用量,并将成本降低 66%,同时提升分析准确性。该功能现已通过 Gemini API 向开发者开放,适用于视频上传和 YouTube 视频,未来还将集成到 Gemini 应用及 YouTube 的“Ask YouTube”功能中。

此次更新覆盖 Gemini 3.7 Flash3.6 Flash3.5 Flash-Lite 三款模型。与以往默认每秒一帧的静态采样方式不同,新系统采用“代理式”处理:模型会自行判断需要查看哪些时间段的视频、以何种速度以及通过哪种模态(帧、音频或文本记录)进行分析,仅提取完成任务所需的时刻和信号。谷歌表示,这种方式能够捕捉到短于一秒的瞬间变化,例如状态切换或剪辑点,而这些在传统每秒一帧的扫描中很容易被遗漏,从而让自动化视频编辑更加精准。

对于长达数小时的视频素材,该功能也能高效定位特定场景,而无需消耗数百万个令牌。系统会通过以更高帧率重新采样可疑时间窗口来检测异常,并能准确统计重复动作和随时间变化的单个物体。在谷歌自家的 1H-VideoQALVBench 基准测试中,令牌用量下降了 88%,同时准确率还有所提升。

这一技术建立在谷歌于今年 1 月为 Gemini 3 Flash 推出的“代理视觉”(agentic vision)能力之上。该功能允许模型编写并运行 Python 代码来对图像进行缩放、裁剪和标注,并在响应前通过“思考-行动-观察”循环检查每一步结果。虽然该功能在推出初期并非在所有情况下都能自动运行,但为此次视频分析功能奠定了基础。早在去年 12 月发布 Gemini 3 Flash 时,谷歌就已预告视频的视觉与空间推理将是未来的能力方向。

效率提升在长视频场景中尤为明显,无论是 10 分钟的教程、90 分钟的讲座,还是数小时的录制内容。在静态处理模式下,开发者往往需要在高昂的令牌成本和可能丢失重要细节的方法之间做出取舍。而在谷歌自家的 LongVideoBench 等基准测试中,采用代理分析的 Gemini 3.7 Flash 在整体质量上得分最高,并在准确性与成本效率之间取得了最佳平衡。在 1H-VideoQA 评估中,Gemini 3.7 Flash 也以最低的单次查询成本实现了最高准确率。

目前,该功能已通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上线,支持视频上传和 YouTube 视频。开发者只需在 API 配置中将处理模式设置为“agentic”,即可按标准 Gemini API 令牌费率使用,无需额外付费。谷歌还计划将这一改进推广至自家产品:不久后,所有使用 Flash 和 Flash Lite 设备的 Gemini 应用用户都将能用上该功能;未来几个月内,代理式视频分析还将为播放页面上的“Ask YouTube”功能提供支持,使回答更贴合视频中实际可见的内容。

此次更新反映了谷歌在视频理解领域的技术路线调整——从固定的逐帧扫描转向更智能、更具选择性的分析方式。对于处理长视频或需要精准定位片段的开发者而言,这一变化有望显著降低计算成本并提升效率。不过,该功能目前仍处于早期应用阶段,其实际效果在不同场景下的表现仍有待更多开发者验证。