谷歌正在為其 Gemini Flash 系列模型引入基於代理的影片分析功能,該功能不再以固定幀率逐幀掃描影片,而是由模型自主決定分析哪些片段以及如何分析。據谷歌稱,這一方法可削減高達 88% 的令牌用量,並將成本降低 66%,同時提升分析準確性。該功能現已通過 Gemini API 向開發者開放,適用於影片上傳和 YouTube 影片,未來還將整合到 Gemini 應用及 YouTube 的“Ask YouTube”功能中。
此次更新覆蓋 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型。與以往預設每秒一幀的靜態取樣方式不同,新系統採用“代理式”處理:模型會自行判斷需要檢視哪些時間段的影片、以何種速度以及通過哪種模態(幀、音訊或文本記錄)進行分析,僅提取完成任務所需的時刻和訊號。谷歌表示,這種方式能夠捕捉到短於一秒的瞬間變化,例如狀態切換或剪輯點,而這些在傳統每秒一幀的掃描中很容易被遺漏,從而讓自動化影片編輯更加精準。
對於長達數小時的影片素材,該功能也能高效定位特定場景,而無需消耗數百萬個令牌。系統會通過以更高幀率重新取樣可疑時間視窗來檢測異常,並能準確統計重複動作和隨時間變化的單個物體。在谷歌自家的 1H-VideoQA 和 LVBench 基準測試中,令牌用量下降了 88%,同時準確率還有所提升。
這一技術建立在谷歌於今年 1 月為 Gemini 3 Flash 推出的“代理視覺”(agentic vision)能力之上。該功能允許模型編寫並執行 Python 程式碼來對影像進行縮放、裁剪和標註,並在響應前通過“思考-行動-觀察”迴圈檢查每一步結果。雖然該功能在推出初期並非在所有情況下都能自動執行,但為此次影片分析功能奠定了基礎。早在去年 12 月釋出 Gemini 3 Flash 時,谷歌就已預告影片的視覺與空間推理將是未來的能力方向。
效率提升在長影片場景中尤為明顯,無論是 10 分鐘的教程、90 分鐘的講座,還是數小時的錄製內容。在靜態處理模式下,開發者往往需要在高昂的令牌成本和可能丟失重要細節的方法之間做出取捨。而在谷歌自家的 LongVideoBench 等基準測試中,採用代理分析的 Gemini 3.7 Flash 在整體質量上得分最高,並在準確性與成本效率之間取得了最佳平衡。在 1H-VideoQA 評估中,Gemini 3.7 Flash 也以最低的單次查詢成本實現了最高準確率。
目前,該功能已通過 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上線,支援影片上傳和 YouTube 影片。開發者只需在 API 配置中將處理模式設定為“agentic”,即可按標準 Gemini API 令牌費率使用,無需額外付費。谷歌還計劃將這一改進推廣至自家產品:不久後,所有使用 Flash 和 Flash Lite 裝置的 Gemini 應用使用者都將能用上該功能;未來幾個月內,代理式影片分析還將為播放頁面上的“Ask YouTube”功能提供支援,使回答更貼合影片中實際可見的內容。
此次更新反映了谷歌在影片理解領域的技術路線調整——從固定的逐幀掃描轉向更智慧、更具選擇性的分析方式。對於處理長影片或需要精準定位片段的開發者而言,這一變化有望顯著降低計算成本並提升效率。不過,該功能目前仍處於早期應用階段,其實際效果在不同場景下的表現仍有待更多開發者驗證。