Google 宣布在 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 上推出全新的「代理式影片理解(Agentic Video Understanding)」功能。這項技術結合 Gemini 的核心推理能力與原生影片工具,能動態搜尋、掃描與檢視影片中的特定片段,進一步降低影片分析所需的 Token 與成本,同時提升分析準確度。
突破傳統影片分析瓶頸
過去的「靜態」影片處理方式,通常讓模型以固定影格率讀取影片,預設為每秒 1 影格(FPS),開發者也可以透過 API 調整。這種方式在處理 10 分鐘的教學影片、90 分鐘的演講,甚至數小時的長時間錄影時,往往迫使開發者在高 Token 成本與遺漏關鍵細節之間做出取捨。
相較之下,代理式影片理解讓 Gemini 能夠採取主動、具目標導向的分析方式,自主判斷要檢視哪些影片片段、以何種速度或影格率分析,以及使用畫面、音訊或逐字稿等哪種訊號,只擷取完成任務所需的內容。
顯著的效率與效能提升
根據 Google 公布的基準測試,啟用代理式影片理解後:分析成本最高降低 66%、Token 消耗最高降低 88%、分析準確度最高提升 7%。這些效率提升在長篇影片中特別明顯,包括 10 分鐘教學影片、90 分鐘演講,以及數小時的錄影內容。

Google 表示,三款支援的模型都能獲得這些改善,其中 Gemini 3.7 Flash 在整體品質,以及品質與成本之間的平衡方面表現最佳,在測試模型中位於影片理解的 accuracy-to-cost Pareto frontier。
代理式影片理解可支援多種需要精準分析的影片處理情境:
- 次秒級時刻檢索:精準定位傳統 1 FPS 採樣容易錯過的瞬間狀態變化與剪輯邊界,進一步支援精確的自動影片剪輯。
- 長片大海撈針搜尋:在數小時影片中尋找特定資訊,而不需要消耗數百萬 Token。
- 異常偵測:針對感興趣的時間區段提高影格率重新取樣,以檢查快速動作與細微視覺異常。
- 動作與物件計數:精準追蹤影片中重複發生的動作,以及隨時間出現的不同物件。
Agentic Video Understanding 如何運作?
與固定影格率讀取影片的傳統方式不同,代理式影片理解讓 Gemini 可以透過 Agentic loop 主動決定要查看哪些內容,再呼叫內部工具載入影片中相關的部分。
開發者過去雖然也能手動實現類似流程,但現在 Gemini 可以自行完成這些步驟,因此能大幅降低開發者自行建構影片搜尋與分析流程的成本。

如何開始使用與未來布局
目前代理式影片理解已透過 Gemini API 在 Google AI Studio 與 Gemini Enterprise Agent Platform 上線,支援 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite,可分析上傳的影片以及 YouTube 影片。
這項功能採用標準 Gemini API Token 定價,不額外收取功能費用。開發者只需要在 API 設定中將處理模式設為 agentic 即可啟用。
Google 也表示,這項技術將逐步推廣至更多 Google 產品。近期將向 Gemini App 中使用 Flash 與 Flash-Lite 模型的所有使用者推出;接下來幾個月,代理式影片理解也將應用於 YouTube 影片觀看頁面的 Ask YouTube 功能,利用 Gemini 更準確地根據影片視覺內容回答使用者問題。
請注意!留言要自負法律責任,相關案例層出不窮,請慎重發文!