動察 Beating AI 快訊,Google 為 Gemini API 上線 Agentic Video Understanding。它讓模型自己決定看哪段視頻、怎麼檢查。普通模式默認按 1 FPS 固定抽幀,再一次性放進上下文。新模式會自己沿時間軸找片段,並按問題選擇畫面、音頻或轉錄文本。遇到快速動作,還能提高幀率重新檢查。
Google 自測稱,Gemini 3.7 Flash 開啟後,Token 消耗最高下降 88%,分析成本最高下降 66%,準確率相對提升最高約 7%。它能定位不到 1 秒的瞬間,也能在幾小時的視頻裡找一個細節。
技術上是把開發者以前要自己搭的「先定位、再精看」流程塞進 Gemini 內部。現在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 都支持。上傳視頻和 YouTube 視頻都能用,也不另收功能費。之後還會接入 Gemini App 和 YouTube 的 Ask YouTube。