据Android Authority报道,谷歌9月2日宣布为Gemini推出“智能体视频理解”功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite等最新模型。该功能允许用户上传视频交予人工智能分析,与以往的静态处理方式相比,token用量最多降低88%,准确率最多提升7%。

此前,用户已经可以向Gemini上传视频,但系统只能执行谷歌所称的“静态”处理,也就是将视频拆分成单个帧,导致处理速度较慢、成本较高。新的智能体视频理解功能让Gemini自行决定关注哪些内容以及以何种速度观看,并可在画面、音轨和文字记录之间选择,从而更高效地解析视频。

报道称,Gemini能够捕捉亚秒级变化,回答涉及多个小时视频内容的复杂问题,检查视频中的视觉伪影,并统计和追踪物体与物理运动。该功能目前仅通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform提供。谷歌表示,该功能很快会向Gemini应用推送。谷歌还计划将智能体视频理解用于支持YouTube的“Ask YouTube”功能,使创作者更便捷地借助Gemini分析视频。