HeadlinesBriefing favicon HeadlinesBriefing.com

谷歌DeepMind为Gemini推出代理式视频理解

Google DeepMind Blog •
×

谷歌DeepMind已在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型中推出代理式视频理解功能,将token消耗降低高达88%,成本降低高达66%,精度提升高达7%。与固定帧率的静态处理不同,此功能使Gemini能够通过代理循环动态搜索、扫描和检查视频片段,覆盖视觉帧、音频和转录文本。

基准测试显示,效率提升在长格式内容上最为显著——从10分钟的指南到多小时的录制——此前开发者在这些场景中常面临高token成本与细节丢失之间的权衡。具备代理理解能力的Gemini 3.7 Flash如今位于视频分析的精度-成本帕累托前沿。

关键能力包括:亚秒级时刻检索用于精准编辑;跨多小时视频的“大海捞针”搜索;通过高FPS重采样进行异常检测;以及动作和物体的精准计数。早期访问合作伙伴报告了强劲结果。该功能今日通过Gemini API在Google AI Studio和Gemini企业代理平台上可用,支持视频上传和YouTube视频处理。

关键实体:公司:Google DeepMind, Google AI Studio, Gemini企业代理平台 | 人物:Mario Lučić

FAQ:代理式视频理解如何相比静态处理降低token使用?

与固定帧率摄入视频不同,代理式视频理解让Gemini能够动态获取仅需回答查询的相关帧、音频或转录片段,从而在长格式视频上将token消耗降低高达88%。