Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解(agentic video understanding)能力。与此前类似结合代码执行与原生图像理解的智能体视觉技术一致,该功能利用 Gemini 的原生视频工具,在提升性能的同时解锁亚秒级时刻检索、异常检测与精确计数等视频处理能力。
从静态帧率到目标导向的动态分析
传统的“静态”处理方式要求模型以固定帧率(默认每秒 1 帧,可通过 API 调整)读取视频流。智能体视频理解则将模型的核心推理能力与原生视频工具结合,使 Gemini 能够主动决定观看内容、播放速度以及使用的模态(画面帧、音频或字幕),仅获取所需的片段与信号。
这一过程通过一个智能体循环实现:模型调用内部工具加载视频文件的相关部分,无需开发者手动编写分段逻辑,从而显著降低开发开销。
效率与准确率的量化表现
根据 Google DeepMind 公布的数据,在标准视频分析基准测试中,启用智能体视频理解的 Gemini 模型可将分析成本降低最高 66%,Token 消耗减少最高 88%,准确率提升最高 7%。这些效率增益在长视频场景中尤为明显——涵盖 10 分钟的教程、90 分钟的讲座乃至数小时的录像。在静态处理模式下,开发者往往需要在高昂的 Token 成本与丢失关键细节之间做出取舍。
在三款受支持的模型中,Gemini 3.7 Flash 结合智能体理解能力后,在质量与成本效率的组合上表现最优,位于所测模型的准确率-成本帕累托前沿。在 LongVideoBench 长视频理解基准测试中,该模型展现了大幅的 Token 削减与准确率提升。
支持的处理场景
智能体视频理解可应用于多种对长视频处理要求较高的场景:
- 亚秒级时刻检索:定位每秒 1 帧下容易遗漏的瞬间状态变化和剪辑边界,支持精确的自动化视频编辑。
- 长视频大海捞针式搜索:在数小时的视频中回答复杂查询,而无需消耗数百万 Token。
- 异常检测:对感兴趣的时间窗口以更高帧率重新采样,检查快速运动和细微视觉瑕疵。
- 动作与物体计数:随时间推移准确追踪重复的物理动作和独立物体。
使用方式与产品落地
该功能即日起通过 Google AI Studio 中的 Gemini API 及 Gemini Enterprise Agent Platform 提供,支持视频上传和 YouTube 视频。计费沿用标准 Gemini API Token 定价,不收取额外功能费用。开发者只需在 API 配置中将处理方式设为“agentic”即可启用。
在产品层面,智能体视频理解的效率与质量改进将逐步覆盖数十亿用户。该功能即将在 Gemini 应用的 Flash 和 Flash-Lite 模型中向所有用户推出。未来数月内,它还将驱动 YouTube 视频观看页面的“Ask YouTube”功能,利用 Gemini 提供基于视频画面的高质量回答。
