Gemini 推出智能体式视频理解能力
Gemini 可自行判断视频中哪些时段值得细看,在提升检索准确率的同时,将词元消耗最多降低 88%。
让模型自己决定看哪里
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体式视频理解能力。与按照固定帧率扫描整段视频不同,模型会先结合音频、字幕和已有画面判断问题需要什么证据,再动态选择最值得检查的时段与画面。
这一过程类似调用工具。Gemini 可以跳转到特定时间点,在疑似关键事件附近提高采样密度,并在证据不足时重新查看视频。Google 称,与静态处理方式相比,这种选择性分析既能提高准确率,也可减少最多 88%的词元消耗。对会议记录、监控档案、体育赛事和教学录像等长视频场景而言,词元下降意味着成本降低,也意味着一次任务可以覆盖更长内容。
固定采样一直存在明显取舍:高帧率能够捕捉短暂事件,却会让长视频处理变得昂贵;低帧率虽然节省成本,却可能漏掉一个动作、物体或一闪而过的文字。自适应机制可以把计算量集中在信息密度高或模型不确定的片段,但也引入新的失败方式——如果模型一开始搜索错了位置,就可能永远看不到足以纠正判断的证据。
这项能力已通过上述 Flash 系列模型开放,Google 也发布了构建智能体视频分析流程的开发指南。此次更新针对视频理解而非视频生成,也不会自动把 Gemini 变成完整的监控系统;数据保存、权限控制、外部工具以及后续行动仍由开发者负责。
为何重要
长视频是成本最高的多模态输入之一,因为对某个具体问题而言,大多数画面都没有信息价值。让模型自行安排查看节奏,相当于把视频分析从逐帧处理转变为一种信息检索。只要开发者能够监测它何时漏掉关键瞬间,这种方式就可能让海量视频在无需预处理每一帧的情况下具备经济可行的搜索能力。