一段60分钟的视频,在传统多模态模型眼里意味着什么?几万token的无差别扫描。画面逐帧被翻译成符号,模型从头看到尾,token烧得飞快,账单也涨得飞快。Google DeepMind今天推出的agentic video understanding,正在改变这道数学题——让模型自己决定该看哪里、看多仔细。
视频理解的成本困境
固定帧率,AI时代的“无差别阅片”
传统视频理解方案遵循一套极其朴素的逻辑:每隔固定间隔抽一帧,逐帧送入模型处理。这套逻辑的优点是简单,缺点同样明显——大量计算被浪费在无关紧要的画面上。一段长达一小时的安全监控录像里,可能只有30秒涉及异常事件,但固定帧率模式依然会把这一个小时全部“读完”,token消耗与视频时长严格成正比。这不算智能,更像笨办法。
更麻烦的是,这种“无差别阅片”还会带来注意力稀释的问题。模型把宝贵的上下文窗口平均分配给所有画面,结果就是:该看仔细的没看够,不该看的花了大量算力。一套流程跑下来,成本花了,精度还没上去。
烧掉的token,熄火的应用
token消耗过高带来的直接后果,是应用在成本层面根本跑不通。做视频摘要的创业公司,可能光算力成本就吃掉了大半毛利。想做长视频分析的开发者,往往在报价阶段就被成本劝退。更尴尬的是,token消耗高还不一定换来准。大量冗余信息会稀释模型的注意力,关键事件反而被淹没。成本、效率、质量三个维度同时失控,这才是视频理解迟迟无法大规模落地的根本原因。
行业内不是没尝试过优化。有人用降分辨率压缩视频,有人用抽帧策略减少调用量,但都绕不开同一个死结:用户要的是对整段视频的理解,而模型只能看到固定帧率下的抽样画面。省了钱,丢了信息。这样的取舍,让视频理解类产品长期停留在“演示惊艳、商用寒酸”的状态。
Agentic模式:从“看完”到“看对”
动态扫描的底层逻辑
“Agentic”出现在功能名称里,不是营销话术,而是架构层面的转变。模型不再被动接收每一帧画面,而是主动扫描视频片段——就像一个真正的分析师,先快速浏览全局,再对关键区域深入观察。视频进来之后,模型先建立全局认知,判断哪些时间段值得深挖,然后集中算力处理这些片段,而不是把时间均匀浪费在每帧画面上。这套“先粗扫、再精读”的流程完全由模型自主决策,不需要人工预设任何规则。
核心突破在于,模型第一次能够对“如何看”这件事做出自己的判断。之前的视频理解,模型是观众,播放什么就看什么;现在的模型更像是导演——它在看之前就知道哪些画面重要,于是主动调整注意力分布。这种自主性,正是“agentic”这个词的分量所在。
三款型号,同一套新能力
这次功能覆盖了Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite三款模型。三者的定位各不相同:3.7 Flash主打综合性能与速度的平衡,3.6 Flash是性价比取向的日常选择,3.5 Flash-Lite则是轻量级场景的低成本入口。但无论定位如何,agentic video understanding的加入,都让开发者可以在不同级别的模型上获得同样的效率优势——不必为了省成本而牺牲能力,也不必为了性能而承受高不可攀的账单。
另一个值得注意的点:这三款模型覆盖了从轻量到主流的绝大多数开发场景。无论是做原型验证的个人开发者,还是跑大规模生产系统的团队,都能在这次更新里找到适合自己的选项。
88%、66%与7%的含金量
官方列出的核心指标是三个数字:相比固定帧率处理,token消耗最多降低88%,成本最多降低66%,准确率最多提升7%。这三个数字必须放在一起看才见真章。Token降低88%,意味着同等预算下能处理的视频量接近原来的9倍;成本降低66%,直接改写了许多应用的经济模型;准确率提升7%,则反驳了“省token必然牺牲质量”的直觉判断。
如果这三项提升在真实场景中能够稳定复现,长视频理解这个品类可能一夜之间就从“试试点”变成“能规模化的生意”。创业公司终于有机会给视频分析产品定出客户愿意买单的价格,而企业客户也终于不用在“看得清”和“花得起”之间做二选一。
开发者的选择题:换,还是不换?
这笔账怎么算
对开发者来说,最关心的永远是“关我什么事”。如果你正在用固定帧率模式处理大量视频,切换到agentic模式的账很好算:token省了,成本降了,准确率还涨了,几乎找不到不换的理由。但如果你处理的视频量很小,或者任务本质上需要均匀理解整段内容——比如逐帧标注某种持续出现的状态——那么固定帧率未必是坏选择。省token的前提是视频内容本身具有信息密度不均的特征,而大部分真实视频恰恰如此。结论很清晰:先用自己的真实数据跑一遍,再决定要不要全面切换。
另外一个容易被忽略的点是延迟。动态扫描意味着模型需要先做一轮快速浏览才能进入精读阶段,这会带来一定的推理延迟。对实时性要求极高的场景,比如直播流分析,需要评估这轮增加的延迟是否在可接受范围内。
上手门槛:一个开关的事
根据官方说明,开发者不需要复杂的配置就能启用这个功能。在API调用中调整相应参数即可,已有的应用逻辑不需要大改。对工程排期来说这是好消息——不用重构整个pipeline,先打开开关跑起来看效果,让数据自己说话。
Google这次的姿态也很务实:把模式开放出来,让开发者自己对比、自己判断,而不是宣称一套方案包打天下。这种“先跑了再说”的发布方式,某种程度上也反映出AI行业竞争节奏的变化——功能落地比概念包装更重要。
Agent视频能力:更大的棋局
从“看懂”到“会看”
“看懂”和“会看”是两个层次的问题。传统视频理解追求从画面中提取信息,而agentic video understanding追求用最合理的方式完成提取。这背后是一种完全不同的智能观:AI不该是仓库里埋头清点库存的搬运工,而该是站在货架前判断先拿什么的拣货员。当模型具备了“决定如何看”的能力,视频理解就从被动处理变成了主动认知行为。这一步,为更复杂的Agent任务打好了地基。
多模态Agent的军备竞赛
Google DeepMind在此时推出agentic video understanding,战略意图再明显不过。多模态Agent的竞争焦点正在从“能不能理解”转向“理解得有多高效”。OpenAI、Anthropic都在朝同一方向发力,但Google手里握着DeepMind的算法积累和YouTube级别的视频数据,两张牌的协同效应正在显现。
此次功能更新看似只是API里的一个新参数,实际上是在为Agent生态铺设水电煤——让未来的Agent不仅会看图说话,更能在海量视频中找到真正值得看的部分。这种“元能力”的储备,短期未必能直接量化成营收,但放到Agent全面落地的节点上看,迟早会变成核心竞争力。
视频理解,Agent场景的关键拼图
为什么说视频理解是Agent的关键拼图?因为Agent的大多数实际任务都发生在动态世界里——实时监控、设备巡检、物流调度、内容审核,这些场景的核心输入是视频流,而不是静态文本或图片。没有高效视频理解能力的Agent,就像没有视觉的工人,只能在黑暗中摸索。
而agentic video understanding恰好补上了这块拼图:它让Agent面对长视频时,具备了人类分析员那种“知道该看哪里”的判断力。当这种能力从Flash系列模型开始逐步覆盖更多产品线,视频Agent的规模化落地就不再是停留在PPT上的口号。

