科技

Gemini视频分析最多省88% Token,但短片可能更慢

|作者: QUASA 编辑团队|2 分钟阅读| 4
Gemini视频分析最多省88% Token,但短片可能更慢

Google于2026年9月1日在Gemini API上线代理式视频理解。Google的上线公告 显示,该模式首发支持Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,可处理上传的视频和YouTube视频;在Google公布的长视频基准中,Token消耗最多减少88%。

对9月1日这次上线,更准确的理解不是“所有视频都便宜且更快”,而是模型获得了一种按问题选择读取内容的新方式。当前支持名单已经加入Gemini 3.8 Flash,但88%是特定对照测试的峰值;不足5分钟的短片还可能因为前置推理和工具往返增加首字延迟。

模型先定位片段,再按需读取内容

Gemini API先定位转录片段,再按需读取对应画面和音频

静态模式默认以1 FPS提取画面,并在一次处理中把固定采样结果放入上下文。9月3日更新的 Gemini API视频理解文档 列出另一条路径:Gemini 3.8 Flash、3.7 Flash、3.6 Flash和3.5 Flash Lite可动态浏览时间轴,按提示词选择转录、画面或音频,并在需要时调整帧率和分辨率。

因此,代理式处理改变的是信息进入上下文的顺序与范围,而不只是把固定帧率调低。模型可以先从转录或时间轴中寻找候选位置,再载入对应帧或音轨;对于快速动作,它还可以回看局部区间,而不必让整段视频始终维持同样的采样密度。

开启方式是在单个视频输入的processing字段中选择agentic;没有显式设置时仍使用static。响应steps数组中的processing_call和processing_result表示模型调用了内部视频处理工具,开发者也可以在同一次请求中为不同视频分别指定代理式或静态模式。

88%与约7%不是同一组最佳结果

Gemini 3.7 Flash的88% Token降幅与约7%质量提升来自不同基准

PPC Land对官方图表的逐项拆解 显示,对照均使用Gemini 3.7 Flash,静态基线采用高思考等级、低媒体分辨率和1 FPS:Minerva由80,900降至33,600 Token,降幅58.4%;1H-VideoQA由397,600降至47,700,LVBench由300,300降至36,000,后两项降幅均约88%。同一组图表中,准确率分别从73.7%升至79.0%、从87.5%升至88.5%、从85.1%升至88.6%;Google所称约7%的最高增幅对应Minerva的7.2%相对提升,而不是两项达到88% Token降幅的长视频测试。

标题中的“最多”是关键限定。在1H-VideoQA上,Token减少约88%,准确率只增加1个百分点;准确率提升最大的Minerva则只减少约58.4%的Token。两项宣传数字都能在这组测试中找到依据,但不能组合成一次典型请求会同时获得的结果。

比较起点同样重要。若现有系统已经降低静态采样率、预先截取候选片段,或使用不同媒体分辨率,其静态Token基线就不再等同于官方测试;88%不能直接作为预算折扣套用到这些工作负载。

Token下降不等于账单同比例下降

代理式模式的用量不再只由视频时长决定,还取决于内容复杂度、问题范围和模型的导航路径。初始提示和视频引用计入total_input_tokens,导航推理计入total_thought_tokens,按需载入的转录、帧与音频计入total_tool_use_tokens,答案计入total_output_tokens。评估一次请求时需要看这些字段的总和,而不是只比较最初的视频输入。

静态模式更容易预估:默认低媒体分辨率约为每秒100 Token,高分辨率约为每秒300 Token,并会随自定义FPS变化。代理式模式没有同样稳定的“时长乘单价”关系,因为同一段视频面对不同问题,可能打开数量不同的片段和模态。

Google还给出分析成本最多降低66%的上限,但公开材料没有提供足以按三个基准逐项重算该数字的完整成本表。88%的Token峰值与66%的成本峰值是不同指标;输出、思考和工具调用的构成不同,最终费用也不会必然与视频Token按相同比例变化。

短片和全程精确采样仍应保留静态模式

短视频中代理式导航增加首字等待,而静态处理直接按固定帧率读取

所谓短片“更慢”,准确地说是首字延迟可能增加,并不等于每个短视频的总处理时间必然更长。代理式模式要在生成答案前完成导航推理和工具往返;对于不足5分钟的内容,这段固定开销可能抵消少读画面所节省的时间。

  • 长视频或定点检索:问题只涉及少数时刻,或需要在候选区间提高帧率时,代理式模式更符合任务结构。
  • 短片且延迟敏感:如果首个Token出现时间比上下文节省更重要,静态模式避免了前置导航。
  • 全片帧级一致性:需要按统一FPS覆盖整段内容、比较连续采样点,或自行控制截取区间时,应继续使用静态模式。
  • 成本评估:不能只记录输入Token;两种模式应在相同素材、问题、模型和分辨率下比较完整用量字段。

固定1 FPS也有自身局限:快速动作或短暂状态变化可能落在采样点之间。选择静态模式意味着获得可控、可复现的覆盖方式,并不代表它天然具有更高的时间精度;需要更密采样时,Token和延迟也会随之上升。

现有证据支持分流,不支持全面替换

目前可以确定的是,代理式视频理解已经进入Gemini API,支持范围扩展到四款Flash系列模型,长视频测试出现了最高88%的Token降幅;短视频首字延迟风险也已写入开发文档。它适合把长时间录像中的少量相关片段从完整上下文中分离出来,但不是静态模式的无条件升级。

仍缺少的是跨更多视频长度、提示类型和模型的完整延迟分布,以及能够复算66%成本上限的逐基准明细。在这些数据公开前,最稳妥的结论是按视频长度、所需覆盖精度和延迟目标分流:长视频与定点问题优先比较代理式模式,短片、首字延迟敏感和全程固定采样任务保留静态基线。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0