资讯

Google Launches Agentic Video Understanding for Gemini Flash Models, Cutting Video Tokens by Up to 88%

marktechpost.com·2026/9/5 04:37:25🔗 原文

📋总体概括

Google为Gemini Flash系列模型推出「智能体式视频理解」能力。传统做法以每秒1帧的速率将整段视频全部转为token输入模型,成本高且低效;新机制让模型像智能体一样主动导航视频,只加载与提示词相关的片段,可将视频token消耗削减最高88%。这标志着视频理解从被动全量编码转向按需检索式的agentic架构,在长视频分析场景下显著降低推理成本与延迟。

关键信息

  • Google面向Gemini Flash模型推出Agentic Video Understanding能力
  • 旧方案以1 FPS全量摄取视频,新方案仅加载提示词所需片段
  • 视频token消耗最高降低88%
  • 模式从被动整段编码转为模型主动导航视频的agentic架构
  • 适用于长视频场景,可显著节省推理成本与延迟

🔥犀利点评

88%的token削减数字亮眼,但本质上是把「笨办法」优化成「聪明办法」:以前模型硬啃全部帧,现在学会先检索再细看。这更像是工程效率的胜利而非范式突破,且按需加载意味着可能漏掉提示词未覆盖的关键信息,召回率代价几何Google没说。不过对视频理解商业化为时尚早的当下,能省88%成本就已足够让开发者侧目。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文