资讯
Google Launches Agentic Video Understanding for Gemini Flash Models, Cutting Video Tokens by Up to 88%
📋总体概括
Google为Gemini Flash系列模型推出「智能体式视频理解」能力。传统做法以每秒1帧的速率将整段视频全部转为token输入模型,成本高且低效;新机制让模型像智能体一样主动导航视频,只加载与提示词相关的片段,可将视频token消耗削减最高88%。这标志着视频理解从被动全量编码转向按需检索式的agentic架构,在长视频分析场景下显著降低推理成本与延迟。
⚡关键信息
- ▸Google面向Gemini Flash模型推出Agentic Video Understanding能力
- ▸旧方案以1 FPS全量摄取视频,新方案仅加载提示词所需片段
- ▸视频token消耗最高降低88%
- ▸模式从被动整段编码转为模型主动导航视频的agentic架构
- ▸适用于长视频场景,可显著节省推理成本与延迟
🔥犀利点评
88%的token削减数字亮眼,但本质上是把「笨办法」优化成「聪明办法」:以前模型硬啃全部帧,现在学会先检索再细看。这更像是工程效率的胜利而非范式突破,且按需加载意味着可能漏掉提示词未覆盖的关键信息,召回率代价几何Google没说。不过对视频理解商业化为时尚早的当下,能省88%成本就已足够让开发者侧目。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →