谷歌博客:Gemini推出智能体视频理解功能
23 小时前 2 阅读来源:blog.google
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌DeepMind团队近日推出了一项名为“agentic video understanding(智能体视频理解)”的新功能,并已集成到Gemini 3.7 Flash、3.6 Flash以及3.5 Flash-Lite三款最新模型中。这项技术旨在解决当前AI处理长视频时面临的“高成本、低效率”痛点,通过让模型像人类一样主动“看”视频,而非被动“扫”视频,实现了成本与精度的双重优化。目前,开发者已可通过Google AI Studio或Gemini Enterprise Agent Platform将API配置切换至“agentic”模式,即刻体验这一新特性。
核心变化:从“静态抽帧”到“动态检索”的范式转变。过去,AI分析视频通常采用“静态处理”方式,即模型以固定的帧率(默认每秒1帧)机械地抽取画面进行分析。这种方式不仅消耗大量Token(数据令牌),且容易遗漏关键细节。而新的智能体视频理解功能,赋予了Gemini模型主动决策的能力。它不再盲目扫描所有画面,而是结合自身的推理能力与原生视频工具,动态地决定“看什么、以什么速度看、通过哪种模态(画面、音频或文字稿)看”,只精准抓取所需的关键瞬间和信号。这种“按需索取”的模式,从根本上改变了视频分析的资源消耗结构。
带来的直接效益是惊人的。根据谷歌公布的基准测试数据,启用该功能后,视频分析成本最高可降低66%,Token消耗量最高可减少88%,同时分析准确率还能提升高达7%。对于处理长视频(如10分钟的教学视频、90分钟的讲座或多小时的监控录像)的开发者而言,这一优势尤为明显。以往,处理这类视频往往面临两难选择:要么承担高昂的Token费用,要么使用会丢失关键细节的压缩技术。现在,智能体视频理解通过其“代理循环”机制,自动调用内部工具加载视频相关部分,不仅大幅降低了开发者的工作量,也解决了长视频处理的成本与精度矛盾。在具体应用场景上,该功能支持亚秒级时刻检索、更精准的异常检测以及精确计数等高级任务,为电商视频分析、内容审核、智能安防等领域打开了新的想象空间。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
