AI工具AI评分 头条 (76)AI 中文改写

谷歌博客:Gemini推出智能体视频理解功能

23 小时前 2 阅读来源:blog.google

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

谷歌DeepMind团队近日推出了一项名为“agentic video understanding(智能体视频理解)”的新功能,并已集成到Gemini 3.7 Flash、3.6 Flash以及3.5 Flash-Lite三款最新模型中。这项技术旨在解决当前AI处理长视频时面临的“高成本、低效率”痛点,通过让模型像人类一样主动“看”视频,而非被动“扫”视频,实现了成本与精度的双重优化。目前,开发者已可通过Google AI Studio或Gemini Enterprise Agent Platform将API配置切换至“agentic”模式,即刻体验这一新特性。 核心变化:从“静态抽帧”到“动态检索”的范式转变。过去,AI分析视频通常采用“静态处理”方式,即模型以固定的帧率(默认每秒1帧)机械地抽取画面进行分析。这种方式不仅消耗大量Token(数据令牌),且容易遗漏关键细节。而新的智能体视频理解功能,赋予了Gemini模型主动决策的能力。它不再盲目扫描所有画面,而是结合自身的推理能力与原生视频工具,动态地决定“看什么、以什么速度看、通过哪种模态(画面、音频或文字稿)看”,只精准抓取所需的关键瞬间和信号。这种“按需索取”的模式,从根本上改变了视频分析的资源消耗结构。 带来的直接效益是惊人的。根据谷歌公布的基准测试数据,启用该功能后,视频分析成本最高可降低66%,Token消耗量最高可减少88%,同时分析准确率还能提升高达7%。对于处理长视频(如10分钟的教学视频、90分钟的讲座或多小时的监控录像)的开发者而言,这一优势尤为明显。以往,处理这类视频往往面临两难选择:要么承担高昂的Token费用,要么使用会丢失关键细节的压缩技术。现在,智能体视频理解通过其“代理循环”机制,自动调用内部工具加载视频相关部分,不仅大幅降低了开发者的工作量,也解决了长视频处理的成本与精度矛盾。在具体应用场景上,该功能支持亚秒级时刻检索、更精准的异常检测以及精确计数等高级任务,为电商视频分析、内容审核、智能安防等领域打开了新的想象空间。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · blog.google

内容版权归原作者及 blog.google 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容