AI工具AI评分 头条 (78)AI 中文改写

推出Gemini智能体视频理解功能

1 天前 1 阅读来源:Google DeepMind Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

谷歌DeepMind今日正式推出Gemini系列模型的智能体视频理解功能,覆盖Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite三款最新模型。这项新能力让模型不再按固定帧率“盲读”整个视频,而是像人类分析师一样,带着目标去动态扫描、检索和核查视频中的关键片段,从而在提升准确率的同时,将视频分析的令牌消耗最高降低88%,成本最高降低66%。开发者即日起便可通过Google AI Studio或Gemini Enterprise Agent Platform,将API配置设为“agentic”模式直接使用。 这一功能的推出,直接回应了跨境电商和内容创作者在处理长视频时的核心痛点。过去,无论是分析竞品视频、审核直播回放,还是从数小时的教程中提取卖点,开发者都面临两难选择:要么按默认每秒1帧的静态处理方式烧掉大量令牌和费用,要么采用降采样技术导致关键细节丢失。智能体视频理解则打破了这种僵局——它让Gemini模型能够自主决定“看什么、以什么速度看、通过画面还是音频或字幕看”,只抓取真正需要的瞬间和信号。以Gemini 3.7 Flash为例,启用该功能后令牌消耗可锐减88%,准确率反而提升7%,在视频理解的准确率与成本比上达到了帕累托最优。 在具体应用场景上,这项技术为卖家带来了实实在在的效率升级。比如“亚秒级时刻检索”功能,可以帮你在长达90分钟的直播录像中,瞬间定位到某款产品被展示或讲解的那个瞬间,无需再手动拖拽进度条。异常检测和精确计数能力则适用于库存盘点视频、工厂质检录像等场景,能更准确地识别异常情况或清点商品数量。对于YouTube视频和本地上传的视频,Gemini都能通过API直接调用这些能力,这意味着你可以将竞品分析、用户生成内容(UGC)审核等流程自动化,大幅降低人工审核成本。从10分钟的操作指南到多小时的会议记录,长视频处理的门槛正在被显著拉低,而这对于依赖视频内容做选品、营销和运营决策的跨境卖家来说,无疑是一个值得立刻上手测试的新工具。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · Google DeepMind Blog

内容版权归原作者及 Google DeepMind Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容