AI评分 头条 (90)AI 中文改写
推出Gemini 3.8 Live与3.8 Live扩展思考版
1 天前 4 阅读来源:Google DeepMind Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌DeepMind于9月15日正式发布两款实时语音对话模型Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,号称是其迄今最先进的实时对话模型。两款模型即日起通过Gemini API、Google Workspace和Gemini应用向用户开放。核心卖点在于:语音交互不再是简单的"你问我答",而是能在对话过程中同步完成复杂推理、实时视觉理解和后台任务执行,且不会打断正在进行的对话。
两款模型的定位有明确分工。Gemini 3.8 Live主打规模和成本效率,面向需要大规模部署语音代理的开发者和企业,强调流畅对话和视觉 grounding(视觉锚定,即模型能结合摄像头画面等视觉信息理解语境)。Gemini 3.8 Live Extended Thinking则面向高复杂度任务,强化了多步推理能力,适合需要边思考边执行的企业级场景。在第三方评测中,Extended Thinking版本拿下了Artificial Analysis语音到语音质量指数第一名(82.6分),在τ-Voice代理任务完成度上得分68.6%,在Sierra的τ-Voice-banking银行场景基准上得分35.1%,Big Bench Audio推理测试得分97.7%。Gemini 3.8 Live则在Speech Agent Arena中排名第二,主打性价比。
对跨境电商卖家和出海团队来说,这次发布的实际意义在于语音AI代理的生产力门槛进一步降低。过去做多语言客服或语音导购,往往需要拼接语音识别、翻译、对话管理、任务执行等多个模块,延迟高、成本贵、体验割裂。Gemini 3.8 Live系列把这些能力整合到一个模型里,且支持对话中穿插后台任务处理——比如用户一边用语音咨询订单状态,AI一边在后台调用物流接口查询,全程不中断对话。对于需要覆盖多语种市场的卖家,这意味着可以用更低的工程成本搭建接近真人体验的语音客服或销售代理。不过目前这些能力主要面向开发者和企业通过API接入,中小卖家能否快速用上,还取决于后续是否有开箱即用的SaaS工具跟进。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
