AI评分 头条 (89)AI 中文改写
谷歌发布Gemini 3.8 Live及扩展思考版
1 天前 3 阅读来源:blog.google
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌在9月15日正式发布了两款全新的实时语音对话模型——Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking。按照谷歌官方博客的说法,这是其迄今为止最先进的实时对话模型,核心升级集中在智能水平和并行推理能力上,目标是让用户通过语音就能完成复杂任务,同时保持对话的自然流畅。两款模型即日起通过Gemini API、Google Workspace和Gemini应用向用户开放。
两款模型的定位有明确分工。Gemini 3.8 Live主打规模化与成本效率,将对话智能与流畅的语音交互、实时视觉理解结合在一起,适合需要快速响应、大批量部署的场景。Gemini 3.8 Live Extended Thinking则面向高复杂度任务,强调更强的智能水平和多步推理能力,能够在对话不中断的情况下在后台调用工具、执行任务。换句话说,前者解决的是"聊得快、聊得便宜",后者解决的是"聊得深、干得成"。
从跑分来看,谷歌这次拿出了不少硬数据。Gemini 3.8 Live Extended Thinking在Artificial Analysis的语音到语音质量指数上拿到82.6分,位列总榜第一;在衡量智能体任务完成能力的τ-Voice基准上得分68.6%,在Sierra的τ-Voice-banking基准上得分35.1%,均处于领先位置。推理能力方面,该模型在Big Bench Audio上取得97.7%的成绩,同时谷歌强调其价格相比其他前沿模型仍具竞争力。Gemini 3.8 Live则在Speech Agent Arena中排名第二,用户偏好度较高,成本效益是其主打卖点。在ServiceNow用于评估语音智能体的EVA-Bench上,两款模型在复杂工作流场景中成功推动了帕累托前沿的扩展。
对开发者和企业客户而言,这次发布的意义在于语音智能体的落地门槛进一步降低。过去做语音AI应用,往往要在响应速度、推理深度和成本之间三选二,而谷歌试图用两款模型分别覆盖"走量"和"走质"两条路线。对国内出海团队来说,如果正在做客服机器人、语音助手或跨境场景下的多语言交互产品,这两款模型值得纳入技术选型的比较清单。不过需要注意的是,语音智能体的实际表现高度依赖网络延迟和本地化语音数据的适配,跑分领先不等于落地体验一定领先,建议先通过Gemini API做小规模验证再决定是否接入生产环境。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
