谷歌发布Gemini 3.8 Live,支持实时虚拟形象
6 小时前 1 阅读来源:blog.google
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌在9月24日正式发布Gemini 3.8 Live with Live Avatar,为其对话式AI装上了"一张会说话的脸"。这项功能将实时视频生成与语音对话原生耦合,让AI在说话时同步呈现精准的口型、自然的面部表情和流畅的对话轮转,不再只是"只闻其声"的语音助手。目前该功能已率先在Gemini Enterprise企业版中上线,普通消费者暂时还无法使用。
这次发布距离上周Gemini 3.8 Live的亮相仅隔一周,节奏相当紧凑。从技术路径看,Live Avatar的核心突破在于多模态的同步处理:它能同时接收视觉和音频输入,在近实时状态下生成带表情的音频和视频输出。更值得关注的是后台能力——通过异步工具调用(asynchronous tool calling),Avatar可以在对话不中断的情况下在后台触发工具、拉取数据,比如处理酒店入住登记这类复杂任务时,嘴上还在和客人聊天,后台已经把信息查完了。语言方面,该功能支持97种语言的语音到语音同步,且能在对话中途无缝切换语种,口型和表情会动态适配,不会出现画面漂移或清晰度下降。
对跨境电商和出海企业来说,这项功能的落点很明确:虚拟客服、互动导览、产品演示等场景可以做得更像"真人接待"。企业除了使用预设的多样化Avatar库,还能基于一张高质量参考图定制专属形象,保留品牌风格或角色特征,不过定制功能目前仅对企业白名单开放。安全层面,谷歌表示所有AI生成的音视频输出都嵌入了SynthID隐形水印,用于内容溯源、降低误传和冒用风险。对于正在寻找AI客服升级方案的出海团队,这相当于多了一个"有脸、能听、会说、还能后台干活"的选项,但企业版的门槛和定制白名单机制,意味着中小卖家短期内可能还难以直接接入。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
