Gemini 3.8语音合成功能上线
1 天前 2 阅读来源:Google DeepMind Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
Google DeepMind 在 9 月 23 日发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,官方称这是其迄今表现力最强的音频生成模型。两款模型已在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 五个平台同步上线,意味着开发者、内容创作者和企业用户可以直接调用。
这次发布的核心变化,是把语音生成从"选预设音色"变成了"用自然语言造声音"。Gemini 3.8 Flash TTS 面向深度创作场景,用户可以用自然语言描述角色设定、口音和声音特征,从零生成全新音色,支持超过 100 种语言和方言。官方演示中包括墨尔本口音的高能量 DJ、单调的机器人音色,以及一条日语龙的角色配音。更实用的是逐行导演功能:创作者可以对每一句台词单独控制节奏、情绪、方言切换和对话中的附和声(backchanneling,比如"嗯""对"这类真实对话里的语气词),让生成的音频更接近真人交流。此外,模型支持用 30 秒音频样本复刻音色,前提是拥有该声音的使用授权,并内置了同意验证机制。原有 30 个预设音色之外,用户还能调用 2000 多个可直接用于生产的音色库,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。
Gemini 3.8 Flash-Lite TTS 则主打高并发和低成本,针对大批量配音、音频内容生产和实时语音助手场景优化,同样支持对语气、节奏和表达细节的精细控制。对跨境电商卖家和出海团队来说,这两款模型的直接价值在于:产品视频配音、多语言广告素材、播客内容、客服语音机器人等环节,过去需要外包给配音演员或使用机械感明显的 TTS 工具,现在可以用自然语言提示词批量生成带情绪和口音的音频,且覆盖 100 多种语言,本地化成本有望明显下降。安全方面,Google 为生成的音频加入了水印等内置工具,用于追踪和标识 AI 生成内容。这两款模型是 Gemini Audio 家族的最新成员,此前该系列已陆续推出 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
