AI工具AI评分 头条 (76)AI 中文改写

Gemini 3.5智能转录,谷歌博客发布

2 天前 1 阅读来源:blog.google

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

谷歌发布Gemini 3.5 Transcribe语音转写模型,专为智能语音交互打造。相比传统语音识别模型,它在嘈杂环境、专业术语和口语修正处理上表现更优,能将原始音频直接转换为准确、精炼且格式规范的文本。目前,谷歌自家的Gemini应用和Android系统已率先采用该模型,用户已体验到如Android上的Rambler和macOS版Gemini应用中的新语音功能。现在,开发者可通过Gemini API、Google AI Studio和Gemini Enterprise Agent Platform接入这一能力,用于构建语音代理、实时字幕工具或通话后分析流程。 这次升级的核心在于“智能”二字。Gemini 3.5 Transcribe不仅能听清,还能听懂。它能自动处理“周二见——不,周三”这类自我纠正,剔除“嗯”“啊”等口头语,并自动格式化文本。更关键的是,它支持函数调用,能通过语音指令将图像生成、文件分析等复杂任务委派给其他Gemini模型执行,目前该功能已在macOS版Gemini应用中上线。在性能数据上,据Artificial Analysis评测,其流式转写的平均词错误率(WER)为4.0%,非流式场景下为2.6%,相比上一代Chirp 3模型,最终转写时间提升了70%。此外,模型支持85种以上语言的自动检测与转写,能适应地区口音和方言,并在预录音频中准确识别最多三位说话人(三人以上为实验性功能),附带词级时间戳。 对中国跨境电商卖家和AI从业者而言,这一模型的实际价值在于处理真实世界的语音数据。无论是客服通话录音分析、多语言会议纪要,还是语音下单场景中的地址和订单号识别,Gemini 3.5 Transcribe都针对这些痛点做了优化。开发者可通过Live API实现亚秒级延迟的双向流式交互,适合实时语音助手;通过Interactions API则可处理预录音频,获得带说话人归属和词级时间戳的转写结果。对于需要处理多语言客服或海外市场语音内容的团队,这提供了一个更精准的底层工具选项。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · blog.google

内容版权归原作者及 blog.google 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容