Gemini 3.5智能转写
2 天前 2 阅读来源:Google DeepMind Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌旗下DeepMind今日正式发布Gemini 3.5 Transcribe,这是其迄今最精准的语音转文本模型,专为智能语音交互场景设计。与传统的语音识别模型不同,Gemini 3.5 Transcribe能够直接将原始音频转化为准确、精炼且格式规范的文本,即便在嘈杂环境、面对复杂专业术语或口语不流畅的情况下,也能保持高水准表现。目前,该模型已率先应用于谷歌自家的Gemini应用及Android系统,例如Android上的Rambler功能和macOS版Gemini应用中的新语音能力,用户已能体验到其带来的便利。现在,开发者可以通过Gemini API、Google AI Studio以及Gemini Enterprise Agent Platform接入这一模型,构建类似功能。
这一新模型的推出,标志着谷歌在语音AI领域迈出了重要一步。其前代产品Chirp 3虽然已具备一定能力,但在处理背景噪音、自我修正(如“我们周二见——不,周三”)以及去除“嗯”“啊”等口头语方面存在短板。Gemini 3.5 Transcribe通过智能转录功能解决了这些问题,不仅能自动清理语言中的不流畅部分,还能自动格式化文本。据Artificial Analysis的评测数据,该模型在流式传输场景下的平均词错误率(WER)仅为4.0%,非流式场景下更是低至2.6%,相比Chirp 3在最终转录时间上提升了70%。这意味着,无论是实时字幕、语音助手还是会议记录,开发者都能获得近乎实时的精准转录体验。
对于跨境电商卖家和出海企业而言,这一技术的落地具有实际价值。Gemini 3.5 Transcribe支持超过85种语言的自动检测与转录,能够处理地区口音和多样方言,这对于处理多语言客服对话、国际会议记录或用户生成内容分析尤为关键。模型还支持最多三人的说话人识别(三人以上为实验性功能),并附带词级时间戳,方便后续的呼叫后分析或内容检索。此外,自定义词汇表功能允许企业输入行业术语或特定拼写,确保转录结果贴合业务场景。开发者可通过Live API实现亚秒级延迟的双向流式传输,适用于交互式语音应用;或通过Interactions API处理预录音频,满足会议记录、通话日志等批量处理需求。值得一提的是,该模型还支持函数调用,能够将图像生成、文件分析等复杂任务委派给其他Gemini模型,为构建多模态AI工作流提供了可能。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
