行业动态AI评分 一般 (65)AI 中文改写

实时多说话人AI:NVIDIA Nemotron 3说话人分离技术

1 天前 2 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

英伟达又往语音AI赛道扔了一颗重磅炸弹。9月23日,NVIDIA在HuggingFace博客上发布了Nemotron 3 Diarization,这是一个开源的1亿参数模型,专门解决一个在会议记录、客服通话和播客转写中长期被忽视的问题:谁在什么时候说了话。该模型在VoiceArena的说话人分离排行榜上以14.72%的分离错误率(DER)排名第一,支持最多8个说话人,同时覆盖实时流式和离线录音两种场景。对于做跨境客服质检、会议纪要工具、AI语音助手记忆功能的开发者和出海团队来说,这意味着过去需要依赖昂贵闭源方案才能实现的多说话人识别能力,现在有了一个可以直接拿来用的开源选项。 说话人分离(Speaker Diarization)要解决的核心问题是:一段对话里,每句话是谁说的。语音识别(ASR)负责把声音转成文字,但如果没有说话人分离,你拿到的就是一份所有句子都正确、却完全不知道谁说了什么的转写稿。在真实的会议或客服场景中,这意味着你无法判断是谁做出了承诺、谁提出了异议、谁打断了谁。搜索、摘要、行动项提取、对话分析和语音助手的记忆功能,都会因此大打折扣。Nemotron 3 Diarization的思路是识别每个说话人活跃的时间区间,包括多人同时说话的重叠片段,再把这些时间戳和ASR结果结合,生成带说话人归属的完整转写。 技术上,这个模型延续了英伟达此前Streaming Sortformer的架构思路,但把支持上限从4个说话人扩展到了8个,并在准确率和吞吐量上做了明显提升。它的关键设计是按说话人首次出现的时间顺序来分配输出通道——第一个出现的新声音对应第一个通道,第二个对应第二个,以此类推。这种排序方式让模型在流式处理时不需要每个音频块都重新解算说话人的排列组合,从而保证了跨片段的身份稳定性。训练数据方面,英伟达使用了公开语音数据和从David AI授权的真实多人对话数据,还利用授权音频合成了覆盖21种语言的大规模模拟混合语音。加入David AI数据后,复合分离错误率从11.19%降到了10.42%,绝对下降了0.77个百分点。 对跨境电商和出海团队来说,这个模型有几个直接相关的应用场景。客服通话质检是最典型的:过去要判断客服和客户各自说了什么,往往需要人工听录音或购买昂贵的商业方案,现在可以用这个开源模型自动生成带说话人标签的转写稿,再接入质检规则或大模型做分析。会议纪要工具同样受益,尤其是远程协作场景下多人同时发言的重叠片段,过去是转写质量的重灾区。此外,模型支持自定义流式延迟,意味着开发者可以在实时性和准确率之间做灵活取舍,这对需要低延迟响应的语音助手类产品尤为重要。需要注意的是,模型输出的是匿名标签(speaker_1、speaker_2等),它只告诉你“2号说话人”在某个时间段说了话,并不会识别出这个人具体是谁——身份识别仍然需要额外的声纹验证环节。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0 条

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容