AI评分 一般 (52)AI 中文改写
开放TTS排行榜:多语言语音合成与声音克隆的可扩展评估
1 天前 2 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
开源语音合成领域正在经历一场爆发。截至2026年9月30日,Hugging Face Hub上已有超过8000个TTS(文本转语音)模型,但评估体系却远远跟不上模型发布的速度。目前社区公认的黄金标准仍然是MOS、MUSHRA这类人工偏好评分,几个竞技场式排行榜——TTS Arena v2、Artificial Analysis Voice Arena——通过让用户盲听两个模型的输出并选择更好的一个,再用Elo评分和Bradley-Terry模型进行排名。问题在于,这种模式根本无法规模化。截至同一时间点,Artificial Analysis收录的92个模型中只有16个是开放权重模型,Voice Arena的分布也类似。原因很实际:接入一个API模型只需要一个密钥,而托管一个开源模型需要竞技场运营方自己部署和运维;同时商业公司比开源作者更有动力去争取排名。此外,投票者的一致性也无法保证,同一个人对“更好”的判断标准会随时间变化。
Open TTS Leaderboard的推出正是为了解决这个矛盾。它不依赖人工投票,而是用客观指标从三个维度评估模型:可懂度,通过Qwen3 ASR(Open ASR Leaderboard上排名最高的开源模型)计算生成音频转录文本与原始提示词之间的词错误率和字符错误率;速度,用H200 GPU上的批处理离线推理RTFx(逆实时因子)和流式批大小1场景下的首音频延迟TTFA来衡量;说话人相似度,通过计算生成音频与参考片段之间WavLM说话人嵌入的余弦相似度来评估。这套方案将模型评估周期从收集投票所需的数周缩短到数小时。需要强调的是,这个排行榜并不打算取代人工偏好排名——基于ASR的词错误率只是可懂度的代理指标,说话人相似度也只是估计声音身份的保留程度,两者都无法直接衡量自然度、表现力或听感偏好。但它可以为投票制排行榜提供参考,帮助决定哪些模型值得纳入评估。
多语言和声音克隆评估是另一个重点。排行榜默认视图按Seed TTS Eval和CV3 Eval英文分片的宏平均词错误率排名,Kokoro-82M、supertonic-3和s2-pro在英文WER上领先,帕累托图则展示了哪些模型在WER、批处理推理速度和模型体积之间取得了较好平衡。但英文表现好不代表其他语言也好,这正是多语言评估需要独立进行的原因。对于中国跨境电商卖家和AI从业者来说,这个排行榜的价值在于:当你需要为多语言客服、产品视频配音或语音交互功能选型时,不再只能依赖英文社区的投票结果,而是有了一个可量化、可复现、覆盖多语言的参考基准。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
