开源TTS评测榜来了,多语言和声音克隆都能比

做语音这行的应该都有同感,开源TTS模型的发布速度已经到了离谱的程度。光是在模型托管平台上,TTS相关模型的数量已经超过8000个,几乎每周都有新面孔冒出来。但问题也随之而来:模型多了,评测却完全没跟上,大家选模型基本靠口口相传或者自己跑demo,没有一个公认的参考系。

目前社区里比较有影响力的几个竞技场类榜单,比如TTS Arena v2、Artificial Analysis和Voice Arena,思路都是让用户盲听两个模型的输出然后投票,攒够票数后用Elo或者Bradley-Terry模型算排名。这套玩法在纯英文、通用场景下确实有效,但放到多语言和声音克隆这些细分需求上,就明显不够用了。这次新出的Open TTS Leaderboard,切入点就是补上这块空白。它把重点放在开源模型和多语言评测上,同时加入了声音克隆效果的对比,还考虑了流式场景下的表现。我觉得这个方向是对的,因为很多团队真正落地的需求就是小语种加克隆音色,而不是再比一遍英文新闻播报。当然,竞技场模式本身也有局限。投票人群的偏好会偏向听起来顺耳、情绪饱满的输出,但实际业务里可能更看重稳定性和延迟。所以我的判断是,这个榜单适合当筛选工具,先圈定几个候选,再拿自己的数据和场景去实测。别把Elo分数当成唯一标准,尤其是做垂直语种和实时交互的团队。另外值得关注的是,它把流式性能也纳入了评测维度。这一点很关键,因为流式TTS的体验和离线合成完全是两回事,首包延迟、断句自然度、长文本稳定性都会影响最终效果。如果这个榜单能把流式指标持续更新,对做语音助手和实时翻译的开发者会很有参考价值。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼