开源TTS评测有了新榜单
最近看到一个挺有意思的新动作,有人给开源和多语言TTS专门做了一个评测榜单。背景其实不难理解,开源语音模型的发布速度实在太快了,光是在模型社区里,截至今年九月底就已经有超过八千个TTS模型,这个量级放在两年前根本不敢想。
但问题也很明显,模型多了,评测却没跟上。现在大家参考的仍然是MOS、MUSHRA这类人工偏好打分,标准分散、复现困难。于是TTS Arena、Artificial Analysis、Voice Arena这些竞技场式榜单成了事实上的参照系,逻辑都是让用户盲听两个模型的输出并投票,攒够票数后用Elo和Bradley-Terry模型算出排名。新榜单的差异点在于,它把重心放在开源模型和多语言场景上,还加入了声音克隆的评测维度,同时关注流式性能。这几项恰恰是过去榜单覆盖不足的地方。多语言和克隆能力直接决定模型能不能落地到真实产品里,而流式延迟又直接影响语音交互的体验,光看音质排名其实说明不了太多问题。我自己的判断是,竞技场模式虽然贴近真实偏好,但也有明显短板。投票人群的构成会强烈影响结果,英语用户占多数时,小语种模型的排名天然吃亏;声音克隆这类任务也很难靠一两句试听分出高下。所以榜单可以看,但别把它当成唯一标准,最好结合自己的业务场景做小规模AB测试。对做出海语音产品的团队来说,这类榜单的价值更多是缩小候选范围,而不是直接拍板选型。多语言覆盖、克隆相似度、流式延迟这三项,建议在选型时单独拉出来做加权评估。开源生态跑得快,评测体系能跟上一步,对整个行业都是好事。
但问题也很明显,模型多了,评测却没跟上。现在大家参考的仍然是MOS、MUSHRA这类人工偏好打分,标准分散、复现困难。于是TTS Arena、Artificial Analysis、Voice Arena这些竞技场式榜单成了事实上的参照系,逻辑都是让用户盲听两个模型的输出并投票,攒够票数后用Elo和Bradley-Terry模型算出排名。新榜单的差异点在于,它把重心放在开源模型和多语言场景上,还加入了声音克隆的评测维度,同时关注流式性能。这几项恰恰是过去榜单覆盖不足的地方。多语言和克隆能力直接决定模型能不能落地到真实产品里,而流式延迟又直接影响语音交互的体验,光看音质排名其实说明不了太多问题。我自己的判断是,竞技场模式虽然贴近真实偏好,但也有明显短板。投票人群的构成会强烈影响结果,英语用户占多数时,小语种模型的排名天然吃亏;声音克隆这类任务也很难靠一两句试听分出高下。所以榜单可以看,但别把它当成唯一标准,最好结合自己的业务场景做小规模AB测试。对做出海语音产品的团队来说,这类榜单的价值更多是缩小候选范围,而不是直接拍板选型。多语言覆盖、克隆相似度、流式延迟这三项,建议在选型时单独拉出来做加权评估。开源生态跑得快,评测体系能跟上一步,对整个行业都是好事。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼