开源TTS评测新榜来了
最近看到一个挺有意思的新项目,一个专门面向开源和多语言场景的TTS排行榜。发起方提到,截至9月30日,模型社区上已经有超过8000个TTS模型,这个数字确实有点吓人,说明开源语音合成的供给端已经彻底卷起来了。但问题是,评测体系完全没跟上,大家还是靠MOS、MUSHRA这类人工打分,碎片化严重,横向对比很难。
这个新榜单的思路和TTS Arena v2、Artificial Analysis、Voice Arena类似,都是让用户盲听两个模型的输出然后投票,积累足够票数后用Elo或Bradley-Terry模型算排名。人类偏好确实是最终标准,但我觉得这类竞技场模式有个老问题:投票人群的构成会极大影响结果,普通用户和语音从业者的听感偏好差异很大,多语言场景下更是如此。它这次强调的两个差异点是多语言加声音克隆评测,以及流式性能。这两块恰恰是现有榜单覆盖不足的地方。多语言TTS的评测一直很难做,因为不同语系的韵律、音调、连读规则差异太大,用同一套英文测试集去衡量中文或阿拉伯语模型基本没意义。声音克隆则涉及相似度、自然度和稳定性,单靠主观投票也不够,最好能结合客观指标。流式性能被单独拎出来我觉得是个好信号。很多开源模型在离线场景下效果不错,但一到实时对话、语音助手这类需要低延迟流式输出的场景就露馅了。首包延迟、实时率、长文本稳定性这些指标,直接决定模型能不能落地到产品里,而不是只停留在演示视频里。总体判断是,这个榜单方向对,但能不能成为社区公认的参考,取决于它能否持续吸引足够多且多样化的投票者,以及是否公开透明的评测方法和数据。对做语音产品的团队来说,多一个可对比的维度总是好事,但别把Elo排名当成唯一真理,最终还是要拿自己的业务场景去实测。
这个新榜单的思路和TTS Arena v2、Artificial Analysis、Voice Arena类似,都是让用户盲听两个模型的输出然后投票,积累足够票数后用Elo或Bradley-Terry模型算排名。人类偏好确实是最终标准,但我觉得这类竞技场模式有个老问题:投票人群的构成会极大影响结果,普通用户和语音从业者的听感偏好差异很大,多语言场景下更是如此。它这次强调的两个差异点是多语言加声音克隆评测,以及流式性能。这两块恰恰是现有榜单覆盖不足的地方。多语言TTS的评测一直很难做,因为不同语系的韵律、音调、连读规则差异太大,用同一套英文测试集去衡量中文或阿拉伯语模型基本没意义。声音克隆则涉及相似度、自然度和稳定性,单靠主观投票也不够,最好能结合客观指标。流式性能被单独拎出来我觉得是个好信号。很多开源模型在离线场景下效果不错,但一到实时对话、语音助手这类需要低延迟流式输出的场景就露馅了。首包延迟、实时率、长文本稳定性这些指标,直接决定模型能不能落地到产品里,而不是只停留在演示视频里。总体判断是,这个榜单方向对,但能不能成为社区公认的参考,取决于它能否持续吸引足够多且多样化的投票者,以及是否公开透明的评测方法和数据。对做语音产品的团队来说,多一个可对比的维度总是好事,但别把Elo排名当成唯一真理,最终还是要拿自己的业务场景去实测。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼