微软实时转录模型杀进语音赛道

微软 AI 团队刚发布了 MAI-Transcribe-2-Streaming,一个主打实时转录的新模型。官方说它在 Artificial Analysis 的准确率榜单上排第一,支持 60 种语言,首次返回部分结果只要 100 毫秒出头。这个延迟意味着语音 agent 可以在用户话还没说完时就开始响应,交互体感会完全不一样。

价格方面,年底前推广价是一小时音频 0.54 美元。这个定价放在实时转录场景里相当有攻击性,尤其是对比那些按分钟计费的 API。我判断微软这次是想用低价先把开发者圈进 Foundry 生态,等用量起来再谈别的。同时发布的还有两个 TTS 模型。MAI-Voice-2.1 能用同一个声音说 23 种语言,而且每种都带母语口音,不是那种一听就是外国人的腔调。Flash 版本延迟压到 150 毫秒,价格从每百万字符 22 美元降到 15 美元,降幅接近三成。两个语音模型都支持几秒钟参考音频就克隆声音,官方说内置了防滥用机制。测试里 4000 名参与者中约有一半认为听到的声音来自真人,这个比例说明合成语音的自然度已经越过了多数人的辨别阈值。模型可以通过 Microsoft Foundry 和 MAI Playground 等平台调用,两个语音模型也上了 OpenRouter。我的看法是,实时转录加低延迟 TTS 的组合,真正冲击的是客服、会议记录和语音助手这几个场景,做跨境工具和 SaaS 的团队值得尽快测一下接入成本。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼