Olmo-core 3 开源MoE训练栈

今天刷到 Ai2 发布 Olmo-core 3 的消息,第一反应是:终于有人认真把 MoE 训练栈当系统工程来做了。他们这次重写了开放 MoE 训练系统,目标直接对准万亿参数级别,同时强调计算效率不塌。对做开源模型的人来说,这比单纯放个权重有意义得多。

MoE 的吸引力一直很直白:模型可以塞进更多参数,但每个输入不必激活全部专家,所以推理和训练的单位成本有机会压下来。问题在于,MoE 的工程复杂度远高于稠密模型,路由、负载均衡、通信开销、专家并行,每一项都能把训练效率吃掉。Olmo-core 3 把重点放在「MoE 实际怎么工作」上,而不是套一个通用训练框架硬改,这个思路我比较认同。从公开信息看,这次升级主要围绕三件事:一是重新设计开放 MoE 训练系统,二是把扩展性推到万亿参数区间,三是保持计算效率。它也是下一代 Olmo 模型的核心系统之一,配套给了技术报告、代码和交互 demo。对学术研究者和中小实验室来说,这种完整栈的开放,比只拿到一个 API 要有价值得多。不过我也得泼点冷水。万亿参数级别的 MoE 训练,真正的门槛不只是代码开不开源,还有算力、集群通信和工程调优经验。Ai2 把训练基础设施开放出来,确实降低了「从零造轮子」的成本,但小团队要复现同等规模,依然会被硬件卡住。更现实的路径,可能是在中等规模上先吃透这套 MoE 训练逻辑,再谈扩展。总体看,Olmo-core 3 是开源模型生态里少见的「补基础设施」动作。大家平时更关注榜单和参数,但真正决定能不能持续迭代的,往往是训练栈。如果这套东西能稳定跑通并形成社区反馈循环,下一代 Olmo 的开放程度会更有看头。我会先蹲一波代码和报告细节,再判断它是不是真能成为 MoE 训练的新默认选项。
4

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼