Olmo-core 3 开源MoE训练栈
今天刷到 Ai2 放出了 Olmo-core 3,这次重点是把 MoE 训练系统重新设计了一遍,目标直接瞄着万亿参数级别,同时还要保住计算效率。他们自己说这是下一代 Olmo 背后的核心系统之一,代码、技术报告和交互 demo 都一并开源了。
我比较在意的是他们反复强调的动机:大模型训练太烧算力,成本和能耗把很多高校和小实验室挡在门外,而 MoE 恰好能用更少的激活参数撑起更大的模型容量。这个方向本身不新鲜,但真正把训练栈按 MoE 的实际工作方式去重构、还愿意整套开出来的团队并不多。对做跨境 AI 工具或者想自建模型的团队来说,这类基础设施开源比再发一个榜单模型更有长期价值。当然,万亿参数级别的 MoE 对普通团队依然是遥不可及,真正能落地的可能还是他们这套工程思路和调优经验。
我比较在意的是他们反复强调的动机:大模型训练太烧算力,成本和能耗把很多高校和小实验室挡在门外,而 MoE 恰好能用更少的激活参数撑起更大的模型容量。这个方向本身不新鲜,但真正把训练栈按 MoE 的实际工作方式去重构、还愿意整套开出来的团队并不多。对做跨境 AI 工具或者想自建模型的团队来说,这类基础设施开源比再发一个榜单模型更有长期价值。当然,万亿参数级别的 MoE 对普通团队依然是遥不可及,真正能落地的可能还是他们这套工程思路和调优经验。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼