边缘端决策模型开源,3B 跑赢 35B

今天刷到 LiquidAI 开源了 d1 决策模型家族的两个新成员,d1-3B 和实验性的 d1-omni-600M。最让我意外的是 d1-3B 在 Decision Index 0.2.1 上拿到 48.57 分,直接压过了所有 4B、9B 模型,连 35B-A3B 的 Decider 也才 47.11。这说明决策任务和生成任务完全不是一条赛道,参数堆料未必有用,架构和训练目标才是关键。

这两个模型和常见的生成式模型有个本质区别:它们不逐 token 输出,而是在一次前向传播里直接给出答案。这个设计对边缘场景太重要了,因为省掉了自回归解码的延迟和显存开销。官方数据是 d1-3B 在 Jetson AGX Thor 上单次推理只要 16 毫秒,AGX Orin 上 26 毫秒,最弱的 Orin Nano 也只要 50 毫秒。这个量级已经能塞进实时控制回路里了。多模态支持也做了区分:d1-3B 吃文本加图像,d1-omni-600M 则支持文本加图像或文本加音频。600M 这个尺寸放在端侧音频场景里很有想象空间,比如语音指令的意图判断、异常声音分类,不需要把音频传回云端。不过官方把它标成实验性,说明稳定性和工具链可能还不成熟,想上生产得先做一轮验证。我的判断是,这波发布真正值得关注的不是分数,而是「决策模型」这个品类开始有开源选项了。以前端侧做分类或策略判断,要么用蒸馏后的小生成模型硬扛,要么自己训小分类器。现在有了专门为单次前向传播优化的模型,延迟和能耗都能降一个档次。对做机器人、智能家居、工业质检的团队来说,值得花半天跑个 benchmark 试试。当然也别急着 all in。决策模型的能力边界比生成模型窄,它只回答预设好的判断问题,不能拿来聊天或写代码。选型前先想清楚你的任务是不是能拆成明确的决策点,以及输出空间是否固定。
2

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼