LiquidAI 开源端侧决策模型 d1
LiquidAI 刚开源了 d1 决策模型家族的两个新成员,d1-3B 和 d1-omni-600M,定位很明确,就是给边缘设备用的。和常见的生成式模型不同,决策模型不逐 token 输出,而是一次前向传播直接给答案,这个思路在端侧场景里其实更合理,延迟和功耗都更好控制。
先看硬指标。d1-3B 在 Decision Index 0.2.1 上拿到 48.57 分,官方说这是 10B 以下最好的决策模型,超过了所有 4B 和 9B 模型,也压过了 Decider 35B-A3B 的 47.11。这个对比挺有意思,一个 3B 模型打赢了 35B 的 MoE,说明决策任务上参数规模未必是决定因素,架构和训练方式可能更关键。多模态能力是另一个看点。d1-3B 支持文本加图像,d1-omni-600M 则支持文本加图像或文本加音频,后者还是实验性的。速度方面,d1-3B 在 NVIDIA Jetson AGX Thor 上回答一个问题只要 16 毫秒,AGX Orin 上 26 毫秒,Orin Nano 上 50 毫秒。这个延迟水平放到机器人、工业质检或者车载交互里,基本是实时可用的。技术底座是他们的 Liquid Foundation Models,决策模型和生成模型走的是两条路线。我比较关注的是,这类模型开源之后,端侧 AI 的玩法会不会变。以前大家拼的是把大模型塞进设备,现在如果决策任务可以用小模型一次前向搞定,那很多场景根本不需要大模型上场。当然,实验性的 omni 版本和决策索引本身的权威性还需要更多第三方验证。但方向是对的,端侧需要的不只是能聊天的模型,更需要能快速做判断的模型。做硬件和边缘计算的朋友可以留意一下这两个权重。
先看硬指标。d1-3B 在 Decision Index 0.2.1 上拿到 48.57 分,官方说这是 10B 以下最好的决策模型,超过了所有 4B 和 9B 模型,也压过了 Decider 35B-A3B 的 47.11。这个对比挺有意思,一个 3B 模型打赢了 35B 的 MoE,说明决策任务上参数规模未必是决定因素,架构和训练方式可能更关键。多模态能力是另一个看点。d1-3B 支持文本加图像,d1-omni-600M 则支持文本加图像或文本加音频,后者还是实验性的。速度方面,d1-3B 在 NVIDIA Jetson AGX Thor 上回答一个问题只要 16 毫秒,AGX Orin 上 26 毫秒,Orin Nano 上 50 毫秒。这个延迟水平放到机器人、工业质检或者车载交互里,基本是实时可用的。技术底座是他们的 Liquid Foundation Models,决策模型和生成模型走的是两条路线。我比较关注的是,这类模型开源之后,端侧 AI 的玩法会不会变。以前大家拼的是把大模型塞进设备,现在如果决策任务可以用小模型一次前向搞定,那很多场景根本不需要大模型上场。当然,实验性的 omni 版本和决策索引本身的权威性还需要更多第三方验证。但方向是对的,端侧需要的不只是能聊天的模型,更需要能快速做判断的模型。做硬件和边缘计算的朋友可以留意一下这两个权重。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼