Reka 发布 190 亿参数全模态模型
刚看到 Reka AI 放出了 Rho-1 的研究预览版,一个 190 亿参数的全模态模型,文本、图像、视频、机器人控制动作全塞进同一个神经网络里处理。这个思路跟现在主流做法很不一样——大多数系统都是把任务路由给专门的子模型,而 Rho-1 把所有模态都当成 token 放进同一个上下文窗口,不调用工具也不依赖外部模型。
最让我在意的是它的实时性:模型能连续生成视频,还能在运行中直接响应新指令,不用重启。更关键的一点是,预测摄像头画面的那套权重,同时也在驱动机器人的动作。这意味着视觉理解和运动控制共享同一套表征,对做具身智能的团队来说是个值得盯的方向。机器人训练数据稀缺是老问题了,Reka 的解法是搭了一个逆动力学模型,从普通互联网视频里反推出控制信号。训练规模上,他们用了 320 张 H100,跑了大约三个月。这个成本对大厂不算夸张,但对中小团队依然是很高的门槛,所以短期内我更看好这类模型以 API 形式开放。Reka 做多模态不是新手。2024 年 4 月他们发过 Reka Core,一个多模态语言模型,当时在基准测试里对标 GPT-4、Claude 3 和 Gemini Ultra。这次 Rho-1 的发布,也契合了当前 AI 研究往「世界模型」方向走的整体趋势。我的判断是:全模态单模型如果能跑通,会明显简化工程链路,省掉一堆模型编排和工具调用的胶水代码。但 190 亿参数要同时扛住视频生成和机器人控制,实际效果和延迟还得看后续评测。做跨境工具和 Agent 产品的朋友,可以先把这类「一个模型吃下所有模态」的路线记进技术选型清单里。
最让我在意的是它的实时性:模型能连续生成视频,还能在运行中直接响应新指令,不用重启。更关键的一点是,预测摄像头画面的那套权重,同时也在驱动机器人的动作。这意味着视觉理解和运动控制共享同一套表征,对做具身智能的团队来说是个值得盯的方向。机器人训练数据稀缺是老问题了,Reka 的解法是搭了一个逆动力学模型,从普通互联网视频里反推出控制信号。训练规模上,他们用了 320 张 H100,跑了大约三个月。这个成本对大厂不算夸张,但对中小团队依然是很高的门槛,所以短期内我更看好这类模型以 API 形式开放。Reka 做多模态不是新手。2024 年 4 月他们发过 Reka Core,一个多模态语言模型,当时在基准测试里对标 GPT-4、Claude 3 和 Gemini Ultra。这次 Rho-1 的发布,也契合了当前 AI 研究往「世界模型」方向走的整体趋势。我的判断是:全模态单模型如果能跑通,会明显简化工程链路,省掉一堆模型编排和工具调用的胶水代码。但 190 亿参数要同时扛住视频生成和机器人控制,实际效果和延迟还得看后续评测。做跨境工具和 Agent 产品的朋友,可以先把这类「一个模型吃下所有模态」的路线记进技术选型清单里。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼