ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Rho-1 全能模型亮相:19B 参数,一个网络同时管文本、图像、视频和机器人动作

Rho-1 全能模型亮相:19B 参数,一个网络同时管文本、图像、视频和机器人动作

AI资讯 • Admin • • 7 次浏览

Rho-1 是 Reka AI 刚放出的研究预览模型。2026 年 10 月 5 日,The Decoder 报道了这款 19B 参数的"全能"模型:文本、图像、视频和机器人控制动作,在同一个神经网络里处理和生成,不靠外挂工具调用,也不把不同任务分发给不同的专用模型。所有模态都被放进同一个共享上下文窗口,当作同一种 token 流来算。

一个网络管四种活,难在数据不在结构

按报道,Rho-1 可以实时生成连续视频,运行中途接到新指令也不用重启,同一套既预测摄像头画面的权重,也直接输出机器人的运动。机器人数据稀缺是这类模型的老大难,Reka 的解法是先训一个逆动力学模型,从普通互联网视频里反推出控制信号,把海量无标注视频变成能用的训练材料。整个模型在 320 张 H100 上训练了约三个月。放到 Reka 的官方路线里,这不是临时起意:它与 Moonvalley 合并人才后一直在推进"全能世界模型",目标就是让同一个架构同时做模拟、推理和动作预测,Rho-1 是这条线露出的第一个实例。

它和现在主流的多模态做法差在哪

主流视觉语言模型通常是"多种输入、一种输出":看图、看视频,最后吐文字;要生成图像或驱动机器人,再外挂别的模型,拼接处天然有延迟和信息损耗。Rho-1 的赌注是把理解和生成塞进同一套表征里,让模型先在内部"预演"画面接下来怎么变,再决定动作怎么出。对机器人场景,这意味着规划和执行不再是两个系统的接力;对交互媒体,则是视频可以边生成边响应新指令。站内此前报道的 RobCo 机器人融资 说明资本在追机器人本体,而 Rho-1 这类工作补的是另一头:让本体共用一个更通用的"脑子"。

先别急着给它下定级结论

目前关于 Rho-1 的公开信息主要来自一家媒体的报道和演示视频,没有公开的评测数据、权重或试用入口,19B 的规模也决定了它不是冲着前沿分数去的。它的价值更像一次路线验证:单一网络能否同时扛住理解、生成和动作,逆动力学这条数据路线能否规模化。等 Reka 放出技术报告或可复现的演示,再判断它离"能用的全能模型"还有多远不迟。

推荐工具

更多