据 MarkTechPost 10 月 6 日报道,Reka 发布 19B 全模态推理模型 Rho-1 的研究预览版。该模型由单一神经网络理解和生成文本、图像与视频,并直接输出机器人动作,Reka 将其定位为对按模态分工的智能体流水线的直接替代。
Rho-1 把文本、视觉和机器人动作统一为同一上下文窗口内的 token。所有输入输出都使用两种原生格式之一:离散 token 承载文本、符号推理和高层指令,连续 token 承载图像潜变量、视频帧、机器人动作与本体感受。每个 transformer 块内设有两套专家权重流,理解流负责语言与视觉解析,生成流把潜变量去噪为图像和视频,两套流共享注意力并运行在同一个 KV 缓存之上。当回复需要像素时,理解流先发出离散的交接 token,生成流再从累积的完整状态渲染画面。训练方式把离散序列的下一 token 预测与连续输出的流匹配结合起来。
这一设计带来若干具体差异。边界框以坐标 token 的形式输出,不再依赖单独的检测器;视频首帧复用上下文中的图像表示,而不是重新编码的副本。Reka 公布的一次未经剪辑的会话中,模型画出灯塔、为其加框、做成动画、把视频改造成暴风雪场景,并解释前后差异,全过程在 5 轮内完成,没有调用外部工具,也没有第二个模型参与。
速度方面,基础模型生成视频的中位速度为实时的 0.79 倍,约 6 秒后开始出现可观看的流。Reka 团队测得首个片段耗时 7.0 秒,作为对照给出的多智能体流水线耗时为 13.8 秒。蒸馏版本把去噪步数从 99 步压缩到 8 步,Reka 称质量损失很小,约 1 秒即可返回 5.3 秒的片段。在 Reka 的内部测试中,该模型与最快的专用图像模型相当,也是所测模型中输出首个文本 token 最快的。上述数据均由厂商自行测试,并非独立基准。
在世界模型与机器人方向,Rho-1 连续流式生成,一段接一段。新指令通过理解流进入,并在 rollout 中途更新状态。Reka 演示了同一开场分叉为左转与右转两条延续轨迹。机器人方面,动作与未来帧从同一潜变量状态解码,在 LIBERO 仿真的一集里,Rho-1 输出了 7 个动作通道。为绕开遥操作日志稀缺的限制,Reka 将 Rho-1 与其逆向动力学模型配对,从原始视频推断控制信号。
据 2026 年 10 月 5 日从官方来源核验的数据,Rho-1 参数量为 19B,输入与输出均包含文本、图像、视频、动作和本体感受,具备原生视频生成能力,分辨率上限为 672×384,支持连续 rollout 的实时操控,并输出原生连续动作 token,但不开放权重,目前仅通过 contact@reka.ai 提供研究预览。对比之下,ByteDance BAGEL 为 14B 总参数、7B 激活,接受文本与图像输入,权重以 Apache 2.0 开放;BAAI Emu3.5 为 34B,处理交错文本与图像,同样以 Apache 2.0 开放;Google Genie 3 未披露参数量,输入为文本提示与导航输入,输出可交互视频世界,支持 720p、每秒 24 帧,向 Google AI Ultra 订阅者提供,能够接收导航动作但不输出动作。Rho-1 的训练使用 320 张 H100、历时 3 个月,公开权重、API 与定价均未公布。