Reka发布19B参数的全模态推理模型Rho-1研究预览版,该模型从零训练,单一神经网络即可理解与生成文本、图像和视频,并输出机器人动作。其核心创新在于摒弃传统多模态流水线中模型间的任务交接,将文本、视觉与机器人动作统一为同一上下文窗口内的token。架构上采用双流设计:离散token处理语言与符号推理,连续token承载图像潜变量、视频帧及机器人动作,两条专家权重流共享注意力与KV缓存。训练结合离散序列的下一token预测与连续输出的流匹配。实测中,模型在5轮对话内完成绘图、标注、动画化、视频编辑与解释,全程无需工具调用或第二模型。基础模型视频生成速度中位数为实时的0.79倍。该模型为构建端到端智能体提供了新范式。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅