清华大学、无问芯穹与正行创新联合开源的RPent,是一套面向真实物理世界的具身智能体基础设施。它试图回答一个关键问题:通用大模型能否成为机器人的“大脑”,使其完成复杂现实任务。RPent并未在纯VLA端到端与纯大模型Agent两条路线间折中,而是将具身智能拆解为分层能力:通用大模型负责理解任务与制定计划,VLA、WAM等专家模型负责高精度动作执行,记忆系统沉淀经验,框架连接模型、工具与真实环境,形成“观察—规划—执行—反馈—再规划”的闭环。在LIBERO-PRO基准测试中,RPent任务成功率达92.6%,端到端任务完成速度优化7倍以上。真机演示显示,机器人能应对任务变化、主动排除遮挡并复用已有技能,还可将验证过的任务逻辑沉淀为任务卡,通过Flash Mode降低执行延时。其意义在于推动机器人从执行固定指令走向理解目标、调用能力并持续进化的具身智能体形态。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅