世界模型领域长期缺乏统一评测标准,不同技术路线各自出题、各自宣布领先。HappyWorld-Bench 试图改变这一局面,它不争论技术路线,而是从能力出发,将世界模型分为 W1 到 W6 六个等级,分别考察语义连贯、动作响应、状态记忆、可控编辑、多智能体扩展及跨环境通用能力,核心可概括为“看得见、推得动、记得住、改得了、扩得开”。该基准覆盖视频生成、空间重建和具身智能三条赛道,设置 29 个评测维度,强调以具体物理判据而非主观观感评分,并将总体偏好与能力分数分开。首批 1692 个案例主要覆盖 W1 至 W5。结果显示,各赛道领先者各有短板,没有全能冠军,反映出当前世界模型仍处于能力分化阶段。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅