本文提出HyperWorld,系统研究了文本世界模型中状态序列化结构对学习效果的影响。作者将同一真实状态分别编码为原始观测、独立句子、成对三元组和以实体为中心的超边单元四种形式,在相同训练目标下比较不同模型规模和数据预算的表现。实验发现,超边序列化在0.5B至1.5B参数模型以及分布偏移场景下优势最明显,尤其在事实F1分数上表现突出;而较大模型可缩小各表示间的差距,成对三元组在分布内精确匹配上甚至略优。在下游贪心规划任务中,超边世界模型的成功率最高。研究结论表明,高阶状态组织是一种简单有效的归纳偏置,尤其适用于模型容量受限或测试环境与训练分布不一致的情形,为文本世界模型的状态表示设计提供了实证依据。
| World models | 世界模型,指让代理预测环境动态并据此规划行动的模型。 |
| State serialization | 状态序列化,将环境状态转换为文本序列的过程。 |
| Hyperedge | 超边,一种将多个相关事实围绕实体和关系分组的高阶结构单元。 |
| Inductive bias | 归纳偏置,模型中帮助泛化的先验假设或结构偏好。 |
| Out-of-distribution | 分布外,指测试数据与训练数据分布不同的情况。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅