该研究提出了一种基于自生成强化学习的闭环框架,用于探索和控制复杂系统中的自组织现象。与传统的开环方法不同,该框架允许智能体在模拟过程中自主采样多样化目标,并通过最小局部干预学习目标条件策略。研究团队将该框架应用于Lenia连续元胞自动机,构建了名为CARL的智能体系统,展示了三项核心能力:以高于启发式基线的效率发现多种更新规则下的稳定孤子;通过少量干预控制已有孤子的运动方向;以及支持人类通过高层方向指令实时引导孤子穿越迷宫环境。经过多样化目标、规则和初始状态训练的智能体,其策略能够零样本泛化至分布外条件。该研究为构建能够自主或辅助人类发现和控制涌现现象的人工实验智能体提供了可行路径。
| Autotelic Reinforcement Learning | 自生成强化学习,一种智能体自主设定目标并学习达成这些目标的强化学习范式。 |
| Cellular Automata | 元胞自动机,由规则驱动的离散网格模型,用于模拟复杂系统的时空演化。 |
| Lenia | 一种连续元胞自动机,以其类生命的自组织模式而闻名,用于研究涌现现象。 |
| Solitons | 孤子,在非线性系统中保持形状和速度稳定传播的局部波动或模式。 |
| Zero-shot Generalization | 零样本泛化,指模型在未见过的条件下无需额外训练即可正确表现的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅