该研究对一种自我发现的强化学习规则进行了首次因果机制审计,围绕“经验时代”的五大支柱展开,通过固定、冻结和移植循环状态来检验学习历史何时是资产、何时是负担。三项核心发现是:循环历史能显著扩展可用奖励尺度,维持约六个数量级的窗口,而零固定条件下仅约三个;历史内容与其维护机制解耦后,错配历史的惩罚主要源于持续钳制,允许导入状态自然演化可减轻负担;在环境变化下,控制回放保留会逆转相对DQN的表观适应优势,说明外部数据更替可能混淆内部可塑性。该工作将宏观递归自我改进目标落到微观学习动力学,为下一代自演化强化学习算法建立了审计标准。
| 递归自我改进 (RSI) | 指智能系统通过自我修改来不断提升自身能力,最终可能达到通用智能的循环过程。 |
| 经验时代 (Era of Experience) | 一种强调通过具身交互和持续学习来发展通用智能的范式,与单纯扩大语言模型规模相对。 |
| Disco103 | 一种通过算法自我发现得到的强化学习规则,在基准测试中超越了PPO并达到最先进性能。 |
| 循环状态 (recurrent states) | 在循环神经网络或强化学习智能体中,携带历史信息并影响当前决策的内部状态变量。 |
| 回放保留 (replay retention) | 在经验回放中控制旧数据保留程度的机制,影响智能体对环境变化的适应能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅