自我发现RL规则首次审计:循环历史让奖励窗口从3年暴增至60年!
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
arXiv AI (cs.AI) 重要 论文方法Agent大模型 🕐 今天 12:00

📖 AI 总结

该研究对一种自我发现的强化学习规则进行了首次因果机制审计,围绕“经验时代”的五大支柱展开,通过固定、冻结和移植循环状态来检验学习历史何时是资产、何时是负担。三项核心发现是:循环历史能显著扩展可用奖励尺度,维持约六个数量级的窗口,而零固定条件下仅约三个;历史内容与其维护机制解耦后,错配历史的惩罚主要源于持续钳制,允许导入状态自然演化可减轻负担;在环境变化下,控制回放保留会逆转相对DQN的表观适应优势,说明外部数据更替可能混淆内部可塑性。该工作将宏观递归自我改进目标落到微观学习动力学,为下一代自演化强化学习算法建立了审计标准。

🔑 关键词速览

递归自我改进 (RSI)指智能系统通过自我修改来不断提升自身能力,最终可能达到通用智能的循环过程。
经验时代 (Era of Experience)一种强调通过具身交互和持续学习来发展通用智能的范式,与单纯扩大语言模型规模相对。
Disco103一种通过算法自我发现得到的强化学习规则,在基准测试中超越了PPO并达到最先进性能。
循环状态 (recurrent states)在循环神经网络或强化学习智能体中,携带历史信息并影响当前决策的内部状态变量。
回放保留 (replay retention)在经验回放中控制旧数据保留程度的机制,影响智能体对环境变化的适应能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅