该论文提出“广义智能体迭代”(GAI)这一形式化框架,旨在统一描述迭代策略改进与递归自我改进(RSI)两种学习范式。作者将智能体定义为一个系统内可修改组件的配置,并把学习过程建模为“智能体评估—智能体改进”的循环。框架通过两个关键维度区分不同实例:改进机制是否属于智能体本身,以及衡量标准是否锚定于智能体外部。前者划定了广义策略迭代(GPI)与RSI的边界,后者决定系统是锚定型、目标漂移型还是完全自指型。借助这两个坐标,作者将现有系统置于同一框架下比较,并使RSI的缺陷能够被逐条陈述。该工作为RSI提供了基于经典理论的形式化刻画,使不同系统具备可比性,并为分析与设计新系统奠定原则性基础。
| 递归自我改进 (RSI) | 智能体通过修改自身组件来提升自身能力的过程,可能导致能力爆炸或目标漂移。 |
| 广义策略迭代 (GPI) | 经典强化学习框架,通过交替进行策略评估和策略改进来逼近最优策略。 |
| 广义智能体迭代 (GAI) | 本文提出的统一形式化框架,将迭代策略改进和递归自我改进视为同一范式的两个特例。 |
| 智能体评估 | 在GAI循环中,根据某个标准对智能体当前配置进行衡量的阶段。 |
| 智能体改进 | 在GAI循环中,根据评估结果修改智能体可修改组件以提升性能的阶段。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅