Google Cloud AI Research联合多所高校开源了RRSI框架,让大语言模型智能体能够自主改写自身的"外壳"——包括提示词、工具、记忆、控制流和子智能体,而模型权重保持不变。该研究的核心发现是,传统自我改进循环因反复使用同一组任务而容易过拟合,具体表现为基准特定拟合、噪声追逐和复杂度累积三种失效模式。RRSI的应对思路是不限制可编辑内容,而是约束搜索过程本身:在提议端引入退火编辑预算、证据感知信用记录和结构化探索,在选择端设置泄漏审查、噪声调整下限、成本规则和剪枝机制。这些设计分别对应L0、L1和L2等经典正则化思想。其意义在于,智能体在外壳上的改进能够迁移到从未优化过的基准测试上,为构建不过拟合的自我改进系统提供了可复用的研究框架。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅