智能体AI自我改进机制大揭秘:性能分数根本分不清!
Verification and Self-Improvement in Agentic AI: Foundations and Limits
arXiv AI (cs.AI) 重要 Agent安全对齐论文方法 🕐 今天 12:00

📖 AI 总结

该论文针对智能体AI的自我改进机制提出了一个形式化验证框架,旨在区分“搜索更久”“获得额外支持”与“修改提议和验证方式”这三种常被性能分数混淆的改进路径。作者引入带隐藏终端随机性的有界验证模型,定义“原生可达”与“闭包前沿”两类语言,并证明独立多数投票放大可保持二者不变,而基于随机带的存现接受可能引入错误输出。在复杂度层面,随机验证类满足Σ_k^P ⊆ Σ_k^RV ⊆ Σ_{k+1}^P,严格扩张与深度分离需依赖显式复杂度假设。针对递归自我改进,论文表明在统一可靠解释器和固定验证协议下,一致有界的自我修改仍停留在同一验证类内。该框架将自我改进主张与正确性、可采纳证据、验证资源和选择误差四类义务绑定,为评估智能体AI的能力提升提供了可证明的边界。

🔑 关键词速览

有界验证 (Bounded Verification)在多项式资源限制下对计算过程进行验证,确保输出在给定界内正确。
闭包前沿 (Closure Frontier)在验证接口允许的所有支持条件下,系统能达到的最大语言集合边界。
随机验证器类 (Randomized-Verifier Classes)使用随机性进行验证的计算复杂性类,记为 Σ_k^{RV},介于 Σ_k^P 和 Σ_{k+1}^P 之间。
递归自我改进 (Recursive Self-Improvement)智能体系统修改自身代码或策略以提升性能,且修改过程本身可递归进行。
条件错误预算 (Conditional-Error Budget)在自适应选择候选时,控制错误选择概率的预定义阈值。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅