想法级评论家让ML智能体验证预算不变却大幅提升进化效率
Verify Less, Evolve More: Training Idea-Level Critics for Verification-Efficient ML Evolving Agents
arXiv AI (cs.AI) 重要 Agent论文方法算力 🕐 今天 12:00

📖 AI 总结

本文关注AI4ML场景下自演化智能体的验证效率瓶颈:验证机器学习改进方案通常需要昂贵的模型训练与评估,限制了智能体演化的速度与规模,而直接使用前沿大模型作为想法筛选器收益有限。为此,作者提出训练专门的“想法级”评论家模型,用于预测某个机器学习修改方案能否优于当前解,从而让智能体先筛选想法、再把验证资源集中在最有希望的候选上。评论家模型先通过Gemini-3.1-Pro合成的高质量评论进行监督微调,再用GRPO进一步提升预测准确率。实验表明,该模型在静态想法评估上优于Gemini-3.1-Pro,且优势可迁移到智能体推理、持续学习与策略训练中:在相同验证预算下提升最终解质量,并可作为学习到的奖励模型,将实证验证留给不确定情形,从而用同等验证资源完成更多策略更新。

🔑 关键词速览

AI4ML机器学习人工智能,指利用人工智能技术来辅助或自动化机器学习任务。
Idea-Level Critic想法级评论家,一种专门预测机器学习修改想法是否有效的模型,用于筛选候选方案。
GRPO群体相对策略优化,一种强化学习算法,用于优化策略模型的预测准确性。
Verification Budget验证预算,指在智能体进化过程中可用于经验验证(如模型训练和评估)的计算资源限制。
Continual Learning持续学习,指模型在连续任务中不断学习并保留先前知识的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅