研究智能体框架与模型协同演化,发现在线策略校正可助弱模型超越模仿学习。
| Agent harness | 智能体框架,指围绕模型构建的系统提示、工具集、执行钩子和上下文管理脚手架,用于支持智能体任务执行。 |
| On-policy correction | 在线策略修正,指在模型自身生成轨迹的基础上,由专家仅修正失败步骤的训练方法,以保持模型原有策略风格。 |
| Imitation learning | 模仿学习,指通过训练模型模仿专家完整轨迹来学习行为的方法,但可能因能力不匹配而失败。 |
| Model-harness fit | 模型与框架契合度,指模型行为与框架设计之间的匹配程度,影响任务性能。 |
| MLE agent | 元级最大似然估计智能体,指用于自动化专家修正流程的智能体,通过定位失败轮次来优化训练。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅