这篇论文提出了一种面向网页智能体的预算感知在线适应框架,旨在解决部署后持续学习中的成本效率问题。研究指出,传统的轨迹级偏好优化在不可解决的任务片段和冗余执行轮次上浪费了大量预算。为此,作者设计了Score-Guided Online Teaching with Budgeted Trajectory Trimming框架,通过可解性感知的教师门控机制决定何时调用教师模型,并利用分数引导的回合选择机制筛选有信息量的轨迹片段进行教学。在MiniWoB和TimeWarp基准上的实验表明,该方法在保持相近首次通过成功率的同时,平均减少了22.6%的教师调用次数和52.1%的学生训练计算量,为资源受限场景下的网页智能体在线适应提供了可行方案。
| Web agents | 网络代理,指能够自动执行互联网任务的智能体系统。 |
| Online adaptation | 在线适应,指模型在部署后根据新数据或环境进行持续调整的过程。 |
| Trajectory-level preference optimization | 轨迹级偏好优化,一种通过比较完整执行轨迹来优化模型的方法。 |
| Score-Guided Online Teaching | 分数引导的在线教学,一种利用评分机制选择有效教学样本的方法。 |
| Budgeted Trajectory Trimming | 预算感知的轨迹修剪,在有限预算下裁剪冗余轨迹以节省资源的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅