这篇论文提出了一个名为Iron的训练框架,旨在提升通用虚拟代理(GUI智能体)在跨环境和跨设备任务中的表现。针对多模态大语言模型在代理部署中面临的数据标注成本高、动作与意图对齐不精确以及失败轨迹利用效率低三大挑战,Iron框架引入了双重学习策略。该策略通过逐步循环一致性奖励机制,实现低层动作与高层意图的细粒度对齐,增强指令理解能力;同时,框架还设计了事后复现机制,将失败轨迹重新用于训练,提升学习效率和任务多样性。实验结果显示,Iron训练的通用代理在性能上优于使用三倍数据训练的模型,在未见过的网页任务上实现了25.06%的相对提升,在复杂任务上也有进一步增益,证明了构建更强虚拟代理的可行性。
| Embodied AI | 具身智能,指在物理或数字环境中具有身体并能够感知和行动的AI系统。 |
| Multimodal Large Language Models (MLLMs) | 多模态大语言模型,能够处理文本、图像等多种模态信息的语言模型。 |
| Dual Learning | 双重学习,一种利用两个相关任务之间的循环一致性来提升模型性能的训练策略。 |
| Stepwise Cycle-Consistent (SCC) Reward | 逐步循环一致性奖励,一种用于对齐低级动作和高级意图的奖励机制。 |
| Hindsight Reproduction | 事后复现机制,一种将失败轨迹重新用于训练以提高学习效率的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅