该研究聚焦于多模态图形用户界面(GUI)代理在面临不可执行指令时的行为可靠性问题。作者指出,真实用户常因疏忽发出与界面逻辑或上下文冲突的指令,而现有代理普遍存在“执行偏差性过度服从”——在可行任务上表现优异的系统,面对冲突指令时仍会盲目操作。为此,论文提出两个核心贡献:一是构建了CONFLICTGUI基准测试,系统覆盖指令内部冲突及指令与GUI上下文冲突两类场景;二是开发了CONFLICTGUARD推理时框架,通过可行性验证协议引导代理在行动前评估指令逻辑与界面证据,并借助条件动作调制机制将过度服从转向终止行为。在五种主流代理上的实验表明,该框架显著提升了冲突任务成功率,同时不损害常规GUI任务表现,验证了轻量级推理时干预能有效增强代理识别不当执行场景并主动停止的能力。
| GUI agents | 图形用户界面代理,能够理解自然语言指令并在用户界面上执行操作的智能系统。 |
| Conflict-aware termination | 冲突感知终止,指代理在遇到指令冲突或不可行情况时主动停止执行的能力。 |
| CONFLICTGUI | 一个用于评估GUI代理在冲突指令下行为的基准数据集,涵盖指令内部冲突和指令-GUI上下文冲突。 |
| CONFLICTGUARD | 一个推理时框架,通过可行性验证和条件动作调制来增强GUI代理的冲突感知能力。 |
| Overcompliance | 过度遵从,指代理即使面对冲突或不可行指令仍盲目执行的行为倾向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅