该论文提出了GUI-CC基准测试,用于评估图形用户界面世界模型作为智能体环境时的上下文一致性。现有研究多将GUI世界模型视为单步屏幕预测器,但其实际用途是支持多步交互的环境,这导致关键需求未被充分测试:生成的状态在反复用于后续交互时,必须保持上下文一致。GUI-CC包含两个互补轨道:离线参考动作轨道沿真实移动GUI轨迹滚动模型,在线智能体循环轨道则让固定探测智能体与模型生成的界面交互。基准涵盖来自GUIOdyssey的500个离线轨迹任务和30个移动应用中的200个模拟器验证的在线任务,评估转换保真度、转换合理性、上下文一致性和任务进展。实验表明,看似合理的单步生成并不能保证可靠的环境模拟,当前模型常生成外观可用的屏幕,却无法保留任务相关上下文或支持可执行的多步展开。该研究揭示了GUI世界模型评估中的关键盲区,为构建更可靠的智能体环境提供了评测基础。
| GUI world models | 图形用户界面世界模型,指能够预测或生成GUI屏幕序列的模型,用于模拟代理交互环境。 |
| Contextual consistency | 上下文一致性,指生成的状态在多次交互中保持与任务相关的信息连贯和逻辑一致。 |
| Offline reference-action track | 离线参考动作轨道,一种评估方式,使用预定义的轨迹和动作来测试模型生成的屏幕序列。 |
| Online agent-loop track | 在线代理循环轨道,一种评估方式,让代理与模型生成的UI实时交互以测试环境模拟能力。 |
| Transition fidelity | 转换保真度,衡量模型生成的屏幕转换与真实环境中的转换之间的相似程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅