单步预测准没用!新基准揭示GUI模型多步交互会崩
GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments
arXiv CL (cs.CL) 重要 Agent多模态数据集 🕐 09-02 12:00

📖 AI 总结

该论文提出了GUI-CC基准测试,用于评估图形用户界面世界模型作为智能体环境时的上下文一致性。现有研究多将GUI世界模型视为单步屏幕预测器,但其实际用途是支持多步交互的环境,这导致关键需求未被充分测试:生成的状态在反复用于后续交互时,必须保持上下文一致。GUI-CC包含两个互补轨道:离线参考动作轨道沿真实移动GUI轨迹滚动模型,在线智能体循环轨道则让固定探测智能体与模型生成的界面交互。基准涵盖来自GUIOdyssey的500个离线轨迹任务和30个移动应用中的200个模拟器验证的在线任务,评估转换保真度、转换合理性、上下文一致性和任务进展。实验表明,看似合理的单步生成并不能保证可靠的环境模拟,当前模型常生成外观可用的屏幕,却无法保留任务相关上下文或支持可执行的多步展开。该研究揭示了GUI世界模型评估中的关键盲区,为构建更可靠的智能体环境提供了评测基础。

🔑 关键词速览

GUI world models图形用户界面世界模型,指能够预测或生成GUI屏幕序列的模型,用于模拟代理交互环境。
Contextual consistency上下文一致性,指生成的状态在多次交互中保持与任务相关的信息连贯和逻辑一致。
Offline reference-action track离线参考动作轨道,一种评估方式,使用预定义的轨迹和动作来测试模型生成的屏幕序列。
Online agent-loop track在线代理循环轨道,一种评估方式,让代理与模型生成的UI实时交互以测试环境模拟能力。
Transition fidelity转换保真度,衡量模型生成的屏幕转换与真实环境中的转换之间的相似程度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅