UI-Venus-2是一个面向移动、网页和桌面环境的通用基础GUI智能体,旨在弥合基准测试模型与真实世界应用之间的差距。该技术报告指出,多模态GUI智能体在数字任务自动化中面临环境覆盖有限、任务构建脆弱和奖励验证不可靠三大挑战。为此,UI-Venus-2通过统一闭环推理-行动框架,在三个关键维度同步扩展:环境方面覆盖超过170个多语言移动应用和原生桌面操作系统;任务方面采用深度研究流水线生成基于功能的指令;验证方面引入轨迹级和样本级评估器,结合视觉关键点和多模型投票机制,为强化学习提供可靠信号。此外,系统还整合了安全感知机制,确保关键操作的可控执行。该项目以开源形式发布,为构建更可泛化、可验证且具备自我反思能力的真实世界GUI智能体提供了基础。
| Multimodal GUI agents | 多模态图形用户界面智能体,能够理解和操作屏幕上的视觉和文本信息以完成数字任务。 |
| UI-Venus-2 | 本文提出的通用基础GUI智能体,支持移动、网页和桌面环境,采用闭环推理-行动框架。 |
| Closed-loop reasoning-action framework | 闭环推理-行动框架,智能体在行动后观察结果并调整推理,形成循环迭代过程。 |
| Reinforcement learning (RL) signals | 强化学习信号,用于训练智能体的奖励或惩罚反馈,指导其学习最优策略。 |
| Trace-level and sample-level evaluators | 轨迹级和样本级评估器,分别从完整操作序列或单个样本角度评估智能体表现,用于验证和奖励生成。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅