PointRL提出了一种基于可验证强化学习的点级视觉-语言定位框架,旨在解决视觉语言模型在GUI交互、机器人操作等场景中难以学习可靠指向行为的问题。该框架将现有的边界框、掩码和实例标签等异构标注转化为指向指令,同时保留目标支持、实例归属和集合约束作为隐藏验证证据,由确定性检查器对预测进行评分。奖励函数综合评估可解析性、点有效性、实例覆盖、基数一致性和冗余缺失预测。在PointArena基准上,PointRL将Qwen3.5-4B的整体准确率从56.11%提升至65.58%,并在RoboSpatial、BLINK和Ref-Adv等外部基准上取得同骨干网络的性能提升,表明可验证的点级反馈有助于增强空间定位能力。
| PointRL | 一个可验证的强化学习框架,用于从标注证据中学习点级视觉语言定位。 |
| Vision-Language Grounding | 将自然语言指令与图像中的具体视觉元素(如点、区域)关联起来的过程。 |
| Verifiable Annotation Evidence | 用于验证模型预测的标注信息,如边界框、掩码和实例标签,作为隐藏的检查依据。 |
| PointArena | 一个用于评估点级视觉语言定位性能的基准数据集。 |
| Cardinality Consistency | 确保预测的实例数量与指令中要求的数量一致,避免多或少。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅