现代视觉语言模型(VLM)在回答需要细粒度视觉细节或外部知识的复杂图像问题时存在局限,虽可调用图像裁剪、搜索等工具,但现有训练方式仅以最终答案正确性评估工具使用,导致工具调用冗余、目标偏移,且模型常无法从观察结果中提取关键信息。为此,研究者提出NTEP(必要工具证据路径)标注方案,明确每条查询所需的外部证据及对应工具调用,并在此基础上构建NTEP-R奖励机制,确保每次工具调用都切实推进推理进程。该机制奖励模型在调用前意图与必要证据目标对齐、调用后信息总结与必要证据一致,并通过非重复目标正则化惩罚冗余调用。在七个图像基准上的实验表明,8B参数的NTEP-8B模型在统一三工具框架下显著提升了搜索准确率和工具使用效率,凸显了细粒度工具证据路径监督对训练鲁棒智能体VLM的重要价值。
| NTEP (Necessary Tool-Evidence Path) | 一种标注方案,明确指定每个查询所需的基本外部证据和相应的工具调用路径。 |
| NTEP-R (NTEP Reward) | 一种奖励机制,确保每次工具调用都严格推进推理过程,并惩罚冗余调用。 |
| Agentic Vision-Language Models (VLMs) | 能够调用外部工具(如搜索、裁剪)来获取额外信息以回答复杂问题的视觉语言模型。 |
| Tool-Evidence Path | 从工具调用到证据获取再到最终答案的推理路径,强调证据的获取和利用。 |
| Non-repeated-goal regularizer | 一种正则化项,用于惩罚重复访问已满足目标的冗余工具调用。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅