该研究提出了一种无需标注的推理时边界精化方法(LFPR),用于改善视觉-语言模型在指代表达理解中的定位精度。核心思路是让冻结的直答模型利用自身预测结果,对预测较小的区域进行高分辨率二次观察,在上下文裁剪中重新定位,并通过固定几何守卫和坐标中点融合输出最终边界框。在31,921条Ref-L4表达上,mAcc从72.947%提升至76.013%,Acc@0.9从55.788%提升至61.142%;在RefCOCO系列约3万条表达上,各数据集在Acc@0.5、mAcc和平均IoU上均有提升。跨数据集和单框变体实验进一步验证了方法的泛化性,且该方法可与现有定位专家模型互补。消融实验表明几何守卫是关键组件。研究揭示了指代对象选择与边界精度在一定程度上可分离,不同组件对IoU曲线不同区间产生差异化影响,单一阈值无法全面反映这种效应。
| LFPR (Label-Free Precision Refinement) | 无标签精度细化,一种在推理时无需目标标注即可提升边界框精度的方法。 |
| IoU curve | IoU曲线,描述不同交并比阈值下模型性能的曲线,用于评估定位精度。 |
| mAcc | 平均精度,在多个IoU阈值下计算的平均准确率,用于综合评估定位性能。 |
| Ref-L4 | 一个用于指代表达理解的数据集,包含大量表达式和边界框标注。 |
| EGM | 一种接地专家模型,专门用于指代表达理解任务,具有不同参数规模(如4B和8B)。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅