视觉语言模型框不准?LFPR无需标注,推理时自动精修,mAcc暴涨3%!
Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement
arXiv CV (cs.CV) 重要 #视觉语言模型#边界细化#推理优化 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
提出无标签推理时边界细化方法,利用模型自身预测分配局部观测,提升指代定位框精度而不需标注。

📖 AI 总结

该研究提出了一种无需标注的推理时边界精化方法(LFPR),用于改善视觉-语言模型在指代表达理解中的定位精度。核心思路是让冻结的直答模型利用自身预测结果,对预测较小的区域进行高分辨率二次观察,在上下文裁剪中重新定位,并通过固定几何守卫和坐标中点融合输出最终边界框。在31,921条Ref-L4表达上,mAcc从72.947%提升至76.013%,Acc@0.9从55.788%提升至61.142%;在RefCOCO系列约3万条表达上,各数据集在Acc@0.5、mAcc和平均IoU上均有提升。跨数据集和单框变体实验进一步验证了方法的泛化性,且该方法可与现有定位专家模型互补。消融实验表明几何守卫是关键组件。研究揭示了指代对象选择与边界精度在一定程度上可分离,不同组件对IoU曲线不同区间产生差异化影响,单一阈值无法全面反映这种效应。

🔑 关键词速览

LFPR (Label-Free Precision Refinement)无标签精度细化,一种在推理时无需目标标注即可提升边界框精度的方法。
IoU curveIoU曲线,描述不同交并比阈值下模型性能的曲线,用于评估定位精度。
mAcc平均精度,在多个IoU阈值下计算的平均准确率,用于综合评估定位性能。
Ref-L4一个用于指代表达理解的数据集,包含大量表达式和边界框标注。
EGM一种接地专家模型,专门用于指代表达理解任务,具有不同参数规模(如4B和8B)。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅