RECOUNT提出了一种基于参考图像引导的零样本目标计数框架,旨在解决文本引导计数方法在细粒度类别上分类能力不足、以及少样本计数方法依赖人工标注的问题。其核心思路是用单张场景外参考图像替代文本提示来指定目标类别,并利用扩散模型作为对比数据引擎,将单一参考图像扩展为多样化的示例图库,以弥补视觉类别覆盖不足的缺陷。该框架保持底层计数器的类别无关提议能力,将分类任务交由独立视觉模块处理,通过匹配目标与干扰图库实现判别。实验表明,RECOUNT在LookAlikes和PairTally两个基准上分别将计数误差降低55%和21%,显著优于现有零样本计数方法,为无需人工标注的精确视觉计数提供了可行方案。
| RECOUNT | 本文提出的即插即用框架,利用合成视觉示例进行参考引导的零样本计数。 |
| zero-shot counting | 零样本计数,指在未见过目标类别的情况下进行对象计数的任务。 |
| diffusion model | 扩散模型,一种生成模型,通过去噪过程生成图像,本文用作数据引擎。 |
| exemplar gallery | 示例画廊,由参考图像扩展出的多样化示例集合,用于提供判别性视觉信息。 |
| MAE (Mean Absolute Error) | 平均绝对误差,衡量计数预测与真实值之间平均绝对差异的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅