FAVE提出了一种受人类中央凹视觉启发的自适应视觉编码方法,旨在解决细粒度视觉理解中高分辨率处理成本与全局编码细节丢失之间的矛盾。该方法将“看哪里”与“编码什么”分离,采用轻量级变分辨率ViT,对外部选定的区域进行高精度编码,同时保持原始几何结构。在受控小物体实验中,FAVE在ImageNet上相比固定分辨率ViT提升了9.4个百分点的Top-1准确率,同时计算量降低12.7倍。将FAVE作为局部分支集成到FastVLM后,仅增加至多16个局部token,便在TextVQA上提升1.60分,在GQA属性问题上提升1.31分,并实现3.3倍的TTFT加速。研究结果表明,选择性分配高精度局部计算资源,是补充全局表征和模型规模扩展的高效途径,尤其适用于小物体、文本和属性等细粒度理解任务。
| FAVE | 中央凹自适应视觉编码,一种轻量级可变分辨率ViT,用于高效编码外部选择的局部区域。 |
| ViT | 视觉变换器,一种基于Transformer架构的图像编码模型。 |
| FLOPs | 浮点运算次数,衡量模型计算复杂度的指标。 |
| TTFT | 首令牌生成时间,衡量模型响应速度的指标。 |
| FastVLM | 一种视觉语言模型,FAVE作为其互补局部分支进行集成。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅