视觉Transformer也能按需省算力!ProgResViT多轮渐进推理,精度超DeiT-III,代码已开源
ProgResViT: Progressive Resolution and Width for Adaptive Vision Transformers
arXiv CV (cs.CV) 重要 #推理优化#Transformer#图像分类 🕐 09-04 12:00

📖 AI 总结

ProgResViT提出了一种输入自适应的视觉Transformer架构,旨在解决传统ViT对所有图像使用固定计算量的问题。其核心设计是渐进式推理机制:首轮以低分辨率和窄子网络处理图像,若预测置信度不足,则复用已有表征,逐步提升输入分辨率并扩展网络宽度进行细化。研究团队为此提出了Progress-Conditioned Soft Gating机制,确保多轮推理共享单一骨干网络时,能根据当前轮次、模块和分辨率动态调节特征融合。实验表明,在图像分类任务中,ProgResViT在准确率与计算量的权衡上优于自适应宽度、深度及动态令牌等基线方法;结合知识蒸馏后,其DeiT版本达到84.9%的Top-1准确率,略超DeiT-III-S。该设计同样适用于自监督DINO表征及下游语义分割任务,展现出良好的通用性。

🔑 关键词速览

ProgResViT一种输入自适应的视觉Transformer,通过多轮渐进式推理(从低分辨率窄网络到高分辨率宽网络)来优化计算效率。
Progress-Conditioned Soft Gating (PSG)一种软门控机制,根据当前推理轮次、块和输入分辨率动态调节令牌融合和层输出。
Vision Transformer (ViT)一种基于Transformer架构的图像分类模型,将图像分割成令牌序列进行处理。
Knowledge Distillation一种模型压缩技术,通过让小型学生模型学习大型教师模型的输出来提高性能。
DINO一种自监督学习框架,用于训练视觉Transformer,无需标签即可学习图像表示。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅