不到10万参数,COCO检测84.7 mAP50,这个紧凑视觉系统有点东西!
TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
arXiv CV (cs.CV) 重要 #计算机视觉#结构化表示#多任务学习 🕐 今天 12:00

📖 AI 总结

该论文提出TAPe+ML v3,一个基于主动感知理论(TAPe)的紧凑型多任务计算机视觉系统。其核心思路是不直接处理像素张量,而是先通过结构化表示编码感知元素间的关系,再结合模块化识别架构完成图像分类、目标检测和实例分割任务。系统整合背景与轮廓处理、局部定位、原型分类及协调器,参数量不足10万。在COCO检测上取得84.7 mAP50和65.3 mAP50-95,实例分割达80.7 mask mAP50和58.4 mask mAP50-95;分类任务中Imagenette验证准确率92%,ImageNet-Real Top-1为89.9%。研究还评估了视频场景检测的紧凑性及工业试点中的分布偏移适应。结果表明,将部分建模负担从网络参数转移到结构化输入表示,有助于在降低数据、内存和算力需求的同时实现紧凑的多任务视觉系统。

🔑 关键词速览

TAPe (Theory of Active Perception)主动感知理论,一种在识别前编码感知元素间关系的结构化表示方法。
TAPe+ML v3基于 TAPe 的紧凑型多任务计算机视觉系统,参数量少于 10 万。
mAP50 / mAP50-95目标检测和实例分割中常用的平均精度指标,分别对应 IoU 阈值 0.5 和 0.5 到 0.95 的平均值。
ImagenetteImageNet 的一个子集数据集,常用于快速分类实验。
分布偏移 (distribution shift)测试数据分布与训练数据分布不一致的情况,用于评估模型的泛化能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅