该论文提出TAPe+ML v3,一个基于主动感知理论(TAPe)的紧凑型多任务计算机视觉系统。其核心思路是不直接处理像素张量,而是先通过结构化表示编码感知元素间的关系,再结合模块化识别架构完成图像分类、目标检测和实例分割任务。系统整合背景与轮廓处理、局部定位、原型分类及协调器,参数量不足10万。在COCO检测上取得84.7 mAP50和65.3 mAP50-95,实例分割达80.7 mask mAP50和58.4 mask mAP50-95;分类任务中Imagenette验证准确率92%,ImageNet-Real Top-1为89.9%。研究还评估了视频场景检测的紧凑性及工业试点中的分布偏移适应。结果表明,将部分建模负担从网络参数转移到结构化输入表示,有助于在降低数据、内存和算力需求的同时实现紧凑的多任务视觉系统。
| TAPe (Theory of Active Perception) | 主动感知理论,一种在识别前编码感知元素间关系的结构化表示方法。 |
| TAPe+ML v3 | 基于 TAPe 的紧凑型多任务计算机视觉系统,参数量少于 10 万。 |
| mAP50 / mAP50-95 | 目标检测和实例分割中常用的平均精度指标,分别对应 IoU 阈值 0.5 和 0.5 到 0.95 的平均值。 |
| Imagenette | ImageNet 的一个子集数据集,常用于快速分类实验。 |
| 分布偏移 (distribution shift) | 测试数据分布与训练数据分布不一致的情况,用于评估模型的泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅