该研究针对机器人修剪树木这一应用场景,探讨了视觉编码器选择对联合语义分割与立体深度估计任务的实际影响。作者构建了硬参数共享网络,在固定数据集、解码器、损失函数、训练计划和评估标准的前提下,仅替换编码器,对CNN、Transformer、混合架构、MLP-mixer及状态空间模型等约2500万参数规模的多类编码器进行了从头训练的受控对比。三项核心发现值得关注:卷积与混合编码器整体表现优于纯Transformer,多数纯视觉Transformer从头训练时性能崩溃;参数量并不能预测模型质量,小型编码器可超越参数量大两个数量级的模型;分割与深度任务的排名高度一致,表明两项任务之间不存在冲突。此外,部分编码器退化为“全部判为树”的无效分割,边界F1指标能揭示该问题而区域IoU无法察觉。
| Vision Backbone | 视觉骨干网络,指用于提取图像特征的神经网络主体结构,如CNN或Transformer。 |
| Joint Semantic Segmentation and Stereo Depth | 联合语义分割与立体深度估计,指同时进行像素级分类和距离预测的多任务学习。 |
| Parameter Sharing | 参数共享,指不同任务分支共用同一组网络参数,以减少参数量并促进特征复用。 |
| Boundary F1 | 边界F1分数,一种评估分割边界准确性的指标,对边界错误更敏感。 |
| Spearman ρ | 斯皮尔曼等级相关系数,用于衡量两个变量排名之间的相关性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅