该研究挑战了跨设备硬件评估中一个常见假设:若架构排名能在设备间迁移,代理设备便可支持目标端的模型选择。作者在NAS-Bench-201上发现,跨设备排名相关性虽为中等水平,但目标可比的可行集重叠并不完整,即便引入忠实的AdaProxy诊断显著改善延迟排名,边界失效依然存在,说明问题并非源于适配能力不足。有限样本分裂共形分析进一步揭示了证据瓶颈:单侧90%阈值至少需要九个校准观测。作者随后在13台HW-GPT-Bench设备上的10000个GPT架构中复现该现象,相对RTX3080代理,目标延迟SRCC高达0.951至0.996,但在匹配联合约束下,代理复用违规风险却介于33.3%至100%之间。这表明排名可迁移性、可行性可迁移性与目标特定决策支持是三个不同的评估对象,跨设备评估应明确报告哪些目标环境真正支持所声称的工作点。
| Rank Portability | 排名可迁移性:指模型架构在不同设备上的性能排名是否保持一致。 |
| Feasibility Portability | 可行性可迁移性:指在代理设备上满足约束的模型在目标设备上是否同样满足约束。 |
| Joint Latency-Energy Feasibility | 联合延迟-能耗可行性:同时考虑延迟和能耗两个约束条件,判断模型是否满足要求。 |
| Split-Conformal Analysis | 分裂共形分析:一种用于构建预测区间或阈值的方法,基于有限样本提供统计保证。 |
| SRCC | 斯皮尔曼等级相关系数:衡量两个变量排名之间相关性的非参数指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅