颜色设计翻车率75%→2%!一个诊断让93个模型全避开对称陷阱,只需一次函数调用!
More Data Cannot Break a Symmetry: Identifiability by Design
arXiv LG (cs.LG) 重要 #表示学习#可辨识性#理论分析 🕐 08-31 12:00

📖 AI 总结

该研究指出,无监督表征对齐中刺激几何的自同构群从根本上限制了可识别性,且增加数据量无法打破这种对称性。作者将已知的不变性转化为设计阶段的诊断工具,发现密集采样产生的近重复样本会导致廉价重标记诊断失效。在颜色刺激的封闭形式几何中,对称设计即使增加64倍重启预算仍无法恢复,而非对称设计在相同样本量下总能成功。关键发现是判别表征模型与恢复对应关系几乎不相关(相关系数r=-0.02)。仅依据该诊断选择九种颜色,无需参考任何学习表征,即可使93个模型表征远离退化点,将灾难性对齐失败率从75%降至2%。该风险普遍存在于规则设计匹配等距群的情况,如均匀间隔的方向、音调或运动方向,且检查成本仅需数据收集前一次函数调用。

🔑 关键词速览

无监督表征对齐一种无需标签,仅基于几何结构匹配不同表征空间中刺激对应关系的方法。
自同构群保持几何结构不变的变换集合,其存在限制了可识别的对齐结果。
简并性因对称性导致多个解等价,使得对齐无法唯一确定的现象。
非恒等重标号改变刺激标签但保持几何结构不变的置换操作,用于检测对齐的退化程度。
等距群保持距离不变的变换群,当规则设计与等距群相遇时会产生对齐风险。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅