矩阵-CODI推理真相:秩截断0.6%误差内全平,81%准确率却秩跨4-13,秩根本不管用!
The Gradient Does Not See Rank: Rank-Indifference in Matrix-CODI on ProsQA
arXiv LG (cs.LG) 重要 #推理优化#可解释性#Transformer 🕐 09-04 12:00

📖 AI 总结

该研究探讨了矩阵化连续思维链(Matrix-CODI)模型中潜在矩阵的秩结构是否承载可分离的推理路径。作者在ProsQA和GSM8K-Aug数据集上,通过四种训练配置和多种读出头(包括双线性、带GELU的非线性、SVD增强及二次型)进行秩-k投影消融实验,发现所有曲线均保持平坦,精度波动不超过0.6个百分点。三种子复现显示,最终有效秩在4至13间变化,但准确率稳定在81.0±2.0个百分点,表明梯度并未对特定秩结构产生偏好。线性探针在目标预测上表现不佳(AUC 0.673 vs 0.846),而GPT-2负对照实验同样呈现平坦曲线,说明秩-k消融本身无法区分“秩无关性”与“位置无关性”。该发现提示,矩阵潜变量中的秩可能并非推理复杂度的可靠指标,对可解释性研究具有方法论警示意义。

🔑 关键词速览

Matrix-CODI一种连续思维链模型,使用矩阵瓶颈路由潜在标记,以压缩推理过程。
秩-k投影消融一种干预方法,将潜在矩阵截断为秩k,以测试模型对低秩表示的敏感性。
有效秩矩阵中显著奇异值的数量,反映潜在表示的实际维度。
读出将潜在表示映射到输出预测的模型组件。
叠加神经网络中多个特征或路径在同一维度上并行编码的现象。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅