该研究探讨了将神经网络可解释性技术“susceptibilities”应用于图灵机,以识别其算法结构。作者针对Murfet和Troiani提出的带噪图灵机学习问题,通过探测局部损失景观,证明了图灵机算法中的对称性和路径分离会反映为其susceptibility矩阵中的置换对称性和低秩块。研究在确定性有限自动机(DFA)上进行了实证验证,结果表明通过主成分分析和聚类方法,能够从susceptibility空间中有效恢复算法特征。该工作为理解算法内部机制提供了新视角,并展示了可解释性技术跨领域应用的潜力。
| susceptibilities | 一种用于神经网络的可解释性技术,通过分析损失景观的局部曲率来揭示模型内部结构。 |
| Turing machines | 一种抽象计算模型,由艾伦·图灵提出,用于定义可计算性。 |
| deterministic finite automata (DFAs) | 确定性有限自动机,一种简单的计算模型,具有有限状态集和确定性转移规则。 |
| loss landscape | 损失函数在参数空间中的几何结构,用于描述模型训练的动态特性。 |
| principal component analysis (PCA) | 主成分分析,一种降维技术,用于提取数据中的主要变化方向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅