🔥 今日值得一读 大模型跨语言解题靠共享特征?新方法GI-SAE实测6种语言,结果出乎意料!
Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders
arXiv LG (cs.LG) 🔥 重点 论文方法大模型多语言 🕐 08-26 12:00

📖 AI 总结

该研究探讨多语言大模型在解决相同数学问题时,是否依赖跨语言共享特征还是语言特有计算。作者使用MGSM数据集,在四个家族的五个模型上,用六种语言求解问题,并通过CKA识别跨语言对齐层,训练了基线稀疏自编码器和新提出的几何不变稀疏自编码器(GI-SAE)。GI-SAE通过InfoNCE损失增强编码器对同一问题不同语言表征的相似性。结果显示,尽管GI-SAE在几何相似性指标上普遍提升,但更高的几何相似性并不保证功能可互换性。跨语言特征共享具有模型和架构依赖性,出现深度各异。GI-SAE主要放大已有跨语言结构,效果因模型而异:在Qwen中增强,在Gemma中无功能提升,在Llama和Phi中呈分层混合效应。该研究揭示了多语言推理机制的内在复杂性,对可解释性和多语言模型设计有参考价值。

🔑 关键词速览

Sparse Autoencoders (SAE)稀疏自编码器,一种通过稀疏约束学习数据高效表示的神经网络模型。
Geometry-Invariant SAE (GI-SAE)几何不变稀疏自编码器,本文提出的对比变体,通过InfoNCE损失增强跨语言特征共享。
Centered Kernel Alignment (CKA)中心核对齐,一种衡量神经网络表示相似性的方法。
InfoNCE loss信息噪声对比估计损失,一种对比学习损失,用于拉近正样本对、推远负样本对。
Kullback-Leibler (KL) divergenceKL散度,衡量两个概率分布差异的非对称度量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅