🔥 今日值得一读 因果影响力三因素缺一不可,低响应性直降95%,因果探针引导性能飙升118%!
Capacity, Responsiveness and Alignment: What Makes a Latent Structure Actionable
arXiv CL (cs.CL) 🔥 重点 #可解释性#激活空间#因果分析 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者理解模型内部哪些潜结构真正可控,指导激活引导与行为干预设计。

📖 AI 总结

该研究探讨语言模型激活空间中潜在结构的因果影响力为何存在显著差异,提出因果影响力由容量、响应性和对齐三个因素共同决定。容量衡量模型输出对沿该结构移动的敏感度,响应性反映概念在当前上下文中被激发的难易程度,对齐则体现结构与上下文特定概念表征的匹配程度。研究覆盖4个语言模型家族和50个概念,发现因果有效性需三个因素同时较高:容量和响应性偏低分别使因果效果下降84%和95%,而对齐偏低甚至会逆转效果、抑制概念表达。研究进一步表明,因果性并非结构的固有属性,而是依赖上下文,有效方向构成随语境变化的低维子空间。基于此,作者将线性探针训练限制在该子空间内,提出因果探针,在多个模型上实现17%至118%的引导性能提升,概念检测仅下降3%。

🔑 关键词速览

潜在结构语言模型激活空间中编码特定概念或特征的内部表示模式。
因果影响力一个潜在结构对模型输出行为产生因果效应的程度。
容量模型输出对沿潜在结构方向移动的敏感度,即改变该结构时输出变化的幅度。
响应性在给定上下文下,概念被提升或激活的容易程度。
对齐性潜在结构与当前上下文中概念特定表示之间的匹配程度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅