该研究挑战了机制可解释性中广泛采用的线性表示假设,即高层概念在激活空间中编码为线性方向。作者指出,自然视觉概念之间的过渡往往并非线性:晴天与暴风雨之间存在少量白云的中间天气状态,毛毛虫到蝴蝶的演变也不是翅膀持续生长的线性过程。当直接提示文本到图像模型生成中间属性时,其激活值很少落在连接两端点的直线上。为此,作者提出KANSteer方法,将概念遍历建模为穿过中间状态的曲线,并采用Kolmogorov-Arnold网络提供一维坐标,由学习到的函数定义轨迹,使引导方向随概念变化而保持可解释性。在多个概念和文本到图像扩散Transformer上的实验表明,激活轨迹显著偏离直线,KANSteer相比线性引导能更贴合中间属性并实现更平滑的过渡。
| 线性表示假设 (LRH) | 一种假设,认为神经网络中的高层概念被编码为激活空间中的线性方向。 |
| KANSteer | 本文提出的方法,将概念遍历建模为穿过中间状态的曲线,用于引导文本到图像模型。 |
| 柯尔莫哥洛夫-阿诺德网络 (KAN) | 一种神经网络架构,基于柯尔莫哥洛夫-阿诺德表示定理,提供可解释的一维坐标表示。 |
| 文本到图像扩散变换器 | 结合扩散模型和变换器架构的生成模型,用于根据文本提示生成图像。 |
| 激活轨迹 | 模型在处理不同输入时,内部激活值在激活空间中形成的路径或曲线。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅