本文介绍了一种名为 Capsule Lens 的框架,用于定位和追踪机器学习模型内部表示中的概念几何结构。该框架将概念占据的区域拟合为一种可解释的几何形式——胶囊,并通过闭式解和样本外验证确保准确性。研究在静态和动态两种表示设置下应用该框架:静态分析揭示了不同模型中概念几何的定位及其跨度与范数曲线的特征;动态分析则通过三个案例(CLIP 预训练、视觉问答的强化学习后训练、数学推理的强化学习后训练)追踪表示漂移,发现不同训练方式引发截然不同的几何动态——从 CLIP 预训练的广泛网络重构到强化学习后训练的局部化、概念特异性变化。研究结果既验证了现有文献,也提供了新观察,表明 Capsule Lens 是分析概念几何的有力工具。
| Capsule Lens | 一种新框架,将概念在表示空间中的区域拟合为可追踪的几何形状(胶囊),用于定位和分析概念几何。 |
| Mechanistic Interpretability | 机械可解释性,研究模型内部机制如何编码和处理信息,以理解其行为。 |
| Representation Space | 表示空间,模型内部层输出的向量空间,概念在此空间中编码。 |
| Static and Dynamic Representations | 静态表示指模型固定时的表示,动态表示指训练过程中或不同训练阶段变化的表示。 |
| RL Post-training | 强化学习后训练,在预训练模型基础上通过强化学习进一步调整,以优化特定任务表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅