该研究探讨了线性探针在语言模型激活中检测欺骗行为时,面对分布外数据泛化能力不足的问题。作者以Llama-3.1-8B-Instruct为对象,在三个保留的欺骗检测数据集上实验,发现将输入投影到训练激活分布的一小组主成分上,可实现接近直接在测试分布上训练探针的跨域迁移性能。进一步,他们利用大语言模型作为评判者,对各主成分的最强/最弱激活样例进行评分,筛选出可迁移的欺骗方向,从而在Insider Trading Report和Sandbagging数据集上分别将基线到理想性能的差距缩小了78%和25%。研究揭示,源探针权重较大的方向多编码源域特有表面特征,而真正可迁移的方向则以更抽象、可被自然语言描述的形式编码相同对比。总体而言,探针的分布外鲁棒性主要由子空间选择决定。
| 线性探针 (Linear Probes) | 一种简单的分类器,用于检测语言模型内部激活中是否编码了特定概念或行为。 |
| 分布外泛化 (Out-of-Distribution Generalization) | 模型在训练数据分布之外的新数据上的表现能力,这里指探针在不同欺骗检测数据集上的迁移能力。 |
| 主成分 (Principal Components, PCs) | 通过主成分分析得到的激活空间中的正交方向,用于降维和识别数据中的主要变化模式。 |
| 子空间选择 (Subspace Selection) | 从高维特征空间中选择一个子集或子空间的过程,这里指选择特定的主成分以提高探针的迁移性能。 |
| LLM评判器 (LLM Judge) | 使用大型语言模型作为自动评估工具,对主成分的解释性进行评分,以识别可迁移的方向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅