探针OOD泛化差?选对主成分子空间,性能直逼测试集训练!
Probe Generalization as Subspace Selection for OOD Deception Detection
arXiv CL (cs.CL) 重要 大模型安全对齐论文方法 🕐 09-04 12:00

📖 AI 总结

该研究探讨了线性探针在语言模型激活中检测欺骗行为时,面对分布外数据泛化能力不足的问题。作者以Llama-3.1-8B-Instruct为对象,在三个保留的欺骗检测数据集上实验,发现将输入投影到训练激活分布的一小组主成分上,可实现接近直接在测试分布上训练探针的跨域迁移性能。进一步,他们利用大语言模型作为评判者,对各主成分的最强/最弱激活样例进行评分,筛选出可迁移的欺骗方向,从而在Insider Trading Report和Sandbagging数据集上分别将基线到理想性能的差距缩小了78%和25%。研究揭示,源探针权重较大的方向多编码源域特有表面特征,而真正可迁移的方向则以更抽象、可被自然语言描述的形式编码相同对比。总体而言,探针的分布外鲁棒性主要由子空间选择决定。

🔑 关键词速览

线性探针 (Linear Probes)一种简单的分类器,用于检测语言模型内部激活中是否编码了特定概念或行为。
分布外泛化 (Out-of-Distribution Generalization)模型在训练数据分布之外的新数据上的表现能力,这里指探针在不同欺骗检测数据集上的迁移能力。
主成分 (Principal Components, PCs)通过主成分分析得到的激活空间中的正交方向,用于降维和识别数据中的主要变化模式。
子空间选择 (Subspace Selection)从高维特征空间中选择一个子集或子空间的过程,这里指选择特定的主成分以提高探针的迁移性能。
LLM评判器 (LLM Judge)使用大型语言模型作为自动评估工具,对主成分的解释性进行评分,以识别可迁移的方向。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅