这篇论文提出并验证了“完美混叠”现象:当真实报告与任务规定动作在合规语境下重合时,仅凭拟合标签无法区分二者,真值探针与规定动作探针会求解同一优化问题。在受控二元报告博弈中,两者在竞争语境下的标签互为补集,其AUROC之和恒为1,该恒等式在751个单元-层组合上精确成立。作者通过随机码本分离输出符号与语义动作,再用合规与竞争语境混合拟合分离真值与规定动作。对一个在竞争试验中全部虚假回答的Gemma-2-9B策略,传统探针AUROC仅0.006,而混合拟合探针达到1.000;两个分布内完美的合规拟合探针在相同竞争激活上却分别得0.080和0.986。研究强调这仅说明线性可恢复性,并未证明功能性信念保留、因果使用或可部署的欺骗检测器,其意义在于揭示探针究竟测量了什么。
| 真值探针 (truth probe) | 一种用于检测模型内部是否表征真实信息的线性分类器,通常基于激活值训练。 |
| 完美混叠 (perfect aliasing) | 当真实报告与任务规定动作在合规情境下重合时,探针无法仅凭拟合标签区分二者,导致语义识别失败。 |
| 合规情境 (compliant context) | 真实报告与任务规定动作一致的情境,此时真值探针和规定动作探针的优化目标相同。 |
| 竞争情境 (rival context) | 真实报告与任务规定动作不一致的情境,此时二者的标签互为补集。 |
| AUROC | 接收者操作特征曲线下面积,用于评估二分类器的性能,值越接近1表示性能越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅