本文针对大语言模型隐藏表征中线性探针检测社会偏见的可靠性问题提出了一套几何与统计理论。研究指出,现有探针准确率几乎都来自每个输入都带明确人口统计标记的反事实评估;当仅有一部分输入携带此类信息时,性能会急剧下降,此时弱探针既可能意味着模型无偏见,也可能只是检测器功效不足。作者将表征建模为具有马氏距离分离度和流形曲率的两类条件簇,证明了四项结论:受流形外半径约束的有限样本泛化界及匹配的极小极大下界;最大线性探针AUC关于人口标记比例严格递增的纯度定律;曲率上限;以及低于该阈值时任何审计都无法将探针输出与随机猜测区分。理论在合成流形和六个开源模型、四个偏见维度上得到验证,纯度定律仅凭在完整标记下测得的一个参数即可预测整条AUC曲线。该框架将偏见审计转化为功效分析,可依据目标纯度和效应量给出所需样本预算。
| 线性探针 (Linear Probing) | 一种在模型隐藏表示上训练线性分类器以检测特定属性(如社会偏见)的标准方法。 |
| 马氏距离 (Mahalanobis Separation) | 一种考虑数据协方差结构的距离度量,用于量化两个类条件簇之间的分离程度。 |
| 纯度定律 (Purity Law) | 描述最大线性探针 AUC 与携带人口统计信息的输入比例 α 之间严格递增关系的精确公式。 |
| 曲率上限 (Curvature Ceiling) | 在曲率为 κ 的空间形式上,环境弦分离不能超过 2/√κ 的理论限制。 |
| 可检测性阈值 (Detectability Threshold) | 一个临界值,低于此值时任何审计方法都无法区分探针输出与随机猜测。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅