该研究针对AI生成文本检测器内部表征机制不明的问题,以冻结的BERT-base-uncased编码器为对象,在RAID基准上考察六类生成模型(含纯基座与指令微调模型)。研究者采用稀疏探针方法对全部9216个CLS隐藏维度进行筛选,发现每个生成器仅需不足1%的神经元即可保留接近全特征的检测精度,且该神经元集合在不同折与随机种子下保持稳定。双向激活修补实验证实这些神经元的因果作用,其翻转预测的频率比同等规模的随机集合高出一个数量级;而均值消融后准确率基本不变,说明信号呈冗余分布。跨生成器分析揭示出二分结构:指令微调模型的稳定神经元有30%至36%集中于BERT最后一层,基座模型则低于14%,与后训练对齐在第十二层留下的印记相符。留一法评估显示,所选神经元在未见生成器家族上仍能保持86%至94%的性能上限,表明检测器可依托小型固定子空间运行,无需针对每个生成器重新识别神经元。
| BERT-base-uncased | 一种预训练语言模型,具有12层Transformer编码器,隐藏层维度为768,不区分大小写。 |
| RAID | 一个用于AI生成文本检测的基准数据集,包含多种生成器产生的文本。 |
| 稀疏探测 | 一种通过L1到L2正则化从模型隐藏状态中识别少量关键神经元的方法。 |
| 激活修补 | 一种因果干预技术,通过替换或消融特定神经元的激活来测试其对模型预测的影响。 |
| 指令微调 | 在预训练模型上使用指令数据进一步训练,使其更好地遵循人类指令。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅