该研究探讨了训练语言模型激活探针所需的合成数据量问题。作者针对高风险情境、有害回复和指令不遵从三类监控概念,在14个评估分布和4种探针模型上追踪了10至590个合成样本的学习曲线。结果显示,探针所需数据量取决于监控对象本身:高风险和有害概念在80个样本后即接近饱和,而指令探针需要数倍于此的数据,该排序在更小模型和真实样本上同样成立。研究进一步发现,概念和分布解释了42-45%的方差,而生成器、探针模型和提示细节的影响不足10%。决定数据需求的核心因素是覆盖度而非单类难度——每类分布饱和所需的本类样本中位数仅为7-11个,概念间的差异主要源于不同类别样本间的迁移程度:高风险概念下迁移近乎完全,有害概念次之,指令概念最弱。这意味着广度策略的收益因概念而异,对指令监控不可或缺,对高风险监控则近乎冗余。
| 激活探针 (Activation Probe) | 一种在语言模型内部激活上训练的分类器,用于监控模型输出是否涉及特定概念(如高风险、有害内容)。 |
| 半增益大小 (Half-Gain Size) | 拟合学习曲线达到一半最大增益所需的样本数量,用于量化一个概念所需的数据深度。 |
| 覆盖度 (Coverage) | 指一种类型的合成样本能够代表或迁移到同一概念下其他类型的程度,覆盖度越高,所需类型越少。 |
| 生成器LLM (Generator LLM) | 用于生成合成对话数据的语言模型,其选择可能影响探针训练的效果。 |
| 留出评估分布 (Held-out Evaluation Distribution) | 在训练中未使用、用于评估探针泛化性能的数据分布,通常代表不同的应用场景或数据来源。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅