该研究提出“有害性传播动力学”(HPD)这一跨层信号:对于有害提示,最后一 token 的隐藏状态在学习到的有害方向上的投影随 Transformer 深度单调上升,而良性提示则保持平坦或振荡。这一现象表明有害意图是一种逐步解析的语义属性——表层形式较早出现,语用意图则在后期才固化,因此轨迹形状比任何单层快照都更具信息量。基于逐层学习的有害方向在随机划分下保持稳定(余弦相似度大于0.97),作者进一步构建了轻量级输入审核器HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,并用仅288参数的MLP分类。该方法每层仅存储一个方向向量,训练无需梯度计算,推理开销极低。在八个基准和四个模型家族上,HERALD在OLMo2-7B上平均F1达89.3,对抗越狱检测F1为98.4,优于所有受测防护模型,并在各骨干上超越既有潜空间方法2.3至4.1个F1点。其逐实例轨迹还可作为可读审计记录,揭示有害性何时及如何涌现,在可解释性上优于单层方法。
| Harmfulness Propagation Dynamics (HPD) | 有害性传播动力学,指有害提示的隐藏状态投影随模型深度单调上升的跨层特征。 |
| harm direction | 有害方向,通过LDA逐层学习得到的向量,用于将隐藏状态投影为有害性分数。 |
| HERALD | 基于激活层动力学的有害编码识别,一种利用跨层投影序列进行有害提示检测的轻量级方法。 |
| adversarial jailbreak detection | 对抗性越狱检测,识别旨在绕过模型安全限制的对抗性提示的任务。 |
| prefill FLOPs | 预填充浮点运算次数,衡量模型处理输入提示阶段的计算开销。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅