🔥 今日值得一读 有害意图随层数单调上升!288参数MLP实现轻量审核,仅存262KB
Harmfulness Propagation Dynamics: Layer-wise Trajectories of Adversarial Intent in Large Language Models
arXiv CL (cs.CL) 🔥 重点 #安全对齐#可解释性#表示分析#越狱检测 🕐 09-15 12:00
👨‍💼 主理人解读 · 为什么值得关注
揭示有害意图在模型各层的演化轨迹,可用于构建更鲁棒的有害提示检测与安全过滤机制。

📖 AI 总结

该研究提出“有害性传播动力学”(HPD)这一跨层信号:对于有害提示,最后一 token 的隐藏状态在学习到的有害方向上的投影随 Transformer 深度单调上升,而良性提示则保持平坦或振荡。这一现象表明有害意图是一种逐步解析的语义属性——表层形式较早出现,语用意图则在后期才固化,因此轨迹形状比任何单层快照都更具信息量。基于逐层学习的有害方向在随机划分下保持稳定(余弦相似度大于0.97),作者进一步构建了轻量级输入审核器HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,并用仅288参数的MLP分类。该方法每层仅存储一个方向向量,训练无需梯度计算,推理开销极低。在八个基准和四个模型家族上,HERALD在OLMo2-7B上平均F1达89.3,对抗越狱检测F1为98.4,优于所有受测防护模型,并在各骨干上超越既有潜空间方法2.3至4.1个F1点。其逐实例轨迹还可作为可读审计记录,揭示有害性何时及如何涌现,在可解释性上优于单层方法。

🔑 关键词速览

Harmfulness Propagation Dynamics (HPD)有害性传播动力学,指有害提示的隐藏状态投影随模型深度单调上升的跨层特征。
harm direction有害方向,通过LDA逐层学习得到的向量,用于将隐藏状态投影为有害性分数。
HERALD基于激活层动力学的有害编码识别,一种利用跨层投影序列进行有害提示检测的轻量级方法。
adversarial jailbreak detection对抗性越狱检测,识别旨在绕过模型安全限制的对抗性提示的任务。
prefill FLOPs预填充浮点运算次数,衡量模型处理输入提示阶段的计算开销。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅