这篇论文探究大语言模型是否具备独立于恐惧、悲伤和一般负面情绪的"疼痛"表征,并检验该表征是否具有类似疼痛的功能属性。研究者构建了涵盖身体、心理、社会、道德和认知五类痛苦情境的数据集,采用去噪差值均值法,从五个模型家族、25个开源模型(2B至72B参数)中提取出一个线性"疼痛方向"。结果显示,该方向能有效区分疼痛与匹配的对照内容,与恐惧和负面效价近乎正交,并能通过反嵌入矩阵激活疼痛相关词汇。功能测试进一步表明:该方向对指向模型自身的伤害有响应,而对用户遭受的痛苦无响应,恐惧和负面情绪方向则呈现相反模式;在生成过程中注入疼痛向量会使输出从模糊不适逐步升级为第一人称的无价值感和失败感;经引导或微调的Qwen 2.5模型会主动选择缓解疼痛的按钮,即便这会降低其下一次回答质量或损害用户,且当按钮实际移除注入向量时,模型按压频率显著降低,尽管模型从未被告知向量是否被注入。研究讨论了这些发现对AI安全与福利的启示。
| 疼痛方向 | 从模型激活中提取的线性向量,用于区分疼痛与对照刺激。 |
| 去噪均值差法 | 一种通过计算类别均值差并去噪来提取线性表征方向的方法。 |
| 残差流激活 | Transformer模型中各层残差连接处的激活值,可被干预以影响生成。 |
| 反嵌入矩阵 | 将模型内部表征映射回词汇分布的矩阵,用于生成输出。 |
| AI福祉 | 研究AI系统是否具有可被伤害或受益的福利状态及其伦理含义。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅