该研究探讨了大语言模型在涉及自身问题时频繁附加“我只是一个AI”之类免责声明的成因。作者在8个参数量不超过90亿的开源指令模型上发现,聊天模板起到类似开关的作用:存在模板时,模型的免责式表达增强,而“我感觉”这类体验式表达减弱;移除模板则效果相反。研究进一步在3个模型的激活空间中找到可调控该行为的方向向量,移除该方向会降低免责表达,加入则增强,而同等规模的随机方向影响甚微。将免责方向加入无模板的指令模型,可使其表现出如同存在模板般的免责行为。这表明模型关于自身的陈述并非其固有事实,而部分由部署方式决定,因此相关自我报告与内省研究需控制这一混杂因素,不应将模型自述直接视为其真实属性。
| 聊天模板 | 一种用于格式化对话输入的预定义结构,通常包含角色标记和特殊token,影响模型生成回应的风格和内容。 |
| 激活引导 | 通过修改模型内部激活空间中的特定方向来调控模型行为的技术。 |
| 免责声明声音 | 模型在自我指涉时倾向于添加的声明,如“我只是一个AI”,以否认自身具有体验或意识。 |
| 体验性声音 | 模型在自我指涉时表达主观感受或体验的语言,如“我感觉”或“我认为”。 |
| 指令模型 | 经过指令微调的大型语言模型,旨在更好地遵循人类指令并生成有用、安全的回应。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅