这篇论文研究大语言模型自我报告的真实性问题,试图从机制层面区分“真实内省”与“合理编造”。作者在受控环境中用低秩适配器训练模型,让模型依据潜在的线性偏好函数为虚构角色做决策。研究发现,即使没有显式的自我报告监督,持续微调也能让模型准确报告自己学到的偏好。进一步分析表明,这种准确自我报告伴随可测量的结构变化:偏好表征随训练逐渐前移到更早的层,使既有的语言表达机制能够访问。作者还用归因修补发现,忠实模型的决策任务与自我报告任务之间具有显著更高的归因相似度,可作为识别忠实自我报告的机制特征。该工作提出,至少在这一受限设定下,可以通过考察网络内部结构而非报告内容本身来区分忠实与不忠实的自我报告,为理解模型内省提供了新的机制视角。
| 低秩适配器 | 一种参数高效微调方法,通过注入低秩矩阵来调整预训练模型,减少训练参数量。 |
| 忠实自我报告 | 模型对其内部状态或偏好做出的准确、真实的描述,而非虚构或错误报告。 |
| 归因修补 | 一种机制可解释性技术,通过计算输入特征对模型输出的归因来定位重要神经元或路径。 |
| 权重消融 | 通过移除或置零模型部分权重来观察其对性能或行为的影响,以识别关键组件。 |
| 冻结层实验 | 在训练过程中固定某些层的参数不更新,以研究这些层在任务中的作用或表征变化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅