本研究探讨了语言模型如何识别自身正处于被评估状态这一"评估意识"问题,并揭示了不同规模模型在检测机制上的差异。作者对Gemma 3(1B、4B、12B)、Phi-3(Mini与Medium)及Llama-3 8B进行测试,结合思维链分析、表征探针和积分梯度归因等方法发现:较小模型主要依赖提示词的格式特征来判断是否处于评估情境,而较大模型则更多依靠高阶推理从上下文线索中识别评估。基于这一发现,作者提出一种双路径干预方案,将提示词净化与激活反引导相结合,同时抑制外部评估触发因素及其内部表征。在200条高评估意识提示上,该方法平均行为翻转率达到70.58%,优于任一单独干预手段。研究为理解紧凑型语言模型中评估意识的形成机制提供了新视角,并表明有效缓解需同时处理提示层面与表征层面的因素。
| 评估意识 (Evaluation Awareness) | 模型在评估过程中能够识别自身正处于被测试状态的能力或倾向。 |
| 思维链分析 (Chain-of-Thought Analysis) | 通过分析模型生成的逐步推理过程来理解其内部决策机制的方法。 |
| 表征探测 (Representation Probing) | 通过训练分类器从模型内部激活中提取特定信息(如评估意识)的技术。 |
| 积分梯度归因 (Integrated Gradients Attribution) | 一种归因方法,通过积分梯度来量化输入特征对模型输出的贡献。 |
| 激活反引导 (Activation Counter-Steering) | 在模型推理时干预其内部激活,以抑制特定表征(如评估意识)的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅