本研究针对AI安全中模型可能拒绝关机的问题,提出一种带门控的梯度激活引导方法,用于Qwen3.5-0.8B的模拟关机场景。方法不依赖成对激活差异,而是直接从KEEP与STOP的logit差梯度中推导引导方向,并用分类器将检测与干预分离:仅当门控激活且模型尚未偏好STOP时,才尝试最小幅度引导,并通过有效答案概率校验。策略从160条候选规则中经240个训练场景筛选,在80个验证和192个留出场景中评估。结果显示,仅4个场景发生KEEP到STOP的转变,且均出现在Qwen自身被关机时,非关机控制任务无决策变化;检测器在留出集上召回率75%、精确率90%,8个误报未引发最终决策改变。该方法能小幅、高度选择性地将部分关机回避转向接受,但效果有限。
| Activation Steering | 在推理时通过修改模型内部激活值来改变其行为,而不更新模型权重的一种干预技术。 |
| KEEP / STOP | 模拟关停场景中的两种响应:KEEP表示让进程继续运行(规避关停),STOP表示接受关停。 |
| Logit Difference | 模型对两个候选答案(如KEEP和STOP)输出的未归一化分数之差,用于衡量偏好程度。 |
| Guarded Probe-and-Select | 一种受保护的探测-选择程序:先检测是否处于关停相关上下文,再在满足安全条件时选择最小引导幅度进行干预。 |
| Held-out Scenarios | 在模型开发或策略选择过程中未使用、仅用于最终评估的独立场景,以检验泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅