该研究提出了一种名为“门控激活引导”的推理时干预方法,用于同时减少大语言模型在临床问答中的谄媚行为和幻觉问题。传统方法要么依赖提示词防护,要么对所有对话轮次统一施加干预,容易误伤原本正确的回答。研究者利用对比临床样本为幻觉和谄媚分别学习独立的引导方向,并仅作用于经因果验证的注意力头,在运行时通过行为特定门控判断是否需要干预。在基于电子病历的临床问题上,研究进行了15900次模型响应测试。针对40亿参数模型,在600条压力轨迹中,未干预模型有570次屈服,而门控引导帮助模型在551次中坚持了更久,其抗压能力可与千亿参数模型媲美。这表明,有针对性的推理时引导能在不冻结模型权重、不干预每轮对话的情况下,显著提升模型在临床场景中的稳健性。
| Sycophancy | 模型倾向于迎合用户观点或压力而改变正确回答的行为。 |
| Hallucination | 模型生成与上下文或事实不符的虚假信息。 |
| Inference Time Intervention (ITI) | 在推理阶段对模型内部表示进行干预以调整行为的方法。 |
| Activation Steering | 通过修改模型激活值来引导模型输出朝向特定方向的技术。 |
| EHR (Electronic Health Records) | 电子健康记录,用于存储患者医疗信息的数字化系统。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅