该研究采用机制可解释性技术,分析了Gemma-3-27B大语言模型内部如何表征抑郁症状。研究者基于临床验证工具中的症状描述记录模型激活,发现症状组在第21层残差流中几何分离最明显。通过语义投影方法,他们构建了症状向量,并将其应用于自然语言文本,所得各症状系数能保持临床医生标注的情绪、躯体及自杀倾向维度的排序。此外,第21层中的单一抑郁向量可区分抑郁与非抑郁文本(AUC=0.789),并可作为情绪效价门控,限制症状投影仅适用于抑郁相关言语。这些发现表明,模型内部激活中存在与临床判断一致、去相关化的症状信号,为开发可解释的抑郁评估工具提供了机制层面的基础。
| Mechanistic Interpretability | 一种通过分析模型内部结构和激活来理解其决策机制的技术方法。 |
| Residual Stream | Transformer模型中各层之间传递的残差连接向量,承载了模型处理信息的核心状态。 |
| Semantic Projection | 一种将文本表示映射到特定语义方向(如症状向量)上的技术,用于量化语义特征。 |
| Symptom Vectors | 从临床工具中提取的、代表特定症状语义方向的向量,用于在模型内部识别症状信号。 |
| Emotional Valence Gate | 一种基于情感效价(如抑郁与非抑郁)的过滤机制,用于限制症状投影仅适用于相关文本。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅