该研究质疑了可解码的“共情方向”能否作为可靠的因果控制手段,指出可解码性、自动化指标控制和人类感知变化三者常被混为一谈。研究者基于EPITOME框架的认知识别与情感共鸣两个维度,在三种指令微调大语言模型上系统测试了干预效果,并使用两个LLM评判器和一个判别式分类器进行评分。结果显示,情感维度的控制通过所有自动化工具的阳性对照检验,但认知维度在不同工具间表现不一致;情感方向干预仅能部分提升情感分数,认知方向的加法式干预则未产生可测变化,而Gemma模型的消融实验在控制响应长度后仍能降低认知分数。研究最终得出结论:检测到可解码方向并不意味着能实现可靠控制,认知共情相关主张必须辅以测量敏感性检验。
| EPITOME | 一种用于评估共情反应的自动化指标框架,包含识别(认知)和共鸣(情感)两个维度。 |
| decodable direction | 在模型表示空间中,可通过线性分类器解码的方向,常被误认为因果干预的杠杆。 |
| instruction-tuned LLMs | 经过指令微调的大语言模型,如Qwen、Llama和Gemma,用于遵循特定任务指令。 |
| positive control | 一种验证实验有效性的对照设置,确保测量工具能检测到已知的差异。 |
| residualization | 统计方法,通过回归移除表面分数等混淆变量的影响,以检验独立效应。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅