现代语言模型内部存在一个单一方向向量,用于追踪语句的情感正负倾向。研究者仅用9个情绪类别名称及每类50段短叙事文本(约1500个标签,远少于传统监督方法),即可提取这一情感轴(V轴),且该方向在视觉、音频和人脑编码器中同样出现,尽管这些编码器从未联合训练。方法是对冻结编码器中九个情绪锚定故事集的嵌入取平均,再计算主方向。投影新输入后,在SST-2上达到监督性能的93%(Llama-3-8B-Instruct,AUC 0.772对比0.828),与11,811张EmoSet图像的人类效价评分相关r=0.636,在ESC-50音频上AUC达0.906。基于文本标签训练的2参数分类器可迁移至图像(AUC 0.961)、音频(0.764)和脑记录(0.828),无需目标模态标签;而通用16维子空间仅随机水平(0.525)。该方法仅适用于连续属性,对类别概念测试接近随机,且引导效果因模型家族而异(Llama/Mistral有效,Qwen/Gemma无效)。
| Valence Axis (V-axis) | 效价轴,指在嵌入空间中表示情感积极或消极程度的一个方向。 |
| Principal Direction | 主方向,通过主成分分析得到的最大方差方向,用于提取数据的主要变化模式。 |
| SST-2 | 斯坦福情感树库二分类数据集,常用于情感分析任务。 |
| AUC | ROC曲线下面积,衡量分类器性能的指标,值越高表示性能越好。 |
| Steering | 引导,指通过调整模型内部表示来控制生成输出的方向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅