该研究提出一种无需训练、无需监督数据的提示条件式方法,用于发现大语言模型隐藏激活中的风格维度。具体做法是对单一提示进行高温重复采样,对池化后的隐藏激活施加主成分分析,并依据两极生成结果自动为各轴打标签。研究通过两阶段实验,以245条人工标注的风格维度进行验证。在表现最佳的Qwen-3.5-4B-Instruct上,前两个轴与人类自发提出的风格维度匹配的精确率为72.8%,宏召回率为43.6%;75.6%的有效性评分认为各轴两极生成与标签相符,标注者间相邻一致率达90.9%。可发现性高度依赖模型:两个Qwen模型和Llama-3.2-3B均能暴露人类可感知的风格轴,而DeepSeek-7B-Chat精确率降至35.3%,其主成分由结构性而非风格性方差主导。这表明对模型自身解码方差做简单PCA即可低成本探测其表征中的风格结构,同时揭示不同模型在风格组织方式上的显著差异。
| 主成分分析 (PCA) | 一种降维统计方法,通过线性变换将数据投影到方差最大的几个正交方向上,用于发现数据中的主要变化模式。 |
| 提示条件 (Prompt-Conditional) | 指分析方法或模型行为依赖于给定的输入提示,针对每个提示单独发现其相关的风格维度。 |
| 隐藏激活 (Hidden Activations) | 神经网络内部层(如Transformer的中间层)产生的向量表示,编码了输入文本的语义和风格信息。 |
| 风格轴 (Stylistic Axes) | 在激活空间中代表不同风格维度(如正式-随意、积极-消极)的方向向量,沿这些轴移动可改变生成文本的风格。 |
| 宏召回率 (Macro-Recall) | 一种评估指标,先计算每个类别的召回率再取平均,能平等对待每个类别,避免多数类主导。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅