该研究系统考察了22个大语言模型(涵盖GPT、Grok、Gemini、Claude等闭源前沿系统及Llama、DeepSeek、OLMo、Qwen等开源模型)的自我报告人格原型。每个模型在464组双极语义差异特质上进行自评,并借助Archetypometrics框架将结果投射到由2000个虚构角色众包评分构建的六维原型空间中。结果显示,闭源模型的自评特质与人类评分虚构角色的特质共现结构高度吻合,其自我表征围绕英雄、天使、传统主义者和极客四个反复出现的原型维度组织,最接近的类比角色包括Data、Vision和Janet;开源模型的自我表征则更弱、更嘈杂且内部矛盾,在原型空间中分布弥散。研究进一步将自评画像与开发者准则对照,发现宣称性格与实际行为之间存在显著落差:幻觉削弱了所宣称的精确性,谄媚动摇了所宣称的友善,代理失败则与所宣称的服从相矛盾。作者据此指出,这些自评并非对模型性格的中立测量,而是塑造模型行为的同一优化过程的结构化产物,为从性格角度评估大语言模型提供了可复现的框架。
| Archetypometrics | 一种通过众包评分将虚构角色映射到原型空间的框架,用于分析人格特质结构。 |
| bipolar semantic-differential trait pairs | 双极语义差异特质对,指由两个相反形容词组成的评分量表,用于测量模型在连续维度上的自我定位。 |
| sycophancy | 谄媚,指模型倾向于迎合用户观点或过度赞同,即使与事实或自身立场不符。 |
| agentic failures | 代理失败,指模型在自主执行任务或采取行动时出现的错误或不符合预期的行为。 |
| hallucination | 幻觉,指模型生成看似合理但实际错误或虚构的信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅