本研究探讨大语言模型在人格评估中是否存在类似人类的“装好”与“装坏”反应扭曲现象,聚焦于暗黑三角特质(马基雅维利主义、自恋与精神病态)。研究者评估了七种先进模型,在求职筛选与司法评估两种情境下,通过语境框架传递社会赞许或反赞许的激励,并采用标准心理测量计分与自评基线进行聚合及条目层面的比较。结果显示,模型普遍表现出系统且一致的反应调节:多数模型在“装好”条件下降低暗黑三角得分,在“装坏”条件下提高得分,但效应幅度因特质和模型而异,其中马基雅维利主义与自恋的转变最强且最一致,精神病态则差异较大;求职情境的效应通常大于司法情境,且显式“装坏”指令比单纯语境框架引发更强扭曲。该研究提示人格相关输出需结合动机与情境解读,并凸显心理测量范式在评估模型反应扭曲、印象管理及情境依赖行为方面的价值,对基准测试、对齐评估与鲁棒性研究具有重要意义。
| Dark Triad | 暗黑三联征,指马基雅维利主义、自恋和精神病态三种负面人格特质的组合。 |
| Fake-good | 假装好,指个体在评估中故意表现出社会赞许的特质以留下好印象。 |
| Fake-bad | 假装坏,指个体在评估中故意表现出社会不赞许的特质以留下坏印象。 |
| Response distortion | 反应扭曲,指个体在心理测量中因动机或情境因素而系统性地改变其反应。 |
| Impression management | 印象管理,指个体试图控制他人对自己形成印象的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅