大模型也会装好装坏!7款顶尖LLM在招聘和法医场景下系统性扭曲暗黑人格得分
Faking Good and Faking Bad in LLMs: Response Distortion Across Dark Triad Personality Traits
arXiv CL (cs.CL) 重要 安全对齐大模型论文方法 🕐 09-17 12:00

📖 AI 总结

本研究探讨大语言模型在人格评估中是否存在类似人类的“装好”与“装坏”反应扭曲现象,聚焦于暗黑三角特质(马基雅维利主义、自恋与精神病态)。研究者评估了七种先进模型,在求职筛选与司法评估两种情境下,通过语境框架传递社会赞许或反赞许的激励,并采用标准心理测量计分与自评基线进行聚合及条目层面的比较。结果显示,模型普遍表现出系统且一致的反应调节:多数模型在“装好”条件下降低暗黑三角得分,在“装坏”条件下提高得分,但效应幅度因特质和模型而异,其中马基雅维利主义与自恋的转变最强且最一致,精神病态则差异较大;求职情境的效应通常大于司法情境,且显式“装坏”指令比单纯语境框架引发更强扭曲。该研究提示人格相关输出需结合动机与情境解读,并凸显心理测量范式在评估模型反应扭曲、印象管理及情境依赖行为方面的价值,对基准测试、对齐评估与鲁棒性研究具有重要意义。

🔑 关键词速览

Dark Triad暗黑三联征,指马基雅维利主义、自恋和精神病态三种负面人格特质的组合。
Fake-good假装好,指个体在评估中故意表现出社会赞许的特质以留下好印象。
Fake-bad假装坏,指个体在评估中故意表现出社会不赞许的特质以留下坏印象。
Response distortion反应扭曲,指个体在心理测量中因动机或情境因素而系统性地改变其反应。
Impression management印象管理,指个体试图控制他人对自己形成印象的过程。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅