该研究探讨了基于大语言模型(LLM)的智能体能否忠实模拟人类多元且冲突的价值观体系。研究者构建了以世界价值观调查(WVS)为基础的模拟框架,让具有不同文化背景和沟通风格的智能体参与纵向、价值观相关的讨论,共涉及约4000场对话、1200个人设、15个话题及三种模型。结果显示,超过50%的人设从一开始就无法表达其被分配的WVS价值观档案,另有2-7%在重复对话后发生价值观漂移。去除人口统计细节虽能提升部分模型的忠实度,但无法改变整体趋势——模拟的价值观分布仍系统性偏离设定。与人类讨论相比,模拟对话在风格一致性与语义多样性之间呈现不同权衡,常表现为内容多样但风格重复。研究认为,当前LLM智能体虽能生成看似合理的对话,但在表征和长期维持多样化人类价值观方面仍是有限的代理工具。
| LLM Agent Societies | 由大型语言模型驱动的智能体群体,模拟人类社会互动。 |
| World Values Survey (WVS) | 全球性调查项目,用于测量不同文化中人们的价值观和信念。 |
| Value Faithfulness | 智能体表达的价值与其被指定画像的一致性程度。 |
| Value Drift | 在对话过程中智能体价值表达随时间发生的偏离或变化。 |
| Ablation | 通过移除模型或数据中的某些部分来测试其影响的实验方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅