超50%AI人设一开始就崩了!4000场对话揭穿价值模拟真相
The Failure Happens Before the Drift: The Social Dynamics of Values in LLM Agent Societies
arXiv AI (cs.AI) 重要 #Agent#社会模拟#价值观对齐 🕐 09-09 12:00

📖 AI 总结

该研究探讨了基于大语言模型(LLM)的智能体能否忠实模拟人类多元且冲突的价值观体系。研究者构建了以世界价值观调查(WVS)为基础的模拟框架,让具有不同文化背景和沟通风格的智能体参与纵向、价值观相关的讨论,共涉及约4000场对话、1200个人设、15个话题及三种模型。结果显示,超过50%的人设从一开始就无法表达其被分配的WVS价值观档案,另有2-7%在重复对话后发生价值观漂移。去除人口统计细节虽能提升部分模型的忠实度,但无法改变整体趋势——模拟的价值观分布仍系统性偏离设定。与人类讨论相比,模拟对话在风格一致性与语义多样性之间呈现不同权衡,常表现为内容多样但风格重复。研究认为,当前LLM智能体虽能生成看似合理的对话,但在表征和长期维持多样化人类价值观方面仍是有限的代理工具。

🔑 关键词速览

LLM Agent Societies由大型语言模型驱动的智能体群体,模拟人类社会互动。
World Values Survey (WVS)全球性调查项目,用于测量不同文化中人们的价值观和信念。
Value Faithfulness智能体表达的价值与其被指定画像的一致性程度。
Value Drift在对话过程中智能体价值表达随时间发生的偏离或变化。
Ablation通过移除模型或数据中的某些部分来测试其影响的实验方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅