LLM智能体复现心理学实验:命名后从众率从0%飙至83.3%!
Recognition, Simulation, and Refusal: A Contamination-Aware Study of Classic Psychological Effects in LLM Agents
arXiv CL (cs.CL) 重要 Agent评测基准论文方法 🕐 今天 12:00

📖 AI 总结

这篇论文提出 PsyAgentBench 基准,通过在 LLM 智能体上重跑经典心理学实验,区分模型“表现出”人类心理效应与“真正具有”相应偏差。研究采用因子设计,将任务分为显式命名与盲测、教科书原版与降低训练数据重叠的反事实变体,并叠加人格操纵,在五个范式、最多三个开源模型家族上完成 41,904 次试验。结果显示,表面类人的效应来源各异:Asch 从众受范式标签门控(盲测 0% 至命名 83.3%),锚定依赖知识信号,框架效应在标注下放大,沉没成本稳定缺失,最小群体分配则因安全机制触发拒绝。单句人格修改即可消除、削弱或逆转这些效应,说明不存在单一响应偏差解释。作者还形式化并记录三种移植失败模式:人格主导、群体坍缩和安全选择,主张以复制档案取代标量偏差分数。

🔑 关键词速览

PsyAgentBench一个用于在LLM智能体上重新运行经典心理学实验的基准测试,旨在区分模型是否真正拥有心理偏差。
Asch conformity阿希从众实验,经典社会心理学范式,测试个体在群体压力下是否顺从错误多数意见。
anchoring锚定效应,指个体在做判断时过度依赖最先接触到的信息(锚点)的心理现象。
persona manipulation人格操纵,通过提示词改变LLM智能体所扮演的人格特质或角色设定。
sunk cost沉没成本效应,指人们因已投入资源而继续投入,即使继续投入已不理性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅