这项研究探讨了大型语言模型作为合成受访者时,何种信息能更有效地预测个体后续选择。作者基于845名美国成年人的两波面板数据,涵盖14种行为偏差,设置了从无个人信息到人口统计、人格特质、认知分数,再到受访者早期选择(行为历史)的五种递进条件。结果显示,在总体层面各条件均能接近人类平均偏差数,但掩盖了方差差异:仅靠描述性人格画像只能恢复53%至67%的人际差异,加入行为历史后则接近人类水平。在个体层面,描述性画像仅达到人类重测信息量的7%至12%,加入行为历史后提升至28%,且在全部17个 demographic 群体中信息量最高。研究还发现合成回答在教育与收入相关差异上比人类更强。核心结论是:对LLM合成人格而言,受访者过去的回答比对其本人的描述更能提升个体层面的预测力。
| LLM Synthetic Personas | 利用大型语言模型生成的模拟人物,用于代表真实调查受访者进行预测或实验。 |
| Behavioral History | 受访者过去在调查或实验中的选择记录,作为预测其未来决策的行为数据。 |
| Test-Retest Benchmark | 同一组受试者在不同时间点重复相同测试,用以衡量个体反应一致性的基准。 |
| Informedness | 衡量预测模型或合成人物在个体层面提供有效信息量的指标,值越高表示预测越准确。 |
| Behavioral Biases | 个体在决策中表现出的系统性偏差,如风险偏好、时间偏好、过度自信和推理偏差等。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅