Fredrik A. Dahl 针对 Chen、Zhao 与 Cohan 关于大语言模型生成研究创意的分布评估工作提出了一项识别层面的质疑。原研究将已发表论文作为人类基线,与 LLM 一次性生成的提案进行对比,但 Dahl 指出,这一比较可能受到幸存者偏差的干扰:如果桥接型或综合型创意相对容易生成、却相对难以通过发表筛选而存活,那么以已发表论文构成的人类基线就会低估这类创意在未发表人类创意池中的真实比例。由此,原研究观察到的人类与 LLM 之间的差距,可能部分甚至主要源于这种偏差,而非模型与人类在创意生成能力上的真实差异。该评论篇幅仅两页,核心贡献在于提醒相关分布评估需谨慎选择人类基线,避免将发表筛选效应误读为生成能力差距。
| Survivorship Bias | 幸存者偏差,指因只关注成功留存下来的样本(如已发表论文)而忽略未留存样本,导致对总体分布的估计产生系统性偏差。 |
| Distributional Evaluation | 分布评估,指从整体分布角度而非单一指标来比较不同来源(如人类与LLM)生成内容的特征。 |
| Human Baseline | 人类基线,在对比研究中作为参照标准的人类表现或产出集合,此处特指已发表论文。 |
| LLM Baseline | 大语言模型基线,指用大语言模型生成的输出作为对比对象,此处指一次性生成的研究提案。 |
| One-shot Proposals | 一次性提案,指模型在单次生成中直接产出的研究想法,未经迭代修改或筛选。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅