本文研究在受限信号传递场景中,当知情对手与受众共享同一信道时,何种信号最能保护真相。作者将对抗者引入一个源自桌游《香港谋杀之谜》的强制选择任务:对手知晓目标答案、可观察信号,并以说服预算β为最强错误答案辩护。研究发现,随着β增大,最优信号从后验最大化选项转向边际最大化选项;当β=0时,模型退化为原始预言机模型。在108个验证项目上,对抗鲁棒最优解与既有研究中的显著性极点完全重合;在20万项目池中,两者仅在2748个项目上不同,且这些项目恰好位于显著性—贝叶斯坐标未定义处。18.2%的项目在有限预算下最优解发生偏移。作者进一步指出,由于鲁棒目标与显著性启发式目标在结构上重合,现有测量无法判断语言模型的选项变化究竟源于对抗意识还是显著性偏好,这是结构性局限而非零结果,并建议在评估对抗意识前先检验两类目标是否重合。
| 对抗鲁棒最优解 | 在存在知情对手的情况下,能够最好地保护真相的信号选择。 |
| 显著性极点 | 指信号在显著性维度上的极端位置,即最突出、最易被注意到的信号。 |
| 说服预算 β | 对手用于为错误答案辩护的资源或强度参数,影响最优信号的选择。 |
| 后验最大化选项 | 贝叶斯框架下,使后验概率最大化的信号选项。 |
| 边际最大化选项 | 使信号与错误答案之间的边际距离最大化的选项,以提高鲁棒性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅