这篇立场论文探讨了大语言模型在开放式战略推演中的应用风险。作者指出,此类推演本质上是高风险的社会模拟,涉及对手建模、机构行为、冲突升级与危机响应等要素。语言模型虽能扮演智能体、生成情景分支并裁决模糊行动,但正因如此,模型生成的语言既决定了行为体的意图,也塑造了被模拟的现实,从而带来隐患。论文提出五项失效模式:决策洗白、裁决不透明、角色崩塌、经由裁决的升级以及战略想象力的缺失。作者的核心主张是:任何由语言模型驱动的推演,在缺乏可审计安全论证的情况下,都不应影响规划、条令、政策或危机响应;当前开放式推演的正当用途是作为压力测试工具,用以暴露决策影响型智能体的缺陷,而非充当重大应用的安全凭证。常规基准测试无法为此类场景确立安全性。
| 开放式战略兵棋推演 | 一种基于语言模型的高风险社会模拟,用于模拟对手、制度、升级和危机响应等战略互动。 |
| 语言模型(LM) | 一种人工智能模型,能够生成自然语言文本,在此语境中用于扮演智能体、生成情景和裁决行动。 |
| 可审计安全论证 | 一种可被独立审查和验证的安全保证文档,用于证明系统在特定用途下的安全性。 |
| 决策洗白 | 一种失败模式,指语言模型生成的输出被不当用于为决策提供合法性,而缺乏真正的安全验证。 |
| 通过裁决升级 | 一种失败模式,指语言模型在裁决模糊行动时无意中导致冲突升级。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅