这篇论文研究多智能体在共享奖励机制下如何学会举报不安全任务。由于举报会中止任务、减少团队奖励,智能体天然倾向于沉默。作者构建了一个博弈模型,其中每项任务有k个见证者共享策略并独立行动,发现在全体沉默时,期望奖励对沉默概率的导数会将任务收益计算k次,而全体举报时仅计算一次,这一不对称导致沉默成为学习的默认结果。研究给出了使精确策略梯度更新收敛到全体举报的审计条件,并证明在平衡策略族中,实现完全策略共享所需的最低审计成本恰好是每角色独立策略的k倍。基于24个见证者图的PPO训练实验显示,将共同见证者分离可使不安全任务完成率降低33.59个百分点;在相同审计预算下,完全共享网络在独立动作采样时无一满足安全与合法完成率双阈值,而采用共同采样时全部48次运行均达标。该工作揭示了策略共享结构对安全举报行为学习的关键影响,为多智能体安全机制设计提供了理论依据与实证支持。
| 多智能体博弈 | 多个智能体在共享奖励环境下交互决策的博弈框架,本文用于研究报告不安全任务的学习问题。 |
| 策略梯度 | 一种强化学习方法,通过计算期望奖励关于策略参数的梯度来直接优化策略。 |
| PPO | 近端策略优化(Proximal Policy Optimization),一种常用的强化学习算法,通过限制策略更新幅度来稳定训练。 |
| 审计条件 | 本文提出的一个充分必要条件,用于确保策略梯度更新能够收敛到普遍报告不安全任务。 |
| 目击者图 | 表示任务中哪些智能体作为目击者可以报告不安全行为的图结构,用于实验中的策略训练。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅