多智能体沉默团队训练突破:不安全完成率直降33.59个百分点!
Learning to Report Unsafe Tasks in a Multi-Agent Game
arXiv AI (cs.AI) 重要 Agent安全对齐论文方法 🕐 今天 12:00

📖 AI 总结

这篇论文研究多智能体在共享奖励机制下如何学会举报不安全任务。由于举报会中止任务、减少团队奖励,智能体天然倾向于沉默。作者构建了一个博弈模型,其中每项任务有k个见证者共享策略并独立行动,发现在全体沉默时,期望奖励对沉默概率的导数会将任务收益计算k次,而全体举报时仅计算一次,这一不对称导致沉默成为学习的默认结果。研究给出了使精确策略梯度更新收敛到全体举报的审计条件,并证明在平衡策略族中,实现完全策略共享所需的最低审计成本恰好是每角色独立策略的k倍。基于24个见证者图的PPO训练实验显示,将共同见证者分离可使不安全任务完成率降低33.59个百分点;在相同审计预算下,完全共享网络在独立动作采样时无一满足安全与合法完成率双阈值,而采用共同采样时全部48次运行均达标。该工作揭示了策略共享结构对安全举报行为学习的关键影响,为多智能体安全机制设计提供了理论依据与实证支持。

🔑 关键词速览

多智能体博弈多个智能体在共享奖励环境下交互决策的博弈框架,本文用于研究报告不安全任务的学习问题。
策略梯度一种强化学习方法,通过计算期望奖励关于策略参数的梯度来直接优化策略。
PPO近端策略优化(Proximal Policy Optimization),一种常用的强化学习算法,通过限制策略更新幅度来稳定训练。
审计条件本文提出的一个充分必要条件,用于确保策略梯度更新能够收敛到普遍报告不安全任务。
目击者图表示任务中哪些智能体作为目击者可以报告不安全行为的图结构,用于实验中的策略训练。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅