本文提出“智能体事件登记库”(AIR),一个带来源链接的目录,收录了特定时间段内披露的智能体相关事件记录,每条记录包含支撑证据、稳定标识符,以及针对因果角色、披露类别、机制和结果的缺失感知标签。在智能体实际参与行动的生成式系统记录中,相当比例涉及已实现的危害,且这类结果集中于真实环境事件和安全失败记录,而负责任披露与研究演示则绝大多数停留在演示阶段,因此总体比例反映的是收录构成而非部署风险。经过初步整理后,由第二位人工审核者对全部记录及其标签进行了完整性与正确性核查。在部署类比审计中,InjecAgent 的案例仅覆盖 AIR 十二个表面中的三个,且全部为攻击者触发,而 AIR 还包含无对抗者的安全失败案例。AIR 旨在支持基于来源的案例检索与评估范围审计,而非用于估计失败率或控制有效性。
| Agent Incident Registry (AIR) | 一个与来源关联的智能体事件目录,用于记录和分类AI智能体相关的公开故障事件。 |
| InjecAgent | 一个针对AI智能体注入攻击的评估基准,包含攻击者触发的案例。 |
| missingness-aware labels | 一种标签标注方式,明确考虑并记录数据缺失情况,以提高标签的可靠性。 |
| deployment-analogue audit | 一种模拟部署场景的审计方法,用于比较评估基准与真实事件记录的覆盖范围。 |
| realized harm | 指智能体行为已实际造成伤害的结果,区别于仅处于演示或研究阶段的事件。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅