该论文针对智能体AI在高风险场景中仅依赖概率推理难以安全部署的问题,提出BRaVeS有界推理与安全治理框架。作者指出,随着推理加深,系统行为可能偏离领域专家设定的安全约束,即“认知漂移”。为此,BRaVeS将专家约束编码为不变锚点,提出深度感知访问机制以保持锚点可见,并通过状态层级在认知风险上升时降低自主性。论文还引入Lyapunov有界共识框架,将连续风险信号映射为有限抽象并施加屏蔽状态转移,强制能量下降或转入人工介入的终止状态。基于工业控制系统数据的蒙特卡洛仿真显示,该过程实现有限步收敛且无安全违规。研究为有界治理行为提供了仿真证据,但形式化结论仅适用于有限抽象,未来需在真实部署、人在回路验证及对抗场景中进一步检验。
| Epistemic Drift | 认知漂移,指AI系统在推理过程中逐渐偏离主题专家设定的安全约束的现象。 |
| BRaVeS | 有界推理与安全治理框架,全称为Bounded Reasoning and Safety-Governance Framework,用于在高风险自动化中保持安全约束。 |
| MoDA-Style (Mixture of Depths Attention) | 混合深度注意力,一种深度感知的注意力机制,旨在推理过程中保持关键约束锚点的可见性。 |
| Lyapunov-Bounded Consensus Framework (LBCF) | 李雅普诺夫有界共识框架,将连续认知风险信号映射为有限抽象,并通过屏蔽状态转换确保系统收敛或安全终止。 |
| SMARtAutonomy | 一种状态层级机制,根据认知风险的增加动态降低系统的自主性水平。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅