本文提出CARE(校准自适应修正与升级)框架,旨在解决人机协同决策中安全性与效率的平衡问题。传统方法将AI弃权后的人工介入视为一次性兜底,既无法利用反馈持续提升AI自动化水平,又会因模型更新而破坏原有安全校准。CARE通过端到端流水线整合AI模型与人工审核者,在保证决策安全且符合人类偏好的前提下,持续从选择性查询的人工反馈中学习,逐步减少人工查询量。其核心创新是自适应校准模块,可为任意修正模块在每一时间步提供风险控制保证,且适用于任何黑盒AI模型。在驾驶、语言和机器人三个领域的四个安全关键数据集上,CARE在实现人类对齐决策的同时,将人工查询量较基线减少25%至81%,表明该方法在提升自动化效率方面具有显著效果。
| CARE | 校准自适应修正与升级,一种结合AI模型和人工审核员以保证安全决策并持续学习的端到端流水线。 |
| human-AI collaborative decision making | 人机协同决策,指人类和AI系统共同参与决策过程,以提高决策质量和安全性。 |
| adaptive calibration | 自适应校准,一种动态调整模型输出或风险阈值的方法,以确保在每个时间步满足安全约束。 |
| safety guardrails | 安全护栏,指为AI系统设定的安全约束或机制,防止其产生不安全或有害的决策。 |
| query efficiency | 查询效率,衡量在达到相同决策质量时所需人工查询次数的指标,查询次数越少效率越高。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅