该文章探讨了在“智能体时代”人机协作系统的评估设计问题。核心挑战在于:当人类与AI智能体协作时,需要判断该协作模式是否优于纯人类或纯AI单独执行任务,但实际部署后无法同时观察到所有对照结果,只能通过成本高昂的“重放”来获取缺失数据。作者提出TEAM-Design规则,为每项任务分配两种重放概率(分别对应人类单独和AI单独基线),优先在结果难以预测、比较难度大且重放成本低的场景中提高采样概率。研究证明该规则能优化预算分配,并控制错误判断风险。通过6个临床场景和1个编码基准的再分析,以及基于真实胸部X光研究的半合成实验,作者发现TEAM-Design在两种比较难度差异显著时表现最佳,而在难度相近时可能不如传统的方差分配方法。
| TEAM-Design | 一种决策导向的评估规则,为每个任务分配两个重放概率以优化部署决策。 |
| human-AI workflow | 人类与AI协作的工作流程,在部署中需与仅人类或仅AI方案比较。 |
| replay budget | 用于重放任务以获取缺失基线结果的有限资源(如专家时间或计算)。 |
| baseline | 替代方案,如仅人类或仅智能体执行任务的结果,用于比较评估。 |
| variance-based sampling | 一种基于结果方差选择采样任务的现有方法,但未直接针对部署决策。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅