该研究针对大语言模型智能体在长时程真实部署中暴露的执行失败问题,以临床环境模拟器为测试平台,让智能体在持续时间和资源压力下管理整个急诊科轮班。研究发现,现有智能体虽多数能给出正确诊断,却无法完整、及时地执行关键处置,存在明显的执行鸿沟,并将其归因于指令遵循漂移、治疗不完整和及时性上的严重程度公平性差距三种失败模式。为此,作者提出Asclepius自适应智能体框架,通过可自我演化的执行手册、外部化临床技能库和三个隔离子智能体协同工作。在未参与演化的留出批次上,关键处置正确率提升22%,完整十批次上关键处置提升25%、及时性提升13%,且诊断准确率保持不变。结果表明三种失败模式构成耦合瓶颈,只有三个组件协同作用才能带来显著改善。
| Clinical Environment Simulator (CES) | 一个模拟急诊科轮班的测试平台,智能体需在连续时间和资源压力下管理整个班次。 |
| Long-Horizon Execution Failures | 智能体在长时间、多步骤任务执行中出现的失败,如指令漂移、治疗不完整和及时性差距。 |
| Adaptive Agent Scaffolding | 一种自适应智能体框架,能根据反馈动态调整其操作手册和组件以提升长时程任务表现。 |
| Self-Evolving Harness | 一种自演化挽具,能在轮班之间根据轨迹级反馈自动重写智能体的操作手册。 |
| Severity-Equity Gap | 在及时性方面,不同严重程度患者之间存在的公平性差距,即治疗延迟的不均衡。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅