该研究关注临床大语言模型智能体在重复运行下的可靠性问题。作者指出,现有基准通常只对每个任务评分一次,很少检验相同输入是否产生相同操作,因此可能掩盖智能体行为的不一致。为此,他们提出“同输入重跑”方法,固定全部输入并比较生成的医嘱而非分数,并设计六项可靠性指标,在MedAgentBench的50个任务、1000次运行上测试两个低于百亿参数、四位量化的开源模型及两种温度设置。结果显示,在8B模型温度0.7时,43个排序组在五次相同运行中均产生不同医嘱集合,其中22组虽行为实质不同,基准却给出相同的失败判定;4B模型在0.7时全部10个分歧组也如此。研究还发现医嘱在不同运行中到达不同终点,有的被记录服务器拒绝却告知智能体成功。该工作表明动作层面的分歧真实存在且可能不被评分记录,呼吁临床智能体基准引入重复运行评估、动作级稳定性报告与忠实的环境反馈。
| MedAgentBench | 一个用于评估临床智能体在医疗任务中表现的标准基准测试平台。 |
| same-input rerun | 一种评估方法,在保持所有输入不变的情况下重复运行任务,以比较智能体产生的动作是否一致。 |
| action-level divergence | 指智能体在相同输入下,不同运行之间产生实质性不同的动作(如医嘱、检查等)的现象。 |
| reliability metrics | 用于量化智能体在重复运行中动作一致性和稳定性的六项指标。 |
| execution-faithful environment feedback | 指环境反馈应真实反映动作执行结果,避免智能体收到与实际情况不符的成功或失败信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅