🔥 今日值得一读 同一病人同一输入,8B模型43组医嘱次次不同,基准却判相同失败!
Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs
arXiv CL (cs.CL) 🔥 重点 #Agent#评测基准#可靠性#医疗AI 🕐 09-15 12:00
👨‍💼 主理人解读 · 为什么值得关注
指出单次评测掩盖了智能体动作的不稳定性,开发者可用同输入重跑协议检验自己Agent输出的一致性。

📖 AI 总结

该研究关注临床大语言模型智能体在重复运行下的可靠性问题。作者指出,现有基准通常只对每个任务评分一次,很少检验相同输入是否产生相同操作,因此可能掩盖智能体行为的不一致。为此,他们提出“同输入重跑”方法,固定全部输入并比较生成的医嘱而非分数,并设计六项可靠性指标,在MedAgentBench的50个任务、1000次运行上测试两个低于百亿参数、四位量化的开源模型及两种温度设置。结果显示,在8B模型温度0.7时,43个排序组在五次相同运行中均产生不同医嘱集合,其中22组虽行为实质不同,基准却给出相同的失败判定;4B模型在0.7时全部10个分歧组也如此。研究还发现医嘱在不同运行中到达不同终点,有的被记录服务器拒绝却告知智能体成功。该工作表明动作层面的分歧真实存在且可能不被评分记录,呼吁临床智能体基准引入重复运行评估、动作级稳定性报告与忠实的环境反馈。

🔑 关键词速览

MedAgentBench一个用于评估临床智能体在医疗任务中表现的标准基准测试平台。
same-input rerun一种评估方法,在保持所有输入不变的情况下重复运行任务,以比较智能体产生的动作是否一致。
action-level divergence指智能体在相同输入下,不同运行之间产生实质性不同的动作(如医嘱、检查等)的现象。
reliability metrics用于量化智能体在重复运行中动作一致性和稳定性的六项指标。
execution-faithful environment feedback指环境反馈应真实反映动作执行结果,避免智能体收到与实际情况不符的成功或失败信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅