这篇论文关注医学基准评测中评分标准本身的质量问题。随着医学评估从静态选择题转向开放式临床场景,基于评分细则的自动化评估成为主流,但细则若存在缺陷,评测结果的可靠性便存疑。作者将全球性评分细则失效分类框架RIFT应用于HealthBench Professional和LiveMedBench两个临床基准,发现失效模式普遍且影响显著:在HealthBench Professional上,LLM评判器将29.6%的评分标准标记为非原子性,65.4%标记为错位或僵化。研究进一步证明这些缺陷并非表面问题——将“至少满足以下之一/全部满足”这类捆绑式标准拆分为等权子项后重新评分,受影响对话的分数最多变动15.9个百分点,其中析取式捆绑会抬高分数,合取式捆绑则压低分数。此外,RIFT对临床细则中捆绑结构的漏检较为严重,仅标记LiveMedBench中3.3%的标准为非原子性,而表面形式分析发现25.8%存在此类结构。该研究提示,当前医学基准的评分方式可能系统性失真,亟需更严谨的细则设计与检测方法。
| RIFT | 一种全局评分标准失效分类体系,用于识别和分类评分标准中的缺陷模式。 |
| HealthBench Professional | 一个用于评估医学专业能力的临床基准数据集。 |
| LiveMedBench | 一个用于评估医学场景下模型表现的临床基准数据集。 |
| 非原子性标准 | 指一个评分标准中捆绑了多个独立要求,而非单一可独立评判的原子条件。 |
| 捆绑标准 | 将多个评判条件组合在一个标准中,如“以下至少一项”或“以下全部”,可能导致评分偏差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅