该研究针对通用医疗基准难以按专科细分评估大语言模型(LLM)表现的问题,提出了心理健康领域的专门子集HealthBench-Psych及其更严格版本HealthBench-Psych-Hard。研究团队从OpenAI HealthBench的5000个医生评分对话中,通过透明LLM筛选规则和两轮盲审临床医生验证,最终确定610个心理健康相关对话,占原语料12.2%。对20个前沿及开源模型使用三个不同LLM评委评估后发现:前沿模型表现统计上无显著差异,两个模型出现可测量的拒答行为,且不同评委给出的排名高度一致。该研究提供了可复用的子集、评估流程、模型响应及分析代码,为心理健康领域LLM性能评估提供了标准化工具,有助于开发者更精准地追踪和提升模型在该关键领域的表现。
| HealthBench | OpenAI发布的通用健康基准,包含5,000个由医生评分的对话,用于评估LLM的医疗性能。 |
| HealthBench-Psych | 从HealthBench中筛选出的心理健康相关对话子集,包含610个对话,用于专门评估LLM在心理健康领域的表现。 |
| LLM (Large Language Model) | 大语言模型,如GPT系列,能够处理自然语言任务,在医疗领域被广泛测试。 |
| Blinded clinician review | 盲法临床医生审查,一种评估方法,审查者不知道对话是否来自已知排除对照,以减少偏见。 |
| Cross-vendor panel | 跨供应商评审小组,由来自不同模型供应商的多个LLM评审员组成,用于评估模型性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅