BioEVAL 是一项由全球22个研究团队共同构建的多机构基准测试,旨在评估大语言模型和多模态模型在生物工程领域的实验推理能力。该基准覆盖11个生物工程子领域,包含608道博士级评估题目,分为380道选择题、218项文献综合任务和10个多模态实验图像解读问题。所有题目经过撰写团队专家评审和集中质量控制,评估后还对高、低准确率选择题进行了盲审,剔除或修订了21道问题,最终选择题结果基于保留的359道题目计算。研究团队测试了ChatGPT、Gemini、Grok等云端基础模型及可本地部署的模型。该工作的意义在于突破了以往基准偏重事实记忆的局限,将评估重点转向前沿推理与多模态任务,为生物工程领域AI能力的标准化衡量提供了更贴近真实科研场景的工具。
| BioEVAL | 一个全球多机构合作的生物工程基准,用于评估大型语言模型和多模态模型的实验推理能力。 |
| LLM | 大型语言模型,指具有海量参数、能进行通用推理和文本生成的人工智能模型。 |
| MCQ | 多项选择题,一种常见的评估形式,要求从多个选项中选择正确答案。 |
| 多模态模型 | 能够同时处理和理解多种类型数据(如文本、图像)的人工智能模型。 |
| 文献综合 | 对多篇科学文献进行整合、分析和总结,以回答特定研究问题的任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅