本文提出 EEGAgentBench,一个用于系统评估大语言模型(LLM)智能体在短时程与长时程脑电(EEG)分析中表现的统一基准。针对现有 EEG 智能体评测任务零散、时间跨度有限、协议不一致且缺乏对推理、工具使用与工作流构建能力综合考察的问题,该基准覆盖从知识问答到睡眠分期等六类代表性 EEG 应用,信号时长从 2 秒延伸至近 23 小时,预测目标涵盖类别标签、事件区间与逐帧序列,支持知识推理、短时程解读、长时程事件检测和序列理解的统一评估。基准还提供 10 个确定性 EEG 分析工具,仅暴露任务相关的信号测量,要求智能体自主选工具、迭代积累证据并构建多步工作流。作者对来自 15 个模型家族的 29 个前沿 LLM 进行评测,结果显示该基准能有效区分超越模型规模与推理成本的能力差异,同时揭示当前 LLM 智能体在长时程 EEG 分析中的显著局限,尤其是在持续证据积累与多步推理方面。
| EEGAgentBench | 本文提出的统一基准,用于系统评估 LLM 智能体在短时程与长时程脑电图分析中的能力。 |
| LLM Agents | 以大语言模型为核心、能自主调用工具并执行多步推理以完成任务的智能体系统。 |
| Long-Horizon EEG Analysis | 针对长时间跨度脑电信号(可达数小时)的解读任务,需要迭代积累证据和多步推理。 |
| Sleep Staging | 睡眠分期,将整夜脑电信号按时间划分为不同睡眠阶段(如 NREM、REM)的序列标注任务。 |
| Epoch-level Sequences | 以固定时间窗(epoch)为单位输出的序列预测结果,常用于睡眠分期等连续脑电分析任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅