🔥 今日值得一读 6140万问答、30项任务!PhysioBench统一基准评估21个模型,竟无一持续强劲
PhysioBench: A Unified Benchmark for Physiological Signal Question Answering
arXiv CL (cs.CL) 🔥 重点 #评测基准#生理信号#问答系统 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
为生理信号模型提供统一问答评测标准,开发者可据此检验模型跨模态指令跟随能力。

📖 AI 总结

PhysioBench 是一个面向生理信号问答任务的统一基准,旨在解决现有生理信号基础模型需针对每项任务单独适配、缺乏跨模态指令跟随能力评估的问题。该基准将 22 个公开数据集的标注统一整合为 6140 万个问题,覆盖 30 类任务,每个问答对均锚定于具体信号片段并可追溯至原始标注。研究者评估了 21 个代表性模型,涵盖大语言模型、视觉语言模型、时间序列语言模型及生理信号基础模型,并在三种互补设置下测试。结果显示,没有任何模型能在所有生理信号模态和任务上保持稳定优异表现;引入自然语言虽可支持跨任务统一预测,但性能对问题表述方式较为敏感。该工作为生理信号理解提供了可扩展的细粒度分析平台。

🔑 关键词速览

PhysioBench一个统一的生理信号问答基准,整合22个公开数据集为30个任务上的6140万个问答对。
生理信号基础模型在大规模生理信号数据上预训练、可迁移至多种下游任务的模型,通常需针对具体任务微调。
时间序列语言模型将时间序列数据与自然语言对齐或联合建模的模型,用于跨模态预测与问答。
视觉-语言模型同时处理视觉输入(如图像或信号图)与文本的模型,可依据语言指令完成多模态任务。
统一预测使用自然语言指令作为通用接口,使单一模型无需任务特定适配即可处理多种预测目标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅