零样本呼吸诊断破纪录:61.3% AUC,数据仅需43%!
Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment
arXiv CL (cs.CL) 重要 多模态医疗 🕐 09-02 12:00

📖 AI 总结

该研究提出了一种零样本呼吸音分类框架,通过将自监督呼吸音编码器与医学语义对齐,解决传统模型缺乏临床语义基础、难以进行零样本推理的问题。针对配对数据稀缺,研究利用医学大语言模型合成结构化报告,为对比学习提供密集语义锚点,并采用sigmoid对比损失结合编码器原生自监督目标及相似性感知负采样,增强病理边界区分能力。在6个数据集的9项任务中,该方法平均零样本AUC达61.3%,优于CLAP(51.4%)和Qwen2-Audio(54.9%),线性探测AUC最高达71.6%,且仅使用全规模基线43%的数据。结果表明,结构化语义对齐在临床诊断中优于大规模通用模型,为医疗音频分析提供了高效、可泛化的新路径。

🔑 关键词速览

Zero-Shot Inference零样本推理,指模型在未见过的类别或任务上直接进行预测,无需额外训练数据。
Self-Supervised Respiratory Encoders自监督呼吸编码器,通过自监督学习从呼吸声音中提取特征,但缺乏临床语义标注。
Contrastive Learning对比学习,一种通过拉近正样本对、推远负样本对来学习表征的机器学习方法。
LLM-Augmented大语言模型增强,指利用大语言模型生成或补充数据以提升模型性能。
Linear Probing AUC线性探测AUC,通过训练线性分类器评估特征质量,AUC为曲线下面积,衡量分类性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅