该研究提出了一种零样本呼吸音分类框架,通过将自监督呼吸音编码器与医学语义对齐,解决传统模型缺乏临床语义基础、难以进行零样本推理的问题。针对配对数据稀缺,研究利用医学大语言模型合成结构化报告,为对比学习提供密集语义锚点,并采用sigmoid对比损失结合编码器原生自监督目标及相似性感知负采样,增强病理边界区分能力。在6个数据集的9项任务中,该方法平均零样本AUC达61.3%,优于CLAP(51.4%)和Qwen2-Audio(54.9%),线性探测AUC最高达71.6%,且仅使用全规模基线43%的数据。结果表明,结构化语义对齐在临床诊断中优于大规模通用模型,为医疗音频分析提供了高效、可泛化的新路径。
| Zero-Shot Inference | 零样本推理,指模型在未见过的类别或任务上直接进行预测,无需额外训练数据。 |
| Self-Supervised Respiratory Encoders | 自监督呼吸编码器,通过自监督学习从呼吸声音中提取特征,但缺乏临床语义标注。 |
| Contrastive Learning | 对比学习,一种通过拉近正样本对、推远负样本对来学习表征的机器学习方法。 |
| LLM-Augmented | 大语言模型增强,指利用大语言模型生成或补充数据以提升模型性能。 |
| Linear Probing AUC | 线性探测AUC,通过训练线性分类器评估特征质量,AUC为曲线下面积,衡量分类性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅