医学微调竟输给通用模型!LLM专业术语理解反降,机制揭秘校准错误
Domain-Specific Jargon in Large Language Models: A Comparative Analysis between General-Purpose and Specialist Models
arXiv CL (cs.CL) 重要 #评测基准#领域适应#医学NLP#微调 🕐 09-15 12:00

📖 AI 总结

该研究比较了通用大模型与医学领域微调模型在专业术语理解上的表现,并构建了两个医学行话评测基准。令人意外的是,通用Llama-3.1模型在两项任务上均优于医学微调版本。通过机制可解释性分析,研究者发现微调模型存在系统性校准偏差:它并未真正重组参数知识,而是过度依赖少数与行话偏好预测相关的模型组件。对相关组件进行重新加权后,可有效抑制这些偏差并缩小与通用基线的差距。研究还发现,部分对行话敏感的组件能迁移至材料科学术语任务,暗示其编码了部分领域无关的专业术语概念。该工作表明,领域微调并不必然提升专业术语理解能力,对领域适配的效果不应想当然。

🔑 关键词速览

大型语言模型(LLMs)基于海量文本训练的深度学习模型,能够生成自然语言并完成多种任务。
参数化知识模型在训练过程中学习并存储在参数中的事实和概念信息。
机制可解释性研究神经网络内部计算机制和组件功能的方法,旨在理解模型决策过程。
领域适应将通用模型调整到特定领域(如医学)的过程,通常通过微调实现。
组件重加权一种通过调整模型内部组件(如神经元或层)的权重来改变模型行为的技术。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅