本文提出一种名为GPEC(高斯过程嵌入校正)的方法,用于提升多模态大语言模型在心脏超声视频描述生成中的表现。由于通用多模态模型在超声等专业医学影像领域性能往往下降,作者在视觉投影层与语言模型之间插入一个模块化的校正环节,通过学习残差修正,将投影后的视觉表示推向由结构化视频标注构建的目标表示。该目标通过将标注转化为定性属性、生成固定格式参考描述并映射到语言模型嵌入空间得到,校正过程采用带诱导点的稀疏变分高斯过程建模,并保持原模型组件不变。实验在相同输入与参考条件下对比原始VideoChat2与加入GPEC后的版本,结果显示描述相似度和内容对齐度均有提升,且每段视频推理开销增加不足0.05秒。这表明无需端到端微调即可低成本改善专业医学视频的描述生成质量。
| GPEC | 高斯过程嵌入校正,一种插入视觉投影层与语言模型之间的模块化预LLM纠错方法,用于改进医学视频字幕生成中的视觉表示。 |
| MLLMs | 多模态大语言模型,能够同时处理文本、图像、视频等多种模态数据并生成语言输出的大规模预训练模型。 |
| VideoChat2 | 一种用于视频理解与字幕生成的多模态大语言模型,本文以其作为基础模型并保持其参数冻结。 |
| 稀疏变分高斯过程 | 一种利用诱导点和变分推断来近似高斯过程后验的方法,可显著降低计算复杂度,适用于大规模数据建模。 |
| 超声心动图 | 利用超声波技术对心脏结构和功能进行成像的医学检查方法,属于专业医学影像领域。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅