牙科X光AI幻觉有救了!AgenTeeth让冻结VLM最高暴涨23个百分点
AgenTeeth: A Model-Agnostic Framework for Suppressing Hallucination in Frozen Vision-Language Models on Dental X-Rays via Tool Evidence Injection
arXiv CV (cs.CV) 重要 多模态Agent论文方法 🕐 09-17 12:00

📖 AI 总结

本文提出AgenTeeth,一个模型无关的工具增强框架,旨在抑制冻结视觉语言模型在牙科全景X光片上的幻觉问题。研究指出,现有VLM在牙齿定位与空间推理任务中往往依赖学到的解剖先验而非图像证据,即便经过微调的牙科专用模型也难以摆脱此类空间偏差。AgenTeeth通过七个专业牙科视觉专家模型,由问题感知编排器动态调用相关工具,将检测结果映射为FDI牙位编号或解剖区域,并以结构化发现和标注图像叠加的形式注入证据,最终由模型基于这些证据重新生成答案,全程无需微调底层VLM。在MMOral-OPG-Bench上,该框架使四个骨干VLM较基线提升12.9至23.0个百分点,最强配置在开放式VQA上达到65.66%,显著高于OralGPT-Plus的45.35%;在同等规模下,冻结的Qwen2.5-VL-7B-Instruct配合AgenTeeth达到48.11%,超过经监督微调和强化学习训练的OralGPT-Plus。研究同时开源了框架、七个专家模型及牙医标注的牙槽骨丢失检测数据集。

🔑 关键词速览

Vision-Language Models (VLMs)视觉语言模型,能同时处理图像和文本并生成文本回答的多模态模型。
Frozen VLMs冻结的视觉语言模型,指在推理时不更新其参数、不进行微调的预训练模型。
FDI tooth numbersFDI牙位编号,国际牙科联合会制定的牙齿编号系统,用两位数字表示牙齿位置。
Panoramic dental radiographs全景牙科X光片,一种展示上下颌全部牙齿及周围结构的曲面断层影像。
Alveolar bone-loss detection牙槽骨丢失检测,识别牙槽骨因牙周病等原因导致的骨质吸收或高度降低。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅