该研究提出了一种基于三维注视模式的放射科医生专业水平预测方法,用于胸部CT影像解读。研究采用DINOv2骨干网络,将放射科医生的注视模式整合进体积特征学习中,具体通过两种机制实现:自注意力中的可学习对数空间偏置和基于注视权重的补丁嵌入池化。研究基于182次CT阅读会话数据,涵盖五位不同经验水平的放射科医生。在独立测试集上,该模型取得了0.91的ROC-AUC和0.86的F1分数,优于现有适配方法。该研究的意义在于,将视觉搜索行为融入Transformer架构,为放射学中客观的、基于过程的专业能力评估提供了新思路,突破了传统仅依赖结果判断的局限。
| DINOv2 | 一种自监督视觉Transformer模型,用于提取图像特征,此处作为骨干网络处理CT图像补丁。 |
| Gaze-informed transformer | 一种结合眼动注视信息的Transformer架构,通过注意力偏置和池化方式将视觉搜索行为融入特征学习。 |
| ROC-AUC | 受试者工作特征曲线下面积,衡量分类模型区分正负样本的能力,值越高性能越好。 |
| F1 score | 精确率和召回率的调和平均数,综合评估分类模型的性能。 |
| Eye-tracking | 眼动追踪技术,记录观察者的注视点、注视时间等视觉行为,用于分析认知过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅