该研究提出利用两种去噪扩散概率模型(DDPMs)无条件生成眼动追踪数据,以解决真实数据采集成本高、受限于隐私等问题。两种模型均采用相同的FiLM条件一维U-Net架构(1935万参数),分别生成原始二维注视位置序列和双分量速度序列,并在28名参与者的视觉搜索数据上进行训练与评估。结果显示,位置空间模型在九项运动学特征上的平均JS散度为0.016,注视时长与真实数据误差在2%以内,且Fréchet注视距离显著优于统计和马尔可夫基线;在合成训练-真实测试协议下,R²达到0.66。速度空间模型在速度相关特征上表现更优(平均JS散度0.0065),但路径长度重建精度较低。总体而言,无条件扩散模型能有效捕捉局部注视运动学及短时结构,但长程特征仍需依赖条件生成模型进一步改进。
| DDPMs | 去噪扩散概率模型,一种生成模型,通过逐步去噪从噪声中恢复数据。 |
| FiLM-conditioned U-Net | 一种使用特征级线性调制(FiLM)条件化的U-Net架构,用于生成任务中引入条件信息。 |
| Jensen-Shannon divergence | 衡量两个概率分布相似度的对称性度量,值越小表示分布越接近。 |
| Fr'echet Gaze Distance | 一种评估生成眼动轨迹与真实轨迹分布差异的指标,基于Fr'echet距离。 |
| Train-on-Synthetic-Test-on-Real | 一种评估协议,模型仅在合成数据上训练,然后在真实数据上测试,以检验泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅