生成4D视线图像,困难场景误差直降3.05°到2.80°!
GazeDiT: Gaze-Accurate Diffusion Image Generation for Eye Tracking via Spatial Conditioning
arXiv CV (cs.CV) 重要 多模态论文方法 🕐 09-17 12:00

📖 AI 总结

GazeDiT 是一项针对眼动追踪数据合成难题提出的扩散模型方法。研究指出,现有扩散模型在生成训练数据时,若条件信号维度低且粗糙,难以实现精确的标签控制——文本条件图像只追求语义一致,而监督训练要求图像与数值标签严格对应。眼动追踪中的4D双眼注视方向恰恰依赖瞳孔与虹膜的细微空间几何,属于典型的低维精确控制问题。为此,GazeDiT 在内部构建空间条件,将全局注视标签锚定到局部几何结构上:训练阶段用冻结的 SegFormer 从真实图像提取瞳孔与虹膜几何,使模型学习以该几何为条件的真实外观;推理阶段则通过物理眼睛渲染器采样与注视一致的几何,无需源图像即可生成多样化样本。实验表明,GazeDiT 的尾部注视标签误差显著低于其他扩散基线,接近同一冻结注视估计器在真实图像上的误差水平;其生成数据还能提升下游眼动追踪器性能,在最小队列的困难样本上将注视误差从3.05°降至2.80°。该工作为需要精确数值标签的合成数据生成提供了新思路。

🔑 关键词速览

GazeDiT一种基于扩散模型的图像生成方法,通过空间条件实现精确的4D注视标签控制,用于生成眼动追踪训练数据。
4D binocular gaze四维双眼注视,通常指左右眼各自的水平和垂直注视方向,共四个维度。
SegFormer一种基于Transformer的语义分割模型,此处用于从真实图像中提取瞳孔和虹膜的空间几何结构。
spatial conditioning空间条件,指将低维标签(如注视方向)映射为空间局部几何特征(如瞳孔/虹膜形状),以指导图像生成。
tail gaze-label error尾部注视标签误差,指在误差分布尾部(即困难或极端样本)上的注视标签预测误差,反映模型在最差情况下的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅