唇部DCT检测说话人脸伪造,六成方法碾压rPPG,融合AUC冲上0.891!
Complementary rPPG-Derived and Lip-Region Frequency Cues for Talking-Face Deepfake Detection
arXiv CV (cs.CV) 重要 #深伪检测#rPPG#多模态融合 🕐 今天 12:00

📖 AI 总结

该研究针对说话人脸深度伪造检测中基于rPPG方法在不同生成器上表现不均衡的问题,提出并比较了两种轻量级纯视觉线索:由RhythmFormer提取的rPPG衍生波形与唇部区域离散余弦变换(DCT)系数。在Celeb-DF++的七种说话人脸生成方法上采用主体独立协议进行评测,结果显示:域内测试中唇部DCT在除SadTalker外的所有方法上达到或超过rPPG一维ResNet,拼接融合的AUC达0.891,高于两种单模态基线的0.824和0.827。在留一生成器评估中,两种线索呈现互补性,各自对三种留出方法迁移效果更好,而IP-LAP对两者均接近随机水平;拼接融合平均AUC为0.798,但在DCT迁移较差时低于单独使用rPPG,表明静态融合仅部分利用了这种互补性。此外,唇部DCT在七种方法中的六种上优于全脸DCT。作者将rPPG衍生信号视为经验性线索,未声称其源于心脏活动。

🔑 关键词速览

rPPG远程光电容积描记术,一种通过分析视频中皮肤颜色微小变化来提取生理信号的技术。
RhythmFormer一种用于从视频中提取rPPG波形的深度学习模型。
DCT离散余弦变换,一种将信号从空间域转换到频率域的数学变换,常用于图像压缩和特征提取。
Celeb-DF++一个用于深度伪造检测的大规模基准数据集,包含多种生成方法制作的说话人脸视频。
AUC接收者操作特征曲线下的面积,用于衡量二分类模型的性能,值越高表示性能越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅