该研究针对说话人脸深度伪造检测中基于rPPG方法在不同生成器上表现不均衡的问题,提出并比较了两种轻量级纯视觉线索:由RhythmFormer提取的rPPG衍生波形与唇部区域离散余弦变换(DCT)系数。在Celeb-DF++的七种说话人脸生成方法上采用主体独立协议进行评测,结果显示:域内测试中唇部DCT在除SadTalker外的所有方法上达到或超过rPPG一维ResNet,拼接融合的AUC达0.891,高于两种单模态基线的0.824和0.827。在留一生成器评估中,两种线索呈现互补性,各自对三种留出方法迁移效果更好,而IP-LAP对两者均接近随机水平;拼接融合平均AUC为0.798,但在DCT迁移较差时低于单独使用rPPG,表明静态融合仅部分利用了这种互补性。此外,唇部DCT在七种方法中的六种上优于全脸DCT。作者将rPPG衍生信号视为经验性线索,未声称其源于心脏活动。
| rPPG | 远程光电容积描记术,一种通过分析视频中皮肤颜色微小变化来提取生理信号的技术。 |
| RhythmFormer | 一种用于从视频中提取rPPG波形的深度学习模型。 |
| DCT | 离散余弦变换,一种将信号从空间域转换到频率域的数学变换,常用于图像压缩和特征提取。 |
| Celeb-DF++ | 一个用于深度伪造检测的大规模基准数据集,包含多种生成方法制作的说话人脸视频。 |
| AUC | 接收者操作特征曲线下的面积,用于衡量二分类模型的性能,值越高表示性能越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅