GHARP 是一种从少量输入图像和驱动表情信号出发、实时生成三维人头动画的方法。其核心思路是将问题解耦为两个阶段:离线身份阶段构建受试者的几何与外观表示,运行时动画阶段则在此基础上预测与表情相关的残差。由于动画阶段仅需运行轻量网络,该方法在保真度、质量与运行速度之间取得了良好平衡,适合移动端部署。具体而言,动画在预训练重建模型的语义结构化潜空间中进行,使表情变化保持空间局部性,从而提升残差预测效率;该重建先验还提供一致的空间布局,支持将多视角输入融合为紧凑的固定尺寸规范高斯表示。针对表情编码无法描述身体姿态与衣物位置、导致动画网络映射不适定并产生模糊与闪烁的问题,作者引入身体对齐网络,将目标图像中的人物身体与输入参考图像对齐,从而消除训练信号中的歧义。在 Ava-256 基准上,该方法取得当前最优质量,同时在 A100 GPU 上运行速度最高提升 13 倍,高斯数量减少 8 倍。
| GHARP | 本文提出的实时高斯头部动画方法,基于大规模重建先验,将身份构建与动画预测解耦。 |
| Gaussian Splatting | 一种基于高斯点云的三维场景表示与渲染技术,本文用其构建紧凑的规范高斯表示。 |
| Reconstruction Prior | 预训练重建模型提供的先验知识,为动画提供一致的空间布局和语义结构化潜在空间。 |
| Expression Residual | 在身份表示基础上,由动画网络预测的与表情相关的空间残差,用于驱动面部动态变化。 |
| Body Alignment Network | 本文提出的网络,用于将目标图像中的身体与参考图像对齐,消除身体姿态和衣物位置的不确定性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅