🔥 今日值得一读 外视角转第一人称视频,新框架性能全面碾压SOTA!
Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation
arXiv CV (cs.CV) 🔥 重点 #视频生成#扩散模型#AR/VR 🕐 08-24 12:00
👨‍💼 主理人解读 · 为什么值得关注
从外部视角生成第一人称视频,适用于AR/VR和物理AI应用。

📖 AI 总结

本文提出Grounded-Exo2Ego框架,用于解决从单一外心视频生成第一人称(自我中心)视频的难题。该任务因极端视角变化和大面积不可观测区域,使传统几何条件化方法失效。框架采用双分支视频扩散模型:几何锚定分支基于3D重建渲染进行条件生成,语义接地分支则利用物体级上下文提升困难区域生成质量。研究还发现相机重建错位是影响性能的关键问题,为此提出相机重定位算法,显著改善所有指标。此外,作者构建了全自动合成数据引擎,生成带骨骼绑定的3D角色及程序化环境。在EgoExo4D数据集上的评估显示,该方法在所有指标上大幅超越现有最先进技术,消融实验验证了各贡献的有效性。

🔑 关键词速览

Grounded-Exo2Ego本文提出的框架,通过语义接地增强外部视角到第一人称视角视频生成。
Exocentric-to-Egocentric video generation从外部视角视频生成第一人称视角视频的任务,用于AR/VR等应用。
Video diffusion model基于扩散过程的视频生成模型,通过逐步去噪生成视频帧。
Semantic grounding branch利用对象级语义信息指导生成的分支,处理几何信息不可靠的区域。
Camera re-localization重新估计相机位置以解决重建错位问题,提升生成质量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅