🔥 今日值得一读 多假设Transformer用熵最大化破解3D网格恢复歧义,准确率多样性双SOTA!
MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery
arXiv CV (cs.CV) 🔥 重点 #3D重建#多假设学习#Transformer#姿态估计 🕐 09-11 12:00
👨‍💼 主理人解读 · 为什么值得关注
为遮挡下的手部/人体3D网格恢复生成多个候选解并择优,可提升AR/VR姿态估计鲁棒性。

📖 AI 总结

本文提出MHE-Former,一种基于Transformer的多假设框架,用于单目三维手部和身体网格恢复。针对严重遮挡与歧义导致的预测过度自信问题,作者引入“探索—利用”范式:在探索阶段,基于概率建模与熵最大化生成多样且合理的候选假设,兼顾训练效率与标签友好性;在利用阶段,提出上下文感知的假设选择过程,借助视觉语言模型的视觉理解与推理能力,结合额外证据和自然语言意图,帮助用户挑选最符合需求的估计结果。实验表明,该框架在多个数据集上的准确性与多样性均达到当前最优水平,用户偏好研究也验证了假设选择流程的实用性。

🔑 关键词速览

MHE-Former一种基于Transformer的多假设网格恢复框架,通过熵最大化生成多样且合理的假设。
熵最大化一种鼓励模型输出多样化假设的正则化技术,用于避免过度自信的单一预测。
多假设学习同时生成多个可能的解而非单一最优解的学习范式,以处理歧义性。
假设选择一个上下文感知的过程,利用视觉语言模型(VLM)从多个假设中选出最合理的估计。
VLM视觉语言模型,具有强大的视觉理解和推理能力,用于辅助假设选择。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅