本文提出MHE-Former,一种基于Transformer的多假设框架,用于单目三维手部和身体网格恢复。针对严重遮挡与歧义导致的预测过度自信问题,作者引入“探索—利用”范式:在探索阶段,基于概率建模与熵最大化生成多样且合理的候选假设,兼顾训练效率与标签友好性;在利用阶段,提出上下文感知的假设选择过程,借助视觉语言模型的视觉理解与推理能力,结合额外证据和自然语言意图,帮助用户挑选最符合需求的估计结果。实验表明,该框架在多个数据集上的准确性与多样性均达到当前最优水平,用户偏好研究也验证了假设选择流程的实用性。
| MHE-Former | 一种基于Transformer的多假设网格恢复框架,通过熵最大化生成多样且合理的假设。 |
| 熵最大化 | 一种鼓励模型输出多样化假设的正则化技术,用于避免过度自信的单一预测。 |
| 多假设学习 | 同时生成多个可能的解而非单一最优解的学习范式,以处理歧义性。 |
| 假设选择 | 一个上下文感知的过程,利用视觉语言模型(VLM)从多个假设中选出最合理的估计。 |
| VLM | 视觉语言模型,具有强大的视觉理解和推理能力,用于辅助假设选择。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅