该研究针对多模态大语言模型在人类动作反馈生成中存在的建议笼统、可解释性差和物理上不合理幻觉等问题,提出BoT-Feedback框架,将模型推理建立在结构化生物力学证据之上。其核心是四阶段“生物力学思维链”,依次完成动作识别、关键身体区域定位、专家与学生动作的定量生物力学差异分析以及可解释反馈合成,并配套开发了即插即用的生物力学数据解析器和专家—学生动作时序对齐策略。作者还构建了包含师生配对视频、三维骨架、生物力学属性和专家标注的BiomAF基准。在十二个开源与闭源模型上的实验表明,该方法显著提升反馈质量、可解释性与鲁棒性,专家评分从2.07升至2.95,提升约40%,使小型开源模型接近大型专有系统的水平。
| BoT-Feedback | 本文提出的框架,将多模态大语言模型的推理建立在结构化生物力学证据之上,用于生成可解释的人体动作反馈。 |
| Biomechanics of Thought (BoT) | 一种四阶段推理框架,依次完成动作识别、关键身体区域定位、专家与学员的定量生物力学差异分析以及可解释指导反馈的综合生成。 |
| Biomechanical Data Parser (BDP) | 一个即插即用的解析器,可将视频转换为结构化的生物力学描述符,为推理过程提供数据支持。 |
| BiomAF | 本文提出的基准数据集,包含配对的师生视频、3D 骨架、生物力学属性以及专家指导标注。 |
| Multimodal Large Language Models (MLLMs) | 能够同时处理视觉和文本等多种模态信息的大语言模型,本文将其应用于人体动作反馈生成任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅