本研究评估了开源视觉语言模型在奥运跳水动作质量评估中的零样本能力,基于AQA-7基准数据集展开实验。作者提出一种基于回归的框架,将模型生成的语义推理文本与分阶段子分数相结合,通过TF-IDF向量化、降维和集成学习预测最终比赛得分。结果显示,单独使用视觉语言模型的斯皮尔曼相关系数低于0.32,而所提集成回归框架在四模型配置下将相关系数提升至0.67。值得注意的是,文本推理特征的表现始终优于原始数值子分数,说明模型生成的解释性描述对动作质量分析具有更高价值。该研究的意义在于,视觉语言模型有望成为可解释、半自动化体育表现评估的辅助工具,为专家主观评分提供补充参考。
| 动作质量评估 (AQA) | 自动评估人体动作执行质量的任务,常用于体育评分。 |
| 视觉语言模型 (VLM) | 能同时处理图像/视频和文本的多模态模型,具备跨模态推理能力。 |
| 零样本学习 | 模型在未见过特定任务训练数据的情况下直接进行推理和预测。 |
| Spearman相关性 | 衡量两个变量排序一致性的非参数统计指标,常用于评估预测分数与真实分数的相关性。 |
| TF-IDF向量化 | 一种将文本转换为数值向量的方法,基于词频和逆文档频率加权。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅