该论文提出将课堂观察协议COPUS重新构建为视频多模态基准,以解决视频语言基准缺乏可靠性统计的问题。COPUS包含24个代码的多标签观察体系,每2分钟生成一个24维二元向量,覆盖50-90分钟的讲座,并拥有经过同行评审的可靠性文献支持。作者构建了由5人评估小组产生的共识矩阵作为参考标注,并提出VISTA基线方法——通过MiniCPM-V-4.5在密集滑动窗口上运行,利用轻量级MLP头微调输出,再经最大池化映射至2分钟网格。在三场化学讲座的测试中,VISTA达到80.1%的受限宏准确率,优于零样本变体的74.9%,主要误差集中在视觉相似的教师行为代码和依赖音频的稀有代码上。研究还识别了三种系统性失败模式,并公开了基准工具与代码。
| COPUS | 本科STEM课堂观察协议,一种用于系统观察和编码大学STEM课堂中师生行为的工具,包含24个代码。 |
| VISTA | 本文提出的基线方法,结合视觉语言模型和轻量级MLP头进行密集多标签视频分类。 |
| MiniCPM-V-4.5 | 一种视觉语言模型,用于处理视频帧并生成初步的标签预测。 |
| 多标签分类 | 一种分类任务,每个样本可以同时被分配多个标签,而非仅一个。 |
| 限制宏平均准确率 | 一种评估指标,计算每个类别的准确率后取平均,但限制在特定条件下,用于衡量模型在各类别上的整体表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅