课堂观察AI新基准:80.1%准确率,2分钟密集标注24种行为!
VISTA: Dense Multi-Label Classroom Coding with Vision-Language Models
arXiv CV (cs.CV) 重要 #评测基准#视觉语言模型#教育应用 🕐 09-07 12:00

📖 AI 总结

该论文提出将课堂观察协议COPUS重新构建为视频多模态基准,以解决视频语言基准缺乏可靠性统计的问题。COPUS包含24个代码的多标签观察体系,每2分钟生成一个24维二元向量,覆盖50-90分钟的讲座,并拥有经过同行评审的可靠性文献支持。作者构建了由5人评估小组产生的共识矩阵作为参考标注,并提出VISTA基线方法——通过MiniCPM-V-4.5在密集滑动窗口上运行,利用轻量级MLP头微调输出,再经最大池化映射至2分钟网格。在三场化学讲座的测试中,VISTA达到80.1%的受限宏准确率,优于零样本变体的74.9%,主要误差集中在视觉相似的教师行为代码和依赖音频的稀有代码上。研究还识别了三种系统性失败模式,并公开了基准工具与代码。

🔑 关键词速览

COPUS本科STEM课堂观察协议,一种用于系统观察和编码大学STEM课堂中师生行为的工具,包含24个代码。
VISTA本文提出的基线方法,结合视觉语言模型和轻量级MLP头进行密集多标签视频分类。
MiniCPM-V-4.5一种视觉语言模型,用于处理视频帧并生成初步的标签预测。
多标签分类一种分类任务,每个样本可以同时被分配多个标签,而非仅一个。
限制宏平均准确率一种评估指标,计算每个类别的准确率后取平均,但限制在特定条件下,用于衡量模型在各类别上的整体表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅