🔥 今日值得一读 评估协议暗藏特权信息,准确率虚高32个百分点!
Are We Measuring Anticipation? Auditing Privileged Information in Procedural Video Evaluation
arXiv CV (cs.CV) 🔥 重点 #评测基准#视频理解#动作预测#评测有效性 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
提醒你评测基准可能偷偷喂了未来信息,做视频预测模型评估时需检查协议是否真的因果。

📖 AI 总结

这篇论文审视了程序性视频评估协议本身的有效性,而非仅关注预测模型的表现。作者以程序性动作预判为案例,指出一种更隐蔽的评估失效模式:协议即便满足时间因果性、也不存在经典的目标泄漏,仍可能通过提供特权中间表示而虚高成绩。在Breakfast数据集上,匹配的识别器历史与真实历史两种设定得分分别为30.3%和62.3%,差距达32个百分点;多项干预实验进一步分离出14.6至26.8个百分点不等的测试时oracle效应。作者将这一差异定义为“特权信息差距”,并提出一套可复用的四条件审计方法。研究意义在于揭示基准分数所宣称的能力与实际测量的构念之间存在错位,提醒评估者警惕这种不易察觉的效度问题。

🔑 关键词速览

程序性动作预期在程序性视频(如烹饪)中,根据已观察到的步骤预测下一步动作的任务。
特权信息差距评估协议中因提供非预言机恢复流程无法获得的中间表示而导致的性能高估差距。
目标泄漏训练数据中意外包含了预测目标的信息,导致模型评估过于乐观。
四条件审计一种可复用的评估协议审计方法,通过四个条件检查是否存在特权信息差距。
Breakfast数据集一个常用的程序性动作视频数据集,包含多种早餐制作活动。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅