这篇论文审视了程序性视频评估协议本身的有效性,而非仅关注预测模型的表现。作者以程序性动作预判为案例,指出一种更隐蔽的评估失效模式:协议即便满足时间因果性、也不存在经典的目标泄漏,仍可能通过提供特权中间表示而虚高成绩。在Breakfast数据集上,匹配的识别器历史与真实历史两种设定得分分别为30.3%和62.3%,差距达32个百分点;多项干预实验进一步分离出14.6至26.8个百分点不等的测试时oracle效应。作者将这一差异定义为“特权信息差距”,并提出一套可复用的四条件审计方法。研究意义在于揭示基准分数所宣称的能力与实际测量的构念之间存在错位,提醒评估者警惕这种不易察觉的效度问题。
| 程序性动作预期 | 在程序性视频(如烹饪)中,根据已观察到的步骤预测下一步动作的任务。 |
| 特权信息差距 | 评估协议中因提供非预言机恢复流程无法获得的中间表示而导致的性能高估差距。 |
| 目标泄漏 | 训练数据中意外包含了预测目标的信息,导致模型评估过于乐观。 |
| 四条件审计 | 一种可复用的评估协议审计方法,通过四个条件检查是否存在特权信息差距。 |
| Breakfast数据集 | 一个常用的程序性动作视频数据集,包含多种早餐制作活动。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅