该论文提出了一种超越传统准确率指标的视觉-语言模型(VLM)记忆评估框架ECCBench。作者指出,现有基准仅通过长文本或视频上的准确率来测试记忆,忽略了实际长时程任务中更关键的属性。为此,他们引入三个评估维度:效率(回答记忆问题所需的计算量)、压缩性(可压缩输入是否被更准确高效地记忆)和校准性(系统是否根据自身不确定性进行弃权)。研究发现,预训练VLM在文本上能有效压缩记忆,但在视频上表现不佳,且两类输入的校准性都较差。此外,在多种记忆骨干架构中,若干非Transformer架构在压缩-校准权衡上优于RoPE Transformer,提示这些架构可能更适合作为长时程智能体的记忆组件。该工作为VLM记忆评估提供了更全面的方法论。
| ECCBench | 一个用于评估视觉语言模型记忆能力的基准测试和评估协议,关注效率、压缩和校准三个维度。 |
| ECC | 效率(Efficiency)、压缩(Compression)和校准(Calibration)的缩写,用于全面衡量记忆性能。 |
| FLOPs | 浮点运算次数,用于衡量计算量或计算效率的指标。 |
| RoPE Transformer | 一种使用旋转位置编码的Transformer架构,常用于语言模型,但在压缩-校准权衡上表现不佳。 |
| 校准(Calibration) | 模型对其预测不确定性的估计准确性,即模型是否在不确定时正确弃权。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅