该研究提出FailSAE框架,利用稀疏自编码器(SAE)实现视觉语言模型(如CLIP)的可解释失败预测。传统方法依赖置信度或辅助分类器,虽能预测失败但缺乏可解释性。FailSAE将失败预测转化为对SAE稀疏潜在激活的分类任务,并设计三阶段失败感知训练流程,使潜在方向在保持可解释性的同时增强预测信息。实验表明,该框架在失败预测上优于基线方法,且失败感知训练促使SAE潜在方向捕获更多类别特定概念。通过概念级分析,研究揭示了模型失败时表征从类别特定概念转向模糊或风格相关概念的规律。此外,学习到的潜在方向还可支持运行时失败恢复,为高风险场景下VLM的安全部署提供了兼具准确性与可解释性的解决方案。
| Vision-language models (VLMs) | 视觉语言模型,通过联合学习视觉和文本表示来处理多模态任务的模型,如CLIP。 |
| Sparse Autoencoders (SAEs) | 稀疏自编码器,一种通过稀疏约束学习高维数据潜在表示的神经网络结构,用于提取可解释特征。 |
| Failure prediction | 失败预测,指预测模型在特定输入上可能出错或性能下降的任务。 |
| Interpretability | 可解释性,指模型决策过程能被人类理解的程度,本研究中指通过SAE潜在方向提供概念级解释。 |
| Latent activations | 潜在激活,指神经网络中间层(如SAE)产生的特征向量,用于表示输入数据的抽象特征。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅