🔥 今日值得一读 最差类别覆盖率暴跌至0!零样本VLM在分布偏移下尾部安全崩了,边际覆盖0.86也救不了!
Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?
arXiv CV (cs.CV) 🔥 重点 #安全对齐#零样本VLM#分布偏移 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
审计零样本视觉语言模型在分布偏移下的边际覆盖保证,揭示类条件安全性失效问题,指导可靠拒识层设计。

📖 AI 总结

该研究系统审计了分裂共形预测作为零样本视觉-语言模型(如CLIP、OpenCLIP和SigLIP)弃权层在部署偏移下的安全性。结果显示,边缘覆盖率虽保持较高,但类别条件尾部覆盖率严重崩溃:在ImageNet-Sketch上,最差类别覆盖率降至接近0,10-12%的类别低于有限样本零假设下限,尽管边缘覆盖率约为0.86。这种失败与目标域类别准确率相关,但无法由源域诊断指标预测。源端Mondrian校准虽改善分布内尾部表现却无法迁移,聚类共形和Conf-OT方法仅提升边缘或平均指标,无法恢复最差类别尾部。目标端类别校准能显著提升尾部表现,但需每类标签且集合规模开销大。研究还发现跨家族效率差距达2-3倍,SigLIP的sigmoid分数破坏了APS的概率质量解释。结论认为,边缘共形覆盖率应视为平均可靠性统计量,而非类别尾部的安全保障。

🔑 关键词速览

Split-conformal prediction分裂保形预测,一种通过数据分割构建预测集并提供统计覆盖保证的方法。
Marginal coverage边际覆盖,指预测集覆盖真实标签的平均概率,不区分具体类别。
Class-conditional tail coverage类别条件尾部覆盖,指最差类别或尾部类别的覆盖概率,反映极端情况下的可靠性。
Mondrian calibrationMondrian校准,一种按类别分别进行校准的方法,旨在改善类别条件覆盖。
Zero-shot VLMs零样本视觉-语言模型,如CLIP,能够对未见过的类别进行分类,无需微调。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅