大都会博物馆1500件藏品审计:CLIP模型性别偏见无统计学显著差异!
Disentangling Algorithmic Bias from Archival Artifacts: A Controlled Audit of Vision-Language Model Valuation in Metropolitan Museum Archives
arXiv LG (cs.LG) 重要 #视觉语言模型#算法偏见#审计#CLIP 🕐 09-17 12:00

📖 AI 总结

本研究针对视觉语言模型(VLM)的社会偏见审计问题,提出需区分算法本身的估值差异与档案元数据中固有的混杂因素。作者以纽约大都会艺术博物馆开放获取藏品为数据来源(共1500件,其中具名作品743件:男性534件、女性209件,匿名618件),构建量化审计框架,采用零样本CLIP对数差分分数,围绕“杰作”“质量”“影响力”三组语义提示对进行评估。未调整的评估显示,OpenAI CLIP与OpenCLIP均未呈现统计显著的性别主效应,等价性检验(TOST)亦确认在Cohen's d≥0.25范围内统计等价。多变量OLS回归在控制媒介、创作年代与宽高比后(R²<0.02),进一步表明艺术家性别无显著条件效应。但高残差嵌入方差说明全局零样本估值指标接近嵌入噪声下限,属粗糙测量工具,不能据此断言模型绝对公平。作者强调两点局限:宏观分数等价源于指标对细粒度视觉语义特征不敏感,不排除局部微观偏见;排除41.2%未署名藏品则反映机构存续偏差。研究结论指出,评估文化遗产领域AI公平性时,多变量混杂控制、等价性检验与档案来源审计缺一不可。

🔑 关键词速览

Vision-Language Models (VLMs)视觉语言模型,能够同时处理图像和文本的多模态人工智能模型。
CLIP (Contrastive Language-Image Pretraining)对比语言-图像预训练模型,通过对比学习将图像和文本映射到共享嵌入空间。
Zero-shot logit differential零样本 logit 差异,指模型在未针对特定任务微调时,对不同提示词输出的原始分数差异。
Two One-Sided Tests (TOST)双单侧检验,一种用于检验统计等价性的方法,常用于证明两组结果无显著差异。
Archival provenance auditing档案来源审计,指对档案记录的历史来源和归属信息进行审查,以识别潜在偏差。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅