该研究针对可解释人工智能(XAI)解释质量评估长期依赖主观人工判断、难以复现和规模化比较的问题,提出XAI-Arena框架,探索以大语言模型作为评判者进行可复现、可扩展的多维度评估。该框架从感知简洁性、清晰度、任务适配性、信任校准、可操作性、透明度、忠实性及整体可解释性等维度对XAI解释进行比较,并在多种数据集、机器学习模型和利益相关者画像下对主流XAI方法进行基准测试。人类验证结果显示,LLM评分与人类评分呈显著正相关(Spearman's rho=0.693,p<0.001)。这表明基于LLM的评估能够捕捉XAI解释质量的系统性差异,为XAI解释的对比评估提供了一种可扩展且可复现的新路径。
| XAI (Explainable AI) | 可解释人工智能,指使机器学习模型的决策过程对人类可理解的方法与技术。 |
| LLM-as-a-judge | 以大型语言模型作为评判者,利用LLM对文本或输出质量进行自动评分与比较的评估范式。 |
| XAI-Arena | 本文提出的基于LLM评判的评估框架,用于多维度、可重复地比较XAI解释的质量。 |
| Faithfulness | 忠实性,指解释是否真实反映模型内部决策依据的程度,是XAI解释质量的核心维度之一。 |
| Trust Calibration | 信任校准,指用户对AI系统的信任程度与其实际可靠性相匹配的状态。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅