本文提出MEA,一个奖励驱动的多智能体框架,旨在降低机器学习模型事后解释的使用门槛。MEA由两个智能体构成:Proposer根据问题类型和数据模态选择并配置解释工具,Actor则针对忠实度进行端到端优化,将工具输出转化为基于模型行为的自然语言解释,覆盖表格、文本和视觉三种模态。研究还设计了涵盖特征归因、反事实推理和虚假特征检测的多样化问题类型,并为每类问题配备基于扰动的忠实度指标。关键发现是,前沿大语言模型系统性地产生不忠实的解释;而通过以忠实度奖励并结合模态自适应惩罚进行优化,MEA在六个数据集上持续优于事后解释器、智能体方法及闭源基线,相较未训练的主干模型,忠实度在表格、文本和视觉模态上分别提升28%、21%和34%。该工作表明,AI智能体本身可作为可扩展、可适配的机器学习可解释性接口,推动自然语言解释超越传统固定单一用途工具的局限。
| MEA | 一种奖励驱动的多智能体系统,通过Proposer和Actor两个智能体协作,自动生成忠实的模型解释。 |
| 忠实性(Faithfulness) | 衡量解释是否真实反映模型实际决策过程的指标,是本文优化的核心目标。 |
| 事后解释方法(Post-hoc Explanation Methods) | 在模型训练完成后,用于解释其预测行为的各种技术,如LIME、SHAP等。 |
| 多智能体框架(Multi-Agent Framework) | 由多个智能体协同工作的系统,每个智能体负责特定任务,共同完成复杂目标。 |
| 基于扰动的忠实性度量(Perturbation-based Faithfulness Metric) | 通过扰动输入并观察模型输出变化来评估解释忠实性的一种量化方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅