本文提出SPICE框架,用于解决神经网络可解释性中的多义性难题,即单个神经元被多个不相关概念激活、导致功能理解困难。现有方法多依赖特定架构和人工设定的概念聚类数K,通用性与可扩展性不足,难以适用于现代Transformer模型。SPICE通过基于聚类的解释方法,摆脱架构相关的传播规则,可自动确定每个神经元的概念聚类数量,无需预设K,从而首次实现对CNN与Transformer多义性的系统比较。作者利用该框架全面考察了多义性如何产生、随深度与架构如何变化,以及通过哪些计算路径形成。该工作发表于ECCV 2026,为跨架构、可扩展的神经元多义性分析提供了通用工具。
| 多义性 (Polysemanticity) | 指单个神经元对多个不相关概念产生响应的现象,是神经网络可解释性研究中的核心挑战。 |
| SPICE | 一种基于聚类的通用框架,用于自动解释深度视觉模型中的多义特征,无需预设概念簇数量。 |
| 概念簇 (Concept Clusters) | 将神经元激活模式聚类得到的语义分组,每个簇代表一个潜在概念,其数量K通常需人工设定。 |
| Transformer | 一种基于自注意力机制的神经网络架构,广泛用于现代视觉和语言模型,其多义性分析更具挑战。 |
| 可解释性 (Interpretability) | 理解神经网络内部工作机制的能力,旨在揭示神经元和层级的语义功能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅