本文研究从原始非结构化图像数据中无监督学习物体及其属性解耦表示的问题。现有基于槽位的方法在物体表示学习上表现良好,而块槽位注意力方法进一步假设物体表示可均匀分解为属性,但这种假设可能并非最优,限制了表示质量。为此,作者提出LinSlot框架,联合发现物体与属性表示。其核心贡献在于利用线性表示假设(LRH),即组合性概念可在槽位表示中表示为线性可加子空间。基于此,作者构建了连接图像、槽位(物体)与块(属性)的概率模型,并提出一种架构,利用块注意力将属性表示与槽位关联,同时在物体和属性表示空间中引入LRH,从而有效优化所提图模型的证据下界(ELBO)。实验表明,该方法能有效发现解耦的物体与属性表示,为槽位空间中的LRH提供了实证支持,并因表示的解耦性和可解释性而具备图像编辑能力。在多个数据集上,其DCI评分优于现有最先进方法。
| Slot-based object representation | 基于槽的物体表示:将图像中的物体编码为独立的向量槽,每个槽对应一个物体,实现无监督的物体发现与表示学习。 |
| Linear Representation Hypothesis (LRH) | 线性表示假设:认为可组合的概念在表示空间中表现为线性可加的子空间,即概念可以通过向量的线性组合来表示。 |
| Block-slot attention | 块-槽注意力:一种注意力机制,将物体表示分解为多个块(属性),并通过注意力连接槽与块,用于属性表示学习。 |
| Evidence Lower Bound (ELBO) | 证据下界:变分推断中用于优化概率模型的目标函数,是数据对数似然的下界,常用于训练生成模型。 |
| DCI score | DCI分数:解缠表示学习的评估指标,衡量表示的解缠性、完整性和信息性,分数越高表示解缠质量越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅