该论文提出了一种基于范畴论框架的 compositional generalization 分析方法,不再依赖传统模型准确率评估,而是从数据结构角度探究哪些结构或词汇识别使 COGS 基准中的未见示例可从训练集结构推导。作者将句子表示为从句法地址到词汇标记的函子,通过选择性坍缩诱导 Kan 扩张,传播观察到的关联。在 21 种 COGS 泛化类型中,可接受性呈现不同识别特征,残余失败则区分出不受支持的结构模板。该研究无需训练预测模型,即可诊断训练语料在特定识别条件下所许可的泛化模式,为理解组合泛化机制提供了数据侧的新视角,有助于揭示模型泛化能力的结构基础。
| Compositional Generalization | 组合泛化,指模型能够理解训练中未见过的词语组合的能力。 |
| COGS | 一个用于评估语义解析中组合泛化的基准数据集。 |
| Functor | 范畴论中的概念,这里指从句法地址到词汇标记的映射,用于表示句子结构。 |
| Kan Extension | 范畴论中的一种构造,用于在函子间传播信息,这里用于从训练观察中推断未见组合的语义。 |
| Admissibility | 可接受性,指在给定识别条件下,某个示例是否被训练语料库所支持。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅