本文提出了一种名为“非对称注意力头”(AAH)的框架,用于优化Transformer中多头注意力的上下文分配。传统多头注意力为所有头分配相同的完整因果上下文范围,但不同头实际承担的角色各异:有的依赖邻近词汇或句法信息,有的则需要捕捉长距离的实体交互或语篇关联。AAH将上下文长度视为可分配变量,依据特征统计对头进行分组,并构建层次化结构,为各组分配不同的因果局部窗口,同时保持标准多头注意力的输出接口不变。在4096 token的实验中,多种AAH局部分配变体取得了比纯全注意力更低的验证损失。消融实验表明,稳定的局部分配和头窗口结构至关重要,而固定或局部控制方案可与自适应层次方法相媲美。该工作为理解注意力机制中的上下文分配提供了新视角,并引入注意力覆盖率(ACR)作为窗口路由的诊断指标。
| Multi-Head Attention (MHA) | 多头注意力机制,将注意力分为多个头以捕捉不同子空间的信息。 |
| Asymmetric Attention Heads (AAH) | 非对称注意力头,一种为每个头或每组头分配不同上下文长度的框架。 |
| Causal Local Window | 因果局部窗口,限制注意力只能关注当前位置之前一定范围内的令牌。 |
| Attention Coverage Ratio (ACR) | 注意力覆盖率,衡量所选窗口覆盖的注意力权重的比例,作为路由诊断指标。 |
| Validation Loss | 验证损失,模型在验证集上的损失值,用于评估模型泛化性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅