本文研究频率坍缩注意力中滤波器形状对性能的影响,通过字符级语言建模的受控消融实验检验了五个假设。核心发现包括:直流和奈奎斯特分量具有主动危害性,证实振荡带通结构不可或缺;最优单尺度带宽约为2个频段、中心位于段落尺度(约70个token),相较基线点积注意力带来1.15 nats的净增益;满足零均值条件的可容许滤波器(如m=2的墨西哥帽DOG)在同尺度下优于非可容许的高斯滤波器,并能部分抵御双边FFT泄漏;双边FFT泄漏随频谱覆盖范围单调递增,窄带滤波器干净而宽带滤波器存在泄漏;字符级因果时域Morlet滤波器无法超越基线点积注意力。上述结果共同表明,FourierQK在双向注意力场景(如BERT类编码器)中有效,而自回归生成则需采用因果频谱变体(如MorletQK)。
| 频率坍缩注意力 | 一种注意力机制,用带通滤波内积替代标准点积,以提升语言建模性能。 |
| 带通滤波 | 允许特定频率范围信号通过,同时抑制其他频率的滤波方式。 |
| 直流抑制 | 消除信号中零频率(直流)分量的处理,以避免有害影响。 |
| 奈奎斯特抑制 | 消除信号中最高频率(奈奎斯特频率)分量的处理,以避免混叠等有害影响。 |
| FFT 泄漏 | 快速傅里叶变换中由于频谱截断导致的能量从主频带泄漏到其他频带的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅