该研究首次针对基于Gated DeltaNet(GDN)和Kimi Delta Attention(KDA)的语言模型中的循环状态进行训练后量化。研究发现,均匀量化在精度与存储之间难以取得平衡:INT8和FP8在复杂推理任务上已出现精度下降,而INT4和NVFP4几乎使精度归零。进一步分析表明,量化误差能量集中在少数通道中,且状态通道的相对衰减强度在不同提示和任务间保持稳定。基于此,DAMP方法利用量化误差能量和基于衰减的持久性识别高风险通道,在离线校准阶段为这些通道分配更高精度,其余通道使用INT8。在Qwen3.6-35B和Kimi-Linear-48B模型上的六项基准测试中,DAMP以每状态值9.9比特的精度保持了接近FP32基线的平均准确率,同时将循环状态存储减少69.1%,更新内核速度提升至2.01倍,全模型TPOT延迟降低最高10.9%。
| Gated DeltaNet (GDN) | 一种语言模型架构,通过门控机制和增量更新维护固定大小的循环状态,替代传统KV缓存以降低内存开销。 |
| Kimi Delta Attention (KDA) | 一种注意力机制变体,类似GDN,使用循环状态压缩历史信息,减少推理时的内存占用。 |
| 循环状态量化 | 对语言模型中固定大小的循环状态(如GDN/KDA中的状态向量)进行低精度数值表示,以减少存储和加速计算。 |
| 训练后量化 | 在模型训练完成后,通过校准数据确定量化参数,将权重或激活转换为低精度格式,无需重新训练。 |
| TPOT | Time Per Output Token,生成每个输出词元所需的平均时间,是衡量推理延迟的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅