仅需微调!TinyCeNN-LM质量门控转换注意力,缓存直降6%精度几乎无损
TinyCeNN-LM: Quality-Gated Conversion of Pretrained Attention with CeNN-Inspired Cellular-Recurrent Layers
arXiv AI (cs.AI) 论文方法大模型架构 🕐 今天 12:00

📖 AI 总结

TinyCeNN-LM 提出一种“质量门控”的训练后转换框架,用受细胞神经网络(CeNN)启发的细胞循环层替换预训练语言模型中的注意力机制,以缓解替换后表示不兼容的问题。该框架包含有界局部处理、紧凑循环记忆、路由、融合以及“接受或回滚”验证机制,并研究了三种实现方案。实验显示,在 SmolLM2-135M 上,第0至2层通过严格 PDelta3 转换验证,累积 NLL 仅增加 0.01209,而第3层虽 NLL 达标却因表示保真度不足被拒绝;在 Qwen3.5-0.8B 上,第3、7、11层被接受,最终 NLL 增加 0.02073。Integrated Memory 方案将困惑度波动控制在 -0.07% 至 +0.93% 之间,总缓存最多减少 6.01%,转换后 Qwen 模型在200项下游抽样测试中准确率为 28.5%–32.0%。研究支持保守、按质量门控的结构转换,而非普遍替换注意力或追求加速。

🔑 关键词速览

CeNN细胞神经网络(Cellular Neural Network),一种具有局部连接和连续时间动态的神经网络模型。
质量门控转换一种在训练后替换模型组件时,通过预设质量阈值决定是否接受或回滚的机制。
NLL负对数似然(Negative Log-Likelihood),衡量语言模型预测概率的常用损失指标。
表示保真度替换层后,模型内部表示与原始表示保持一致的程度。
PDelta3一种严格的转换验证方法,要求表示和 NLL 指标同时满足固定阈值才接受替换。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅