🔥 今日值得一读 冻结模型跨架构拼接,KV缓存直降84.4%,准确率不输原模型!
NinaXander: Feasibility and Limits of Composing Frozen Language Models Across Architecture Families via a Shared Latent Space
arXiv CL (cs.CL) 🔥 重点 #模型组合#潜在空间#跨架构#训练方法 🕐 10-01 12:00
👨‍💼 主理人解读 · 为什么值得关注
让开发者无需重训即可拼接不同架构的冻结模型层,低成本组合出新的复合模型能力。

📖 AI 总结

该研究提出NinaXander方法,尝试通过一个训练好的共享潜在适配器,将来自不同架构家族的冻结语言模型逐层拼接组合。具体做法是让组合模型先运行一个模型的前若干层,经适配器转换中间表示后,再接入另一模型的剩余层;适配器训练完成后,可在不同层位置生成多种组合模型而无需重新训练。实验以循环架构RWKV-4-Raven-7B和Transformer架构Tulu-Pythia-6.9b为对象,考察跨家族冻结模型事后重组的可行性。结果显示,组合模型能生成语法通顺的文本,其中Pythia前5层加RWKV后27层的配置将Transformer键值缓存减少84.4%,准确率与单独RWKV无显著差异。但所有组合模型在多选题准确率上均未达到父模型Pythia,在域外WikiText上的语言建模性能也大幅下降。中间表示的对应仅在共享分词器、相同深度和隐藏宽度的有利条件下成立,不足以证明模型间存在通用语义空间。

🔑 关键词速览

NinaXander本文提出的组合语言模型系列,通过共享潜在适配器连接不同架构家族的冻结模型层。
共享潜在适配器一个训练好的模块,用于将一种模型的中间表示转换为另一种模型可接受的表示。
RWKV-4-Raven-7B一种循环神经网络架构的语言模型,具有线性计算复杂度,简称为RWKV。
Tulu-Pythia-6.9b基于Transformer架构的语言模型,简称为Pythia,用于与RWKV进行组合实验。
KV缓存Transformer模型在自回归生成时存储键值对以加速计算的机制,减少缓存可提升效率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅