该研究提出NinaXander方法,尝试通过一个训练好的共享潜在适配器,将来自不同架构家族的冻结语言模型逐层拼接组合。具体做法是让组合模型先运行一个模型的前若干层,经适配器转换中间表示后,再接入另一模型的剩余层;适配器训练完成后,可在不同层位置生成多种组合模型而无需重新训练。实验以循环架构RWKV-4-Raven-7B和Transformer架构Tulu-Pythia-6.9b为对象,考察跨家族冻结模型事后重组的可行性。结果显示,组合模型能生成语法通顺的文本,其中Pythia前5层加RWKV后27层的配置将Transformer键值缓存减少84.4%,准确率与单独RWKV无显著差异。但所有组合模型在多选题准确率上均未达到父模型Pythia,在域外WikiText上的语言建模性能也大幅下降。中间表示的对应仅在共享分词器、相同深度和隐藏宽度的有利条件下成立,不足以证明模型间存在通用语义空间。
| NinaXander | 本文提出的组合语言模型系列,通过共享潜在适配器连接不同架构家族的冻结模型层。 |
| 共享潜在适配器 | 一个训练好的模块,用于将一种模型的中间表示转换为另一种模型可接受的表示。 |
| RWKV-4-Raven-7B | 一种循环神经网络架构的语言模型,具有线性计算复杂度,简称为RWKV。 |
| Tulu-Pythia-6.9b | 基于Transformer架构的语言模型,简称为Pythia,用于与RWKV进行组合实验。 |
| KV缓存 | Transformer模型在自回归生成时存储键值对以加速计算的机制,减少缓存可提升效率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅