该研究探讨了混合语言模型中注意力机制与固定大小循环状态各自的功能分工。作者提出了两种缓存级干预方法:分割预填充将KV缓存或循环状态单独保留以生成答案,状态交换则在单次前向传播中配对来自不同上下文的两种状态。在Qwen3.5和Falcon-H1上的实验显示,两种通道功能高度分化:精确检索仅依赖注意力机制(保持64-98%的完整准确率),而循环状态在此任务上完全失效;相反,输出语言和人格特征主要依赖循环状态(分别保持70-80%和3-5倍效果),仅靠KV缓存时语言准确率降至约1%。状态交换实验进一步证实,答案内容由KV侧决定,语言风格由循环侧决定。此外,仅循环生成可接受上下文未出现但语义相关的词汇。研究表明,注意力负责对已述内容的查找,循环状态则塑造后续表达方式。
| Hybrid language models | 结合注意力机制与固定大小循环状态的语言模型,旨在融合两种机制的优点。 |
| KV cache | 注意力机制中存储键和值的缓存,用于加速生成并保留上下文信息。 |
| Recurrent state | 循环神经网络中的隐藏状态,以固定大小编码历史信息。 |
| Split-prefill | 一种干预方法,仅使用预填充上下文中的KV缓存或循环状态之一来生成答案。 |
| State-swap | 一种干预方法,将一个上下文的KV缓存与另一个上下文的循环状态配对,以测试各自的功能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅