该研究提出并验证了一种为大型语言模型提供长期记忆的实用方案。其核心是名为galahad-kv的记忆层,将每约1.6万token文本块的键值(KV)状态加密保存至本地NVMe磁盘,需要时按字节精确加载,无需重新计算。作者在单张NVIDIA H100上,用Gemma 4 12B和31B模型对5000万token真实公开文本进行了测试:所有探测块均成功从加密存储中无重算加载,加载速度比重算快2.8至4.3倍,GPU能耗降低8.8至12.3倍,且显存占用在整个5000万token流中保持平稳。在检索数百万token前植入的事实时,12B模型正确回答82次(共100次),31B模型正确98次,且均未编造答案。研究同时指出局限:这是对已存状态的复用而非扩大注意力窗口,一次仅加载一个块,回答质量取决于模型本身,写入记忆是一次性成本,且存储需占用数TB本地磁盘。该工作为长上下文场景提供了一条比反复重算更高效、更经济的路径,并给出了可单卡复现的测试协议。
| KV 状态 | 键值状态,是 Transformer 模型在注意力机制中缓存的历史信息,用于避免重复计算。 |
| 上下文窗口 | 模型一次能够处理的最大 token 数量,决定了模型能“记住”多长的文本。 |
| galahad-kv | 一个公开软件包,用于将 KV 状态保存到磁盘并加载,实现长期记忆而无需重新计算。 |
| vLLM | 一个高效的大型语言模型推理和服务引擎,支持高吞吐量和低延迟。 |
| NVMe | 非易失性内存主机控制器接口规范,是一种高速固态硬盘接口,用于快速存储和读取数据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅