🔥 今日值得一读 AI记忆大突破:5000万token窗口,加载快4.3倍省电12倍,准确率98%!
Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute
arXiv CL (cs.CL) 🔥 重点 #KV缓存#长上下文#推理优化#vLLM 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
把KV状态落盘复用,避免重复计算,让LLM支持超长上下文且更省钱,可直接接入vLLM服务。

📖 AI 总结

该研究提出并验证了一种为大型语言模型提供长期记忆的实用方案。其核心是名为galahad-kv的记忆层,将每约1.6万token文本块的键值(KV)状态加密保存至本地NVMe磁盘,需要时按字节精确加载,无需重新计算。作者在单张NVIDIA H100上,用Gemma 4 12B和31B模型对5000万token真实公开文本进行了测试:所有探测块均成功从加密存储中无重算加载,加载速度比重算快2.8至4.3倍,GPU能耗降低8.8至12.3倍,且显存占用在整个5000万token流中保持平稳。在检索数百万token前植入的事实时,12B模型正确回答82次(共100次),31B模型正确98次,且均未编造答案。研究同时指出局限:这是对已存状态的复用而非扩大注意力窗口,一次仅加载一个块,回答质量取决于模型本身,写入记忆是一次性成本,且存储需占用数TB本地磁盘。该工作为长上下文场景提供了一条比反复重算更高效、更经济的路径,并给出了可单卡复现的测试协议。

🔑 关键词速览

KV 状态键值状态,是 Transformer 模型在注意力机制中缓存的历史信息,用于避免重复计算。
上下文窗口模型一次能够处理的最大 token 数量,决定了模型能“记住”多长的文本。
galahad-kv一个公开软件包,用于将 KV 状态保存到磁盘并加载,实现长期记忆而无需重新计算。
vLLM一个高效的大型语言模型推理和服务引擎,支持高吞吐量和低延迟。
NVMe非易失性内存主机控制器接口规范,是一种高速固态硬盘接口,用于快速存储和读取数据。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅