随着大模型上下文窗口不断扩展、Agent任务持续时间延长以及AI Coding等场景需要跨天跨周保留项目上下文,KV Cache正从短生命周期的临时缓存演变为需长期保存、跨节点共享的AI记忆基础设施。传统依赖显存、内存和本地SSD的三级缓存体系在容量、成本和寿命上均已触及瓶颈。华为推出OceanStor M900 AI记忆存储,定位L3.5层,将KV Cache从计算节点内的临时资源升级为可持久化、可调度、可复用的数据资产,单集群可提供64PB容量,单NPU可用KV Cache从GB级提升至TB级。其核心挑战在于SSD毫秒级时延可能抵消缓存复用收益,华为通过KV语义直通访问和分层预取调度,将数据搬运次数从5次减至1次,I/O时延和首Token时延降低超50%,访问时延约10至15微秒。内部测试显示Token命中率可提升约一倍。这一方案反映出上下文复用效率正成为AI落地的关键竞争变量。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅