文章讨论了大模型推理中KV Cache带来的显存压力问题。随着Agent类任务普及,模型需反复处理长上下文,导致KV Cache急剧膨胀。以Qwen3-8B为例,每个Token约需147KB缓存,百万上下文对应约147GB,若按大规模请求推演,日累计数据量可达PB乃至EB级。由于GPU显存还需承载模型权重等数据,缓存挤占会降低并发能力,甚至触发缓存清理,迫使系统重算Prefill,拉长首Token等待时间。文章指出,破局思路是"以存代算",将不同活跃度的缓存分层存放于CPU内存、SSD及远端存储,让GPU专注生成Token,CPU接管记忆管理,从而在同等硬件下服务更多请求。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅