本文介绍了LeanStream,一个面向端侧大语言模型(LLM)推理的高效流式框架。端侧推理虽利于隐私和响应速度,但受限于模型权重远超设备DRAM容量。现有系统虽利用激活稀疏性并将权重卸载至闪存,却面临根本性权衡:精确的稀疏执行决策依赖最新上下文,而高效的计算与I/O重叠则需早期预测,导致执行串行化或产生冗余权重读取与缓存开销。LeanStream提出“推测与精炼”机制,利用部分GPU结果逐步优化计算、加载及缓存保留策略,实现了GPU执行与存储I/O的细粒度重叠。在移动和嵌入式平台上的实现表明,相较此前系统,LeanStream在达到先前最优吞吐时,内存占用降低4.8至7.5倍,同时令牌生成吞吐量进一步提升1.6至2.1倍。该研究为资源受限设备上的高效LLM部署提供了新思路。
| LeanStream | 一种用于设备端LLM推理的流式推测与细化框架,通过逐步细化计算和I/O优先级实现高效重叠。 |
| speculate-and-refine | 一种推测与细化策略,先基于部分信息进行推测,再根据最新结果逐步调整决策。 |
| activation sparsity | 激活稀疏性,指神经网络中许多激活值为零,可利用此特性减少计算和I/O。 |
| on-device LLM inference | 设备端大语言模型推理,指在移动或嵌入式设备上本地运行LLM,无需云端。 |
| computation-I/O overlap | 计算与I/O重叠,指通过并行执行GPU计算和存储访问来隐藏I/O延迟。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅