该研究针对边缘设备上检索增强生成(RAG)系统中上下文压缩策略的静态性问题,提出了一种基于遥测信息的自适应压缩方案。研究团队在NVIDIA Jetson AGX Thor平台上,使用Llama和Qwen系列生成模型、Natural Questions和HotpotQA数据集以及LLMLingua-2压缩方法进行了系统实验。测量结果显示,对于7B-8B参数规模的模型,生成阶段占单次查询延迟的约90%和GPU能耗的91%,是RAG预算的主要部分。实验进一步揭示了压缩率的自适应操作区间:轻度压缩可能错失节能机会,而过度压缩则会损害推理质量。在中等压缩率下,GPU能耗最多可降低53.2%,SoC总能耗可降低48.2%,且质量损失可忽略不计。基于这些发现,作者主张在运行时根据工作负载特征和边缘设备实时状态动态管理压缩率,而非采用固定的离线预设值。该研究为边缘RAG系统的能效优化提供了实证基础和新的设计思路。
| RAG | 检索增强生成,一种通过外部检索来增强语言模型生成的技术。 |
| KV-cache | 键值缓存,存储注意力计算中的键和值,以减少重复计算。 |
| LLMLingua-2 | 一种上下文压缩方法,用于在生成前修剪检索到的文本。 |
| 边缘SoC | 边缘设备上的系统级芯片,集成了CPU、GPU等组件,用于本地推理。 |
| 遥测 | 实时收集设备运行状态数据的技术,用于监控和决策。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅