本文针对在NVIDIA T4等显存受限的商用GPU上部署检索增强生成(RAG)系统时面临的效率瓶颈展开研究,提出了“压缩悖论”这一实际问题:神经提示压缩虽能降低生成阶段开销,却会加剧KV缓存竞争并引入预处理延迟,而完全跳过压缩则在长上下文场景下导致显存溢出。作者识别出vLLM推理引擎与PyTorch压缩器在紧内存预算下协同部署时的两种失效机制,并提出Tri-Metric Router——一种无需训练、确定性的路由策略,依据空间复杂度、句法密度和类符形符比三个CPU侧信号,在原始、神经压缩和词法压缩三条流水线间动态选择。该路由以显存余量和延迟交叉点为硬件物理依据,在LongBench qasper上校准出T4平台约4332词的操作交叉点。在分布外测试中,该方法实现零OOM失败、88.5%的oracle对齐率和49.3%的综合F1,较始终启用词法压缩提升5.2个百分点,且不增加显存或训练成本。
| Compression Paradox | 压缩悖论:神经提示压缩在节省生成时间的同时,可能因KV缓存争用和预处理延迟导致总体效率下降的现象。 |
| Tri-Metric Router | 三指标路由器:一种基于空间复杂度、句法密度和类型-标记比三个CPU侧信号,在Raw、Neural和Lexical流水线间进行确定性选择的策略。 |
| KV Cache | 键值缓存:在Transformer推理中缓存键和值张量以加速自回归生成,但会占用大量显存。 |
| LLMLingua-2 | 一种基于神经网络的提示压缩方法,通过训练模型来精简输入文本,减少token数量。 |
| BM25 | 一种基于词频和逆文档频率的经典词法检索算法,常用于信息检索中的文本相关性排序。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅