🔥 今日值得一读 低秩压缩新突破!LRCC让每个词元按需计算,下游准确率飙升7.6个百分点!
LRCC: Generalizing Low-Rank Compression with Conditional Computation
arXiv CL (cs.CL) 🔥 重点 #模型压缩#低秩分解#条件计算#推理优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让LLM推理按token动态选择低秩路径,简单输入少算、复杂输入多算,降低平均推理成本。

📖 AI 总结

本文提出了一种名为LRCC(低秩条件计算)的新方法,旨在改进预训练语言模型的低秩压缩效率。传统低秩压缩在推理阶段采用固定的秩分配,对每个输入token施加相同的计算量,忽略了不同token之间的差异。LRCC通过在Transformer的每个模块中训练一个轻量级路由器,使其在若干嵌套的低秩路径中进行选择,从而实现与token相关的自适应计算。训练过程中低秩因子保持冻结,仅优化路由器参数。作者在Llama和Qwen系列模型上进行了语言建模与零样本下游任务评测,结果表明:在相同的平均活跃参数预算下,LRCC优于静态低秩压缩方法,其中在Llama-2-7B上平均下游准确率提升达7.6个百分点;在batch-size-1解码延迟相当的条件下,LRCC在Llama-3.2-1B上同时改善了困惑度和下游准确率,在Llama-2-7B上也保持竞争力,且无需专用算子。作者还通过分析路由器的路径选择验证了token级路径分配的有效性。

🔑 关键词速览

Low-Rank Compression低秩压缩,一种通过将权重矩阵分解为两个小矩阵的乘积来减少模型参数和计算量的技术。
Conditional Computation条件计算,一种根据输入动态选择计算路径的方法,旨在减少不必要的计算。
Router路由器,一个轻量级网络模块,用于为每个输入词元选择特定的计算路径。
Nested Low-Rank Paths嵌套低秩路径,一组具有不同秩的预定义低秩分解,按计算量从小到大嵌套排列。
Zero-Shot Downstream Tasks零样本下游任务,模型在未经过特定任务微调的情况下直接进行评估的任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅