本文提出了一种名为LRCC(低秩条件计算)的新方法,旨在改进预训练语言模型的低秩压缩效率。传统低秩压缩在推理阶段采用固定的秩分配,对每个输入token施加相同的计算量,忽略了不同token之间的差异。LRCC通过在Transformer的每个模块中训练一个轻量级路由器,使其在若干嵌套的低秩路径中进行选择,从而实现与token相关的自适应计算。训练过程中低秩因子保持冻结,仅优化路由器参数。作者在Llama和Qwen系列模型上进行了语言建模与零样本下游任务评测,结果表明:在相同的平均活跃参数预算下,LRCC优于静态低秩压缩方法,其中在Llama-2-7B上平均下游准确率提升达7.6个百分点;在batch-size-1解码延迟相当的条件下,LRCC在Llama-3.2-1B上同时改善了困惑度和下游准确率,在Llama-2-7B上也保持竞争力,且无需专用算子。作者还通过分析路由器的路径选择验证了token级路径分配的有效性。
| Low-Rank Compression | 低秩压缩,一种通过将权重矩阵分解为两个小矩阵的乘积来减少模型参数和计算量的技术。 |
| Conditional Computation | 条件计算,一种根据输入动态选择计算路径的方法,旨在减少不必要的计算。 |
| Router | 路由器,一个轻量级网络模块,用于为每个输入词元选择特定的计算路径。 |
| Nested Low-Rank Paths | 嵌套低秩路径,一组具有不同秩的预定义低秩分解,按计算量从小到大嵌套排列。 |
| Zero-Shot Downstream Tasks | 零样本下游任务,模型在未经过特定任务微调的情况下直接进行评估的任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅