该研究提出了一种面向大语言模型(LLM)的“推理感知压缩”框架,旨在解决统一量化压缩方法可能破坏关键推理电路的问题。研究者在五个推理基准(GSM8K、FOLIO、MATH-500、ProofWriter、MuSiQue)上结合硬件级GPU能耗测量,对196至224个模块进行INT4脆弱性扰动扫描,并选择性地将最敏感电路恢复至FP16精度。研究发现三点:其一,INT4量化可能因延长推理链而增加能耗,例如在GSM8K上功率降低25%反而导致净能耗上升;其二,脆弱性具有任务依赖性,数学推理中注意力投影更关键,逻辑推理中的敏感模式则因架构而异;其三,选择性压缩能达到统一方法无法企及的帕累托最优效果,如R1-Qwen-7B模型在ProofWriter上Top-10%压缩相比FP16提升12个百分点,同时能耗降低9.7%。该研究为节能型LLM部署提供了更精细的压缩策略。
| Large Reasoning Models (LRMs) | 大型推理模型,指专门设计用于复杂逻辑和数学推理的AI模型,如OpenAI的o1系列。 |
| INT4 quantization | 一种将模型权重和激活值量化为4位整数的压缩技术,以减少内存和计算能耗。 |
| FP16 | 半精度浮点格式,用于深度学习模型,相比INT4提供更高精度但能耗更高。 |
| Pareto-optimal | 帕累托最优,指在多个目标(如精度和能耗)之间达到无法在不牺牲一个目标的情况下改善另一个目标的平衡状态。 |
| Reasoning circuits | 推理电路,指模型中负责执行推理任务的特定神经网络路径或模块集合。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅