ExFold 提出了一种无需训练的专家折叠框架,用于统一加速混合专家(MoE)模型的预填充和解码阶段。MoE 推理中,预填充受限于逐 token 的专家计算,而解码受限于批量激活专家的内存带宽,但现有方法仅优化单一资源代理,且忽略或近似处理被排除专家的贡献。ExFold 将两阶段统一为预算输出近似问题:仅执行阶段特定的受限专家集,并通过校准的标量投影矩阵,将预算外专家的贡献折叠到保留专家上。该方法基于专家输出方向对齐但幅度不同的观察,在无标签数据上校准投影矩阵。预填充加速对应 token 级 Top-K 折叠,解码加速对应批量级专家池折叠,两阶段仅专家选择方式不同。在 vLLM 中实现为即插即用插件,配合轻量级 CUDA 内核,实现了高达 1.41 倍的首 token 延迟(TTFT)和 2.45 倍的每 token 输出延迟(TPOT)加速,同时保持约 99% 的原始平均质量。
| Mixture-of-Experts (MoE) | 一种模型架构,通过稀疏激活部分专家网络来扩展模型容量,同时保持计算效率。 |
| Prefill | 推理阶段之一,处理输入提示并生成键值缓存,计算密集。 |
| Decode | 推理阶段之一,逐令牌生成输出,受内存带宽限制。 |
| Expert Folding | 一种技术,将未激活专家的贡献通过投影合并到保留专家中,以近似完整模型输出。 |
| TTFT (Time to First Token) | 从输入到生成第一个输出令牌的延迟,衡量预填充速度。 |
| TPOT (Time per Output Token) | 生成每个输出令牌的平均时间,衡量解码速度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅