🔥 今日值得一读 免训练提速MoE推理!ExFold统一加速预填充与解码,性能飙升还不用重训!
ExFold: Unified Expert Folding for Training-Free MoE Prefill-Decode Acceleration
arXiv LG (cs.LG) 🔥 重点 大模型算力 🕐 08-27 12:00

📖 AI 总结

ExFold 提出了一种无需训练的专家折叠框架,用于统一加速混合专家(MoE)模型的预填充和解码阶段。MoE 推理中,预填充受限于逐 token 的专家计算,而解码受限于批量激活专家的内存带宽,但现有方法仅优化单一资源代理,且忽略或近似处理被排除专家的贡献。ExFold 将两阶段统一为预算输出近似问题:仅执行阶段特定的受限专家集,并通过校准的标量投影矩阵,将预算外专家的贡献折叠到保留专家上。该方法基于专家输出方向对齐但幅度不同的观察,在无标签数据上校准投影矩阵。预填充加速对应 token 级 Top-K 折叠,解码加速对应批量级专家池折叠,两阶段仅专家选择方式不同。在 vLLM 中实现为即插即用插件,配合轻量级 CUDA 内核,实现了高达 1.41 倍的首 token 延迟(TTFT)和 2.45 倍的每 token 输出延迟(TPOT)加速,同时保持约 99% 的原始平均质量。

🔑 关键词速览

Mixture-of-Experts (MoE)一种模型架构,通过稀疏激活部分专家网络来扩展模型容量,同时保持计算效率。
Prefill推理阶段之一,处理输入提示并生成键值缓存,计算密集。
Decode推理阶段之一,逐令牌生成输出,受内存带宽限制。
Expert Folding一种技术,将未激活专家的贡献通过投影合并到保留专家中,以近似完整模型输出。
TTFT (Time to First Token)从输入到生成第一个输出令牌的延迟,衡量预填充速度。
TPOT (Time per Output Token)生成每个输出令牌的平均时间,衡量解码速度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅