🔥 今日值得一读 CPU推理提速82%!用向量索引替换输出投影,小模型解码快得飞起
Accelerating LLM Inference via Vector Index Based Output Embeddings
arXiv CL (cs.CL) 🔥 重点 #推理优化#Transformer#向量检索 🕐 08-31 12:00
👨‍💼 主理人解读 · 为什么值得关注
通过向量索引检索候选token,减少内存带宽瓶颈,开发者可集成到现有解码流程中加速推理。

📖 AI 总结

该研究针对大语言模型推理中的内存带宽瓶颈问题,提出了一种基于向量索引的输出嵌入加速方法。在自回归解码过程中,大型输出嵌入矩阵会显著消耗内存带宽,这一问题在词汇量大的紧凑型多语言模型中尤为突出。研究者将输出投影和top-k令牌选择重新定义为令牌嵌入上的最大内积搜索,并用基于HNSW的向量索引替代了密集词汇投影。该方法仅检索少量高分候选令牌,通过将检索到的逻辑值散射到稀疏的全词汇张量中,可无缝集成到现有解码流程。在Gemma 3、Llama 3.2和Qwen 3模型的CPU推理测试中,该方法显著加速了输出投影,使Gemma 3 270M的端到端批大小为一的解码吞吐量提升最高达82%,同时经AlpacaEval评估,生成质量保持不变。研究结果表明,在延迟敏感的小批量解码场景中,近似检索可作为密集输出投影的实用替代方案。

🔑 关键词速览

输出嵌入矩阵存储所有词汇的嵌入向量的大型矩阵,用于将隐藏状态映射到词汇空间。
自回归解码一种逐个生成令牌的推理过程,每一步依赖之前生成的令牌。
最大内积搜索在向量空间中寻找与查询向量内积最大的向量,用于高效检索最相关的项。
HNSW一种基于分层可导航小世界的近似最近邻搜索算法,用于高效检索。
输出投影将模型的隐藏状态映射到词汇表上的逻辑值(logits)的线性变换。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅