该研究针对大语言模型推理中的内存带宽瓶颈问题,提出了一种基于向量索引的输出嵌入加速方法。在自回归解码过程中,大型输出嵌入矩阵会显著消耗内存带宽,这一问题在词汇量大的紧凑型多语言模型中尤为突出。研究者将输出投影和top-k令牌选择重新定义为令牌嵌入上的最大内积搜索,并用基于HNSW的向量索引替代了密集词汇投影。该方法仅检索少量高分候选令牌,通过将检索到的逻辑值散射到稀疏的全词汇张量中,可无缝集成到现有解码流程。在Gemma 3、Llama 3.2和Qwen 3模型的CPU推理测试中,该方法显著加速了输出投影,使Gemma 3 270M的端到端批大小为一的解码吞吐量提升最高达82%,同时经AlpacaEval评估,生成质量保持不变。研究结果表明,在延迟敏感的小批量解码场景中,近似检索可作为密集输出投影的实用替代方案。
| 输出嵌入矩阵 | 存储所有词汇的嵌入向量的大型矩阵,用于将隐藏状态映射到词汇空间。 |
| 自回归解码 | 一种逐个生成令牌的推理过程,每一步依赖之前生成的令牌。 |
| 最大内积搜索 | 在向量空间中寻找与查询向量内积最大的向量,用于高效检索最相关的项。 |
| HNSW | 一种基于分层可导航小世界的近似最近邻搜索算法,用于高效检索。 |
| 输出投影 | 将模型的隐藏状态映射到词汇表上的逻辑值(logits)的线性变换。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅