本文介绍了一种名为“提示内并行解码”(IPPD)的新型推理方法,旨在解决共同上下文问答(CCQA)任务中的效率瓶颈。在CCQA中,多个问题共享同一上下文,但传统大语言模型需为每个问题独立生成提示,导致GPU因注意力机制的内存瓶颈而利用率不足。IPPD通过在单个提示内并行解码多个问题的下一词元,实现内存与计算的高效共享,并利用虚拟位置ID和注意力掩码操作,确保输出与标准提示一致,且无需微调或改动模型架构。该方法与批量推理完全兼容,即使各提示上下文不同也能适用。实验结果显示,IPPD的有效吞吐量比标准解码提升高达7倍,且不损失生成质量,在多数场景下优于结合前缀缓存和PagedAttention的现有技术。该研究为提升多问题问答场景的推理效率提供了新思路,已获EMNLP 2026主会接收。
| Common-Context Question Answering (CCQA) | 一种问答任务,其中多个问题共享同一上下文来生成答案。 |
| Intra-Prompt Parallel Decoding (IPPD) | 一种在单个提示词内并行解码多个问题答案的推理方法。 |
| Virtual Position IDs | 用于在注意力机制中模拟不同位置标识的技术,无需改变模型结构。 |
| Attention Mask Manipulation | 通过调整注意力掩码来控制模型关注范围,以实现并行解码。 |
| PagedAttention | 一种用于高效管理注意力缓存的内存技术,常用于前缀缓存。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅