🔥 今日值得一读 单提示词内并行解码,吞吐量狂飙7倍!无需改架构,CCQA推理快人一步
Intra-Prompt Parallel Decoding for Common-Context Question Answering
arXiv CL (cs.CL) 🔥 重点 #推理优化#解码方法#问答系统 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用IPPD在多个问题共享上下文的场景下,通过并行解码减少注意力计算瓶颈,显著提升推理吞吐量。

📖 AI 总结

本文介绍了一种名为“提示内并行解码”(IPPD)的新型推理方法,旨在解决共同上下文问答(CCQA)任务中的效率瓶颈。在CCQA中,多个问题共享同一上下文,但传统大语言模型需为每个问题独立生成提示,导致GPU因注意力机制的内存瓶颈而利用率不足。IPPD通过在单个提示内并行解码多个问题的下一词元,实现内存与计算的高效共享,并利用虚拟位置ID和注意力掩码操作,确保输出与标准提示一致,且无需微调或改动模型架构。该方法与批量推理完全兼容,即使各提示上下文不同也能适用。实验结果显示,IPPD的有效吞吐量比标准解码提升高达7倍,且不损失生成质量,在多数场景下优于结合前缀缓存和PagedAttention的现有技术。该研究为提升多问题问答场景的推理效率提供了新思路,已获EMNLP 2026主会接收。

🔑 关键词速览

Common-Context Question Answering (CCQA)一种问答任务,其中多个问题共享同一上下文来生成答案。
Intra-Prompt Parallel Decoding (IPPD)一种在单个提示词内并行解码多个问题答案的推理方法。
Virtual Position IDs用于在注意力机制中模拟不同位置标识的技术,无需改变模型结构。
Attention Mask Manipulation通过调整注意力掩码来控制模型关注范围,以实现并行解码。
PagedAttention一种用于高效管理注意力缓存的内存技术,常用于前缀缓存。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅