本文探讨了大语言模型提示词过长带来的推理成本与延迟问题。针对现有学习式压缩方法依赖辅助模型且非确定性的局限,作者提出一种无需训练、完全确定、仅靠CPU运行的词汇级压缩流水线,集成停用词删除、填充短语剔除、缩略替换、词性剪枝、词形还原、WordNet同义缩短及命名实体保留等十一种可开关的词汇变换。研究在来自六个数据源的1242条英文提示上测试十五种配置,覆盖十一个任务类别,生成18630组配对补全结果,并以BLEU、ROUGE、BERTScore及SentenceBERT余弦相似度衡量输出保真度。结果显示,最激进配置平均减少40.3%的token,BERTScore-F1为0.876;仅删停用词可减少29.6%且F1达0.913。研究还刻画了各任务类别的压缩与保真度帕累托前沿,指出常识推理在激进压缩下系统性失效。所有代码与数据均已公开,为低成本提示压缩提供了可复现的基线。
| LLMLingua | 一种基于学习的大型语言模型提示压缩方法,通过辅助语言模型实现高压缩比,但具有非确定性。 |
| BERTScore-F1 | 一种基于 BERT 嵌入的文本生成评估指标,通过计算生成文本与参考文本之间的语义相似度 F1 值来衡量质量。 |
| Pareto frontier | 帕累托前沿,在多目标优化中表示无法在不牺牲一个目标的情况下改进另一个目标的最优权衡曲线。 |
| stopword removal | 停用词移除,一种经典的文本预处理技术,删除常见但信息量低的词(如 the、a、is),以减少文本长度。 |
| in-context learning | 上下文学习,指大型语言模型仅通过提示中提供的少量示例即可执行新任务,而无需更新模型参数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅