对话压缩竟丢掉用户改主意的关键轮次,TPBench用3个探针揭穿,保留率0.30时全输完整上下文
TPBench: A Turning-Point Benchmark for Dialogue Compression
arXiv CL (cs.CL) 重要 #评测基准#对话压缩#长上下文 🕐 今天 12:00

📖 AI 总结

这篇论文提出TPBench,一个针对对话压缩中“转折点丢失”问题的基准测试。作者指出,现有压缩方法可能保留对话事实,却删除了改变这些事实的关键轮次,例如用户修正价格、改变选择或新增约束,而单一的整体保留分数会掩盖这一失败。TPBench在相同名义保留预算下评估三类信息目标:用户初始目标、用户修改后槽位的当前值,以及二者兼有的联合探测。当前值答案来自MultiWOZ和SGD的人工对话状态标注,初始目标取自首轮首句,无需额外众包。实验发现,不同探测对压缩方法的排序并不一致;在保留比例0.30的联合探测中,所有被测压缩方法均低于完整上下文。删除携带更新的轮次会显著降低当前值准确率,而删除一个匹配的无关轮次则无影响。该基准揭示了对话压缩评估中被忽视的关键维度。

🔑 关键词速览

转折点驱逐压缩器保留对话事实但丢弃改变这些事实的关键轮次的现象。
TPBench一个评估对话压缩方法在转折点信息保留上表现的基准测试。
MultiWOZ一个多领域对话数据集,提供人工对话状态标注。
SGDSchema-Guided Dialogue数据集,用于对话状态跟踪的标注语料。
LongMemEval-KU一个用于评估长对话记忆和知识更新的额外语料库。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅