这篇论文提出TPBench,一个针对对话压缩中“转折点丢失”问题的基准测试。作者指出,现有压缩方法可能保留对话事实,却删除了改变这些事实的关键轮次,例如用户修正价格、改变选择或新增约束,而单一的整体保留分数会掩盖这一失败。TPBench在相同名义保留预算下评估三类信息目标:用户初始目标、用户修改后槽位的当前值,以及二者兼有的联合探测。当前值答案来自MultiWOZ和SGD的人工对话状态标注,初始目标取自首轮首句,无需额外众包。实验发现,不同探测对压缩方法的排序并不一致;在保留比例0.30的联合探测中,所有被测压缩方法均低于完整上下文。删除携带更新的轮次会显著降低当前值准确率,而删除一个匹配的无关轮次则无影响。该基准揭示了对话压缩评估中被忽视的关键维度。
| 转折点驱逐 | 压缩器保留对话事实但丢弃改变这些事实的关键轮次的现象。 |
| TPBench | 一个评估对话压缩方法在转折点信息保留上表现的基准测试。 |
| MultiWOZ | 一个多领域对话数据集,提供人工对话状态标注。 |
| SGD | Schema-Guided Dialogue数据集,用于对话状态跟踪的标注语料。 |
| LongMemEval-KU | 一个用于评估长对话记忆和知识更新的额外语料库。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅