4B小模型靠合成数据反超Claude Opus 4.8,用户侧冲突检测有新招!
Towards Proactive Detection of User-Side Implicit Conflicts in Human-LLM Dialogue
arXiv CL (cs.CL) 重要 Agent论文方法大模型 🕐 09-18 12:00

📖 AI 总结

这篇论文关注人机对话中一个此前被忽视的问题:用户后续发言可能与此前意图存在隐性冲突,导致大模型误解需求并给出不当回应。作者指出,已有研究多聚焦模型侧冲突,用户侧冲突尚缺乏系统探索。为此,他们构建了人工标注基准UC-Bench,用于评估用户侧冲突检测能力。初步实验显示,现有大模型在该任务上表现不佳,尤其当冲突源于对话历史中的隐性不兼容时。针对轻量模型训练数据有限的问题,作者提出约束引导的合成方法SynUC,将用户侧冲突映射到约束空间,并借助SPEAKING框架实现可追溯的约束变换,据此在WildChat上构建了包含2487个样本的训练集UC-Data。实验表明,经UC-Data训练的Qwen3.5-4B在UC-Bench上优于Claude Opus 4.8等更大规模通用模型,也优于用现有方法合成数据训练的同类模型。该工作为对话系统主动识别用户意图冲突、及时请求澄清提供了新的基准与方法路径。

🔑 关键词速览

用户侧冲突指用户后续话语与先前意图之间隐含的不一致或矛盾,需要系统主动识别。
UC-Bench一个人工标注的基准数据集,用于评估大语言模型检测用户侧冲突的能力。
SynUC一种约束引导的数据合成方法,通过约束空间和SPEAKING框架生成可追踪的用户侧冲突样本。
SPEAKING框架一种用于指导约束变换的框架,帮助在合成过程中保持冲突演变的可追踪性。
UC-Data基于SynUC方法从WildChat构建的用户侧冲突训练集,包含2,487个样本。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅