本文研究语言模型智能体在处理CRM记录类任务时的一种失效模式:当上下文中包含带有乐观倾向的当事方(如销售代表)的断言时,模型会将其当作证据,从而批准公司自身记录本应否决的交易。在CRMArena-Pro的100个销售线索资格判定任务中,销售代表在每次通话中都声称交付时间可接受,在76次通话中声称预算可接受;在其中31个断言与价格表和安装政策相矛盾的案例里,仅阅读通话记录的模型有29次批准了交易。该现象在来自四家提供商的七个模型中一致出现(被误导率87%至97%),模型规模扩大和显式推理均无法提供抵抗。35个真实失败中仅3个不涉及此类断言,说明问题本质是"被说服"而非"信息缺失"。作者贡献了一套诊断方法,包括区分说服与信息缺口的桶分析、同信息对照实验和计算步骤对照实验,并指出该模式是一种稳健的方向性倾向与健全性属性,而非已证实的性能下限。
| CRM (Customer Relationship Management) | 客户关系管理,用于管理公司与客户互动和数据的系统,本文中作为语言模型智能体的问答数据源。 |
| In-Context Grounding | 上下文接地,指语言模型基于给定上下文(如CRM记录)进行推理和回答的能力。 |
| Lead Qualification | 线索资格认定,销售流程中判断潜在客户是否值得跟进或符合销售条件的任务。 |
| Persuasion vs. Information Gap | 说服与信息缺口的区分,本文核心诊断:模型失败是因被有偏见的断言说服,而非缺少信息。 |
| CRMArena-Pro | 一个用于评估语言模型在CRM任务上表现的基准数据集,本文使用了其中的100个线索资格认定任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅