该研究针对电商对话智能体评估中单一任务成功率掩盖过程差异的问题,构建了一个确定性、可复现的电商仿真环境。环境预先固定每次试验的客户画像、难度、目标购物车及商品揭示时序,由模拟消费者在模型协助下完成购买,并记录助手每一步动作与对应环境状态,使评估者可基于留存证据对对话的局部环节分别打分,例如仅当客户已提及某商品时,才因搜索未呈现该商品而扣分;同时依据实际工具调用与预期调用集的差异施加不同惩罚。环境还与模拟器双向交互,可因客户过度沮丧而终止试验,并实时注入探索、延迟购买或回忆先前对话等指令。研究对8个参数规模在20B至35B之间的开放权重智能体各进行160次试验,采集44项指标,所得能力画像能够区分行动不足、过度购买、无依据的产品属性描述和搜索能力薄弱等问题,而这些正是终端成功率所无法揭示的。
| Environment-Grounded Verification | 一种基于环境记录的状态和动作证据来验证智能体行为的方法,而非仅依赖最终任务结果。 |
| Open-Weight Agents | 指模型权重公开可用的智能体,通常允许研究社区自由使用和修改。 |
| Task-Success Rate | 衡量智能体完成指定任务比例的指标,但可能掩盖过程中的具体行为差异。 |
| Tool-Call Set | 预期智能体在特定情境下应调用的一组工具或函数,用于评估其动作的合理性。 |
| Capability Profiles | 通过多维度指标刻画智能体能力特征的综合画像,用于识别其行为模式与缺陷。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅