该研究针对用户模拟器保真度评估依赖昂贵且主观的大模型评判这一问题,提出从社会语言学视角将用户人设重新定义为可观测的语言风格特征,而非需要模型自行推断的标签或描述。作者以具体文体比率来编写人设,并引入两种无需模型的成熟工具——作者身份验证文体计量学和基于词典的内容分析——作为保真度诊断手段。在五个面向任务的客服智能体上,研究将社会语言学方案与扁平化描述基线进行A/B对比,结果显示该方案在多数模型上同时提升了风格遵循度和文体计量可区分性,但人设风格保真并不等同于人设自然度。研究认为,该方法有助于构建更多样、更具代表性的用户人设,相关指标在错误归因分析中尤具价值,可定位保真度失效环节,是推动用户模拟更忠实呈现多样语言输出的第一步。
| 用户模拟器 (User Simulator) | 在智能体评估中模拟真实用户行为与语言风格的自动化系统,用于替代或补充人类测试者。 |
| 人格保真度 (Persona Fidelity) | 模拟用户人格与真实用户人格在语言风格和行为特征上的吻合程度。 |
| 社会语言学图式 (Sociolinguistic Schema) | 将人格视为由可观察语言风格涌现的社会类型,而非依赖标签或描述进行预测的建模框架。 |
| 作者身份验证文体计量学 (Authorship-Verification Stylometry) | 通过量化文本的文体特征(如用词频率、句法模式)来判定作者身份或区分不同写作风格的无模型方法。 |
| 错误归因分析 (Error-Attribution Analysis) | 一种诊断方法,用于定位模拟过程中保真度下降或失败的具体环节和原因。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅