本文提出WinSyn,一个用于生成企业级问答评测数据的自动化流水线。针对现有基准普遍缺乏真实复杂度、答案偏短、提问方式不自然等问题,该方法通过模拟跨越数月、涉及多达25名不同角色员工的企业项目,合成包含邮件等职场场景的数据,并配套生成基于数据的长短型问题与标准答案,突出信息分散、歧义和自然提问等特征。作者用最新前沿模型对若干标准智能体基线进行评测,发现各数据集在所有查询上的平均得分均低于80%,表明现有系统在企业场景下仍有明显提升空间。该工作强调了高复杂度、贴近真实的评测数据对于推动企业深度研究系统发展的重要性。
| Retrieval-Augmented Generation (RAG) | 检索增强生成,一种将外部知识检索与大语言模型生成相结合的技术,用于提升回答的准确性和时效性。 |
| Deep Research (DR) | 深度研究,指智能体通过多步检索、推理和综合来回答复杂问题的能力或系统。 |
| Agentic Baselines | 智能体基线,指用于评估智能体系统性能的基准模型或方法,通常代表当前典型的技术水平。 |
| Synthetic Datasets | 合成数据集,通过算法或模拟生成而非真实采集的数据集合,用于可控地测试系统性能。 |
| Enterprise Question-Answering | 企业问答,指在企业内部数据(如邮件、文档、聊天记录)上进行的自动问答任务,通常面临数据分散和冲突等挑战。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅