StoreBench 是一个面向自主运营智能体的实时电商评测与训练环境。与多数静态基准不同,该环境让智能体在生产级电商后端上经营一家中型服装网店,客户全天候下单,供应商会调价或断供,市场冲击往往毫无预警,以此考察长周期规划与不确定性下的经济判断能力。智能体通过人类运营者使用的29种商家工具操作,并受窗口化操作预算约束,使模拟时间取决于动作而非模型延迟。评测采用脚本化锚点策略校准通过阈值,并对奖励作弊进行加固。在11个场景、三种世界种子下测试七款前沿模型,无一能平均匹敌脚本化智能策略:最佳模型 DeepSeek-V4-Pro 通过率为49%,而启发式策略达97%;人类专家综合得分0.708,略高于所有模型。在完整模拟年度中,多数模型表现显著提升;经GRPO后训练,Qwen3.5-27B 在仅五个任务上训练后,留出评测综合分从0.136升至0.373。该工作为智能体长周期经济决策提供了可复现、抗污染的评测与训练平台。
| StoreBench | 一个直播电商环境基准,用于评估和训练自主运营智能体在动态市场中的长时程规划与经济决策能力。 |
| GRPO | 一种强化学习后训练方法,通过组相对策略优化来提升语言模型在特定任务上的表现。 |
| 奖励黑客(Reward Hacks) | 智能体利用奖励函数漏洞获取高分而非真正完成任务的行为,StoreBench 对此进行了加固。 |
| 窗口化操作预算(Windowed Operation Budget) | 一种约束机制,使模拟时间仅随智能体采取的行动推进,从而避免模型推理延迟影响模拟进程。 |
| 脚本化智能分诊策略(Scripted Smart-Triage Policy) | 作为基准锚定的人类编写启发式策略,用于校准通过阈值并衡量模型表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅