该研究针对通用决策模型(如Jev)作为大语言模型高效替代方案的可靠性边界展开系统评估,构建了名为JEVal的双语基准,涵盖10个应用领域、36个数据集共11257个实例,并测试了25种模型配置。核心发现有三:其一,决策模型在证据充分时表现最具竞争力,但面对专业知识和不确定性估计时明显减弱,常能识别最可能结果却大幅高估其概率;其二,在长程多步交互系统中,快速局部决策虽缩短单步耗时,却因误差累积导致任务成功率下降;其三,在大规模社会模拟中,决策模型以显著更低的推理成本接近强生成式模型的个体预测水平,但在用户画像和聚合估计上误差与偏差更大。研究还提出InnerJev-4B与InnerJev-27B,通过推理到读出自我蒸馏将推理内化为单次首token决策,其中27B版本性能与Jev相当,典型查询响应约0.1秒。
| General Decision Models | 通用决策模型,一类面向结构化判断与选择任务的高效模型,被视为大语言模型的替代方案。 |
| JEVal | 本文提出的双语基准,覆盖 10 个应用领域、36 个数据集,共 11,257 个实例,用于评估决策模型。 |
| τ-bench | 一个用于评估长时程、多步交互任务的基准,本文用它分析局部快速决策在系统层面的可靠性问题。 |
| Reasoning-to-Readout Self-Distillation | 推理到读出自我蒸馏,一种将大语言模型自身的推理过程内化到单次前向首 token 决策中的训练方法。 |
| InnerJev | 本文提出的决策模型系列(InnerJev-4B 和 InnerJev-27B),通过自我蒸馏实现快速单次决策。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅