🔥 今日值得一读 通用决策模型大翻车:11257个实例实测,概率高估严重,长任务成功率暴跌!
General Decision Models: Benchmarking and Insights Beyond Jev
arXiv CL (cs.CL) 🔥 重点 #评测基准#决策模型#LLM对比 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
需要结构化判断选型的开发者可用JEVal对比通用决策模型与LLM,判断何时用轻量决策模型替代大模型。

📖 AI 总结

该研究针对通用决策模型(如Jev)作为大语言模型高效替代方案的可靠性边界展开系统评估,构建了名为JEVal的双语基准,涵盖10个应用领域、36个数据集共11257个实例,并测试了25种模型配置。核心发现有三:其一,决策模型在证据充分时表现最具竞争力,但面对专业知识和不确定性估计时明显减弱,常能识别最可能结果却大幅高估其概率;其二,在长程多步交互系统中,快速局部决策虽缩短单步耗时,却因误差累积导致任务成功率下降;其三,在大规模社会模拟中,决策模型以显著更低的推理成本接近强生成式模型的个体预测水平,但在用户画像和聚合估计上误差与偏差更大。研究还提出InnerJev-4B与InnerJev-27B,通过推理到读出自我蒸馏将推理内化为单次首token决策,其中27B版本性能与Jev相当,典型查询响应约0.1秒。

🔑 关键词速览

General Decision Models通用决策模型,一类面向结构化判断与选择任务的高效模型,被视为大语言模型的替代方案。
JEVal本文提出的双语基准,覆盖 10 个应用领域、36 个数据集,共 11,257 个实例,用于评估决策模型。
τ-bench一个用于评估长时程、多步交互任务的基准,本文用它分析局部快速决策在系统层面的可靠性问题。
Reasoning-to-Readout Self-Distillation推理到读出自我蒸馏,一种将大语言模型自身的推理过程内化到单次前向首 token 决策中的训练方法。
InnerJev本文提出的决策模型系列(InnerJev-4B 和 InnerJev-27B),通过自我蒸馏实现快速单次决策。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅