这篇综述将大语言模型处理复杂问题(CPS)重新界定为潜在解空间上的序贯估计与决策问题:控制器维护对未观测解题轨迹的信念,随噪声中间证据更新,并决定提交、验证、分支、回滚或弃权。作者据此把现有方法归纳为显式状态表示、转移结构化、验证与约束、搜索与回滚、不确定性管理五个组件,并按所估计的统计量重新解读评估指标。框架提出“控制匹配”诊断假设:干预应针对失败所涉及的具体误差或不确定性成分,否则即为控制错配——例如增加采样只能降低采样波动,却无法消除共享的系统性偏差。文章区分系统误差、随机误差与不可约误差及认知与偶然不确定性,指出可靠验证、定向恢复、校准不确定性与预算匹配评估是核心开放问题。
| 复杂问题求解 (CPS) | 指需要多步推理和决策的复杂任务求解过程。 |
| 序贯估计与决策 | 在不确定环境下,根据逐步到达的证据更新信念并做出决策的过程。 |
| 控制匹配/失配 | 干预措施与失败所涉及的误差或不确定性组件之间的对齐或不对齐。 |
| 认知不确定性 | 由于知识缺乏导致的不确定性,可通过更多信息减少。 |
| 偶然不确定性 | 数据本身固有的随机性导致的不确定性,无法通过更多信息消除。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅