本文提出EVOKE,一种面向大语言模型智能体的后训练方法,旨在提升其在未见环境中的决策迁移能力。作者指出,大语言模型在预训练阶段已内化大量世界知识,真正的瓶颈不在于获取知识,而在于如何激发这些知识用于决策;传统后训练因每个状态仅受单一目标监督,容易使策略依赖表层上下文习惯。EVOKE通过在固定环境状态与交互历史下引入目标多样性,对同一组候选动作在不同目标下重新排序,迫使动作偏好随目标变化,从而隐式调用预训练世界知识。研究在三种模型骨干和多种任务上验证了该方法,结果显示任务表现、未见环境泛化能力和数据效率均有提升,并通过受控实验分析了增益来源,为可迁移决策提供了新思路。
| EVOKE | 一种后训练方法,通过在固定状态下引入目标多样性来迫使策略改变动作偏好,从而隐式引出预训练世界知识。 |
| 世界模型(World Model) | 智能体内部关于环境动态的预测模型,能够根据当前状态和动作预测未来观测。 |
| 后训练(Post-training) | 在预训练之后对模型进行的进一步训练,通常用于特定任务或目标的微调。 |
| 可迁移决策(Transferable Decision-Making) | 智能体将在一个环境中学习到的决策能力应用到未见过的环境中的能力。 |
| 动作偏好(Action Preferences) | 策略在不同状态下对候选动作的排序倾向,反映了智能体的决策倾向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅