本文研究一个开放性问题:LLM智能体能否在未知下游任务分布的情况下,仅凭对陌生环境的自主探索,提前构建可复用的准备资源。作者将这一设定形式化为“任务无关的环境预处理”,即研究系统在给定预算下探索环境,为固定的求解器生成索引、脚本或程序性指导等工件,且不依赖任务示例、轨迹或评估反馈。研究在六个异构基准上比较了无辅助与配备档案的元智能体、固定合成练习及语料处理方法。结果显示,元智能体变体在五个基准上取得最高的Avg@3奖励,而固定语料处理在最大语料基准上仍表现最佳;更大的研究预算并未稳定提升下游奖励。但研究产出的工件能减少达到特定分数所需的测试时采样次数,表明可复用的准备工作可将计算从反复的测试时尝试转移到任务前的研究阶段。
| 任务无关环境预处理 | 在不知道下游任务分布的情况下,智能体预先探索环境并生成可复用资源的过程。 |
| 元智能体 | 一种能够自主决定如何准备环境的智能体,通常配备存档以辅助决策。 |
| Avg@3 | 一种评估指标,表示在三次独立运行中获得的平均奖励。 |
| 冻结求解器 | 在预处理阶段后固定不变的任务求解器,用于评估预处理生成工件的效果。 |
| 研究预算 | 智能体在预处理阶段可用于探索环境的有限资源(如时间或计算量)。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅