本文提出 CityPlanner,一个面向可执行城市规划的沙箱智能体框架。针对城市规划这一需在成本与服务质量等实际目标下、从庞大候选空间中筛选可行方案的空间优化问题,作者指出既有优化与强化学习方法虽在固定建模下有效,却往往依赖特定任务的表示与约束处理方式。为此,CityPlanner 引入 UrbanSandbox,一个统一的基于文件的环境,智能体可查看任务文件、生成方案、运行评估器,并依据可执行反馈修正决策。为使学习可行,作者进一步提出原子任务强化学习,将较长的沙箱轨迹分解为负责初始构建的 BuildPlan 与负责反馈式改进的 ImprovePlan。在真实基准上的实验表明,CityPlanner 持续优于启发式方法、任务专用强化学习以及通用大模型智能体基线,消融实验也验证了 UrbanSandbox、原子任务强化学习与迭代部署各自的贡献。该工作为城市规划提供了一种可执行、可反馈迭代的智能体范式,并公开了代码与数据集。
| CityPlanner | 一种用于可执行城市规划的沙盒智能体框架,通过文件环境与评估反馈迭代生成规划方案。 |
| UrbanSandbox | 一个统一的基于文件的环境,智能体在其中检查任务、生成规划、运行评估并基于反馈修改决策。 |
| 原子任务强化学习 | 将长轨迹分解为初始构建(BuildPlan)和反馈细化(ImprovePlan)两个原子任务进行强化学习的方法。 |
| BuildPlan | 原子任务强化学习中的初始构建阶段,负责生成初步的城市规划方案。 |
| ImprovePlan | 原子任务强化学习中的反馈细化阶段,基于评估反馈对规划方案进行迭代改进。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅