本文提出一种复合梯度学习(CGL)方法,用于改进深度强化学习(DRL)与模型预测控制(MPC)共享控制权限的集成框架。传统方法通常将MPC视为环境的一部分,未显式考虑MPC对控制输入的贡献及其与DRL智能体的交互。CGL通过将DRL和MPC的控制输入表示为联合动作,并在训练中纳入二者的交互来更新DRL智能体。作者在两个多类高速公路交通网络上进行验证,涵盖DRL与MPC控制输入交互强度不同的场景,并与将MPC视为环境或仅部分纳入学习过程的替代方法进行比较。结果表明,在弱交互条件下CGL收益有限;在强交互条件下,CGL在部分训练运行中学习到性能更优的控制策略,但平均控制性能提升幅度仍较为有限。
| 深度强化学习 (DRL) | 一种通过与环境交互来学习最优控制策略的机器学习方法,使用深度神经网络作为函数逼近器。 |
| 模型预测控制 (MPC) | 一种基于系统模型进行滚动时域优化,并显式处理约束的先进控制方法。 |
| 共享控制权限 | 在控制系统中,由多个控制器(如 DRL 和 MPC)共同决定控制输入,各自负责一部分控制权限的架构。 |
| 复合梯度学习 (CGL) | 本文提出的方法,将 MPC 控制器集成到 DRL 的学习过程中,通过联合动作表示和交互梯度更新来训练智能体。 |
| 多类高速公路交通网络 | 包含多种车辆类型或驾驶行为的高速公路交通仿真环境,用于评估控制方法的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅