该研究提出了Sim2Signal基准框架,用于系统评估交通信号控制中强化学习策略的模拟到现实迁移问题。作者将Sim-to-Real差距分解为观测、动作、转移和奖励四种缺口,对应马尔可夫决策过程的四个组成部分,并在统一协议下独立诱导每种缺口。研究在10个基于真实地点构建的校准网络上,对18种缓解方法、2种基础控制器和33种缺口设置进行了全面评估。结果表明,直接迁移在所有四种缺口下均导致性能下降,但下降严重程度并不能预测缓解方法的有效性;缓解效果高度依赖具体网络和缺口场景,在动作缺口之外,某种方法在一种情境下有效,在另一种情境下可能失效。最有效的方法通常是估计缺口带来的具体变化,而非通过域随机化或不变表示使策略变得不敏感。该基准为交通信号控制领域的Sim-to-Real研究提供了标准化评估工具。
| Sim-to-Real gap | 仿真环境与真实世界之间的差异,导致在仿真中训练的策略在现实中表现不佳。 |
| Reinforcement learning (RL) | 一种机器学习方法,通过与环境交互试错来学习最优策略。 |
| Markov decision process (MDP) | 用于建模序贯决策问题的数学框架,包含状态、动作、转移概率和奖励。 |
| Domain randomization | 一种通过随机化仿真环境参数来提高策略泛化能力的技术。 |
| Invariant representations | 学习对环境变化不敏感的特征表示,以提高策略的鲁棒性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅