仿真里称王,上路就翻车?33种差距测试揭示交通信号AI的致命短板!
Sim2Signal: Sim-to-Real Benchmarks for Traffic Signal Control
arXiv LG (cs.LG) 重要 #强化学习#评测基准#智能交通 🕐 09-03 12:00

📖 AI 总结

该研究提出了Sim2Signal基准框架,用于系统评估交通信号控制中强化学习策略的模拟到现实迁移问题。作者将Sim-to-Real差距分解为观测、动作、转移和奖励四种缺口,对应马尔可夫决策过程的四个组成部分,并在统一协议下独立诱导每种缺口。研究在10个基于真实地点构建的校准网络上,对18种缓解方法、2种基础控制器和33种缺口设置进行了全面评估。结果表明,直接迁移在所有四种缺口下均导致性能下降,但下降严重程度并不能预测缓解方法的有效性;缓解效果高度依赖具体网络和缺口场景,在动作缺口之外,某种方法在一种情境下有效,在另一种情境下可能失效。最有效的方法通常是估计缺口带来的具体变化,而非通过域随机化或不变表示使策略变得不敏感。该基准为交通信号控制领域的Sim-to-Real研究提供了标准化评估工具。

🔑 关键词速览

Sim-to-Real gap仿真环境与真实世界之间的差异,导致在仿真中训练的策略在现实中表现不佳。
Reinforcement learning (RL)一种机器学习方法,通过与环境交互试错来学习最优策略。
Markov decision process (MDP)用于建模序贯决策问题的数学框架,包含状态、动作、转移概率和奖励。
Domain randomization一种通过随机化仿真环境参数来提高策略泛化能力的技术。
Invariant representations学习对环境变化不敏感的特征表示,以提高策略的鲁棒性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅