本文提出了一种名为SIGMA的交通信号控制框架,旨在应对实时交通管理中的多目标权衡问题,包括通行效率、延误公平性、信号稳定性和紧急车辆优先权。现有强化学习方法通常固定优化目标,难以适应动态优先级变化,且在不同几何结构交叉口的泛化能力不足。SIGMA创新性地结合大语言模型,将自然语言紧急指令转化为优先级向量,驱动多目标演员-评论家控制器,避免了手动设计奖励函数的繁琐。通过旋转增强技术,模型在四向交叉口间具备更好的迁移性;离线到在线的学习策略则保证了稳定初始化与渐进适应。研究在印度加尔各答四个城市交叉口基于SUMO仿真验证,结果显示SIGMA在平均及紧急等待时间、排队长度和通行量上均优于固定配时、感应控制和DQN基线。消融实验进一步确认其对组件故障和几何旋转的鲁棒性。该工作为语言引导、多目标自适应交通控制提供了可靠方案,并引入统计可靠性保证,具有实际部署潜力。
| SIGMA | 一种对称感知、智能、几何、多目标自适应交通控制框架,结合强化学习和大语言模型。 |
| Multi-objective actor-critic controller | 多目标演员-评论家控制器,一种强化学习架构,用于同时优化多个目标(如吞吐量和紧急优先权)。 |
| Rotational augmentation | 旋转增强,一种数据增强技术,通过对输入进行旋转操作来提高模型对几何变化的泛化能力。 |
| Offline-to-online learning | 离线到在线学习,一种训练策略,先使用离线数据进行稳定初始化,再在线适应动态环境。 |
| Bootstrap statistics | 自助法统计,一种通过重采样估计统计量置信区间的方法,用于验证系统性能的可靠性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅