本文提出了一种面向自动驾驶安全离线强化学习的风险感知分层扩散框架DiDrive。研究针对扩散模型在捕捉多模态行为先验时面临的分布偏移、重尾风险信号、分布外动作生成及高维状态冗余等挑战,设计了两个协同组件:风险感知分层扩散架构(RHDif)和3DICE策略优化范式。RHDif通过低层风险门控编码器和高层情境调制器过滤环境冗余信息,聚焦安全关键威胁;3DICE则通过样本内校准引导、时空优化和集成候选排序,缓解分布外过估计与梯度振荡问题。在CARLA基准测试中,DiDrive在60辆车的复杂高密度交通场景下表现优于IQL、CQL和Diffusion-QL等基线方法,实现了85%的成功率和4295.68的平均奖励,为安全自动驾驶决策提供了稳健的技术路径。
| DiDrive | 本文提出的分布引导的离线扩散框架,用于安全自动驾驶决策。 |
| Risk-Aware Hierarchical Diffusion (RHDif) | 风险感知分层扩散架构,通过低级风险门控编码器和高级上下文调制器处理状态空间。 |
| 3DICE | 一种策略优化范式,通过样本内校准、时空优化和集成排序缓解OOD问题。 |
| Offline Reinforcement Learning | 离线强化学习,从静态数据集中学习策略,不与环境交互。 |
| Out-of-Distribution (OOD) | 分布外,指模型遇到与训练数据分布不同的输入或动作。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅