🔥 今日值得一读 自动驾驶新突破!DiDrive框架狂揽4295分,复杂车流成功率85%
DiDrive: A Risk-Aware Hierarchical Diffusion Framework for Safe Offline Reinforcement Learning in Autonomous Driving
arXiv LG (cs.LG) 🔥 重点 #自动驾驶#扩散模型#离线强化学习 🕐 09-03 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此框架训练自动驾驶策略,通过风险感知扩散模型减少分布偏移和OOD动作,提升安全性。

📖 AI 总结

本文提出了一种面向自动驾驶安全离线强化学习的风险感知分层扩散框架DiDrive。研究针对扩散模型在捕捉多模态行为先验时面临的分布偏移、重尾风险信号、分布外动作生成及高维状态冗余等挑战,设计了两个协同组件:风险感知分层扩散架构(RHDif)和3DICE策略优化范式。RHDif通过低层风险门控编码器和高层情境调制器过滤环境冗余信息,聚焦安全关键威胁;3DICE则通过样本内校准引导、时空优化和集成候选排序,缓解分布外过估计与梯度振荡问题。在CARLA基准测试中,DiDrive在60辆车的复杂高密度交通场景下表现优于IQL、CQL和Diffusion-QL等基线方法,实现了85%的成功率和4295.68的平均奖励,为安全自动驾驶决策提供了稳健的技术路径。

🔑 关键词速览

DiDrive本文提出的分布引导的离线扩散框架,用于安全自动驾驶决策。
Risk-Aware Hierarchical Diffusion (RHDif)风险感知分层扩散架构,通过低级风险门控编码器和高级上下文调制器处理状态空间。
3DICE一种策略优化范式,通过样本内校准、时空优化和集成排序缓解OOD问题。
Offline Reinforcement Learning离线强化学习,从静态数据集中学习策略,不与环境交互。
Out-of-Distribution (OOD)分布外,指模型遇到与训练数据分布不同的输入或动作。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅