本文提出TrajFusionNet+,一种基于Transformer的行人过街意图预测模型,旨在从自动驾驶车辆视角判断行人横穿道路的可能性。该模型在原有TrajFusionNet基础上扩展,融合三类信息:序列注意力模块处理行人历史与预测轨迹的时序表示,视觉注意力模块将观测及预测边界框叠加于场景图像以获取视觉表示,图注意力模块则从分割场景中提取以行人为中心的图结构,捕捉行人与交通要素间的关联依赖。在PIE和JAAD两个主流数据集上,TrajFusionNet+取得了优于现有方法的性能。作者还提出一种新的评估协议,将两数据集联合训练后分别测试,结果显示该模型在此设定下泛化能力更强。该工作已投稿至Signal, Image and Video Processing。
| TrajFusionNet+ | 本文提出的基于 Transformer 的行人过街意图预测模型,融合轨迹序列、视觉与场景图三种表示。 |
| 行人过街意图预测 | 从自动驾驶车辆视角判断行人是否可能横穿马路的一项任务。 |
| 序列注意力模块(SAM) | 处理行人过去与预测轨迹序列表示的注意力模块。 |
| 视觉注意力模块(VAM) | 通过将观测和预测边界框叠加到场景图像上来利用轨迹视觉表示的模块。 |
| 图注意力模块(GAM) | 从分割场景图像中提取以行人为中心的图,并捕捉行人与交通元素关系依赖的模块。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅