国内刊号:11-2179/TH
国际刊号:0254-3087
发布日期:
作者:赵树恩,袁亮,赵东宇
单位:赵树恩,重庆交通大学机电与车辆工程学院重庆400074,zse0916@163.com,袁亮,重庆交通大学机电与车辆工程学院重庆400074,,赵东宇,四川大学计算机学院成都610065,zdy19981636965@163.com,
关键词:自动驾驶;场景语义补全;图像描述;场景语义理解
基金:国家自然科学基金项目(52072054)、重庆市自然科学基金创新发展联合基金项目(CSTB2024NSCQ-LZX0105)、重庆交通大学自然科学类揭榜挂帅项目(XJ2023)资助
针对自动驾驶复杂交通场景精准感知与理解过程中路侧设施及交通参与者二维视觉图像几何特征信息不全、场景语义信息缺乏等问题,构建一种基于要素信息补全的自动驾驶复杂场景语义理解模型。首先,运用稠密连接网络(DenseNet)提取视觉图像多尺度二维特征,通过特征视线投影模块(FLoSP)将体素逆向映射至三维空间,采用维度分解残差(DDR)模块构建3DUNet,提取场景目标三维特征,实现单帧视觉图像二维特征向三维特征的转换,再在3DUNet编码器与解码器之间引入三维上下文先验层(3DCRP),并通过空洞空间金字塔池化(ASPP)与Softmax层输出场景语义补全结果,以增强语义补全模型的空间语义理解能力。同时,运用图像描述生成技术,构建基于改进VGG-16编码器和长短时记忆网络(LSTM)解码器的上下文语义嵌入场景理解语言描述模型,其中改进VGG-16编码器将不同尺度的交通场景特征进行融合与拼接,并通过投影矩阵输入到LSTM解码器,建立场景目标图像与谓词关系的语义表示,进而自动生成目标检测结果及自动驾驶决策规划建议自然语言描述。最后,运用SemanticKITTI数据集及实车实验,对所提出的复杂场景语义理解算法进行验证。结果表明,该算法相较于JS3C-Net算法平均交并比(mIoU)相对提升了11.27%,通过语义补全实现了自动驾驶复杂场景的准确感知与语义理解,为自动驾驶决策规划提供可靠依据。
来源:2025年第4期
《仪器仪表学报》期刊编辑部