东北石油大学计算机与信息技术学院,黑龙江 大庆 163318
针对目前基于点云的三维目标检测算法中小目标检测效果差的问题,提出了基于改进PointPillars模型的三维目标检测方法。首先,改进了PointPillars模型中的pillar特征网络,提出了一个新的pillar编码模块,在编码网络中引入了平均池化和注意力池化,充分考虑了每个pillar模块的局部详细几何信息,提高了每个pillar模块的特征表示能力,从而提升了模型的小目标检测性能。其次,基于ConvNeXt改进了骨干网络中的二维卷积下采样模块,使模型在网络特征提取阶段能够提取丰富的上下文语义信息和全局特征,从而增强了算法的特征提取能力。在公开数据集KITTI上进行验证,实验结果表明,所提方法具有更高的检测精度,相较于原网络,改进后的算法的平均检测精度提升了3.63个百分点,证明了该方法的有效性。
三维目标检测 PointPillars 小目标检测 注意力池化 ConvNeXt 激光与光电子学进展
2024, 61(8): 0812007
1 广西大学电气工程学院,广西 南宁 530004
2 广西大学先进测控与智能电力研究中心,广西 南宁 530004
现有的U-Net虽然为遥感图像道路提取提供了较为理想的解决方案,但由于其缺乏对全局信息的关注,模型对于上下文信息的提取能力不足。为了进一步提高道路提取的准确度与完整度,提出一种结合上下文信息与多层特征融合的context&multilayer features-UNet(CMF-UNet),该模型利用金字塔特征聚合模块融合多层特征,并引入多尺度上下文信息提取模块用于加强上下文信息捕获能力。在Massachusetts Roads和CHN6-CUG两个数据集上进行实验验证,结果表明,所提方法能够有效提升道路分割精度,相较于原U-Net,CMF-UNet在Massachusetts Roads数据集上的召回率、F1 分数和交并比分别提升了5.77个百分点、2.02个百分点和2.62个百分点,在CHN6-CUG数据集上的召回率、F1分数和交并比分别提升6.47个百分点、1.53个百分点和2.04个百分点。
图像处理 U-Net模型 多尺度上下文 注意力机制 条带池化 激光与光电子学进展
2024, 61(4): 0428007
武汉工程大学智能机器人湖北省重点实验室, 武汉 430000
针对遥感地物图像具有背景复杂且种类众多的特点, 利用传统算法进行分割会导致边缘模糊、信息丢失及分割精度低的问题, 提出了一种基于改进DeepLabV3+网络的语义分割算法。首先, 在主干网络中引入改进后的特征提取网络CHRNet; 其次, 使用非下采样轮廓波变换(NSCT)算法重构空洞空间金字塔池化(ASPP)模块中的全局池化操作; 最后, 在模型编码和解码阶段添加无参数的注意力机制SimAM, 加强模块间的特征传递, 提高特征利用率。实验表明, 在PASCAL VOC2012和WHDLD数据集上, 改进算法的平均交并比(MIoU)分别达到了81.56%和64.2%, 较原有算法分别提升了约4.61和2.8个百分点, 改进算法在保证分割速率的同时, 提升了分割精度。
遥感图像 非下采样轮廓波变换 空洞空间金字塔池化 注意力机制 remote sensing image DeepLabV3+ DeepLabV3+ Non-Subsampled Contourlet Transform Atrous Spatial Pyramid Pooling attention mechanism
1 太原工业学院电子工程系, 山西太原 030008
2 长春理工大学电子信息工程学院, 吉林长春 130022
3 长春理工大学电子信息工程学院, 吉林长春 130022教育部学科创新引智基地(D17017), 吉林长春 130022
针对复杂任务场景中, 目标检测存在的多尺度特征学习能力不足、检测精度与模型参数量难以平衡的问题, 提出一种基于 CSE-YOLOv5(CBAM-SPPF-EIoU-YOLOv5, CSE-YOLOv5)模型的目标检测方法。模型以 YOLOv5主干网络框架为基础, 在浅层引入卷积块注意力机制层, 以提高模型细化特征提取能力并抑制冗余信息干扰。在深层设计了串行结构空间金字塔快速池化层, 改进了统计池化方法, 实现了由浅入深地融合多尺度关键特征信息。此外, 通过改进损失函数与优化锚框机制, 进一步增强多尺度特征学习能力。实验结果显示, CSE-YOLOv5系列模型在公开数据集 RSOD、DIOR和 DOTA上表现出良好的性能。 mAP@0.5的平均值分别为 96.8%、92.0%和 71.0%, 而 mAP@0.5:0.95的平均值分别为 87.0%、78.5%和 61.9%。此外, 该模型的推理速度满足实时性要求。与 YOLOv5系列模型相比, CSE-YOLOv5模型的性能显著提升, 并且在与其他主流模型的比较中展现出更好的检测效果。
遥感图像 目标检测 注意力机制 金字塔快速池化 多尺度目标 remote sensing images, target detection, attention
1 天津大学微电子学院,天津 300072
2 天津大学智能与计算学部,天津 300072
3 天津市成像与感知微电子技术重点实验室,天津 300072
针对无人机航摄图像中目标尺寸差异大导致的感受野难以同时兼顾不同尺寸物体分割效果的问题,提出了利用两路分支分别提取浅层和深层信息的双路特征融合网络(DSFA-Net)。在编码器中,浅层分支利用三个串行ConvNeXt模块提取高通道数的浅层特征以保留更多空间细节;深层分支利用坐标注意力空洞空间金字塔池化(CA-ASPP)模块为特征图重新分配权重,使网络更加关注尺寸各异的分割目标,获得深层多尺度特征。在解码过程中,网络利用双边引导融合模块为两层特征建立通信以进行分辨率融合,提高层级特征的利用率。所提方法在AeroScapes和Semantic Drone航摄图像数据集上进行了实验,其平均交并比分别达到83.16%和72.09%、平均像素准确率分别达到90.75%和80.34%。与主流的语义分割方法相比,所提方法对于具有较大尺寸差异的目标,分割能力更强,更适用于无人机航摄图像场景下的语义分割任务。
语义分割 特征融合 双路网络 坐标注意力空洞空间金字塔池化 多尺度特征提取 激光与光电子学进展
2023, 60(24): 2428005
1 南京信息工程大学电子与信息工程学院,江苏 南京 210044
2 南京信息工程大学江苏省大气环境与装备技术协同创新中心,江苏 南京 210044
地铁场景行人目标存在大小不一、不同程度遮挡以及环境过暗导致目标模糊等问题,很大程度影响了行人目标检测的准确性。针对上述问题,本研究提出了一种改进YOLOv5s目标检测算法以增强地铁场景行人目标检测的效果。构建地铁场景行人数据集,标注对应标签,进行数据预处理操作。本研究在特征提取模块中加入深度残差收缩网络,将残差网络、注意力机制和软阈值化函数相结合以增强有用特征信道,削弱冗余特征信道;利用改进空洞空间金字塔池化模块,在不丢失图像信息的前提下获得多尺度、多感受野的融合特征,有效捕获图像全局上下文信息;设计了一种改进非极大值抑制算法,对目标预测框进行后处理,保留检测目标最优预测框。实验结果表明:提出的改进YOLOv5s算法能有效提高地铁场景行人目标检测的精度,尤其对小行人目标和密集行人目标的检测,效果提升更为显著。
行人目标检测 YOLOv5s 注意力机制 改进空洞空间金字塔池化 激光与光电子学进展
2023, 60(6): 0610013