本发明涉及计算机视觉,特别是涉及一种三维目标检测方法、装置及系统。
背景技术:
1、自动驾驶技术的迅速发展,标志着交通和运输领域的一次革命性转变。随着传感器技术、人工智能和实时数据处理能力的进步,自动驾驶系统已经从实验室阶段逐步走向现实应用。在当前场景中,自动驾驶技术不仅仅意味着更安全的道路、更高效的交通流动,它还能够显著减少交通事故、改善城市空气质量,并为人们带来更便捷的出行体验。工程师们在设计和优化自动驾驶系统时需要考虑诸多因素,如传感器精度、环境感知能力、决策算法的可靠性、系统安全性及法律法规等,以确保其稳定性和可信度。因此,自动驾驶技术的推广将为社会带来深远的影响,也会促进交通系统的现代化和智能化发展,成为未来可持续城市生活的重要组成部分。
2、自动驾驶中最关键的感知系统是指通过传感器和算法来感知和理解周围环境的能力。这些系统通常包括雷达、摄像头、激光雷达和超声波传感器等多种技术,用于实时获取和分析道路、障碍物、行人和其他车辆的信息。感知系统的发展经历了从单一传感器到多传感器融合的进程。随着传感器技术的进步和成本的下降,自动驾驶车辆可以更精确地感知和理解复杂的交通场景。从传统的机械雷达到现代的高分辨率摄像头和先进的深度学习算法,感知系统的能力不断提升,使得自动驾驶车辆能够在不同的天气条件和路况下安全地操作。感知系统在自动驾驶中的意义重大。它们不仅帮助车辆实时监测和识别周围环境中的各种动态和静态物体,还能够预测其他交通参与者的行为,从而做出适时的驾驶决策。这种高精度的环境感知是自动驾驶车辆安全性和可靠性的基石,能够大大减少交通事故的发生率,并提升交通系统的效率和流畅度。感知系统的作用不仅仅局限于传感器的安装和数据的获取,它们还通过实时数据处理和高级算法分析,为车辆提供了高度自主的驾驶能力。这种自主能力使得自动驾驶车辆可以在复杂的城市环境和高速公路上安全驾驶,为乘客和行人创造更加安全和便利的出行体验。
3、目前,自动驾驶领域的3d对象检测面临着利用变压器模型进行特征提取和长距离关系建模方面的关键挑战。传统方法尝试通过局部自注意力机制(如基于柱体或体素的分割)来处理点云数据,以促进特征之间的交互。然而,由于计算资源限制,这些方法通常仅能处理小规模的特征组,未能有效利用变压器模型在处理全局长距离依赖关系上的潜力。具体而言,当前的研究尚未解决如何在保持计算效率的同时,实现对复杂场景中远距离对象和结构之间关系的精确建模。长距离关系的建模需要超越局部区域的限制,涉及多个对象和结构元素之间复杂的空间和语义依赖关系。此外,建模长距离关系不仅需要大规模、多样化的数据集支持,还需要进一步优化数据表示和算法设计,以确保在各种复杂的实际场景中能够有效地实施和应用。因此,未来的研究方向将集中在如何有效整合变压器模型的优势,克服计算限制,从而在更广泛和复杂的环境中实现更精确和高效的3d对象检测和识别。
4、在自动驾驶场景感知系统中的三维目标检测方法面临着两大核心问题:首先,这些方法通常在处理长距离依赖时表现不佳,未能有效建模物体的全局上下文和复杂空间关系。传统的三维目标检测方法缺乏有效的注意力机制来处理物体之间的长距离依赖关系,这导致了在捕捉物体的远距离关系和复杂的空间结构时,性能不佳。例如,在自动驾驶中,有效地识别和跟踪远处车辆或行人对于安全驾驶至关重要,但传统方法往往无法满足这一需求。其次,这些方法在处理高计算开销时存在挑战,特别是在处理高度稀疏的点云数据时更为突出。采用注意力机制的方法虽然能够有效地提取特征之间的长距离依赖关系,但也因此需要更多的计算资源和计算开销。在处理大规模点云数据时,这种方法往往需要复杂的计算图结构和大量的计算单元,从而限制了其在实际自动驾驶系统中的应用和部署效率。综上所述,未来的研究需要在克服长距离依赖建模能力不足和高计算开销的基础上,进一步优化和创新三维目标检测方法,以提升自动驾驶系统在复杂环境下的感知和决策能力。
5、对于体素划分方法目前存在的问题,首先是在划分过程中缺乏对体素高度信息的有效利用,这导致在处理立体场景时信息的完整性和准确性受到限制。其次,部分方法在支持大组内体素划分时,可能会导致单个组内体素数量过多,从而影响计算效率和模型的处理能力。此外,使用稀疏卷积进行上采样和下采样操作时,由于点云的稀疏性,会产生较大的计算开销,限制了网络的实时性和部署效率。相比之下,目前基于稀疏卷积的网络在直接提取通用特征方面存在挑战,难以有效捕获点云中的复杂结构和局部特征。
6、有鉴于此,如何克服现有技术所存在的缺陷,解决上述技术问题中的至少一部分问题,是本技术领域待解决的难题。
技术实现思路
1、针对现有技术中的缺陷或改进需求,为了解决当前在点云数据处理中存在的稀疏卷积计算开销大的问题。本发明提供一种三维目标检测方法、装置及系统,基于窗口划分和线性分组循环神经网络,通过引入体素合并和扩散技术,有效降低了稀疏卷积操作的计算开销和资源消耗,提升了模型的计算效率和实时性。此外,通过引入三维描述子,能够精确提取局部三维体素特征;通过体素生成技术,利用自回归方法扩展体素特征,进一步增强了对复杂场景的特征表征能力。与传统方法相比,本发明在三维目标检测任务中表现出更优异的性能,为进一步推动该领域的研究和应用提供了新的理论和技术支持。
2、本发明采用如下技术方案:
3、第一方面,本发明提供了一种三维目标检测方法,包括:
4、将初始三维体素特征按照基于窗口的三维体素划分方式进行划分,得到第一阶段的三维体素特征;
5、将第一阶段的三维体素特征通过三维描述子进行局部的特征提取,得到第二阶段的三维体素特征;
6、将第二阶段的三维体素特征通过扩散和合并来进行特征生成,得到第三阶段的三维体素特征;
7、将第三阶段的三维体素特征经过基于窗口划分和线性分组循环神经网络的骨干网络进行特征提取,得到第四阶段的三维体素特征;
8、将第四阶段的三维体素特征通过鸟瞰图骨干网络和检测头进行处理,得到最终的检测结果。
9、在一些实施例中,所述将初始三维体素特征按照基于窗口的三维体素划分方式进行划分,得到第一阶段的三维体素特征具体包括:
10、将输入的点云进行体素化得到初始三维体素特征;
11、按照初始三维体素特征的空间形状划分三维空间为不重叠的窗口,对每个窗口内的三维体素特征,采用x轴优先和y轴优先两种不同的排序方式,以获得不同的体素特征排序顺序;
12、对排序的体素特征进行分组,即将排序的体素特征进行等额数目划分,不足等额数目的采用特征补零方式进行填充,从而得到第一阶段的三维体素特征。
13、在一些实施例中,所述三维描述子包括依次设置的一个三维子流形稀疏卷积、一个层标准化以及一个激活函数。
14、在一些实施例中,所述将第二阶段的三维体素特征通过扩散和合并来进行特征生成,得到第三阶段的三维体素特征具体包括:
15、获取第二阶段的三维体素特征中高响应特征的坐标;
16、将高响应特征的坐标扩散到相邻坐标,同时将扩散得到的坐标的特征赋零值;将扩散得到的新特征和新坐标合并到第二阶段的三维体素特征的特征和坐标上,得到体素生成后的第三阶段的三维体素特征。
17、在一些实施例中,所述将第三阶段的三维体素特征经过基于窗口划分和线性分组循环神经网络的骨干网络进行特征提取,得到第四阶段的三维体素特征具体包括:
18、根据第三阶段的三维体素特征的坐标生成绝对位置编码,将绝对位置编码加到第三阶段的三维体素特征上,得到第一中间阶段的三维体素特征;
19、将第一中间阶段的三维体素特征通过基于线性分组循环神经网络的层进行序列化建模,每个线性分组循环神经网络的网络层包括不同方向上的双向循环神经网络,将序列化建模的三维体素特征通过体素合并进行下采样;重复序列化建模和下采样操作两次,得到第二中间阶段的三维体素特征;
20、将第二中间阶段的三维体素特征通过体素扩展并进行上采样得到对应分辨率的体素特征,将下采样前的特征通过跳跃连接加回得到新的特征,将新的特征通过基于线性分组循环神经网络的层进行特征建模,重复上采样和特征建模操作两次,得到第四阶段的三维体素特征。
21、在一些实施例中,所述将第四阶段的三维体素特征通过鸟瞰图骨干网络和检测头进行处理,得到最终的检测结果具体包括:
22、将第四阶段的三维体素特征通过鸟瞰图骨干网络转换为鸟瞰图视角特征;
23、将鸟瞰图视角特征通过检测头模块进行目标检测,得到最终的检测结果。
24、在一些实施例中,所述检测头模块首先预测每个体素或像素位置是否包含目标中心点,输出一个置信度分数来表征目标中心点的存在与否;对于被预测为含有目标中心点的位置,所述检测头模块进一步预测目标的边界框位置和尺寸,通过回归模型调整框的位置,拟合目标的真实边界框,得到最终的检测结果。
25、第二方面,本发明还提供了一种三维目标检测装置,用于实现第一方面所述的三维目标检测方法,所述装置包括:
26、至少一个处理器;以及,与所述至少一个处理器通信连接的存储器;其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述处理器执行,用于执行第一方面所述的三维目标检测方法。
27、第三方面,本发明还提供了一种三维目标检测系统,应用如第一方面所述的三维目标检测方法,所述系统包括第一阶段模块、第二阶段模块、第三阶段模块、第四阶段模块以及最终检测结果获取模块,其中:
28、所述第一阶段模块用于:将初始三维体素特征按照基于窗口的三维体素划分方式进行划分,得到第一阶段的三维体素特征;
29、所述第二阶段模块用于:将第一阶段的三维体素特征通过三维描述子进行局部的特征提取,得到第二阶段的三维体素特征;
30、所述第三阶段模块用于:将第二阶段的三维体素特征通过扩散和合并来进行特征生成,得到第三阶段的三维体素特征;
31、所述第四阶段模块用于:将第三阶段的三维体素特征经过基于窗口划分和线性分组循环神经网络的骨干网络进行特征提取,得到第四阶段的三维体素特征;
32、所述最终检测结果获取模块用于:将第四阶段的三维体素特征通过鸟瞰图骨干网络和检测头进行处理,得到最终的检测结果。
33、第四方面,本发明还提供了一种非易失性计算机存储介质,所述计算机存储介质存储有计算机可执行指令,该计算机可执行指令被一个或多个处理器执行,用于完成第一方面所述的三维目标检测方法。
34、与现有技术相比,本发明的有益效果在于:提供一种三维目标检测方法、装置及系统,基于窗口划分和线性分组循环神经网络,通过引入体素合并和扩散技术,有效降低了稀疏卷积操作的计算开销和资源消耗,提升了模型的计算效率和实时性。此外,通过引入三维描述子,能够精确提取局部三维体素特征;通过体素生成技术,利用自回归方法扩展体素特征,进一步增强了对复杂场景的特征表征能力。与传统方法相比,本发明在三维目标检测任务中表现出更优异的性能,为进一步推动该领域的研究和应用提供了新的理论和技术支持。
1.一种三维目标检测方法,其特征在于,包括:
2.根据权利要求1所述的三维目标检测方法,其特征在于,所述将初始三维体素特征按照基于窗口的三维体素划分方式进行划分,得到第一阶段的三维体素特征具体包括:
3.根据权利要求1所述的三维目标检测方法,其特征在于,所述三维描述子包括依次设置的一个三维子流形稀疏卷积、一个层标准化以及一个激活函数。
4.根据权利要求1所述的三维目标检测方法,其特征在于,所述将第二阶段的三维体素特征通过扩散和合并来进行特征生成,得到第三阶段的三维体素特征具体包括:
5.根据权利要求1所述的三维目标检测方法,其特征在于,所述将第三阶段的三维体素特征经过基于窗口划分和线性分组循环神经网络的骨干网络进行特征提取,得到第四阶段的三维体素特征具体包括:
6.根据权利要求1所述的三维目标检测方法,其特征在于,所述将第四阶段的三维体素特征通过鸟瞰图骨干网络和检测头进行处理,得到最终的检测结果具体包括:
7.根据权利要求6所述的三维目标检测方法,其特征在于,所述检测头模块首先预测每个体素或像素位置是否包含目标中心点,输出一个置信度分数来表征目标中心点的存在与否;对于被预测为含有目标中心点的位置,所述检测头模块进一步预测目标的边界框位置和尺寸,通过回归模型调整框的位置,拟合目标的真实边界框,得到最终的检测结果。
8.一种三维目标检测装置,用于实现如权利要求1-7任一所述的三维目标检测方法,其特征在于,所述装置包括:
9.一种三维目标检测系统,应用如权利要求1-7任一所述的三维目标检测方法,其特征在于,所述系统包括第一阶段模块、第二阶段模块、第三阶段模块、第四阶段模块以及最终检测结果获取模块,其中:
10.一种非易失性计算机存储介质,其特征在于,所述计算机存储介质存储有计算机可执行指令,该计算机可执行指令被一个或多个处理器执行,用于完成如权利要求1-7任一所述的三维目标检测方法。
