CN113888557B 一种基于rgb-d特征融合的场景语义分割方法及系统(山东师范大学)_第1页
CN113888557B 一种基于rgb-d特征融合的场景语义分割方法及系统(山东师范大学)_第2页
CN113888557B 一种基于rgb-d特征融合的场景语义分割方法及系统(山东师范大学)_第3页
CN113888557B 一种基于rgb-d特征融合的场景语义分割方法及系统(山东师范大学)_第4页
CN113888557B 一种基于rgb-d特征融合的场景语义分割方法及系统(山东师范大学)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

(19)国家知识产权局(12)发明专利(10)授权公告号CN113888557B(65)同一申请的已公布的文献号路88号(74)专利代理机构济南圣达知识产权代理有限公司37221专利代理师李琳semanticsegmentatio1-9页.semanticsegmentatio1-9页.审查员王亚菲(54)发明名称一种基于RGB-D特征融合的场景语义分割方法及系统(57)摘要本发明提供了一种基于RGB-D特征融合的场景语义分割方法及系统,首先获取待分割场景的同时输入场景语义分割模型中,得到场景语义分割结果;其中,场景语义分割模型的编码器分别采用RGB分支和深度分支对所述RGB图像和深度图像处理,处理过程中采用RGB-D特征融合网络进行RGB特征和深度特征的融合,得到多个低层融合特征和一个高层融合特征,以达到增强目标特征且抑制背景的目的;同时引入的特征细化网编码器编码器Luse3-Losu4.D-RGBConvl中[Layerl中[Layer?中[Layer3中[Layer4中Up4Up3解码器CN113888557B2处理后的结果分别与RGB特征与深度特征进行通道乘法之后再进行元素相所述深度分支采用深度卷积层对深度图像进行处理后输入多个依次连接的深度分支3.如权利要求2所述的一种基于RGB-D特征融合的场景语义分割方法,其特征在于,所述特征细化网络对低层融合特征先输入卷积层进行卷积操作,再输送到通道注意力层处图像获取模块,其被配置为:获取待分割场景的RGB图像和深度图像;解码器;所述高层融合特征经过上下文特征处理网络后进入解码器3同时将RGB特征、深度特征和拼接特征分别进行全局平均池化处理后送入不同的MLPMLP层输出元素相加之后的结果,经由Sigmoid函数处理;处理后的结果分别与RGB特征与深度特征进行通道乘法之后再进行元素相加,得到输7.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现如权利要求1-5中任一项所述的一种基于RGB-D特征融合的场景语义分割方法中的步骤。8.一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现如权利要求1-5中任一项所述的一种基于RGB-D特征融合的场景语义分割方法中的步骤。4技术领域[0001]本发明属于场景语义分割技术领域,尤其涉及一种基于RGB-D特征融合的场景语义分割方法及系统。背景技术[0002]本部分的陈述仅仅是提供了与本发明相关的背景技术信息,不必然构成在先技术。[0003]相比于室外场景,室内场景中的图像结构往往比较复杂,存在着光照不均匀,物体间互相遮挡,以及不同物体的颜色与结构具有较大的相似性等问题。现在大部分的语义分割方法多集中在标准室外条件下,尚未进行深入研究的室内语义分割在许多方面仍然具有挑战性。[0004]室内场景的RGB图像会大量丢失场景中的空间信息,所以普通的的图像分割方法无法对室内场景进行有效的分割。针对这种情况,研究者们选择加入深度信息提高分割效果。因为深度信息几乎不受光线变化以及物体的颜色及纹理的影响,可以为RGB图像提供对应的几何关系,可以凸显场景中物体的空间信息。这种利用深度信息的方法学习的特征更加丰富,表达能力更强,更加适合于室内这种复杂的场景。同时,Kinect等深度传感器技术也已经相当成熟,深度图像可以轻易地获取,所以可以通过研究融合RGB图像信息和深度信息的深度学习方法提高分割的精度。[0005]但是,目前的方法依然不能够解决因为场景具有背景复杂、光照不均、低征辨识力弱以及物体之间存在大量遮挡等所导致的分割精度低的问题。发明内容[0006]为了解决上述背景技术中存在的技术问题,本发明提供一种基于RGB-D特征融合的场景语义分割方法及系统,基于注意力机制构造的RGB-D特征融合网络可以对特征图进行选择加权处理以达到增强目标特征且抑制背景的目的;同时引入的特征细化网络和上下文特征处理网络可以降低语义信息损失,优化语义分割效果。[0007]为了实现上述目的,本发明采用如下技术方案:[0008]本发明的第一个方面提供一种基于RGB-D特征融合的场景语义分割方法,其包括:[0009]获取待分割场景的RGB图像和深度图像;[0010]将RGB图像和深度图像同时输入场景语义分割模型中,得到场景语义分割结果;[0011]其中,场景语义分割模型的编码器分别采用RGB分支和深度分支对所述RGB图像和深度图像处理,处理过程中采用RGB-D特征融合网络进行RGB特征和深度特征的融合,得到多个低层融合特征和一个高层融合特征。[0012]进一步的,所述RGB分支采用RGB卷积层对RGB图像进行处理后输入多个依次连接[0013]所述深度分支采用深度卷积层对深度图像进行处理后输入多个依次连接的深度5分支层。[0015]进一步的,所述RGB-D特征融合网络具体为:[0016]连接RGB特征和深度特征,得到拼接特征;[0017]同时将RGB特征、深度特征和拼接特征分别进行全局平均池化处理后送入不同的[0018]MLP层输出元素相加之后的结果,经由Sigmoid函数处理;[0019]处理后的结果分别与RGB特征与深度特征进行通道乘法之后再进行元素相加,得到输出结果。[0020]进一步的,所述多个低层融合特征经过特征细化网络处理后进入解码器;[0021]所述特征细化网络对低层融合特征先输入卷积层进行卷积操作,再输送到通道注意力层处理。[0022]进一步的,所述高层融合特征经过上下文特征处理网络后进入解码器;[0023]所述上下文特征处理网络对高层融合特征分别进行一次1×1空洞卷积操作、一次全局池化操作和多次膨胀系数不同的3×3空洞卷积操作。[0024]进一步的,所述解码器通过上采样层和RGB-D特征融合网络对多个低层融合特征和一个高层融合特征进行处理得到待分割场景的特征。[0025]本发明的第二个方面提供一种基于RGB-D特征融合的场景语义分割系统,其包括:[0026]图像获取模块,其被配置为:获取待分割场景的RGB图像和深度图像;[0027]语义分割模块,其被配置为:将RGB图像和深度图像同时输入场景语义分割模型中,得到场景语义分割结果;[0030]本发明的第四个方面提供一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现如上述所述的一种基于RGB-D特征融合的场景语义分割方法中的步骤。[0031]与现有技术相比,本发明的有益效果是:照不均、低层视觉特征辨识力弱以及物体之间存在大量遮挡的问题,能够得到相对精准的6分割结果,适用于室内场景的语义分割。附图说明[0034]构成本发明的一部分的说明书附图用来提供对本发明的进一步理解,本发明的示意性实施例及其说明用于解释本发明,并不构成对本发明的不当限定。[0035]图1是本发明实施例一的场景语义分割模型的整体框架图;[0036]图2(a)是本发明实施例一的RGB分支层和深度分支层的框架图;[0037]图2(b)是本发明实施例一的下采样层的框架图;[0038]图3是传统的通道注意力机制的框架图;[0039]图4是本发明实施例一的RGB-D特征融合网络的框架图;[0040]图5是本发明实施例一的特征细化网络的框架图;[0041]图6是本发明实施例一的上下文特征处理网络的框架图;[0042]图7是本发明实施例一的不同的系数对应的卷积示意图。具体实施方式[0043]下面结合附图与实施例对本发明作进一步说明。[0044]应该指出,以下详细说明都是例示性的,旨在对本发明提供进一步的说明。除非另有指明,本文使用的所有技术和科学术语具有与本发明所属技术领域的普通技术人员通常理解的相同含义。[0045]需要注意的是,这里所使用的术语仅是为了描述具体实施方式,而非意图限制根据本发明的示例性实施方式。如在这里所使用的,除非上下文另外明确指出,否则单数形式也意图包括复数形式,此外,还应当理解的是,当在本说明书中使用术语“包含”和/或“包[0046]实施例一[0047]如图1所示,本实施例提供了一种基于RGB-D特征融合的场景语义分割方法,该方法在编码-解码体系结构的基础上将ResNet-50作为基础框架,并以分别训练逐渐融合的方式对原始数据进行处理,由两个平行独立的卷积分支分别提取RGB和深度图像特征。编码器负责逐级提取图像语义特征,解码器对提取的特征进行上采样。基于注意力机制构造的RGB-D特征融合模块可以对特征图进行选择加权处理以达到增强目标特征且抑制背景的目的;同时引入的特征细化网络和上下文特征处理网络可以降低语义信息损失,优化语义分割效果。具体步骤如下:[0048]步骤1、获取待分割场景的RGB图像和深度图像。[0049](1)图像采集:使用KinectV2相机,在自然光源下对同一采样点同一角度下分别采集该样本点的RGB图像和深度图像Depth。待分割场景图像均在自然光环境下(包括顺光、逆光情况)采集。图像采集使用镜头:KinectV2(Microsoft),统一设置KinectV2相机的RGB图像和深度图像采集分辨率480×640,输出格式为JPG.相机角度不变,对同一样本点分别采集目标物体的RGB图像和深度图像。每一个样本采样点,同时输出目标物体的RGB、深度图像。[0050](2)图像处理:对所有输入图像分别进行随机缩放、裁剪和翻转,并分别对RGB图像7和深度图像进行归一化操作,并在HSV空间中通过随机调整色调,亮度和饱和度进一步增强输入的RGB图像。得到的图像噪声比较大,所以对图像进行增强处理。[0051]步骤2、将RGB图像和深度图像同时输入场景语义分割模型中,得到场景语义分割结果。场景语义分割模型包括编码器、解码器和分类器。场景语义分割模型的编码器分别采用RGB分支和深度分支对所述RGB图像和深度图像处理,处理过程中采用RGB-D特征融合网络进行RGB特征和深度特征的融合,得到多个低层融合特征和一个高层融合特征。高层融合特征经过上下文特征处理网络后进入解码器;多个低层融合特征经过特征细化网络处理后进入解码器。解码器通过上采样层和RGB-D特征融合网络对多个低层融合特征和一个高层融合特征进行处理得到待分割场景的特征。[0052]作为一种实施方式,场景语义分割模型的整体结构如图1所示。采用编码器-解码模块,加强RGB特征和深度特征的融合,提取图像语义信息,并将处理结果送入到上下文特征处理网络Context;经由上下文特征处理网络处理的结果输入到解码器,对图像进行上采样,同时引入特征细化模块,提高语义分割精度,解码器同样包含有五个上采样模块。编码器负责逐级提取图像语义特征,解码器对提取的特征进行上采样。下采样模块和上采样模块的构造如图2所示。[0053](1)RGB分支采用RGB卷积层对RGB图像进行处理后输入多个依次连接的RGB分支层;深度分支采用深度卷积层对深度图像进行处理后输入多个依次连接的深度分支层。深度卷积层输出的深度特征与RGB卷积层输出的RGB特征通过RGB-D特征融合网络进行融合;深度分支层与RGB分支层一一对应,且深度卷积层输出的深度特征与其对应的RGB分支层输[0054]编码器采用两个独立的卷积分支(RGB分支和深度分支)分别对RGB图像和深度图度分支具有相同的网络配置,但是因为RGB分支输入为RGB三通道图像信息,深度分支输入为单通道深度图像信息,所以深度分支中Conv1_D层的参数与RGB分支中Conv1层的参数不完全一样。采用两个基于ResNet的分别独立的卷积分支网络分别对输入的RGB图像和深度图像进行处理,因为室内场景的RGB图像颜色会模糊物体之间的边界,大量丢失场景中的空间信息,加入深度信息可以为RGB图像提供对应的几何关系,很好地保留场景中物体的空间[0055]作为一种实施方式,RGB分支层和深度分支层的数量为四,将RGB图像和深度图像特征经过特征融合模块处理之后,融合处理得到的结果经由RGB分支处理,原深度分支输出结果继续由深度分支处理;以此类推处理,所有数据信息汇集到五层的RGB分支,模型编码[0056](1-1)RGB图像和深度图像分别经RGB卷积层(Conv1层)和深度卷积层(Conv1_D层)处理以后,然后两个结果分别输入RGB-D特征融合网络RFM,经RGB-D特征融合网络处理之后的结果为第一融合特征,作为第一RGB分支层(Layer1层)新的输入,原深度卷积层(Conv1_D层)的输出继续作为第一深度分支层(Layer1_D)层输入。[0057](1-2)按照(1-1)中操作方式以此类推,第二RGB分支层(Layer2)、第三RGB分支层8(Layer3)、第四RGB分支层(Layer4)和上下文特征处理网络(Context)的输入数据分别来层Layer3_D和第四深度分支层Layer4_D的输出数据,经过RGB-D特征融合网络处理融合之X=[x₁,x₂,…,xc]∈9KC×xw,经过全局平均池化得到输出一维特征图分别进行全局平均池化处理,得到的三个结果分别送入不同的MLP层进行卷积处理;每个9输入特征通道数由原来的2C变为最初的C;最终经由Sigmoid函数去处理MLP层输出元素相加之后的结果;这个最终结果分别与RGB特征与深度特征进行通道乘法之后再进行元素相[0070](2)多个低层融合特征分别依次输入特征细化网络。特征细化网络对低层融合特征先输入卷积层进行卷积操作,再输送到通道注意力层处理。[0071]特征细化网络旨在用高级语义特征指导低级特征。因为高级语义信息和低级语义信息差异性很大,直接融合效果相对较差,在解码器网络嵌入基于注意力机制构造的特征细化模块可以提高两种语义信息的融合效果。[0072]利用跳跃结构可以保留高级特征用以指导低级特征,但是不同阶段的特征具有差异性,通道注意力机制可以有效地弥补这种差异;通过利用通道注意力机制构造的特征细化网络被嵌入跳跃结构。特征细化网络Refine的构造如图5所示,从图中可以看到,模块由一个卷积层和通道注意力机制模块构成。注意,由于不同阶段特征的通道尺寸在融合之前需要对齐,所以对低层融合特征先输入卷积层进行一次1×1的卷积操作,再输送到通道注意力层处理。卷积层加上通道注意力层就构成了特征细化网络。[0073]特征细化网络采用跳跃连接结构,嵌入特征细化网络,将低层信息与高层信息进行一个有深度的互补。[0074](3)高层融合特征上下文特征处理网络。上下文特征处理网络Context对高层融合特征分别进行一次1×1的空洞卷积操作、一次全局池化操作和多次膨胀系数不同的3×3空洞卷积操作。[0075]所有数据汇聚完之后,经过一个上下文特征处理网络进行处理,然后将其送到解码器以获得最终预测,可以帮助特征进行更好的传播和融合。[0076]编码器的输出送入到解码器时,特征信息往往丢失较多,为了保留更多的特征上下文信息,在数据送到解码器之前,嵌入了一个上下文特征处理网络。上下文特征处理网络以多个采样率和有效视野的滤波器探测卷积特征层,从而在多个尺度处捕获对象以及图像上下文。上下文特征处理网络的构造如图6所示。空洞卷积是在标准的卷积中注入空洞,以此来增加卷积核的感受野,相比原来的正常卷积,空洞卷积可以让每个输出都包含较大范围的信息。它多了一个称之为膨胀系数的参数,这个参数指的是卷积核的间隔数量。在这里,进行三次3×3的空洞卷积,并分别让膨胀系数为6,12,18,不同的系数对应的卷积如图7所示。除了这三次空洞卷积之外,又进行了一次1×1的空洞卷积和一次全局池化操作,这五次操作共同组合成了上下文特征处理网络。通过这样的信息处理方式,网络可以捕捉更多的上下文信息。[0077](4)解码器通过上采样层和RGB-D特征融合网络对多个低层融合特征和一个高层融合特征进行处理得到待分割场景的特征,并输入分类器。多个上采样层依次连接逐级将特征恢复到原空间分辨率大小。[0078]模型解码阶段负责对提取的特征进行上采样,最终输出分割结果与输入图像大小一致的输出图像。[0079]作为一种实施方式,高层融合特征输入第一上采样层UP1,经过上采样操作后与第四融合特征经过RGB-D特征融合网络融合后输入第二上采样层UP2;第二上采样层的输出与第三融合特征经过RGB-D特征融合网络融合后输入第三上采样层UP3;第三上采样层的输出与第二融合特征经过RGB-D特征融合网络融合后输入第四上采样层UP4;第四上采样层UP4[0090]3)平均区域交集精度(MIoU):这是用于分割目的的标准度量。算法的正确分割区11模块确实在模型中发挥了巨大作用,并且在数据集上将本发明的模型与其他一些常见的模型做对比,实验表明,本发明的场景语义分割模型可以胜过现有的大部分常用的用于RGB-D语义分割的网络结构。[0095]本实施例提供了一种基于RGB-D特征融合的场景语义分割系统,其具体包括如下[0097]语义分割模块,其被配置为:将RGB图像和深度图像同时输入场景语义分割模型[0098]其中,场景语义分割模型的编码器分别采用RGB分支和深度分支对所述RGB图像和深度图像处理,处理过程中采用RGB-D特征融合网络进行RGB特征和深度特征的融合,得到多个低层融合特征和一个高层融合特征。[0099]此处需要说明的是,本实施例中的各个模块与实施例一中的各个步骤一一对应,其具体实施过程相同,此处不再累述。[0101]本实施例提供了一种计算机可读存储介质,其上存储有计算机程序,该程序被处理器执行时实现如上述实施例一所述的一种基于RGB-D特征融合的场景语义分割方法中的[0102]实施例四[0103]本实施例提供了一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现如上述实施例一所述的一种基于RGB-D特征融合的场景语义分割方法中的步骤。[0104]本领域内的技术人员应明白,本发明的实施例可提供为方法、系统、或计算机程序产品。因此,本发明可采用硬件实施例、软件实施例、或结合软件和硬件方面的实施例的形式。而且,本发明可采用在一个或多个其中包含有计算机可用程序代码的计算机可用存储介质(包括但不限于磁盘存储器和光学存储器等)上实施的计算机程序产品的形式。[0105]本发明是参照根据本发明实施例的方法、设备(系统)、和计算机程序产品的流程图和/或方框图来描述的。应理解可由计算机程序指令实现流程图和/或方框图中的每一流程和/或方框、以及流程图和/或方框图中的流程和/或方框的

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论