CN114926338B 模型训练方法及装置、电子设备和存储介质 (上海商汤智能科技有限公司)_第1页
CN114926338B 模型训练方法及装置、电子设备和存储介质 (上海商汤智能科技有限公司)_第2页
CN114926338B 模型训练方法及装置、电子设备和存储介质 (上海商汤智能科技有限公司)_第3页
CN114926338B 模型训练方法及装置、电子设备和存储介质 (上海商汤智能科技有限公司)_第4页
CN114926338B 模型训练方法及装置、电子设备和存储介质 (上海商汤智能科技有限公司)_第5页
已阅读5页,还剩44页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

混合图像是通过将两个样本图像中的图像块拼本公开实施例可实现提高了整体的模型训练效2通过预设的图像重建模型中的编码器对所述混合图像进行编码,通过所述图像重建模型中的解码器对所述目标特征图进行解码,得其中,所述编码器包括N个子编码器,每个子编码器包括多头其中,所述通过预设的图像重建模型中的编码器对所述确定每个子编码器中的多头注意力机制层所采用的注意力掩码通过所述N个子编码器,根据所述N个子编码器中所采用的注意力掩码与注意力窗口,其中,所述注意力掩码用于指示所述多头注意力机制层计根据拼接所述混合图像时所采用的掩码图,确定所述N个子编码器中的第一个子编码根据所述N个子编码器中的第n个子编码器所编码的特征图尺度,对第n-1个子编码器3.根据权利要求1或2所述的方法,其特征在根据针对每个子编码器中的多头注意力机制层所预先设置的窗口尺寸其中,所述注意力窗口包括用于计算全局多头注意力通过第一个子编码器,根据所述第一个子编码器中所采用的注意力掩码与注意力窗对第n-1输出特征图进行下采样,得到分辨率缩小且通道数增加的第n-1个输入特征3通过第n个子编码器,根据第n个子编码器中所采用的注意将通过第N个子编码器编码得到的第N个输出特征图作为所述目6.根据权利要求1或2所述的方法,其特征在于,所根据编码所述目标特征图时所采用的注意力掩码,将所述目标7.根据权利要求1或2所述的方法,其特根据所述第一样本图像与预设的掩码图,确定从所述第一样根据所述第二样本图像与所述掩码图对应的反向掩码图,确定从所8.根据权利要求1或2所述的方法,其特征在其中,所述根据所述两个重建图像与所述两个样本图像之确定所述第一重建图像与所述第一样本图像之间的第一图像差根据从所述第二样本图像中抽取图像块时所采用的反向掩码图,确根据从所述第一样本图像中抽取图像块时所采用的掩码图,确定所述4获取模块,用于获取混合图像,所述混合图像是通过将两个样编码模块,用于通过预设的图像重建模型中的编码器对所解码模块,用于通过所述图像重建模型中的解码器对所述目标特征图进行解码训练模块,用于根据所述两个重建图像与所述两个样其中,所述编码器包括N个子编码器,每个子编码器包括多头所采用的注意力掩码,以及确定每个子编码器中的多头注意力机制层所采用的注意力窗述注意力窗口用于指示所述多头注意力机制层计算同一注意力窗口内的特征之间的多头程序指令被处理器执行时实现权利要求1至10中任意5首先会根据将原始图像分割成不重叠的图像补丁(patch),然后采用一个随机掩码来掩盖使得任务有足够的难度,使用大量特殊符号来填充掩码掩盖的部分图像补丁是不可避免于指示所述多头注意力机制层计算同一注意力窗口内的特征之间的多6编码器编码得到的第N个输出特征图作为所述目标[0012]在一种可能的实现方式中,所述两个样本图像包括第一样本图像与第二样本图[0013]在一种可能的实现方式中,所述两个样本图像包括第一样本图像与第二样本图7编码器编码得到的第N个输出特征图作为所述目标8[0023]在一种可能的实现方式中,所述两个样本图像包括第一样本图像与第二样本图[0024]在一种可能的实现方式中,所述两个样本图像包括第一样本图像与第二样本图本图像中的图像块拼接而成得到图像,也即输入编码器的混合图像来自于真实的样本图9[0033]图2示出根据本公开实施例的一种转换器块(Transformerblock)的模型结构示所说明的任何实施例不必解释为优于或好于其它实[0041]可知晓的是,自监督学习(Self-SupervisedLearning)是无监督学习里面的一种,主要是希望能够学习到一种通用的视觉表征(也即特征表达),以用于下游任务的预训练过程;在将模型预训练到一定程度后,可以再根据不同下游任务(Downstream[0042]本公开实施例中的编码器可以理解为一种可以提取图像中通用的视觉表征的模[0044]本公开实施例的模型训练方法中采用了编码器-解码器的设计,也即图像重建模[0045]图1示出根据本公开实施例的模型训练方法的流程图,所述模型训练方法可以由自随机抽取的部分图像块(例如可以是从两个样本图像中各自随机抽取50%的图像块)拼[0050]在一种可能的实现方式中,编码器可以例如采用分层的视觉转换器(VisionTransformer,ViT)的模型结构,还可以采用基于移动窗口的分层视觉转换器(Swin码器之间存在一个下采样层,下采样层用于成倍缩小输入特征图(也即输入子编码器的特征图)的分辨率以及成倍增加输入特征图的通道数,每个子编码器包括至少一组转换器块施例的一种转换器块(Transformerblock)的模型结构示意图,如图2所示,每个(Multi-LayerPerceptron,MLP,或称多层感知器)层以及层归一化(Layer的损失;当然还可以采用其他计算方式确定上述两个重建图像与两个样本图像之间的损不同下游任务中采用的不同带标签的样本数据,继续训练采用上述目标编码器的网络模本图像中的图像块拼接而成得到图像,也即输入编码器的混合图像来自于真实的样本图[0066]根据第一样本图像与预设的掩码图,确定从第一样本图像中根据第二样本图像与掩码图对应的反向掩码图,确定从第二样本图像中抽取的第二图像[0068]其中,反向掩码图可以是与掩码图中二进制掩码相反的二进制掩码构成的掩码示为X2意力,那么应计算输入特征图(或输入向量)中属于同一样本图像的特征之间的多头注意图。注意力掩码用于指示多头注意力机制层计算同一样本图像的特征之间的多头注意力,多头注意力机制层计算同一样本图像的特征之[0080]根据拼接混合图像时所采用的掩码图,确定N个子编码器中的第一个子编码器所[0084]其中,由于每两个子编码器之间的下采样层用于成倍缩那么对第n-1个子编码器所采用的注意力掩码进行下采样所得到的注意力掩码的分辨率也意力掩码与注意力窗口对输入特征图(或输入向量)进行处理的。在一种可能的实现方式合图像的多个图像块在通道维度进行展开(也即通道展开)可以得到x兴x(16x3)的图像,然后再对的图像中的每个像素在通道维度上做线性变换(得到xx2c的第1个输入特征图;通过第2个子编码器,根据第2个子编码器中所采用的的第2个输入特征图,再通过第3个子编码器,根据[0100]根据编码目标特征图时所采用的注意力掩码,将目标特征图拆解为两个子特征于解码器的具体模型结构以及具体解码过程不差异,也即可以确定第一重建图像与第一样本图像中整个图像区域之间的第一图像差异,能够提取出混合图像中属于样本图像的部分特征中越有效的视觉表征信息,通过该方式,得到每个重建图像与对应的样本图像中被另一个样本图像填充的局部图像区域之间的图[0112]L=II(Y1-X1)O(1-M)l⃞+II(YZ-X2)Ml'(1)行上述步骤S11至步骤S14(包括步骤S141至步骤S142),来多次迭代训练编码器与解码器,造输入(也即用无意义的特殊符号填充被掩码掩盖的图像块)对模型训练产生的负面影响,[0125]编码模块102,用于通过预设的图像重建模型中的编码器对所述混合图像进行编[0126]解码模块103,用于通过所述图像重建模型中的解码器对所述目标特征图进行解编码器编码得到的第N个输出特征图作为所述目标[0134]在一种可能的实现方式中,所述两个样本图像包括第一样本图像与第二样本图本图像与所述掩码图对应的反向掩码图,确定从所述第二样本图像中抽取的第二图像块;[0135]在一种可能的实现方式中,所述两个样本图像包括第一样本图像与第二样本图本图像中的图像块拼接而成得到图像,也即输入编码器的混合图像来自于真实的样本图[0146]电子设备1900还可以包括一个电源组件1926被配置为执行电子设备1900的电源务器操作系统(WindowsServerTM),苹果公司推出的基于图形用户界面操作系统(MacOSXTM),多用户多进程的计算机操作系统(UnixTM),自由和开放原代码的类Unix操作系统[0149]计算机可读存储介质可以是可以保持和存储由指令执行设备使用的指令的有形[0150]这里所描述的计算机可读程序指令可以从计算机可读存储介质下载到各个计算/任意组合编写的源代码或目标代码,所述编程语言包括面向对象的编程语言—诸如[0152]这里参照根据本公开实施例的方法、装置(系统)和计算机程序产品的流程图和/处理装置的处理器执行时,产生了实现流程图和/或框图中的一个或多个方框中规定的功计算机可读介

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论