CN115861995B 一种视觉问答方法、装置及电子设备和存储介质 (山东海量信息技术研究院)_第1页
CN115861995B 一种视觉问答方法、装置及电子设备和存储介质 (山东海量信息技术研究院)_第2页
CN115861995B 一种视觉问答方法、装置及电子设备和存储介质 (山东海量信息技术研究院)_第3页
CN115861995B 一种视觉问答方法、装置及电子设备和存储介质 (山东海量信息技术研究院)_第4页
CN115861995B 一种视觉问答方法、装置及电子设备和存储介质 (山东海量信息技术研究院)_第5页
已阅读5页,还剩48页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

力模块搭建的双阶段DeformableDETR模型;检文本的文本特征信息作为文本模态信息;基于2利用对象属性检测模型和BERT模型提取所述正样本的多模态的图文模态信息和所述检索所述训练样本中的图像的相似图像,提取所述相似检索所述训练样本中的描述文本的相似文本,提取所基于所述正样本的图文模态信息、所述负样本的图文模态信息、确定第一骨干网络,构建单尺度可变形注意力基于所述多尺度可变形注意力模块分别构建所述骨干网络中的RFN_Encode模块和基于所述正样本的图文模态信息、所述图像模态信息和基于所述正样本的图文模态信息、所述负样本的图文模态信息、所述文本模态信息计算正负样本图像与文本之基于所述第一跨模态距离和所述第二跨模态距离计算跨剔除所述OpenImagesV6数据集中的负样本得在所述Object365数据集中确定样本数量大于第二阈值的第二目标类别,将所述3Object365数据集中第二目标类别的样本收集基于所述COCO数据集中的样本数量和所述第三中间数据集中的样本数量计算第一比按照第一预设比例在所述第二中间数据集中、按照第二计算所述第三中间数据集中的样本数量与所述COCO数据集中的样本数量之间的第一计算所述第三中间数据集中的样本数量与所述VG数据集中的样本数量之间的第二比对所述训练样本中的描述文本进行句子级别的重写,以对所述训练样本中的描述文本进行词组级别和单词级别的重写,以生成第二目标文利用对象属性检测模型提取所述正样本中图像的多模态的第一图像特征信息,利用利用对象属性检测模型提取所述负样本中图像的多模态的第二图像特征信息,利用利用图像检索模型检索所述训练样本中的图4基于所述哈希码与所述哈希中心之间的距离交替优所述第二骨干网络的多个模型参在所述训练样本中确定待掩藏的目标内容;将所述训练样本中的目标内容进行掩藏,生成视觉语言基于所述视觉语言学习训练样本和对应的标签训练将替换后的训练样本集输入所述视觉问答模型,以利用所述视多尺度可变形注意力模块搭建的双阶段Defo第二提取模块,用于检索所述训练样本中的图像的第三提取模块,用于检索所述训练样本中的描述尺度可变形注意力模块分别构建所述骨干网络中的RFN_Encode模块和transformer5距离计算跨模态对比学习的损失值,并基于所述损失值更新所述视觉问答模型的模型参处理器,用于执行所述计算机程序时实现如权利要求1至10任一项所述视觉问答方法程序,所述计算机程序被处理器执行时实现如权利要求1至10任一项所述视觉问答方法的6机器像人一样去认识世界。通常的视觉语言模型在基于BERT(BidirectionalEncoderRepresentationfromTransformers,一个预训练的语言表征模型)的语言模型处理语言基于语义空间中信息进一步处理。当前视觉特征绝大多数选择骨干网络为ResNet_101C4(采用101层的深度残差网络)的Faster_RCNN(FastRegion_basedConvolutional有丰富的对象标记以及属性标签,但针对视觉语言任务来讲,仍无法满足数据丰富性与多样性。采样的注意力机制)提出了新的解决方案,用multi_scaledeformableattention替换transformerattention,将之前关注整幅图缩减到参考点周围点,大大降低了计算复杂[0004]目前现有的预训练模型在NLP单模态领域表现都比较好,而将其利用迁移学习到有效的同时进行单模态与多模态的内容理解和生成任务。UNIMO虽能够有效的同时适配单模态与多模态的内容理解和生成任务,但仍采用基于Faster_RCNN模型预提取视觉特征和7[0010]利用对象属性检测模型和BERT模型提取所述正样本的多模态的图文模态信息和[0019]在所述Object365数据集中确定样本数量大于第二阈值的第二目标类别,将所述Object365数据集中第二目标类别的样本收集[0020]基于所述COCO数据集中的样本数量和所述第三中间数据集中的样本数量计算第8[0023]计算所述第三中间数据集中的样本数量与所述COCO数据集中的样本数量之间的[0024]计算所述第三中间数据集中的样本数量与所述VG数据集中的样本数量之间的第[0036]基于所述多尺度可变形注意力模块分别构建所述骨干网络中的RFN_Encode模块[0043]基于所述哈希码与所述哈希中心之间的距离交替优所述第二骨干网络的多个模9[0047]基于所述第一跨模态距离和所述第二跨模态距离计算跨模态对基于多尺度可变形注意力模块搭建的双阶段Deform测模型为基于多尺度可变形注意力模块搭建的双阶段DeformableDETR模型;检索所述训[0068]本申请基于训练样本集训练双阶段DeformableDETR模型,随后引入到跨模态对[0073]图3为根据一示例性实施例示出的一种基于two_stageDeformable_DETR对象属[0082]本实施例中的训练样本集可以具体为VG数据集,训练样本集包描述技术生成所述训练样本中的图像对应的第一目标文本。采用Imagecaption(图像描变形注意力模块搭建的双阶段Deform变形注意力模块;基于所述多尺度可变形注意力模块分别构建所述骨干网络中的RFN_[0089]目前视觉语言模型仍采用基于Faster_RCNN结构的对象属性检测模型,由于算法性能。首先,挑选骨干网络。目前对象属性检测模型采用的骨干网络为ResNet_101C4和和为可学习的权重注意力权重AnorE[01],Anak表示第h个head中择key的数目,AThar表示第h个head中第k个样本的偏移量,AThar为浮点数,则;key的数目,Amaar表示第h个head中第lEncoder模块和transformerEncoder模块。搭建PRN_Encoder模块:为了能够提升检测精块初始时接受RPN_Encoder模块输出的objectqueries和TransformerEncoder模块输出特征图编码,后期为了提升检测精确度,用TransformerDecoder模块输出替代RPN_型要理解图像内容还远远不够,因此需要在two_stageDeformableDETR基础上添加属性[0098]在decoder尾部添加类别数目为524类的属性分支,此分支与FFN和line-logisto(e)为分类loss,is()为第i个样本的预测置信度,ci为第i个样本的标签,ci,j为第i个样本第j个属性的标签,N为样本数量,M为属性数量,需要搜索的参数[0101]根据已训练two_stageDeformable_DETR对象属性检测模型,预提取image_text[0106]在一般的跨模态对比学习任务中,为了更充分使用单模态视觉特征信息而加入立性和平衡性,并且行向量与列向量正交。利用Sylvester算法生成的Hadamard矩阵:其中为Kronecker积。[0108]构建实例权重中心相似性:为了度量哈希码bi与哈希中心的相似性di,采用BCE(binary采用BCE(binaryfo计算哈希中心fv兴与Hamming距离,然后利用梯度下图像,并选择相似图像。根据已训练ICS多标签图像检索模型,预提取image_text类型与imagecollections类型的64位哈希码,其中image_text类型为上述步骤提到的四个多模;正负样本图像与文本计算如下EV,T代表数学期望,也即跨模态对比学习Loss为的数学期望。[0119]在具体实施中,基于上述对比学习的预训练模型基础上,增加下游任务对应的[0120]本申请实施例基于训练样本集训练双阶段DeformableDETR模型,随后引入到跨模态对比学习中,通过跨模态的对比学习提升视觉模型学习能力,解决了现有技术中第一目标类别的样本收集至第二中间数据集;在所述Object365数据集中确定样本数量大于第二阈值的第二目标类别,将所述Object365数据集中第二目标类别的样本收集至第三[0125]为了提升对象属性检测模型性能,利用已公开的COCO、OpenImagesV6、[0129]基于均匀分布策略以及各数据集存在样本重叠问题,将4种数据集按照如下方式变形注意力模块搭建的双阶段Deformmask文本中一些位置单词,随后基于剩余的文本和图像去预测mask部分单词。Maskedtransformer本身的特性解决了Faster_RCNN需要手动设置参数的问题,但由于[0149]C、基于多尺度可变形注意力模块分别搭建RPN_Encoder模块和transformer接受RPN_Encoder模块输出的objectqueries和TransformerEncoder模块输出特征图编[0153]A、在decoder尾部添加类别数目为524类的属性分支,此分支与FFN和line-logisto(e)为分类loss,is()为第i个样本的预测置信度,ci为第i个样本的标签,ci,j为第i个样本第j个属性的标签,N为样本数量,M为属性数量,需要搜索的参数[0158]将步骤二对象属性检测模型和步骤三ICS多标签图像检索模型引入到跨模态对比[0162]图5为视觉语言学习的示例图,视觉语言学习过对图像区域和句子中单词随机对,随机mask图像目标检测结果中区域,随后基于图像其他区域检测结果和文本去预测[0172]重写模块602,用于对所述训练样本中的描述文本进行重写,生成正样本和负样[0173]第一提取模块603,用于利用对象属性检测模型和BERT模型提取所述正样本的多型为基于多尺度可变形注意力模块搭建的双阶段Deforma[0178]本申请实施例基于训练样本集训练双阶段DeformableDETR模型,随后引入到跨模态对比学习中,通过跨模态的对比学习提升视觉模型学习能力,解决了现有技术中[0183]第二收集单元,用于在所述Object365数据集中确定样本数量大于第二阈值的第定所述训练样本中的描述文本的目标语言,将所述描述文本翻译为其他语言的中间文本,[0191]在上述实施例的基础上,作为一种优选实施方法,所述第一提取模块603具体用于:利用对象属性检测模型提取所述正样本中图像的多模态的第一图像特征信息,利用述多尺度可变形注意力模块分别构建所述骨干网络中的RFN_Encode模块和transformer[0194]在上述实施例的基础上,作为一种优选实施方法,所述第二提取模块604具体用[0197]在上述实施例的基础上,作为一种优选实施方法,所述第一训练模块606具体用模态距离;基于所述第一跨模态距离和所述第二跨模态距离计算跨模态对比学习的损失[0207]本申请实施例中的存储器3用于存储各种类型的数据以支持电子设备的操作。这编程只读存储器(PROM,ProgrammableRead_OnlyMemory)、可擦除可编程只读存储器(EPROM,ErasableProgrammableRead_OnlyMemory)、电可擦除可编程只读存储器磁盘存储器或磁带存储器。易失性存储器可以是随机存取存储器(RAM,RandomAccess(SSRAM,SynchronousStaticRandomAccessMemory)、动态随机存取存储器(DRAM,DynamicRandomAccessMemory)、同步动态随机存取存储器(SDRAM,SynchronousDynamicRandomAccessMemory)、双倍数据速率同步动态随机存取存储器(DDRSDRAM,储器3旨在包括但不限于这些和任意其它适合类型的存储器。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论