CN115146100B 一种基于反事实推理的跨模态检索系统、方法及计算机设备 (天津理工大学)_第1页
CN115146100B 一种基于反事实推理的跨模态检索系统、方法及计算机设备 (天津理工大学)_第2页
CN115146100B 一种基于反事实推理的跨模态检索系统、方法及计算机设备 (天津理工大学)_第3页
CN115146100B 一种基于反事实推理的跨模态检索系统、方法及计算机设备 (天津理工大学)_第4页
CN115146100B 一种基于反事实推理的跨模态检索系统、方法及计算机设备 (天津理工大学)_第5页
已阅读5页,还剩15页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本发明公开了一种基于反事实推理的跨模本的正负样本。采用反事实方法分别生成实例2S1、分别提取原始的图片特征和文本特征,将得到的图片同一维度之后,各自用四层transformer构成的图片特征编码器和文本特征编码器得到特征向量,将得到的图片特征向量和文本特征向量使用一个两层Transformer进行高层次语然后将图片特征和原始文本使用反事实推理方法进行S2、使用反事实推理构建实例级的正负样本,使系S1.1:对训练数据中的每一张图片I以及其对应的文本表述E,提取其文本特征TeRoxoa,图像特征位置特征以及图片的对象区域标签IOS,这里p为图像特征V;每个区域视觉特征的维度为2048,位置特征P包含每个特征区域的左上角坐p构建一个包含各自用四层Transformer构成的图片特征编码器和文本特征编码器、用来进行高级语义特征对齐的两层参数共享的Transformer结构的基将图像特征和文本特征经过式(2)(3)处理之后得到的VF和TF输入创建的基本跨3其中t,x表示为正样本对,t-,x-表示为负样本,即同一批次的其他文本特征和图像特掩盖的对象轮廓进行比对,将图像的所有局部特征区域形成的方框长宽各均匀分为14份,建正样本Oins+,将在中对应的值为1的不重要区域的特征连接起来作为反事实样本,模态检索系统中,然后将得到的特征中对应[CLS]标志位的特征向量作为最终的特征向量Vins+和以及T,使得系统感知图像中的视觉物体并学习细粒度的图片文本局部特部分中随机选择m个图像作为负样本m表示模态检索系统中,然后将得到的特征中对应[CLS]标志位的特征向量作为最终的特征向量4检索系统中,使用得到的特征中[CLS]标志位的特征向量作为最终的特征向量Tsem+和以及T来训练系统使其更注意对视觉词语的理解,进而建立不同模态间的关系并设计损失函数L,进行跨模态检索系统的整体训练:7.根据权利要求1-6任一项所述的一种基于反事实推理的跨模态检索系统的跨模态检事实推理的跨模态检索系统的执行程序代码或存储程序代码、或者权利要求7所述的跨模5[0001]本发明属于多媒体计算领域,具体涉及一种基于反事实推理的跨模态检索模型、[0006]步骤S1,分别使用Faster-RCNN模型和经过预训练的Bert模型来提取原始图片特征和文本特征,将得到的图片特征和文本特征独立映射到同一维度之后,各自用四层transformer构成的图片特征编码器和文本特征编码器中得到特征向量,将得到的图片特征向量和文本特征向量使用一个两层Transformer进行高层次语义对齐,使得图片特征向6特征和文本特征分别独立映射到同一维度之后,各自用四层transformer构成的图片特征个两层Transformer进行对齐,使得图片特征向量和文本特征向量映射到一个公共空间来征和文本特征独立映射到同一维度之后,再使用由四层Transformer构成的图片特征编码个两层Transformer进行处理,将图片特征向量和文本特征向量映射到一个公共空间来构级图片特征和文本特征独立映射到同一维度之后,各自用四层Transformer构成的图片特一个两层Transformer进行处理,将图片特征向量和文本特征向量映射到一个公共空间来[0013](1)本发明提出了一个多层级反事实对比学习跨模态检索框架,提高了模型对多[0015](3)通过反事实对比学习方法,可以缓解由于数据集的数据分布不均导致的虚假反事实推理来构建多级别对比学习。根据各对象节点的重要程度来生成反事实正负样本,7在实例级对比学习模块中我们通过在原图像上掩盖重要的对象区域来生成反事实样本(负解数据集中可能存在的虚假相关和选择偏差。使得模型能够提取到更具有判别性的特征,[0020]图1为本发明提出的反事实推理的跨模态检索模型的框架图,利用反事实生成对征TeRoioa,图像特征veRDnxDV、位置特征以及图片的对象区域标签这p其连接在一起作为图像特征V。每个区域视觉特征的维度为2048(即Dv=2048),pqq[0031]构建一个包含各自用四层Transformer构成的图片特征编码器和文本特征编码器、用来进行高级语义特征对齐的两层参数共享的Transformer结构的基本的跨模态检索[0032]将图像特征和文本特征经过式(2)(3)处理之后得到的VF和T8应图片中狗所在的区域就是重要的,这时候如果把与这块区域有交集的局部特征掩盖掉,[0037]Pi表示区域i的位置特征,表示图片的对象区域标签,E表示原始文本,mask(p',IS,B)表示统计区域i落在重要区域内部的点的数量,Fi表示的第i行的值。Vii∈Dn对当前文本特征的重要程度,根据S1.2中的计算过程,如果图像局部特征Vi对应Fi连接起来(在FDn×1中对应的值不为1)构建正样本Oins+,例如图1中的“[sheep]”和实样本(负样本)其中i=1表示掩盖掉一个最不重要的区域特征,以此类推i=k的基本的跨模态检索模型中,使用得到的特征中[CLS]标志位的特征向量作为最终的特征向量Vins+和以及T。帮助模型感知图像中的视觉物体并学习细粒度的图片文本局9[0045]步骤S3,如图1中的图像级对比学习模块所示,利用步骤S1.2生成的重要矩阵(在Fonx1中对应的值为1)来构建正样本Bimg+,从的基本的跨模态检索模型中,使用得到的特征中[CLS]标志位的特征向量作为最终的特征向量Vimg+和以及T。指导跨模态检索模型学习细粒度的图片文本全局特征对齐。的跨模态检索模型中,使用得到的特征中[CLS]标志位的特征向量作为最终的特征向量Tsem+和以及T来训练模型使其更注意对视觉词语的理解,进而建立不同模态间的的[CLS]标志位的特征向量,经过公式(6)计算改图像于测试库中所有文本之间的相似度,出的[CLS]

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论