CN115374289B 一种结构化知识增强的图文匹配方法 (电子科技大学)_第1页
CN115374289B 一种结构化知识增强的图文匹配方法 (电子科技大学)_第2页
CN115374289B 一种结构化知识增强的图文匹配方法 (电子科技大学)_第3页
CN115374289B 一种结构化知识增强的图文匹配方法 (电子科技大学)_第4页
CN115374289B 一种结构化知识增强的图文匹配方法 (电子科技大学)_第5页
已阅读5页,还剩23页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

捕获图像区域之间关系,并构建区域知识结构2本为由正样本中的文本与随机选择的错误图像构成的错误A31、对输入的图文对进行特征提取,获得图像各区域的特征和对应文本各区域的特A4、根据获得的正样本的余弦相似度及其对应的负样本的余弦相似首先,分别计算图像的每个区域知识特征与其他区域知识特R=wvf(v)T个图像知识特征ve。3统计图像字幕库中所有词语的出现次数,并根据词语的将知识概念中的任意两两词语组合成词语对,统计每一个词语对在图像知识概念特征以及共现知识图的邻接矩阵,使用GRU网络计算得到最终的知识概念特征。利用FasterR_CNN模型提取出图文对中的图像的个区;。然后,以相似度作为各区域视觉特征的各知识概念特征4步骤A4中,根据获得的正样本的余弦相似度及其对应对于一个训练数据组,损失函数采用正样本和对应的两个负样本构成的三元组损失,的一个负样本的余弦相似度计算结果,d(s,t-)为训在进行迭代训练过程中,对一轮输入的所有训练数据组的输入图像和待检索文本,通过图文匹配模型计算输入的图像和所5或者,输入文本和待检索图像,通过图文匹配模型计算10.如权利要求1_9任意一项所述的一种结构化知识增强的图文匹配方法,其特征在所述根据相似度确定匹配出的图像,包括:对输入的文本和所有待6[0001]本发明涉及跨模态图文匹配技术,具体涉及一种结构化知识增强的图文匹配方[0008]MTFN(Matchingimagesandtextwithmulti_modaltensorfusionandre_[0011]以CVSE(Consensus_awarevisual_semanticembeddingforimage_textmatching,共识感知视觉语义嵌入模型)为代表方法。该方法通过计算图像字幕语料库中语义概念之[0012]但是该方法只是从图文中提取了知识概念集合,没有考7负样本为由正样本中的文本与随机选择的错误图像进行排序,以覆盖词语总量预设比例(如80%)的8所述共现频率为共现次数与图像字幕库的文后基于知识概念特征C以及共现知识图的邻接矩阵P,使用GRU网络计算得到最终的知识概[0037]利用Bi_GRU网络提取出图文对中的文本的m个区域特征,获得文本区域特征T"=[0039]首先,基于图像的区域视觉特征计算每个图像区域和所有知[0048]进一步的,步骤A32中,根据图像的区域知识特征之间的关系构建图像知识结构9[0055]然后,将图像的n个区域的结构化知识[0057]首先,将文本的m个文本区域特征采用求均值的方法融合为一据组中的一个负样本的余弦相似度计算结果,d(v,t_)为训练数据组中的另一个负样本的[0070](1)本发明针对图文匹配过程中结构化信息缺失导致匹配结果不正确的问题,设[0071](2)本发明针对图像区域空间信息被忽视的问题,在图像区域本身信息中加入空[0075]本实施例中的结构化知识增强的图文匹配方法主要包括图文匹配模型训练和基和随机选择的错误对应的图像构建成的错误网络由VGG_16组成,其包括5个卷积池化层。其中前两个卷积池化层的结构采用依次连接pooling_layer(池化层);第三、第四个卷积池化层的结构均为采用依次连接的:conv_conv_layer(卷积层)、relu(激活函数)。第五个卷积池化层的结构为采用依次连接的:[0085]接下来,以维度为(N/16)*(M/16)*512的特征图作为输入,将候选框数量设置为长度为25088的一维向量。再使用大小为1024*25088的可学习参数矩阵与得到的一维向量[0089]首先对输入图文对数据中的文本进行预处理。预处理包括:使用字符串类的[0090]接下来,使用Pytorch深度学习框架中的torchtext.vo模型(GlobalVectorsforWordRepresentation,全局词向量模型)训练好的词向量库。在此过程中统计每段文本所含的词语个数为vocab_le使用的循环神经网络需要相同大小的向量,所以经过pad_packed_sequence操作对所有向[0092]接下来,向量序列经过参数为301024的tr与1024*1024的WI相乘的结果与kj的转置1024*1的kjT相乘。最终得到一个数的结域视觉知识特征。计算操作过程也是构建一个1024*1024的参数矩阵。对于一个km,将1*1024的vf与1024*1024的参数矩阵相乘的结果与km的转置1024*1的kmT相乘。最终得到一个为输入,将1024维的和1024维的进行拼接得到2048维的i∈1,[0122]f=fr[0123]对每个和进行相同的操作,得到包含空间位置信息的图像区域知识特征vf=hf,i,jE(1,2,3,…,n),rij为相关性

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论