CN116680343B 基于融合多模态信息的实体和关系表示的链接预测方法 (北京理工大学)_第1页
CN116680343B 基于融合多模态信息的实体和关系表示的链接预测方法 (北京理工大学)_第2页
CN116680343B 基于融合多模态信息的实体和关系表示的链接预测方法 (北京理工大学)_第3页
CN116680343B 基于融合多模态信息的实体和关系表示的链接预测方法 (北京理工大学)_第4页
CN116680343B 基于融合多模态信息的实体和关系表示的链接预测方法 (北京理工大学)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

号基于融合多模态信息的实体和关系表示的体涉及一种基于融合多模态信息的实体和关系三元组数据共同作为输入,对融合模块进行训练,学习包含多模态信息的实体和关系向量表2收集与所要构建知识图谱主题相关的多模态数据,进将预处理后的三元组数据进行实体识别、关系抽取和属性抽通过视觉模块对图像数据进行单模态特征提取,学习图像数据中通过文本模块对文本数据和三元组数据进行单模态特征提取,通过解码部分对融合模块学习到的特征表示进行解码并进行链接预测所述视觉模块包括输入、择优模块和视觉编码器;通过视觉模块对将同一实体对应的多个图像数据作为输入,送入所述择优模块在所述择优模块中,通过相似度计算和清晰度评价两个步采用感知哈希算法对同一实体对应的多张图像进行相似度计算,采用灰度差分绝对值之和函数进行清晰度评价,通过对图像水输入向量先通过多头注意力层和残差连接与层操作,再通过前馈神2.根据权利要求1所述的基于融合多模态信息的实体和关系表示的链接预测方法,其3.根据权利要求1所述的基于融合多模态信息的实体和关系表示的链接预测方法,其4.根据权利要求1所述的基于融合多模态信息的实体和关系表示的链接预测方法,其35.根据权利要求1所述的基于融合多模态信息的实体和关系表示的链接预测方法,其将文本数据中的文本序列分割成多个句子,在整个文本序列的开头添加一个“[CLS]”文本编码器采用Transformer架构中的编码器结构,输入向量先通过多头注意力层和6.根据权利要求1所述的基于融合多模态信息的实体和关系表示的链接预测方法,其文本辅助编码器采用Transformer的编码器结构,输入的文本表示先通过多头注意力视觉融合编码器采用Transformer的编码器结构,输入的图像表示先通过多头注意力中心编码器采用Transformer架构中的编码器结构,文本辅助编码器输出的文本特征向量和视觉融合编码器输出的图像特征向量先通过多模态注意力层和残差连接与层归一7.根据权利要求1所述的基于融合多模态信息的实体和关系表示的链接预测方法,其对输入的每一个三元组表示,先通过线性变换矩阵得到三元组结构将文本模态注意力值、视觉模态注意力值和三元组注意力值分别作为文本特征向量、将实体的多模态表示与实体的原有特征表示进行加权求和,获对于实体之间关系的多模态表示,取三元组结构信息作为多模态表8.根据权利要求1所述的基于融合多模态信息的实体和关系表示的链接预测方法,其将上一层的输出向量与融合模块的输出一同作为输入向量,通过多头4将上一层的输出向量通过前馈神经网络和残差连接将上一层的输出向量通过1个全连接层和1个softmax层,得到最终的概率输出结果作5知识推理技术进行研究。面向多模态知识图谱的推理技术主要能够辅助推理出新的事实、表示学习的知识推理方法进行解决上述问题态数据自身复杂性以及它们之间进行信息交互所带来的[0005](2)现有方法更多的关注重点放在了如何从图像、文本这两大类多模态数据中得[0006](3)由于大部分实体和图像之间的关系是一对多,也就是一个实体对应多个不同6[0028]将文本数据中的文本序列分割成多个句子,在整个文本序列的开头添加一个[0031]文本编码器采用Transformer架构中的编码器结构,输入向量先通过多头注意力7[0033]文本辅助编码器采用Transformer的编码器结构,输入的文本表示先通过多头注[0034]视觉融合编码器采用Transformer的编码器结构,输入的图像表示先通过多头注[0035]中心编码器采用Transformer架构中的编码器结构,文本辅助编码器输出的文本特征向量和视觉融合编码器输出的图像特征向量先通过多模态注意力层和残差连接与层[0039]对输入的每一个三元组表示,先通过线性变换矩阵得到[0048]将上一层的输出向量通过1个全连接层和1个softmax层,得到最终的概率输出结8[0053]如图1所示,本发明实施例公开了一种基于融合多模态信息的实体和关系表示的[0063]具体为:使用不保持原图长宽比例直接压缩为网络的输入尺寸224*224的方法对数值形式存在的类别信息转换为相应的文本形式,最后将经过预处理的数据信息集成到9[0090]输入的文本表示经过文本辅助编码器,文本辅助编码器采用Transformer的编码[0093]输入的图像表示经过视觉融合编码器,视觉融合编码器采用Transformer的编码[0096]中心编码器同样使用了Transformer架构中的编码器结构,首先通过多模态注意而使知识图谱之外的三元组得分更低,最大化它们之间的距离以达到优化知识表示的目阵得到三元组结构的初始表示head0ijk,经过LeakyRelu非线性层后得到head1ijk,再通过v"r"为文本表[0126]将上一层的输出向量通过1个全连接层和1个softmax层,得到最终的概率输出结[0128]本发明使用硬件为CPU:Intel(R)Xeon(R)Gold5218CPU@2.30GHz,GPU:

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论