CN119478617A 一种面向信息合规性治理的多模态知识表示方法 (福建拓尔通软件有限公司)_第1页
CN119478617A 一种面向信息合规性治理的多模态知识表示方法 (福建拓尔通软件有限公司)_第2页
CN119478617A 一种面向信息合规性治理的多模态知识表示方法 (福建拓尔通软件有限公司)_第3页
CN119478617A 一种面向信息合规性治理的多模态知识表示方法 (福建拓尔通软件有限公司)_第4页
CN119478617A 一种面向信息合规性治理的多模态知识表示方法 (福建拓尔通软件有限公司)_第5页
已阅读5页,还剩13页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种面向信息合规性治理的多模态知识表本发明涉及一种面向信息合规性治理的多用无卷积的图像切分方法对图像进行标准化与切分,后通过投影获取图像数据特征;再通过类型特征得到文本模态特征;最终使用BiLSTM_Attention模型对两种模态特征进行多模态融2步骤S2、利用KeyBert预训练模型从政务领域信息的长文本中提取关键词,然后通过MacBert模型得到关键词对应的特征表示,融合模态类型特征与位置特征后得到文本模态步骤S3、将文本模态特征、视觉模态特征输入已训练好的BiLSTM2.根据权利要求1所述的一种面向信息合规性治理的多模态知识表示方法,其特征在步骤S11、定义政务领域数据的图像集合P,将图像集合P中的图像切分得到224x3.其中,Transforms(p)表示对原始图像数据Pi进行转换切分,Pi表示原始其中,Linearprojection(patches)表示线性投影函数,patchesi代表第i个切分图像块子集,而vpatches;代表投影结果,即图像中的原始位置信息;vn代表第i个图像块4.根据权利要求1所述的一种面向信息合规性治理的多模态知识表示方法,其特征在3过对原句编码和分词结果编码的余弦相似度对比来计算并选择关键词;计算公式如下所库对ti进行基础分词,keyBert(jieba.lcut(t⃞))表示基础分词之后通过keyBert模型来t指文本模态特征向量,Vt和分别为文本数据样本ti输入MacBert预训练模型后序列ti在隐藏层的第一和最后一层输出;代表文本数据样本ti通过MacBert编码后隐示第i个关键词keyi的长度,posi表示第i个关键词keyi在文本序列ti中的开始位置,vg"s*表示的是文本数据样本ti经过编码后,位于posi之后第k个位置处的特征向量,Vt。5.根据权利要求1所述的一种面向信息合规性治理的多模态知识表示方法,其特征在V=VP+vt4过MacBert模型得到关键词对应的特征表示,融合模态类型特征与位置特征后得到文本模[0006]其中,Transforms(p)表示对原始图像数据Pi进行转换切分,Pi表示步骤S12、遍历图像集合p',按照16×16×3的大小切分,得到图像块集合5代表第i个切分图像块子集,而vpatches;代表投影结果,即p分前图像中的原始位置信息;vn代表第i个图像块步骤S21、使用jieba库的基础分词能力和KeyBert模型基于N_gram的二次分词能i表示原始文本数据集T中的第i个数据样本,jieba.lcut(t⃞)表示通过jieba库对ti进行基础分词,keyBert(jieba.lcut(t⃞))表示基础分词之后通过keyBert模型来计算并选择关键词;keyi表示经jieba库与KeyBert模型对ti抽取的关键词结果集,posi为keyi对应的关键词在原文本中的位置向量;t指文本模态特征向量,Vt和分别为文本数据样本ti输入MacBert6模型后序列ti在隐藏层的第一和最后一层输出;代表文本数据样本ti通过MacBert编码L=len(key)表示第i个关键词keyi的长度,posi表示第i个关键词keyi在文本序输入基于BiLSTM_Attention架构的特征融合模块,得到最终的政务领域数据的语义表示,V=VP+vtKeyBert和MacBert模型以主题词语义替换原文本语义的方式实现了对长文本的特征提取。7文本进行语义代换,结合原文本的类型特征得到文本模态特征;最后,使用BiLSTM_过MacBert模型得到关键词对应的特征表示,融合模态类型特征与位置特征后得到文本模[0017]其中,Transforms(p)表示对原始图像数据Pi进行转换切分,Pi表示原步骤S12、遍历图像集合p',按照16×16×3的大小切分,得到图像块集合代表第i个切分图像块子集,而vpatches;代表投影结果,即p分前图像中的原始位置信息;vn代表第i个图像块步骤S21、使用jieba库的基础分词能力和KeyBert模型基于N_gram的二次分词能8i表示原始文本数据集T中的第i个数据样本,jieba.lcut(t⃞)表示通过jieba库对ti进行基础分词,keyBert(jieba.lcut(t⃞))表示基础分词之后通过keyBert模型来计算并选择关键词;keyi表示经jieba库与KeyBert模型对ti抽取的关键词结果集,posi为keyi对应的关键词在原文本中的位置向量;t指文本模态特征向量,Vt和分别为文本数据样本ti输入MacBert模型后序列ti在隐藏层的第一和最后一层输出;代表文本数据样本ti通过MacBert编码L=len(key)表示第i个关键词keyi的长度,posi表示第i个关键词keyi在文本序[0020]步骤S3中,将得到的文本模态特征向量Vt、视觉模态特征Vp输入基于BiLSTM_Attention架构的特征融合模块,得到最终的政务领域数据的语义表示,计算公式如下所V=VP+vt9[0024]这些计算机程序指令也可存储在能引导计算机或其他可

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论