CN115761757B 基于解耦特征引导的多模态文本页面分类方法 (福州大学)_第1页
CN115761757B 基于解耦特征引导的多模态文本页面分类方法 (福州大学)_第2页
CN115761757B 基于解耦特征引导的多模态文本页面分类方法 (福州大学)_第3页
CN115761757B 基于解耦特征引导的多模态文本页面分类方法 (福州大学)_第4页
CN115761757B 基于解耦特征引导的多模态文本页面分类方法 (福州大学)_第5页
已阅读5页,还剩17页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于解耦特征引导的多模态文本页面分类本发明涉及一种基于解耦特征引导的多模流的端到端Transformer编码网络,所述双流的端到端Transformer编码网络包括视觉特征提取分类的电子文本页面的文本数据输入语言特征页面的图像数据输入视觉特征提取器获得深层2获取电子文本页面数据构建训练集,并基于训练集训练双流的端到端Transformer编将待分类的电子文本页面的文本数据输入语言特征提取器获得将待分类的电子文本页面的图像数据输入视觉特征提取器获得将得到的深层语言特征和深层视觉特征共同输入跨模态融合编码器获得多模态特征,所述视觉特征提取器包括第一解耦表征网络模块、引导对齐模块待分类的电子文本页面的图像数据通过第一解耦表征网络模块处理,解耦得到形状特输入引导对齐模块进行引导对齐得到浅层视觉将浅层视觉特征Ev输入视觉编码器进行加工,进一步提取视觉特征得到深层视觉特征3将形状特征、颜色特征和像素特征共同输入引导对齐模块进行gray)+γ2*LN(Wshhsv)将剩余文本特征Etail通过1×1通道卷积实现与视觉特征E1维度对齐,并与E1拼接输入一个自注意力层进行语义对齐得到浅层视觉特征Ev替代已有的合并特征,其计算公式如将待分类的电子文本页面的文本数据先输入第二解耦表征网络模块,得到浅层语言特然后将浅层语言特征Ehead通过10层Transformer结构的语言编码器网络进一步提取文具体过程表示为:采用S22中文本嵌入方法分别将头部文本Thead和剩余文本Ttail共享同一份Bert权重嵌4为剩余文本特征;将剩余特征和浅层语言特征分别输入引导对齐模块和语言编码模块将跨模态特征Fx输入分类头网络进行分类;分类头网络通过维度大小为三层全连接层组成,并通过Mish激活函数和BatchNorm归一化层连接两层全连接,分类头最终通过特征和语言模态特征,分别表示所有图片视觉模态特征和语言模态特征的集合,(3):将分类头输出的分类概率使用交叉熵损失函数计算预测得到的分类概率与真实5近电子文本页面分类相似的视觉任务,但电子文本页面图像包括了文档的种类且不限于[0010]将得到的深层语言特征和深层视觉特征共同输入跨模态融合编码器获得多模态[0013]将待分类的电子文本页面的文本数据先输入[0014]然后将浅层语言特征Ehead通过10层Transformer结构的语言编码器网络进一步提6[0016]采用大规模预训练Bert编码文本语言特征;将文本序列嵌入到语言特征空间具体过程表示为:[0018]其中Bert(·)为预训练Bert权重,为待嵌入的文本序列,p,$分别为依照Bert处理的方法在嵌入过程中添加嵌入向量的位[0019]采用S22中文本嵌入方法分别将头部文本Thead和剩余文本Ttail共享同一份Bert权aa,⃞,5)为浅层语言特征,tau,u,s)为剩余文本特征;[0022]待分类的电子文本页面的图像数据通过第一征Etail输入引导对齐模块进行引导对齐得到浅层视特征Fv;其中对常规的视觉编码器中的自注意力层进行替换,采用加入高斯核函数生成[0028]对图像xi通过不同大小的高斯核G(·)处理图像,并得到高斯差分金字塔DOG7[0033]通过提取图像xi的HSV特征,将该特征值序列通过一层全连接网络映射为特定长gray)+γ2*LN(Wshhsv)[0041]将剩余文本特征Etail通过1×1通道卷积实现与视觉特征E1维度对齐,并与E1拼接接层组成,并通过Mish激活函数和BatchNorm归一化层连接两层全连接,分类头最终通过8模态特征和语言模态特征,分别表示所有图片视觉模态特征和语言模态特征的集[0055](3):将分类头输出的分类概率使用交叉熵损失函数计算预测得到的分类概率与[0057]1、本发明能够有效地对电子文本页面中综合特征进行分析,提升了分类的准确[0058]2、本发明针对模型学习电子文本页面图像细节特征代价问题,提出解耦表征模[0060]4、本发明针对难以将电子文本页面场景中大量文本与视觉特征进行模态间特征9Transformer编码网络并通过已训练网络并推理电子文本页面类别,用于检测用户浏览电[0070]步骤S112:将S34中得到的视觉模态特征Fv和S23中得到的语言模态特征Ft通过infoNCEloss计算模态间损失LCM,将S模态特征和语言模态特征,分别表示所有图片视觉模态特征和语言模态特征的集处理的方法在嵌入过程中添加嵌入向量的位置和份Bert权重嵌入特征空间得到Ehead=为浅层语言特征,Eau=Bert(Tau,pu,s)为剩余文本特征;[0089]步骤S23:将S21得

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论