CN119479969A 多模态特征融合Mamba用于医学报告自动生成方法 (安徽大学)_第1页
CN119479969A 多模态特征融合Mamba用于医学报告自动生成方法 (安徽大学)_第2页
CN119479969A 多模态特征融合Mamba用于医学报告自动生成方法 (安徽大学)_第3页
CN119479969A 多模态特征融合Mamba用于医学报告自动生成方法 (安徽大学)_第4页
CN119479969A 多模态特征融合Mamba用于医学报告自动生成方法 (安徽大学)_第5页
已阅读5页,还剩25页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

多模态特征融合Mamba用于医学报告自动生本发明公开一种多模态特征融合Mamba用于特征和文本特征分别输入SSM_Attention视觉文本特征整合模块,输出新的视觉特征和文本特的高级视觉特征输入多模态融合Mamba模块输出融合特征,将融合特征输入Transformer解码器自动生成医学报告。本发明的SSM_Attention、MultimodalMamba可独立发展和改进,同时也2步骤3、将步骤1所得视觉特征和步骤2所得文本特征Ftext分别输视觉文本特征整合模块;SSM_Attention视觉文本特征整合模块分别对视觉特征和文本步骤4、将步骤3所得视觉特征输入Transformer编码步骤5、将步骤3得到的文本特征为Ftext和经Transformer编码器增强后的视觉特征一起输入多模态融合Mamba模块,所述多模态融合Mamba模块包括三层相同结构的多模态2.根据权利要求1所述的多模态特征融合Mamba用于医块的大小为patch_sizexpatch_size,小块的数量为num_patches=(H//patch_3.根据权利要求1所述的多模态特征融合Mamba用于编码器结构生成包含丰富上下文信息的词嵌入,然后转换为固定长度的向量词嵌入;positionEncoding,位置编码使得模型能够区分相同词汇在不同位置的3;Embedding(text)是词汇的词嵌入向量,positionEncoding是位置编码向量。4.根据权利要求1所述的多模态特征融合Mamba用于医学报告自动然后,对新的序列f和f做下述不同操作:;;;5.根据权利要求1所述的多模态特征融合Mamba用于于,步骤4中Transformer编码器对经过SSM_Attention模块后的新的视觉特征进行编码6.根据权利要求1所述的多模态特征融合Mamba用于医学报4;;是通过乘以作为门控因子,生成门控后的特征,形成输出序列;;;;;。5当今大多数技术主要致力于从医学影像中提取并整合视觉特征,并将这些特征进行编码,[0006]传统的Transformer架构其自注意力计算的复杂度为二次方(与序列长度相关医学影像的视觉信息时使用Transformer模型通常需要大规模计算资源,不适合在处理高图像的整体特征或文本的上下文信息,而忽略了图像局部区域和文本语义之间的协同作;[0014]步骤2、将原始医学报告输入基于BERT模型的文本特征提取模块,输出文本特征6[0015]步骤3、将步骤1所得视觉特征和步骤2所得文本特征分别输入SSM_经过SSM_Attention得到的新,经过SSM_Attention得到的新;[0021]步骤5、将步骤3得到的文本特征为和经Transformer编码器增强后的视觉特[0023]为得到原始医学图像的中级特征和低级特征,所述步骤1视觉特征提取模块的详个小块的大小为patch_sizexpatch_size,小块的数量为num_patches=(H//[0029]步骤2.2、使用BERT模型对预处理后文本标签进行嵌入处理:先通过双向Transformer编码器结构生成包含丰富上下文信息的词嵌入,然后转换为固定长度的向量positionEncodingBXLXD,位置编码使得模型能够区分相同词汇在不同位置的意义差异至此得到positionEncodingBXLXD7[0033]Embedding(text)是词汇的词嵌入向量,positionEncoding是位置编码向量[0036]然后,对新的序列f和f做下述不同操作:;;上式中,Linear(o是指线性变换操作,LayerNor用通过结合SSM的全局依赖建模能力和注意力机制的局部特征选择能力,能够更全面地捕8;[0050]是通过乘以作为门控因子,生成门控后的特征,形成输出序列;;;SSM是状态空间模型,crossAttention()是指交叉注意力操作,是指两个特征相[0055]此处的多模态融合Mamba模块相当于交叉模态优化器,最大化特征提取和学习的9[0065]自注意力:通过多头自注意力机制计算目标序列中的每;[0097]步骤2、将原始医学报告输入基于BERT模型的文本特征提取模块,输出文本特征[0098]步骤3、将步骤1所得视觉特征和步骤2所得文本特征Ftext分别输入SSM_经过[0104]步骤5、将步骤3得到的文本特征为和经Transformer编码器增强后的视觉特个小块的大小为patch_sizexpatch_size,小块的数量为num_patches=(H//[0114]步骤2.2、使用BERT模型对预处理后文本标签进行嵌入处理:先通过双向Transformer编码器结构生成包含丰富上下文信息的词嵌入,然后转换为固定长度的向量;positionEncodingBXLXD,位置编码使得模型能够区分相同词汇在不同位置的意义差异至此得到positionEncodingBXLXD[0133]经过步骤文本特征和视觉特征进入第一层多模Mamba网络后,输出;[0138]是通过乘以作为门控因子,生成门控后的特征,形成输出序列;;[0154]自注意力:通过多头自注意力机制计算目标序列中的每[0170]为验证本发明技术效果,将本发明技术方案与其他现有技术作对比如下表1所示[0175]METEOR(MetricforEvaluationofTranslationwithExplicitORdering)是对BLEU的改进,不仅考虑了n_gram匹配,还加入了词形还原(stemming)、同义词

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论