CN115238118B 基于模态增强的图像描述模型训练方法及图像描述方法 (中国科学院上海高等研究院)_第1页
CN115238118B 基于模态增强的图像描述模型训练方法及图像描述方法 (中国科学院上海高等研究院)_第2页
CN115238118B 基于模态增强的图像描述模型训练方法及图像描述方法 (中国科学院上海高等研究院)_第3页
CN115238118B 基于模态增强的图像描述模型训练方法及图像描述方法 (中国科学院上海高等研究院)_第4页
CN115238118B 基于模态增强的图像描述模型训练方法及图像描述方法 (中国科学院上海高等研究院)_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

US2021232850A1,2021.07.29基于模态增强的图像描述模型训练方法及本发明提供基于模态增强的图像描述模型推理信息;基于各单词对应的所述语义推理信2基于所述当前训练数据中的文本数据;对所述文本数据中的各单词基于各单词对应的所述语义推理信息,和当前图像的语义标签更新所述当前训练数据,以基于更新后的所述当前训练所述图像描述模型包括隐藏状态特征记忆池和视觉注意力特征记忆池获取当前单词的隐藏状态特征和视觉注意力特征;基于当前和所述视觉注意力特征,对应更新所述隐藏状态特征记忆池和所述视觉注意力特征记忆获取所述当前视觉注意力特征序列的序列特征;基于该序列特基于当前单词的所述隐藏状态特征查询向量和所述隐藏状态特征对所述当前隐藏状态特征序列执行时间和语义增强,以获取增强后的基于所述增强后的隐藏状态特征序列和所述增强后的视觉注意力特基于当前单词的所述上下文推理特征,和当前单词的所述视觉注意获取上一单词对应的隐藏状态特征和获取当前基于当前单词的所述词嵌入特征、所述图像区域特征,和上一单基于当前单词的隐藏状态特征和所述图像区域特征,采用注意3将当前单词的所述隐藏状态特征输入至所述隐藏状态特征记忆池的将当前单词的所述视觉注意力特征输入至所述视将所述视觉注意力特征记忆池最底层存储的所述视觉基于各所述隐藏状态特征于所述当前隐藏状态特征序列中的序基于各所述视觉注意力特征于所述当前视觉注意力特征序列中的序列h为区域特征的特征维度。基于所述新的多模态特征序列,和所述当前单词的多模态特征查采用门控线性单元,将所述当前单词的隐藏状态特征查询向量和所依次执行各所述基于模态信息增强的上下文推理过程,以获取基于各单词对应的语义对齐损失,获取所述当前文本数据的其中,于次执行单次所述基于模态信息增强的上下文推理过获取所述当前隐藏状态特征序列的序列特征;基于该序列特征,和当4基于所述增强后的隐藏状态特征序列,和所述隐藏状态特征查基于所述增强后的视觉注意力特征,和所述视觉注意力特征查基于所述隐藏状态语义特征和所述视觉语义特征,采用语义对基于所述增强后的隐藏状态特征序列,采用自注意力机制获所述基于所述增强后的视觉注意力特征,和所述视觉注意力特征查询基于所述增强后的视觉注意力特征序列,采用自注意力机制获得交采用传统注意力机制获得所述交互增强后的视基于图像描述的样本数据构建各训练数据集;单组所述训练数据包括基于各所述训练数据集和与所述训练数据对应的语义标签信息,采用对待描述的图像,利用所述训练后的图像描述模型进行上下文语义求1至9中任一项所述的基于模态增强的图像描述模型训练方法或如权利要求10所述的图计算机程序被处理器执行如权利要求1至9中任一项所述的基于模态增强的图像描述模型56[0009]于本发明一实施例中,所述对所述当前隐藏状态特征序7中,在获取所述增强后的隐藏状态特征序列和获取所述增强后的视觉注意力特征序列之增强后的视觉注意力特征序列,采用自注意力机制获得交互增强的视觉注意力特征序列;行如上任意所述的基于模态增强的图像描述模型训练方法或如上所述的图8[0021]图1显示为本发明提供的所述基于模态增强的图像描述模型训练方法于一实施[0024]图4显示为本发明提供的所述基于模态增强的图像描述模型训练方法于另一实[0027]需要说明的是,以下实施例中所提供的图示仅以示意方式说明本发明的基本构[0035]请参阅图1,示出为本发明一实施例中所述基于模态增强的图像描述模型训练方9[0038]如图1所示,所述基于模态增强的图像描述模型训练方法于执行单次所述模型训[0041]采用目标检测模型对图像数据进行分区,并提取图像中v=2048。[0057]拼接所述当前单词的词嵌入特征和所述图像区域特征,获取当前单词的拼接特视觉注意力特征序列;H为所述第一门向量,用于动态地平衡所述词嵌入特征和所述注意力特征视觉注意力特征序列;[0099]对所述当前隐藏状态特征记忆池中各所述隐藏状态特征[0107]对所述当前视觉注意力特征序列中各所述视觉注意力特征,均执行上述增强过[0108]S206,基于所述增强后的隐藏状态特征序列和所述增强后的视觉注意力特征序a"为当前单词的上下文推理特征。签信息的概率,即约束语义推理信息和语义标签信息之间的分布概率相近,p()表征记忆池和视觉注意力特征记忆池中存储的特征序列。[0137]请参阅图4,示出为本发明提供的所述基于模态增强的图像描述模型训练方法于A为所述第二门向量,用于动态地平衡词嵌入特征和隐藏状态特征序列均值所述增强后的隐藏状态特征进行序列内部特征的交互,获得交互增强的隐藏状态特征序强后的视觉注意力特征进行序列内部特征的交互,获得交互增强的视觉注意力特征序列,为[0163]其中,Lalign为当前单词语义对齐损失,Smooth-L1函数数据的语义对齐损失;λ用于平衡所述交叉熵损失和所述语义对齐损失于所述模型总损失基于模态增强的图像描述模型训练方法或如上所述图像描述方法[0185]上述的处理器可以是通用处理器,包括中央处理器(CentralProce简称CPU)、网络处理器(NetworkProcessor,简称NP)等;还可以是数字信号处理器(DigitalSignalProcessing,简称DSP)、专用集成电路(ApplicationSpecific[0188]这里所描述的计算机可读程序可以从计算机可读存储介质下载到各个计算/处理储设备。每个计算/处理设备中的网络适配卡或者网络接口从网络接收计算机可读程序指

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论