CN114973402B 一种基于模态对齐的动作提示的视觉语言导航系统及方法 (中山大学·深圳)_第1页
CN114973402B 一种基于模态对齐的动作提示的视觉语言导航系统及方法 (中山大学·深圳)_第2页
CN114973402B 一种基于模态对齐的动作提示的视觉语言导航系统及方法 (中山大学·深圳)_第3页
CN114973402B 一种基于模态对齐的动作提示的视觉语言导航系统及方法 (中山大学·深圳)_第4页
CN114973402B 一种基于模态对齐的动作提示的视觉语言导航系统及方法 (中山大学·深圳)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于模态对齐的动作提示的视觉语言本发明提供一种基于模态对齐的动作提示智能体在导航开始前从动作提示库中检索与指输出提示特征与文本编码模块的输出指令特征块的输出视觉特征被提供给多层transformer用2动作提示集产生模块,输入指令到动作提示集产生模态对齐动作提示的视觉语言导航模块,动作提示集通过提示编码模块,出视觉特征被提供给多层transfor优化学习模块,即模态对齐损失模块和连续一致性损提示编码模块,该模块由两个单模态子提示编码器和一个多模态提示编连续一致性损失模块,促使智能体根据其观察,按顺序关注检索到的S2:通过视觉编码模块和文本编码模块,分别对S3:通过提示编码模块,动作提示集中图像子提示和S5:通过模态对齐动作提示的视觉语言导航模块,34.根据权利要求3所述的视觉语言导航方法,其特征在于,所述步骤S1包括以下子步创建好的视觉物体visualobject/位置location词汇表来查找指令中提及的视觉物体/位动作序列中一个图像B属于c类的概率由以下5.根据权利要求3所述的视觉语言导航方法,其特征在于,所述步骤S2包括以下子步v)列I和[CLS]和[SEP]tokens给transformer中的se使用通过提示编码器得到提示编码该提示编码器由两个单模态子分别为和和首先通过单模态子提示编码器得到子提示特征和4up7.根据权利要求3所述的视觉语言导航方法,其特征在于,所述步骤S4包括以下子步8.根据权利要求3所述的视觉语言导航方法,其特征在于,所述步骤S5包括以下子步状态视觉特征Kt基于Kt和Xp之间的跨模态注然后将分解为和af",获得不同的基于注意力机制增强的特征,参与指令特征制增强的文本子提示特征通过对和进行ag"加权获得,和用于计算顺序一致9.根据权利要求3所述的视觉语言导航方法,其特征在于,所述步骤S6包括以下子步S600:模态对齐损失,促使动作提示已经有匹配的其中τ2是温度参数,表示动作提示pn的成对的图像和文本子提示的特征,5定义,用于提高基于注意力机制增强的图像子提示特征和基于注意L=LRL+λ1LIL+λ2Lc+λ3La2和λ3是平衡损失的损失权重。6进展的启发之后,越来越多的工作试图将预训练范式和模型引入到视觉语言导航任务中。PREVALENT在大量的图像-语言-动作三元组上对模型进行自监督预训练。VLNBERT在预7[0013]文本编码模块该模块接收语言信息的输入,利用多层transformer神经网络分别[0014]提示解码模块,该模块由两个单模态子提示编码器和一个多模态提示编码器组提前创建好的视觉物体visualobject/位置location词汇表来查找指令中提及的视觉物将短语“aphotoof{CLASS}”中的标记{CLASS}token替换为类别标签是c的可视物体/位8特征和短语特征,M为词汇表的尺寸,然后选择与该短语相似度最大的图像作为图像子提的动作提示,计算提示库中每个与对象/位置相关的动作短语与文本子提示之间的句子相θv)指令序列I和[CLS]和[SEP]tokens给transformer中的self-att0将会在时间步骤t被更新为st。[0039]使用通过提示编码器得到提示编码该提示编码器由两个单模提示分别为和和首先通过单模态子提示编码器得到子提示特征和up9[0050]然后将分解为a"和f",获得不同的基于注意力机制增强的特征,参与指令特λ2和λ3是平衡损失的损失权重。对齐损失和连续一致性损失,以实现有效的学习动作提示。使用对比语言-图像预训练[0068]图5为本发明具体实施例中应用视觉语言导航方法与baseline方法结果导航的结[0071]对于本领域技术人员来说,附图中某些公知结构及其说明可能省略是可以理解[0076]模态对齐动作提示的视觉语言导航模块11,通过一个提示编码器来获取提示特编码模块的输出视觉特征被提供给多层transform[0080]提示编码模块111,该模块由两个单模态子提示编码器和一个多模态提示编码器需要在特定的时间步骤进行的动作。因此,为了派生动作提示中的图像子提示,只从在动作序列中一个图像B属于c类的概率由以特征和短语特征,M为词汇表的尺寸,然后选择与该短语相似度最大的图像作为图像子提相关的动作提示。计算提示库中每个与对象/位置相关的动作短语与文本子提示之间的句θv)输入指令序列I和[CLS]和[SEP]tokens给transformer中的self-attentio0将会在时间步骤t被更新为st。到提示编码该提示编码器由两个单模态子提示编码器和一个多模态提示编码器组成,其中图像子提示和文本子提示分别为和和首先通过up[0112]然后将分解为0"和of",获得不同图像和文本特征疏远,使用infoNCE损失以促进每个动作提示中图像和文本子提示的特征[0117]其中τ2是温度参数,表示动作到的动作提示集{pn}中的动作提示也与不同的物体/位置相关,为了促使智能体根据其观λ2和λ3是平衡损失的损失权重。[0128]模态对齐动作提示的视觉语言导航模块11,通过一个提示编码器来获取提示特编码模块的输出视觉特征被提供给多层tra[0132]提示编码模块111,该模块由两个单模态子提示编码器和一个多模态提示编码器需要在特定的时间步骤进行的动作。因此,为了派生动作提示中的图像子提示,只从在动作序列中一个图像B属于c类的概率由以特征和短语特征,M为词汇表的尺寸,然后选择与该短语相似度最大的图像作为图像子提相关的动作提示。计算提示库中每个与对象/位置相关的动作短语与文本子提示之间的句θv)输入指令序列I和[CLS]和[SEP]tokens给transformer中的self-attentio0将会在时间步骤t被更新为st。到提示编码该提示编码器由两个单模态子提示编码器和一个多模态提示编码upe"分解为0"和0",获得不同的基于注意力机制增强的特征,参与指令特得到基于提示的动作预测概率图像和文本特征疏远,使用infoNCE损失以促进每个动作提示中图像和文本子提示的特征[0168]其中τ2是温度参数,表示动作提示pn的成对的图像和文本子提到的动作提示集{pn}中的动作提示也与不同的物体/位置相关,为了促使智能体根据其观注意力机制增强的指导特征tR}必须接近:λ2和λ3是平衡损失的损失权重。的一个指令路径实例,采用新近开发的具有强大的跨模态对象/位置级对齐能力的对比语[0

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论