CN117571014B 一种结合图像描述和文本生成图像的视觉语言导航方法 (上海优玩网络科技有限公司)_第1页
CN117571014B 一种结合图像描述和文本生成图像的视觉语言导航方法 (上海优玩网络科技有限公司)_第2页
CN117571014B 一种结合图像描述和文本生成图像的视觉语言导航方法 (上海优玩网络科技有限公司)_第3页
CN117571014B 一种结合图像描述和文本生成图像的视觉语言导航方法 (上海优玩网络科技有限公司)_第4页
CN117571014B 一种结合图像描述和文本生成图像的视觉语言导航方法 (上海优玩网络科技有限公司)_第5页
已阅读5页,还剩11页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种结合图像描述和文本生成图像的视觉本发明涉及一种结合图像描述和文本生成过场景描述模块生成基于当前场景的详尽自然场景有着类似核心物品对象以及核心场景布局层Transformer结构和细尺度跨模态编码器进行生成综合考虑了当前真实场景和对应相似场景2S2:基于S1获得的全景视觉图像,通过场景描S3:将S2中生成的详尽自然语言图像描述作为文本生所描述场景有着类似核心物品对象以及核心场景布S4:将S1中的视觉图像以及S3中基于当前场景生成的相似场景图像分别通过多层Transformer结构提取视觉特征,同时将S1中的自然语言目标指令通过文本编码器得到目S5:将S4中生成的当前场景编码和相似场景预测和基于当前场景所作出的动作预测生成动N(e(),xi)))(4)其中,pr""表示综合考虑了当前真实场景和对应相似场景的融合动作预测,最后将Entropy(pr(i"),AY)(6)其中,ug"表示融合动作预测损失,通过监督融合动作预测来指导整个决策过程的学32.根据权利要求1所述的一种结合图像描述和文本生成图像的视觉语言导航方法,其首先将获得的当前场景所处位置的全景图像通过均匀地调整智能体视角离散化为36概述再细节描述的顺序,并结合细节描述的对应位置关系组合生成详尽自然语言图像描3.根据权利要求1所述的一种结合图像描述和文本生成图像的视觉语言导航方法,其4.根据权利要求1所述的一种结合图像描述和文本生成图像的视觉语言导航方法,其5.根据权利要求1所述的一种结合图像描述和文本生成图像的视觉语言导航方法,其4语言导航作为多模态机器学习领域和具身智能领域的一个重要分支,吸引了广泛的关注。觉语言导航智能体具备理解自然语言指令和观察周围环境能力,并且能够依据获得的视成与所描述场景有着类似核心物品对象以及5Transformer结构提取视觉特征,同时将S1中的自然语言目标指令通过文本编码器得到目[0024]首先将获得的当前场景所处位置的全景图像通过均匀地调整智能体视角离散化6键字,再使用其图像编码器CLIP-I分别对每一张切割后的子图进行编码并将其作为询问,位置编码和单词类型编码,最后将位置编码和单词类型编码一起注入到多层Transformer7调整智能体视角将当前全景视觉图像离散化[0039]S3:将S2中生成的详尽自然语言图像描述作为文本生成图像任务的先进模型示单词相对于整个句子的位置编码和单词类型编码,再将它们一起注入到多层Transformer结构中生成目标指令编码,结合目标指令编码将提取得到的两种视觉特征通融合目标指令语言特征和视觉图像特征的交叉注意力层,自注意力层以及由全连接层、8[0045]其中,FFN表示线性前馈网络,最后将视觉增强动作预测和基准专家动作聚合S4中生成

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论