CN114945907B 用于图像搜索和图像索引的方法以及电子设备 (Oppo广东移动通信有限公司)_第1页
CN114945907B 用于图像搜索和图像索引的方法以及电子设备 (Oppo广东移动通信有限公司)_第2页
CN114945907B 用于图像搜索和图像索引的方法以及电子设备 (Oppo广东移动通信有限公司)_第3页
CN114945907B 用于图像搜索和图像索引的方法以及电子设备 (Oppo广东移动通信有限公司)_第4页
CN114945907B 用于图像搜索和图像索引的方法以及电子设备 (Oppo广东移动通信有限公司)_第5页
已阅读5页,还剩26页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2022.07.14PCT/CN2021/0760722021WO2021/160100EN2021.08.19US2015026101A1,2015.01.22以及通过语义对齐网络(SAN)获得所述查询关键词的目标语义嵌入,并通过所述SAN根据所述目标语义嵌入搜索与所述查询关键词对应的至少一个目标图像。所述SAN被配置为语义嵌入提取空间定义了至少一个图像嵌入和语义嵌入之间2通过语义对齐网络(SAN)获得所述查询关键词的目标语义嵌入,并通过所视觉模型,用于提取至少一个图像的特征并将所述至少一个图像的所词缀子网络(WR-Net),用于将所述单词向量组转换为根据由所述语义约束产生的语义-对齐损失训练所述WR-Net,从而所述WR-Net被配置根据所述语义-对齐损失调整所述单词向量组,以生成另一单词向量组作为所述语义一对同义词的单词向量的第一子约束,所述一对同义词的单词一对反义词的单词向量的第二子约束,所述一对反义词的单词所述另一单词向量组的第三子约束,所述另一单词向量组义词的单词向量之间的距离与所述反义词集中反义词之间的最7.根据权利要求4所述的方法,其特征在于,所述空间损失由第一距离和第二距离表量和所述另一单词向量组中的所述单词的邻近单词的8.根据权利要求2所述的方法,其特征在于,所述视词向量组中的每个单词向量之间的距离以及所述深度向量与正确(Ground-truth)标签的3通过所述WR-Net将所述查询关键词的所述单词向量转换成所述目通过所述SAN将所述至少一个图像转换为所述至少一个图像嵌入,将所述至少一个图像的所述深度特征转换为所述至少一通过语义对齐网络(SAN)将所述至少一个图像转换为至少一个图像嵌入,从而提供视视觉模型,用于提取所述至少一个图像的特征并将所述至少一个图像的词缀子网络(WR-Net),用于将所述单词向量组转换为所述根据由所述语义约束产生的语义-对齐损失训练所述WR-Net,从而所述WR-Net被配置根据所述语义-对齐损失调整所述单词向量组,以生成另一单词向量组作为所述语义一对同义词的单词向量的第一子约束,所述一对同义词的单词一对反义词的单词向量的第二子约束,所述一对反义词的单词所述另一单词向量组的第三子约束,所述另一单词向量组4反义词的单词向量之间的距离与所述反义词集中反义词之间的量和所述另一单词向量组中的所述单词的邻近单词的20.根据权利要求14所述的方法,其特征在单词向量组中的每个单词向量之间的距离以及所述深度向量与正确(Ground-truth)标签将所述至少一个图像的所述深度特征转换为所述至少一通过所述SAN获得所述查询关键词的目标语义嵌入,并通过所述SAN通过所述WR-Net将所述查询关键词的所述单词向量转换成所述目24.根据权利要求23所述的方法,其特征在于,所述至少一个目标图像包括在所述视令被所述处理器执行时,所述处理器执行权利要求1-12和权利要求13-24中任意一项所述5[0002]本申请要求于2020年2月12日提交的申请号为62/975,565的美国临时专利申请的6执行基于从当前单词嵌入中学习到的图像向量的文本到照片搜索将导致不符预期的结果,[0025]图1是本申请实施例提供的一种语义对齐网络(SAN)的框架图。SAN100包[0026]视觉模型可用于提取至少一个图像的特征并将至少一个图像的特征转换为至少7数据集)的1000个物体类别中预测出一个。所述卷积神经网络的最后一个全局集合层的输语言模型可以是Mikolov介绍的跳格文本建模架构。每个图像的标签可以是未注释的文本[0029]所述Mikolov介绍的跳格文本建模架构已被证明能够有效地从未注释的文本中学习术语的语义上有意义的浮点表示。跳格文本建模架构通过预测未注释文本中的相邻术[0030]在Mikolov介绍的跳格文本建模架构的一个示例中,创建一个300维的单词向量[0035]在一些实施例中,SAN的训练包括根据由语义约束产生的语义-对齐损失训练WR-[0036]由于WR-Net是根据语义约束产生的语义-对齐损失来训练的,而视觉模型是根据[0037]进一步地,在一些示例中,WR-Net的训练包括根据语义-对齐损失调整单词向量8[0047]在一些示例中,同义词损失由同义词集中一对同义词的单词向量之间的距离表d(w′a)m,0)组中的所述单词的单词向量之间的距离以及另一单词向量组中的所述单词的单词向量和另一单词向量组中的所述单词的邻近单词的单词向量是单词i在单词向量组W(即原始空间或W空间)中的9词向量之间的距离以及深度向量与正确(Ground-truth)标签的单词向量之间的距离表示。[0061]图2是本申请实施例提供的一种图像搜索方法的流程图。该方法可由电子设备执SAN根据所述目标语义嵌入搜索与所述查询根据SAN的视觉-语义空间中的目标语义嵌入找到与查询关键词对应的至少一个目标图像。[0067]在这些实施例中,SAN被配置为语义嵌入提取器并且用于提供定义了至少一个图像嵌入和语义嵌入之间的映射关系的视觉-语义空间,每个语义嵌入是基于语义约束生成图像可以包括在视觉-语义空间中与目标语义嵌[0070]图4是本申请实施例提供的另一种图像搜索方法的流程图。该方法可由电子设备[0072]所述至少一个图像可以从电子设备中的用户的相册中获得,或者可以在现场拍[0075]在这些实施例中,通过被配置为语义嵌入提取器的SAN,至少一个图像被输入到[0077]图5是本申请实施例提供的一种图像索引方法的流程图。该方法可由电子设备执[0079]所述至少一个图像可以从电子设备中的用户的相册中获得,或者可以在现场拍[0081]该视觉-语义空间定义了至少一个图像嵌入和语义嵌入之间的映射关系,并且每[0083]在这些实施例中,通过被配置为语义嵌入提取器的SAN,至少一个图像被输入到[0085]图6是本申请实施例提供的另一种图像索引方法的流程图。该方法可由电子设备入通过所述SAN搜索对应于所述查询关键词的至少根据SAN的视觉-语义空间中的目标语义嵌入找到与查询关键词对应的至少一个目标图像。[0091]在这些实施例中,SAN被配置为语义嵌入提取器并且用于提供定义了至少一个图像嵌入和语义嵌入之间的映射关系的视觉-语义空间,每个语义嵌入是基于语义约束生成像可以包括在视觉-语义空间中与目标语义[0098]获取模块810可被用于获得至少一个图像。转换模块820可用于通过SAN将至少一例中描述的图像索引方法或上述实施例方法的任意技术人员在本申请的技术范围内想出的任何等效的修

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论