CN117390213B 基于oscar的图文检索模型的训练方法和实现图文检索的方法 (西交利物浦大学)_第1页
CN117390213B 基于oscar的图文检索模型的训练方法和实现图文检索的方法 (西交利物浦大学)_第2页
CN117390213B 基于oscar的图文检索模型的训练方法和实现图文检索的方法 (西交利物浦大学)_第3页
CN117390213B 基于oscar的图文检索模型的训练方法和实现图文检索的方法 (西交利物浦大学)_第4页
CN117390213B 基于oscar的图文检索模型的训练方法和实现图文检索的方法 (西交利物浦大学)_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

US2023134531A1,2023.05.04基于OSCAR的图文检索模型的训练方法和实本发明提供一种基于OSCAR的图文检索模型本对输入面向视觉语言任务的预训练模型OSCAR2将所述训练集中的多个图像一文本样本对输入面向视觉语言任务的预训练模型OSCAR将所述训练集中的每个样本作为锚点样本,基于所述图像特征计算正样本对中图像与文本的正相似度、负样本对和所基于所述正相似度和负相似度计算损失函数,通过所述损失函数所述将所述训练集中的每个样本作为锚点样本,基于所述图像特基于核函数计算每个负样本与所述锚点样本q之间的相似度以及对应的权重,进行加所述基于核函数计算每个负样本与所述锚点样本q之间的相似度以及对应的权重,进基于高斯径向基函数计算每个负样本与锚点样本之根据以下公式计算每个负样本与锚点样本间的相似度对3度和负相似度的集合,Scv表示锚点样本为文本样本时正相似度和负相似度的集合;本样本对输入预训练的OSCAR图文检索模型中,进行特征提取生成图像特征表示和文本特获取所述训练集中的图像样本,提取所述图像样本的区域视觉特征和区域位置特征,获取所述训练集中的文本样本,采用分词技术将所述文本样本划基于所述图像嵌入和所述文本嵌入,采用注意力机制生成4.一种利用OSCAR图文检索模型实现图文检索的方法,所述O基于所述图文检索模型中的文本编码器对所述目标文本进行特基于所述图文检索模型中的图像编码器对所述目标图像进行特基于所述文本特征表示及所述图像特征表示,确定所述目标文5.一种采用如权利要求1一3任一项所述的基于OSCAR的图文检索模型训练方法的训练特征提取模块,用于将所述训练集中的多个图像一文相似度计算模块,用于计算正样本对中图像与文本的正相似度、4对比损失计算模块,用于基于所述正相似度和负相似度计算损失函少一条指令用于被处理器执行以实现如权利要5[0001]本发明涉及信息检索技术领域,尤其涉及一种基于OSCAR的图文检索模型的训练义差异则是指在捕捉图像和文本之间的跨模态对应关[0004]目前在面向视觉语言任务中,OSCAR模型的性能非常强大,其已经在几百万对图[0005]因此,本申请基于OSCAR模型构建一种新的图文检索模型,以提升模型的泛化能[0006]本发明的目的在于提供一种基于OSCAR的图文检索模型的训练方法和实现图文检[0010]将所述训练集中的多个图像一文本样本对输入面向视觉语言任务的预训练模型6[0017]基于核函数计算每个负样本与所述锚点样本q之间的相似度以及对应的权重,进[0018]进一步地,所述基于核函数计算每个负样本与所述锚点样本q之间的相似度以及相似度和负相似度的集合,Scv表示锚点样本为文本样本时正相似度和负相似度的集合;7[0033]获取所述训练集中的文本样本,采用分词技术将所述文基于OSCARbase模型获得每个标记对[0040]第三方面,本发明还提供一种基于OSCAR的图文检索模型训练装置,所述装置包[0048]本发明的有益效果在于:本发明实施例提供的一种基于OSCAR的图文检索模型的8[0049]上述说明仅是本发明技术方案的概述,为了能够更清楚[0050]图1为本发明实施例提供的一种基于OSCAR的图文检索模型训练方法的流程示意[0056]本申请实施例提供一种基于OSCAR的图文检索模型训练方法,该训练方法的执行[0059]本发明实施例中,可以从指定的开源的自然语言学习模[0062]具体地,基于预训练的OSCAR模型生成图像特征表示和文本特征表示的步骤,包9[0065]在一个示例中,利用预训练于VisualGenome数据集上的FasterR_CNN模型提取[0066]2)获取训练集中的文本样本,采用分词技术将文本样本划分为多个标记,基于[0072]本实施例中,将获取的图像嵌入和文本嵌入输入至OSCAR视觉语言模型中的单个Transformer模型来获得图像和文本的联合特征表示,再通过平均池化将图像的局部特征[0080]3)基于核函数计算每个负样本与锚点样本q之间的相似度以及对应的权重,进行负样本与锚点样本q之间的相似度以及对应的权重,进行加权平均获得多个不同难度的负[0096]本发明实施例基于InfoCMR提出一种全新的损失函数,用于对比不同来源的正负相似度和负相似度的集合,Scv表示锚点样本为文本样本时正相似度和负相似度的集合;些高斯噪声向量与批处理中的每个样本形成高置信度的负样本对,有助于平滑表示空间。[0101]本发明实施例提供的一种基于OSCAR的图文检索模型的训练方法,利用视觉语言预训练模型OSCAR对图像样本和文本样本进行特征提取,通过负样本合成模块生成不具有[0102]请参阅图2,为本发明实施例提供的一种采用如上述方法训练得到的图文检索模[0104]基于图文检索模型中的文本编码器对目标文本进行特征提取,得到文本特征表[0105]基于图文检索模型中的图像编码器对目标图像进行特征提取,得到图像特征表[0106]基于文本特征表示及图像特征表示,确定目标文本在目标图像中的图像检索结括外部存储设备。存储器20不仅可以用于存储安装于计算机设备的应用软件及各类数据,还可以用于暂时地存储已经输出或者将要输出和线路连接整个电子设备的各个部件,通过运行或执行存储在存储器20内的程序或者模总线或扩展工业标准结构(extendedindustrystandardarchitecture,简称EISA)总线[

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论