版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
相似图像的第一描述文本及非相似图像的第二定相似图像及非相似图像与训练图像之间的相优化图像检索模型,得到优化后的图像检索模2采用图像检索模型分别将所述第一描述文本、所述第二描述文本与分别确定所述相似图像与所述训练图像之间的第一相似度基于所述目标损失值对所述图像检索模型进行模型优化,得到优化后的图像检索模采用第一损失函数根据所述第一相似度及所述第二相似度确定第一损损失值用于指示所述图像检索模型的图像准确率与图像准确率优化采用第二损失函数根据所述第一概率和所述第二概率确定第二损失值用于指示所述图像检索模型的文本准确率与文本准确率优化目标之根据获取到的各个权重,对所述第一损失值和所述第二损失值进行采用所述图像检索模型,对所述相似图像进行图像特征提取,得到所根据所述相似图像的图像全局特征预测得到所述相似图像的参考描采用掩码符号对所述多个参考文本词中的目标数量个参考文本基于所述相似图像的图像全局特征及所述参考描述文本中未被掩码符号掩盖的参考采用所述各个掩码符号掩盖的参考文本词所对应的预测文本词,3获取所述第一描述文本的文本特征、所述训练图像的图像根据所述文本特征、所述图像区域特征以及所述对象标签特征获取所述第一图像语义特征所指示的语义信息与所述训练图像获取所述任一图像的图像全局特征以及所述训练图确定所述任一图像的图像全局特征与所述训练图像的图像全局特征之间的特征相似将所述特征相似度作为所述任一图像与所述训练图像之间采用所述优化后的图像检索模型,基于所述输入图像从至少一个候选图所述输入图像的图像相似度满足所述相似度条获取所述输入图像的图像全局特征及任一候选图当所述输入图像的图像全局特征与所述任一候选图像的图像全局特征之间的特征相获取单元,用于获取训练图像、所述训练图像的相似图像、所述述训练图像进行跨模态匹配,得到所述第一描述文本与所述训练图像相匹配的第一概率,模型优化单元,用于基于所述目标损失值对所述图像检索模型进行4计算机存储介质,所述计算机存储介质存储有一条或多条条计算机程序适于由所述处理器加载并执行如权利要求1-9任一程序,所述一条或多条计算机程序适于由处理器加载并执行如权利要求1-9任一项所述的算机程序适于由处理器加载并执行如权利要求1-9任一项5了传统图像检索方法确定出的图像检索结果的准确该模型优化方法进行模型优化得到的图像检索模型可以检索得到准确度较高的图像检索6[0013]相似度确定单元,用于分别确定所述相似图像与所述训练图像之间的第一相似7备在执行文本模态的训练任务时所采用的文本模态的数据是计算机设备根据相应图像特度以及文本与图像之间的匹配度。基于这种计算思路计算出的目标损失值进行模型优化,加准确的图像特征,进一步也就可以基于该图像特征检索得到准确度较高的图像检索结8[0050]本申请实施例利用的人工智能(ArtificialIntelligence,AI)技术是计算机科处理成为更适合人眼观察或传送给仪器检测的图像。计算机视觉技术通常包括图像处理、[0053]机器学习(MachineLearning,ML)技术及深度学习技术则是一门多领域交叉学习技术是一门专门研究采用计算机模拟或实现人类的学习行为的技术。基于机器学习技9图像生成的图像描述文本,还可以包括基于训练图像的非相似图像生成的图像描述文本,家电、飞行器等。在具体实施例中,终端设备内还可以运行各式各样的应用程序提出的图像检索算法可以检索得到更高准确度的图像检索37.2964.4877.8842.9870.7678.1649.3581.0789.2555.6382.4289.51Image-TextMatching,图像文本匹配的视觉语义推理)与CLIP(ContrastiveLanguage-ImagePre-Training,对比性图文预训练)均可以用于匹配图像和文本。DRLD(Detailedsemanticimage-imageRetrievalviaLearningtoDescribe,基于文本生成的同语义图像检索)为本申请实施例提出的一种图像检索方法,该方法中采用的图像检索模型是基[0060]表1中的R@k表示前k个结果的召回率(k=1或5或10)。召回率(RecallRate)也叫索模型根据图像A从图像库中检索k个结果后,这k个结果中存在的相似图像的数量与图像该模型优化方案的具体实现原理进行详细说明。该模型优化方案的具体实现原理可以如图像检索模型可以检索得到更加准确的图像检于负样本图像库进行难样本挖掘之后确定出来的。基于难样本挖掘后确定出的非相似图施例中基于难样本挖掘方式确定出的非相似图像可以与训练图像包含相似或相同的对象,[0076]实际应用时,在计算机设备将第一描述文本与训练图像进行跨模态匹配的过程一致的预训练)模型的网络,或者,用于构建LXMERT(一种视觉语言跨模态框架)模型的网[0084](1)计算机设备先构建一个文本序列,该文本序列主要用于后续表达相应图像的例性地,词特征可以是计算机设备采用图像检索模型中的词嵌入层对[CLS]标识符以及各[0086](3)计算机设备采用同样的方式对各个对象标签进行特征提取,以得到各个对象[0087](4)计算机设备基于各个区域特征整合得到图像区域特征,在计算机设备确定出[0088](5)计算机设备可以采用图文预训练网络基于输入特征进行自注意力学习,得到相应图像的图像全局特征。示例性地,计算机设备可以将图文预训练网络的隐藏层中,[CLS]标识符对应的输出特征作为图像全局特征。图文预训练网络的隐藏层主要用于对输检索模型可以确定出更加准确的图像全局特征以及预测出表达能力更强的图像描述文本。索模型的目标损失值时,还利用了相似图像的第一描述文本与训练图像之间的匹配概率,[0096]基于上述模型优化方案以及图2所示的模型优化方法的相关描述,本申请实施例[0101]其中,计算机设备根据相似图像的图像全局特征以及训[0102](1)计算机设备先获取相似图像的图像全局特征,进而根据相似图像的图像全局[0103](2)计算机设备可以采用掩码符号(如:[MASK]符号)对多个参考文本词中的目标够保证图像检索模型能够将文本模态的训练任务中产生的相关模型损失值进行梯度回传,进而使得计算机设备后续能够基于相关损失函数对图像检索模型底层的模型参数进行优[0104](3)计算机设备可以基于相似图像的图像全局特征以及参考描述文本中未被掩码为目标文本词),计算机设备获取该目标文本词对应的预测文本词的一种具体可行方式可测查询词表V中各个候选文本词的预测概率。预测概率可以用于指示相应候选文本词当前图像检索模型根据相似图像的图像全局特征来预测参考描述文本中被掩盖的参考文本词图像特征来对文本序列中的[MASK]对应的参考文本词进行预测还原,得到相应[MASK]掩义信息相同的概率,向量元素b可以表示图像描述文本的语义信息与训练图像所表达的语练图像的图像区域特征以及对象标签特征构建输入特征(具体实现方式可以参见步骤S203合理程度,从而使得计算机设备可以进一步地基于获取到的逻辑合理程度来确定第一概第二图像语义特征所表达的图像语义应该与训练图像的实际图像语义信息具有较大语义|可以表示相似图像以及非相似图像中相应图像的图像全局特征的模,||vec2||则可以表本申请实施例中计算机设备可以基于第一损失值对图像检索模型中特征提取网络进行优示训练图像的图像全局特征与相似图像的图像全局特征之间的特征相似度;表示训练图像的图像全局特征fy与非相似图像的图像全局特征之间的特征相似度。合图5a所示的第一损失值计算流程图来对相关步骤进[0138]在本申请实施例中,第二损失值可以是计算机设备采用第二损失函数计算出来检索模型将文本和图像进行跨模态匹配时得到的相关匹配度的准确率。在本申请实施例二损失值;表示计算机设备基于相似图像的第一描述文本以及训练图像的图像区域特征和对象标签特征生成的第一图像语义特征。表示计算机设备基于非相似图像的第二描述文本以及训练图像的图像区域特征和对象标签特征生成的第二图像语义特征。合图5b所示的第二损失值计算流程图来对相关步骤进[0144]硬标题生成阶段:针对相似图像以及非相似图像中任一图像(如图5b中的词的预测概率进行平滑处理,以基于平滑处理后的各个预测概率确定出相应的预测文本称:二分类层)基于该图像语义特征预测得到软标题与训练图像相匹配的概率以及软标题[0149]示例性地,本申请实施例中计算机设备可以采用如式7所示的方法确定目标损失[0154]针对本申请实施例提出的模型优化方法(即:图2所示的模型优化方法以及图4所[0163]由于本实施例中候选图像与输入图像之间的图像相似度是基于图文匹配角度以请实施例中用于图像检索的图像检索模型是基于文本模态的数据以及图像模态的数据共[0167]基于上述模型优化方法的相关描述,本申请实施例还公开了一种模型优化装该模型优化装置可以是运行于上述所提及的计算机设备中的一个或多个计算机程序(包括[0170]相似度确定单元703,用于分别确定所述相似图像与所述训练图像之间的第一相损失值用于指示所述图像检索模型的文本准确率与文本准确率优化[0186]基于所述相似图像的图像全局特征及所述参考描述文本中未被掩码符号掩盖的掩盖的参考文本词所对应的预测文本词;[0194]确定所述任一图像的图像全局特征与所述训练图像的图像全局特征之间的特征[0202]当所述输入图像的图像全局特征与所述任一候选图像的图像全局特征之间的特7所示的模型优化装置中的获取单元701来执行,步骤S402可以由图7所示的模型优化装置中的匹配单元702来执行,步骤S403可以由图7所示的模型优化装置中的相似度确定单元703来执行,步骤S404至步骤S406均可以由图7所示的模型优化装置中的损失值确定单元图6所示的步骤S601至步骤S603均可由图7所示的模型优化装置中的图像检索单元706来执[0204]根据本申请的另一个实施例,图7所示的模型优化装置中各个单元是基于逻辑功化装置在执行文本模态的训练任务时所采用的文本模态的数据是模型优化装置根据相应器801以及计算机存储介质802可通过总线或质,当然也可以包括计算机设备所支持的扩展存储介质。计算机存储介质802提供存储空器801加载并执行的一条或多条的计算机程序,这些计算机程序可以是一个或一个以上的适于加载并执行一条或多条计算机程序从而实现相应方法流程或相或多条计算机程序,以实现上述有关图2、图4以及图6所示的方法实施例中的相应方法步损失值用于指示所述图像检索模型的文本准确率与文本准确率优化[0228]基于所述相似图像的图像全局特征及所述参考描述文本中未被掩码符号掩盖的掩盖的参考文本词所对应的预测文本词;[0236]确定所述任一图像的图像全局特征与所述训练图像的图像全局特征之间的特征[0244]当所述输入图像的图像全局特征与所述任一候选图像的图像全局特征之间的特备在执行文本模态的训练任务时所采用的文本模态的数据是计算机设备根据相应图像特度以及文本与图像之间的匹配度。基于这种计算思路计算出的目标损失值进行模型优化,加准确的图像特征,进一步也就可以基于该图像特征检索得到准确度较高的图像检索结设备能够执行上述图2、图4以及图6所示的模型优化方法实施例方面的各种可选方式中提为磁碟、光盘、只读存储记忆
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 学困生辅导制度
- 物业企业停车费收取管理制度
- 教师未请假擅自离岗检讨书
- 人教版新课标六年级下册语文《汤姆索亚历险记》教学设计(表格)
- 智慧黄金店应急管理工作手册
- 牙科诊所员工职业暴露应急处理手册
- 建筑高空作业成本管控工作手册
- 销售工程师团队协作与分工手册
- 驾校网络布线建设规划手册
- 职业院校教材动态更新管理指南
- 2026年中小学教师编制考试教育综合知识全真模拟试题及答案
- 班组安全互保联保制度培训
- (2026年)肠内营养相关性腹泻的预防及护理课件
- 2026年村级集体经济强村公司发展与收益分配规范测试
- 2026年二级造价工程师《建设工程造价管理基础知识》考试真题(答案和解析附后)
- 2026年重庆八中中考语文模拟试卷(3月份)
- 护理教学查房示范课件
- 中原银行校园招聘笔试真题
- JJG 703-2003光电测距仪行业标准
- (高清版)TDT 1071-2022 园地分等定级规程
- 苏教版八年级上册数学全册教学课件
评论
0/150
提交评论