版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
一种基于文本检测和语义匹配的场景文本本发明公开了一种基于文本检测和语义匹先对原始图像进行预处理得到图像区域特征和关系进行融合得到针对场景文本的统一检索模2S1,提取图像的区域特征和图像描述文本的S3,提取出图像中的文本信息即场景文本,并使用f过fastText提取出图像描述文本的单S5-1,将输入的图像和图像描述文本,根据步骤S3和步骤S4得到场景文本和图像描述利用余弦相似度计算得到场景文本和图像描述文本之间句子级别的相似度,用Ss表示S5-2,将输入的图像和图像描述文本,根据步骤S3和步骤S4得到场景文本和图像描述w和Pw的大小分别为k*300和l*300的对St在场景文本维度求得每个单词与图像描述文本的最大相似度,得到长度为k的向3S5-3,将输入的图片和图像描述文本,根据步骤S3和步骤S4得到场景文本和图像描述文本的单词特征O和P,通过使用堆叠交叉注意力机制计算得到两者之间的注意力相似度;最终将所有的单词相似度进行平均操作,得到通过堆叠注意力机2是平衡化参数;2.根据权利要求1所述的一种基于文本检测和语义匹配的场景文本检索模型,其特征i)4最终的单词特征ei通过将瓦和取平均的方式进行融合,使得单词特征融合wi周围句i)使用余弦相似度计算图像特征V和文本特征E的相似度,得到跨模态检索的相似度结其中Δ是超参数,(v,e)表示数据集D中的正样本对,t=argmaxesxesc(v,e')表示v的i=argmaxvxvsc(v',e)表示t的最难负样本,[x]+≡max(0,x),利用三元排序4.根据权利要求1所述的一种基于文本检测和语义匹配的场景文本检索模型,其特征5StanfordCoreNlp中进行语义分析,通过对性筛选,挑选单词词性包含在上述五种词性的单词,最终挑选出k个场景文本用于后续任将最终得到的场景文本通过预训练的fastText模型提取出300维的特征向量,5.根据权利要求1所述的一种基于文本检测和语义匹配的场景文本检索模型,其特征S4-1,对图像描述文本即未处理的单词文本进行词性分析,将图像描述文本送入S4-3,将最终得到的图像描述文本通过预训练的fastText模型提取出300维的特征向6.根据权利要求1所述的一种基于文本检测和语义匹配的场景文本检索模型,其特征37.根据权利要求1-6任一项所述的一种基于文本检测和语义匹配的场景文本检索模型首先将模型加载训练完成的神经网络参数,对于利用图像进图像描述文本之间的相似度并输出与输入图像最相似的前十对于利用图像描述文本进行图像检索,将需要检索的图像描述本检测和语义匹配的场景文本检索模型的执行指令代码或存储程序代码、或权利要求7所述的跨模态检索方法的执行指令代码或存储程6多具有挑战性的任务被关注和研究。跨模态检索(Cross-modalRetrieval)正是其中的一很大的降低了从图像中获取信息的效率,通过跨模态检索可以一定程度上的解决这个问跨模态检索在基于OCR的检索上仍然存在巨大的挑战。目前还为出现一种统一的模型利用一种基于文本检测和语义匹配的场景文本检索方法来提高跨模态检索模型在包含场景文骤得到:7[0013]步骤S1-1,使用预训练好的FasterRC景文本通过预训练的fastText模型提取出[0024]步骤S5-1,将输入的图片和图像描述文本,图像描述文本的单词特征。通过将单词特征进行平均融合分别得到两个句子级别语义特[0025]步骤S5-2,将输入的图片和图像描述文本,根据步骤S2和步骤S3得到场景文本和[0026]步骤S5-3,将输入的图片和图像描述文本,根据8[0031]首先将模型加载训练完成的神经网络参数。对于利用图像进行图像描述文本检与其他图像描述文本之间的相似度并输出与输入图像最相[0033]上述的基于文本检测和语义匹配的场景文本跨模态检索模型和方法均可置于计[0035](1)本发明提出的基于文本检测和语义匹配的场景文本检索方法,通过学习场景[0037](3)本发明通过利用多个层级的文本相似度来进行检索,使得模型能够从整体和[0042]步骤S1,提取图像的区域特征和图像描9[0044]步骤S1-1,给定图像I,使用预训练好的FasterV={vli=1,2,…n,veRA),其中n表示使用FasterRCNN检测到的感兴趣区域个数。表示该单词在词汇表中的位置,使用映射矩阵We将wi映射到300维的向量中,表示为xi=[0051]最终单词特征ei通过将瓦和通过平均的方式进行融合,使得单词特征融合wi周[0053]其中,MLPe表示对应于图像的多层感知机,得到的输入图像的文本特征表示为[0062]其中Δ是超参数,(v,e)表示数据集D中的正样本对,t=argmaxesxesc(v,e')表i=argmaxvxvsc(v',e)表示t的最难负样本,[x]+≡max(0,x),利用三[0063]步骤S3,利用RosettaOCR图像文本提取系统提取出图像中的文本信息即场景文StanfordCoreNlp中进行语义分析。首先通[0068]将最终得到的场景文本通过预训练的fastText模型提取出300维的特征向量。[0073]步骤S4-3,将最终得到的图像描述文本通过预训练的fastText模型提取出300维[0076]步骤S5-1,将输入的图像和图像描述文本,[0078]将图像描述文本的单词进行平均融合,得到当前图像描述文本的句子级别表示PP[0082]步骤S5-2,将输入的图片和图像描述文本,根据步骤S3和步骤S4得到场景文本和词级别的特征,分别表示为[oi,...,ok[0084]对St在场景文本维度求得每个单词与图像描述文本的最大相似度,得到长度为k[0086]步骤S5-3,将输入的图片和图像描述文本,根据[0088]其中si,j表示为第i个场景文本单词和第j个图像描述文本单词之间的相似性。接之后的af和场景文本单词之间的相关性用两者的余弦相似度表示:
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 防暑降温应急预案(15篇)
- 内蒙古2024内蒙古医科大学第二附属医院事业单位招聘考察工作笔试历年参考题库典型考点附带答案详解
- 2026年初中整本书阅读策略研究报告
- 2026重庆九洲隆瓴科技有限公司招聘产品经理测试笔试历年备考题库附带答案详解
- 2026年公共卫生安全治理方案
- 2026湖南港航水利集团启动校园招聘64人笔试历年典型考点题库附带答案详解
- 2026海南陵水黎族自治县数字投资有限公司招聘9人笔试历年难易错考点试卷带答案解析
- 2026年幼儿园户外活动骑小车目标
- 2026年手术室年度工作计划实施方案
- 2026年承租方消防安全责任书
- 内科常用仪器使用规范与操作要点
- DB42T 1049-2015 房产测绘技术规程
- 检验科实习生培训
- 客户走访维护管理制度
- 粮库粉尘清扫管理制度
- 施工现场临时用电安全监理实施细则模版(3篇)
- 介入治疗术后运动康复
- 雷火灸讲义专题知识讲座
- 工程质量安全手册实施细则检查标准 (安全实体控制分册)
- DL-T 1476-2023 电力安全工器具预防性试验规程
- 北师大版六年级数学下册全单元测试题及答案【完整】
评论
0/150
提交评论