CN115376118B 一种街景文字识别方法、系统、设备和介质 (广东工业大学)_第1页
CN115376118B 一种街景文字识别方法、系统、设备和介质 (广东工业大学)_第2页
CN115376118B 一种街景文字识别方法、系统、设备和介质 (广东工业大学)_第3页
CN115376118B 一种街景文字识别方法、系统、设备和介质 (广东工业大学)_第4页
CN115376118B 一种街景文字识别方法、系统、设备和介质 (广东工业大学)_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

WO2022111355A1,2022.06.02本发明公开了一种街景文字识别方法、系的轻量级实例分割模型对街景图像进行检测识的场景文本检测模型对中间文本区域进行文本2通过预设的场景文本检测模型检测所述中间文本区域,确定场景文通过预设的文本识别模型识别所述目标文本区域内的目标字符,确定所述预设的轻量级实例分割模型包括多个轻量级层、特征金字塔网通过所述预测类别处理层对所述语义特征图进行预测,得到多个预测按照所述预测类别分别采用所述预测框分割对应的所述类别像素概所述预测类别处理层包括原型特征分割层和实例类别预测层;所述通过所述通过所述实例类别预测层对所述语义特征图进行预测,得到所按照非极大值抑制算法分别去除所述预测类别对应的多个所述候选框内重复的候选将全部所述原型特征图分别与对应的所述目标特征系数相乘,分别按照所述预测框分割对应的所述类别像素概率图,按照预设的分割阈值选取所述初始类别像素分割概率图,得到所将全部所述目标类别像素分割概率图与所述街景图像相乘,生成3计算所述二值化区域内白色区域对应的最小外接矩形,计算所述顶点坐标对应的投影变换矩阵,结合预设的通过所述特征提取层提取所述中间文本区域内的多个场通过所述推测层推测所述场景特征图对应的预测概率图按照所述预测概率图和所述阈值图对应的像素点,结合预设的近似二通过所述卷积网络层提取所述目标文本区域内的多个文本特征图通过所述循环网络层分别计算所述文本特征序列对应通过转录层采用归一化指数函数计算所述后验概率矩阵内每列数值对应的文字概率将全部所述目标字符作为所述街景图像对应的初始文本区域分割模块,用于当接收到街景图像时,通4执行时实现如权利要求1_5任一项所述的5前人工智能应用的方向之一。街景文字识别是一个光学字符识别(OpticalCharacter6[0019]按照非极大值抑制算法分别去除所述预测类别对应的多个所述候选框内重复的[0034]按照所述预测概率图和所述阈值图对应的像素点,结合预7[0040]通过转录层采用归一化指数函数计算所述后验概率矩阵内每列数值对应的文字概率序列;[0041]分别选取所述文字概率序列内的最大值,将所述最大值对应的字符作为目标字[0046]目标文本得到模块,用于通过预设的场景文本检测模型文本特征所在的目标文本区域。通过预设的文本识别模型识别目标文本区域内的目标字文本检测模型和文本识别模型分别实现文本区域划定以及文本识别操作,不仅识别效率8实例分割模型采用轻量级改进yolact深度神经网络算法对街景图像中文本区域进行检测余的像素值均被置0,使用轻量级改进yolact深度神经网络在光照差异或是背景复杂的情[0062]初始文本区域是指街景图像经过轻量级实例分割模型分割处理后得到保留街景9[0065]中间文本区域是指采用二值化算法以及轮廓检测算法确定初始文本区域内的文层和训练好的推测层。特征提取层采用3*3的卷积核提取中间文本区域内的多个场景文本[0069]目标文本区域是指将中间文本区域输入场景文本检测模型进行检测后得到的文和转录层。卷积网络层通过多次卷积操作提取目标文本区域内有用信息即多个文本特征域进行投影转换将初始文本区域内的文本由原来的大小和位置转换为自定义的标准大小除,再结合场景文本检测模型和文本识别模型分别实现文本区域划定以及文本识别操作,分割模型,轻量级实例分割模型的主干网络(Backbone)由五个轻量级的Shufflenet层组成,通过Shufflenet层分别对街景图像进行特征提取,输出语义特征的尺寸分别为112×特征以及高层次的语义特征。将输出的语义特征传送至特征金字塔网络层进行下一步处[0083]在本发明实施例中,将语义特征图并行输入原型特征分每个候选框对应的坐标以及与Protonet分支输出的32个原型mask特征图一一对应的32个[0086]S13、按照非极大值抑制算法分别去除预测类别对应的多个候选框内重复的候选[0087]在本发明实施例中,由于PredictionHead分支输出预测类别对应的多个候选框[0089]在本发明实施例中,将Protonet分支输出的32个原型mask特征图分别与PredictionHead分支所生成的一一对应32个目标特征系数相乘,得到每个预测框中待分后,由于该目标像素分割概率图为包含预测类别检测概率以及类别像素分割概率的掩码[0103]在本发明实施例中,白色区域是指二值化区域内的文本区域即像素值为255的区型的特征提取层提取中间文本区域的主干即通过3*3的卷积核提取中间文本区域内的多个[0142]S54、通过转录层采用归一化指数函数计算后验概率矩阵内每列数值对应的文字概率序列。部分使用的是DBNet以及CRNN两个深度网络,分别实现目标文本区域划定以及文本识别操[0154]图像文本得到模块304,用于通过预设的文本识别模型识别目标文本区域内的目[0168]初始文本区域生成子模块,用于将全部目标类别像素分割概率图与街景图像相ROM之类的电子存储器。存储器具有用于执行上述方法中的任何方法步骤的程序代码的存算机程序被处理器执行时实现如上述任一实施例说对现有技术做出贡献的部分或者该技术方案的全部或部分可以以软件产品的形式

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论