CN115620265B 基于深度学习的机车标志牌信息智能识别方法及系统 (华南理工大学)_第1页
CN115620265B 基于深度学习的机车标志牌信息智能识别方法及系统 (华南理工大学)_第2页
CN115620265B 基于深度学习的机车标志牌信息智能识别方法及系统 (华南理工大学)_第3页
CN115620265B 基于深度学习的机车标志牌信息智能识别方法及系统 (华南理工大学)_第4页
CN115620265B 基于深度学习的机车标志牌信息智能识别方法及系统 (华南理工大学)_第5页
已阅读5页,还剩41页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Detection-RecognitionApproachf1358-1365页.基于深度学习的机车标志牌信息智能识别本发明公开了基于深度学习的机车标志牌2所述的预分类结果包括单一文本标志牌、单行文本标志牌步骤312,利用方向分类器判断所述的文本区域中的文本方向,若文本方向为纵向文步骤317,将所述的视觉特征、CLS特征和编码文量为仅包含文本语义信息的单一特征,所述第二位置向量为视觉语义融合信息的融合特步骤31101,输入图像经过金字塔结构的ResNet5步骤31102,将所述的4种不同尺度的特征上采样;f,=Linear(xz),q,=Linear(fs);3ff;值图进行轮廓查找得到文本检测框result;;的LSTM输入输出关系为output=LSTM(input)+input,其中input表示输入,output表示输步骤31303,通过Attention解码出预测字符的概初始化尺寸均为1xc1的全零特征向量so和yo,作为Attention中Decoder模块初始4;;其中,wi为输入向量x'在位置i上的位置编码,wi,所述的视觉特征网络包括视觉骨干网络与注意力模块,其中,所述的视觉骨干网络为将所述的视觉特征向量经过激活全连接后获得尺寸为T2x1的注意力图;将所述的注意力图点乘视觉特征向量,并在第一个维度C2x1的视觉特征。将视觉特征向量X、CLS特征X和编码文本特征向量X按顺序组合成新的特征向量xrorai,将新的特征向量xrorai送入Transformer中进行信息聚合,通过添加掩膜M控制信息聚合路径,得到融合特征向量xruse,xruse=Transformer(xroran,M);其中,Linear1、Linear2和Linear3分别为三次独立的线性变换;变换维度D归一化后经过softmax生成向量的注意力5;所述的融合特征向量的第一位置向量为仅包含10.根据权利要求2所述的基于深度学习的机车标志牌信息智能识别方法,其特征在11.根据权利要求2所述的基于深度学习的机车标志牌信息智能识别方法,其特征在12.根据权利要求1所述的基于深度学习的机车标志牌信息智能识别方法,其特征在步骤325,将所述的视觉特征、CLS特征和编码文量为仅包含文本语义信息的单一特征,所述第二位置向量为视觉语义融合信息的融合特13.根据权利要求1所述的基于深度学习的机车标志牌信息智能识别方法,其特征在614.根据权利要求1所述的基于深度学习的机车标志牌信息智能识别方法,其特征在16.根据权利要求1所述的基于深度学习的机车标志牌信息智能识别方法,其特征在17.一种基于深度学习的机车标志牌信息识别系统,其应用为权利要求1_16任一项所18.根据权利要求17所述的一种基于深度学习的机车标志牌信息识别系统,其特征在7与传统汽车行驶所见的道路交通标志牌相比,机车标志牌可供铁路维护人员从事线路检[0006]二是标志牌的类别与其文本区域位置是强相关的,这是一般图像不具有的特8[0007]三是部分标志牌中的文本内容具有强烈语义信息,即文本内容与类别信息强相关。在提取标志牌类别信息时,传统的深度学习分类算法直接将图像通过CNN或者[0008]现有的利用图像与文本多模态信息进行分类的任务大多为给定图像与其文字描9f对二值图进行轮廓查找得到文本检测框result;X为按比例缩放至预设尺寸的图像;连接的LSTM输入输出关系为output=LSTM(input)+input,input其中表示输入,[0050]初始化尺寸均为1xc1的全零特征向量so和yo,作为Attention中Decoder模块[0051]将编码特征EnFeat与so进行线性映射,两者相加与tanh操作后,再进行一次线[0055]重复上述操作,直到输出,将进行线性映射后得到概率向量码出文本。[0061]经过视觉骨干网络后所得的视觉特征向量尺寸为T2XC2,其中,为向量长寸为c2x1的视觉特征。[0065]将视觉特征向量、CLS特征X和编码文本特征向量X按顺序组合成新的特征向量xrorai,将新的特征向量xrorai入Transformer中进行信息聚合,通过添加掩膜M控制[0066]x[0068]将输入的新的特征向量xrorai向量通过三次独立的线性变换,分别得到查询序列K以及价值序列V:线性变换维度归一化后经过softmax生成向量的[0073]将注意力权重图Map与价值序列进行矩阵乘法得到最终的融合特征向量xruse=Map-v;所述的融合特征向量的第一位置向量为仅包含文本语义信息的单一特[0125]图1示出了本发明实施例的流程示意图。基于深度学习的机车标志牌信息智能识[0134]经过ResNet34网络进行特征提取后,经过一层线性层与softmax操作获得类别概动增强方案增强对低对比度标志牌的鲁棒性;同时针对类别差异达104数量级的类别长尾与5*5的核对图像的文本区域进行膨胀操作,膨胀后的结果将得到不存在文字的标志牌背[0142]创建与标志牌图像尺寸相等的全0矩阵Mask,并根据标注将其中的文本区域值f[0176]与传统的DBNet算法仅利用融合特征进行反卷积操作得到概率图与阈值图不X为按比例缩放至预设尺寸的图像;连接的LSTM输入输出关系为output=LSTM(input)+input,其中input表示输入,output表示输出;[0187]初始化尺寸均为1xc1的全零特征向量so和yo,作为Attention中Decoder模块[0188]将编码特征EnFeat与so进行线性映射,两者相加与tanh操作后,再进行一次线[0192]重复上述操作,直到输出,将进行线性映射后得到概率向量本当成集合中的元素进行独立编码。例如,对于一个由两段文本组成的序列,而集合位置编码将每段文本作为[0201]经过视觉骨干网络后所得的视觉特征向量尺寸为T2XC2,其中,T2为向量长c2为向量维度;寸为c2x1的视觉特征。[0205]将视觉特征向量X,、CLS特征X和编码文本特征向量X按顺序组合成新的特征向量xrotal,将新的特征向量xrotai送入Transformer中进行信息聚合,通过添加掩膜M控[0208]将输入的新的特征向量xroral向量通过三次独立的线性变换,分别得到查询序列K以及价值序列V:线性变换维度归一化后经过softmax生成向量的[0213]将注意力权重图Map与价值序列进行矩阵乘法得到最终的融合特征向量xruse=Map-v;所述的融合特征向量的第一位置向量为仅包含文本语义信息的单一特

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论