CN119418345A 基于VMamba框架和通道-空间注意力机制的场景文本检测方法 (南京信息工程大学)_第1页
CN119418345A 基于VMamba框架和通道-空间注意力机制的场景文本检测方法 (南京信息工程大学)_第2页
CN119418345A 基于VMamba框架和通道-空间注意力机制的场景文本检测方法 (南京信息工程大学)_第3页
CN119418345A 基于VMamba框架和通道-空间注意力机制的场景文本检测方法 (南京信息工程大学)_第4页
CN119418345A 基于VMamba框架和通道-空间注意力机制的场景文本检测方法 (南京信息工程大学)_第5页
已阅读5页,还剩34页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于VMamba框架和通道-空间注意力机制的框架采用可变形卷积构建可变形VMamba特征编2步骤S1,获取包含文本的场景图像参考样本数据集,步骤S2,基于VMamba框架采用可变形卷积构建可变形V步骤S4,构建傅里叶特征解码器,用于根据文本实例特征步骤S201,采用Stem模块将输入可变形VMamba特征将第二尺寸特征图、第三尺寸特征图、第四尺寸特征图输入卷积核大小为3x3的可变;通过插值和最大池化的方法基于多尺度文本实例特征图获得平3基于通道空间注意力机制构建GASM模块,并将平衡特征图中的通道维度排至最后一将通道增强后的特征图划分为目标数量的分组,其中每个分组对混洗后的特征图进行卷积操作,并采用批量归一化和ReLU激活函数通过全连接层将平衡后特征图的输入通道数降维,使用ReLU激活函数对;;采用批量归一化和ReLU激活函数以稳定训练过程并进行非线性变将混洗后的特征图和空间注意力图逐像素相乘,获得GASM模块输;;对逐像素增强后的文本实例特征进行卷积,分别获取用于预测每对分类结果进行归一化操作,获得识别文本区域的概率分布和识别文4通过阈值化操作提取文本区域掩模图中文本区域对应的傅里叶特征向采用基于文本实例类别和傅里叶特征向量的损失函数对自输入到输出方向由可变形样本增广模块,用于获取包含文本的场景图像参考样本数据集,对参特征编码器构建模块,用于基于VMamba框架采用可变形卷积构建可变形GASM模块构建模块,用于采用插值和最大池化方法,根据多尺场景文本检测模型生成模块,用于构建傅里叶特征解码器,用56步骤S202,将图像补丁顺序输入至可变形VMamba特征编码器的第一Stage、第二;通过插值和最大池化的方法基于多尺度文本实例特征图获得平利用嵌入式高斯非局部注意力机制对平衡语义特征进行精炼,并获得平衡特征基于通道空间注意力机制构建GASM模块,并将平衡特征图中的通道维度排至最7;;[0011]在其中一个实施例中,对混洗后的特征图进行卷积操作,并采用批量归一化和中的复杂关系进行建模,再通过第二7x7的卷积层将特征图的通道数恢复至混洗后的大;;文本区域的分类结果和预测每个像素的傅里叶级数的概率分布;将文本区域得分和文本中心区域得分进行加权乘积得到逐像素的分类得分采用基于文本实例类别和傅里叶特征向量的损失函数对自输入到输出方向由可变形VMamba特征编码器、GASM模块和傅里叶特征解码器构成的待训练网络结构进行训练,8[0016]图1为一个实施例中基于VMamba框架和通道一空间注意力机制的场景文本检测方9本特征,通过连通分量分析(CCA,ConnectedComponentAnalysis)或滑动窗口(SW,有限。研究人员提出SLPR(Adeeplearningbasedchineseshiplicenseplate可能缺乏全局连贯性。TextMountain和MOST(AMulti_OrientedSceneTextDetector致训练数据不够;传统的场景文本检测模型所采用的视觉基础架构缺乏长程依赖建模能同质性和局部性,通过可变形卷积优化VMamba框架强调十字形激活的局限,构建可变形本增广方面,通过引入数据增强策略帮助场景文本检测模型更好地学习到数据的内在规步骤S202,将图像补丁顺序输入至可变形VMamba特征编码器的第一Stage、第二;步骤S201,将步骤S1生成的增强样本图像送入可变形VMamba编码器提取文本特个由4×4的卷积组成的Stem模块将输入图像划分为4×4的补丁,以便于之后的VSSBlockStage1即为第一Stage、Stage2即为第二Stage、Stage3即为第三Stage、Stage4即为第四Stage1中输入大小为96x200x200的特征图,并经过两个VSSBlock模块,每个Stage2中输入大小为96x200x200的特征图,先经过一层下采样将特征图的尺寸变为192x100x100。除了输入尺寸与输出尺寸不同外其余均和Stage1相同,即经过两个Stage3中输入大小为192x100x100的特征图,先经过一层下采样将特征图的尺Stage4中输入大小为384x50x50的特征图,先经过一层下采样将特征图的尺寸的十字形激活机制在捕捉复杂局部文本信息时的局限性,使用如下公式所示的可变形卷积于局部前景感受野的能力:;其中x(p)和y(p)分别表示输入特征图和输出特征图在p位置的特征,和pk分别第三尺寸特征图、第四尺寸特征图输入卷积核大小为3x3的DConv中,从而得到可变形VMamba特征编码器输出的多尺度文本得到第一尺寸特征图,经过下采样和两个VSSBlock模块得到第二尺寸特征图并输入卷积核大小为3x3的DConv,经过下采样和八个VSSBlock模核大小为3x3的DConv,经过下采样和两个VSSBlock模核大小为3x3的DConv。通过插值和最大池化的方法基于多尺度文本实例特征图获得平利用嵌入式高斯非局部注意力机制对平衡语义特征进行精炼,并获得平衡特征基于通道空间注意力机制构建GASM模块,并将平衡特征图中的通道维度排至最;;中的复杂关系进行建模,再通过第二7x7的卷积层将特征图的通道数恢复至混洗后的大;;S2中获得的多尺度文本实例特征图,使用通过插值和最大池化的方式缩放到中间层大小,;;;;;[0038]其中,ωs为空间注意力过sigmoid函数处理后得到通道注意力图,通道注意力图与输入特征图逐像素点乘;经过文本区域的分类结果和预测每个像素的傅里叶级数的概率分布;将文本区域得分和文本中心区域得分进行加权乘积得到逐像素的分类得分采用基于文本实例类别和傅里叶特征向量的损失函数对自输入到输出方向由可变形VMamba特征编码器、GASM模块和傅里叶特征解码器构成的待训练网络结构进行训练,步骤S403,采用复值函数f()来描述任意封闭的文本轮廓,令f为周期性函数,周;;;;下公式所示:;;[0043]如上所述的各实施例所涉及的流程图中的至少一部分步骤可以包括多个步骤或[0044]

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论