CN115393949B 一种连续手语识别方法及装置 (河北大学)_第1页
CN115393949B 一种连续手语识别方法及装置 (河北大学)_第2页
CN115393949B 一种连续手语识别方法及装置 (河北大学)_第3页
CN115393949B 一种连续手语识别方法及装置 (河北大学)_第4页
CN115393949B 一种连续手语识别方法及装置 (河北大学)_第5页
已阅读5页,还剩35页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Cui,ZC.Spatial-temporaltransformerforend-to-endsignlanguagerecognition.识别方法是将原始手语视频通过随机删减的方频的预测序列与手语文本序列进行WER计算;进行网络级训练,对最终的手语识别结果进行输2S3、通过以Spatial_TemporalTransformer网步骤S3中所用编码器是兼顾时间和空间的编码器结构,S3_1、将步骤S2中的训练数据作为输入视频,先进行Embedding和PositionalS3_2、将Embedding和PositionalEncoding后的向进入STTN编码模块之后,先利用维度变换操作将向量P的帧数T放到第一维度batch_size,S3_3、对解码器依次进行三部分操作:①MaskedMulti_HeadSelf_Attention,②LayerNormalization;解码器的注意力计算包括手语文本之间的自注意力计算以及注意步骤S4中所用的解码器包括三个子层组成,第一个子层=D的大小,此投影输出即为patchembedding;此时featuremap大小为BxTxNxD,N=h3.根据权利要求1所述的连续手语识别方法,其特征是,步骤S3_1中,Positional3步骤S3_2中的时间注意力和空间注意力的计算方式均为SelfAtKV对所有的P0/P1向量分别进行三次线性变换,所有向量又衍生出三个新的向量tK对向量Z0和向量Z1进行特征拼接操作,经LayerNormalization和FeedForS3_3_2、手语文本之间的自注意力计算时,Multi_headaS3_3_4、注意力输出与编码器输出的交叉注意力计算时,Q为编码器的输出,K=V=通过线性层,将解码器堆栈生成的向量投影到一个更大的向量,成为logits向量,再由softmax层将其转换为概率,选择最高的概率单元生成与其相关联的词作为当前时间步的47.一种连续手语识别装置,其特征在于,该装预处理模块,分别与手语视频提取模块和手语识别网络训练模块相接语视频帧进行patch操作,为Spatial_TemporalTransformer网络提供序列化的手语视频所述预处理模块包含patch操作部和embedding网络;所述embedding网络包括patch_手语识别网络训练模块中的所述STT编码部包括有多层编码器,每层编码器包括一个手语识别网络训练模块中的所述解码部包括多层解码器,每层解码器包括三个子层;5[0004]CN202010083258.8号专利公开了一种基于对多模态图像序列特征融合和自注意手语图像序列和光流图像序列时空特征的提取和多模态图像序列时空特征融合和手语句[0006]本发明的目的就是提供一种基于Spatial_TemporalTransformer的连续手语识62因为原始的transformer的self_attention不含有位置的信息,但是手语视频帧存在非常cet)(1)et)(2)将时间维度t放到第一维度batch上,对空间维度n个向量块进行动态的空间相关性注意力[0024](1)SpatialSelf_AttentionBlock仅对同一帧的不同token进行MSA计算,空间7[0028](2)TemporalSelf_AttentionBlock仅对不[0030]S3_1、将步骤S2中的训练数据作为输入视频,先进行Embedding和Positionalae)(6)el)7)[0033]其中:pos对应token再序列中的位置,起始token位置记为0,2i和2i+1表示[0034]S3_2、将Embedding和PositionalEncoding后的向量作为STT向量进入STTN编码模块之后,先利用维度变换操作将向量P的帧数T放到第一维度batch_8LayerNormalization;解码器的注意力计算包括手语文本之间的自注意力计算以及注意分完的矩阵在axis=0维上进行concat链接;对V和K进行同样的操作;操作后的矩阵记为=matDec,计算过程与手语文本之间的自注意力的计算相同;在Add&Norm层的操作同9模型架构不一致问题,这是由于预测阶段使用sequencemasked可以保持重复的句子预测[0058]由softmax层将logits向量转换为概率,选择最高的概率单元生成与其相关联的[0060]本发明手语识别方法首先采用patch操作对手语视频帧进行预处理,使其大小尺[0061]在复杂背景下用提出的密集分割网络过滤掉冗余的背景[0062]本发明手语识别方法是基于Transformer改进的手语识别网络,通过时间和空间色手语视频帧进行patch操作,为Spatial_TemporalTransformer网络提供序列化的手语络包括patch_embedding网络和positional_述STT编码部利用预处理模块输出的输入帧,通过时间和空间双通道进行动态空间相关性[0071]本发明手语识别装置通过在预处理模块中设计了patch操作,将手语视频帧进行[0082]图10是STTN网络在RWTHPHOENIX_Weather_2014(PHOENIX14)数据集上的训练效果练和验证网络模型打基础的。Spatial_TemporalTransformer网络包括一个向量化模块、一个编码器以及一个解码器。向量化模块包含了patch操作,Patch_embedding和PositionalEncoding操作;编码器包括时间注意力计算机制和空间注意力机制以及前馈[0089]对输入图像进行预处理使得图像达到固定维度并进行分块操作。本步骤中,频作为验证集。RWTHPHOENIX_Weather_2014(PHOENIX14)数据集预处理后视频数量为6841(B是batch_size,H,W是原始图像的分辨率,C是通道数)的手语视频帧中的每一帧重塑层上使用恒定的隐矢量dmodel,将图块展平投影映射到dmodel=D的大小,此投影输出即为。因为原始的transformer的self_attention不含有位置的信息,但是手语视频帧存在非常cet)(1)ae)(2)[0095]步骤S3:通过以Spatial_TemporalTransformer网络中的编码器作为时空编码将时间维度t放到第一维度batch上,对空间维度n个向量块进行动态的空间相关性注意力[0100](1)SpatialSelf_AttentionBlock仅对同一帧的不同token进行MSA计算,空间[0104](3)TemporalSelf_AttentionBlock仅对不[0106]S3_1、将步骤S2中的训练数据(此处仅利用预处理后的训练集)作为步骤3的输入其中PositionalEncoding计算公cet)(6)ae)7)[0109]其中:pos对应token再序列中的位置,起始token位置记为0,2i和2i+1表示了[0110]S3_2、将Embedding和PositionalEncoding后的向量作为S向量进入STTN编码模块之后,首先,利用维度变换操作将向量P的帧数T放到第一维度码模块对维度变换后的向量P1进行时间注意力的计算,计算后的向量记为Z1;其中是时间阵分别对所有的P0/P1向量进行三次线性变换,于是所有的向量又衍生出三个新的向量qt,ktt记作键矩阵K,将所有的向量vt拼成一个大矩阵,记作值矩阵V(分别见图7中的“查询”、[0122]S3‑3、对于解码器和Encoder一样,依次需要三部分操作:①MaskedMulti‑HeadSelf‑Attention,②Multi‑HeadEncoder‑DecoderAttention,③FeedForward意力输出与编码器输出的交叉注意力计算。计算方式与编码器部分的multi‑head经网络是时间驱动的,只有当t时刻运算结束了,才能看到t+1时刻的词。而Transformer再由softmax层将其转换为概率,选择最高的概率单元生成与其相关联的词作为当前时间[0130]本发明提出了patch操作+STTN网络手语识别的策略。Patch操作可极大化地降低编码器和空间编码器模块组成。其中时间编码器是对所有T帧进行时间维度长期相关性的编码和特征提取,空间编码器是对每帧的所有N块进行空间维度动态相关性的编码和特征K_,V_;Q_矩阵相乘K_的转置(对最后2维),生成结果记为[0140]S4_4、对outputs进行softmax运算,更新outputs,即outputs=softmax(outputs);最新的outputs(即K和Q的相关性)矩阵相乘V,其值更新为outputs;最后将层FeedForward,也就是两层卷积操作,对outputs进行第一次卷积操作,结果更新为不一致问题,这是由于预测阶段使用sequencemasked可以保持重复的句子预测结果是一[0146]由softmax层将logits向量转换为概率,选择最高的概率单元生成与其相关联的语视频帧进行patch操作,为Spatial_TemporalTransformer网络提供序列化的手语视频[0151]预处理模块包含patch操作部和embedding网络;所述embedding网络包括patch_embedding网络和positional_encoding网络。手语识别网络训练模块中的所述STT编码部[0152]为了进一步证明本发明提出的STTN模型的有效性,本发明实施例在CSL100和RWTHPHOENIX_Weather_2014(PHOENIX14)公共数据集上进行手语识别实验,与其他基于深[0155]由表1可见,本发明提出的STTN网络的在CSL100数据集上的识别错误率降至[0156]本发明在RWTHPHOENIX_Weather_2014(PHOENIX14)公共数据集上实验

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论