CN114944149B 语音识别方法、语音识别设备及计算机可读存储介质 (科大讯飞股份有限公司)_第1页
CN114944149B 语音识别方法、语音识别设备及计算机可读存储介质 (科大讯飞股份有限公司)_第2页
CN114944149B 语音识别方法、语音识别设备及计算机可读存储介质 (科大讯飞股份有限公司)_第3页
CN114944149B 语音识别方法、语音识别设备及计算机可读存储介质 (科大讯飞股份有限公司)_第4页
CN114944149B 语音识别方法、语音识别设备及计算机可读存储介质 (科大讯飞股份有限公司)_第5页
已阅读5页,还剩43页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2基于待识别语音进行语音特征提取,得到语音特征,并基于参考所述待识别语音的语境相关,所述参考语音的发言时间先于所述待识别语音的发言时间,获取前轮解码的解码状态;基于所述前轮解码的解码状态和第一参考特征进行解码,还包括各所述关键词的局部文本特征在所述本轮解码获取各历史轮解码对应的字符特征;其中,所述历史轮解基于各所述关键词在所述本轮解码的第一权重对各所述关键词的第一文本特征进行将所述语音特征和所述本轮解码的融合文本特征进行拼接,得到所述基于所述本轮解码的第一拼接特征,以及所述前轮解码的解码状在对所述前轮解码的解码字符进行注意力处理的过程中还参考所述全局文本特征的基于所述前轮解码对应的第一字符查询特征、各所述历史轮基于所述第二权重、各所述历史轮解码对应的第一字符值特征和所述全局文本特征,36.根据权利要求1所述的方法,其特征在于,所述识别文本基于语音识别模型识别得基于所述样本待识别语音进行语音特征提取,得到样本语音特基于所述样本文本特征和所述样本语音特征,识别得到所述样本基于所述样本识别文本与所述样本实际文本之间的差异语境相关的参考语音识别得到,所述参考语音的发言时间先于所述待识别语音的发言时识别模块,用于基于参考文本特征和语音特征,识别得到包括各所述关键词的局部文本特征在所述本轮解码的4获取各历史轮解码对应的字符特征;其中,所述历史轮解理器运行的程序指令,所述程序指令用于实现如权利要求1至7任一项所述的语音识别方5[0003]语音识别方法大致可以描述为提取待识别语音的语音特征,对语音特征进行识参考语音与待识别语音的语境相关,因此参考文本与待识别语音表达的文本的语境相关,6[0033]在介绍本申请提供的语音识别方法之前,先结合图1对相关技术中语音识别方法7[0037]为了方便理解,列举一些具体的应用场景:当待识别语音表达的句子有发音为申请提及的参考语音/待识别语音的语境,是指参考语音/待识别语音表达的文本的语境,8人乙使用的语音采集设备C在时间段1之后的该同一源语音是会议录音,是对会议中的各个发言人围绕某一会议主题的发言采集得到9过滤,得到关键词1~关键词N;对各关键词进行编码,得到各关键词的局部文本特征H=[0061]语音特征是由多个语音子特征组成的序列,每个语音子或者多个字符组成的词语。基于参考文本特征和语音特征的识别分为多轮(多个时间步),[0062]S12中的识别过程也可以称为解码过程,依据的解码器可以是任意类型的循环神特征辅助语音特征的识别,能够考虑参考文本与待识别语音表达的文本的语境之间的联[0078]解码状态即前面提及的隐藏状态,是在前轮解码过程中对语音特征解码得到转换后的全局文本特征与解码器状态相适应,将其作为前轮解码的解码状态(即隐藏层的[0089]1)在第t轮利用注意力机制对语音特征进行处理,处理后的语音特征Xt的注意力0为全零特征。[0096]1)在第t轮利用注意力机制对语音特征进行处理,处理后的语音特征Xt的注意力[0102]1)在第t轮利用注意力机制对语音特征进行处理,处理后的语音特征Xt的注意力偏置,让解码器的隐藏状态更加偏向对符合待识别语音表达的文本语境的方向进行解码,第一字符查询特征分别与各历史轮解码对应的第一字符键特征、全局文本特征进行匹配,~S322来说,S323~S324对前轮解码的解码字符进行自注意力处理的过征进行注意力处理(方法与前述对第一字符查询特征、第一字符键特征和第一字符值特征[0138]例子4:在对前轮解码得到的解码字符进行注意力处理的过程中参考全局文本特[0140]自注意力模块采用自注意力机制(可以是单头自注意力机制,也可以是多头自注意力机制,本申请后文以多头自注意力机制为例进行说明)对前轮解码得到的解码字符进符键特征K10和第一字符值特征V10;将K10和全局文本特征L拼接,得到第0轮的第二拼接特[0142]2)编码器-解码器注意力模块基于P10对语音特征中第0轮待解码的部分X0进行增[0143]3)全连接层基于增强特征X0’进行非线性变换,以得到第0轮解码的解码字符第1轮的第三拼接特征;将Q11与第1轮的二拼接特征进行匹配,得到第1轮解码的第二权重[0145]5)编码器-解码器注意力模块基于P11对语音特征中第1轮待解码的部分X1进行增[0146]6)全连接层基于增强特征X1’进行非线性变换,以得到第1轮解码的解码字符[0148]例子5:在对前轮解码得到的解码字符进行注意力处理的过程中参考各历史轮解[0151]2)编码器-解码器注意力模块基于P10对语音特征中第0轮待解码的部分X0进行增[0152]3)关键词-解码器注意力模块基于X0’和各关键词的局部文本特征H得到第0轮解[0155]例子6:在对前轮解码得到的解码字符进行注意力处理的过程中参考全局文本特符键特征K10和第一字符值特征V10;将K10和全局文本特征L拼接,得到第0轮的第二拼接特[0158]2)编码器-解码器注意力模块基于P10对语音特征中第0轮待解码的部分X0进行增[0159]3)关键词-解码器注意力模块基于X0’和H得到第0轮解码的第二注意力处理结果P200[0160]4)全连接层基于增强特征X0’进行非线性变换,以得到第0轮解码的解码字符和端侧3,端侧1~3可以进行语音采集和识别,端侧1~3采集语音并进行识别得到的文本(带有时间戳信息)会同步至语音辅助设备(语音辅助设备可以是端侧1~3中的一者,也可待识别语音2的参考文本特征(历史表征1),将历史表征1和待识别语音2输入语音识别模[0165]图16是语音识别模型的结构(需要说明的是,该结构不造成对语音识别模型的限[0168]3)解码器基于参考文本特征和语音特征,识别得到待识别语音的识别结果/识别[0176]进一步地,考虑到实际应用时可能存在待识别语音没有参考语音的情况(例如待的语境相关的参考语音识别得到,参考语音的发言时间先于所述待识别语音的发言时间。征还包括各关键词的局部文本特征在本轮解码的融合从而得到的融合文本特征能够更好地辅助对语音特征的识别。[0188]可以理解的是,通过融合文本特征参与拼接得到第一拼[0190]通过在对前轮解码的解码字符进行注意力处理的过程中还参考全局文本特征,解码的解码字符转换得到。[0199]由于在得到增强特征之后,未直接基于增强特征解码得本轮训练是否满足关于丢弃样本文本特征的训练条件;响应于本轮训练不满足训练条件,执行基于样本文本特征和样本语音特征,识别得到样本待识别语音的样本识别文本的步[0204]可以理解的是,考虑到实际应用时可能存在待识别语音没有参考语音的情况(例如待识别语音表达的是一段话的首个句子的情况),因此在训练过程中通过训练条件来限存取存储器(RAM,RandomAccessMemory)、磁碟或者光盘等各种可以存储程序代码的介

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论