CN119400162A 基于多尺度全局卷积网络的语音关键词识别方法及系统 (大连大学)_第1页
CN119400162A 基于多尺度全局卷积网络的语音关键词识别方法及系统 (大连大学)_第2页
CN119400162A 基于多尺度全局卷积网络的语音关键词识别方法及系统 (大连大学)_第3页
CN119400162A 基于多尺度全局卷积网络的语音关键词识别方法及系统 (大连大学)_第4页
CN119400162A 基于多尺度全局卷积网络的语音关键词识别方法及系统 (大连大学)_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于多尺度全局卷积网络的语音关键词识本发明公开了基于多尺度全局卷积网络的多尺度特征融合残差模块输出的语音特征进行最大池化层和全连接层后,得到关键词识别结模型的全局特征感知能力以学习更丰富的特征2通过预卷积块对语音信息进行预处理获得初在多尺度特征融合残差模块中,处理初步语音特征同时降在最终卷积块中,对多尺度特征融合残差模块输出的语音特4.根据权利要求1或3所述基于多尺度全局卷积网络的语音关键词的元素,oi.,代表通道连接后特征中第k个通道第i行第j列的值,Fi代表2D滤波器中第k式(2)展示了多尺度频域卷积的计算过程;其中zi,表示输出特征的第i行第j列的元式(4)表示频域全局卷积的计算过程,频域全局卷积Cfreq中,3多尺度特征融合残差模块,处理初步语音特征同时降低不相关信息对语音特征的干最终卷积块,对多尺度特征融合残差模块输出的语音特征进行处理获得最终语音特于,所述处理器执行所述程序时实现权利要求1_7任一项所述的基于多尺度全局卷积网络该程序被处理器执行时实现权利要求1_7任一项所述的基于多尺度全局卷积网络的语4[0008]本发明的目的在于,提出基于多尺度全局卷积网络的语音关键词识别方法及系56连地表示的方框实际上可以基本并行地执行,或者它们有时也可以按照相反的顺序执行,和/或框图中的方框的组合,可以使用执行规定的功能或操作的专用的基于硬件的系统来[0040]S2.在多尺度特征融合残差模块中音特征先经过多尺度时域卷积和多尺度频域卷积,再进入时域全局卷积和频域全局卷积,78特征经过时域卷积的最终输出。式(3)将两个不同尺度的时域卷积的输出进行融合,其中zi.,代表输出特征中第i行第j列的元素,oi.,代表通道连接后特征中第k个通道第i行第j[0050]多尺度频域卷积过程和多尺度时域卷积过程相似。式(4)展示了将两个不同尺度[0053]式(7)表示特征经过时域全局卷积和频域全局卷积后的逐点卷积操作,从而融合[0054]S3.在最终卷积块中,对多尺度特[0058]使用GoogleSpeechCommandV2_12数据集、MUSAN数据集和BUTSpeech@FITReverberationDatabase数据集进行关键9[0061]BUTSpeech@FITReverberationDatabase是一个混响数据集,旨在支持语音信数据和来自BUTSpeech@FITReverberationDatabase的RIR数据均按8:1:1的比例分成三处理器执行所述程序时实现上述的基于多尺度全局卷积网络的语音关键词识别方法,包[0085]本发明中多尺度时域卷积和多尺度频域卷积能够针对噪音对时域与频域的不同需要付出创造性

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论