CN119400196A 基于分布式光纤声波传感系统的语音增强方法 (齐鲁工业大学(山东省科学院))_第1页
CN119400196A 基于分布式光纤声波传感系统的语音增强方法 (齐鲁工业大学(山东省科学院))_第2页
CN119400196A 基于分布式光纤声波传感系统的语音增强方法 (齐鲁工业大学(山东省科学院))_第3页
CN119400196A 基于分布式光纤声波传感系统的语音增强方法 (齐鲁工业大学(山东省科学院))_第4页
CN119400196A 基于分布式光纤声波传感系统的语音增强方法 (齐鲁工业大学(山东省科学院))_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于分布式光纤声波传感系统的语音增强本申请公开了一种基于分布式光纤声波传感系统的语音增强方法,涉及语音增强技术领块,编码器模块的输出端依次连接第一个方法得到的增强后的时域语音信号的时域波形而且也具有更多的与原始语音信号相同的语音2S1、利用分布式光纤声波传感系统采集初始时S2、对初始语音数据集中的时域语音信号样本序上下文相关性信息进一步增强的特征序列;第一个GRU模块用于获得具有关键语音特征S4、利用训练集和SmoothL1损失函数对语音增强S5、将待增强的语音信号依次进行分帧处理和2.根据权利要求1所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征将初始时域语音信号按照4s为一个时域语音信号单元的长度进行切3.根据权利要求1所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征4.根据权利要求1所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征支单元聂以及与两个分支单元聂相连接的Add层;两个分支单元聂的输入端均与和第二个Reshape层输出端连接的Add层的5.根据权利要求1所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征36.根据权利要求5所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征7.根据权利要求5所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征8.根据权利要求1所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征9.根据权利要求8所述的一种基于分布式光纤声波传感系统的语音增强方法,其特征S4_1、将原始语音信号按照S1所述分帧处理步骤进行数计算预测的增强后的复数频谱和目标复数频谱之间的损失值,并利用AdamW优化器优化S4_2、将验证集的复数频谱输入至步骤S4_1更新完epoch达到预设的200次后,将200次利用验证集的复数频谱验证语音增强网络的过程中得4增强方法通常对基于DAS采集系统采集的噪声源较多的语音信号进行语音增强的效果较一个GRU模块用于对第二个TCNS模块输出的特征序列进行处理,得到具有关键语音特征的丰富关键语音特征和高维特征的复数频谱特征图;解码器用于得到预测的增强的复数频5相连接的Add层;两个分支单元聂的输入端均与和第二个Reshape层输出端连接的Add层的频谱特征图的实部进行处理,得到预测的增强实部;第二个分支单元聂用于对与第二个Reshape层相连接的Add层所输出的复数频谱特征图的虚部进行处理,得到预测的增强虚卷积单元所输出的预测的增强虚部通过与二者连接的Add层进行相加,得到预测的增强后的卷积块和第二个分支单元聂中的反卷积块采用跳跃6[0013]优选地,步骤S3中,六个TCNBlock层中一维扩张因果卷积层的膨胀率d按照公式TCNBlock层,具体也可以表述为:TCNS模块包括依次连接的第一个TCNBlock层、第二个层,上述第一个TCNBlock层所处的层数即为1,同理,上述第二个TCNBlock层至第六个失函数计算预测的增强后的复数频谱和目标复数频谱之间的损失值,并利用AdamW优化器S4_2、将验证集的复数频谱输入至步骤S4_1更新完模型参数的语音增强网络中,当训练次数epoch达到预设的200次后,将200次利用验证集的复数频谱验证语音增强网络的过程中得到的损失值最小的那个训练段epoch保留的参数,作为语音增强网络的最终模一步增强的特征序列;第一个GRU模块用于对第二个TCNS模块输出的特征序列通过更新门7与第二个Reshape层相连接的Add层则用于对第二个Reshape层输出的复数频谱特征图和编码器模块中Add层输出的高维特征图进行相加,得到具有丰富关键语音特征和高征图的实部经过第一个分支单元聂中五个依次连接的反卷积块以及一个反卷积单元的处的虚部经过第二个分支单元聂中五个依次连接的反卷积块以及一个反卷积单元的处理后,个分支单元聂中反卷积单元所输出的预测的增强虚部通过与二者连接的Add层进行相加,波动明显减小,这说明本申请所述语音增强方法能够有效抑制初始时域语音信号中的噪图7为初始时域语音信号、原始语音信号以及本申请所述语音增强方法基于初始8语音信号样本的后2s时域语音信号是和与其相邻的后一个时域语音信号样本的前2s时域测试集,包括以下步骤:从初始语音数据集中随机选择300个时域语音信号样本构成测试9器用于获得融合有实部深层特征和虚部深层特征的高维特征图,第一个Reshape层用于将性信息进一步增强的特征序列;第一个GRU模块用于对第二个TCNS模块输出的特征序列进特征序列进行处理,得到具有丰富关键语音特征的特征序列;第二个Reshape层将第二个GRU模块输出的具有丰富关键语音特征的特征序列转化为复数频谱特征图;与第二个Reshape层相连接的Add层则用于对第二个Reshape层输出的复数频谱特征图和编码器模块中Add层输出的高维特征图相加,得到具有丰富关键语音特征和高维特征的复数频谱特征解码器模块包括两个结构相同的分支单元聂以及与两个分支单元聂相连接的Add层;两个分支单元聂的输入端均与和第二个Reshape层输出端连接的Add层的输出端相连模块中Add层的输出端还与和第二个Reshape层输出端连接的Add层的输二个卷积块的输出端还与第一个分支单元聂中位于第四个反卷积块和第五个反卷积块之四个卷积块的输出端还与第一个分支单元聂中位于第二个反卷积块和第三个反卷积块之二个卷积块的输出端还与第二个分支单元聂中位于第四个反卷积块和第五个反卷积块之四个卷积块的输出端还与第二个分支单元聂中位于第二个反卷积块和第三个反卷积块之中位于第一个反卷积块和第二个反卷积块之间的Add层输入端连接;第一个分支单元聂中的反卷积单元和第二个分支单元聂中的反卷积单元与连接第一个分支单元聂和第二个分TCNBlock层,具体也可以表述为:TCNS模块包括依次连接的第一个TCNBlock层、第二个层,上述第一个TCNBlock层所处的层数即为1,同理,上述第二个TCNBlock层至第六个征图进行特征相加,得到融合有实部深层特征和虚部深层特征的高维特征图,第一个Reshape层将Add层输出的特征图展平为一维特征序列;第一个TCNS模块对第一个Reshape相关性信息进一步增强的特征序列;第一个GRU模块用于对第二个TCNS模块输出的特征序列通过更新门和重置门来控制特征序列中的信息的存储与遗忘,有效滤除不必要的信息,出的具有丰富关键语音特征的特征序列转化为复数频谱与第二个Reshape层相连接的Add层则用于对第二个Reshape层输出的复数频谱特征图和编码器模块中Add层输出的高维特征图相加,得到具有丰富关键语音特征和高维特图的实部经过第一个分支单元聂中五个依次连接的反卷积块以及一个反卷积单元的处理分支单元聂中反卷积单元所输出的预测的增强虚部通过与二者连接的Add层进行相加,得增强且空间噪音减小的特征图;Add层用于将PReLU激活层输出的特征图以及SGE模块输出减小的融合特征图。本申请中采用的SGE模块与论文《SpatialGroup_wiseEnhance:输出的特征图进行批量归一化操作;PReLU激活层用于对批量归一化层输出的特征图进行于对PReLU激活层输出的特征图进行通道特征的重排以及注意力的调整,得到具有关键语用的SA_NET模块与论文《SA_Net:ShuffleAttentionforDeepConvolutionalNeural进行随机失活处理,第二个Dropout层的失活率参数设置为0.2;Add层则用于将第二个Dropout层输出的特征序列以及用于输入给一维扩张因果卷积层的特征序列进行特征相一维扩张因果卷积层提取的语音信号的时序相关性信息的尺的复数频谱即为目标复数频谱;将训练集的复数频谱输入语音增强网络中前向传播一次,计算预测的增强后的复数频谱和目标复数频谱之间的损失值,并利用AdamW优化器优化损S4_2、将验证集的复数频谱输入至步骤S4_1更新完模型参数的语音增强网络中利用验证集的复数频谱验证语音增强网络的过程中得到的损失值最小的那个训练段epoch中CED_GRU网络的网络结构为编码器模块_GRU模块_将本申请图2所示的语音增强网络中依次连接的第一个TCNS模块、第二个TCNS模请中CED_TCNS网络的网络结构为编码器模块_TCNS模块_利用本申请中测试集的复数频谱对语音增强网络、CED_GRU网络以及CED_TCNS网这四种测试指标作为评价本申请所述语音增强方法以及上述三种语音增强方法的语音增[0034]从表1中可以发现,本申请所提出的语音增强方法在四个评价指标中均取得了最高的得分,本申请所述语音增强方法得到的增强后的时域语音信号在PESQ指标上达到了述语音增强方法得到的增强后的时域语音信号的语本申请所述语音增强方法得到的增强后的时域语音信号在STOI指标上达到了述的语音增强方法在对于分布式光纤声波传感系统采集的原始时域语音信号进行增强时,可以有效提升分布式光纤声波传感系统采集的原始时域语音信号的清晰度和本申请所述语音增强方法得到的增强后的时域语音信号在PSNR指标上相较于初始时域语音信号提升了19.72dB,在SI_SDR指标上相较于初始时域语音

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论