《语音增强算法研究的文献综述》3000字_第1页
《语音增强算法研究的文献综述》3000字_第2页
《语音增强算法研究的文献综述》3000字_第3页
《语音增强算法研究的文献综述》3000字_第4页
《语音增强算法研究的文献综述》3000字_第5页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

语音增强算法研究的文献综述在1950年左右,注重语音增强算法自贝尔实验室开始的。1960年,经典谱减法由施罗德首次实现。学者Boll在20世纪70年代中期再次研究初始的谱减法。和学者施罗德截然不同,学者Boll研究谱减法在数字范围内,所采用的是模拟法。该方法包括两个关键的假设,第一个假设是语音信号中的噪声为稳定性较强的噪声,噪声不会出现较大波动;第二个假设是噪声和原始语音信号之间几乎不存在关联性REF_Ref70835242\n\h[2]。此算法原理具体为:第一需要预测噪声的功率谱,然后将其带噪语音的功率谱出去,产生语音信号的增强功率谱REF_Ref70835715\n\h[3]。虽然该方法并不复杂同时实现过程较为简单,但它会产生语音失真和音乐噪声。对振幅谱的感知对于听者来说很容易,但对相位谱的感知却有很大的不同REF_Ref71384077\n\h[4]。之后,重构初始语音信号能够借助估计原有的语音信号的噪声语音信号的相位谱以及功率谱得到,就此产生语音增强信号。算法实现较简单,但仍然存在噪声产生干扰。在上个世纪八十年代初期,学者Berouti致力于改进谱减法语音效果:通过添加阈值及修正系数,谱减法的性能因为系数的加入得到了提升。但该算法的不足在于系数的确定通常需要一定经验的积累,这也导致其普适性低。此外,音乐噪声仍未完全消除。为了解决这个瓶颈,学者西姆与奥本海姆选择维纳滤波方法,有利于提升语音信号的信噪比例REF_Ref71387926\n\h[5]。1990年左右,学者Harim等将振幅谱作为依据产生创新型的方法,也就是最小均方误差短时振幅谱(MMSE-STSA)算法REF_Ref71387944\n\h[6]。之后他们又从听者的感受出发,对MMSE-STSA算法进行了进一步的改进,即Log-MMSE-STSA增强算法。这类语音增强算法只是在平稳环境下有较好表现。于是1987年,学者卡尔曼(Kalman)的研究成果为滤波语音增强算法。具有明显优势,对于经典维纳滤波起到不充足作用,通过时域上的状态空间手段在一定程度上缓解了不稳定的环境中最低均方误差条件下的的最优估计问题REF_Ref71610161\n\h[7]REF_Ref70841747\n\h。但是缺陷为适应性因为信号的提取模式而较差,缩小应用范围。后来语音降噪的研究开始侧重于语音谱统计方法。当今Cohen提出的最小控制迭代平均法是比较普遍的噪音估计方法。随后他在此基础上提出了进一步的改进方法。该学者的研究成果是最优修正对数频谱振幅估计算法REF_Ref71391316\n\h[8]。估计误差通过OMLSA算法得到的更小,自然噪声估计效果好于以往。传统的语音增强方法由于其历史悠久,计算简便,被应用于大部分工业界实际产品;然而却只是对简单且具有一定分布的噪声有良好的降噪能力,对日常不规则的噪音却束手无策。这时人工智能领域的方法表现出很好的效果。1990年,语音增强领域出现不同类型的监督学习的方法。将隐马尔可夫模型作为基础衍生出的方法属于第一类。学者Ephraim等人,将语音识别的思想作为基本依据进而研发出创新型的语音增强算法。其具体应用是在不同的隐马尔可夫模型上模拟纯语音和噪声,对噪声做出相应的预测,从而达到语音增强的目的REF_Ref70835242\n\h[2]REF_Ref70835242\n\h。在深层神经网络出现之前,能够将语音特征作为基本依据形成适用性较强的模型,然而在语音方面存在诸多假设,包括纯语音与噪声之间有单一的假设以及高斯假设。第二类:以矩阵的非负矩阵为基础进一步分解语音增强算法模型的具体方法REF_Ref70835715\n\h[3]。该过程借助单独训练,将复语音信号矩阵进一步分解,划分成纯信号矩阵语音矩阵以及含噪语音矩阵,产生自含噪语音至清晰语音的线性映射关系REF_Ref70847277\n\h[9]。然而该映射关系不能使语音信号复杂的特点构造过程产生良好的效果。第三类则是基于浅层神经网络。该方法的思想是在语音增强算法中嵌入神经网络,包括反向传播算法在神经网络中的实践过程,能够得到有噪声参与的映射的纯语音。原来的人工神经网络办法由于缺乏练习数据信息以及隐含层层数并不多,使结果并不理想。同时区域化最优以及过拟合问题频繁出现,因为隐含层数量增加,此办法逐渐跟不上形势。学者Hinton的研究成果为深度信念网络和无监督算法有效地处理了局部最优和过拟合问题REF_Ref71391586\n\h[10]REF_Ref70848528\n\h。第四类方法是21世纪产生的监督方法,也就是将深层神经网络作为基础的深层拟合作用把神经网络适当融入到语音增强过程中。这使得网络能够近似于噪声语音和纯语音之间的未知函数映射REF_Ref70835715\n\h[3]。还有一种基于特征映射的增强方法,通过网络将语音的幅度谱特征自有噪特征映射至纯特征REF_Ref70857390\n\h[11]。另外还有将理想时频作为基础掩蔽估计的增强方式,具体功能为把降噪任务转变为估计噪声主导或语音主导的任务REF_Ref71391804\n\h[12]。再者就是以信号近似为基础的语音降噪方法,它在对语音信号进行估算与练习网络时采用频域掩蔽的方式。深度学习的概念首次于2006年被GeoffreyHinton教授提出,并在2012年被一些互联网公司微软、谷歌等融入到语音识别范围中,并且产生良好的反馈,所以更多学者探究以深度学习作为基础的语音增强的算法。吕旭刚等于2003年发表了一种基于去噪自动编码器的语音增强算法REF_Ref71391901\n\h[13];彭川REF_Ref71392025\n\h[14]等人研究基于深度学习的语音增强算法,也就是借助深度学习模型学习带噪语音和纯净语音存在的映射关系,能够维持带噪语音信号的识别程度以及质量水平。张馨等人REF_Ref70835715\n\h[3]深度神经网络的方法运用对于语音增强起到良好效果,通过对于深度神经网络的数据分析能力能够拟合带噪语音与纯净语音存在的一定映射关系,其实验证实了特征联合改进的具体方法能够对于低信噪比带噪语音的语音质量以及识别程度有积极意义,能够有效改善语音失真的现象。学者魏泉水等人REF_Ref70835242\n\h[2]致力于探究将谱减法和深度神经网络互相融合的语音增强算法,有效缓解深度神经网络语音增强算法过程中训练库要求噪声种类较多的实际问题,有利于增加语音增强的实际效果。李湑等人REF_Ref71386575\n\h[15]基于特征映射的深度神经网络型组合,其研究成果为动态语音感知训练方法,能够动态噪声感知训练互相融合,该学者尝试将动态语音与动态噪声联合感知训练融合应用于语音增强,在改善语音质量的同时也提高了可懂度。KounovskyREF_Ref71392252\n\h[16]验证了卷积网络在使用客观标准语音质量感知评估在测量期具备优质的性能,在较低的信噪比水平下,基于映射的网络在估计两种结构的对数功率谱方面的性能始终优于基于掩蔽的网络。JeonKMREF_Ref71387926\n\h[5]等采用了基于原始波形的全卷积网络语音增强模型,系统以端到端(即波形输入和波形输出)的方式进行语音增强。研究得出将深度以及卷积神经网络作为基础的模型对波形高频分量的恢复能力有限,从而导致增强语音的可懂度下降;而提出的全卷积神经网络(FullyConvolutionalNetwork,FCN)模型不仅能很好地恢复波形,并且在较短的时间内客观识别程度和PESQ方面也优于基于LPS的DNN基线。本文在传统方法的基础上研究了基于卷积神经网络的语音增强算法的实现。参考文献HanW,WuC,ZhangX,etal.SpeechEnhancementBasedonImprovedDeepNeuralNetworkswithMMSEPretreatmentFeatures[C]//InternationalConferenceonSignalProcessing,Chennai,India,2016:1140-1145.魏泉水.基于深度神经网络的语音增强算法研究[D].南京大学,2016.张馨.基于深度神经网络的语音增强算法研究[D].哈尔滨工业大学,2019.LimJS,OppenheimAV.Enhancementandbandwidthcompressionofnoisyspeech[J].ProceedingsoftheIEEE,1979,67(12):1586-1604.JeonKM,ParkNI,KimHK,etal.Multi-bandspectralsubtractionbasedzoom-noisesuppressionfordigitalcameras[C].IEEEInternationalConferenceonConsumerElectronics.2013:401-402.EphraimY,MalahD.Speechenhancementusingaminimum-meansquareerrorshort-timespectralamplitudeestimator[J].IEEETransactionsonAcoustics,SpeechandSignalProcessing,1984,32(6):1109-1121.谭乔来.语音增强方法研究及应用[D]:[硕士学位论文].湖南:湖南师大学,2008.CohenI.NoiseSpectrumEstimationinAdverseEnvironments:ImprovedMinimaControlledRecursiveAveraging[J].IEEETransactionsonSpeechandAudioProcessing,2003,11(5):466-475.KangTG,KwonK,ShinJW,etal.NMF-BasedSpeechEnhancementIncorporatingDeepNeuralNetwork[C]//AnnualConferenceoftheInternationalSpeechCommunicationAssociation,Singapore,2014:2843-2846.E.Hinton,SOsindero,YWTeh.AFastLearningAlgorithmforDeepBeliefNets[J].NeuralComputation,2006,18(7):1527-1554.XuY,DuJ,DaiL,etal.AnExperimentalStudyonSpeechEnhancementBasedonDeepNeuralNetworks[J].IEEESignalProcessLetters,2014,21(1):65-68.韩伟,张雄伟,闵刚等.基于感知掩蔽深度神经网络的单通道语音增强方法[J].自动化学报,2017,43(2):248-258.XugangLu,YuTsao,ShigekiMatsuda,etal.SpeechEnhancementBasedonDeepDenoisingAutoencoder[C]//InternationalConferenceonInterspeech.Lyon:SpeechCommunicationPress,2013:436-440.彭川.基于深度学习的语音增强算法研究与实现[D].电子科技大学,2020.李湑.单声道语音增强关键技术研究[D].重庆邮电大学,2019.KounovskyT,MalekJ.Singlechannelspeechenhancementusingconvolutionalneuralnetwork[C].Electronics,Control,Measurement,Signals&TheirApplicationtoMechatronics.IEEE,2017./leixiaohua1020/article/details/47276353陈欢,邱晓晖.改进谱减法语音增强算法的研究[J].计算机技术与发展,2014,24(4):75-77./yhcwjh/article/details/112598893HyvarienA.FastandRobustFixedpointAlgorithmsforIndependentComponentAnalysis.IEEETrans.OnNeuralNetwork.1999,10(3):626~634.HyvarienA.“FastandRobust

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论