基于协同发音现象的一种汉语语音合成方法_第1页
基于协同发音现象的一种汉语语音合成方法_第2页
基于协同发音现象的一种汉语语音合成方法_第3页
基于协同发音现象的一种汉语语音合成方法_第4页
基于协同发音现象的一种汉语语音合成方法_第5页
已阅读5页,还剩4页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第24卷第6期2003年6月小型微型计算机系统MINI-MICROSYSTEMSVol124No.6June2003基于协同发音现象的一种汉语语音合成方法张钦李辉戴蓓倩(中国科学技术大学电子科学与技术系,安徽合肥230026)摘要:在目前汉语语音合成常用的波形编码合成方法中,通常是以单音节作为语音合成的声音基元.但是由于合成时音节连接处往往不能很好的过渡,导致合成语音自然度不是很好.本文针对这个问题通过对汉语中协同发音现象的研究,提出了一种新的合成声音基元选取策略,在单音节合成单元基础上增加了部分自然语音中的音节连接段作为合成单元,使用该策略结合TD2PSOLA算法进行语音合成,合成语音的自然

2、度较通常的波形合成法有了较大的提高.关键词:汉语语音合成;协同发音;TD2PSOLA算法中图分类号:TN912.3文献标识码:A文章编号:100021220(2003)0621091204ANewMandarinSpeechSynthesisBasedonCoarticulationZHANGQin,LIHui,DAIBei(DepartmentofElectronicScienceandTechnology,UniversityofSandT,efeiChina)Keywords:mspeechsynthesis;coarticulation;TD2PSOLA1引言目前,语音合成常用的的方法

3、大致可以分为三种类型1:波形编码合成法、参数合成法和规则合成法,这三种方法各有优缺点.汉语语音合成目前最常用的方法是波形编码合成法(以下简称波形合成法),这是因为汉语国标二级字库有6768个汉字,但其对应的单音节的发音(单个字的发音)仅为1300个左右,因此采用单音节作为合成声音基元进行拼接合成,可实现汉语无限词汇的语音合成,而且通常这种波形拼接方法较之其它两类合成方法有着更好的清晰度和可懂度,但是由于汉语中丰富的韵律变化和存在的协同发音现象,简单的将单个字发音波形直接进行拼接合成方法得到的合成语音与实际连续语音往往有着很大的区别,主要表现在合成单元之间连接处的谱包络、幅度、基频等声学特性不能

4、较好的还原,导致得到合成语音机器味很浓,自然度不好.显然,如果采用词、词组乃至部分句子作为合成声音基元,由于合成单元连接处大大减少,自然度会相应的大幅度提高,但是存储空间也会急剧膨胀.因此,如何在语音合成单元存储容量有限的条件下,进一步提高合成语音的自然度一直是波形编码合成法研究的主要问题.针对以上问题,本文提出了一种新的波形合成方法,该方法基于一种对汉语语音中协同发音现象的合成声音基元选取策略,通过对汉语语音中协同发音现象的研究,在单音节合成单元基础上增加了部分自然语音中的音节连接段作为合成单元,以便保留大部分音节之间过渡段的声学特性,使合成语音过渡自然.然后再用TD2PSOLA(时域基音同

5、步叠加)的方法根据对语音进行拼接、平滑,以及对语音进行音调、时长、音高等韵律特征调整,从而使最后的合成语音在自然度上有了较大的提高.2协同发音现象和声音基元的选取我们知道单个字的发音和该字在词组乃至句子中的发音常常并不是完全相同的,有时候甚至差别很大,这是由于一方面在连续语音中音节的音调、音长和音高等特征发生了变化,另一方面由于协同发音作用引起了音节与音节之间的共振峰过渡,这种过渡对音节信息虽然不重要,但却影响语音的自然度2.对于前者,通常用TD2PSOLA算法可以较好的加以调整,但是对于后者,由于PSOLA算法只能对基音频率进行修改的局限性,对协同发音时共振峰特征的这种变化无能为力.基于这个

6、问题的考虑,我们在选取单音节作为主要合成声音基元的基础上,增加部分音节间过渡段作为辅助合成声音基元.显然,增加音节间过渡段的方法不可避免的导致合成收稿日期:2001209221基金项目:国家自然科学基金资助课题(69872036)资助;安徽省科学基金项目(01042205)资助作者简介:张钦,硕士研究生,主要研究方向为语音信号处理.1092小型微型计算机系统2003年基元的大量增加,如果将所有的单音节之间的过渡段都保留下来,那存储量将是惊人的,也是不现实的.因此我们需要对汉语单音节之间的关系作一定的研究,看能否去除不必要的过渡段.事实上,通过对词的音节过渡部分的分析,我们发现确实有一定的规律可

7、循,不必要将所有的过渡段都保留,甚至可以说只需要少量的音节间过渡段作为合成声音基元.下面我们就此问题进行研究讨论.根据已有的汉语知识,我们知道汉语单音节的发音可分为二种情况,即声母+韵母的情况和只有韵母的情况.如果我们从一个发音起始和结束的角度考虑,一个单音节发音的结束只有两种情况:以元音结束和以鼻音结束;而其开始可以分为爆破音(包括塞擦音)、摩擦音、鼻音和元音四种情况.显然,一个词的各个音节之间的过渡段包含的是前一个音节的结束部分和后一个音节的开始部分,协同发音现象正是发生在这一过渡段当中.我们挑选了包含各种不同情况下组合的大量词语,通过对这些词语的研究分析并结合文献345的研究结果,我们发

8、现大致可以将词语的音节过渡部分划分为以下三种类型:类型1:当前一音节的结束部为元音,为元音或摩擦音时,两个音节的谱包络()过渡,自然过渡.类型2:,无论前一音节,音节连接处有一段短暂的静音,因此过渡段不需要保留作为合成基元,在合成时直接将两个单音节进行拼接合成即可.类型3:当前一音节的结束部或者后一音节的起始部为鼻音时,音节连接处音素会受到鼻音的一些影响,但是整个鼻音部分的频谱特性依然是稳定的.这种情况下,从存储容量的角度考虑可以不需要将过渡段作为合成基元.具体对应情况如表1所示.表1音节间过渡段类型Table1Typesoftheintermediatesegmentbetweenthesy

9、llables音节间过渡段类型元音鼻音后一音节的起始部爆破音摩擦音鼻音元音22133313加的这部分合成基元能使合成语音的自然度有较大提高.3TD-PSOLA算法和声音基元的连接3.1基音同步叠加算法90年代初,MoulinesE,CharpentierF.提出了TD2PSO26sm(n)=hm(tm2n)s(n)(1)其中tm为基因标注点,hm(n)为窗函数,一般取汉明窗,窗长为原始信号的两倍.x(n)=s(n)h(t-h(t-n)qqqqn)q(3)qq其中,x(n)代表合成波形,tq为合成语音的基音同步标志,hq(n)表示合成窗函数,q是用来调整合成信号能量的因子,sq(n)是合成语音的

10、短时信号,它由原始语音的短时加窗信号sm(n)根据基音同步标志tm>tq的变化得到.从上面的研究结果可以看到,并不是任何时候都会产生明显的协同发音现象,而是主要出现在类型1的音节过渡部分,因此我们在进行语音合成时对声音基元的选择可分为两种情况,分别是出现类型1的情况和出现类型2、3的情况.对于后者,我们只需选择单音节作为合成基元即可;而对于前者,为了考虑协同发音的影响,除了选择单音节以外还选择相应的音节间过渡段作为合成基元.由于并不需要将所有的可能出现的音节过渡段都保留作为合成基元,合成基元并不会显著的增加,而从后面的实验可以看到,因考虑协同发音而增图1TD2PSOLA算法改变原始语音波

11、形的音长和音调示意图Fig.1IllustrationoforiginspeechlengthandtonechangedbyTD2PSOLA在实际使用的时候公式(3)可以近似简化为下式x(n)=s(n)qqq(4)6期张钦等:基于协同发音现象的一种汉语语音合成方法1093语音合成系统中,在根据需要选择好需要拼接的声音基元后,接下来就是基元的拼接合成.针对前面谈到声音基元出现的两种情况,在对基元进行合成连接时需要分别处理.只有单音节基元的情况比较简单,只需直接连接即可;而对于有过渡段基元情况下,需要去掉前后音节分别与过渡段叠加的部分.拼接得到的合成语音,从图中可以看到基元波形连接处相位是一致的

12、,幅度变化也比较平滑,从而保证了合成语音的质量.4实验结果和分析为了检验本文提出的声音基元选取方法对提高合成语音(a)(b)考虑协同发音的合成语音谱图图2直接波形拼接语音合成Fig.2Directlyconcatenatedsynthesizing但是需要注意的是,在合成过程中进行声音基元拼接时,直接对波形拼接会造成波形连接处的相位失配和幅度突变,因此在拼接时需要进行一定的处理.从前面的TD2PSOLA算法我们知道,利用同步叠加算法的基音同步标志可以解决拼接时相位失配的问题;而通过改变能量因子q,可以解决拼接处波形幅度突变的问题.采用直接波形拼接与采用TD2PSO23所示.LA算法波形拼接的合

13、成语音波形分别如图2、(c)不考虑协同发音的合成语音谱图图4词语“饥饿”的原始语音与合成语音的频谱图Fig.4Spectrogramoforiginandsyntheticspeechofwordhungry自然度的有效性,我们分别采用考虑协同发音与采用不考虑图3TD2PSOLA算法波形拼接语音合成Fig.3TD2PSOLAsynthesizing从图2可以看到,直接对波形进行拼接合成的语音在拼接处产生了基音周期和幅度的突变,基音周期的突变是由于相位失配引起的;图3是采用同步叠加算法对声音基元进行图5直接波形拼接的合成语音波形Fig.5Directltyconcatenatesynthesiz

14、ingspeech协同发音两种方法,做了大量词语的合成语音对比试验,并将试验结果与自然语音也做了比较,实验表明考虑协同发音1094小型微型计算机系统References:2003年合成出来的语音较不考虑(a)非常接近,主观听感的自然度也确实更好.1ChenXiao2qin.Thedevelopmentofchinesetext2to2speechsystem.Computer&Communication,1998(3):14J2222Linguistics,1990(16):2115Tse,Kwow2ping.Productionandperceptionofsyllablefinaln图6经TD2PSOLA算法平滑的合成语音波形Fig.6TD2PSOLAsynthesizingspeech在整个语音合成系统的后期合成处理过程中,我们采用TD2PSOLA算法对基元进行连接合成以及合成语音的韵律调整,取得了较好的效果.如图5、6所示,经过TD2PSOLA算法平滑以后的合成语音与平滑前有较大改善.由于篇幅的关系,本文没有讨论采用TD2PSOLA算法对合成语音进行韵律调整的内容,具体可以参考文献7.StudiesinEnglishLiteratureandLinguistics,andngJ1992(18):143156456SpeechCommunicat

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论