已阅读5页,还剩56页未读, 继续免费阅读
(计算机应用技术专业论文)重音的自动检测和tts系统中重音效果体现.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
重音的自动检测和t t s 系统中重膏效果体现作者:王建 中文摘要 轻重音的研究是使得现有语音合成系统能够进一步提高其表现力的关键,也 是国内语音合成领域研究的热点,同时也是语音感情色彩研究的基础。 本文的研究工作主要集中在轻重音的自动检测、轻重音表达效果在系统中的 体现。主要研究内容包括: 将词性信息有效地利用到轻重音检测模型中。因为国内外研究表明词性是提 高韵律模型效果的一个非常关键属性,但如何在韵律模块中有效地利用词性信息 一直未得到解决。文中采用统计学方法分析、建立了不同词性在韵律参数上的二 维相似度表格,并将此结果直接应用到基于c a r t 的和基于贝叶斯的重音检测模 型中,实验结果表明:利用二维相似度表格提供的先验知识,两种重音检测模型 的效果都有较大的提高。 轻重音自动检测模型的研究。因为重音的自动检测对合成更丰富的语音具有 重要意义,同时可以显著提高语料库中重音的标注效率和标注结果的一致性。文 中通过对影响重音的参数进行分析,得到和短语重音相关性较强的一组声学参 数、韵律环境参数,尤其是弓l 入了基频曲线形状参数。以这些参数作为输入,通 过不同的机器学习方法建立检测模型并进行相互比较,选择其中性能最优的分类 器,最后通过利用先验的重音连接概率信息,有效地提高了整个模型的效果。 语音合成系统中轻重表现力的体现。现有的语音合成系统是基于单元挑选, 而单元挑选算法是基于代价的一个全连接体系。本文提出在现有的代价体系中加 入与重音相关的代价,通过自动训练的方法获得代价权值,同时也采用手工调整 代价方法,最后利用主观评测方法对上述方法得到的效果与原系统进行比较,结 果证明表达力效果有一定的提升但还需要未来更深入的研究。 关键字:语音合成,重音,机器学习,统计,自动检测 糯纂漤i 赣| 舔冀 重音的自动检测和t t s 系统中重音效果体现 作者:王建 a b s t r a c t r e s e a r c h0 ns t r e s si sak e yf o ra d v a n c i n ge x p r e s s i v ef o r c eo fc u r r e n t 丁r s s y s t e m ,a n d i st h eh o ts p o to fd o m e s t i ct r sr e s e a r c ha r e a f u r t h e r m o r e ,t h e r e s e a r c hi st h ef o u n d a t i o no f s p e e c he m o t i o n a lc o l o r i n g t h e p a p e ri sf o c u so na u t o m a t i cd e t e c t i o no fs t r e s s 、r e f l e c t i o no fs t r e s s e f f e c t si n 丁r s s y s t e m r e s e a r c hc o n t e n t sc o m p r i s e : u s ep o s ( p a 懈s p e e c h ) i n f o r m a t i o ni na u t o m a t i cd e t e c t i o no fs t r e s sm o d e le f f e c t i v e l y m a n ys t u d i e sh a v es h o w nt h a tp o si sak e ya t t r i b u t ef o ra d v a n c - i n gp r o s o d ym o d e l b u t t h ep r o b l e mo fh o wu s et h i sa t t r i b u t ee f f e c t i v e l yh a s n t b e e ns o l v e d i nt h i sp a p e r ,as t a t i s t i c b a s e dm e t h o dw a su s e dt oa n a l y s i sa n d c r e a t e st h et w o - d i m e n s i o nt a b l eo ft h ep o ss i m i l a r i t yi np r o s o d yp a r a m e t e r s t h er e s u l tw a s a p p l i e dt ot h ec a r t - b a s e da n db a y e s i a n - b a s e ds t r e s sd e t e c t i o n m o d e l i td e m o n s t r a t e st h a tt h ep e r f o r m a n c eo ft w om o d e la r ea d v a n c e dw h e n a d o p tt h ep n o ri n f o r m a t i o np r o v i d e db yt h ea b o v et a b l e r e s e a r c ho na u t o m a t i cd e t e c t i o no fs t r e s s i no r d e rt os y n t h e s i z em o r er i c h a n dc o l o r f u ls p e e c h ,i t si m p o r t a n tt oa u t o m a t i c a l l yd e t e c tp r o s o d i cp h r a s e s t r e s s ,a n di tc a np r o m o t es t r e s sl a b e l i n ge f f i c i e n c ya n dl a b e lc o n s i s t e n c y b y a n a l y z i n gp a r a m e t e r si n f l u e n c i n gp r o s o d i cp h r a s es t r e s s ,t h ea u t h o rs e l e c t s o m eu s e f u la c o u s t i ca n dp r o s o d i ce n v i r o n m e n t p a r a m e t e r s ,e s p e c i a l l yp i t c h c o n t o u na c c o r d i n gt oa b o v e p a r a m e t e r s , b yu s i n gd i f f e r e n tm a c h i n el e a r n i n g m e t h o d ,t h em e t h o dw i t ht h eb e s tp e r f o r m a n c ei ss e l e c t e d f i n a l l y , p r i o r n - g r a mp r o b a b i l i t yi n f o r m a t i o ni si n t r o d u c e dt oe n h a n c et h ep e r f o r m a n c eo f w h o l ed e t e c t i o nm o d e l t h er e s u l to f e x p e r i m e n ts h o w st h a tt h ew h o l em o d e l h a sg o o de f f e c t 。 1 1 1 er e f l e c t i o no fs t r e s se x p r e s s i v ef o r c ei n1 1 ss y s t e m t h ec u r r e n tt 1 s s y s t e mi sb a s e do nu n i ts e l e c t i o n ,a n du n i ts e l e c t i o na l g o r i t h mi saf u l l - c o n n e c t n e t w o r k 1 1 1 ep a p e r p r o p o s et h a ta d d i n gc o s ti nr e l a t i o nt os t r e s st oe x i s t i n g c o s ts y s t e ma n d g e t t i n gw e i g h to fe a c hc o s tb ya u t o m a t i c t r a i n i n gb e s i d e s h a n d - t u n i n g f i n a l l y , s u b j e c t i v et e s t i n gm e t h o di si n t r o d u c e dt oe v a l u a t ew h i c h 第4 贞共6 3 页 重音的自动捡浏和- r r s 系统中重音效果体现作者:王建 s y s t e mb yd i f f e r e n tm e t h o di st h eb e s ti ne x p r e s s i v ef o r c e t h er e s u l ts h o w s t h a tp e r f o r m a n c eh a sa l i g h te l e v a t i o na n dn e e dam o r ei n d e p t hr e s e a r c hi n f u t u r e k e y w o r d :t r s ,s t r e s s , m a c h i n el e a r n i n g ,s t a u s t j c , a u t o m a t i cd e t e c t i o n 畛誉漾i 篝瀛嚣 重音的自动检测和t t s 系统中重音效果体现作者:王建 第一章绪论 1 - 1 语音合成研究的历史回顾 语音合成的研究历史可以回溯到1 8 世纪,k r a t z e n s t e i n 在1 7 7 9 年研制的机械 式语音合成器,这种会说话的机械,是用风箱模拟人的肺、簧片模拟声带、以皮 革制成的共振腔模拟声道,通过改变共振腔的形状,它可以合成出一些不同的元 音。1 9 3 9 年d u d l e y 第一次按照信号处理的原理设计出一个声音发生器。以一些 白噪音似的激励产生非浊音信号,以周期性的激励产生浊音信号。模拟声道的共 振器是通过一个1 0 阶的带通滤波器建模,模型的增益通过人来控制。 早期的机械式语音合成器反应了人们对语音产生机理了解的e e 较粗略,现代 语音合成的方法基本上都是采用一种语音模型来合成语音。总的说来,近期语音 合成的方法可以归结为三种: 物理机理语音合成 源一滤波器语音合成 基于波形拼接技术的语音合成 其中源一滤波器的合成方法又可以分为l p c 合成和共振峰合成等;另外近些 年,p s o l a ( p i t c h - s y n c h r o n o u so v e r l a pa n da d d ) 方法被广泛的应用在基于波形拼接 技术的语音合成系统中,这种方法可以在一定范围内调节语音信号的基频和时 长,而对语音音质的损伤很小。关于对早期语音合成研究的历史和方法,在k l a t t 中有详细介绍。下面我们将简要介绍语音合成的几种方法。 1 1 1 物理机理语音合成 物理机理语音合成是通过对人产生语音的物理结构进行建模,从而产生语 音,比如,对发音过程中嘴唇、牙齿、下巴等运动进行建模。t t z e 曾经研究过 一个数学模型,这个模型是对声带振动的过程进行建模。但是也有另外一些研究 是对通过声带的气流来建立模型。 近来,物理机理语音合成的研究受到了制约,因为难以将它在现阶段推向实 用。其原因主要在于两个方面:一是对语音产生过程中发声器官的运动和变化进 行度量非常困难,比如说如何精确记录舌位运动和口腔的变化。第二个原因是和 源一滤波器的语音合成模型相比,对通过声道气流特征和运动轨迹的数学建模也 筮6 面婪6 3 百 重音的自动检测和t t s 系统中重音效果体现作者:王建 非常复杂,以及这种模型的计算量非常大。但是目前,随着高性能计算机的出现 和对发音机理的深入了解,很多学者在推动这方面的研究。 最早的言语仿造者是c h r i s t i a ng o t t l i e bk r a t z e n s t e i n ,他曾在1 7 7 9 年以发明声 学共振器而获得皇家学院的奖金。他发明了一套声学共振器,其形状大小有点跟 人类的口腔相似。它用一片模仿人类声带的振动簧片,切断气流,使共振器发出 声音。据报道,c h r i s t i a n 的机器所模仿的五个元音a 、e 、i 、o 、u 还相当准确。 第一个试图用电气方法合成连续语言的机器叫v o d c r ( 语音合成仪 v o i c e - o p e r a t i o nd e m o n s t r a t o r ) ,它曾经在1 9 3 9 年纽约世界博览会和次年旧金山世 界博览会上展出。v o d e r 有两个声源,一个是宽带的噪声源,一个是周期波峰鸣 振荡器。这两种声音通过“共振控制”箱( 即“声道”) 的时候,音色发生改变。 控制箱有l o 个相邻带通滤波器,包括正常语言的频率范围。带通滤波器的输出 通过1 0 个子键的单独操纵,进行增益调整。还有三个附件操纵选择滤波器作瞬 时激励,模仿产生三组塞音:t - d , p - b ,k - g 。操作人员用一条转柄来选择噪音和蜂 鸣声,用一个脚踏板控制蜂鸣振荡器的音高。经训练的操作人员,能够用合成器 相当熟练地奏出易懂的语言。 1 1 2 源一滤波器合成 1 1 2 1 源一滤波器合成基本原理 源一滤波器的语音合成基于这样一种声学理论,这种理论认为声音由激励和。 相应的滤波器形成。其中激励主要分为两种:一种是类似噪声的激励,主要形成 非浊音语音信号;另外一种是周期性的激励,主要产生浊音信号。这两种激励有 时也会共同使用,如产生某些浊辅音信号。在该方式里,音库中预先存放各种语 音合成单元的声道参数,这些参数根据控制规则的要求进行修正,以合成出各种 语言环境下的语音。值得提及的是h o l m e s 的并联共振峰合成器和k l a t t 的串并 联共振峰合成器,只要精心调整参数,这两个合成器都能合成非常自然的语音。 但是,由于准确提取麸振峰参数比较困难,虽然利用共振峰合成器可以得到许多 十分逼真的合成语音,但是在合成某些个别语音时仍达不到预期的音质,从而影 响整体语音合成效果。 i 麟塞j 囊舞涕贾 重音的自动检测和r r s 系统中重音效果体现作者:王建 青觌t振喝,周删1界a , 蟹毋。丢 l 发生器i i 模型 7、,一:、= | ,开关t l 竺竺! 兰兰兰兰 _ 争,7 一 振幅,t 图1 1 源滤波器合成方式结构框图 在参数合成中,合成器的工作流程主要可分成三步: 首先根据待合成音节的声调特性构造出相应的声门波激励源; 然后再根据协同发音、速度变换( 时长参数) 等音变信息在原始声道的基础 上构造出新的声道参数模型; 最后将声门波激励源送入新的声道模型中,其输出就是符合给定韵律特性的 合成语音。 1 1 2 2 几种常见的源一滤波器语音合成方法 l p c 合成和共振峰( f o m a n t ) 合成是传统参数合成中,最常用的两种方法。它 们实现原理上都是上述源滤波器型结构,只是所用声道模型不同。同时,针对 声道模型的特性,在源的选取上略有差别。 1 1 2 2 1l p c 合成方法 l p c 指的是线形预测合成,以线形预测误差滤波器为基础来模拟声道。由于 语音信号存在时域上的相关性,可以考虑用信q x ( n ) 过去的p 个样本来预测当前 值x ( n ) 。 一 p x ( ) = z a x ( n f ) ( 1 - 1 ) 佃l 线形预测误差:e ( n ) = x ( h ) 一工五)( 卜2 ) 在最小均方误差准则( 即e e 2 ( n ) 最小) 下 导到的预测系数a 。就是我们通常 所说的l p c 系数。由最小均方误差准则,可知其应该满足以下公式: 麟:建;熬熊:船覆 苛 爹 合一 匦扩歼 声 广:j - l 重音的自动检测和- r r s 系统中重音效果体现作者:王建 a e _ e ;f z ( n ) :一2 e 【。( 力) z ( 。一j ) :。s ,p ( 1 3 ) 有( 卜3 ) 式易得: p ,( ,) 一z a 。r ( j f ) = 00 ,p ( 1 4 ) 佃i 由上式可以解出所有的预测系数a ,。上述由x ( n ) 得到e ( r 1 ) 的过程可以用以下 线形预测误差滤波过程表示: 兰塑 。厂瓦一型之 1 。,、,一i p 其中爿( :) = 1 一a , z 。 图1 2 线形预测误差滤波器 由图1 2 知:倘若我们己知e ( n ) ,则通过传递函数为1 a ( z ) 的滤波器,同样可以 恢复出x ( n ) 来。 实际中的l p c 语音合成器,正是由下式构造其声道模型 坝z ) :三一( 1 - 5 ) i z a j 乏7 , 因为p ( n ) = 工( 疗) 一x c n ) = x ( ”) 一z a ,x ( n f ) 只是x ( n ) 及其过去样本值的线形组 合,又由( 3 ) 知e e ( i q ) x ( n - j ) = 0 , 可得 e e e ( r 1 ) e ( n j ) = 0j o 由此可见预测误差序列e ( n ) 为一白噪声序列。设 e ,= e e 2 ( 行) 】。= e ( 野) 【x ( 行) 一兰。z 工( 终一f ) 】 ;e ( 。) 羔( 蝴:,( 。一圭口l r 。) i i f l l 第9 页共6 3 页 重音的自动检测和r r s 系统中重音效果体现作者;王建 则取h ( z ) 中的增益因子g = 、厂万时,只要在输入端送入一单位方差的白噪声序 列,就可以在最小均方误差准则下恢复出原始语音信号来。 j 塑每5h ( z ) i 兰堕:。 i,o 图1 3l p c i 吾音合成器 在实际合成系统中,激励源要根据实际语音的清浊不同来生成,而非简单的单 位方差的白噪声序列。由于声门波激励源在绝大部分时间很小,在采用均方误差 最小准则下使e ( n ) 逼近u ( n ) ,从原理上仍是相洽的。 在实际的l p c 语音合成器的构造中。有用预测系数、也有用反射系数或线谱对 参数来构造的。采用预测系数时滤波器构造简单,运算快,但可能出现不稳定的 现象:用反射系数或线谱对参数来构造是,运算量大,但系统稳定,量化特性和 内插特性均相对优越。 1 1 2 2 2 共振峰合成方法 把人的声道模型看成一个谐振腔,语音信号的共振峰特性由这个腔体的谐振 频率来表证,这种合成方法叫做共振峰合成。由于人耳听觉的柯缔氏器官的纤毛 细胞就是按频率感受而排列其位置的,所以这种模拟共振峰特性的声道模型方法 非常有效。听辩实验表明用前三个共振峰就能代表元音,对于较复杂的辅音或 鼻音。大概要用到5 个以上的共振峰才行。 由语音产生的模型可知,语音信号谱中的谐振特征( 对应声道传输函数的极 点) ,完全由声道的形状决定,与激励源位置无关;语音谱中的反谐振特征( 对 应声道传输函数的零点) 出现在下面两种情况:一是当激励源位置不在堠部( 如 发摩擦音时) ,二是发鼻音时。所以对于一般元音,传输函数可以采用全极点模 型,对于鼻音和大多数辅音,声道模型应采用极零模型。 对于全极点模型的传输函数:v ( z ) = 阶极点的网络的串联。即: g 1 一8 。z 。 可以将v ( z ) 分解成多个二 瓣j 4 霞i 蕺蒺。舔黉 重音的自动梭铡和t t s 系统中重音效果体现 作者:王建 矿= 臻而# 孑 由于二阶谐振器的传输函数参数与其共振峰间有简单明确的对应关系,而谐振 器串联时各部分的共振峰将会保留,所以用这种方法可以很方便地模拟信号的共 振峰特性。下图为个二阶谐振器的幅频特征: d b 2 0 o 一2 0 z ) 图1 4 二阶谐振器的幅频特征 由上可知,全极点模型可以用串联型共振峰模型实现。它的结构简单,每个谐 振器代表一个共振峰特性,只需一个参数来控制共振峰幅度。串联型结构可以很 好地逼近元音的幅额特性。 对于一个极零点模型的传输函数: r 6 ,z 1 矿( z ) = 号r ( 卜7 ) l 一纭z 。 i 。l 在n r 且公子与分母无公因子及分母无重根时,可以分解为部分分式之和的 形式。因此极零模型可以用并联型共振峰模型来实现。它可以模拟谐振和反谐振 特征,因而被用来台成辅音和鼻音。 综上所述,共振峰合成系统通常采用下图1 5 所示的混合型实现方法:相比 于l p c 方法,共振峰合成在参数调整合适的情况下,可望产生较高质量的合成语 音。基于共振蜂合成方法衍生出很多合成效果不错的商业系统,如k l a g t a l k 1 1 。 其最大的优点是基于已有的发音机理,容易确定语音合成所需的参数变化轨迹以 及在语音段边界处的参数内插,可以通过共振蜂频率的变动来模拟不同语气、不 同发音人的特征等。最大缺点是合成器结构复杂,参数调整复杂,很难完全正确 獭、。t 釜;灞;簿e 钠_ 萋 重音的自动检测和t t s 系统中重音效果体现 作者:王建 地实现这些参数调整,所以实际的合成系统音质往往也难以达到实用要求。l p c 合成的特点是算法简单,有完全自动的分析步骤,但音质相对较差。 f o 蕊 擘 生瓶藏瓦芦 噪声发生器卜 一一:一丁一芒竺竺竺广一 目弘詈。l 怖击碉 剥调制广。t 垆于1 1 竺! 兰! ! ! ; l j 幅度 1 1 3 波形编辑语音合成 采用语音编码技术,根据自然语言的语音和韵律规律,存储适当的语音基元, 使这些单元在确定的存贮容量下具有最大的语音和韵律覆盖率。合成时刻,经过 单元选择、波形拼接、平滑等处理步骤后输出自然浯音。通过精心设计语料库。 以及根据语音和韵律规则( 直接使用这些规则或对这些规律进行建模) ,从音库 中挑出最合适的声学单元,使文语转换系统输出高质量的语音。波形拼接语音合 成中的合成单元是从原始自然语音中切分出来的,保留了自然语音的一些韵律特 征。虽然这种合成方法需要占用较大的存储空间,但计算量小。计算速度快。早 期的简单波形拼接技术能较好地保持合成单元的音段特性,但无法根据上下文 来调节其超音段特征。八十年代末由f c h a r p e n t i e r 、e m o u l i n e s 等人提出的基音 同步叠加技术( p s o l a ) 既能保持原始发音的主要音段特征,又能在拼接时灵 活地调整基频、时长和强度等超音段特征,使波形拼接技术重新得到各国专家的 重视。尽嚣国内外一些主要的高质量语音合成系统,基本上都是以波形拱接技术 为主研制的。本文所作的系列关键技术研究都是基于波形拼接技术的语音合成 系统,本节对波形拼接技术不在详细介绍。 1 2 中文语音合成系统概述 人类已经进入信息对代,信患豹存在形式多种多样,在计算祝的帮劲下,人 类对信息的控制能力也在不断的加强。大量以声音、图像和动画等为媒介的交互 系统越来越多进入我们的生活,我们的生活因此也变得更简单、霓易操作、也更 丰富多彩。中文语音含成系统就是其中一个很有代表性的一个,它又称中文t t s 第】2 页共6 3 页 重音的自动检测和t t s 系统中重音效果体现 作者:王建 ( 文语转换t e x t - t o s p e e c h ) 系统。 声讯有声服务是t t s 应用前景的非常广阔的一个领域。网络技术的飞速发 展,使i n t e m e t 服务项目日益增多,时效性提高,同时,电话已成为人与网络交 互信息的终端。如通过电话查询股票行情,进行股票交易;通知或查询即时到达 的电子邮件:通过电话进行电子商务活动等。2 0 0 2 年世界杯的时候全国不少地 方利用t t s 开通了1 6 8 声讯服务即时传递比赛信息和花絮,取得了很好的效益。 目前,t t s 已应用到信息咨询、电话银行、办公自动化等各个方面,它把声 音和文字、图像集成在一起,增强了人们的理解和阅读* 趣,使人与计算机之间 的交流变得“亲切”和“友好”。 语音技术已成为智能计算机领域的研究热点,但技术的成熟度、应用的广泛 性与人们的需求还有较大的差距,无论从技术的进步还是应用的开拓,都还需付 出巨大的努力。目前,合成语音的可懂度、清晰度已基本解决,自然度还不尽如 人意,表现力的差距较大。从应用的角度来说,仅把语音输出看作是“锦上添花” 是不够的,如盲人计算机、即时信息服务、语音报警提示、口语机器翻译中的语 音合成就是非常必要的。 1 2 1t t s 系统的基本原理 t t s 系统就是把文本文字串或文件通过一定的软硬件转换成连续的语音流 后由计算机或电话语音系统等输出的系统。一般认为,语音合成系统包括两个主 要的组成部分:文本分析模块、语音合成模块,因此可以说订s 系统是语言学 和声学有效结合的产物。图1 6 为个典型的t t s 系统原理框架图: 圈1 6t t s 系统原理框架图 碧葭妊j 嚣激缬,嚣 重音的自动检测和t t s 系统中重音效果体现 作者:王建 1 2 1 1 语言学处理 在t t s 系统特别是中文t t s 系统中,语言学处理起着非常重要的作用。它 的任务是模拟人对自然语言的理解过程,使得计算机对输入的文本能充分理解, 然后从中提取其后语音合成所需要的各种信息。这些信息一般可以分成两类: 一是语音信息,它决定了合成语音的准确性 另一方面是韵律信息它则直接影 响了合成语音的自然度。语音信息主要根据发音规则来确定,如词典中规定的拼 音信息、多音字处理规则等,而对韵律信息,必须先要对输入文本进行处理,然 后辅以韵律规则库来提取。这些文本的处理分析在主要包括自动分词、文本标准 化、拼音调整、词类调整、语法分析和语义分析等都属于计算语言学的研究范 畴。由于文本分析处理的结果对于韵律的准确提取至关重要,而韵律信息直接影 响了合成语音的自然度,因此可以说计算语言学的运用程度将大大提高最后输出 的合成语音的自然度。同时,一些特殊字( 如特殊字符、多音字等) 的语音信息 的准确性也依赖文本分析的结果。 1 2 1 2 声学处理 系统知道了要说什么并掌握了韵律控制参数后,它是如何使计算机发声的 呢? 系统产生的合成语音是通过一个声学模块来具体实现的。早期语音合成系统 的声学模型多是通过模拟入豹口腔的声道特性来产生的。其中毖较著名的有k a r t 的共振峰( f o r m _ a m ) 合成系统,后来又产生了基于l p c 、l s p 和l m a 等声学参数 的合成系统,这些都可以归结为参数合成系统。使用这些方法建立声学模型的过 程是:首先录制声音。这些声音涵盖了人发音过程中所有可能出现的读音;然 后,提取出这些声音的声学参数,并整台成一个完整的音库。在发音过程中,首 先根据发音需要从音库中选择合适的声学参数然后根据从韵律模型中得到的韵 律参数,通过合成算法产生语音。参数合成方法的优点是其音库般较小,并且 整个系统能适应的韵律特征的范围较宽,但其合成语音的音质却往往受到一定的 限制。 近1 0 年来,采用渡形拼接( p s o l a ) 合成语音的方法越来越被广泛应用。这种 方法的核心思想是直接对存储于音库的语音运用p s o l a 算法进行拼接,从而合 成完墼的语音。有别于传统概念中只是将不同的语音单元进行简单拼接,该系统 毵跨j 潺葶灞滇 重音的自动检测和r r s 系统中重音效果体现作者:王建 首先要在大量语音库中,选择最合适的语音单元用于拼接,并且在选音过程中往 往采用多种复杂的技术,包括多项统计学上的技术或神经网络技术,最后在拼接 时,使用p s o l a 算法,对其合成语音的韵律特征进行修改,使合成的语音达到 了很高的音质。如日本a t r 推出的多语种语音合成系统,就采用了统计学上的 隐马尔可夫模型来进行选音。其他的一些主要语音产品,如s i e m e n s 的p a p a g e n o 系统,也采用了类似或相关的技术。 1 。3 中文t t s 系统的发展历程及现状 中文t t s 系统的研究开始于上个世纪6 0 年代,最初发展比较缓慢,到了7 0 年代后期8 0 年代初期,随着计算机科学的发展,才有了较快的发展。近年来, 由于信息技术的迅速发展,语音技术的重要性正被越来越多的研究单位和跨国公 司所认识。国内一些科研单位对中文t t s 系统进行了大量的研究。 2 0 世纪8 0 年代,中科院声学所首先开始中文语音合成的研究。之后,社科 院语言所、清华大学、中国科技大学、北方交通大学等单位陆续开展了对中文 t t s 的研究,同时,台湾交通大学、台湾大学和国际上的b e l l 实验室也研制了 中文t t s 系统,其中清华大学、中国科技大学、中科院声学所等单位都取得了 很好的成绩。1 9 9 9 年,在口语处理国际会议期间,还举行了语音合成系统的评 比。有十几种语言的几十个系统参加,其中有5 个中文系统。 国内对波形编码合成技术研究比较成功的单位主要是清华大学和中科学声 学研究所。该方法采用语音编码技术,存储适当的语音基元,合成时,经编码、 波形编辑、平滑等处理后输出语音。它的特点是语音基元是从自然语音中切分出 来的,保留了自然语音的韵律特性,因而自然度比较好。基元拼接过程中的数据 平滑是必不可少的,它壹接决定了合成音质的好坏。有些研究机构曾以汉语音素 ( 2 2 个辅音、3 8 个元音共6 0 个) 为合成基元实现文语转换,但是由于合成基元 为单音节的,音节问的平滑工作不能满足自然度的要求。 8 0 年代末期,基音同步叠加技术( p s o l a ) 日趋成熟,p s o l a 既能保持原 始发音的主要音段特征,又能在拼接时灵活的调整基频、时长和强度等超音段特 征,因而成为一种比较好的波形拼接技术。中科院声学所研制的基于p s o l a 技 术的中文文语转换系统,它的合成过程是对音库中取出的音节波形段进行了基音 莨* 掺t 嚣“熟电蕊 重音的自动检测和r r s 系统中重音效果体现作者:王建 同步调节使其达到韵律规则库确定的该音节所应具有的音高、音长和音强,然后 将调节后的音节拼接成输出语音。该系统一方面由于音库取自自然语音,保持了 自然语音的音段特征,因此系统输出的清晰度较高:另一方面由于具有一个较为 完整的韵律规则库,而p s o l a 技术又使得系统能根据韵律规则去改变取自音库 中的音节的基频、音长和音强等韵律特征,因此系统自然度也较好。 糍罐;蘸i 蹙i 疆舞 重音的自动检测和t t s 系统中重音效果体现作者:王建 第二章本文研究意义及内容 2 1 研究意义及内容 随着语音合成技术的持续进步,合成语音的自然度、清晰度等指标越来越高。 特别是对一些如颓闻题材的文语转换等,合成语音的自然度基本上可以达到和自 然语音相媲美的程度。然而大部分合成语音虽然比较自然,但过于平淡,合成出 的语音虽然让人可以很容易地听懂,但是由于整个语音中既没有体现任何感情色 彩、也不能突出任何“焦点”信息,因此容易让听着疲倦和产生厌烦心理。因而 合成语音在“表义”上的不足严重制约了语音合成技术的应用,比如在网络游戏 等很多娱乐性的应用场合下,大家很难接受这种刻板的合成语音,这就为语音合 成技术提出了更高的要求。本研究的目的就是希望在初步解决了合成语音的可懂 度和自然度的基础上,能够将这种技术提到一个更高的高度,那就是希望合成语 音能够合成出更丰富、更能表征出语义的语音。本研究基于的平台是k d t t s 系 统,其系统流程基本如图2 1 所示。 系统流程图说明如下:前端输入的中文文字、数字、货币符号、标点符号等信息 被送入文本预处理器中,文本预处理器利用中文词典、外部规则分别完成不同字 符到拼音的转换。外部规则是利用事先建立的外部规则表将输入文本中包含的货 币符号、标点符号等非词典字符对应的音标和词性生成出来。经过文本预处理模 块,输入的文本被转化为相应的拼音及其它信息。文本预处理产生的信息流和输 入文本被一道送入分词模型中,分词模型的作用是产生韵律分析中所需的语法词 信息,包含语法词边界、词性等。同时一部分中文的多音字也会在分词模型中解 决。 韵律分析模块是语音合成中最重要的一个部分,它的作用主要是根据输入的 文字,来预测它们在确定发音风格下,所对应的某种合理的韵律现象。包含韵律 上合理的停顿位置和停顿类型、每个声学单元( 如音节、音素等) 的时长、基频 起伏、每个声学单元的能量大小。 在基于波形拼接技术的语音合成系统中,声学单元选择是一个重要的部分。 它根据系统中其它模块所分析出的语音和韵律参数,从语料库中提取出一组最合 理的声学样本。为了提高语音合成的效果,目前语音合成所依赖语料库的规模越 蟹1 参j 嚣:翁醯罐 重啻的自动检测和t t s 系统中重音效果体现作者:王建 来越大,每个基本声学单元在语料库中有数百到数千个样本。这就使声学单元的 选择难度较大。关于声学单元的选择在,主要是通过使用定长的方法,来实现不 定长单元的挑选,定长化是指将不同类型的声学单元先分解为最小长度的声学单 元,汉语中的最小声学单元为声韵母。然后通过统一的代价策略来实现对最优不 定长单元的选取。 图2 1 语耆台成系统流程图 在单元选择完成以后,所选择的样本的声学参数和预测值可能还有一定差距 ( 特别是在语料库规模比较小的时候) ,另外由于相邻的声学单元是从非连续的自 然语音中所选择,因此,这些单元之问的声学参数( 如基频参数、谱参数) 可能 还存在不连续的现象。因此在合成系统中,需要对所选的声学样本作一定的处理。 本研究的实现基本是在系统后端的框架中进行,图2 2 是系统后端的框架示意圈。 基于此语音合成系统框架。本文的研究思路如下: 首先在文本分析端预测出轻重音分布,然后利用单元挑选算法从库中挑选出 合适的单元,该单元的轻重信息尽量与文本分析端预测的轻重类型保持一致,使 得系统中的轻重效果能够得到体现。而在自然语流中检测出轻重音的分布是使得 这一流程得以实现的基础,因为为了预测出文本中的轻重音分布。必须提供足够 的已经标注好轻重音信息的训练文本。在基于波形拼接技术的语音合成中,随着 语料库容量的扩大,语料库制作的工作量越来越大,完全依靠人工标注重音需要 耗费大量的人力,而且标注的一致性不高。同时目前语音库中并没有关于自然语 懿l 彰懿i 建。积囊 重音的自动检测和t t s 系统中重音效果体现作者:王建 流中每个单元的轻重信息,因此在挑选的时候就不能利用文本分析预测的轻重信 息。 本文研究的主要内容是轻重音的自动检测以及语音合成系统中的轻重效果 体现,暂时利用手工标注的轻重信息代替文本分析端对轻重信息的预测。最后利 用黑盒法来测试最终语音合成系统的表现力。 前端信息 :。三l 三三三兰; i 音库 i 图2 2 系统后端基本结构示意图 2 2 国内外研究现状 中科院心理研究所伴浇渡在其博士学位论文中主要是通过合成实验、知觉 实验、相互替换试验、声学参数分析的方法详细的分析重音特征,文中将重音分 为3 层t 旬重音、短语重音、词重音:并从两个方面对其中的结论进行解释:重 囊j 秘j 懿;娄 6 羹赞 重音的自动检测和t t s 系统中重音效果体现作者:王建 音的表达怎样使得言语交际更有效的完成;重音的表达怎样受制于人类的发音和 听觉的生理及心理特征。文中认为重音的知觉表现就是突显感,在组成一个韵律 成分的低一级的韵律成分菱,一般会有一个韵律成分被突出出来,此即重音;对 应于音系结构的层次性,重音也有不同的层次,通常把韵律词重音称为s t r e s s , 把比它层次高的重音称为a c c e n t ,其中特别的把句子重音成为核心重音n u c l e a r a c c e n t 。该文对重音的研究涉及下面四个方面的内容: 重音的声学表现 重音的作用 重音和其他韵律特征变量的关系 不同层次重音的相互影响 该文得出的结论主要如下: 各个层次的重音的表现符合节律删规则,即高层次重音加在低层次重音上。 因此各个层次重音在声学表现上具有相似性,同时具有迭加性。 时长更多的承担了对重音表达的功能,这是由实验分析得出的,同时利用功 能负载原理进行解释,即因为音高模式的变化承担了很多功能,如语调、声调。 无论哪一层重音,其声学表现都主要作用于某一个音节上,而且特征是突变。 句子重音导致的声学参数突变范围没有随着句子重音的强调范围变化而变化。一 般主要集中于韵律头。听者对句子强调范围的知觉主要是通过语境信息获得的。 声学参数对韵律词重音的贡献按由大到小顺序为:时长、音高、频谱倾斜、 能量、音高变化量;因为能量很易受环境噪音干扰,因此能量不是知觉重音的主 要声学参数。这是人对环境适应的结果。基频曲线的变化方式对不同调型是不同 的。 韵律短语重音和句子重音的主要声学表现为:时长的增加和音高的突变。 对重音的知觉与人的语言常识有关。 王蓓在其论文f 1 1 中对汉语重音音节知觉的音高线索及句中重读音节的音高变化 模式进行了研究,该论文分3 部分,重音知觉实验、问答匹配实验和语料库分析, 重音知觉实验主要考察了重音知觉的音高线索,主要是高音点、低音点对重音知 觉的贡献。重读音节音高变化模式的研究,一方面从发音人的角度,用问答匹配 实验。选取d a 0 4 为代表音节,设计少量实验旬请多位发音人阅读,系统安排 蠢i 囊窿4 豢鬃镪萎 重音的自动检测和t t s 系统中重音效果体现 作者:王建 d a 0 4 在句中位置,用问旬自然引导d a 0 4 1 重读或非重读,对这两种情况作比 较;另一方面从听者角度,用语料库分析,对一个大规模语料库通过感知实验进 行重音和停顿两方面韵律标注,比较标为重和标为轻的音节音高值差异。 重音知觉实验表明,音域平移和高音点提高都是重音知觉的线索,但是高音 点的提高对重音知觉的作用更明显,重读音节音高变化模式的两项研究表明,重 读音节的音高在高音线低音线渐降汉语语调模式上变化,高音点的提高是重读 音节音高变化的主要声学表现。低音点的变化更多的受到低音线渐降的限制,变 化的幅度不是十分明显,而且不是必须提高高音线低音线双线语调模型中, 高音线起落的变化。前后音节高音点的对比关系表明旬中音节的重读程度。 论文p 1 通过声学分析,得出以下结论: 当句子重音强调词时,时长的增加主要体现在这个词的重读音节上 当句子重音强调词的某个音节,时长的增加主要集中在这个音节上 语句的知觉实验发现:上述两点是可以相互替换的,这种相互替换源于节律 删规律。 许洁萍在论文1 1 0 1 中对汉语中语句重音对韵律特征参数的影响进行了初步探 讨,分析了不同语句重音条件下音长和音高的变化及其相互关系,指出: 音高是语句重音的基本表达手段,随着语句重音级别的提高,音高分布曲线 向高频方向推移。 在连续语流中词被“重读”和“轻读”的情况下,音长分布出现双峰,表示 他们的音长有的受语句重音的影响,有的不受语句重音的影响。 在“正常”,“重读”,“轻读”三种情况下,音高和音长的相互关系分别是: 不相关、负相关和正相关,证实了汉语语句重音音高和音长之间的互补关系。 著名语音学家吴宗济在其著作f i l l 中也详细的研究了重音的一些重要属性。他 也是采用知觉实验、声学分析、合成实验来进行的,认为强度,也就是振幅对听 辨所起的作用很小,正常重音的主要表现是:时长的增加,较完整的音高模式。 而且不同的调型,重音的音高升降模式不同。 上面是国内关于汉语重音的本身机理所进行的深入研究,对本文的研究有很 重要的借鉴意义。在轻重音的自动检测方面,国内外都作了一些研究,代表的有 糕瓤i 纂够羲舔妻 n 9 1 重音的自动检测和1 r s 系统中重音效果体现作者:王建 陶建华博士在其论文1 1 2 1 中利用基于规则的、c a r t 、t r b l 方法分别建立了重音 自动检测模型,东京大学m 1 利用h m m 模型进行英语的轻重音自动检测,因为 作者认为只有与相邻的音节进行比较才能确定当前音节的轻重属性。通过加入重 音相对性的特征,最终实验显示模型检测的效果相对提高了2 5 。德国帕特拉斯 大学也比较了利用三种方法建立的自动检测模型,这三种模型分别是基于语境信 息的神经网络、h m m 模型以及基于规则的方法,试验结果显示前两种模型都能 达到7 5 的性能,基于规则的要比前两者差。 以上是目前国内外关于轻重音研究的基本状况,也反映了目前轻重音研究的 水平。轻重音机理的研究对本文有很重要的指导意义,自动检测的研究虽然其检 测性能并不是很好,但也为作者提供了一些启发,本文将着重于建立汉语重音的 自动检测模型,通过试验,使用更能反映轻重音本质的属性建立模型,同时也希 望通过一些后处理方法来提高该模型的性能,更为重要的是,本文将提出如何在 实际的语音合成系统中来体现轻重效果。因为本文的研究是基于大规模的语料库 数据,因此有效的机器学习算法和良好的统计技术是本文研究所不可缺少的。因 此下一节将重点介绍本文将要用到的机器学习方法、统计学方法以及语言学模 型。 麟黼i 黔渗渤炭 重音的自动检测和1 - r s 系统中重音效果体现作者:王建 第三章机器学习和统计学方法介绍 3 1 神经网络 人类学习过程:通过实例学习一 分析总结规律一 预测未知事实( 推广能 力) 。机器学习过程:模拟人类的上述学习过程,通过对已知数据学习,找到数 据间的依赖关系,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 手绣工基础安全测试考核试卷含答案
- 保温材料熔制工岗位绩效目标考核试卷含答案
- 稀土储氢材料工道德强化考核试卷含答案
- 电鸣乐器接装工岗前测试验证考核试卷含答案
- 运动场草坪管理师诚信品质竞赛考核试卷含答案
- 2026绿色能源行业市场现状评估及投资趋势规划研究报告
- 2026金属粉末D打印技术行业市场供需未来趋势分析及研发投资规划
- 2026医药工业智能制造升级路径与投资价值报告
- 2026商业航天低轨卫星组网商业化应用前景专项研究报告
- 2026中国电网基础设施智能化改造投资回报分析
- 档案数字化管理师岗前评审考核试卷含答案
- 华为行政物业楼宇管理手册
- 2026年秋人教版新八年级英语上册 八年级英语上册 Unit 2(单元测试卷)
- GB/T 6480-2026凿岩用钎头和连接钎杆
- 2025年城市地下管网改造研究报告
- 2026年陕西事业编制招聘在哪里看参考题库附答案
- 2025~2026学年北京市海淀区七年级上学期期中考试英语试卷
- 2025北京国际风能大会暨展览会(CWP2025):大型长柔风电叶片新型失效模式分析与设计验证方法
- 《教育管理》专业考试题及答案
- 制度修订情况汇报
- 肿瘤靶向药物治疗及护理讲课件
评论
0/150
提交评论