已阅读5页,还剩51页未读, 继续免费阅读
(模式识别与智能系统专业论文)普通话文语转换系统的研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
瞢通话文语转抉系统的研究 普通话文语转换系统的研究 摘要 该论文是对作者在硕士研究生期间对普通话文语转换系统的研 究工作的总结。研究的目的是最终构建一个基于小语料库的高清晰和 高自然度的普通话文语转换系统。系统由语音模型,韵律模型,合成 器和语音库四个主要模块构成,其中韵律建模技术,语音合成算法一 直是研究热点,也是我们研究的重点。我们设想系统主要应用于移动 手持终端等存储空间和运算能力受限的硬件平台上;因此系统应该是 基于的基于小语料库的,而且韵律预测模型,合成算法等应该对硬件 平台要求较低,使得整个系统可以达到实时工作的效果。因此在合成 算法上重点研究t d p s o l a ,此算法只需要时域计算,运算量小,合 成效果好。在对韵律参数中的基频模式的预测方法上,我们采用c 4 。5 决策树算法对训练数据进行挖掘,不但能够得到系统实现所需的分类 器,还可以得到相应的规则,使得我们可以对规则进行分析,进一步 改进我们的模型。 作者主要对t d p s o l a 合成算法原理和实现,c 4 5 决策树的原 理和用于预测音节的基频模式这两个方面技术进行研究,并且进行相 关的仿真实验,取得阶段性的成果,为下一步整体系统的实现奠定了 基础。另外,论文也对c 4 5 算法在入侵检测数据样本筛选中的应用 的实验做了介绍。 全文共分五章。第一章概述,主要讨论了研究背景及选题意义, 讨论了普通话文语转换系统的背景和现状,解释了普通话文语转换系 统的各项关键技术,以及作者在项目中主要的工作成果;第二章是对 t d - p s o l a 算法研究的总结,首先介绍了合成算法的几种类型,本系 统选择算法的考虑因素,t d p s o l a 算法的基本原理,公式推导,然 后介绍了仿真实现和试验结果;第三章介绍了决策树c 4 5 算法的原 理,构造一棵决策树和生成相关的规则的过程,以及在系统中采用决 策树算法的考虑;第四章解释了c 4 5 算法在韵律预测模型中的应用, 和在入侵检测中的应用,给出了作者使用c 4 5 算法对网络入侵数据 分析的实验过程和结果;第五章是对论文的总结,并且从技术的角度 萱望重塞至堕堡墨堑箜堡壅 简单的谈谈作者经历本课题研究工作的体会。 关键宇 文语转换,语音合成,p s o l a ,决策树,c 4 5 。 r e s e a r c ho nam 渔n d a r i nt e x t - t o - s p e e c h s y s t e m a b s t r a c t t h i sp a p e ri n t r o d u c e sm yr e s e a r c hw o r ko nam a n d a r i nt t s ( t e x t t os p e e c h ) s y s t e m d u r i n gm yp o s tg r a d u a t es t u d y m yw o r k i sap a r to fa p r o j e c tw h i c ha i m s a tb u i l d i n ga h i 曲l ya r t i c u l a t ea n d n a t u r a lt t s s y s t e m b a s e do nas m a l lc o r p u s t h i ss y s t e mc o m p r i s e sf o u rm o d u l e s :l a n g u a g e m o d u l e ,p r o s o d i cm o d u l e ,s y n t h e s i z e ra n dc o r p u s w el a ye m p h a s i so n t h er e s e a r c ho n p r o s o d i cm o d e l i n ga n ds y n t h e s i sa l g o r i t h m n l es y s t e mi s s u p p o s e d t o a p p l y o nh a r d w a r ep l a t f o r m sw i t hl i m i t e d m e m o r ya n d c o m p u t i n gc a p a c i t yi i k em o b i l eh a n d s e t s ,s 0i ts h o u l db eb a s e d o nas m a l l c o r p u sa n di t sp r o s o d i cp r e d i c t o ra sw e l la si t ss y n t h c s i sa l 叵o r i 盅mc o u l d r l l ni n r e a l t i m e o nt h o s e c a p a c i t y l i m i t e dp l a t f o r m s a c c o r d i n gt o t h e s e sp r e m i s e s ,w ep a yo u ra t t e n t i o nt ot h et i m e d o m a i nt d p s o l a s y n t h e s i sa l g o r i t h m ,d u e t oi t s c o m p u t a t i o n a l l ye f f i c i e n c y a n d g o o d q u a l i t y w ec h o o s ead e c i s i o nt r e ea l g o r i t h mc 4 5t om i n et h et r a i n i n g p r o s o d i cd a t aa n dc o n s t r u c tt h ep r e d i c t o ro f p i t c h ,w h i c hi sak e yf a c t o ro f t h e p r o s o d i ci n f o r m a t i o n b yu s i n gc 4 5 ,w eg e tn o t o n l yt h ep r e d i c t o r f o r t h es y s t e mb u ta l s ot h ec o r r e s p o n d i n g p r o s o d i cr u l e s ,t h e nw e c a l la n a l y z e t h er u l e sa n d i m p r o v e t h em o d e l i nt h i sr e s e a r c hp r o j c o t ,i 眦i n c h a r g eo f r e s e a r c ht h ep r i n c i p l e so f t d - p s o l aa n dc 4 5 a l g o r i t h m a n dia l s od os o m es i m u l a t i o n 昔通话文语转换系统的研究 e x p e r i m e n t sa n dg e ts o m ep o s i t i v er e s u l t sw h i c hl a yt h ef o u n d a t i o nf o r i m p l e m e n t i n g t h es y s t e mi nt h ef u t u r e t h e r ea r ef i v e c h a p t e r s t o t a li nt h i s p a d e l t h ef i r s t c h a p t e r , o v e r v i e w , t e l l su st h er e s e a r c hb a c k g r o u n do ft t sa n dw h yw ed ot h i s r e s e a r c hw o r k , t h e nl i s t ss o m ek e y t e c h n i q u e so f am a n d a r i nt t ss y s t e m a sw e l la sm y m a j o ra c h i e v e m e n t si nt h i sr e s e a r c hp r o j e c t t h es e c o n d c h a p t e ri sa b o u tt h et d - p s o l as p e e c hs y n t h e s i sa l g o r i t h m i tf i r s tl i s t s s e v e r a lt y p e so f s y n t h e s i sa l g o r i t h m s ,a n dt h e ni n t r o d u c e st h ep r i n c i p l e s o ft d - p s o l aa n dt h er e a s o nw ec h o o s ei t , t h e nt h es i m u l a t i o nr e s u l ti s g i v e n i nt h e t h i r d c h a p t e r , t h ep r i n t i p l e s o fd e c i s i o nt r e ea n dc 4 5 a l g o r i t h ma r ei n t r o d u c e d ,a n di te x p l a i n sw h yw ec h o o s ed e c i s i o nt r e ea s t h e p r e d i c t o ro fs o m ep r o s o d i cp a r a m e t e r s t h ef o u r t h c h a p t e r l i e s e m p h a s i s o nh o wt o i m p l e m e n tm ec 4 5a l g o r i t h m o nt h e p r o s o d i c p a r a m e t e rp r e d i c tm o d e lo f o u rm a n d a r i nt t s s y s t e ma n dh o w t om a k e u s eo fc 4 5 a l g o r i t h mi nt h ef i e l do fn e t w o r ki n v a s i o nd e t e c t i o na n dt h e e x p e r i m e n tp r o c e s sa n dr e s u l t sa r e g i v e n f i n a l l y as u m m a r i z a t i o ni s g i v e ni nc h a p t e rf i v ea n dt h e nip r e s e n tm ye x p e r i e n c eo ft h i sr e s e a r c h w o r ki nt e c h n i c a l p h a s e k e y w o r d s 竹s ,s p e e c hs y n t h e s i s ,p s o l a ,d e c i s i o nt r e e c 4 5 普通话文语转换系统的研究 独创性声明 本人声明所呈交的论文是本人在导师指导下进行的研究工作及取得的研究成果。尽我所 知,除了文中特别加以标注和致谢中所罗列的内容以外论文中不包含其他人已经发表或撰 写过的研究成果,也不包含为获得北京邮电大学或其他教育机构的学位或证书而使用过的材 料。与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说明并表示了谢 意。 申请学位论 本人签名: 处,本人承担一切相关责任。 日期:塑兰鉴墨 关于论文使用授权的说明 学位论文作者完全了解北京邮电大学有关保留和使用学位论文的规定,即:研究生在校 攻读学位期间论文工作的知识产权单位属北京邮电大学。学授有权保留并向国家有关部 门或机构送交论文的复印件和磁盘允许学位论文被查阅和借阅:学校可以公布学位论 文的全部或部分内容,可以允许采用影印、缩印或其它复制手段保存、汇编学位论文。 ( 保密的学位论文在解密后遵守此规定) 保密论文注释:本学位论文属于保密在一年解密后适用本授权书。非保密论 文注萎耋薹予兰三臣曼鏊三兰! : 本人签名: :r 价。2 l b 鲫签名:4 牛j 卜 适用本授权书。 日期卵收啦l 矍望堡苎至壁篓墨竺堕婴墨一 1 - 1 背景 第一章概述 文语转换( t e x t - t o s p e e c h ,简称t t s ) ,就是将计算机自己产生的,或外 部输入的文字信息转变为可以听懂的,流利的汉语口语输出。简单的说,t t s 就是一项使机器具备蒙人一样朗读文字的能力的技术。对t t s 的要求是清晰度 ( 或可懂度) 和自然度,也就是说,t t s 追求的目标是输出的合成语音一可懂、 清晰、自然、具有表现力。 近两年来,语音合成技术的应用已经深入到人们生活的方方面面。t t s 有 着广阔的应用前景,它可应用于盲人计算机,电话信息查询,文本校对,火车 站、飞机场的航班信息报告等领域。从电信、交通、税务、银行、证券、保险 等行业到企业和家庭用户,从p c 到手机,再到m p 3 和玩具,其应用几乎无所 不在。t 1 s 技术是目前世界范围内的研究热点,它可以把声音、文字和图像集 成到一起,增强了人的理解和阅读兴趣,人和计算机的交互变得亲切而友好。 2 0 世纪6 0 年代,英文t t s 系统首先被研制出来。8 0 年代,我国开始介入 汉字t t s 领域的研究,清华大学、中国科大、中科院声学所、北京捷通等单位 都在这一领域取得了很好的成绩。近年来,在国家“8 6 3 ”智能计算机主题的支 持下,汉语t t s 技术有了长足的进步。目前,国外的许多大公司也都投入了大 量的人力、物力来从事这方面的研究。如:微软亚洲研究院、i b m 中文语音研 究中心、i n t e l 中文语音研究中心、摩托罗拉公司、西门予公司、d i a l o g i c 公司 等。 目前,t t s 系统输出的合成语音的可懂度、清晰度己基本解决,但自然度 还不尽如人意。 r r s 技术的成熟度、应用的广泛性与人们的需求还有较大的差距,无论从 技术的进步还是应用的开拓,都还需付出巨大的努力。 为了合成出高质量的语言,除了依赖于各种规则,包括语义学规则、词汇 规则、语音学规则外,还必须对文字的内容有很好的理解这将涉及自然语言 理解的问题。从这一点讲,文语转换系统实际上也可看作一个人工智能系统。 要提高汉语t t s 系统的自然度,仅仅靠能合成出清晰、自然的音节和词是远远 不够的,还必须有好的韵律模型将音节和词的发音连接成和自然语音接近的言 语。外国人学汉语,“洋腔洋调”,原因就在于他们对汉语的韵律的特征不够清 楚。因此一个好的韵律模型对提高汉语t t s 系统输出的合成语音的自然度至关 重要。 韵律模型可以实现对汉语自然语句韵律特征的控制。韵律特征,从广义上 讲,是指声调、语调、停顿和轻重音等超音段现象。近年来,对韵律特征的研 究日益受到语言学界和言语工程学界的重视。过去的语音研究以分析音段的发 音、声学和感知特征为主在韵律方面多是对现象的描写。现在,语音研究己 经进入连续语音阶段,韵律特征在自然语言中的作用就显得尤为突出于是, 一系列跟韵律有关的课题被提出,如自然语句的语调结构和韵律结构,语流中 音节的声调变化,时长结构和轻重模式,声调和语调的关系以及自然语言的停 顿等等。t 1 s 技术的发展始终是把提高合成语音的自然度作为追求的目标,而 要生成自然度和可懂度高的语音,对韵律特征的控制,即韵律模型是关键。韵 律不仅具百辨义功能而且是影响语音表现力的主要因素,声音的轻重缓急、 抑扬顿挫、不同语气和口气的传达、个人语音特点的辨别,都要依靠韵律的作 用。 通过韵律模型得到正确的韵律信息后,就需要一种合成技术根据韵律信息 产生出相应的语音。台成技术有参数合成和波形拼接两大类型每种类型又分 为几种不同的方法,主要涉及语音信号处理的技术。 因此,作者选取“普通话文语转换系统的研究”作为论文的题且。准备从 韵律模型,合成技术两个方面进行学习和研究。 1 一发展动态 目前普通话t t s 系统已经有商用产品出现。具有代表性的有科大讯飞推 出系列语音舍成产品。另外微软研究院的语音合成系统也表现出很好的性能。 表1 - 1 是我国二十年来比较突出的t t s 系统。 表1 1 汉语语音合成系统一览表 时间研究者研究单位合成技术韵律建模典型合成结果 1 9 8 4杨顺安社科院语共振峰合成基于规则 “刻舟求剑” 言所 1 9 8 6吕士楠中科院声共振峰合成基于规则“北风与太阳” 普通话文语转按系统的研究 学所 1 9 8 9崔成林中科院声线性预测合基于规则“桥梁专家茅以升” 学所成 1 9 9 3蔡莲红清华计算波形拼接基于规则“我家有个小弟弟” 机系 1 9 9 4初敏中科院声p s o l a基于规则 “修复圆明园城墙” 学所 1 9 9 8王仁华 科大电子 p s o l a 基于规则 系 1 9 9 9高文中科院计p s o l a 数据驱动 算所 2 0 0 0蔡莲红清华计算p s o l a 数据驱动 机系 从上面的表中我们可以看出汉语语音合成技术发展的技术。下面从合成技 术和韵律建模两个方面进行说明。 1 2 1 合成技术方面 语音合成就是通过机械的、电子的方法产生人造语音的技术。今天的语音 合成都是利用计算机来实现的。语音合成技术通常可分为两类:参数合成和波 形合成,分别对应着频谱逼近和波形逼近的合成策略。 参数合成多以音节、音索为合成单位,按照语音学理论,对所有合成单元 做语音分析,分帧提取特征参数,再经编码后形成语音库;合成语音时,根据 待合成的信息,从语音库取出相应的合成参数,经参数合成器合成出语音。戈 振峰合成和线性预测( l p c ) 合成都属于参数合成。较为著名的是m r r 教授 d k l a t t 设计的串,并联混合型共振峰合成器。他用串联通道产生元音和浊辅音, 并联通道产生轻辅音。还可以对声源作各种选择和调整,以模拟不同的嗓音。 在此基础上开发的d e c t a l k 英语文语转换已广泛地应用于各个方面。这类系统 需要的存储量低,音质适中,易于实现韵律修改。 波形合成以语句、短语、词或音节为合成单位,经录音、编码压缩后形成 语音库:合成语音时,根据待输出的信息,从语音库中取出相应单元的波形数 据,经拼接解码后输出语音。 这种语音合成技术用原始语音波形替代参数,而且这些语音波形取自自然语 音的词或句子,它隐含了声调、重音等细微特性,台成出的语音清晰自然,其 质量普遍高于参数合成。8 0 年代末e m o u l i n e s 和f c h a r p e n t i e r 提出基于时域 波形修改的语音合成算法一基音同步叠加算法p s o l a ( p i t c hs y n c h r o n o u s o v e r l a p a d d ) ,该方法较好地解决了语音拼接中的问题,从而推动了波形编辑语 音合成技术的发展与应用。目前,这种语音合成波形拼接技术已用于国内外许 多的丌- s 系统中,而成为合成语音的主流技术。 1 2 2 韵律模型方面 从表1 1 中看出,韵律建模技术经历了从基于规则向数据驱动的方向的转 变。究真原因主要是人类语音的韵律变化万千,涉及自然语音理解,场景变化, 人类发音特性,听觉特性等等许多复杂因素的影响,使得人们无法真正总结出 有效的韵律规则用于语音和成。因此,人们将人工的总结规则的方法转向由大 量数据进行训练的数据驱动的方法。 在较早的t t s 系统中,其韵律模型基本上是基于规则的。目前,国内大部 分的语音合成系统,都是采用规则合成的方式。另外,国外的规则合成系统也 有。清华大学1 9 9 3 年推出的语音合成系统,采用了词间的不同音联模式,取得 了令人满意的合成语音。中国科学院声学所的初敏在1 9 9 4 年的合成系统中,总 结了一系列语调、词调模式,配以一些内部韵律标注的方式,并在词典上标上 发音轻重信息,得到了较为满意的合成语音。中国科技大学在1 9 9 8 年推出的系 统中,就总结了二、三、四字词的声调组合的韵律模式,结合大量的音节样本, 同样得到了较高质量的合成语音输出。规则合成模型往往对研究人员要求很高, 要求他们不仅需要大量的语音学知识,而且还需要大量的语言学知识,同时一 个好的规则系统还需要非常繁琐而细致的工作。目前,在很多场合中,韵律模 型越来越多地采用数据驱动的方法。 数据挖掘及数据驱动技术的发展,推动了近几年语音合成技术中韵律生成的 研究。数据驱动应用于语音合成主要体现在合成基元的选择和韵律模型两个方 面,并且都有成功的应用例子。采用这一思路的比较著名的研究机构和公司有: m i c r o s o r 、s i m e n s 、台湾交通大学通信工程系等。s i m e n s 公司的r a l fh a u r y 等 人设计的可训练德语和英语的t t s 系统是直接建立在韵律模型的设计上的。它 对音节基频曲线进行了定量的描述。用神经网络的韵律模型构建了文本标注信 息( 语境参数) 到基频包络描述参数的映射关系。该系统采用了4 个参数进行 了音节基频包络的描述,这对构建神经网络模型提供了较大的帮助。台湾交通 大学的陈信宏等推出的基于数据驱动的汉语韵律模型,将语句韵律变化的整体 趋势和词内韵律特征分开来考虑,并在他们设计的m r n n ( m u l t i - - r a t er e c u r r e n t 普通话文语转换系统的研究 n e p a ln e t w o r k ) 网络中,体现了这种构思。这是一个较为成功的汉语韵律可训 练的t t s 系统,合成结果基本令人满意。中科院计算所的朱庭邵,利用神经网 络对汉语二字词的基频曲线进行了训练,并较好地实现了孤立二字词的基频曲 线产生模型。中科院自动化所的黄燕等人利用神经网络模型,构建了汉语合成 系统中的时长模型,她的工作新颖之处在于,把神经网络和时长的规则模型相 结合。t t s 系统中韵律建模所采取方法的发展趋势是采用规则模型的方法逐渐 减少,采用数据驱动的逐渐增多。 1 3 研究内容 要研究构建一个t t s 系统需要知道t t s 系统的由哪几个部分组成:语言模 型、韵律模型、合成器和语料库。 一个t t s 系统模型组成如下图: 1 3 1 语言模型 图1 一lt t s 系统模型 首先要注意一个事实:语法和语义与发音密切相关。只有对句子做好语法 分析以及语义理解,才有可能建立好的韵律模型。语言模型应该完成以下几方 面的工作: ( 1 ) 文本的预处理 将数字序列、缩略语、外文字母等非标准汉语单字转换成标准读法的单字。 ( 2 ) 语音词的切分 0 以一个完整的句子为处理单元,采用向前最大匹配向后回溯法。 o 歧义处理:使用区分歧义字段的规则。 ( 3 ) 读音转换 根据分词结果将汉字翻译成拼音,并注意多音字的处理。 1 3 2 韵律模型 ( 1 ) 自然语言的韵律表现 自然语音之所以听起来抑扬顿挫,原因在于它包含有韵律信息。汉语的韵 律主要表现在音节的时长、音高、能量及停顿等几个方面,其中音高和音长对 自然度的影响最显著。 ( 2 ) 韵律建模方法 目前韵律模型的实现方法有两种:基于规则的和基于数据驱动。 o 基于规则 在有大量音韵学知识的背景下,对各种不同语境下的基频,时长等声学参 数的变化情况加以总结,形成韵律规则。目前大多数的t t s 系统仍然采用这种 方法。 o 基于数据驱动 利用数据挖掘技术,通过使用包含大量语音和文本信息的数据,训练产生 韵律模型。具体采用的方法有:决策树、神经网络等。近几年来新的高自然度 的语音合成系统都采用这种技术。 ( 3 ) t t s 中的韵律预测 t t s 系统中的韵律预测包括:音节基频曲线的预测,音节时长的预测,重音 的预测和停顿的预测等。所选用的主流数据挖掘技术是决策树。 决策树是机器和人相结合的一种技术,由人来设计影响目标( 比如:音节的 基频曲线) 的所有可能因素( 问题集) ,然后利用机器来学习,即利用语料库中 大量的样本和样本己知的分类结果,采用合适的学习算法,由计算机归纳总结 出实际影响目标的因素( 韵律规则) ,这种技术非常适合于语音合成中的韵律建 模。利用决策树构建韵律模型。需要解决三方面的问题:问题集的设计;评价 函数的确定;停止规则选择。 a 连续语流中音节韵律变化规律的学习 夺基本思路: 普硒话支语转换系统的研究 假设连续语流中的音节基频曲线可以在一些典型的基频曲线的基础上通过简 单的变换德到。这里将涉及两方面的技术: 夺聚类分析 通过聚类分析进行基频模式( 典型的基频曲线) 的提取。可选取的方法:k 均值算法聚类和自组织神经网络聚类。 夺决策树学习 利用语言学和语音学的知识,确定问题集( 语境参数) ,如表2 所示,然后 利用c 4 5 ( 决策树学习算法) 构造决策树以及生成规则,如图4 所示。 表1 2 决策树学习基频模式问题集 图1 2 决策树对句子中音节韵律变化的学习 以语境参数作为条件属性,以基频长度和基频序列类别作为决策属性进行_ 练。训练的结果以规则的形式给出。实际的实现应采用c 4 5 进行决策树的建 立以及规则生成,分别建立两个决策树用于基频类别和长度变化规律的学习。 实际使用时,利用一句话中单音节的语境参数,通过训练以后的决策树,得 到基频序列类别。 b 汉语重音及停顿的预测 对于这一问题的解决也想尝试使用次策树的方法。目的在于利用从语言层 面的标注信息( 分词,词性标注,句法词法标注等) ,通过所认识的韵律与句法 的相关性,来预测停顿位置的分布及等级,重音位置分布及等级。 c 时长的预测 时长是只同一个字音在不同的语境下发音的持续时间长短,它对台成语音的自 然度也有很大的影响。我们初步决定采用神经网络进行训练和预测。 1 3 f 3 合成器 目前国内外采用的合成技术大多为p s o l a 波形拼接技术,实验结果表明 这种方法能合成出高清晰度,高自然度的合成语音。我们重点研究t d p s o l a 算法是根据分析语音信号的基音标序列和目标基音序列的对应关系,在时域上 进行计算。其中两个基音序列的对应方法,算法的频域解释,音节直接过渡段 的处理等都是我们的研究和实验内容。 1 3 4 语音库 语音库是t t s 系统的重要组成部分。t t s 的语音库不仅存储有合成基元的 波形数据,还应该存储基元的韵律标注信息。合成基元可以是音节,词或句子。 在构建t 叮s 系统时,应根据实际使用的环境来决定语音库的选择,或选用小语 音库( 单音节语音库) ,或选用大语料库,当然大语料库的t t s 系统的自然度要 高于小语音库的t i s 系统。 在基于大语料库的t t s 系统中,语音库已成为系统关键所在,它的基本思 想就是从含有大量自然语句的语料库中,按照某种算法选取最佳的语音合成基 元,再按照一定的规则进行拼接,得到高自然度的语音。语音库的工作包括以 下几点: 一1 0 矍垩重壅受矍塾墨篓塑墅墨 一一 a 1 文本语料的选择 应包含足够的可被使用的合成单元,在设计上应遵循以尽量少的语料,覆 盖尽可能多的自然语言现象。 b ) 语科的录音制作 c 、语料的标注 音节的边界,声韵母的边界,基音标注等。 我们的t t s 系统采用的是带声调的单音节语音库,包含有1 2 6 8 个单音节的 波形数据和标注信息,语音库的语料选自由清华大学、中国科学院声学所、中 国社科院语言所共同完成的合成语料库c o s s l ( c o r p u so f s p e e c hs y n t h e s i s - 1 ) 。 c o s s i 合成语料库包含: ( 1 ) 单音节1 2 6 8 个 ( 2 、二音节组6 4 0 个 ( 3 ) 三音节组2 0 4 8 个 ( 4 1 四音节组2 0 4 8 个 ( 5 ) 儿化音节组2 3 3 个 f 6 ) 轻声音节组3 4 9 个 ( 7 ) 独白体语句2 6 5 句 ( 8 ) 情景对话语篇5 2 个场景 为了搭建t t s 系统和韵律建模,我们需要对c o s s 1 合成语料库进行韵律 标注,主要是单音节、二音节、儿化音节、轻声音节和独白体语句的韵律标注。 1 4 我的工作内容 在研究项目中,我主要负责t d p s o l a 算法和c 4 5 决簧树算法曲研宄。 本论文将主要围绕这两个内容进行论述。 141 t d - p s o l a 算法 基音同步叠加算法p s o l a 实现算法简单,合成效果好,对硬件要求低是 我们优先考虑的算法。其中t d p s o l a 算法只需要在时域上进行计算,不用进 行时频变换,运算速度很快而且效果理想,虽然t d - p s o l a 算法只在时域上进 行计算,但是它的理论推导是在频域上完成的。论文将在第二章对算法的原理, 推导过程,仿真实现和实验结果分析进行详细介绍。 普通话文语转抉系统的研究 1 4 2c a 5 决策树算法 韵律模型中的最重要参数一音节的基频曲线的预测,我们将使用c 4 5 决策 树算法进行训练。基频曲线反映的是音节的语调变化的过程。直接影响到合成 语音的自然度和可懂度。我们标注出库中音节在句子文本中的各种语法语义信 息,根据定义的若干个属性( 特征) ,还有事先标注的基频序列( 分类结果) , 就可以使用c 4 5 训练出一棵决策树( 分类器) 。由于基频曲线千变万化,我们 事先需要进行聚类,等到有限个数的基频模式作为分类结果。采用c 4 5 算法不 但能得决策树,还可以总结出相关的规则。也就是说我们能够从数据中挖掘出 能被人所理解的韵律知识,利于我们对模型本身,特征选择等进行分析。这一 点是神经网络算法所做不到的。另外我们还将c 4 5 算法应用在入侵检测数据样 本筛选中。关于c 4 5 决策树的原理和应用将分别在第三章和第四章中详细介 绍。 普通话文语转换系统的研究 第二章合成算法研究 2 1 合成算法的选择 合成算法主要有两种:一种是参数合成,另种是波形合成。 参数合成多以音节、音素为合成单位,按照语音学理论,对所有合成单元 做语音分析,分帧提取特征参数,再经编码后形成语音库;合成语音时,根据 待合成的信息,从语音库取出相应的合成参数,经参数台成器合成出语音。共 振峰合成和线性预测( l p c ) 合成都属于参数合成。 波形合成以语句、短语、词或音节为合成单位,经录音、编码压缩后形成 语音库;舍成语音时,根据待输出的信息,从语音库中取出相应单元的波形数 据,经处理拼接解码后输出语音。这种语音合成技术用原始语音波形替代参数, 而且这些语音波形取自自然语音的词或句子,它隐含了声调、重音等细微特性, 合成出的语音清晰自然,其质量普遍高于参数合成。 波形舍成的目的就是把语音库中的波形经过处理得到时长和基频曲线符 合要求的合成语音。 波形合成算法包括很多种算法,都是基于p s o l a ( p i t c h s y n c h r o n o u s o v e r l a pa n da d dm e t h o d ) 算法,可总结为两大类:频域算法和时域算法。前者 需要对库中的语料进行频域上的变换,然后进行处理后重新变回时域信号,得 到合成语音:而后者不需要进行变换,而是直接对语料进行时域上的处理得剑 合成语音。 尽管时域算法不需要进行时域和频域的转换,但是它的理论推导还是要借 助于时频转换来完成。频域的算法有f d - p s o l a ( f d - - f r e q u e n c yd o m a i n ) 和 l p - p s o l a ( l p - - l i n e a rp r e d i c t i v e ) ,时域算法时t d p s o l a 。 整个p s o l a 算法可看作一个分析修改合成的过程,因此可以按先后顺序 分为三步: ( i ) 蒋语料库中的语音波形分解为短时分析信号序列 我们把原始的语音波形x ( n ) 分解为一系列短时分析信号x 。( r ) 。其中, t m , m 2 1 , 2 ,m ,是一系列短时信号的下标,n 是短时信号中的样值的下标。x 。( n ) 堂塑堡苎重楚垫墨笙盟里塞 可通过对x ( n ) 加窗获得。 ( n ) = x ( n ) + w ( 觚一n ) ; t m 是分析时刻,对于p s o l a 算法来说,t m 时刻通常就是分析基音标记时 刻。如下图所示: 图2 一l 语音信号加窗和基因标记 ( 2 ) 将短时分析信号序列转换为短时合成信号序列 将短时分析信号序列转换为短时合成信号序列,短时合成信号序列同步于 一组合成基音标记时刻阳 ,q = l 2 ,n 。这正是p s o l a 算法名字的由来。 对于f d - p s o l a 来说,每一个短时分析信号都要变换到额域然后存颇域 上根据合成目标进行抽样和插值等处理,使得信号的基频得到改变,然后交换 回对域得到短时合成信号;对于l p p s o l a 来说,自回归模型被应用到每一个 短时分析信号上,得到的残差信号再进行时长和基频的调整,然后再通过逆滤 波器得到短时合成信号:对于t d p s o l a 来说,只需找到 锄) 与 t q ,的对应关 系即可,无需任何变换。 ( 3 ) 短时合成信号序列转换为输出 短时合成信号序列同步于一组合成基音标记时亥4 t q ) ,短时合成信号之间 在时域上通常互相混叠,将短时合成信号叠加后再输出。如下图所示,分别表 示输出信号相对分析信号的基频升高和降低的情况: “幺番乏婆荟瓤 4 ,即窄带分析的条件下,分析信号的频谱如下图 2 4 虚线所示。实线的合成信号的频谱的包络呈现谐波变化的形状。较长的窗 包含了较多的原始信号的基音周期的信息,对基音周期进行调整后就会出现对 基频谐波分量的幅值选择性衰减的情况,这就造成了波形能量的降低,使得音 质出现混响的感觉。 一2 0 苎望重苎堡壁垫墨竺塑竺塞一 d b h7 刊觚 、 1 一,if ! n 抓, 1i 7y 、 li ¥l fl f i h ,听f州i iv y lii i i1 f r e q u e n c y i l - - - l 王z 图2 3宽带分析【l l 】 n 1 ,、 、 j k ,a 盈mfk 觚 靠n f 9 :“ 甜 烈俐 l ;l i ifl |料i v ; i t i n 。 噎 。l l : l l ! : l ; i5i l i i f l i i i i i ! i f r e q u e n c y h z 图2 4 窄带分析 2 l 一 苎望塑苎重蔓堡墨壅盟堡墨一一 2 3 仿真实现和试验结果 2 1 仿真实验 实验素材 实验用的基本单音语音库是8 6 3 库的单音节女声库,对单音节进行手工标 注。分析标注数据按照语音组标注内容及规范保存成* p i t c h 文件,目 标( 合成) 标注数据通过选择8 6 3 库中的双音节或句子的波形文件进行手 工标注得到。 分析标注序列与合成标注序列对应算法 t d p s o l a 算法的关键在于确定分析标注序列与合成标注序列对应算法。 大家在具体实现方法上多少都有差别。各种算法在理论上没有证明优劣, 由实验结果判断。在本次m a t l a b 仿真实验中有m y d t w m a t 和m y d t w l m a t 两个函数分别实现两种算法。它们的用法描述如下: 一u s a g e :【p a t h ,t r a i l l - - m y d t w ( a n a l y s i s ,s y n t h e s i s ,m ,n ) ; 一 m y d t w m 用d t w 求出分析轴和合成轴对应关系 a n a l y s i s :分析信号的基音标注序列 一 s y n t h e s i s :合成信号的基音标注序列 - m :分析信号基音标注序列的长度 ,n :合成信号基音标注序列的长度 一p a t h :结果p a t h ( x , 1 ) 是路径上第x 点对应分析轴基音标注点,p a t h ( x ,2 ) 是路径上第x 点对应合成轴基音标注点 一t r a i l :t r a i l ( i ,1 ) 是路径上第i 点对应分析坐标值,范围是0 m ;t r a i l ( i ,2 ) 是路径上第i 点对应合成坐标值,范围是o n m y d t w m a t 用d t w ( 动态时间弯曲) 实现两组序列的对应关系;m y d t w l m a t 参考文献【11 】介绍的算法求对应关系。实验表明后者的舍成效果更好。 合成算法 合成算法用p s o l a m a t 实现,用法描述如下: u s a g e :s y n = p s o l a ( x , p a t h ,m i u ) - s y n :合成语音信号序列 - x :分析语音信号 - p a t h :二维列向量,m y d t w 算出的分析基音标注序列与合成基音 标注序列对应关系 一 m i u : 窗长因子,即合成窗相对基音周期的倍数 萱望亟苎堡堕壅墨堑塑塑鍪 算法采用谱相等意义下的p s o l a 公式 其中窗长因子取2 。窗是暗明窗h a m m i n g m m 或非对称窗躺y n _ w n d m a t 。具 体看代码即可。鹋y n o na p i t c ha 妇r a t m n m c h n 由u eo f s p e e c hw 以gt h ea s y m m e t r yw e i g h t e dw i n d o w1 9 9 9i e e e 进行的 实验。根据这篇文献采取此方法可以使合成结果的谱失真减小2 3 d b 。但 是文献没有给出主观评测结果。根据我们实验结果主观听觉上基本没有改 观。输入参数中的p a t h 由m y d t w l m a t 计算得出。p s o l a m m 每次只能合成 一个音节,参数中的x 是一个音节的分析语音信号列向量。合成结果s y n 也 是一个维列向量。 基本实验步骤 首先将一个音节分析基音标注序列和对应的波形数据读入m a t l a b 的两个变 量中,将一个音节的合成标注序列数据也读入一个变量中。然后用 m y d t w l m a t 计算两个序列的对应关系,结果存在列向量p a t h 中;接着用 p s o l a 肌a t 根据读入的波形数据和p a t h 合成出新的波形教据。按此方法逐 个将整个词组或句子的每个音节合成出来,最后拼接在一个变量中,将此 变量的数据用w a v w f i t e _ m a t 写出到一个w a v 文件中就可以播放了。 2 3 2 实验结果和分析 实验结果中根据库中单字变音和二字词合成的语音的可懂度和自然度都相 对较好;根据库中句子合成的语音可懂度基本满意,语调基本正确,自然 度不足有浑浊和机器声。分析实验结果有以下凡点原因: i 二字词效果较好是因为合成语音与分析语音在音长和音调的差别 相对句子较小,合成时对原始语音的修改就越少,音色就越好;合 成句子中的单个音节的啬长和音调与分析库中的音节波形棺差较 大,合成的效果相对差。 i i 在句子合成中音节过渡段基本没有处理,在频谱上有很大的不连续 性也是导致音色不好的重要原因。改进的方法有简单的在过渡段进 行波形平滑。但是预计这种方法也不会有完全的改观。从相关的论 文上看- 对过渡段协同发音的处理光靠对信号进行处理不能达到理 想效果:比较理想的方法都是建立协同发音语音库,考虑到我们现 在语音库的规模暂时不变,本阶段暂时不处理。 下面给出使用语音库中m u 3 “母”和y u 3 “语”两个音节合成双音节词 m u 3 y u 3 “母语”的结果。其中库中包含单音节的波形w a v 文件和基音 标注,趴双音节库中的“母语”的基因标准序列为目标,使用t d - p s o l a 普通话文语转换系统的研究 算法将m u 3 和y u 3 两个单音节合成新的双音节m u 3 y u 3 。 图2 - 5 m u 3 “母” ( 库中原声录音) 的波形和语谱图 图2 6 y u 3 “语”( 库中原声录音) 的波形和语谱图 一2 4 普通话文语转换系统的研究 图2 7 m i l 3 y l l 3 “母语” ( 库中原声录音) 的波形和语谱圈 圜2 8 “母语”合成语音) 的波形和语谱圈 “母语”中的第一个音节语单独发音的m u 3 有明显的变音( 三声变二 声) ,合成语音的语谱图也表现出这点来。由于暂时没有将能量的因素 考虑到算法中,从波形可以看出,在“母语”的合成波形两个音节有明 显的分界,但是在库中原声录音波形的能量是连续的。由于在音节的连 接处没有进行处理,从语谱图中也可以对比出合成语音频谱的非连续 性。在以后的研究工作中我们可以针对这些因素对算法继续进行优化。 下面是合成句子“咱们什么时候出发”合成语音与原声录音的比较 普通话文语转换系统的研究 图2 9 “咱们什么时候出发”( 原声录音) 的波形和语谱图 圈2 一1 0 “咱们什么时候出发” ( 合成语音) 的波形和语谱圈 从语谱图上看出,虽然合成语音的频谱上能够明显看出几个共振峰,但 是和原声录音的语谱图比较,原声的语谱图更干净。换句话说,原声录 音的语谱图的共振峰更明显。 第三章决策树c 4 5 算法 3 1 决策树算法c 4 5 简介
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 时代银行考试题型及对应答案解析
- 2027届甘肃省兰州市教管理第五片区九年级物理第一学期期末达标检测试题含解析
- 快件揽收员岗位理论能力考核试卷含答案
- 软件设计师历年试题及精准答案
- 商业综合体母婴室舒适性专题设计
- 预制构件安装智慧工地建设施工工法
- 医院药品管理差错的全流程追溯解决方案
- 停车场管理系统车牌识别系统安装施工工法
- 加湿系统安装施工工法
- 变电站模块安装施工工法
- 2026年泸西县中枢镇中心学校农
- 2025年长春市公务员录用考试《申论》真题及参考答案(甲类)
- 2026年高考全国1卷语文高考试题(原卷版)
- 2026年江苏高考生物真题含解析及答案
- GA 1817.1-2026学校反恐怖防范要求第1部分:普通高等学校
- 中国2型糖尿病运动治疗指南(2024版)
- CJ/T 283-2017偏心半球阀
- 2026届高中语文一轮复习板块五 文言文阅读 考点突破学案27 理解文言实词(一)-词分古今义究源流 (共107张) +学案+练习(含解析)
- 高考英语3500词顺序版
- 女包质检报告
- 走近老师+ 统编版道德与法治七年级上册
评论
0/150
提交评论