(电子科学与技术专业论文)中文话费文语转换系统的研究与实现.pdf_第1页
(电子科学与技术专业论文)中文话费文语转换系统的研究与实现.pdf_第2页
(电子科学与技术专业论文)中文话费文语转换系统的研究与实现.pdf_第3页
(电子科学与技术专业论文)中文话费文语转换系统的研究与实现.pdf_第4页
(电子科学与技术专业论文)中文话费文语转换系统的研究与实现.pdf_第5页
已阅读5页,还剩64页未读 继续免费阅读

(电子科学与技术专业论文)中文话费文语转换系统的研究与实现.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

硕士学位论文a b s t r a c t a b s t r a c t 1 ks u c c e s s 如la p p l i c a t i o 娜i nm a n yf i e l d so ft e x tt 0s p e e c h ( t t s ) ,w l l i c ha i l i l s t 0c 1 1 毒m g ei i i t e r f 配eb e 觚e e nh 啪a n 锄dm a c l l i n e ,h 酗m a d em o 坞觚dm o r ep o t e n t i a l v a l u e a st h ee 丘o r t so fr e s e a r c h e r s ,i th 鹪b e c np u ti l l t 0t 1 1 e 删w o r l d 锄dr e a l i z e s m 锄yt l l i i l g s w b j c ha 舱o m yd e s c r i k 以i i l 胁t 嬲yp r e v i o u s l y a i m i n ga to b v i o 鸺 d e f i c i e n c i e s 锄dg 印si i l 廿l eb r o a d c 舔t e ds p c e c ho fn l et e l e p h o n ef e eb ya n i f i c i a l r v i c ed e s ko fc w r e n tt 1 1 r m 萄o rd o m e s t i ct e l e c o mq 髓翟幻墙,也ep a p e fd o e s r c s e a r c ho nc e t e l e p h o n e 传ei i lo r d e rt 0g c tb e t t e ri m p r 0 v e m e n ti l lt e l e p h o n ef e e s p e e c h si n t e l l i 酉b i l i 锣a n d 彻:t u :r a l n e 豁觚di i 屹r e a 也e 氲e n d l h l e 鼹o fa i t i f i c i a l s 训c ed e s k t h ep a p e rd e s i 印st t 圮b 舔i cs 缸u c t u r eo ft t sc o n v e 戚o ns y s t e mf i r s t l y w l l i c h i l l c l u d e sd a 瞳ar e s o u r c el i b 捌啊t e x t 锄m y s i sm o d u l e ,锄dr h y m m 觚a j y s i si n o d u l ea n d s p e e c hs y n 也e s i s am o n o s y l l a b i cs 】p e e c hc o 币u si sc r e a l e dd u et 0n l ep a r t i c u l 撕t ) ro f t l l ef e e st e x t ;t b x tn o n i l a l i z a t i o n 惦e sr m bc o i e r s i o n 丘o ms m a l lt ou p p t 鹏a m 9 0 r i t l l m ;i l l c o 池n w i 廿l 吐圮f b ,a r dm 觚i m u mm a t c l l i n ga l g o r i m m ,廿l es p e c c h w o r di s g m e n t e d ;u i l d e rt l i eg u i d a i l c eo fc e t o n em l e s ,t l l ep r i r i l i t i v es t i t c m i l g t o n eo f 辨d hi sp r o c e s d ;t h ep a p e rk g h l i g h t s 也ep i t c h 町m c h r o n o u so v e r l a pa d d a l g o r i t h m 1 1 圮s y i l m e s i z e ds p e e c h sl e n g n li sa d j u s t e db ya u r l i tl e n g t l lo fp i t c ht i l i l e t 1 1 r o u g hp r e c i p i t c hm 甜i 洫g 锄dc o n s i d e r i i l gw i t l lm en o n i l a ll e n g t l lo fs p l c e c h f e a :t u r e ;a c c o r d i i l g t 0t l l e 删t i v es y 劬e s i z e du i l i t sr e s p i r a l t 0 巧p o s i t i o n 也e p r i m i t i v es p e e c ha 陀r 邑;yi sm o d i f i e d 觚盯a n a j y 2 i n ga r l dc o m p a r i n gm ea d m t a g e s 雒dd i s a d v 勰t a g e so f 嘣。璐e ) 【i s t i l l gs p e e :c h s ) r r l 也e s i sm e m o d s ,m ew a v e f o m c o n c a t e n a t i o nm e m o di sc h o n p r 0 v e db yl o t so fe x 肼抽e n t s ,i ft l l es m o o ml e n g t t l o fs p l i c i n gp o i n to f 恤t w o 州“t i v ew a v e f o n i li sl 骶也el 9o f 雠l e s r a l l 也e s i n i a t i o n so fc o n c a t e n a t i o n 托( 1 u 沁s 、) i ,i ub em e 试、玑也锄d 也es ys _ t e m 、航ug a 洫k g l i 瑚舳r a l 】s ss y n t h e s i z e ds p e e c ho u t p u t s i m u i a t i o n 心s u l t sa l s h o wn l a tt l l r o u g h 璐i n gt 1 1 cm o n o s y l l a b i c 鹊s ) ,i l t l l e t i cs p c hu i l i t ,p s o l aa 1 9 0 r i t h ma n dt i m ed o m a i l l w 覃i v e f 0 眦c o n c a t e n a t i o nm e t l l o d ,埘t u i 诅锄d 锄0 0 t l lt c l e p h o 北岛es p e e c h 啪b e o b t a i n e d o n “sb 懿i s ,t h j sp a p e ru 鸵sv c + + a n ds q ls e r v e rd 纰l b a 辩t o c 0 删【i l 咖- i c a :t e 诵me a c ho m e r w 量l i c hm a k e sm eb 嬲i cf 随m e w o r ko ft t ss y s t e mo f c 1 l i 鹏t e l 印h o 鹏b ep r e l i m i n 撕i yd e s i 印e di i lv c + + p l a t f o m 1 ks i i i l i i l a t e ds ) ,i l t i l e s i 趵ds 】弦e c h l l i e v e ss a t i s f a c t o 巧i n t e l l i g i b i l 时鲫dc i 撕吼 a r l d1 1 i g h l y 洒1 p r 0 v e dn a t u 豫l n e s sc o m p a 聆dw i mt t 地s p e e c ho fc u r 他n ta n i f i c i m r v i c e 硕士学位论文a b s t r a c t d e s k 1 1 1 i sp 印e re s t a b l i s h e sas m a l lc 0 吣o fc t l i r l e s et t sc o n v e r s i o ns y s t e m ,w l l i c h h 嬲组k e na v e 巧i i r i p o r t a l l tg t e pf o rb e t t e rs c r v i c e so fm ec o m m u n i c 撕o ni l l d u s 臼黟t 0 g u e s t sa 1 1 di i l l p r 0 v e st l l ea b i l i 够o fh 眦雒- c o m p u t e ri m e m c t i o n k e yw o i t d st t s ,s p e c c hs y n t l l e s i s ,w w e f o 咖c o n c a t e n a t i o n ,p s o l a m 硕士学位论文第一章绪论 1 1 课题背景 第一章绪论 半个多世纪以来,语音信号处理的技术已经成为研究的主流领域。为了促进 人与人、人与机器更好的沟通和交流,语音技术研究的最终目标就是建立能够模 仿或潜在的超越人类在语音编码、语音识别和语音合成方面的能力的系统。 在语音编码的领域,一系列成功的系统已经研制出来。这些系统大大的降低 了语音信号总体的比特率( 从1 0 0 k b s 比特率到8 k b s 比特率甚至更少) ,同时也使 编码语音的清晰度和质量达到了预期的水平。目前手机工业的核心就是嵌入到超 大规模集成电路8 k b s 的语音编码器,到2 0 0 7 年底,全球超过2 0 亿部手机都是采 用了该技术【l j 。 在语音识别和机器认识方面,我们已经取得稳定的进展,开发出来的系统已 经成为人们日常生活不可缺少的一部分,比如,应用在航空公司、金融、医疗和 银行产业的呼叫中心的语音识别系统,协助大型企业办公,为法律和医学界生成 表单和报表系统和研发出能够不需要人为的输入文本就能把文本输入机器上的听 写机【2 】。 文语转换( t e x t - t 伊s p e e c h ,简称t t s ) 技术,该技术可实现将任意文字信息 实时转化为标准流畅的语音,也就是解决如何将文字信息转化为可听的声音信息 的问题。t t s 是综合了语言学处理和声学处理两部分的计算机语音合成技术,涵 盖了声学、语言学、数字信号处理、计算机科学等多个学科领域1 3 】,是中文信息处 理领域的一项前沿技术。它可以提供声文并茂的信息表达方式,它和语音识别的 结合将极大地改善目前单调的人机交互方式,对人机交互有重大意义。文语转换 的应用在人机界面交互方式领域获得了极大的关注和商业应用。甚至比尔盖茨也 预测下一代计算机操作系统的革命性成果就是人机交互界面的全面改观。在其他 领域t t s 也有广阔的应用和市场前景,例如通讯、出版、教育、军事、交通等。 因此,它已经成为当前国内外各大研究机构的研究热点之一【4 】。 论文结合目前中国三大通信运营商的人工服务台的运营现状,由于目前人工 服务台报出的话费在可懂度上虽然达到了一定的水平,但是一字一顿,不连贯, 不自然。可以看出,目前人工服务台播报的话费是直接的一个一个字的播放,加 上一些停顿,没有进行任何的处理,可以看成是简单的录音播放的形式,具有有 限的应用价值。为了进一步提高话费查询系统的实用性和人机交互的友好性,需 要在可懂度的基础上提高合成语音的自然度和连贯性。论文主要就是为了改善播 报的话费语音的自然度和连贯性,为进一步的提高人工服务台的服务水平和提高 硕士学位论文第一章绪论 广大用户使用该平台的质量奠定基础。 1 2 文语转换技术的国内外发展现状 文语转换技术即语音合成技术在过去十年表现出了不断增长的商业价值。追 溯到1 9 8 6 年,只有数量很有限的几个公司活跃在语音合成的市场上,基本上都是 采用基于共振峰参数的语音合成和基于l p c 参数的语音合成。然而,这些技术还 是大多数t r s 产品的基础,新兴的更简单的基于波形拼接的技术在近期得到广泛 使用同时也取得了许多进展。文语转换技术的始于语音合成技术的发展,论文按 照时间顺序简单介绍在文语转换历史上发生的一些重大事件。 第一个共振峰合成器p :a t ( p a 船m e t r i ca r t i f i c i a l 砌k e r ) 是w 酊t e rl 嬲鹏n c e 在 1 9 5 3 年提出的。汀由三个并联的电子共振谐振器组成。其输入是蜂鸣或清音。 装置采用一个移动的玻片把描绘的模型转换成六个时间函数,来达到控制合成语 音的三个共振峰频率,浊音的幅度,基音的频率和清音的幅度【5 】。 与此同时,g 硼n a rf a n t 提出了第一个串联共振峰合成器o v e i ( 0 1 1 a t o rv e r b i s e l e 嘶s ) ,它由共振峰谐振器串联组成。1 9 6 2 年,f 枷a n dm 嘲n y 推出了改进的 o v ei i 合成器,新一代的o v e 由很多独立的部分组成,这些独立的部分用来构造 元音,鼻音和阻塞辅音的声道形状的传递函数。装置采用的激励有元音,气音和 摩擦音。o v e 项目在瑞士k t h ( k u i l g l i g at e k i l i s l 【ah o g s k o l 纽) 的研究下开发到 o v ei i i 和g l o v e 【6 1 。目前的商业h 渤v o x 系统也是来源于这些。 2 0 世纪6 0 年代中期,第一批基于l p c ( l i i l e a rp r e d i c t i v ec o d m g ) 参数的实 验开始了1 7 】。1 9 8 0 年,线性预测最初应用在ns p e a k ns p e l l 这类低成本的系统里, 其合成语音的质量和目前的系统相差甚远,但是经过一些修改该算法在目前很多 系统里面表现良好。 1 9 6 8 年,在日本的e l e c n 0 t e c h i l i c 甜实验室,n o r i l 【0u m e d a 和他的同事开发出 了第一个完整的英语t t s 系统。它是基于语音的发音模型,包括一个完善的启发 式的句法分析模块【引。 l9 7 9 年,础l e 巩h u n i l i c u 位锄d a n 在m i t ( m 嬲s a c h u s e t t si n s t i t u t eo f t e c h n o l o g ) r ) 展示了m i 础【的t t s 系统1 9 】。两年后,d e 姐i s 雒推出了他的著名 的舭系统,该系统使用了一个全新的更复杂的发声源。m i t a 收和舭系 统使用的技术也是目前一些使用中的商业化语音合成系统的基础,如d e c t a l k 。 在2 0 世纪7 0 年代末期和8 0 年代早期,市场上推出了一系列商业化的文语转 换系统和语音合成系统。1 9 8 3 年,第一批商业化的d e c t a j k 和h 晌v o x 问世。当 前的研究方法和商业性的语音合成技术都涉及到数据驱动技术和一些数学的、统 计的和语言学的算法,这些算法能够轻易的在电脑上实现。这些系统都是一些规 2 硕士学位论文 第一章绪论 则系统( 有限状态规则,上下文无关规则,重写规则) ,隐马尔科夫模型( h m m ) , 神经网络模型和分类回归树( c 触玎) 等【l o 】。神经网络系统应用于语音合成也有十 年的时间了。 当前最有前途和广泛的研究趋势是基于语音单元选择的拼接合成和基于数据 驱动的韵律模型。第一批基于语音单元选择合成的系统是n 瑚k ( s a g i s a k ae ta 1 1 9 9 2 ) 】和不久后出现的c h a t r ( b l a c ka n d1 a y l o r1 9 9 4 ) 【1 2 】。还包括:基音同步叠 加算法( p i t c h s y i l c h r o n 0 瑚o v e r l 印a d d ,简称p s o l a 【1 3 】) 算法的提出和基于数据驱 动的大规模语料库的出现,这些人工智能领域的技术在韵律分析和基元选择中发 挥了重大的作用。 中国是一个拥有十三亿人口的国家,一个高清晰度、高自然度的汉语文语转 换系统将拥有广泛的市场。汉语的文语转换技术的研究始于上个世纪8 0 年代,虽 然开始得较晚但是发展很快。特别是近些年来,在国家“8 6 3 智能计算机主题的 支持下,一些科研院所对汉语文语转换系统进行了大量的研究,其中包括清华大 学、中科院声学所、中国科技大学都在文语转换不同的技术领域取了良好的成绩。 由中国科技大学的几名老师和学生创办的企业科大讯飞依靠中国科技大学在汉语 文语转换领域的技术优势,成功的把这项技术从实验室推向了市场,其汉语文语 转换系统合成的语音代表了目前的最高水平【1 4 1 。目前,文语转换技术已引起了世 界上许多著名的计算机厂商或公司的关注。世界上i t 业一些大公司如m i c r o s o f t 、 i 蹦、i n t e l 、n 0 k i a 等都在中国投入大量资金和人力以竞争语音市场。i n t e l 于1 9 9 8 年1 0 月,在北京主持召开了“9 8 国际语音技术论坛 ,并表示要投入五千万美元 进行语音技术的研究;m i c r o s o f t 则在北京成立了继英国剑桥之后在美国本土以外 的第一个研究院,其主要的研究课题就是使计算机能说、能听、会看、会学习, 并把说摆到了首位。b e l l 实验室、a t r 、i b m 和s i e m e n s 公司已研制出多种语言的 t t s 系统。法国c n e t 公司已将其多语种1 1 l s 系统运用于电话网中的公共话音服务。 作为能使计数机说话的文语转换技术确实具有广泛和深刻的划时代意义。 1 3 语音合成方法 语音合成技术是文语转换系统的核心所在,其合成方法的选择直接决定着合 成语音的自然度。虽然语音合成技术的研究已经经历了一段很漫长的时间,但是 真正意义上具有实用价值的近代语音合成技术是在计算机技术和数字信号处理技 术的基础上发展起来的。5 0 多年来,研究者们竭尽全力,试图通过人类发音的声 道模式或时变语音谱的终端模拟合成模型和语音信号的短时平稳性来模仿语音信 号产生的物理模型【l5 1 。尽管很多杰出的语音技术研究者做出了重大的贡献,但是 大多数情况下,通过机器合成语音的质量不自然,在现实世界中根本无法被消费 3 硕士学位论文第一章绪论 者所接受。在2 0 世纪7 0 年代末,一旦研究人员了解到如何可靠的从人类语音中 提取出音素,那么通过拼接基本的语音单元的来合成语音的观点可以被证实是行 之有效的。经过逾十年的调查研究如何以最佳的方式拼接语素,合成的语音获得 了( 比以往的合成系统) 高度的可懂度,但是遗憾的是合成语音的自然度仍旧达 不到要求。因此,基于波形拼接的语音合成系统依旧吸引着研究人员的好奇心, 但仍然没能在现实世界中应用,如阅读电子邮件和在对话系统中进行用户交互等 【1 6 1 。语音合成的技术得到重大的突破是在2 0 世纪8 0 年代末,当时在日本的a t r 的y o s l l i n o r is a g i s a l 【a 摒弃了以单音素标记作为语音合成的基本单位集,采用从精 心设计的语音数据库中提取多音素标记作为语音合成的基本单位集。s a g i s a l ( a 意识 到,在极限情况下,如果你拥有成千上万的尽可能多的英语语言音素的标记,那 么你可以逐字的拼接出“正确的音素序列并合成出自然的接近人类发音的语音【3 j 。 但是新的问题产生了,那就是如何精确的决定在语音合成时,在单音素的位置哪 些成千上万的音素应该被使用,这就像大规模的计算问题,在尽可能合理的时间 和内存空间,采用各种算法搜索最优音素序列【l 刀( 从庞大的,事实上有限的数据 库中) 。所以,新一代的语音学研究人员需要对语音合成中所谓的“单元选择”算 法的研究,提高合成语音的可懂度和自然度并且能够投入实际的使用。 目前,语音合成的方法主要有基于规则的语音合成技术、基于参数的语音合 成技术和基于波形拼接的语音合成技术。当前国际上具有代表性的语音合成系统 有日本a 1 限与c i 也s t 合作的情感语音系统,中国科学院自动化所的合成器,德 国的规则驱动的参数合成器和东京大学的合成器等。这三种语音合成方法也正好 代表了语音合成技术的发展趋势【1 8 】,接下来,具体介绍这三种语音合成方法。 1 、基于规则的语音合成 基于规则的语音合成方法是通过采用语音学的规则来产生语音,此类系统里 面存储的主要是语音单位的声学参数和由音素如何组成音节、由音节如何组成词、 由词如何组成句子和如何控制轻重音、音调等韵律特性的各种语音学的规则。这 些语音单位主要是音节、半音节、音素或双音素。当输入待合成的文字信息后, 在各种规则的指导下,合成系统可以自动地将它们转换成连续的语音声波进行输 出【1 9 1 。 由于协同发音现象存在于汉语语音中,单独发音的元音和辅音与连续语流中 的元音和辅音是不同的。因此,合成规则是在分析每一个语音单元出现在不同语 言环境中的协同发音效应的基础上,总结出各个语音单元发音的规律而制定的, 如共振峰规则等。 2 、基于参数的语音合成 基于参数的语音合成技术大多以音节或者音素作为合成单位,在语音学理论 4 硕士学位论文 第一章绪论 的指导下,对所有合成的语音单元进行语音分析,一帧一帧的提取特征参数,特 征参数再经过编码后形成语音库;合成语音的时候,根据待合成的信息,从语音 库提取出相应的合成参数,经由参数合成器合成出语音【2 0 l 。目前比较主流的是基 于共振峰参数和基于l p c 参数的语音合成,下面简单介绍一下这两种基于参数的 语音合成技术。 共振峰参数合成是目前比较成熟的参数合成方法之一。其理论基础是语音生 成的数学模型。在该模型中,语音信号是在激励信号的激励下,经过谐振腔( 也 就是声道) ,或由鼻或口腔辐射声波【2 l 】。研究者们研究出了三种实用模型:级联型 共振峰模型,并联型共振峰模型和混合型共振峰模型。这三种模型都得到了很成 功的应用,在前一节讲到过的f o n t 的o v e 系统就是采用的级联型的共振峰模型; h o l i i l e s 合成器采用的是并联型的共振峰模型;而最为典型的也是最为成功的是采 用的是混合型的共振峰模型的砒合成器, l p c ( l i i l e 牡p 川i c t i v ec 0 d i i l g ) 参数合成是目前比较简单和实用的一种语音 合成方法,其主要特点是低数据率、低复杂度、低成本,因此而受到特别重视。 其基本原理是:语音样点间存在相关性,也就是说现在或未来的样点值可以用过 去的样点值来预测,或者可以说能够用过去的若干个语音抽样或它们的线性组合 来逼近一个语音的抽样。在使实际语音抽样和线性预测抽样之间的误差在某个准 则下达到最小值的前提下,可以决定一组唯一的线性预测系数。而这组预测系数 就是l p c 技术的关键,它反应了语音信号的特性,可以用于语音合成【捌。 l p c 合成技术实际上只是一种时间波形的编码技术,其合成过程只是一种简 单的语音波形的编码和拼接过程。然而,由于协同发音现象的存在,自然语流中 的语音和该语音在孤立状态下的语音区别很大,如果仅仅简单地把各个孤立的语 音不进行任何处理的拼接在一起,其合成的整个语流肯定是不太理想的。所以, l p c 合成法对于合成整个的连续语流效果并不理想,必须和其他技术相结合,才 能明显提高合成语音的质量。 3 、基于波形拼接的语音合成 基于波形拼接的语音合成方法在包含有大量语音合成单元样本的语音库中选 择最合适的合成单元进行波形拼接,拼接过程中要用一些平滑技术来提高合成语 音的质量。 基于波形拼接的语音合成方法一般有两种形式:一种是波形编码合成,它与 语音编码中的波形编解码相似,直接把要合成的语音的原始语音进行存储或经过 编码压缩后存储,一般以语句、短语、词或音节作为合成单元。合成的时候根据 待输出的信息,采用合适的算法从语音库中取出相应的语音波形数据,经过连接 或适当编辑后组合在一起,再经解码,还原成语音进行输出。另一种是波形编辑 5 硕士学位论文 第一章绪论 合成。首先采用语音编码技术,存储适当的语音基元建立语音库。合成时,根据文 本信息对相应的语音单元经过波形的编辑、拼接、平滑处理后,便可以得到所需 的合成语音1 2 3 】。这类方法一般选择比较大的语音单元建立语料库,例如选择字、词、 词组、短语或者短句。这样,在合成语音时,待拼接的点数比较少,容易达到较高的 合成质量。 上世纪8 0 年代末,基音同步叠加算法的提出,该算法可以灵活的修改语音单 元的韵律特征,由此使得波形拼接合成技术得到了更大的发展和应用。与此同时, 由于计算机处理速度的日新月异的发展,内存容量、硬盘容量不断增大,存储空 间不再阻碍波形拼接的语音合成【冽。波形拼接方法已成功应用于国内外许多文语 转换系统中。 最近,基于数据驱动的大规模语料库的出现为波形拼接合成算法带来了新的 进一步的发展。在这种算法中,语音单元是从一个预先录下的庞大的语音数据库 中挑选出来的,可以想象如果语音数据库足够大,包括了各种语言环境下的语音 单元,则可以根据一系列的匹配规则从该语音库中挑选出最合适的匹配语音单元 进行拼接。这种方法合成的语音的音质较以上所以方法会有质的提高。虽然存在 语料库的录制和制作工作量巨大、需要深厚的基础研究积累等缺陷,但系统的商 业前景却是无可限量的【2 5 1 。 中文话费文语转换系统由于各方面条件限制和系统的应用平台的特点,没能 采用大规模的语料库,仅仅采用了单音节的语音波形为基元组成的语料库。由于 p s o l a 方法以基音为单位进行韵律修改和其合成音质自然度高的优点,本文提出了 采用p s o l a 算法调整合成语音的韵律和基于时域的波形拼接平滑算法来合成话费 语音,对中文话费文语转换系统进行了研究。 1 4 本文主要的研究内容 文语转换系统应用广泛,其中中文话费的语音查询则是我们平时最常用的, 自然易懂的话费信息是每个手机用户都愿意听到的。基于以下考虑:第一,根据 话费查询的特点,每个用户的话费使用情况和余额各不相同,因此系统中话费文 本播报时因用户不同存在差异,而其他文本都是固定不变的,可以直接采用录音 播放的形式,无需对其进行文语转换,而且这种形式的语音是最原始的、最自然 的,有助于提高整个系统输出语音的自然度;如果要对这些文本进行文语转换的 话,需要对所有的汉字建立语料库,会涉及到更复杂的分词算法,这是一项庞大 的工程,适合一个群体进行研究,基于研究条件的限制,论文无法实现该系统涉 及到的所有汉语文本的文语转换,只对话费文本进行文语转换技术进行了初步的 研究。 6 硕士学位论文第一章绪论 因此,论文提出的中文话费文语转换系统是基于话费文本,主要包括语料库 的建立、文本分析、韵律分析和语音合成。语料库存储的是单音节的语料,文本 分析模块主要采用人民币大小写转换算法,韵律分析和语音合成则主要结合一些 韵律规则和p s o l a 算法来实现韵律修改和通过波形拼接技术合成语音,这些都是 基于m a t l a b 平台的仿真实现,为了进一步完善中文话费文语转换系统,本文还 介绍中文话费文语转换系统的基本框架在v c + + 6 0 平台上的设计,其中包括不同 身份人员的登录,人员信息数据库、用户信息的管理和话费值的语音查询。用户 信息的管理主要包括对用户信息的添加和删除,登录密码的修改。话费的语音查 询则是正确读出话费值,使用户能够听懂所读的语音信息。 论文安排如下: 第一章绪论,概述了文语转换系统的背景和发展历史,综述了近年来国内外 文语转换系统的进步和发展,了解了t t s 系统在当前的应用以,详细研究了订s 系统中最为关键的语音合成技术的各种解决方法及其优缺点并提出了本课题的研 究内容。 第二章文语转换系统的研究,详细描述了该系统的设计过程和各个模块的关 键技术。主要包括数据资源库的设计、文本分析模块、韵律分析模块和语音合成 模块。 第三章基于p s o l a 合成算法的中文话费文语转换系统的设计,详细研究了 p s o l a 算法在中文话费文语转换系统中是如何对合成语音的韵律进行修改和合成 语音的。p s o l a 算法实现的关键就在于获得准确的基音标注,本文结合自相关法 进行准确基音周期的求取并在语音信号浊音段的最大幅度处进行基音标注。 第四章中文话费文语转换系统的仿真研究及性能分析,在m a t l a b 平台设 计了系统的操作界面,演示了系统的工作流程、仿真结果和实现方法,并对系统 进行了质量和性能分析。 第五章中文话费文语转换系统界面设计,提出了基于v c + + 平台的该系统功 能和框图、人员信息数据库的设计、登陆模块和不同身份人员主窗口的设计及各 个窗口所实现的功能。 第六章结束语。对论文所做的工作进行了总结,说明了本文的创新点和对下 一步的工作进行了展望。 7 硕士学位论文第二章文语转换系统的研究 第二章文语转换系统的研究 一个典型的t r s 系统是由以下几个部分组成:文本分析、韵律分析、语音合 成和数据资源库。它以普通的文本作为系统的输入,输出是某种格式的语音文件。 数据资源库包括文本分析时需要借鉴参考的语法规则库、韵律模型的预测规则和 语料库。图2 1 所示为一个完整的t t s 系统的结构图。本文的t t s 系统也是建立 在该结构图之上的。下面分别就这四个模块进行介绍。 t t s 内核 图2 1 一个完整的t t s 系统的结构图 2 1 数据资源库的设计 2 1 1 语料库的建立 t t s 系统应建立在高质量的语料库的基础上,只有建立真实、自然、充分的语 音数据库才有可能合成出高质量的语音。同时,语音数据库也为语音合成提供了 大量的分析数据和合成语料。 本系统采用的是基于波形拼接的语音合成技术,第三章会详细介绍该合成技 术在系统上的实现。结合目前绝大多数手机用户话费的消费额度和存储话费的额 度,该系统播报的所有费用都是在0 到9 9 9 9 9 9 之间。而且,合成基元是语音合 成中首先要考虑的问题。从一句连续的汉语语音波形上可以看出,一句连续的汉 语语音可以分成多个单音节的语音。而且,目前手机的存储空间都有限,结合上 述几点,作者提出了以单音节汉语语音的波形作为系统的合成基元,这样语料库 中包含的基元有:o ,1 2 ,3 ,4 ,5 ,6 ,7 ,8 ,9 ,千,百,十,元,角,分共计1 6 个单音节语 音的船v 文件。这些语音基元都是作者在密闭安静的环境下录音制作的,由于录 音过程或多或少会有一些噪声的影响( 如电脑本身的声音) ,所有语音文件都用 8 硕士学位论文 第二章文语转换系统的研究 g o l d w a v e 软件进行了录制、降噪和音量优化处理,经过分析,该语料库完全适合 作为本课题的语料库。g 0 1 d w a v e 是一款功能强大的数字音乐编辑器,它可以对各 种格式的音频文件进行播放、录制以及格式转换等处理【2 6 1 。 为了提高系统的功能和程序编写的便利,系统采用了“拼音加声调”即汉字 的音节这一规范的语料存储文件名,这样语料库中存储的语音波形的文件名为: l i n 9 2 ,姐l ,e r 4 ,s 觚l ,s i 4 ,、m 3 ,l i u 4 ,q i l ,b a lj i l t 3 ,q i 觚1 ,b a i 3 ,s l l i 2 ,y 豫1 1 2 j i a 0 3 ,f e n l 。由于某些 韵律规则的要求和中文人民币的习惯读法,语料库增加了j i u l ,、u 1 ,l i 龃9 1 这三个基 元的语料。至此,本系统的语料库基本完成了。图2 2 和图2 3 显示了语料库中部 分基元的波形图。 h 1 的时域波形图 _ n 1 的时域波形图 图2 2 基元f e n l 和s a n l 的时域波形图 j i u 3 的时域波形图 j i u l 的时域波形图 图2 3 基元j i u 3 和j i u l 的时域波形图 9 硕士学位论文 第二章文语转换系统的研究 2 1 2 语法规则库的设计 语法主要是关于词类、短语、句子、分类句型、复句、句群、标点符号等的 规则的集合,反映了词的变化规律和组词成语的规律。汉语具有象形文字的特点, 而印欧语系是由较少字母构成。汉语具有词语间没有间隔,不易提取和汉语词类 变化( 形态上的变化) 极少等特点,这样研究汉语的语法规则库较为困难,而且 汉语语法规则较多。众多的语言专家经过多年研究总结出汉语语法规则库,包括 通用的规则库和特定领域的规则库,为进一步研究打下了坚实的基础。翻译引擎 正是利用上述规则对句子成分进行标记,识别语义块。 词类主要分为实词和虚词两种。短语主要包括1 2 种类型,即主谓短语,动宾 短语,定中短语,状中短语,中补短语,联合短语等。句子主要是依据句子成分 中的主谓语来进行判断的,分为主谓旬和非主谓句。语法特征提取主要包括:词 类,词的搭配,短语类型,单复句判断和句子成分。通过上述特征的提取,才能 够正确的划分句子的成分。 2 1 3 韵律模型的预测规则 汉语的韵律规则主要描述了音节在不同情况下的基频的变化情况,主要表现 在音节的时长、音高、能量的变化和停顿等几个方面,它决定了合成语音的自然 度和清晰度,因此语音合成必须要提取较为全面的基频变化规律【2 7 】【2 甜。论文的韵 律规则库主要从以下四个方面描述: ( 1 ) 词的声调模式:虽然各种声调独立时有相对稳定的模式,而它们在连续 语流中的调型却要受到其相邻音节调型的影响,因此需要设置汉语双字词的声调 组合的模式和不同声调组合时声调的变化规律。 ( 2 ) 词的音长模式:双字词的音长分布与音节在句子中的位置有关,还与词 的重心以及词在语流中的位置有关,所以不能简单判断双音节词的前音节长还是 后音节长。一般来说,结合大多数音长的分布规律和论文研究的范围,论文统一 采用简单的后音节长规则,双音节词的时长比率为l :1 1 ,一般最后一个音节比 较长,设置为1 2 ,这样基本可以达到要求。 ( 3 ) 停顿模式:系统中,设置词与词之间的停顿为1 0 m s ,呼吸群间停顿为 1 0 0 i n s ,分句间停顿为2 0 0 i n s ,陈述句后停顿为5 0 0 m s 。 ( 4 ) 轻重音规则:音节在一个词中的轻重程度叫音节的重度,分为四级:1 ( 轻声) ,2 ( 正常) ,3 ( 半重) ,4 ( 重) 。单音节词保持原重度;双音节词按照3 4 , 4 一l ,4 2 ,4 3 的重度规律进行重度处理。 l o 硕士学位论文 第二章文语转换系统的研究 2 2 文本分析模块 文语转换系统和其他类型的语音合成系统最重要的区别就在于文语转换系统 必须具有对篇章的一定程度的理解能力。具体表现为文本分析模块能够对一定数 量的文字,最少是一句话,进行语言学分析,以便生成一种能够被语音学处理的 内部表示。至少需要确定每个字的具体读音,识别正确的节奏、重音和语气,这 对于合成语音的连贯性和自然度极其重要。本模块主要包括:文本的正规化、语 音词的划分和句法和语义的分析。 2 2 1 文本的正规化 中文t t s 系统的第一步就是将输入的文本文件中所有非汉字的字符,数字, 缩略语和首字母缩写组成的短语等文本转换为汉字的形式。例如,“¥3 4 5 应该 转换为“三百四十五元 ,“1 9 8 7 0 1 0 9 应该转换为“1 9 8 7 年1 月9 日 ,等等。 同时,相同的字符在不同的句子里面,它所应该转换成的形式也不尽相同。例如 1 9 9 7 ,有的读成一千九百九十七,有的读成一九九七年,有的读成一千九百九十 七元总之,场合不同就有不同的读法【2 9 】。为了解决这种模糊性,我们需要参 考句子的上下文。 文本的正规化一般就是把一篇文章根据标点符号分成一个一个完整的字符 串,再根据语言元素的类型等把每个字符串分成一个一个的文本片段,接着根据 一些符号、数字等的信息调整片段的位置和规范化片段,最后得到符合朗读要求 的顺序片段。 论文要实现的是所有用户的话费信息的语音输出,对于不同的查询用户,输 出语音的不同之处仅在于用户自身产生的话费额度和余额的额度。于是,对于输 出语音的相同部分,作者采用的是简单的录音一播放的形式,没有涉及到t t s 的范 围。这样,系统的文本的正规化就是统一的人民币小写到大写的转换。许多文献 介绍了各种人民币小写到大写的转换算法,都是针对所有数字范围内的数字。但 是,结合本课题数字的范围,论文采用了如下的简化算法,见图2 4 。 算法的基本操作和流程如下:首先对获取的话费n 啪做一个乘一百的操作 n u m = n 啪1 0 0 ,主要是由于整数比较好处理;再把处理后的数字的每一位也就是 “个位十位百位千位万位和十万位”提取出来并转换成对应的汉字输出到一个字符 串里面。接下来,建立一个空的1 2 位的字符串s 仃l 【1 2 】( 因为一个最大的万以内 的数字转换成汉字是1 2 位的,也就是数字里面不包括“0 ”的时候。例如1 2 3 4 5 6 应 转换为一千两百三十四元五角六分) ,把原来的字符串的最高位到最低位依次存储 到新的字符串的奇数位置即s 仃l 的奇数位置“一口二口三口四口五口六口一,再简 硕士学位论文第二章文语转换系统的研究 输入 n 啪= n 啪一o o 1 分别对“元”“角”“分”在不同 i 位置的处理,得到新串s 们 l 对首项为“零”和尾项为 “零”的处理 图2 4 万元以内人民币小写到大写转换算法 1 2 硕士学位论文第二章文语转换系统的研究 单的在数字后也就是偶数位置添加千百十元角分六个单位,则s t r l 字符串中的字 符为“一千两百三十四元五角六分 ;后面就是对零的处理,首先将零后面的字符 变为空格,连续两个零的去掉一个零后变为空格,再对字符串去空格得到新的字 符串s 仃2 。最后剩下的主要是对“零 的处理,主要有:查找到“元”的位置,如 果该位置的前一个字符为“零 并且该位置为2 ,那么新的字符串就要去掉、“零 元 这个子串;查找子串首项,若首项为“零 ,第二项不为“元 时,新的字符 串就要去掉首项;查找到“角 的位置,如果该位置的前一个字符为“零 并且 该位置不为2 ,新的字符串就要去掉“零 这个字符,若该位置为2 ,则新的字符 串就要去掉“零角这个子串;查找到“分”的位置,如果该位置的前一个字符为 “零 并且该位置不为2 ,新的字符串就要去掉“零分 这个子串,若该位置为2 , 新的字符串为“零 ;通过以上所有处理后,便得到了新的字符串s 仃3 ,在新的字 符串s 仃3 中重新查找“零的位置,若字符串末尾为“零 并且字符串长度不为l , 则去掉末尾“零”字符,若字符串长度为l ,则字符串保持不变【3 0 l 。通过这些处理, 就得到了最终的正确的符合人民币读法汉字字符串的组合刚。以上算法就实现了 输入是万以内的数字输出是对应的汉字的人民币。 2 2 2 语音词的切分 文本语音词的切分是确定汉字读音的关键所在,它是确定文字在上下文中的 正确读音和生成韵律参数的基础。传统的分词算法主要有三种:正向最大匹配算 法,逆向最大匹配分词算法和正逆向扫描相结合的最大匹配算法。这些分词算法 虽然机械,但是优点也较为明显:系统资源占用少,分词速度快等【3 l l 。语音词的 切分一直都是中文自然语言处理领域的基础研究。目前,网络上流行的很多中文 分词软件都可以在付出较少的代价的同时,具备较高的正确率。在这里论文研究 的是中文分词的一个最基础的算法:正向最大匹配算法( m a ) 【i i i l 哪m a t c g ) 。该 算法的基本原理为:从左到右将待分词文本中的几个连续字符与词表相匹配,如 果匹配成功,则切分出一个词,在对剩下的文本继续采用上述方法切分,直至文 本切分完毕。当然这里存在一个问题:要做到最大匹配,并不是第一次匹配到就 可以切分的。例如待分词文本:t 懿t 口= i t 中”,”华”,人,民,共”,和”, 国,成”,立, ”了”,。) 词表:l i b 口= i t 中华, 中华人民,中华人民共 和国”, ”成立,成立了 。具体切分如下: ( 1 ) 从t e x t 【l 】开始,当扫描到t e x t 【2 】的时候,发现”中华已经在词表l i b 口中了。 但还不能切分出来,因为还不清楚后面的词语是否可以组成更长的词,实现最大 匹配。 ( 2 ) 继续扫描t e x t 【3 】,发现中华人并不是l i b 口中的词。但是还不能确定前面 1 3 硕士学位论文第二章文语转换系统的研究 找到的”中华”是否已经是最大的词了。因为”中华人”是l i b 2 】的前缀。 ( 3 ) 扫描t e x t 【4 】,发现”中华人民”是l i b 口中的词,继续扫描下去。 ( 4 ) 当扫描t e ) ( t 【5 】的时候,发现”中华人民共”不是词表中的词,但是是词的前 缀,继续扫描下去。 ( 5 ) 当扫描t e 赋【6 】的时候,发现”中华人民共和”不是词表中的词,但是是词的 前缀,继续扫描下去。 ( 6 ) 当扫描t e x t 【刀的时候,发现”中华人民共和国”是词表中的词,是词的前缀, 还需要继续扫描下去。 ( 7 ) 当扫描t e ) ( t 【8 】的时候,发现”中华人民共和国成”并不是词表中的词,也不 是词的前缀,因此可以切分出前面

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论