(信号与信息处理专业论文)基于隐马尔可夫模型的说话人转换方法的相关研究.pdf_第1页
(信号与信息处理专业论文)基于隐马尔可夫模型的说话人转换方法的相关研究.pdf_第2页
(信号与信息处理专业论文)基于隐马尔可夫模型的说话人转换方法的相关研究.pdf_第3页
(信号与信息处理专业论文)基于隐马尔可夫模型的说话人转换方法的相关研究.pdf_第4页
(信号与信息处理专业论文)基于隐马尔可夫模型的说话人转换方法的相关研究.pdf_第5页
已阅读5页,还剩87页未读 继续免费阅读

(信号与信息处理专业论文)基于隐马尔可夫模型的说话人转换方法的相关研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 摘要 随着目前语音合成技术的进步,合成语音的音质和自然度都有了很大的 提高,因此,用户对语音合成系统提出了更高的要求多样化的语音合 成,包括多个发音人、多种发音风格、多种情感以及多语种等语音的合成。 在这一背景下,通过调整一个说话人的语音,使其听起来像是另一个人说出 来一样的说话人转换技术被提出。说话人转换技术根据少量的目标说话人的 语音数据,对源说话人的语音参数进行调整,从而得到目标说话人的合成语 音,并可以此实现多样化的语音合成。为此,本文对基于h m m ( h i d d e n m a r k o vm o d e l ) 的说话人转换技术进行了详细的介绍,并对其训练流程和 关键技术进行了改进,最后,针对具体的应用进行了相应的研究。本文按照 如下几个部分展开讨论: 文章的第一部分主要是介绍了本文研究的背景和几种主要的说话人转换 的方法。首先,简单的描述了一下语音合成技术以及其近年来的发展。接下 来,为了帮助我们更好的理解说话人转换的原理,我们也对人的发音过程的 声学机理和数学模型进行了系统介绍。这是因为,说话人转换技术是对源说 话人的音色进行转换使其听起来像目标说话人发出的。而为了实现说话人音 色的转换,通常需要对语音信号进行激励源和声道滤波器的分离,以便对激 励信号和声道模型分别进行修改,然后再重新生成语音。最后我们对说话人 转换技术的发展和常用的几种方法进行简要的介绍。 在文章的第二部分,主要介绍了基于h m m 的说话人转换的基本框架。 由于基于h m m 的说话人转换技术是建立在基于h m m 的语音合成系统的基 础上的,因此,本章首先介绍了t r a i n a b l et t s ( t e x t - t o s p e e c h ) 的基本框 架,并对其中的一些关键技术进行了分析。接下来主要介绍了基于h m m 的 说话人转换技术的一个重要环节一一m l l r ( m a x i m u ml i k e l i h o o dl i n e a r r e g r e s s i o n ) 模型自适应算法。包括m l l r 算法中h m m 模型均值和方差转 换矩阵的估计方法以及回归矩阵绑定的基本原理。最后基于上述基于h m m 的说话人转换的基本框架,进行了女到女和女到男的说话人转换实验,并且 从合成语音的音质、自然度以及与目标语音的相似程度三个方面进行了主观 和客观的评测实验。 文章的第三部分针对第二章中所介绍的基于h m m 的说话人转换的各主 要技术环节,如基于m s d ( m u l t i s p a c ed i s t r i b u t i o n ) 一h m m 基频建模的模 型自适应、时长模型的自适应、源说话人模型的训练和选择、模型自适应算 法、考虑动态参数的参数生成算法等模块;以及合成语音中的问题,如在自 适应数据很少时效果不佳、合成语音频谱过于平滑等问题,分别进行了分析 和相应的改进工作。主要的改进包括:整合了自适应流程,使频谱、基频、 时长模型在相同的框架下进行转换;使用l s p ( l i n es p e c t r a lp a i r ) + d a l ( d i f f e r e n t i a lc o e m c i e n t so fa d a c e n tl s p ) 参数减轻频谱过平滑的问题:使 用共享决策树聚类方法训练平均模型作为源说话人模型,从而提高模型自适 应的鲁棒性;对模型自适应算法进行改进,提高自适应效果;针对不同的训 练数据量,采用不同类型的转换矩阵;改进参数生成算法。 文章的第四部分主要介绍了基于h m m 的说话人转换技术在情感语音合 成以及嵌入式的多说话人语音合成系统方面的应用。提出了基于h m m 的情 感语音合成方法。并通过主客观的测试验证了情感语音合成的有效性。另 外,针对嵌入式系统中资源受限的特点,提出了一种实现多说话人语音合成 的方法。 关键词说话人转换、隐马尔可夫模型、可训练语音合成、模型自适应 a b s t r a c t w i t ht h ed e v e l o p m e n to ft h es p e e c hs y n t h e s i st e c h n o l o g i e s ,t h eq u a l i t ya n d n a t u r a l n e s so ft h es y n t h e t i cs p e e c hh a v eb e e ng r e a t l yi m p r o v e d s ot h et e x t - t o s p e e c h ( t t s ) s y s t e mw h i c hc a ns y n t h e s i z ev a r i o u sk i n d so fs p e e e i l s u c ha s s p e e c hw i t hd i f f e r e n ts t y l e so rd i f f e r e n te m o t i o n so fd i f f e r e n ts p e a k e r s 。h a sb e e n t h em a i no b j e c t i v e so fr e s e a r c h e r sa n du s e r s d u et ot h i s ,v o i c ec o n v e r s i o nw h i c h c a l lm o d i f ys p e e c ho fo n es p e a k e rt os o u n dl i k es p e e c hf r o ma n o t h e rs p e a k e rh a s b e e ns t u d i e dt oa c h i e v et h ed i v e r s i f i c a t i o no f t h e s y n t h e t i cs p e e c h t h e r e f o r e ,t h i s t h e s i ss t u d i e st h et o p i co ft h eh i d d e nm a r k o vm o d e l ( h m m ) 一b a s e dv o i c e c o n v e r s i o ni nd e p t ha n ds y s t e m a t i c a l l y , i n c l u d i n gt h ef r a m e w o r kc o n s t r u c t i o n , t h ek e yt e c h n o l o g yi m p r o v e m e n t sa n dt h er e l a t e da p p l i c a t i o n s t h ed e t a i l e d r e s e a r c hw o r k si nt h i st h e s i sa r ea sf o l l o w s : f i r s t l y , t h er e c e n td e v e l o p m e n t so fs p e e c hs y n t h e s i st e c h n o l o g i e sa n d s e v e r a lm a i nv o i c ec o n v e r s i o nm e t h o d sa r ep r e s e n t e d i na d d i t i o n , t oi m p l e m e n t v o i c ec o n v e r s i o n ,w eo f t e nn e e dt o d e c o m p o s es p e e c hs i g n a l i n t os o u r c e e x c i t a t i o na n dv o c a lf i l t e rt om a k em o d i f i c a t i o ns e p a r a t e l y t ou n d e r s t a n dt h i s p r o c e d u r eb e t t e r ) w e a l s om a k ea ni n t r o d u c t i o no ft h e p r i n c i p l e s a n d m a t h e m a t i c a lm o d e lo fp r o n u n c i a t i o n s e c o n d l y , t h ew h o l ef r a m e w o r ko ft h eh m m b a s e dv o i c ec o n v e r s i o n s y s t e mi si n t r o d u c e d b e c a u s et h eh m m b a s e dv o i c ec o n v e r s i o ns y s t e mi sb u i l t o nt h eb a s eo ft h eh m m b a s e ds p e e c hs y n t h e s i ss y s t e m ,s o m em o s ti m p o r t a n t a s p e c t so ft h eh m m b a s e dt r a i n a b l e t t sa r ee x a m i n e d t h e n w es t u d i e dt h e m a x i m u ml i k e l i h o o dl i n e a rr e g r e s s i o n ( m l l r ) m o d e la d a p t a t i o n a l g o r i t h m , i n c l u d i n gt h ee s t i m a t i o no ft h em e a na n dt h ec o v a d a n c er e g r e s s i o nm a t r i xa n d t h er e g r e s s i o nc l a s st i e dm e t h o d a tl a s t ,w eb u i l tab a s e l i n eh m m b a s e dv o i c e c o n v e r s i o ns y s t e ma n dr e a l i z ev o i c ec o n v e r s i o ne x p e r i m e n t sf r o mf c m a l et o f e m a l ea n df e m a l et om a l e t h er e s u l t so ft h e s u b j e c t i v e a n do b j e c t i v e e v a l u a t i o n sp r o v et h a t t h es p e e c ho ft h es o u r c es p e a k e rc a nb es u c c e s s f u l l y c o n v e n e dt os p e e c ho f t h et a r g e ts p e a k e r t h i r d l y ,w ei m p r o v es e v e r a la s p e c t s o ft h eb a s e l i n ev o i c ec o n v e r s i o n - 1 1 1 s y s t e m f i r s t ,t h es p e c t r u m ,p i t c ha n dd u r a t i o nm o d e la d a p t a t i o ni si n t e g r a t e di n t o t h es a m ea d a p t a t i o nf r a m e w o r ka n dc a l lb ea d j u s t e du s i n gt h es a m em o d e l a d a p t a t i o nm e t h o d a n dl i n es p e c t r a lp a i r ( l s p ) c o e f f i c i e n t sw i t hd i f f e r e n t i a l c o e f f i c i e n t so fa d j a c e n tl s p ( d a l ) a r ei n t r o d u c e df o rh m m m o d e l i n gt or e d u c e t h eo v e rs m o o t he f f e c to nt h es y n t h e t i cs p e e c h i na d d i t i o n ,t h es e l e c t i o no ft h e s o u r c em o d e la n dt h et r a i n i n go ft h ea v e r a g ev o i c em o d e la r ea l s os t u d i e d t h e n , t h em l l rm o d e la d a p t a t i o na l g o r k h mi s i m p r o v e db yi n t r o d u c i n gc o n t e x t c l u s t e r i n gd e c i s i o nt r e e ,a p p r o p r i a t er e g r e s s i o nm a t r i x f o r m a ta n dm i n i m u m g e n e r a t i o ne r r o r ( m g e ) c r i t e r i o n f i n a l l y , t h ep a r a m e t e rg e n e r a t i o na l g o r i t h m c o n s i d e r i n gg l o b a lv a r i a n c ei sp r e s e n t e d l a s t l y , a p p l i c a t i o n so ft h eh m m - b a s e dv o i c ec o n v e r s i o ns y s t e m a r e i n t r o d u c e d w ep r o p o s eah m m b a s e de m o t i o ns p e e c hs y n t h e s i ss y s t e mb a s e do n a v e r a g ee m o t i o nm o d e la n dm o d e la d a p t a t i o n m o r e o v e r , a ne m b e d d e dm u l t i - s p e a k e rt t ss y s t e mi sr e a l i z e du s i n gh m m - b a s e dv o i c ec o n v e r s i o nt e c h n i q u e k e y w o r d s v o i c ec o n v e r s i o n ,h m m ,t r a i n a b l et t s ,m o d e la d a p t a t i o n - 中国科学技术大学学位论文相关声明 本人声明所呈交的学位论文,是本人在导师指导下进行研究工作 所取得的成果。除已特别加以标注和致谢的地方外,论文中不包含任 何他人已经发表或撰写过的研究成果。与我一同工作的同志对本研究 所做的贡献均已在论文中作了明确的说明。 本人授权中国科学技术大学拥有学位论文的部分使用权,即:学 校有权按有关规定向国家有关部门或机构送交论文的复印件和电子 版,允许论文被查阅和借阅,可以将学位论文编入有关数据库进行检 索,可以采用影印、缩印或扫描等复制手段保存、汇编学位论文。 保密的学位论文在解密后也遵守此规定。 作者签名:每艺 7 0 7 年厂月1 f 日 第1 章绪论 1 1 语音合成技术及其发展 随着信息时代的到来,计算机已成为人类不可缺少的日常工具。在计算 机中,通常人机交互界面以键盘为主。为了使计算机的界面更加“友好”, 科学家开发出了若干种易学易懂、操作简单的界面,其中最方便最自然的界 面首推口述语言。基于语音识别、语音合成及自然语言理解的人机语音对话 技术是世界公认的一个难度很大,极富挑战性的高技术领域,它的前景十分 光明。领导世界软件潮流的美国微软公司的创始人比尔盖茨先生曾说过, “在不久的将来,9 5 的网络软件将是在语音驱动下完成的。”近几年来, 语音识别、合成技术发展很快,和它有关的语言学、语音学、语音理解,听 觉心理和语言感知也有较大进展。同时超大规模集成电路、电子计算机、数 字信号处理、人工智能等取得了突飞猛进的发展,以及最近两年的国际互联 网的迅速生长和全球信息基础设施建设热潮,这些都为人机语音对话的研究 提供了更好的理论和物质基础以及需求牵引。 作为人机交互的核心技术之一,语音合成近年在技术和应用方面都取得 了长足进展。随着电子计算机的运算和存储能力的迅猛发展,语音合成技术 由早期的基于规则的参数合成,到基于小样本的拼接调整合成,并逐渐发展 为现在比较流行的基于大语料库的拼接合成。与此同时,合成语音的自然度 和音质都得到了明显的改善,在一定程度上达到了人们的应用需求,从而促 进了其在实际系统中的应用。目前,语音合成技术已经在自动应答呼叫中心 ( 包括金融、电信和政府等) 、电话信息查询( 包括天气、交通和旅游等) 、 汽车导航以及电子邮件阅读等方面得到广泛的应用,同时针对娱乐和教育方 面的应用也正在开展。总而言之,语音合成技术正在影响着现代社会的方方 面面。 1 1 1 语音合成技术简介 语音合成概括地讲就是可以让计算机象人一样将要表达的信息以普通人 可以听懂的语音播放出来的技术是- - f - j 典型的交叉学科【l 】【3 】 4 】。它涉及 到声学、语音学、语言学、语义学、信息论、信号处理、计算机、模式识 别、人工智能、心理学以及人类的大脑神经活动等众多学科的理论和技术。 根据人类语言功能的不同层次,语音合成可以分成三类层次,它们是:( 1 ) 按规则从文字到语音的合成( t e x t t o s p e e c h ) 。( 2 ) 按规则从概念到语音的 合成( c o n c e p t t o s p e e c h ) 。( 3 ) 按规则从意向到语音的合成( i n t e n t i o n t o s p e e c h ) 。从现有的语音合成的水平来说,可以解决的还只是从文字到语音 的合成这个阶段,也就是文语转换( t t s ) ,后面所说的语音合成都是指文 语转换。 图卜1 文一语转换系统框图 图卜l 显示了一个完整的语音合成系统框图。这里我们将语音的合成过程 看成是一个层次化的分析过程,从文本信息到语音信息的文语转换过程可以 看成是信息在不同的层面上进行分析处理的过程。在文本的层面上,先要在 语言层、语法层和语义层上进行分析,得到文本的层次信息( 包括词组、短 语、句子等信息) 。然后在层次化信息的基础上在语音层上进行韵律分析, 得出语音层面上的韵律信息( 针对汉语来说就是超音段特征的生成,包括基 频、时长、能量的综合韵律曲线) 。最后根据生成的韵律特征,利用合成器 生成或者从语音库中挑选单元来完成语音数据的生成。 在语言层、语法层、语义层的工作可以归结为前端的文本分析,而语音 层面上的韵律生成和声学层面上的按韵律合成语音单元或在音库中挑选单元 可以说是后端的韵律合成。对于语音合成系统来说,前端的文本分析部分都 是相同的,只是由于要求的不同而有不同信息表达方式。而后端的韵律合成 方面也可以层次化的分为两个部分,一个就是按照前端给出的层次化文本信 息生成合适的韵律,而另一个就是按照生成的韵律来产生最后的合成语音, 在产生韵律和合成语音的方法上,各种方法不尽相同,甚至两个部分成为一 个不可分割的整体。 1 1 2 国内外语音合成技术的发展 综观语音合成技术的研究已有二百多年的历史 5 】 6 】 7 】,但是真正有实 用意义的近代语音合成技术是随着计算机技术和数字信号处理技术的发展而 发展起来的,主要是让计算机能够产生高清晰度、高自然度的连续语音。在 语音合成技术的发展中,早期的研究主要是采用参数合成方法。值得提及的 是h o l m e s 的并联共振峰合成器( 1 9 7 3 ) 和k l a t t 的串并联共振峰合成器 ( 1 9 8 0 ) ,只要精心调整参数这两个合成器都能合成出非常自然的语音。 而最具代表性的文语转换系统数美国d e c 公司的d e c t a l k ( 1 9 8 7 ) ,该系统 采用k l a t t 的串,并联共振峰合成器,可以通过标准的接口和计算机连网或单 独接到电话网上提供各种语音信息服务,它的发音清晰,并可产生七种不同 音色的声音,供用户选择。但是经过多年的研究与实践表明,由于准确提取 共振峰参数比较困难,虽然利用共振峰合成器可以得到许多逼真的合成语 音,但是整体合成语音的音质难以达到文语转换系统的实用要求。自八十年 代末期至今,语言合成技术又有了新的进展,特别是基音同步叠加 ( p s o l a ) 方法的提出( 1 9 9 0 ) 8 】,使基于时域波形拼接方法合成的语音 的音色和自然度大大提高。九十年代初,基于p s o l a 技术的法语、德语、 英语、日语等语种的文语转换系统都已经研制成功。这些系统的自然度比以 前基于l p c 方法或共振峰合成器的文语合成系统的自然度要高,并且基于 p s o l a 方法的合成器结构简单易于实时实现,有很大的商用前景。随着9 0 年代电子计算机的运算和存储能力的迅猛发展,该方法逐渐发展为基于大语 料库的单元挑选和拼接合成方法,它的基本思想是根据输入的文本分析信 息,从预先录制和标注好的语音库中挑选合适的单元,进行少量的调整( 或 者不进行调整) ,然后拼接得到最终的合成语音。由于最终的合成单元都是 直接从音库中复制过来的,其最大的优势就是在于保持了原始发音人的音 质。而到2 0 世纪末,伴随着语音合成技术的应用,用户对语音合成效果也 提出了更高的要求,尤其是多样化语音合成方面的需求。对此,可训练的语 音合成方法( t r a i n a b l et t s ) 被提出【9 】 1 0 】【l l 】,该方法的基本思想是基于 统计建模和机器学习的方法,根据一定的语音数据进行训练并快速构建合成 系统。由于这种方法可以在不需要人工干预的情况下,自动快速的构建合成 系统,而且对于不同发音人、不同发音风格、甚至不同语种的依赖性非常 小,非常符合多样化语音合成方面的需求,因此逐渐得到研究人员的认可和 中国科学技术大学工学硕士学位论文 重视,并在实际应用中发挥作用。 国内的汉语语音合成研究起步较晚些,但从八十年代初就基本上与国际 上研究同步发展。大致也经历了共振峰合成、l p c 合成、p s o l a 技术到大 语料库的单元挑选和拼接方法的过程。在国家8 6 3 计划,国家自然科学基 金委,国家攻关计划,中国科学院有关项目等支持下,汉语文语转换系统研 究近年来取得了令人举目的进展,其中不乏成功的例子:如中国科学院声学 所的k x p s o l a ( 1 9 9 3 ) ,联想佳音( 1 9 9 5 ) ;清华大学的 t hs p e e c h ( 1 9 9 3 ) :中国科学技术大学的k d t a l k ( 1 9 9 5 ) 等系统。这些 系统基本上都是采用基于p s o l a 方法的时域波形拼接技术,其合成汉语普 通话的可懂度、清晰度达到了很高的水平。然而同国外其它语种的文语转换 系统一样,这些系统合成的句子及篇章语音机器味较浓,其自然度还不能达 到用户可广泛接受的程度,从而制约了这项技术的大规模进入市场。 一一 1 9 9 8 年中国科学技术大学在国家8 6 3 计划和国家自然科学基金委支持下, 研制成功k d 8 6 3 汉语文语转换系统。和采用国内外流行的p s o l a 技术的系 统相比,在输出语音的音质和自然度上有了突破性的提高。k d 8 6 3 采用了 基于大规模语音数据库的语音合成方法,避免了采用信号处理技术获取音变 单元对音质的损害,因而合成语音具有接近自然语音的音质。k d 8 6 3 文语 转换系统一经推出,就因其合成语音的高清晰度与高自然度引起了社会各方 的重视。先后应用于为深圳华为技术公司设计的“1 1 4 自动电话报号系 统”,和为国家工商总局设计的“工商企业语音( 传真) 查询系统”。使得 汉语语音合成技术走出实验室,向市场应用迈出了重要的一步。k d - 8 6 3 系 统参加了在1 9 9 8 年4 月国家科委组织的全国汉语语音合成系统的性能评 测,其输出语音的自然度居同类系统之首,是唯一达到用户可以接受程度的 系统。k d 8 6 3 还在日本,新加坡,香港的有关研究所和大学进行过演示 均得到了有关方面专家的认同。之后中国科学大学又推出了k d - 2 0 0 0 汉语 文语转换系统,不仅在语音合成技术方面有进一步的发展特别是在文本预 处理中围绕层次化结构思想,运用大量的统计和规则的方法,较好地解决了 三个大的处理环节:特殊符号处理,分词处理和拼接处理。使得汉语文语转 换系统的整体性能有很大提高。k d 2 0 0 0 文语转换系统还荣获了2 0 0 2 年 “国家科技进步二等奖”,这一迄今中文语音研究领域颁发的最高奖。近年 来,中国科学技术大学的讯飞语音实验室更是在可训练的语音合成 ( t r a i n a b l et t s ) 方面从事了大量的研究开发工作,其语音合成系统在刚 刚结束的2 0 0 6 年国际英文语音合成评测大赛( b 1 i z z a r dc h a l l e n g e 2 0 0 6 ) 中,取得了综合成绩第一名的辉煌成绩 1 2 。 1 2 说话人转换技术 由于目前大语料库合成系统的合成音质和自然度都不错,大家对语音合 成系统提出了更多的需求多样化的语音合成,包括多个发音人、多种发 音风格、多种情感以及多语种等。而现有的语音合成系统大多是单一化的, 一个合成系统一般只包括- - n 两个说话入。采用朗读或者新闻播报风格,而 且针对某个特定的语种。这种单一化的合成语音大大限制了语音合成系统的 在实际中的应用,包括教育、娱乐和玩具等。为此,多样化语音合成方面的 研究逐渐成为近期语音合成研究领域的主流。 实现一个多说话人、多种发音风格、多种情感的语音合成系统,最直接 的方法就是录制多个人、多种风格的音库,并分别构建各个发音人、各个风 格的合成系统。由于针对每个发音人、每种风格、每种情感制作一个特定的 语音库的工作量过大,因此这种方法在实际中并不可行。 在这一背景下,通过调整一个说话人的语音,使其听起来像是另一个人 说出来的一样的说话人转换技术被提出。说话人转换技术根据少量的目标说 话人的语音数据,对源说话人的语音参数( 基频、时长和谱参数) 进行调 整,从而得到目标说话人的合成语音,以此实现多说话人的语音合成系统。 1 2 1 说话人转换的基本概念 语音信号传送非常广的信息。在这些信息之中,语音信号表达的含义是 最重要的,然而,第二信息特征也就是说话入的鉴别也非常重要。在日常生 活中,说话人特性对我们来说很重要,比如昕广播节目的时候,如果所有人 说话的特性都一样,那么我们根本就不可能知道哪些意思是哪个人表达的。 说话人转换技术就是试图把一个人( 源说话人) 说的话进行转换,使它 听起来好像另一个人( 目标说话人) 说出来的一样。与此同时,源说话人表 达的意思不变。因此,对于说话人转换来说,最重要的就是要改变源说话人 的特性使其与目标说话人接近。( 图卜2 ) s o u r c e t a r g e t 目标说话人语音数据 图卜2 说话人转换的基本原理 说话人转换技术能够在很多方面取得应用。例如语音信箱,可以让你的 语音邮件按照你所希望的方式发声;定制的t t s ,可以让t t s 系统按照你 定制的方式发音而不必重新录制音库;通话翻译,可以完成不同语种人之间 的对话;电影配音;对于发音有缺陷的人,我们也可以通过说话人转换方法 使他和别人的交流更加方便:另外说话人转换技术还可以用在很多娱乐方 面。由于相对而言,与语音合成相结合的说话人转换系统应用最为广泛,因 此我们将其作为我们的目标系统。 为了更好的理解说话人转换,首先我们需要简要的介绍一下人发音的机 理,接下去再介绍说话人转换的几种主要方法。 1 2 2 语音产生机理及说话人特征体现 1 2 2 1 语音产生的机理 语音产生是一个复杂的生理过程:语言中枢下达命令,这些命令表现为 神经脉冲信号,指挥发音器官的肌肉产生运动,因此就产生了气流气压的变 化,引发声门的动作,并在声腔共鸣系统的调节下,最终产生可懂的语音 因此,语音产生是一个复杂的能量转换过程,先后有化学一电、电一机械、 机械一空气动力、空气动力一声能等的转换。 语音产生的生理方面主要涉及三个系统:声门下系统、喉系统以及声门 上系统。 声门下系统,俗称呼吸器官。它由气管、支气管、肺、及呼气肌群、吸 气肌群和膈肌组成。它提供发音的动力,因此是发音的动力器官。 喉系统由喉头、声门和声带组成。喉头由甲状软骨、环状软骨和两块杓 状软骨组成,上接咽头,下连气管。声带是两片富有弹性的薄膜,前端附在 甲状软骨上,后端联在杓状软骨上。两片声带之间的空隙就是声门。杓状软 骨活动时,会使声带拉紧或放松。从而引起声门的闭开,形成发音的声源。 声门上系统又称共鸣腔,或称声道。它由口腔、鼻腔和咽腔组成。喉系 统过来的嗓音或噪音气流,通过这些腔体的调节,可以产生出不同的音素。 发音系统可以产生三类基本的声音:浊音、摩擦音和爆破音。 浊音( 如元音) 是由于声带颤动而产生的语音。发音时,通过提高肺部 气压,强迫空气通过声门,引起声带振动,产生了一种准周期性的脉冲气 流。这种气流激励声道,就形成了浊音。 摩擦音( 如辅音s 、s h ,f 等) 是声道的某些部位部分关闭,空气以足 够的速度通过紧缩处时引起湍流而产生的。 爆破音( 如塞音p 、t 、k ) 是声道完全闭塞,空气压力在闭塞部位后面 增加,然后突然打开闭塞部位而产生的。当空气释放的时候,这种尖锐的声 音常常伴随着摩擦或送气。 1 2 2 2 语音产生的数学模型 根据上述发音器官的声学理论,语音信号产生的过程可以用图l - 3 所 示的模型实现工程模拟。 图1 3 语音产生的数学模型 下面讨论该模型的各个组成部分。 1 声源模型 长期研究证明,发不同的声音时,激励的情况也不同,大致可分为如下 两类: a ) 发浊音的情况 这里的浊音包括所有的元音和浊辅音。此时气流在通过绷紧的声带 时,冲击声带产生振动,使声门处形成准周期性的脉冲气流串( 声门 波) ,再用它去激励声道。声带绷紧的程度不同,振动频率也就不同。 这个频率就是音调频率,它的倒数就是音调周期。 图卜4 浊音激励源模型 生理学及声学的研究结果表明,自然语音的声门波有点类似于三角 波。开始时声门闭合,幅度为零,接着缓慢上升,然后快速下降,当下 降到零时有一个导数不连续点。其频谱特性在高频部分以1 2 d b o c t 变 化。语音合成的实验表明,对声门波形状的选择并不是很苛刻的,仅要 求它们的频谱具有正确的特性。常用的声门波有r o s e n b e r g 声f 波和三危 波等。一个完整的浊音激励源模型如图i - 4 所示。 b ) 发清音的情况 这里的清音只包括清辅音。与浊音的激励源相比,清音的激励源要 相对简单一些。此时,声带松弛而不振动,气流通过声门直接进入声 道。来自肺部的湍流为具有平坦频谱的压力波,而它与压力的关系是相 当复杂的,通常的做法是用低通滤波关系简化它。图卜5 是一个较完 整的清音激励源模型。 图i - 5 清音激励源模型 清塞音( 即爆破的清音) 是一类特殊的清音。发爆破音时,声带在 一段时间内是关闭的,随后就建立起气压,而声带并不振动。当这一障 碍去除时,空气即以高速冲出,从而产生湍流。准确模拟这类爆破音是 比较困难的,一种简单的方法是使上图中的幅度控制发生突变来模拟爆 破音源。 2 声道模型 发浊音时,激励源的位置固定不变,均在声门处。对于非鼻化的元音, 鼻腔完全关闭,声道对某些频率发生谐振,谐振点对应于声道传递函数中的 极点,所以对于这类浊音用全极点模型就可以很好地模拟声道。对于鼻辅音 和鼻化的元音,由于鼻腔的耦合作用,除了谐振外,还存在反谐振,所以声 道的传递函数除了极点外,还要引入零点,需用零极点模型来模拟。 发清音时,由于阻碍点位置不同,激励源的位置也不同,声道的长短差 异特别大,声道的传递函数也就存在较大差异。如送气清音,激励源仍位于 喉部,故声道的传递函数具有与非鼻化元音相同的形式。而发清擦音时,由 于声道的收缩作用,把声道划分为前后两个腔,前腔起谐振作用,而后腔起 反谐振作用,故声道传递函数中要外加零点。 9 另外,在发音过程中由于声道形状发生改变,声道的传输特性也随之改 变,所以声道的传递函数是时变的,我们可以用时变的线性滤波器模拟声 道,如图1 - 6 所示。 图1 - 6 声道模型 关于声道部分的数学模型,目前有三种实现方法: a 1 声管模型 这种模型把声道视为多个不同截面积的管子串联而成的系统,根据 语音信号的短时平稳特性,在某一“短时”期间,声道可表示为形状稳 定的管道,而且在声频范围内,可以认为沿管轴传播的是平面波。 b 1 共振峰模型 这种模型是把声道视为一个谐振腔,共振峰就是这个腔体的谐振频 率。由于人耳听觉系统中的柯替氏器的纤毛细胞就是按感知频率来排列 的,所以这种共振峰的声道模型方法是非常有效的。它可以较好地解决 音素之间的协同发音问题,使合成的声音连续自然。实践表明,用前三 个共振峰来代表一个元音就足够了,对于较复杂的辅音,大概要用到五 个以上的共振峰。 c ) 滤波器模型 这足一种纯粹效果上的模型。将声门波通过声道产生语音的过程简 单看作是由激励源通过一个滤波器的过程,声道的作用就相当于滤波 器。至于这一滤波器如何模拟声道的物理特征,则不去考虑。如线性预 测编码( l i n e a rp r e d i c t i v ec o d i n g ,l p c ) 模型,就是用线性预测误差滤 波器来模拟声道;对数振幅近似( l o gm a g n i t u d ea p p r o x i m a t i o n , l m a ) 模型,就是用有理函数形式的l m a 滤波器来模拟声道。 3 辐射模型 经过声道传输后,语音就由嘴唇开口处或鼻孔处辐射到四周。嘴的张开 形状会影响语音频谱的形状,但是其作用较之声道而言是次要的。在声学语 音学中,将人头近似成一个圆球,辐射开口就看成是一个镶嵌在球面上的一 个振动活塞。其幅频响应r ( z ) 相当于一个6 d b o c t 的高通滤波器。 有了语音产生的数学模型,就可以在计算机上进行工程模拟,生成各种 语音合成系统。语音合成系统实现的一个重要方式源滤波器方式,就 是利用这种数学模型来实现的。 1 2 3 说话人转换的主要方法 对说话人转换的研究就是最近3 0 多年,1 9 7 1 年,a t a l 和h a n a u e r 研究 了用l p c 声码器改变语音特性的可行性。1 9 8 8 年,a b e ,m 等人发展了用 v q 的方法做说话人转换的技术。以后说话人转换技术就有了比较大的发 展,很多人都开始在这方面展开研究,各种各样的方法都用在说话人转换技 术上。 1 2 3 1 说话人转换的基本模型 完成说话人转换需要两个基本阶段:一个是训练阶段,一个是转换阶 段。训练阶段主要是为了得到进行说话人转换所需要的转换函数:转换阶段 则完成由源说话人语音向目标说话人语音的转换过程。其基本框图如图 1 - 7 所示。 由语音产生的机理,我们知道声音特性主要分为音段和超音段特性,可 以用很多参数来表征。音段特征主要对应于频谱、共振峰信息,超音段特征 则对应于基频、时长、能量。绝大部分说话人转换方法最关心的还是音段特 征的转换,丽对于基频、时长等超音段特征的转换的研究相对薄弱。 对于音段特征的转换,在训练阶段我们可以用l p c 、c e p s t r u m ,l s p 和 f o r m a n t 等参数表征音段特征以得到转换函数,然后采用相应的特征参数完 成转换工作。至于超音段特征的转换,一般都是通过较为简单的基频的调域 变换完成。这种方法对于英语等无调语言基本上能够满足要求,然而对于汉 语这样的有调语言,则无法实现有效的转换。 训练过程 转换函数 转换过程 训练得到的转换函数 图卜7 说话人转换的基本框图 目标合成 语音 1 2 3 2 经典的说话人转换方法 根据训练阶段求取转换函数的方法不同,大体上可以将说话人转换分为 如下几类方法: 1 码本映射方法( c o d e b o o km a p p i n g ) 最经典的码本映射方法是由a b e 在1 9 8 8 年提出的【1 3 】,后面非常多的研 第1 章绪论 究都是建立在他的工作基础上。码本映射方法同样也分为训练和转换两个阶 段。而码本映射的训练阶段实际上就是为了得到源和目标说话人的映射码 本转换过程则是使用映射码本恢复出语音。图1 - 8 和图卜9 显示了映 射码本的生成和转换过程。不过这种方法得到转换语音效果并不理想,特别 是音质非常糟糕,语音中存在明显的噪音和颤音,无法满足实际的应用需 要。 , q u a n t i z a t i o n 厂磊订 图卜8 映射码本的生成过程 图1 - 9 码本映射的转换过程 其后,有许多研究者对码本映射方法进行改进,提出了许多新的思路与 方法,其中a l s a n 提出的s t a s c ( s p e a k e rt r a n s f o r m a t i o na l g o r i t h mu s i n g s e g m e n t a lc o d e b o o k s ) 方法最具有影响力和创新性 1 4 。s t a s c 的训练过 程仍然是基于训练数据的源和目标一一对应的频谱数据。然而它没有采用传 统的d t w ( d y n a m i ct i m ew a r p i n g ) 方法直接进行对应,而是利用语音识别 的技术对语音进行音素的切分。虽然s t a s c 方法本身以及变型 1 5 】的转换效 果较传统的码本映射方法已有了很大的改善,但是由于合成语音的共振峰受 到码本加权叠加的平滑影响很严重,导致转换后的频谱与目标并不是很接 中国科学技术丈掌工学硕士学位论文 近。 2 神经网络方法( a r t i f i c i a ln e u r a ln e t w o r k ) m n a r e n d r a n a t h 等人于1 9 9 4 年提出了使用人工神经网络计算源和目标 说话人之间的共振峰的转换函数的说话人转换方法 1 6 ,该方法选择共振 峰参数来表征说话人的特征,其基本原理如图卜1 0 所示。虽然,不同说 话人的共振峰参数可以很好的表征不同人的特征,从而保证了转换后的语音 中目标说话人的特征较为明显。然而,由于选用了共振峰参数,也就不可避 免的要使用共振峰合成器来合成最终的转换语音,但是,一般共振峰合成器 的合成语音的音质都比较差,并且,想要精细的提取语音的共振峰参数也是 非常困难的,因此这一方法的实用价值也不大。 图卜l o 人工神经网络说话人转换方法的基本框图 t r a n s f o r m e d s p e e c h 3 基于混合高斯模型( g m m ) 的方法 该方法首先提取源说话人和目标说话人的特征参数,然后通过g m m ( g a u s s i a nm i x t u r em o d e l ) 模型计算得到转换函数。在转换阶段再利用转 换函数将源说话人的特征参数转换为目标说话人语音的特征参数 1 7 。 第l 章绪论 l 引蝴卜旺兰卜正芈 量 引黼卜圈申 i 一 蚕 图1 - 1 lg m m 说话人转换的训练过程 图i - 1 l 为g m m 方法具体的训练过程,从图中我们可以看到,g m m 方法的 训练过程,首先是对源和目标说话人的对应数据进行特征参数的提取,从而 得到它们的谱参数。然后用d t w 算法将两个说话人的频谱对齐,并用e m ( e x p e c t a t i o nm a x i m i z a t i o n ) 算法估计g m m 模型参数,最后通过一定的优 化准则来得到转换函数。 g m m 说话人转换方法的转换过程则如图卜1 2 所示,输入的语音信号首 先经过频谱分析分解为频谱参数和韵律参数,接下来频谱参数由训练阶段得 到的转换函数转化为目标的频谱参数,而韵律参数则单独进行转换。最后由 转换后的频谱和韵律参数合成出转换后的语音。 图卜1 2g i m 说话人转换的转换过程 虽然使用g m m 说话人转换方法得到的合成语音的音质较传统的码本映 射的方法有了很大的提高,但其同样存在着合成语音的频谱过于平滑的问 题,从而导致转换后的频谱与且标并不是很接近。总体上经典的基于 g m m 的说话人转换方法与s t a s c 方法的效果是相当的。不过,由于g m m 中国科辛技术大学工孕硕士掌位论文 说话人转换方法中转换函数的求解过程非常复杂,常常需要非常大维数的矩 阵运算,而s t a s c 方法只需要实时自对语音进行状态切分,仅需生成码本 即可,因此,相对于基于g m m 的说话人转换方法,s 1 i a s c 方法更适合于 应用在一些资源受限的场合。 4

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论