(物理电子学专业论文)多带激励语音编码器及其在宽带语音上应用的研究.pdf_第1页
(物理电子学专业论文)多带激励语音编码器及其在宽带语音上应用的研究.pdf_第2页
(物理电子学专业论文)多带激励语音编码器及其在宽带语音上应用的研究.pdf_第3页
(物理电子学专业论文)多带激励语音编码器及其在宽带语音上应用的研究.pdf_第4页
(物理电子学专业论文)多带激励语音编码器及其在宽带语音上应用的研究.pdf_第5页
已阅读5页,还剩50页未读 继续免费阅读

(物理电子学专业论文)多带激励语音编码器及其在宽带语音上应用的研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 对多带激励( m b e ) 语音编码算法进行了研究、仿真和改进。本文首先介绍多带激励 ( m b e ) 模型原理、分析和合成,该算法采f _ 一种新的激励频谱,突破了二二元激励的局限 性,较好的解决了简单二元激励模型导致的合成语音自然度不够以及抗噪声能力差的问题, 是目前低速率语音编码较理想的方案。然后详细阐述了m b e 编码器的仿真实现方法。给 出了程序流程丰仿真结果,并给出了参数的编解码方法。根据仿真结果,对该算法的性能进 行了分析。该算法合成的语音在频谱和波形上都和原始语音比较接近,并具有良好的清晰度 和可懂度,任何熟悉的人都可以辨别说话人,但时延较大。最后将此算法应用到宽带语音上, 为减少在宽带上的算法计算量和降低时延,对算法提出了一些改进措施并指出了今后的研 究方向。 关键词:语音编码;多带激励:激励频谱;宽带语音 a b s t r a c t i n t h i sp a p e r , t h ea u t h o rr e s e a r c h ,s i m u l a t ea n di m p r o v et h em u l f i b a n de x c i t a t i o ns p e e c h c o d i n ga l g o r i t h m f i r s t ,t h ep r i n c i p l eo fm u l t i b a n de x c i t a t i o nm o d e la n di t sa n a l y t i c a l a n d s y n t h e t i c a lm e t h o da r ep r e s e n t e d m b ea p p l i e san e we x c i t a t i o ns p e c t r u m t h u si tp r o v i d e sh i g h q u a l i t ys p e e c hr e p r o d u c t i o nf o rb o t hd e a na n dn o i s ys p e e c h i ti sar e l a t i v e l yi d e a ls p e e c hc o d i n g a l g o r i t h ma tl o wr a t e s e c o n d ,t h i sp a p e ri l l u s t r a t e st h es i m u l a t i o no fm b ee n c o d e ra n dp r o v i d e s t h ef l o wc h a to ft h ep r o g r a ma n dt h er e s u l to ft h es i m u l a t i o n t h ec o d i n ga n dd e c o d i n gm e t h o di s a l s og i v e n b a s e do nt h es i m u l a t i o no ft h ea l g o r i t h m ,t h ea p p l i c a t i o no ft h ea l g o r i t h mi sa n a l y z e d t h er e s u l ts h o w st h es y n t h e t i c a ls p e e c ha n dt h eo r i g i n a ls p e e c ha r es i m i l a ro nt h et i m er e g i o na n d t h ef r e q u e n c yr e g i o n ,a n dt h es y n t h e t i c a ls p e e c hi so fh i g hd e f i n i t i o na n du n d e r s t a n d a b l e ,s ot h e s p e a k e rc a nb ee a s yt ob ed i s t i n g u i s h e d b u ti tn e e d sr e l a t i v e l yl o n gt i m ed e l a y a tl a s t ,t h ea u t h o r a p p l yt h ea l g o r i t h mo nw i d e - b a n ds p e e c h i no r d e rt or e d u c i n gt h ea m o u n to fc o m p u t a t i o na n dt h e t i m ed e l a yo ft h i sa l g o r i t h m ,s o m ei m p r o v e dm e a s u r e sa r ep r o p o s e d i l 】t h ee n do ft h ep a p e r , t h e a u t h o rp o i n t so u tt h ed i r e c t i o no ft h er e s e a r c hw o r ki nt h ef u t u r e k e yw o r d :s p e e c hc o d i n g :m u l t i b a n de x c i t a t i o n ;e x c i t a t i o ns p e c t r u m :w i n d - b a n ds p e e c h 学位论文独创性声明 本人郑重声明: 1 、坚持以“求实、创新”的科学精神从事研究工作。 2 、本论文是我个人在导师指导下进行的研究工作和取得的研究 成果。 3 、本论文中除引文外,所有实验、数据和有关材料均是真实的。 4 、本论文中除引文和致谢的内容外,不包含其他人或其它机构 已经发表或撰写过的研究成果 5 、其他同志对本研究所做的贡献均已在论文中作了声明并表示 了谢意。 作者签名: 日期: 学位论文使用授权声明 本人完全了解南京师范大学有关保留、使用学位论文的规定,学 校有权保留学位论文并向国家主管部门或其指定机构送交论文的电 子版和纸质版;有权将学位论文用于非赢利目的的少量复制并允许论 文进入学校图书馆被查阅:有权将学位论文的内容编入有关数据库进 行检索;有权将学位论文的标题和摘要汇编出版。保密的学位论文在 解密后适用本规定。 作者签名: 日期: 1 1 语音编码概述 第一章前言 2 1 世纪的通信席该在人与人之间、人与机器之间提供高质量的无缝的信息交换手段。 无缝通信是指用户可以方便的综合使用各种多媒体信息交换手段,而不影响通信质量;高质 量是指通信质量不随用户环境以及传输媒介的变化而降低,用户使用起来方便快捷。这取 决于信息高速公路的建设和计算机、微电子、材料、网络、通信等诸多关键科学领域的发展, 而语音压缩编码将是晟基本、最重要的技术这一领域的研究已经有几十年的历史近1 0 余年来,有大量的技术应用于远程通信和存储一些国家和国际标准化组织相继制订了语音 压缩编码的标准,直接推动了语音压缩编码的发展。不仅压缩编码技术有了大幅度的发展, 而且语音带宽也从3 2 k h z 的窄带语音信号发展到7 k h z 的宽带语音信号压缩和2 0 k h z 音乐 宽带音频信号压缩。 1 2 语音编码的发展和分类 1 2 1 发展简史 自从1 9 3 9 年美国的h o m e rd u d l e y 发明声码器以来语音处理开始了参数编码或 模型编码的研究,它是以滤波器为主构造的通道声码器2 0 世纪6 0 年代以前, s a t o ,l t a k u r a ( 1 9 6 6 ) 和a t a l ,s c h r o e d e r ( 1 9 6 7 ) ”1 研究出使用的共振峰声码器, 最早把“线性预测( l p c ) ”技术应用到语音分析和合成。1 9 6 6 年,j l f l a n a g a n 提出了以瞬时频率为基础的相位声码器”1 。1 9 6 9 年,a v o p p e n h e i m 提出了以倒 谱为基础的同态声码器“1 。在众多声码器中,l p c 声码器终因其成熟的算法和参 数的精确估计成为主流并逐步走向实用。1 9 8 2 年,美国国家安全局公布了2 4 k b s 的i j p c 一1 0 声码器标准:1 9 8 4 年,美国国防部制定了s t u - 1 i i 计划,采用2 4 k b s 的l p c - 1 0 e 增强型,1 9 8 6 年正式投入使用,这可以说是5 0 年的研究总结 从1 9 8 5 年提出了c e l p 算法以来,很快在l o 年中产生了3 个国际标准、2 个地区 性标准和2 个国家标准。可见语音压缩编码的研究发展之快。这些算法的共同特 点是采用闭环l p a b s 算法、知觉加权技术、复合窗技术、l s p ( l s f ) 技术、后 置滤波技术、增益自适应技术、分数基音内插技术等。另外,多带激励( m b e ) i s ,自适应变换编码( a t c ) ”1 和子带编码等语音编码的方案也相继出现,它们都 属于正弦编码。在这1 0 年中,c e l p 算法是语音压缩编码的主流。 近年来随着第三代移动通信的发展,变速率语音压缩编码技术得到相应的发展。 可变速率的c e l p ( 通常称为q c e l p ) ”1 己成为北美数字蜂窝通信标准。随着因 特网的发展,语音1 p “1 对语音压缩编码的需求十分迫切。 高保真音频信号压缩编码,即带宽1 5 2 0 k h z 的家用、专业高保真音响,包括动 画和i - i d t v 音频以及多媒体系统。有时音频编码这一术语也指宽带语音编码,即 带宽7 k h z 的语音信号、电视以及i s d n 上的语音通信在通信系统中为了节省带 宽,以及在语音存储系统中节省存储空间。音频信号的压缩编码技术也有大幅度 的发展。” 1 2 2 语音编码的分类“” 语音编码可分为波形编码与声码化编码。或称为非参数编码与参数编码,参数编码有时 也称模型编码。结合波形编码和参数编码两者的优点又提出了混合编码 1 2 2 1 波形编码:语音信号的波形编码力图使重建语音的波形保持原语音信号的波形形 状。这类编码器通常将语音信号作为一般的波形信号来处理,它具有适应能力强,话音质量 好等优点,但所需要的编码速率高。在p c m ( g 7 1 1 码率6 4 k b i t s ) 的基础上,利用语音样 值和基音周期之间的相关性,并根据人耳的听觉特性频率掩蔽效应和等响度曲线,波形 编码引入了差分编码、自适应预测、子带编码和矢量量化等多种技术,提出了多种成熟的编 码算法,如脉冲编码调制( p c m ) 、自适应差分脉冲编码调制( a d p c m ) 、子带编码( s b c ) 、 变换域编码( t c ) 。他们分别在6 4 1 6 k b s 的速率上能获得很高的编码质量,当速率进一步 降低时,其性能下降较快。 1 2 2 2 参数编码:参数编码通过对语音信号特征参数的提取及编码,力图使重建信号具 有尽可能高的可懂性,即保持原语音的语意,而重建信号的波形同原语音信号的波形可能会 有相当大的差别。一方面,由于描述语音生成模型的参数只有十几个,并且考虑到语音的短 时平稳性( 在约2 0 m s 的平稳期内,模型参数变化很小) ,所以参数编码系统的传码率可以 压缩得报低,比如美国联邦标准f s l 0 1 5 就是用1 0 阶l p c 线性预测a r 模型逼近声道响应 2 构成的声码器,编码系统的传码率仪为2 4 k b s 。另一方面,参数编码试图用数学模型产生 的合成语音代替原始语音,对模型做了种种假设,所以其语音质量还不够好,特别是自然度 较低:另外这类编码器对讲话噪声较敏感,需要安静的讲话环境才能给出较高的可懂度, 且时延大。通道声码器、共振峰声码器以及目前广泛使用的线性预测声码器都是典型的参数 编码器。要进一步提高产生的语音的质量,有效的方法是采用混合编码法 1 2 2 3 混合编码:混合编码是将波形编码与参数编码技术相结合产生的一种编码方式, 使语音编码技术有了突破性的进展。混合编码结合了以上两种编码方式的优点,采用了线性 技术构成声道模型,不只传输预测参数和清浊音信息,而是将预测误差信息和预测参数同时 传输,在接收端构成新的激励源去激励预测参数构成的合成滤波器使得合成滤波器输出的 信号波形与原始语声信号的波形最大程度地拟合从而获得自然度较高的语声这类编码主 要有:多脉冲线性预测编码( m p u c ) 、规则脉冲激励线性预测编码( r p e l p c ) 、码激励线 性预测编码( c 删l p ) 等。 混合编码克服了原有波形编码器与声码器的弱点,而结合了它们的优点,在4 1 6 k b s 速率上能够得到高质量的合成语音在本质上也具有波形编码的优点,有一定抗噪和抗误码 的能力,复杂程度介乎于波形编码和参数编码之间。 1 2 3 几种典型的语音编码方法 1 2 3 1 脉冲编码调制( p c m ) “ 脉冲编码调制是最简单的波形编码方法,它把语音信号样本幅值量化到n 2 。个码 字中的一个,这样每个样本需要曰比特来表示。假定信号采样频率是w h z ,那么总的比特 率( 每秒钟的比特数) 将是w b b s 均匀量化p c m 和普通的a d 变换是完全相同的它没 有利用语音信号的任何性质,也没有进行压缩 1 2 3 2 自适应差分脉冲编码调制( a d p c m ) 语音信号是一个非平稳的随机过程,但在短时间间隔内可以近似看成是平稳的,其特 征参数近似不变。a d p c m 采用线性预测方法,利用语音信号样点间的相关性,井针对语音 信号的非平稳特点使用了自适应预测和自适应量化,随着语音特性的变化而不断更新预测 系数,因此能获得更高的预测增益。在3 2 k b s 速率上能给出网络等级语音质量,符台进入 公用网的要求1 9 8 4 年,c c i t t 公布了g 7 2 13 2 k b s a d p c m 编码标准。g 7 2 1 a d p c m 采 s t 抗扰乘子自适应算法“、等效零点函数符号梯度算法“3 1 等等 3 1 2 3 3 子带编码( s b c ) 5 1 在子带编码中,首先用一组带通滤波器将输入信号分成若干个子带信号,然届将这些带 通信号经过频率搬移变成基带信号,再对它们分别采用。采样后的信号经过量化编码,再将 各子带的信码合路变成一个总信码传输给收端。接受端把总信码分成各子带信码,分别进行 解码,再经插值,频率搬移到原来的位置,经过带通滤波后,相加得到重建信号。 子带编码有两个优点。首先,可以对不同的子带合理分配不同的比特数。由于语音的基 音和共振峰主要集中在低频段,它们要求保存较高的精度,所以对低频段的子带可以用较多 的比特数表示,而对高频段的子带可以用较少的比特数表示。其次,各子带内的量化噪声相 互独立这样就能避免输入电平较低的子带信号被其他子带的量化噪声所淹没。子带编码的 缺点是编解码延时比较长,这主要是滤波器组造成的 子带编码已广泛的被应用c c i t tg 7 2 27 1 d - l z 带宽的6 4 k b s 声频编码以及国际标准化 组织( i s o ) 关于激光唱盘等级的2 0 k h z 带宽1 2 8 k b s 声频编码等标准,都采用了子带编码 方法。 1 2 3 4 变换域编码( t c ) ”7 ” 输入信号按个连续样点组成块,经过线性变换后得到个变换系数再经量化编码 后送入信道进行传输接收端对量化后的系数进行逆变换,得到重建信号。一般变换系数量 化所用的平均比特数低于输入信号每样点的比特数,因此编码后的总速率低于输入信号的总 速率。由于语音信号是非平稳的输入信号为了能适应其变化,需要采用自适应比特分配以 及自适应量化这样的变换域编码称为自适应变换域编码( 朋r c ) 1 2 3 5 线性预测声码器( l p c ) ”1 在l p c 中。语音信号逐帧的用其生成模型的特征参数来表示。语音在输入端分帧后, 提取特征参数,将这些参数量化后编码传输接收端根据这些特征参数重新台成语音信号。 l p c 主要应用于窄带信道的语音通信,例如在普通的拨号电话线路上,采用简单的调 制解调器。可传输速率为2 4 k b s 到4 8 k b s 的数据;采用复杂的调制解调器,可传输4 8 k b s 到9 6 k b 的数据。7 0 年代后期。美国确定用线性预测编码器标准l p c 1 0 作为在2 4 k b s 速 率上的推荐编码方式。1 9 8 1 年这个算法被官方接受作为联邦准1 0 1 5 号文件。自1 9 8 6 年 以来,美国第三代保密电话装置( s t u n 1 ) 采用了速率为2 4 k b s 的u ,c 1 0 e ( l p c 1 0 的增 强型) 作为语音处理手段。 1 2 3 6 多脉冲激励线性预测声码器( m p e l p c ) ” 1 9 8 2 年,b i s h n us a t a l 和j o e lr r e m d e 在国际声学、信号、信息处理年会上,首先提 4 出了m p e - , p c 的原理、算法,并且给出了试验结果在这种算法中,对每帧原始语音首先 用l p 分析法计算出l p 系数,然后在当前帧范围内每5 m s 或1 0 m s 用合成分析法估计一次 激励脉冲。将激励脉冲输入合成器,得n 合成语音。合成语音和原始语音的差,也就是误差 信号,输入到个感觉加权滤波器,得到输出加权误差信号。根据最小加权均方误差准则, 分析出一组位置、幅度最佳的激励脉冲,然后与l p 参数一起编码送入信道。多脉冲激励线 性预测声码器的关键问题是,如果一帧中只允许用m 个激励脉冲,如何求出这m 个脉冲在 帧内的位置和幅度,使得合成语音和原始语音的感觉加权均方误差最小。 1 2 3 7 规则脉冲激励线性预测声码器( r p e - l p c ) ”:“”6 1 r p e - l p c 是由e d e d e p r e t t e r e 和p e t e rk r o o r l 在1 9 8 5 年i e e ei c a s s p 年会上首先提出 的。1 9 8 6 年k h e l l w i n gr h o j m a n n 和p w a r yr j s l u y t e r 等人在p k r o o n 提出的规则脉冲激 励编码的基础上,将它简化成实时算法,并用三片d s p 实现了编、译码器,编码速率是1 6 k b s 以后他们与c g a l a n d ,m r o s s o 等人合作,改进算法,加入了长时预测l t p ,并使速率降为 1 3 k b s ,形成长时预测规则脉冲激励( r p e - l t p ) 。r p e l p c 在1 9 8 8 年被确定为泛欧标准全 速语音编码方案,称为g s m 标准 r p e - l p c 与m p e ,l p c 比较相似最大的不同使激励脉冲的求法在r p e - l p c 中,将 一帧语音信号的激励分成若干子帧在一个子帧内部,部采用间隔相同的规则脉冲串作为激 励信号按照这些脉冲串中的第一个非零脉冲出现的位置,可以分为k 种不同相位的候选 激励信号。在其中求出一个最佳激励脉冲序列。语音信号经过p 阶逆滤波器后,得到余量 信号,余量信号和激励序列的误差输入到一个综合加权滤波器,输出综台加权误差。优化的 过程就是调摧激励序列,使综合加权误差在一定范围内所取的平方和最小。 1 2 3 8 码激励线性预测声码器( c e l p ) ” 1 9 8 5 年,m a n f r e dr s e h r o e d e r 和b i s h n us a t a l 在l e e ei c a s s p 年会上首先提出了用码 本作为激励源的线性预测编码技术( c e l p ) 1 9 8 8 年。美国政府标准语音编码器在4 8 k b s 速率采用由美国国防部与a t & t 贝尔实验室共同研制的c e l p 声码器( f e d s t d 1 0 1 6 ) ;1 9 8 9 年8 k b s 速率的北美数字移动通信全速率编译码器标准采用修改的c e l p 技术一矢量和激励 线性预测编码( v s e l p ) ;1 9 9 1 年i e e e 通过了用短延时码激励( l d ,c e l p ) 作为1 6 k b s 语 音编码器的标准。 c e l p 用两个码本分别逼近语音的长时周期性结构和语音经过短时、长时预测后的余量 信号。从两个码本种搜索出来的最佳码矢量,乘以各自的最佳增益后相加。即是c e l p 激励 信号源。将激励信号输入p 阶l p 综合滤波器,得到合成语音信号。合成语音信号与原始语 5 音的误差经过感觉加权滤波器后,得到感觉加权误差c e l p 用感觉加权的最小平方预测误 差作为搜索最佳码矢量及其幅度的度量准则。使感觉加权误差平方最小的码矢量即是最佳码 矢量。 1 2 3 9 多带激励声码器( m b e ) 1 0 1 3 4 1 1 4 美国m r r 大学林旨实验窀1 9 8 8 年提出的多带激励( m u l t i b a n d e x c i t e d ) 语音编码方案, 它不仅在2 4 4 8 k b s 速率上能合成出音质比传统声码器好的多的语音,而且具有较好卉匀白 然度和容忍环境噪声的能力。它是目前这一速率范围内较理想的编码方案。 多带激励就是将语音谱按基音谐波频率分成若干子带,对各带信号分别判断为浊音还是 清音。然后根据各带是清音还是浊音,采用不同的激励信号合成语音最后将各带信号相加 形成全带合成语音。该算法我们将在后面的章节中做详细说明。 1 3 衡量语音编码性能的主要因素 语音编码的目的就是用尽可能低的速率获得尽可能高的语音合成质量“1 ,同时应尽可能 减少编解码时延以及算法的复杂程度换一个角度也可以说,在给定编码质量、编解码时延 以及算法复杂程度的条件下,如何降低语音编码所需的比特率。这四个因素之间有着密切的 联系。并且在不同的应用中对各方面的侧重要求也有所不同。除了这四个主要因素,语音编 解码系统的鲁棒性也是衡量语音编码器的重要指标。 1 3 1 编码质量 语音编码质量是衡量语音编码算法优劣的关键性能之一。评价语音编码质量的方法归纳 起来可分两类,即客观评定方法和主观评定方法。 客观评定方法用客观测量的手段来评价语音编码质量,常用的方法有信噪比、加权信噪 比、平均分段信噪比等。它们都是建立在度量均方误差的基础上,其特点是计算简单,但不 能完全反映人对语音质量的感觉,这个问题对于速率为1 6 k b s 以下的中、低速率语音编码 尤为突出,因此此法主要用于速率较高的波形编码类型的算法。 主观评定方法符合人类听音时对语音质量的感觉,目前得到了广泛应用常用的方法有 平均意见分( m e a no p i n i o ns c o r e 简称m o s 分) “”,判断韵字测试( d i a g n o s t i cr h y m e t e s t , 简称d r t 得分) 1 ,判断满意度测量( d i a g n o s t i c a c c e p t a b i l i t ym e a s u r e ,简称d a m 得分) l 等。其中m o s 分评定使用最为普遍 6 m o s 得分采用五级评分标准,如表1 - 1 所示。参加测试的实验者,在听完所测语音后, 从这五个等级中选择其中某一级作为他对所测语音质量的评定。全体实验者的平均分就是所 测语音质量的m o s 分。 表1 - 1m o s 判分五级标准及相应的描述该级语音质量的形容词 m o s 判分质量级别 失真级别 5优( e x c e l l e n t )不察觉 4 良( g o o d )剐有察觉 3可( f a j r ) 有察觉且稍觉可厌 2差( p o o r )明显察觉且可厌但可忍受 1 坏( u n a c c e p t a b l e ) 不可忍受 在数字语音通信中通常认为m o s 分4 o 4 5 分为高质最数字化语音,达到长途电话 网的质量要求,接近于透明信道编码也常称之为网络质量m o s 分为3 5 分左右称作通 信质量,这时能感到重建话音质量有所下降,但不妨碍正常通话,可以满足多数话音通信系 统使用要求。m o s 分3 0 分以下常称合成语音质量,是指一些声码器合成的语音能达到的 质量。它一般具有足够高的可懂度,但自然度及讲话人的确认等方面不够好 判断韵宇测试( d i r r ) 是反映语音清晰度或可懂度的一种测试方法,它主要用于低速率 语音编码的质量测试。这种测试方法使用若干对( 通常9 6 对) 同韵母进行测试,例如中文 的“为”和“费”。英文的f a s t 和v a s t 等。测试中让受试者每次听到一对韵字中的某个 音,然后让他判断听到的音是哪个字。全体实验者判断正确的百分比就是d r t 得分通常 认为d r t 为9 5 以上时清晰度为优,8 5 9 4 为良,7 5 8 4 为中,6 5 7 5 为差, 而6 5 以下为不可接受。实际通话中清晰度为5 0 时。整句的可懂度大约为8 0 ,这是 因为整句中具有较高的多余度,即使个别字听不清楚人们也能理解整句话的意思。当清晰 度为9 0 时,整句话的可懂度已接近1 0 0 ,所以对于低速率语音编码。一般要求清晰皮能 达到9 0 或以上。 判断满意度测量( d a m ) 是对语音质量的综合评仿,它是在多种条件下对语音质量可 接受程度的一种度量。 1 3 2 编码速率 编码速率用比特秒( b s ) 来度量,它代表了编码的总速率,一般用,表示。编码速率 也可以用比特样值( b p ) 来度量,它代表了平均每个语音样点用多少比特编码一般用r 7 表示。,和尺可以通过采样速率联系起来: i = r 。丘 ( i - 1 ) 其中丘是采样速率。显然平均每样点比特数j r 越高,语音波形或参数量化则越精细 语音质量也就越高,相应的对传输带宽或存储容量的要求也就越高了。目前在波形编码中, 一般目前取r 2 ,而在参数编码中,r 可低剑0 2 5 甚至0 1 以下,当然这种情况下重建语 音只能保持一定的可懂性,而反映讲话人特征的信息和语音的自然度受到很大的损失。 1 3 3 编解码时延 增加算法的复杂程度可以提高语音编码质量,但往往也伴随着增加编解码的时延在实 时语音通信系统中,语音编解码的时延同线路传输时延的作用一样。对系统的通话质量有很 大的影响。例如在卫星通信中,两跳传输时延约0 5 s ,讲话后再听到对方回答需要l s ,已明 显感觉到对方反应“迟钝”。如果时延再大正常交谈都会发生困难。时延影响通话质量的 另一个原因是回声,当时延比较小时,回声感觉不明显当往返总时延超过1 0 0 m s 左右, 发话者就能够听到自己的回声。如果回声传输路径衰耗不够大,就会听到多次回声,从而严 重影响通话质量 语音编解码时延通常由3 个主要部分组成,即算法时延、处理时延和通信时延其中算 法时延是唯一与具体的硬件实现方案无关的时延。 算法时延( a l g o d t h m i cd e l a y ) :大多数低速率语音编码算法一次处理一帧语音数据 其语音参数每帧更新和传送一次。另外,为了对数据进行充分分析,有时需要对超出帧 界限的数据进行分析,超出帧界限的数据称为“前视”( l o o k - a h e a d ) 。因此在分析语 音之前需要缓存一帧数据包括“前视”部分。由此产生的时延称为算法时延。 处理时延( p r o c e s s i n gd e l a y ) :处理时延来自于编解码器在重建语音过程中所花费的时 间。它依赖于执行编解码算法的硬件的处理速度。 传输时延( t r a n s m i s s i o nd e l a y ) 。指码字从编码器传送到解码器所需的时间。 这三种时延的总和称为单向系统时延( o n e - w a ys y s t e md e l a y ) 。 1 3 4 编解码复杂度 编解码算法的复杂程度同语音编码的语音质量有非常密切的关系。一般来说在同样编 8 码速率的情况下,采用较复杂的算法将会获得更好的语音质量。换句话说,对于相同语音质 量,采用复杂一些的算法能够降低编码所需的速率。 编解码算法的复杂程度和硬件的实现有密切关系,它将决定硬件实现的复杂程度、体 积、功耗以及成本。目前在许多应用中都使用通用数字信号处理芯片( d s p ) 来实现编解码 算法。算法的复杂程度对于d s p 芯片的运算能力以及所需要的存储器容量都提出了一定的 要求。因此一般采用实现编解码算法所需要的运算速度( 每秒百万条指夸,m i p s ) 、程序存 储器( r o m ) 和数据存储器( r a m ) 的容量来衡量编解码算法的复杂度。 9 2 1 模型同m 儿蚓 第二章多带激励语音编码 2 1 1 传统声码器语音模型 我们以l p c 声码器为例来分析传统声码器的语音模型在l p c 中,语音信号逐帧地用 其产生模型的特征参数来表示。在发送端,对输入语音信号加窗,截取一帧语音,然后对该 帧语音进行分析得到这帧语音信号的激励参数( 包括清浊音判决信息和基音周期参数) 和 声道参数( 包括全极点模型的谱参数和增益) 在传统的声码器模型中,根据语音激励信号 的性质,将语音划分为两大类:清音和浊音在浊音段,激励信号采用具有该浊音段基音周 期的周期脉冲序列;在清音段,激励信号采用自噪声序列。在合成端将激励信号通过代表声 道特性的合成滤波器产生合成语音 对于“干净”的语音信号,这种二元激励模型能够在2 4 k b s 甚至更低的速率上合成可 懂度很高的语音。对于含有噪声的语音,由于无法准确地提取语音参数,l p c 声码器的性 能严重恶化。其他类型的传统声码器,例如通道声码器、同态声码器也具有相同的弱点。 虽然以这类语音模型为基础的声码器可以得到可懂度较高的合成语音,但是却不能产生 高质量的合成语音主要有两方面的原因: 语音模型本身的限制1 3 ” 传统声码器将短时语音段看成要么是周期波形要么是随机波形的二元模型当完全用周 期信号作为激励源时,合成语音中山现“嗡嗡”声;当完全用随机信号作为激励源,合成语 音会出现沙哑声。这是因为:事实上许多语音段都是既古有周期分量又含有非周期分量。特 别是过渡音阶段及含有噪声的浊音段更是如此。这种特征在频谱上的表现就是在某些频段上 语谱呈现周期谱的特征,在某些频段上则表现出噪声谱的特征显然,简单地用二元谱来拟 合这种实际语音谱并不符合实际语音的特性合成语音缺乏自然度。这也是造成合成语音质 量不高的主要原因 不准确的语音模型参数估计 语音模型参数估计不准确是导致声码器合成语音质量不高的另一个主要原因。例如基 1 0 音周期估计不准确或清浊音判决有误使合成语音质量明显劣化。在有噪声的情况下,由于无 法准确的估计语音模型参数,合成语音的质量显著下降,可懂度降低 因此,一个高质量的语音分析合成系统必须从完善语音模型和提高语音模型参数估计准 确性两方面同时入手。多带激励模型正是从这两方面对传统声码器进行了改进,因此建立在 多带激励语音模型上的声码器具有较高的台成语音质量以及较好的抗噪声性能。 2 1 2 多带激励语音模型 根据观察到的激励频谱中周期能量和噪声能量并存的现象人们提出了一些混和激励的 模型。在这些模型中,周期性和类噪声的激励源是按时变或非时变频谱形状混和而成的 在具有非时变频谱形状的激励模型中,周期和噪声激励按固定的频谱形状相加产生混 和比控制着周期源与噪声源的幅度。这种改进模型的一个基本假设是周期源与噪声源的频谱 形状是非时变的然而在干净的语音中,这点通常是不正确的 为此,又提出了具有时变频谱形状的混合激励模型,其中包括f u j i m a r a 提出的模型和 m a k h o u l 提出的模型。在这些模型中,清浊音判决或激励混合比控制着频谱中较大的连续区 域。这些区域的边界往往是固定的且数目较少( 1 3 个) 观察浊音信号谱中类似噪声的能 量和被噪声污染的浊音信号,我们希望能有一种更加灵活的模型另外,我们假设人耳能够 区分频谱中以周期能量为主的谐频和以类似嗓声能量为主的谐频,并利用这些信息从随机噪 声中获得话音信号。简单激励声码器质量在有噪情况下下降严重就是由于没有利用这一声 学假设, 从我们在频谱中观察到的现象出发并利用上述有用的声学假设,应该采用一种随频率变 化的清浊音混合激励函数,多带激励模型由此产生。它采用了有效的激励模型,突破了= 元 激励的局限性,克服了传统声码器的缺点。是目前较为理想的编码方案人们对此算法进行 了各种深入研究。” 我们现在对多带激励模型进行分析。利用语音信号的短时平稳特性可以对语音信号进 行分帧处理。输入语音信号经采样后用5 加) 表示为进行分帧处理需要对输入语音信号加 窗( 窗函数表示为0 ) ) 。加窗后的语音信号表示为: s 。0 ) - w ( n ) s ( n ) ( 2 - 1 ) 一般窗长为2 0 4 0 m s ,以适应语音信号短时平稳性。 如果用s 。) 表示s 。0 ) 的傅氏变换,那么常用的一种语音模型是将s 。( ) 看成是系 统函数日。( ) 和激励信号谱e 。( ) 的乘积即 而重建语音信号可表示为 s 。( ) - h 。( ) e 。( ) ( 2 - 2 ) s 。( ) 一h 。( m ) 。( 甜) ( 2 3 ) 式中h 。 ) 和e 。( g o ) 分别是合成器的系统频域函数和激励信号的频域函数,是用一 定的分折方法从原始语音信号中提取的。 多带激励声码器与传统声码器相比,主要差别在于激励信号的表示方法不同。传统声码 器中,激励频谱完全由基音周期和整帧的清浊音判决信息决定而在m b e 模型中激励频 谱由基音周期和一个随频率变化的清浊音判决函数决定。然而为了能准确地表示一个连续的 随频率变化的清浊音判决函数需要大量的比特,这对于用于信息压缩的语音编码来说是没有 实际意义的为解决这一问题,将整个额带划分为以基音谐频为中心的互不交叠的谐频带。 对每个频带独立地进行清浊音判决多带激励模型因此得名。 m b e 语音模型的激励频谱e ,( ) 是这样得到的:根据基音频率o 与各个谐频带的清 浊音判决( v r o ) ,将被判为浊音带的周期信号谱同被判为清音带的随机噪声谱组台起来 对于清音带,采用白噪声谱作为激励信号;对于浊音带。采用加窗周期脉冲序列的傅氏变换 ( 用只( w ) 表示) 作为激励信号。只( 山) 完全由基音频率决定,有两种方法产生:( 1 ) 计算加窗的以基音周期为间隔的冲激序列的傅氏变换:( 2 ) 将窗函数的傅氏变换以各基音谐 波为中心通过叠加产生。 系统函数h 。 ) 的作用是确定各个频带分量的相对幅度和相位,起到将e 。( ) 映射 成为s 。( ) 的作用。 这种激励模型比较符合实际语音的特性,从而使合成语音谱同原始语音谱在细致结构上 能够很好地拟合。 图2 1 给出了m b e 语音模型合成端的框图: 1 2 2 1 3 多带激励语音模型参数 图2 1m b e 语音模型 由前述可知。多带激励语音模型参数由两部分组成: 激励参数:包括基音周期和各谐频带所对应的清浊音判决信息。 声道参数:由谱包络来表示,在m b e 模型中是各谐频对应的频谱幅度 从合成语音谱的幅度i s 。( ) i 是能够合成出高质量的语音的t 但是这不仅要求非常准 确地表示l s 。( ) i ,而且算法的时延大于b 这对于实时语音压缩处理是不可行的a 因此 还要考虑合成谱的相位信息从s 。 ) 求出合成信号。在编码速率较高的情况下,可以传 送相位信息;当编码速率较低时,只能在接收端根据上一帧的相位和本帧的基音频率来预测 本帧的相位。 至此,可以确定m b e 语音模型参数包括: 基音周期 各谐频带的清浊音判决信息 各谐频对应的谱包络幅度 各谐频对应的谱包络相位( 编码速率较高时) 2 2 参数提取同n 0 m 传统的语音编码方法如:l p c ,c e l p 等。激励参数与谱包络参数的估计的独立进行 的这些参数的估计通常是建立在一些合理的、启发性的准则上而不是直接考虑合成谱同 原始语音谱之间的拟合程度。这就导致了合成谱与原始语音谱之间往往差异较大 在m b e 模型中,激励参数与谱包络参数的估计是同时进行的,因此,在最小均方误差 准则下,合成语音频谱与原始语音频谱达到最佳拟台。 1 3 在上一章中已经介绍过,无论是对于浊音,清音还是过渡音,多带激励编码过程都涉及 三种参数的提取,郎;基音周期按基音频率各次谐波分成频带后每个频带的谱包络参数以 及每个频带的v 九j 判决信息。统一提取这三个参数所涉及的计算量相当大目前在实际应 用中难以实时实现。冈此我们采用一种次优的算法分两步来完成参数的提取: ( 1 ) 确定使原始频谱与合成频谱达到最佳拟合的基音周期和谱包络: ( 2 ) 根据原始频谱与合成频谱的拟合情况,作出清浊音判决并计算出各谐频所对应的谱包 络幅度。 2 2 1 基音周期 基音周期是语音信号最重要的参数之一。根据加窗的短时语音帧来估计基音周期。在语 音编译码器、语音识别( 对于汉语来说,四声识副就是以基音周期估计为基础的) 、说话入 确认以及生理缺陷人辅助系统等许多领域中都是重要的一环。1 我们采用加权最小均方误差准则来提取参数可以采取两种方案。第一种方案只涉及语 音谱中每一分量的模值( 幅度值) ,第二种方案则既涉及模值又涉及相位值 在采用第一种方案完成上述两步运算时,都是要调整所要提取参数值使得原始语音谱模 值i s 。 ) i 与合成语音谱模值i s 。) l 之差的加权积分最小: s - i l o ( ) s 。( ) l i s 。( 珊) 1 ) 2 d ( 2 4 ) 其中,g ( ) 是一个频率加权函数。 如果采用第二种方案则应使下列加权积分达到最小: 一去j = :| ) i s 如) 一s 。( 训2 d e o( 2 5 ) 采用此式时不仅包含了两个语音谱模值的比较,而且包含了二者的相位比较。由于它既 包含幅度信息又包含相位信息,因此用s 。( ) 拟合s 。( 山) 时可以得到质量更高的语音。但 是,由于所传输的信息增加,编码速率也随之增加。对本文所仿真的m b e 声码器而言由 于编码速率较低,没有多余的比特用于传送相位信息,因此采用第一种方案,即:参数估计 阶段仅考虑语音谱的幅度值,在合成端根据上帧的相位和本帧的基音频率来预测本帧的相 位 在利用( 2 - 4 ) 式进行参数估计时,得到的最佳基音周期值和谱包络参数应使均方误差 达l q 最小值。若直接进行,既困难且计算量大。但是,如果给定基青周期值,最佳的谱包络 1 4 参数就很容易得到。 因此,首先假设基音周期已知,那么相应的基音频率也已知。然后将频谱划分为 以各个基音频率为中心的互不交叠的若干频带,假设每个频带内的谱包络的幅度不变用 表示,下标m 表示第m 个频带。这样,第i n 个频带内的误差就变为: 一去r g ( 甜) s 。( m ) | - j 以忙。 ) i ) 2 d w ( 2 - 6 ) 其中t4 。= 沏一1 2 ) t o o 以及;( m + 1 2 ) c o o y b 第m 个谐频带的上下界。为使厶达 到最小,求s ,对k ,j 求偏导,令偏导值为零,得: i 以i 掣! ! :型兰:型竺 沼, e g ) 忆( ) 1 2d o ) 若原始语音第m 次谐波频带范围内信号能量主要是周期信号能量那么对于加窗后的 语音信号在这一频率范围内谱包络的形状与窗函数主瓣的包络形状相同这时,如果选用 只 ) 来表示激励信号e 。 ) 拟合误差很小若在这一频带内原始语音信号的主要 能量是非周期信号能量,那么。值将较大据此可以进行v u 判决。如果已判定某一频带 为浊音频带,则可以使用只( m ) 作为该带的激励信号,因此: c 。g ( c c j ) l s ,( ) 0 只( 珊) l d i 以i - 墨。丁一 ( 2 8 ) 亡。g ( 珊) 1 只 ) 1 2 如 j 目。 对于清音带。激励信号应采用理想白噪声谱,最佳谱幅度为: 刮- 笔警 ( 2 9 ) 这样,对于假定的基音频率的每一个谐波,利用式( 2 - 8 ) 和( 2 9 ) 计算出l a 。i ,再 带入式( 2 - 6 ) 求出各次谐波带内的最小误差将各谐波分带内的最小误差相加就得到整个 频带的总的最小误差: - s 。o ( 2 1 0 ) 。答“ 旺。1 m i 一卅 对所有可能的基音周期值进行上述运算,从理论上讲,使误差最小的基音周期值即是真 正的基音周期值。 2 2 1 1 时域估计 1 5 上面的估计是在频域内进行的,虽然它可以在任意频率分辨翠f 估计基晋周期,但计舁 量太大,为简化算法下面推导采用时域样点值进行计算的等效公式,利用它们可以很方便 的求出各个参数。 设窗函数w 0 ) 的傅立叶变换为w ( c o ) ,并设归化基音角频率为基音周期为晶t 显然= 2 p o ,还假设在( 仃,石) 频率范围内共有2 m 个谐波,那么在采用只( ) 作为 激励信号时得到的合成语音信号频谱可以写成: s 一( 珊) i

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论