(信号与信息处理专业论文)自适应多速率宽带语音编码算法的仿真实现及研究.pdf_第1页
(信号与信息处理专业论文)自适应多速率宽带语音编码算法的仿真实现及研究.pdf_第2页
(信号与信息处理专业论文)自适应多速率宽带语音编码算法的仿真实现及研究.pdf_第3页
(信号与信息处理专业论文)自适应多速率宽带语音编码算法的仿真实现及研究.pdf_第4页
(信号与信息处理专业论文)自适应多速率宽带语音编码算法的仿真实现及研究.pdf_第5页
已阅读5页,还剩73页未读 继续免费阅读

(信号与信息处理专业论文)自适应多速率宽带语音编码算法的仿真实现及研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

太原理1 人学硕十彬f 究士学位论文 自适应多速率宽带语音编码算法的仿真实现及研究 摘要 为了满足w c d m a 和g s m 对高质量语音业务的需求,3 9 p p e t s i 提出 了宽带自适应多码率( a m r - w b ) 编解码器。随后,a m r - w b 又被i t u t 选用为其1 6 k b i t s 宽带语音编码标准g 7 2 2 2 。a m r w b 具有语音质量高、 平均编码速率低和自适应好等优点,是通信史上第一种可以同时用于有线 与无线业务的语音编码系统,在无线通讯领域和有线通讯领域都有着广阔 的应用前景。 本文首先对a m r w b 算法进行了系统的分析,深入研究了编码器的线 性预测和量化、自适应码本搜索、固定码本搜索和高频带处理等几个模块 以及解码器的解码原理。接着对算法进行了仿真实现,选用t i m i t 标准英 文语音数据库中的标准语音文件( 16 k h z ,16 b i t ) 进行编解码实验,对编解码 后的语音质量进行了主观听觉测试和客观p e s q 测试,测试结果表明 1 2 6 5 k b i t s 以上模式,合成语音的波形与原始语音基本一致,在听觉上已经 与原始语音难以分辨,p e s q 值都超过了4 0 ,6 6 0 k b i t s 和8 8 5 k b i t s 模式, 在波形和听觉上稍有失真,p e s q 值都在3 5 以上,达到了通信质量标准, 而且合成语音具有良好的自然度和听觉舒适性。 本文还对三种宽带语音编码标准g 7 2 2 、g 7 2 2 1 及g 7 2 2 2 ( a m r w b ) 分别进行了编解码测试,对三种算法的语音质量进行了测试比较, g 7 2 2 2 ( a m r w 3 3 ) 中2 3 8 5 k b i t s 和2 3 0 5 k b i t s 两种模式的语音质量与g 7 2 2 i 太原理i 人学硕士研究生学位论文 中的6 4 k b i t s 模式相当,g 7 2 2 2 ( a m r w b l 中的l9 8 5 k b i t s 和1 8 2 5 k b i t s 两种模式的语音质量与g 7 2 2 中的5 6 k b i t s 模式相当,而g 7 2 2 1 中的 3 2 k b i t s 模式只相当于g 7 2 2 2 ( a m r w b ) q u 的1 2 6 5 k b i t s 模式,显然g 7 2 2 2 ( a m r w b ) 用较低的编码速率得到了较高的语音质量,相比g 7 2 2 和c l 7 2 2 1 具有明显的优势。 在a m r - w b 中使用了一种修正的感觉加权滤波器,这种感觉加权滤波 器不同于传统的窄带语音感觉加权滤波器,它可以与预加重结合起来,减 小由于宽带语音信号低频到高频的动态范围大而引起的频谱倾斜,新的语 音感觉加权滤波器的结构可以充分减少了共振峰的倾斜性。本文对这两种 感觉加权滤波器进行了分析研究,并用标准宽带语音对两者的频率特性进 行了测试比较,结果表明新的感觉加权滤波器具有良好的滤波特性,频率 响应与宽带语音的谱包络对应良好,且较为平滑,动态范围小。 关键词:自适应多速率宽带,语音编码,代数码激励线性预测,感觉加权 滤波器 太原理上人学硕卜w f 究,上。学f 市论文 s l m u l 订i o na n dr e s e a r c ho f a d a p t i v em u i r i r a t ew i d e b a n d s p e e c hc o d i n ga l g o r i t h m a b s t r a c t i no r d e rt om e e tt h er e q u i r e m e n to fw c d m aa n dg s mi nh i g h q u a l i t ys p e e c hs e r v i c e s ,3g p p e t s ip r o p o s e dt h ea d a p t i v em u l t i r a t ew i d e b a n d ( a m r - w b ) s p e e c hc o d e c a f t e rt h a t ,t h ea m r w j 3c o d e cw a ss e l e c t e db y i t u ti nt h es t a n d a r d i z a t i o na c t i v i t yf o rw i d e b a n ds p e e c hc o d i n ga r o u n d16 k b i t s a m r - w bh a st h ea d v a n t a g e so fh i g hs p e e c hq u a l i t y , l o wa v e r a g eb i tr a t e a n ds t r o n ga d a p t a b i l i t y t h ea d o p t i o no fa m r w bb yi t u - ti so fs i g n if i c a n t i m p o r t a n c ef o ri ti st h es p e e c hc o d es y s t e ma d o p t e db o t hb yw i r e l e s sa n dw i r e l i n es e r v i c ea tf i r s tt i m e ,a n dw i l lb eu s e dw i d e l yi nw i r e l e s sc o m m u n i c a t i o n f i e l d sa sw e l la sw i r el i n ec o m m u n i c a t i o nf i e l d s t h i sp a p e rs y s t e m i c a l l ya n a l y z e dt h ea m r w ba l g o r i t h m b a s e do n d e e pr e s e a r c ht h el i n e rp r e d i c t i o na n dq u a n t i z a t i o n ,a d a p t i v ec o d e b o o ks e a r c h , f i x e dc o d e b o o ks e a r c h ,h i g hb a n dp r o c e s sa n dt h ed e c o d i n gp r i n c i p l e ,t h e a m r w b a l g o r i t h mw a ss i m u l a t e d t h es t a n d a r ds p e e c hf i l e s ( 16 k h z ,16 b i t ) o f t i m i ts t a n d a r de n g l i s hs p e e c hd a t a b a s ew e r es e l e c t e dt oa c c o m p l i s hc o d i n g a n dd e c o d i n ge x p e r i m e n t s ,t h e nt e s t e dt h es y n t h e s i z e ds p e e c hi ns u b je c t a u d i t o r yq u a li t ya n do b j e c tp e s qv a l u e t h er e s u l ts h o w e da b o v et h em o d e lo f 太原理l :人学硕七研究生学位论文 i2 6 5 k b i t s ,t h ew a v e f o r mo fs y n t h e s i z e ds p e e c hi st h es a m ea st h a to fi n p u t s p e e c h ,a n di th a dh a r d l yt od i f f e r e n t i a t ew i t ho r i g i n a li n p u ts p e e c hi na u d i t o r y , t h ep e s qv a l u e sw e r em o r et h a n4 0 i nt h em o d e lo f6 6 0 k b i t sa n d8 8 5 k b i t s , t h e r ew e r eal i t t l ed i s t o r t i o ni nt e r m so fw a v e f o r ma n da u d i t o r y , a n dt h ep e s q v a l u e sw e r ea b o v e3 5 t h e ya l lr e a c h e dt h ec o m m u n i c a t i o nq u a l i t y s t a n d a r d , a n dt h es y n t h e s i z e ds p e e c hh a dt h eg o o dn a t u r a l n e s sa n dc o m f o r t a b l ea u d i t o r y p r o p e r t y i nt h i sp a p e r , t h r e ek i n d so fw i d e b a n ds p e e c hc o d i n gs t a n d a r do f g 【7 2 2 ,g 7 2 2 1a n dg 7 2 2 2 ( a m r - w b ) a l s ow e r et e s t e d ,a n dt h es p e e c hq u a l i t y o ft h e s ea l g o r i t h m sw a sc o m p a r e d t h er e s u l tp r e s e n t st h es p e e c hq u a l i t yi nt h e m o d e lo f2 3 8 5 k b i t sa n d2 3 0 5 k b i t si n g 7 2 2 2 ( a m r w b ) w a se q u i v a l e n t w i t h6 4 k b i f f si ng 7 2 2 ,t h es p e e c hq u a l i t yi nt h em o d e lo f19 8 5 k b i t sa n d 18 2 5 k b i t si n ( 3 7 2 2 2 ( a m r - w b ) w a se q u i v a l e n tw i t h5 6 k b i t si ng 7 2 2 ,a n d t h em o d e lo f3 2 k b i f f si n ( 3 7 2 2 1w a st h es a m ea st h em o d e lo fi2 6 5 k b i t si n g 7 2 2 2 ( a m g - w b ) a p p a r e n t l y , ( 3 7 2 2 2u s e dt h el o w e rb i tr a t et oo b t a i nt h e h i g h e rs p e e c hq u a l i t y , a n dt h e r ew a so b v i o u sa d v a n t a g e sc o m p a r e dw i t hg7 2 2 a n dg 7 2 2 1 ac o r r e c t i o no fp e r c e p t u a lw e i g h t e df i l t e rw a su s e di nt h ea m r w b a l g o r i t h m ,t h i sp e r c e p t u a lw e i g h t e df i l t e rw a sd i f f e r e n tf r o mt h et r a d i t i o n a l n a r r o w b a n ds p e e c hp e r c e p t u a lw e i g h t e df i l t e r , i tc a nc o m b i n ew i t hp r e e m p h a s i s t or e d u c et h es p e c t r u mi n c l i n a t i o nc a u s e db yt h el a r g ed y n a m i cr a n g ef r o ml o w f r e q u e n c yt oh i g hf r e q u e n c yo fw i d e b a n ds p e e c hs i g n a l ,t h en e wp e r c e p t u a l 太原理l :人学硕十研究生学何论,史 w e i g h t e df i l t e rc o u l dr e d u c et h ei n c l i n a t i o no f f o r m a n t t h i sp a p e ra n a l y z e da n d s t u d i e dt h et w op e r c e p t u a lw e i g h t e df i l t e r s ,a n d c o m p a r e dt h e i rf r e q u e n c y c h a r a c t e r i s t i c sb ym a d ef u l lu s eo fs t a n d a r dw i d e b a n ds p e e c h t h er e s u l ts h o w e d t h a tt h i sn e wp e r c e p t u a lw e i g h t e df i l t e rh a db e t t e rf i l t e r i n gc h a r a c t e r i s t i c s ,a n d t h e 行e q u e n c yr e s p o n s ec o u l db ew e l lc o r r e s p o n d i n gw i t ht h es p e c t r a le n v e l o p e o fw i d e b a n ds p e e c h ,m o r e o v e rt h es m o o t h n e s sp r o p e r t yo ft h i sf i l t e ri sb e r e r a n dt h ec h a n g eo f d y n a m i cr a n g ei ss m a l l k e yw o r d s :a d a p t i v em u l t i r a t ew i d e b a n d ,s p e e c hc o d i n g ,a l g e b r a i cc o d e e x c i t e dl i n e a rp r e d i c t i o n ,p e r c e p t u a lw e i g h t e df i l t e r v 声明尸明 本人郑重声明:所呈交的学位论文,是本人在指导教师的指导下, 独立进行研究所取得的成果。除文中已经注明引用的内容外,本论文 不包含其他个人或集体已经发表或撰写过的科研成果。对本文的研究 做出重要贡献的个人和集体,均已在文中以明确方式标明。本声明的 法律责任由本人承担。 论文作者签名:一闽瘁e i i 蕻i :塑垄;二兰l 关于学位论文使用权的说明 本人完全了解太原理工大学有关保管、使用学位论文的规定,其 中包括:学校有权保管、并向有关部门送交学位论文的原件与复印 件;学校可以采用影印、缩印或其它复制手段复制并保存学位论文; 学校可允许学位论文被查阅或借阅;学校可以学术交流为:目的, 复制赠送和交换学位论文;学校可以公布学位论文的全部或部分内 容( 保密学位论文在解密后遵守此规定) 。 签:名:自因莓日期 趁:三: 导师签名:嵫: 日期冱丛:至旦 太原理l :人学硕士研究生学何论文 1 1 课题的目的和意义 第一章绪论 语言是人类进行交流所使用的最重要的手段之一,是通信系统中最常见的数据形 式。随着移动通信和互联网的飞速发展,语音通信技术也在不断地进行更新并与之融合。 语音信号的数字化传输和存储,在可靠性、抗干扰能力、快速交换等方面远胜于模拟化, 且易于保密,价格低廉,所以从2 0 世纪5 0 年代以来,数字化语音在通信系统中所占的 比重越来越大。 语音编码是数字语音通信中的一项重要技术,语音编码是降低数字语音传输比特率 的过程,同时保证降低速率后的语音质量能达到语音通信或存储等特定应用的要求。近 年来,变速率语音编码和宽带语音编码已经成为语音编码的发展趋势,在国际上已经成 为了研究热点,但在国内还处于起步阶段。 + 自适应多速率宽带( a m r w b ) 语音编码是一种较新的语音编码技术,同时它也是一 种典型的语音编码技术。a m r w b 采用了变速率语音编码技术,处理的语音信号是宽 带语音( 5 0 h z 7 0 0 0 h z ) ,因而它是变速率语音编码技术和宽带语音编码技术的结合。 一 本课题对a m r w b 语音编码技术进行了基础性研究,对算法进行了全面的分析、 仿真和性能测试,为今后对该算法的下一步研究和改进打下了良好的基础,而且对变速 率语音编码和宽带语音编码的研究工作也具有重要的学术意义,能够促进本方向的研究 工作。 1 2 语音编码的理论概述 一般来讲,语音编码的目的是在给定的编码速率下,使得编解码后恢复出的重构语 音的质量尽可能高。提高语音编码效率的基本途径在于充分利用语音信号中的冗余度和 人耳的听觉特性。语音的冗余度主要来源于两个方面,语音信号幅度分布的非均匀性和 语音样点之间的相关性。语音信号的幅度统计特性同信号的带宽、采样时的声学条件以 及统计的时间长度都有关系。对于这样一种随机过程,它的概率密度分布不满足任何一 种固定的分布,它是具有动态的、时变的、多维的暂态概率密度分布的随机过程。随着 统计时间长度不同,它表现的概率密度分布形式不同,一般认为长时( 几十秒以上) 统计 太原理 :大学硕十研究牛学f 节论文 幅度特性接近于g a m m a 分布,而短时( 几到几十毫秒) 统计所得幅度特性接近于高斯分 布。但无论长时或短时统计,语音信号总是小幅度出现的概率大,而大幅度出现的概率 小。非均匀标量量化就是直接利用了语音信号的这一特点,使量化质量得到提高。参数 编码质量的提高的理论基础也依赖于对语音信号的统计特性的进一步研究。 语音样点之间存在相关性是语音信号具有冗余度的另一原因。通过对于语音发声的 机理进行研究,我们知道语音是由肺呼出的气流通过声门形成的激励信号激励声道再经 唇、口和鼻辐射出来的。从信号处理的角度出发,可以把语音看成是由白噪声或周期脉 冲激励信号通过一个有色滤波器所产生的。这一过程在时域上看,相当于使样点之间产 生了相关性;从频域看,相当于给频谱加色,使原来的白色谱变成了非平坦的有色谱。 此外,在语音中的浊音段,信号具有准周期的特性,其频谱含有谱线结构。因此,除了 谱包络代表的短时相关性外,浊音段还其有长时相关性。利用语音信号的这些相关性可 以有效地降低语音编码的速率f 1 】【2 】。 对于人耳听觉特性的研究,目前还不是很完善。可以说,在这个领域,是理论滞后 于实践。目前在语音编码中,对于听觉特性的使用主要通过在编码时考虑人耳的感觉加 权,来改善合成质量。对人耳听觉特性的进步研究,是提高语音编码质量的又一个途 径。 1 3 语音编码的分类 语音编码按编码方式大致可以分为三种:波形编码、参数编码和混合编码。波形编 码是将时间域或频率域( 变换域) 信号直接变换为数字信号,力求使重建语音波形保持 原始语音信号的波形形状。参数编码又称声码器编码,它是将信源信号在频域或其它变 换域提取特征参数,然后对这些特征参数进行编码和传输,在译码端再将接收到的数字 信号译成特征参数,根据这些特征参数重建语音信号。混合编码将波形编码和参数编码 结合起来,克服了波形编码和参数编码的缺点,吸收了它们的长处,能够在较低速率上 得到高质量的合成语音【3 】_ ( 6 l 。 1 3 1 波形编码 波形编码是降低量化每个语音样点的比特数,同时保持相对好的语音质量,在波形 编码中要求重建语音信号j ( 门) 的各个样本尽可能地接近原始语音信号s ( 甩) 的样本值,如 太原理1 :人学硕士研究生学何论文 果令e ( n ) = s ( n ) 一;( ,z ) 表示量化误差或重构误差,那么波形编码的目的是在给定的传输 比特率下,使误差序列e ( n ) 的能量最小。传统的波形编码方法有脉冲编码调匍j ( p c m ) 、 自适应增量调s t ( a d m ) 年i 自适应差分脉冲编码涨t j ( a d p c m ) 等。针对语音信号幅度分 布不均匀的特点,p c m 中用p 律或a 律对信号抽样进行不均匀量化,需要用6 4 k b i t s 实现;a d m 中对信号增量进行自适应量化,需要用3 2 k b i t s 1 6 k b i t s 实现;a d p c m 利 用波形样点之间的短时相关性,进行短时预测,对预测值与原始语音的差值( 预测残差) 进行编码,用3 2 k b i t s 可以再现高质量语音。波形编码具有语音质量好、适应能力强、 算法简单、易于实现、噪性能强等优点。其缺点是所需的编码速率高,一般在 16 k b i t s - 6 4 k b i t s 之间。 1 3 2 参数编码 参数编码是以语音信号产生的数学模型为基础,对数字语音信号进行分析,提出一 组特征参数( 主要是指表征声门振动的激励参数和表征声道特性的声道参数) ,这些参 数携带有语音信号的主要信息,编码它们只需要较少的比特数,在解码后可以由这些参 数重新合成语音信号。码率的降低主要取决于分析和提取什么样的特征参数以及合成器 的类型。这种编码方法力图使重建语音信号具有尽可能高的可懂度,但重建语音信号与 原始语音信号样本之间没有一一对应关系,因而合成语音的音质好坏需要藉助于主观评 定,而缺少客观的评定标准。共振峰声码器、线性预测声码器、余弦声码器都属于参数 编码器。参数编码的优点是可实现低速率语音编码,其编码速率可低至2 4 k b i t s 以下, 其缺点是语音质量差,自然度较低。这类编码器对讲话环境噪声较敏感,需要安静环境 才能给出较高的可懂度。 1 3 3 混合编码 波形编码虽然能够得到很好的语音质量,但它的编码速率很高,而参数编码虽然能 获得很低的编码速率,但其合成语音质量不高。混合编码在保留参数编码的技术精华的 基础上,引用波形编码准则去优化激励源信号,克服了原有波形和参数编码的弱点,而 吸取了它们各自的长处,在4 k b i t s 1 6 k b i t s 的速率上能够合成高质量语音。多脉冲激励 线性预测编码( m p e l p ,m u l t i p u l s el i n e a rp r e d i c t i o nc o d i n g ) 、码激励线性预测编码( c e l p , c o d ee x c i t e dl i n e a rp r e d i c t i o n ) 等都属于这类混合编码器。混合编码器以复杂的算法和很 太原理i 人。学硕十研究生学佗论文 大的运算量为代价,在中低速率语音编码上获得了高质语音。 1 4 语音编码技术的发展史 从最初的6 4 k b i t s 的标准p c m 波形编码器到现在4 k b i t s 以下的参数编码的声码器, 从最初的单一编码速率到现在自适应多速率,语音编码技术在最近几十年得到了迅速的 发展【7 1 【8 1 1 9 1 。 1 8 7 6 年贝尔发明了电话,通过声电、电声转换技术第一次实现了远距离的语音通 信。1 9 3 7 年a h r e e v e s 提出的脉冲编码调制( p c m ,p u l s ec o d em o d u l a t i o n ) 理论则开 创了语音数字化通信的历程。1 9 3 9 年美国人h o m e rd u d l y 研制成功了第一个声码器, 从此奠定了语音产生模型的基础,语音处理开始了参数编码( 或模型编码) 的研究。2 0 世纪6 0 年代,s a t oi t a k u r a ( 1 9 6 6 ) 和a t a ls c h r o e d e r ( 1 9 6 7 ) 研究出实用的共振峰声码 器【1 0 1 ,最早把线性预测编码( l p c ,l i n e a rp r e d i c t i v ec o d i n g ) 技术应用到语音分析和合 成,并提出了自相关法、协方差法、格型法等实用快速算法。1 9 6 6 年,j l f l a n a g a n 提 出了以瞬时频率为基础的相位声码器【l l 】。1 9 6 9 年,a v o p p e n h e i m 提出了以倒谱为基础 的同态声码器【1 2 1 。1 9 8 2 年,美国国家安全局( n s a ) 公布了2 4 k b i t s 的l p c 1 0 声码器 标准( f s 1 0 1 5 ) ;1 9 8 4 年,美国国防部制定了s t u i i i 计划,采用2 4 k b i t s 的l p c 1 0 e 增强型。在众多声码器中,l p c 声码器终因其成熟的算法和参数的精确估计成为研究的 主流,并逐步得到实用,参数编码在这个阶段获得了较大的发展。 2 0 世纪8 0 年代中期到2 0 世纪9 0 年代这1 0 年间,语音编码技术有了突破性的进 展,闭环分析算法( l p a b s ,l i n e a rp r e d i c t i o na n a l y s i s b y s y n t h e s i s ) 成为了主流。l p a b s 思想是在1 9 8 1 年被提出的,最早实用的l p a b s 方案则是1 9 8 5 年由b s a t a l 和 m r s c h r o e d e r 提出的码激励线性预测( c e l p , c o d e e x c i t e dl i n e a rp r e d i c t i o n ) 算、法1 13 1 。 在1 9 9 1 年,n s a 公布了4 8 k b w s 的c e l p 联邦标准f s 1 0 1 6 。i t u t 在1 9 9 2 年和1 9 9 6 年公布了适用于公用网g 7 2 8 、g 7 2 9 和g 7 2 9 a 等语音编码标准,分别采用低时延码激 励线性预测( l d c e l p ) 、共轭结构代数码激励线性预测( c s a c e l p ) 等技术,1 9 9 4 年公布了用于因特网的双速率( 5 3 6 3 k b i t s ) 多媒体语音编码标准g 7 2 3 ,其中5 3 k b i t s 采用代数码激励线性预测( a c e l p ) 技术,6 3 k b i t s 采用多脉冲最大似然度量化( m p m l q , m u l t i p u l s em a x i m u ml i k e l i h o o dq u a n t i z a t i o n ) 技术。随着v o l p ( v o i c eo v e ri n t e r a c t p r o t o c 0 1 ) 需求激增,按照i t u t 的h 3 2 3 建议,v o l p 主要采用的语音编码标准有g 7 2 9 、 太原理l :人学硕十研究生子7 何论文 g 7 2 9 a 、g 7 2 3 等协议。同时,由于第二代数字蜂窝移动通信系统开始在全球商用,欧 洲电信标准协会( e t s i ) 、美国通信工业协会( t i a ) 和同本数字蜂窝( j d c ) 分别制定 了适用于本地区第二代移动通信的语音编码标准。e t s l 分别在1 9 8 9 年、1 9 9 5 年和1 9 9 6 年公布了1 3 k b i t s 的脉冲激励长时预测( r p e l t p ) 语音编码方案( 全速率语音编码 f r ) 、6 5 k b i t s 的矢量和激励线性预测编码( v s e l p ) 方案( 半速率语音编码h r ) 和 1 2 2 k b i t s 的a c e l p 方案( 增强型全速率语音编码e f r ) 。t i a 在1 9 9 1 年公布了i s 5 4 ( 7 9 5 k b i t s 的v s e l p 技术) 标准,j d c 在1 9 9 2 年公布了j d c ( 6 7 k b i t s 的v s e l p 技 术) 标准。 以上介绍的这些算法共同特点是采用闭环l p a b s 算法、感觉加权技术、复合窗技 术、线谱对( l s p ) 技术、后置滤波技术、增益自适应技术和分数基音内插技术等,现在 一般把以l p a b s 为基础的用矢量量化( v q ) 技术对激励信号进行量化编码的算法统称 为c e l p 。另外,在这个阶段i t u t 还制定了一些基于白适应差分脉冲调制( a d p c m ) 的语音编码标准,如的g 7 2 1 、g 7 2 2 、g 7 2 6 和g 7 2 7 等,采用正弦编码范畴的多带激 励( m b e ) 1 4 】、自适应变换编码( a t c ) 【1 5 】和子带编码( s b c ) 等技术的编码方案也 有制定。但总的来说,采用混合编码c e l p 算法是这个阶段语音编码的主流。 2 0 世纪9 0 年代中期到现在,第三代移动通信技术逐渐成熟并走向商用,变速率语 音编码和宽带语音编码得到了迅速的发展,不断有新的国际标准和地区标准公布。应用 于第三代移动通信的变速率语音编码主要有可变速码激励线性预测( q c e l p ) 【l 酬、增 强型变速率编解码器( e v r c ) 、自适应多速率( a m r ) 、自适应多速率宽带( a m r w b , a d a p t i v em u l t i r a t ew i d e b a n d ) 、可选模式声码器( s m v ) 和变速率多模式宽带 ( v m r w b ) 等。在3 g 三大标准中,中国提出的时分一码分多址( t d s c d m a ) 采用 了a m r 语音编码技术;美国提出的c d m a 2 0 0 0 标准随着无线技术和编码技术的发展, 先后采用了q c e l p 、e v r c 和v m r w b 等声码器作为其语音编码方案;欧洲提出的宽 带码分多址( w c d m a ) 标准采用先后采用了a m r 、a m r w b 语音编码技术,s m v 作为其备选语音编码方案。宽带话音的发展也经历了一个过程,1 9 8 8 年国际电联0 t u ) 通过了第一个宽带话音编码器标准g 7 2 2 ,基于子带自适应差分脉码调匍j ( s b - a d p c m ) 编码原理,速率为6 4 k b p s ,5 6 k b p s 和4 8 k b p s ,其中6 4 k b p s 速率的话音编码器的m o s 值可以达到4 7 5 ,与现今采用的增强型全速率话音编码器( e f r ) 4 0 1 的m o s 值相比, 话音质量的提高是很明显的,同时另一重要特点就是宽带话音编码器的合成语音更自 太原理j :人学硕十研究生学位论文 然,非常适合应用到电视电话会议中。对于这种早期的宽带话音编码器的缺点就是编码 效率不高,6 4 k b i t s 的速率不利于在系统中实现。i t u 公布了新的宽带语音编码国际标 准g 7 2 2 1 ,降低了编码速率( 2 4 k b i t s 和3 2 k b i t s ) 。2 0 0 2 年国际电联( i t u ) 在对以往宽带 话音编码算法改进的基础上提出g 7 2 2 2 标准,由9 种速率话音模式组成,编码速率较 低,而且可以根据无线环境和本地容量需求动态选择。 1 5 语音编码性能的评价标准 语音编码的根本目标就是在尽可能低的编码速率条件下,重建得到尽可能高的语音 合成质量,同时还应尽量减小编解码延时和算法复杂度,因此编码速率、语音质量评价、 编解码延时以及算法复杂度这四个因素自然就成了评价一个语音编码算法性能的基本 指标,这四个因素之间有着密切的联系,在具体评价一种语音编码算法的优劣时,需要 根据具体的实际情况,综台考虑四个因索进行性能评价【3 1 。 1 5 1 编码速率 编码速率直接反映了语音编码对语音信息的压缩程度。编码速率可以用“比特秒 ( b i t s ) 来度量,它代表编码的总速率,一般用i 表示;也可以用“比特样点”( b p ) 来度 量,它代表平均每个语音样点编码时所用的比特数,用r 表示。两者之间可以用公式 i = r 石互相转化,其中石为抽样频率。显然,平均每样点比特数r 越高,语音波形或参 数量化则越精细,语音质量也就越容易做高,相应地对传输带宽或存储容量的要求也就 越高。 1 5 2 语音质量的评价方法 语音质量评价可以说是语音编码性能的最根本指标,评价语音质量的方法归纳起来 可以分为两类:主观评价方法和客观评价方法。 ( 1 ) 语音质量主观评价方法 主观评定方法符合人类听话时对语音质量的感觉,目前得到了广泛应用。主观评价 方法是在一组测试者对原始语音和合成语音进行对比试听的基础上,根据某种事先约定 的尺度来对语音质量划分等级。常用的方法有平均得分意见( m e a no p i n i o ns c o r e ,简称 m o s ) ,判断韵字测试( d i a g n o s t i cr h y m et e s t ,简称d r t 得分) 和判断满意度测量 ( d i a g n o s t i ca c c e p t a b i l i t ym e a s u r e ,简称d a m 得分) 。国际上应用最广的是平均得分意见 6 太原理i :人。产硕十研究生学何论文 评定法,一般称为m o s 评分。表1 1 中列出了m o s 判分标准及相应的语音质量级别。 表1 - 1m o s 评分的五个等级 t a b l e1 1f i v es t a n d a r do fm o sg r a d e m o s 评分 质量等级 收听注意力等级失真描述 5 优 可完全放松,不需要注意力没察觉 4 良 需要注意,但不需要明显集中注意力 刚有察觉 3 满意( 正常)中等程度的注意力有察觉且稍觉可厌 2 差需要集中注意力显察觉且可厌但可忍受 l劣 即使努力去听,也很难听懂 不可忍受 在数字通信中,通常认为m o s 分4 0 4 5 分为高质量数字语音,达到长途电话网的 质量要求,也常称之为网络质量。m o s 评分在3 5 分左右时称作通信质量,这时能感 觉到重建语音质量有所下降,但不妨碍正常通话,可以满足多数语音通信系统使用要求。 m o s 评分在3 o 分以下的常称合成语音质量,这是指一些声码器合成的语音所能达到 的质量,它一般具有足够高的可懂度,但自然度及讲话人的确认等方面不够好。 虽然主观评价方法符合人类听话时对语音质量的感觉,但由于其测试结果的获得依 赖于测听者个人的主观感受,因此为了减少个人反应的随意性和不可重复性,一般对测 试所用的设备、数据、测试条件及测试人员都有严格的要求,并有繁琐的测听程序规定, 需要消耗大量的时间、人力和费用,而且即使如此,测试结果仍然存在着一定的不可重 复性,在完全相同的测试条件下重复测试,结果也会有一定的随机波动,所以主观评价 方法一般都是由较大的通信组织来完成,个人很少采用。 ( 2 ) 语音质量的客观评价方法 客观评价方法是用客观测量的手段来评价语音编码质量,它是建立在原始语音和合 成语音的数学对比之上的,常用的方法可分为时域客观评价和频域客观评价两大类。时 域客观评价常用的方法有信噪比、加权信噪比、平均分段信噪比等;频域客观评价常用 的方法有巴克谱失真测度( b s d ,b a r ks p e c t r a ld i s t o r t i o n ) 矛t lm e l 谱测度等。这些评价方 法的特点是计算简单、结果客观、不受个人主观因素的影响,但其缺陷也很明显,就是 不能完全反映人类对语音的听觉效果。虽然如平均分段信噪比、巴克谱失真测度等考虑 了人耳的多种听觉特性,并做了相应的加权校正,在评价速率较高的波形编码算法时和 人的主观感觉比较符合,但在参数编码算法和混合编码算法的评价中仍然存在着上述问 太原理i :人学硕十研究生学位论文 题。 目前能提供主客观相关性较高的音质客观评价方法,都是考虑了人耳的听觉特性, 使用听觉感知模型来模拟收听这一过程的。因此当前的主流是使用感知模型来评估非线 性和易出错的音频通信系统。感知语音质量测度( p s q m ,p e r c e p t u a ls p e e c hq u a l i t y m e a s u r e ) 在1 9 9 6 年被国际电联i t u t 采纳为e 8 6 1 建议;1 9 9 8 年,一个基于归一化块 测度( m n b ) 的可选系统作为附件添加到e 8 6 1 中,m n b 是在考虑听过程的基础上,采 用m n b 方法来模拟人的判断过程,评价结果与主观评价值相关度较高;h o l l i e r 扩展了 巴克谱失真( b s d ) 模型,引领了感知分析测度系统( p a m s ,p e r c e p t u a la n a l y s i s m e a s u r e m e n ts y s t e m ) 的发展,p a m s 是第一个关注端到端行为,包括滤波和变化时延造 成的影响的模型。这些影响,再加上一定类型的编码失真、包丢失和背景噪声,就是引 起b s d 、p s q m 和m n b 等早期模型产生不精确得分的原因【1 8 】b 9 i 1 2 0 1 。 ( 3 ) p e s q ( p e r c e p t u a le v a l u a t i o no fs p e e c hq u a l i t y ) 语音质量评价法 i t u t 进行了一系列的实验来寻找一种新的语音质量评价模型,以期能适应更广泛 的编解码器和网络情况,具有更好的性能和表现。通过实验比较,发现p a m s 和 p s q m 9 9 ( p s q m 的更新和扩展版本) 两种算法的性能最好,然后就结合了这两种算法产 生了一个新的模型,叫做感知语音质量评价( p e s q ,p e r c e p t u a le v a l u a t i o no fs p e e c h q u a l i t y ) 。2 0 0 1 年2 月,在通过了由九种语言、在不同的真实和仿真的网络中采集语音 构成大规模样本库的全面测试评价后,p e s q 被i t u t 确定为e 8 6 2 建议,成为了窄带 电话网络和语音编解码器的端到端语音质量的客观评价方法【2 。 p e s q 是基于感知模型的语音质量客观评价标准,相对于p s q m 这个标准,p e s q 针对现代通信系统中出现的可变时间延迟和系统引入的线性滤波这两方面做了改进,对 差值曲面的解释中不但考虑误差的总量还考虑了误差的分布,增强了对于端到端的通信 系统语音质量的可靠评价。p e s q 总的思路是,对原始信号( 参考信号) 和通过测试系 统的信号进行电平调整到标准听觉电平,再用输入滤波器模拟标准电话听筒进行滤波。 对通过电平调整和滤波后的两个信号在时间上对准,并进行听觉变换,这个变换包括对 系统中线性滤波和增益变化的补偿和均衡。两个听觉变换后的信号之间的不同作为扰动 ( 即差值) ,分析扰动曲面提取出两个失真参数,在频率和时间上累积起来,映射到对 主观平均意见分的预测值1 2 引。 i t u t 的e 8 6 2 协议提供了( o 5 ,4 5 ) 内的原始输出评分p e s q 值,同时人们又希望 太原理l 人学硕= :研究,上学伉论文 通过一个“映射函数”将r 8 6 2 的输出结果转换成一个m o s l q o ( m e a no p i n i o ns c o r e l i s t e n i n gq u a l i t yo b j e c t i v e ) 评分,以便于将r 8 6 2 的结果和m o s 的结果进行线性比较。 e 8 6 2 1 t 2 3 l 建议即可完成这项转换工作。 这个映射函数的表达式为: 该映射函数的 y = 0 9 9 9 + 瓦4 9 9 9 - 而0 9 丽9 9 ( 1 - 1 ) 7 7 , 一一 图卜1 映射函数的曲线 f i g u r el - 1t h eg r a p ho fm a p p i n gf u n c t i o n 实际的实验中采用长度加权的p e s q 值来衡量编码质量。设三为单个语句长度,m 为每个语句的p e s q 原始分值,按下式进行加权p e s q 分必的计算 厶码 m = 型了

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论