(信号与信息处理专业论文)基于csacelp语音编码算法的研究及dsp实现.pdf_第1页
(信号与信息处理专业论文)基于csacelp语音编码算法的研究及dsp实现.pdf_第2页
(信号与信息处理专业论文)基于csacelp语音编码算法的研究及dsp实现.pdf_第3页
(信号与信息处理专业论文)基于csacelp语音编码算法的研究及dsp实现.pdf_第4页
(信号与信息处理专业论文)基于csacelp语音编码算法的研究及dsp实现.pdf_第5页
已阅读5页,还剩49页未读 继续免费阅读

(信号与信息处理专业论文)基于csacelp语音编码算法的研究及dsp实现.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

哈尔演理t 人学t 学硕f 学位论文 基于c s a c e l p 语音编码算法的研究及d s p 实现 摘要 随着现代移动通信的蓬勃发展,频带利用率与通信质量成为目前该领域 两个突出的问题。低速率,高质量和低成本的语音编解码器成为解决这些问 题的有效途径。为满足这种需要,国际电信联盟( i n t e r n a t i o n a lt e l e c o m u n i t e d ,i t u ) 于1 9 9 6 年推出了g 7 2 9 标准。它是基于共轭结构代数码激励 线性预测( c s a c e l p ) 的8 k b i t s 的语音压缩标准,具有时延小,重建语音 质量好等特性。g 7 2 9 标准由于其接着概要介绍了1 6 位定点的数字信号处 理芯片t m s 3 2 0 c 5 4 0 2 及其特点。优良的性能被广泛的应用于卫星通信、多 媒体通信、移动通信以及i p 网络电话等领域。 本文首先叙述了语音编码技术的背景知识,系统地阐述了g 7 2 9 语音编 解码标准,从原理上分析了算法中的关键技术:线性预测、知觉加权滤波、 矢量量化、增益量化、自适应码本搜索和固定码本搜索等。为了降低算法的 运算量,本文提出了对算法进行改进的些方法:线谱对系数量化过程的改 进;开坏搜索方法的改进;码本增益量化的简化;码本搜索中求最小距离的 优化等。 d s p ( d i g i t a ls i g n a lp r o c e s s o r ) 作为一种专用的数字信号处理器而被广 泛的应用在多媒体、通信的各个领域。由于d s p 具有体积小、功耗低、运 算速度快和价格便宜等许多优点,非常适合于实时语音和视频压缩处理。本 文采用t i 公司的t m s 3 2 0 v c 5 4 0 2 芯片来实现g 7 2 9 语音编码算法,根据其 特点对源代码中运算量较大的模块进行了代码优化。 最后,仿真结果表明,优化后的g 7 2 9 算法的运算量仅是原始算法的 1 1 4 ,大大降低了算法的复杂度。经过主观试听判断,其输出的重建语音仍 然具有很高的质量。 关键词语音编码;数字信号处理器( d s p ) ;c s a c e l p 算法;码激励线 性预测: 竺玺鎏詈二盔兰:耋要:竺兰銮 : r e s e a r c h0 1 1c s - a c e l p s p e e c hc o d e ca l g o r i t h m a n di m p l e m e n t a t i o no nd s p a b s t r a c t w i t ht h e r a p i dd e v e l o p m e n t o fm o d e mm o b i l ec o m m u n i c a t i o n , t h e b a n d 晰d t hu t i l i z a t i o na n ds p e e c hq u a l i t yh a v eb e e nt h ec r u c i a lp r o b l e m s t h e v a l i da p p r o a c ht os o l v et h i sp r o b l e mi sl o wr a t e ,l o wc o s ta n dh i g hq u a l i t ys p e e c h c o d e c g 7 2 9p r o t o c o lw a se n a c t e db yi t u ( i n t e r n a t i o n a lt e l e c o mu n i t e d ) t om e e t t h e s cr e q u i r e m e n t si n1 9 9 6 g 7 2 9 ,w h i c hi sb a s e do nc o n j u g a t e - s t r u c t u r e a l g e b r a i c c o d e e x c i t e dl i n e a r - p r e d i c t i o n ( c s - a c e l p ) a tt h er a t eo f8 k b i t s , h a st h ea d v a n t a g eo fl o wd e l a y , h i g hr e c o n s t r u c t e ds p e e c hq u a l i t y o w i n gt oi t s h i g hq u a l i t y , g 7 2 9p r o t o c o lh a sb e e nw i d e l yu s e d i nm a n yf i e l d s ,s u c ha s s a t e l l i t ec o m m u n i c a t i o n , m u l t i m e d i ac o m m u n i c a t i o n , m o b i l ec o m m u n i c a t i o na n d i pp h o n en o w a d a y s i nt h i st h e s i s ,f i r s t l y , t h eb a c k 目o u n dk n o w l e d g eo fl o w - r a t es p e e c hc o d i n g i si n t r o d u c e d a n d e s p e c i a l l y g 7 2 9s t a n d a r di s p r e s e n t e ds y s t e m a t i c a l l y m o r e o v e r , s o m ei m p o r t a n tt e c h n i q u e so fa l g o r i t h mi n c l u d i n gl i n e a r - p r e d i c t i o n , p e r c e p t u a lw e i g h t i n g ,v e c t o rq u a n t i z a t i o n ,g a i nq u a m i z a t i o n , a d a p t i v e c o d e b o o ks e a r c h , a n df i x e d c o d e b o o ks e a r c hh a v eb e e na n a l y z e dt h e o r e t i c a l l y f u r t h e r m o r e ,s o m em e t h o d sa r ep u tf o r w a r dt oi m p r o v et h ea l g o r i t h m ,s u c ha s i m p r o v i n gt h eq u a n t i z a t i o no fl s pc o e f f i c i e n t s ,i m p r o v i n go p e n l o o ps e a r c h i n g m e t h o d s ,s i m p l i f y i n gt h ec o d e b o o kq u a n t i z a t i o no ft h eg a i n s ,o p t i m i z i n gt h e c o d e b o o ks e a r c h s e c o n d l y , t h ec h a r a c t e r i s t i c so fl o wp o w e rl o s sa n dh i g h p e r f o r m a n c e16 一b i t f i x e d p o i n td i g i t a ls i g n a lp r o c e s s i n gc h i pt m s 3 2 0 v c 5 4 0 2a l ei n t r o d u c e d d s p ( d i g i t a ls i g n a lp r o c e s s o r ) a sas p e c i a le l e m e n tf o rd i g i t a ls i g n a lp r o c e s s i n gh a s b e e nw i d e l yu s e di nm a n yf i e l d ss u c ha sm u l t i m e d i a , t e l e c o m m u n i c a t i o n b e c a u s ed s ph a sm a n ya d v a n t a g e s ,s u c h a s c o m p a c t n e s s ,l o wp o w e r c o n s u m p t i o n , h i g ho p e r a t i o ns p e e da n dl o wp r i c e ,i ti sv e r ys u i t a b l ef o rr e a l - t i m e - n 生玺鎏詈:銮:譬:兰竺兰圣 i m p l e m e n t a t i o no hs p e e c ha n dv i d e oc o m p r e s s i o n i nt h i st h e s i s t h eg 7 2 9 a l g o r i t h mi si m p l e m e n t e do nt h et m $ 3 2 0 v c 5 4 0 2f i x e d p o i n td s po ft e x a s i n s t r u m e n t s ,a n dt h em o d u l e so ft h es o u r c ec o d ew i t hl a r g e rc o m p u t a t i o n a l q u a n t i t yh a v eb e e no p t i m i z e d f i n a l l y , t h es i m u l a t i o nr e s u l t ss h o wt h a tt h ec o m p u t a t i o n a lc o m p l e x i t yo f t h eo p t i m i z e dc t 7 2 9a l g o r i t h mh a sb e e nr e d u c e dt o1 1 4t h a to ft h eo d g i u a l a l g o r i t h m a tt h es a m et i m e ,b ym e a n so fs u b j e c t i v ej u d g m e n t ,t h eo u t p u ts p e e c h h a sh i g hr e c o n s t r u c t e dq u a l i t yw i t ht h eo p t i m i z e dg 7 2 9 a l g o r i t h m k e y w o r d s s p e e c hc o d i n g ;d i g i t a ls i g n a lp r o c e s s o r ;c o n j u g a t e - s t r u c t u r e a l g e b r a i c c o d e - e x c i t e dl i n e a r p r e d i c t i o na l g o r i t h m ;c o d ee x c i t e d l i n e a rp r e d i c t i o n ; - i - 哈尔滨理工大学硕士学位论文原创性声明 本人郑重声明:此处所提交的硕士学位论文基于c s a c e l p 语音编码算 法的研究及d s p 实现,是本人在导师指导下,在哈尔滨理工大学攻读硕士学 位期间独立进行研究工作所取得的成果。据本人所知,论文中除已注明部分外 不包含他人已发表或撰写过的研究成果。对本文研究工作做出贡献的个人和集 体,均已在文中以明确方式注明。本声明的法律结果将完全由本人承担。 作者签名:王碍 日期:2 0 0 7 年3 月1 5 日 哈尔滨理工大学硕士学位论文使用授权书 基于c s a c e l p 语音编码算法的研究及d s p 实现系本人在哈尔滨理工 大学攻读硕士学位期日j 在导师指导下完成的硕士学位论文。本论文的研究成果 归哈尔滨理工大学所有,本论文的研究内容不得以其它单位的名义发表。本人 完全了解哈尔滨理工大学关于保存、使用学位论文的规定,同意学校保留并向 有关部门提交论文和电子版本,允许论文被查阅和借阅。本人授权哈尔滨理工 大学可以采用影印、缩印或其他复制手段保存论文,可以公布论文的全部或部 分内容。 本学位论文属于 保密口,在年解密后适用授权书。 不保密曰。 ( 请在以上相应方框内打) 作者签名: 王渭 r 期:2 0 0 7 年3 月1 5 日 导师签名:韦琦r 期:2 0 0 7 年3 月1 5 日 名遗 哈尔滨理t 犬学t 学硕 学位论文 1 1 引言 第1 章绪论 2 l 世纪的通信应在人与人之间,人与机器之间提供高质量,无缝的信息交 换手段。无缝通信是指用户可以方便地综合使用电话,电视电话会议,可视电 话,语音信箱,电子邮件等多媒体方式,既不影响通信质量,又能随意地把一 种通信方式转换成另一种通信方式。高质量是指通信质量不随用户环境和传输 媒介的变化而降低,使用起来方便快捷。由于获取信息的是人,而人是以语音 作为主要的通信方式,因此无论何时何地,以何种方式通信,语音通信都将是 最基本,最重要的方式之一【ul 。 语音信号携带的信息量大。不仅表达了文字的意义,还包括了音高,音 强,音长等特征信息,相对于文本文字,用语音表达相同的一段内容,信息量 要比文本大十倍以上p 1 。简单地对连续语音抽样量化得到的数字语音,在传输 和存储上要占用较多的信道资源和存储空间,而现代通信系统中,随着用户的 激增及对服务质量要求的不断提高,带宽资源显得十分紧张,因此,如何在尽 量减少失真的情况下,高效地对语音信号进行压缩编码,从而降低数码率,减 少占用带宽,显得十分重要。 实际上,语音信号中含有大量的冗余信息,采用各种信源编码技术减少冗 余度,并充分利用人耳的听觉掩蔽效应( m a s k i n ge f f e c t ,m e ) i “,就可以将编码 速率压缩很多倍,而仍能恢复出可懂度甚至自然度很好的语音| 5 】。 目前语音压缩编码技术在可视电话,会议电话,i p 网络电话,数字蜂窝移 动通信,数字卫星系统,综合业务数字网( i s d n ) ,公共交换电话网( p s t n ) , 话音存储转发系统等领域中有着广泛的应用,尤其近几年,随着因特网的发 展,i p 电话的应用越来越广,使语音压缩编码传输的优势越来越突出,它不仅 可以大大节省网络带宽,更重要的是便于实现与i p 的融合【6 j ,带动了目前世界 上两大网络一电信网和计算机网的融合【7 l ,从而减少通信成本,提高效率。 1 2 语音编码国内外研究现状 从1 9 3 7 年脉冲调制( p c m ) 及1 9 3 9 年声码器( v o c o d e r ) 的概念提出以来, 哈尔演理t 大学t 学硕f 学位论文 开创了语音数字化通信的历程。至今6 4 k b i u s 标准p c m 仍占主要地位州。 随着微电子技术的发展,国际电话与电报顾问委员会( i n t e r n a t i o n a l t e l e p h o n ea n dt e l e g r a p hc o n s u l t a t i v ec o m m i t t e e ,c c i r r ) 于1 9 9 3 年并入国际电 信联盟( i n t e r n a t i o n a lt e l e c o m m u n i c a t i o nu n i o n ,i t u ) ,i t u 在二十世纪8 0 年代 初着手研究低于6 4 k b i t s 的非p c m 编码算法,并于1 9 8 4 年通过了3 2 k b i t ,s a d p c m 的g 7 2 1 建议,于1 9 9 2 年公布了】6 k b i f f sl d c e l p 的g ,7 2 8 1 9 i 建议。 1 9 9 5 年1 1 月,在国际电联电信标准部第十五研究组( i t u ts g l 5 ) 全会上通 过了由日本n t t 实验室、法国c n e t 实验室、加拿大s h e r b r o o k e 大学、美国 a t & t 公司联合提出的速率为8 k b i f f s 的使用“共轭结构代数码激励线性预测 ( c s a c e l p ) ”语音编码建议g 7 2 9 t ”j 。1 9 9 6 年6 月的i t u ts g i5 次会议上通 过了g 7 2 9 的附件a t ”】减少复杂度的8 k b i t “sc s a c e l p 语音编码器”,制 定了g ,7 2 9 的附件8 j 】2 j “用于符合i t u 。tv 7 0 终端的优化g 7 2 9 无话期压缩方 案”的文本,正式成为国际电联标准。 目前在国际上,s u n 公司于1 9 9 9 年第3 季度在其m e d i a l i b 应用程序库系 列中增加了g 7 1 1 、g 7 2 2 、g 7 2 3 1 1 3 l 、g 7 2 8 、g 7 2 9 、g 7 2 9 a 等以软件形式 出现的标准音频编解码器版本。在语音网关中,这些编解码器可用来在互联网 上数字化发送和接收语音数据。d s ps o f t w a r ee n g i n e e r i n g 、c o n e x a n t ( 原 r o c k w e l l ) 等实力雄厚的公司也提供了g 7 2 9 、g 7 2 9 a 编码软件。作为c s a c e l p 算法提出机构之一的n t t 联合t o s h i b a 、f u j i t s u 、n e c 制定了以g 7 2 9 为蓝本的同本新一代的语音编码标准j t g 7 2 9 。 国内教学与科研单位于二十世纪8 0 年代开始语音信号数字处理的研究, 并已经取得长足的进步。目前,国内一些著名高校如清华大学,西安电子科技 大学,上海交通大学等都在对g 系列建议进行跟踪,主要是对g 7 2 9 、 g 7 2 9 a 、g 7 2 3 i 实现方法和g 7 2 9 建议的仿真研究。同时,国内一些高技术 公司也开始研究g 7 2 9 语音编解码器,在一些网站上也出现了对g 系列建议的 讨论。 g 7 2 9 是一种基于8 k b i t s 传输速率的声码器,算法延迟为1 5 m s ,它提供 的语音质量能够满足网络通信的要求。它在问世前经过了严格的测试,具有带 宽需求小、算法延时短、适用范围广,抗误码能力高的优点。因此,g 7 2 9 成 为目前比较理想的低速率编码方案,也是i t u 迄今为止向各国电信界推荐的最 新标准。事实上,g 7 2 9 正在被应用在数据通信的各个领域,如i p 电话【1 4 l 和 h 3 2 3 网上多媒体通信系统等。但g 7 2 9 的不足是算法比较复杂,成为其广泛 应用的一大障碍。 坠! :堡堡三查兰三兰堡! :兰堡篁塞 1 3 本课题的目的和意义 本文开展的是有关g 7 2 9 语音编码算法在d s p ( d i g i t a ls i g n a lp r o c e s s o r ) 芯 片上实现的研究工作,着重于c s a c e l p 算法的改进和代码的优化,对涉及到 的技术进行理论研究和实验分析,提出切实可行的方法。目的在于通过研究如 何对算法进行改进和对代码进行优化,达到有效的压缩c s a c e l p 算法的运算 量和代码量,使g 7 2 9 协议在d s p 芯片上得到实时实现。 随着语音信号数字处理算法的日益复杂,对系统的硬件环境要求也越来越 高,通用d s p 芯片的出现及其性价比的迅速提高为各种实用化语音信号处理 系统的实现铺平了道路。自8 0 年代初期d s p 芯片问世以来,在2 0 余年的时 间里,d s p 芯片得到了极为迅速的发展,其性价比和开发手段等方面都有了长 足的进步。然后芯片的性能越好价格就越高这是不争的事实,因此,在保 证语音质量的前提下,降低传输的数码率,就意味着降低成本,也就是说,对 既定语音算法进行高效编码对降低成本和提高经济效益有很高的价值。本课题 研究的基于c s a c e l p 语音编码算法的研究及其d s p 实现就是为了对语音算 法进行高效的编码。 1 4 本文的主要研究工作 本文研究的主要工作旨在利用语音编码的相关技术,在深入地研究了c s a c e l p 算法的基础上,进行对算法内容的改进以及对算法代码的优化,从而 达到降低c s a c e l p 编码算法复杂度的目的,在此基础上力求使得g 7 2 9 编解 码器能在d s p 芯片上实时实现。为此,确定本文的研究内容如下: 1 研究了国内外大量有关语音压缩编码技术和d s p 技术的文献资料。 2 g 7 2 9 的算法比较复杂,本文在i t u 提供的基本算法原理的基础上,进 一步对算法中的一些细节问题做了细致的研究和深入的理解。 3 在深入学习d s p 芯片结构原理的基础上,着重研究了定点运算的d s p 实现以及c 和汇编混合编程的问题,这些技术对实时实现g ,7 2 9 非常重要。 4 通过对g 7 2 9 算法流程的详细分析和研究,先对算法提出了一些改进的 方法,然后对代码分别从c 语言、汇编两个方面进行了优化,提出了多种有效 的优化方法。在t m s 3 2 0 v c 5 4 0 2 上的测试结果表明,优化后的g 7 2 9 算法的 运算量仅是原始算法的1 1 4 ,大大降低了算法的复杂度,并给出了原始输入语 音信号和重构后的语音信号的仿真波形图。经主观试听,输出的重构语音和原 堕尘鎏矍三查兰三茎至! ! :兰竺丝兰 始语音相比较,仍然具有不错的可懂度和自然度。 哈尔滨理t 大学t 学硕i 学位论文 第2 章语音编码相关理论和技术 2 1 语音信号产生的数字模型 利用数字技术来模拟语音信号的产生称为语音信号的数字模型f j ”,或者 说,利用数字信号处理技术来实现对发音器官的模拟。发音器官能发出一系列 声波,那么数字模型就能产生与此声波相对应的信号序列。这种模型是一种线 性系统,它的一组参数选定之后就可以使得系统的输出具有所希望的语音性 质,系统的这些参数是和语音产生过程有关的。通常采取离散时问模型来表示 采样的语音信号。 当发音时,激励和声道形状都是随时间而改变的,但语音信号随时日j 的改 变是非常缓慢的。对大多数语音信号来说,通常认为激励与声道的面积函数在 l o 2 0 m s 的时间范围内是近似不变的。因而可以设想,语音的数字模型是一 个缓变的线性系统,这个线性系统的参数在l o 2 0 m s 时问范围内是近似不变 的。通常,语音可分为浊音和清音两部分:在发浊音时,激励为准周期脉冲 串,其周期称为基音周期;在发清音时,激励为随机噪声。 在浊音情况下,其激励信号的产生如图2 1 所示。 图2 - i语音信号的源系统模型 f i g 2 - 1s o u r c es y s t e mm o d e lo f s p e e c hs i g n a l s 另一种是发清音的情况。这时的发音可以模拟成随机白噪声。实际上可以 使用均值为0 ,方差为l ,并在时间或幅值上为白噪声分布的序列。 把两者结合在一起,可得到图2 2 所示的模型。这就是目丽使用最多的语 音产生的数字模型,利用浊音和清音激励发生器交替工作来模拟激励形式的改 变,通常称之为二元激励。 数字语音处理中的语音分析和语音合成问题都是基于上述模型来实现的。 语音分析是根据原始语音信号来估计信号模型的参数,而语音合成则是利用信 号模型参数产生出在可懂度和自然度方面可接受的语音。语音信号的这种分析 竺尘堡塞三查兰二兰堡! :兰堡篁塞 合成系统在中低速率语音编码6 1 中应用十分广泛。 增益控制 时变参数 图2 - 2 语音信号的数字模型 f i g 2 2d i g i t a lm o d e lo f s p e e c hs i g n a l s 2 2 语音编码技术分类 2 2 1 波形编码 语音取样值 语音信号的波形编码7 1 直接对语音信号的时域或频域的波形进行编码,力 图使重建语音波形保持原语音信号的形状。波形编码器适应能力强,语音质量 好,并易于实现,但所需要的编码速率较高。它们在1 6 6 4 k b i t s 的编码率上 能给出高的编码质量,当编码率进一步降低时,其性能下降较快。在p c m 的 基础上,利用语音样值和基因周期之间的相关性,并根据人耳的听觉掩蔽效 应,波形编码引入了差分编码、自适应预测、子带编码和矢量量化等多种技 术,提出了多种成熟的编码算法,如a d p c m ( 自适应差值脉冲编码调制) 、 a s b c ( 自适应子带编码) 、a t c ( 自适应变换编码) 等。 2 2 2 参数编码 与波形编码不同,语音信号参数编码郴1 通过对语音信号的参数进行提取及 编码,力图使重建语音信号具有尽可能高的可懂度,即保持原语音的语意。它 只要求得到的信号听起来与输入语音相同,而不必与输入波形相同,而重建信 号的波形同原语音的波形可能会有相当大的差别。这类编码的优点是编码率 哈尔滨理t 夫学t 学硕i 学位论文 低,例如可以低到2 4 k b i t s 甚至2 4 k b i t s 以下。 参数编码的基础是语音产生的数学模型,它将输入的语音信号分析为频谱 分量或其他决定信号的参量,编为电码,经远地传送后再合成为语音信号。其 优点是因为所传送的是参数,比较简单,节省信道,此外还可将参数编码改变 为保密系统,大大提高信道的使用价值,在国防和工商业中都很重要。但它的 主要问题是合成的语音质量差,特别是自然度较低。另外,这类编码器对讲话 环境噪声较敏感,需要安静的讲话环境才能给出较高的可懂度,且延时大,要 进一步提高产生的语音的质量,有效的方法是采用混合编码法。 2 2 3 混合编码 混合编码i l9 j 是将波形编码与参数编码结合而产生的一种编码方式,使语音 编码技术有了突破性的进展,混合编码结合了以上两种编码方式的优点,既利 用了语音生成模型,通过对模型中的参数( 主要是声道参数) 进行编码,减少 了波形编码中被编码对象的动态范围或数目:又使编码的过程产生接近原始语 音波形的合成语音,以保留说话人的各种自然特征,提高了合成语音质量。目 前比较成功的混合编码方案有:多脉冲线性预测编码( m u l t i p l e p u l s el p c ) 、码 激励线性预测编码( c o d e e x c i t e dl p c ) 。前者使用一个数目有限、幅度和位置 可调整的脉冲序列作为激励源;后者则使用一个波形码矢量作激励源,它通常 从高斯白噪声序列构成的码本中选取。在这两种方案中,均采样了灵活的语音 合成模型。尽管由于激励序列的引入需要增加几倍的传输码率,但却可以明显 地提高合成语音地质量 2 3 矢量量化技术 矢量量化1 2 0 1 1 2 1 】1 2 2 i ( v e c t o rq u a n t i z a t i o n ,v q ) 是2 0 世纪7 0 年代后期发展起来 的一种数据压缩技术。它广泛应用于语音编码、语音识别与合成、图像压缩等 领域。量化可以分为两大类:一类是标量量化,另一类是矢量量化。标量量化 是将抽样后的信号逐个地进行量化;而矢量量化是将若干个抽样信号分成一 组,即构成一个矢量,然后对此矢量一次进行量化。矢量量化是标量量化地发 展,可以说,凡是用到量化的地方都可以应用矢量量化。 矢量量化是s h a n n o n 信息论在信源编码理论方面的新发展,其研究的基础 是信息论的一个分支:“率一失真理论”。该理论指出:矢量量化总是优于标 量量化,且矢量维数越大性能越优越。这是因为矢量量化有效地应用了矢量中 竺尘堡矍三查兰三兰竺! :兰丝丝三 各分量问的各种相互关联的性质。 矢量量化的过程是:将语音信号由k 个样点组成的每一帧数据,或由k 个参 数组成的每一帧参数,构成k 维空间中的一个矢量,然后对这个矢量进行量 化。通常所说的标量量化,也可以说就是k = l 的一维矢量量化。矢量量化的过 程与标量量化相似。在标量量化时,在一维的零至无穷大值之问设置若干个量 化阶梯,当某输入信号的幅度值落在某相邻的两个量化阶梯之问时,就被量化 为这两个阶梯的中心值。而在矢量量化时,则将k 维无限空间划分为m 个区域 边界,然后将输入矢量与这些边界进行比较,并被量化为“距离”最小的区域边 界的中心矢量值。 矢量量化主要有两个问题: 1 如何划分m 个区域边界。这需要用大量的输入信号矢量,经过统计试 验才能确定。这个过程称为“训练”或建立码本。方法是:将大量欲处理的信 号的波形帧矢量或参数帧矢量进行统计划分,进一步确定这些划分边界的中心 矢量值来得到码本。 2 如何确定两矢量在进行比较时的测度。这个测度就是两矢量之间的距 离,或以其中某一矢量为基准时的失真度。它描述了当输入矢量用码本所对应 的矢量来表征时所应付出的代价。 图2 3 矢量量化器原理框i 玺i f i g 2 - 3b l o c kd i a g r a mo f v e c t o rq u a n t i z a t i o n 矢量量化的原理框图如图2 3 所示,其简单工作过程是:在编码端,输入 矢量肖与码本中的每一个码字进行比较,分别计算出它们的失真。搜索到失真 最小的码字r :。的序号,( 或该码字所在码本中的地址) ,这些序号就作为传输 或存储的参数。在恢复时,根据此序号从恢复端的码本中找出相应的码字 y 一。由于两个码本是完全一样的,此时失真最小,所以y ,就是输入矢量置 的重构矢量。很明显,由于传输或存储的并不是矢量本身而是其序号,所以矢 竺尘兰矍三叁兰三兰堡! :兰堡尘兰 量量化兼有高度保密的优良性能。由图2 3 可见,收发两端即编码器和解码器 两端都没有反馈回路,因此稳定性是没有问题的。由上面的分析可见,设计矢 量量化器的关键是编码器的设计方法,而译码器的工作过程仅是一个简单的查 表过程。 在训练数据已知的情况下,矢量量化的准则是在给定码本大小k 时使量化 所造成的失真最小。矢量量化器的设计就是:从大量信号样本中训练出好的码 本,从实际效果出发寻找到好的失真测度公式,设计出最佳的矢量量化器系 统,以便用最小的搜索和计算失真的运算量,来实现最大可能的平均信噪比 ( s i g n a lt on o i s er a t i o ,s n r ) 1 2 ”。 2 4 码激励线- 性预测 码激励线性预测( c e l p ) 编码器【2 4 1 【2 ”是基于分析合成方法、知觉加权、矢 量量化( v q ) 和线性预测( l p c ) 技术1 2 6 而构成的一个闭环、综合和高效的语 音编码系统,如图2 4 所示。 图2 - 4c e l p 编码原理框图 f i g 2 - 4b l o c kd i a g r a mo f c e l pe n c o d c r 在c e l p 编码器中,语音按帧进行分析,帧长一般为1 0 3 0 m s ,其基本原 理概括为:用一个自适应码本中的码字来逼近语音的长时周期性( 基音) 结构: 用一个固定的随机码字来逼近语音经过短时、长时预测后的残差信号。从两个 码本中搜索出的最佳码字,乘以各自的最佳增益后再相加,其和即为c e l p 的 激励源。将激励信号输入p 阶l p 合成滤波器h c z ) = 形( z ) ,得到合成语音信 哈尔滨理t 大学t 学硕1 :学位论文 号j ( 功,;( 疗) 与原始语音信号s ( n ) 的误差经过知觉加权滤波器形( 力,得至知觉 加权误差e ( n ) ,c e l p 编码器用知觉加权的最小均方误差准则( m i n i m mm e a n s q u a r ee r r o r , m m s e ) 2 7 1 作为搜索最佳码字及其增益的测度准则。自适应码本与 随机码本的搜索过程基本一致,差别在于码本结构和目标矢量的不同。 其中声道模型打( z ) 5 彤( z ) 给出了声道的传输函数,在大多数情况下可用 一个p 阶全极点函数来表示: 1 日( z ) = 二一 ( 2 - 1 ) 1 一y 口,z 。 式中见预测系数。 知觉加权的原理是利用人耳听觉的掩蔽效应,提高合成语音的听觉质量。 即在语音频谱分量很强的地方如共振峰区域内语音能量可掩蔽该区域内的量化 噪声。而不对听觉产生明显影响。因此在共振峰区域内的噪声相对于共振峰区 域外的噪声可允许较大些。知觉加权滤波器的作用是使实际的误差信号的谱不 再平坦,而与原始语音信号谱具有相似的包络形状。这就使误差度量的优化过 程与知觉加权上的共振峰对误差的掩蔽效应相吻合,产生较好的主观听觉效 果。知觉加权滤波器的特性由预测系数口和加权因子,( 取值在o l 之间,通 常取o 8 ) 来确定。 2 5 语音编码器性能的衡量标准 语音压缩编码研究的基本问题就是在一定编码速率下,如何用较低的复杂 度和较小的延时得到尽量好的重建语音,由此可见,重建语音质量、编码速 率、算法延时、算法复杂度是衡量编码器性能的四个主要因素: 1 重建语音质量 。 重建语音质量是衡量编码算法优劣的关键性能之一。它包括可懂度唧1 ( 又 称清晰度) 和自然度1 2 9 1 两个方面,前者是衡量语音中的字,词和句子的可懂程 度,后者则是对讲话人的辨别。其评定方法可分为主观评定和客观评定。 主观评定方法是基于统计的手段,由不同的实验者组成评测小组,让他们 根据自己的感觉进行评测,然后对大量评测结果进行综合平均得到评分。主观 评价方法符合人类听话时对语音质量的感觉,得到广泛的应用,尤其对编码速 哈尔演理t 人学t 学硕i 。学位论文 率低于1 6 k b i t s 的编解码器舯i 。根据评测的侧重点不同,有不同的主观评定标 准,国际通常采用的有:m o s 得分( m a i no p i n i o ns c o r e ) 、d r t ( d i a g n o s t i c r h y m e rt e s t ) 和d a m ( d i a g n o s t i ca c c e p t a b i l i t ym e a s u r e ) 等。其中,最常用的 是m o s 得分。 m o s 得分采取五级评分标准,如表2 1 所示。通常得分在4 o 4 5 之间为 高质量语音,符合长途通信要求:3 5 为通信质量,这时会感觉到语音质量有 所下降,但不足以妨碍正常的通信,一般的语音编码算法的m o s 分应不低于 3 o 分。 表2 - 1m o s 评分标准 1 b b i e 2 1m o sc r i t e r i a m o s 削分质龋级荆火真级别 5 优不易察觉 4 良 刚有察觉 3 可有察觉且稍觉可厌 2 差明显察觉且可厌但可忍受 1坏 不可忍受 客观评定方法主要是使用测试仪器和设备,参照测试标准,测试原始语音 与重建语音的某些参数,差值越大说明重建语音质量越差,反之越好。客观评 定的参数通常选择s n rf s i g n a lt on o i s er a t i o ) 、s e g s n r ( s e g m e n ts n r ) 、 p s q m ( p e r c e p t u a ls p e e c hq u a l i t ym e a s u r e ) 、i i ( i n f o r m a t i o ni n d e x ) 和 c d ( c e p s t r u md i s t a n c em e a s u r e ) 等。这种方法的优点是参数的差值可以通过客 观度量获得,计算简单,对于编码速率高于1 6 k b i t ,s 的编解码器比较有效,但 不能完全反映人本身对语音质量的感觉,对低速率语音编码的测定尚不能做到 十分全面和有效f 3 l i i ”i i ”i 。 2 编码速率 编码速率是语音编码另一个非常重要的方面,一般用比特秒( 即b i t s ) 来 度量,代表了编码的总速率,其大小与采样频率和每个样点编码的位数有关, 与重建语音质量相互矛盾,即编码速率越高,语音波形或参数量化就越精细, 语音质量越好,但对传输带宽或存储容量的要求越高,相反,编码速率较低, 对传输带宽或存储容量的要求越低,但语音质量较差。因此,一般在选择编码 器时要对语音质量和编码速率两个重要因素进行折中处理。 3 、算法延迟 哈尔演理t 人学丁学硕i 。学位论文 算法延迟也是编解码器性能的一个重要因素,一般可分为三种类型:一是 由于编解码过程产生的运算延迟,主要由算法复杂度决定;二是依赖于硬件速 度的处理延迟;三是通信延迟。这三类延迟的总和称作“单向系统延迟”,在 没有回声的情况下,4 0 0 m s 是可以容忍的最大单向系统延迟i ,否则就会明 显感到反应“迟钝”。延迟影响语音质量的另一个因素是回声,它会影响到通 信质量中的清晰度,一般应采用回声抵消和抑制措施。 以上三个因素密切联系,相互制约,在实际中应根据不同的应用场合侧重 不同的因素,而其他因素可以适当放宽要求。 2 6 本章小结 本章在分析和总结大量相关技术资料的基础上,主要介绍了语音信号产生 的数字模型的产生过程,语音编码的三种编码,并比较了每种编码的优缺点, 接着详细地介绍了矢量量化技术和码激励线性预测技术的原理,为下一章深入 分析和研究c s a c e l p 算法提供理论基础。最后对衡量语音编解码性能的标准 做了详细地介绍,为最后对实验结果的语音评测提供理论依据。 哈尔滨理t 大学t 学硕i 学位论文 第3 章g 7 2 9 语音编解码算法原理 3 1 概述 g 7 2 9 是对电话带宽语音信号进行编码的标准,对输入的模拟语音信号用 8 k h z 采样,l6 b i t 线性p c m 量化。其基本算法c s a c e l p ( c o n j u g a t e s t r u c t u r e a l g e b r a i c c o d e e x c i t e dl i n e a r - p r e d i c t i o n ) 是基于c e l p 的编码模式,帧长为 1 0 r e s ,对应于8 k h z 抽样频率的8 0 个语音样点。对每个帧长为1 0 m s 的语音信 号,先提取出c e l p 模型参数,包括线性预测滤波器系数、自适应和固定码本索 引和增益,然后将这些参数编码发送,参数编码的比特分配如表3 1 所示。在 解码端,把收到的比特流恢复成参数编码,解码后得到各个参数,用自适应码 字序号从自适应码本序号中得到自适应码矢,用固定码矢序号从固定码本中得 到固定码矢,分别乘以它们的增益按点相加后构成激励序列。用线性预测滤波 器系数构成合成滤波器。用所谓的自适应码本方法实现长时或基音合成滤波, 计算出合成语音后,用后置滤波器进一步增强音质。 表3 - 18 k b i t sc s a c e l p 算法比特分配( 1 0 m s 帧) t a b l e 3 1b i ta l l o c a t i o no f t h e8 k b i “sc s - a c e l pa l g o r i t h m ( 1 0 m sf r a m e ) 参数码字子帧l子帧2每帧总数 线谱对 厶,厶,厶,厶 1 8 自适应码本时延 墨,最 851 3 基音时延奇偶校验 晶 l1 固定码本位置 c i ,c 2 1 31 32 6 固定码本符号 s ,是 448 码本增益( 阶段1 ) g a l ,g 4 3 36 码本增益( 阶段2 ) g 且,g 岛 448 总计 8 0 3 2 g 7 2 9 编码器的基本原理 如图3 一l 为g 7 2 9 编码原理框图。输入信号先通过高通滤波预处理,每 1 0 m s 帧进行一次l p 分析,计算l p 滤波器系数,这些系数转化为线谱对( l s p ) 哈尔滨理t 大学t 学硕 。学位论文 并用两段1 8 b i t 矢量量化。激励信号经合成滤波器后生成重构信号,与输入信 号相减得到残差信号,该残差信号经知觉加权滤波器处理,根据听觉感受改变 频谱,反馈回控制回路,通过使加权残差信号均方差最小的原则确定激励信号 及其增益,知觉加权滤波器也是根据预测分析所得的l p c 信息构造的。基音 分析模块通过自相关分析得到基音周期,据此信息搜索自适应码本,确定最佳 自适应码本矢量,得到语音中具有准周期特性的激励。然后再搜索固定码本, 根据最小化加权均方差准则确定最佳固定码本矢量,得到语音模型的随机激励 信号。最后确定两个码本矢量的增益e 和g ,采用具有共轭结构的两级码书进 行矢量量化。上述过程确定的线性预测编码信息( 线谱频率l s n 、自适应码本 矢量、固定码本矢量和增益构成完整的g 7 2 9 声码器编码器参数。所有这些参 数均以码本索引的形式发往接收端。 图3 - 1c s - a c e l p 编码器原理图 f i g 3 - 1e n c o d i n gp r i n c i p l eo f t h ec s - a c e l pe n c o d e r 哈尔滨理工夫学丁学硕 :学位论文 3 2 1 预

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论