(通信与信息系统专业论文)关于gsm半速率语音编码算法的研究.pdf_第1页
(通信与信息系统专业论文)关于gsm半速率语音编码算法的研究.pdf_第2页
(通信与信息系统专业论文)关于gsm半速率语音编码算法的研究.pdf_第3页
(通信与信息系统专业论文)关于gsm半速率语音编码算法的研究.pdf_第4页
(通信与信息系统专业论文)关于gsm半速率语音编码算法的研究.pdf_第5页
已阅读5页,还剩49页未读 继续免费阅读

(通信与信息系统专业论文)关于gsm半速率语音编码算法的研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

上海交通大学 学位论文版权使用授权书 本学位论文作者完全了解学校有关保留、使用学位论文的规定, 同意学校傈馨并向国家裔关部f j 或机构送交论文的复印件和电子舨, 允许论文被查阕和借阕。本人授权上海交通大学可以梅本学健论文的 全部或部分内容编入有关数摄库进罨亍梭索,可以采用影e f 】、缩印或捉 搐等复剑手段保存和汇编本学位论文。 保密口,在牟解密后适用本毅权书。 本攀位论文属予 不俣密醴。 ( 请在以土方框内打“4 ”) 学位论文作者签名: 桫 霞期:一年厂局矿驴甾7 豢一 7 僻钽一 鼹甥;戈二2 年r 月二粤b 上海交通大学上 母父逋大芋 学位论文原创性声明 本人郑重声明:所呈交的学位论文,是本人在导师的指导下 独立进行研究工作所取得的成果。除文中已经注明引用的内容外,本 论文不包含任何其他个人或集体已经发表或撰写过的作品成果。对本 文的研究做出重要贡献的个人和集体,均已在文中以明确方式标明。 本人完全意识到本声明的法律结果由本人承担。 学位论文作者签名: 批 日期:、,n 年r 月扩百 关于g s m 半速率语音编码算法的研究 _ _ _ 一 摘要 i 适童匡塑堇盔在各类语音处理系统中得到广泛的使用。现代压缩技 术大多数是基于合成分析法。随着全球移动通讯系统g s m 在世界各地的 发展,围绕着g s m 系统的语音压缩编码技术也得到了不断的发展。g s m 系统的容量正在扩大,原来1 3 k b p s 的全速率语音编码已经不能满足要求。 为此提出了5 6 k b p s 的半速率编码。g s m 半速率编码算法可使g s m 系统的 容量增长一倍,该语音编码已经成为欧洲电信标准( e t s i6 2 0 ) 。g s m 半7 速率编码算法采用全新的语音编码技术,体现了语音编码的最新成果。, 本文首先介绍了g s m 系列中的各种编码算法f r ,e f r 和a m r 。从 实际应用要求出发,本文详细地描述了e t s i6 2 0g s m 半速率编码的算 法及实现。g s m 半速率编码算法属于矢量和激励线性预测v s e l p 。本文 作者对v s e l p 算法中的线性预测分析,分帧方法,基音周期提取,语音 合成,激励源码本构成,主观听觉加权滤波器和前置后置滤波器等进行 了分析。然后针对e t s i6 2 0g s m 半速率编码标准对软件实现中语音信 号的缓存,声道参数量化方法,激励源码本快速搜索方法,语音能量量 化方法和基音周期提取进行了研究。最后介绍了在b c m i5 0 0 芯片上实现 g s m 半速率编解码算法及其编码方法的过程。简要地介绍了b c m l 5 0 0 的 特殊结构和软件优化方法。通过对g s m 半速率编码软件的多次运行统计 ,确定优化重点,对整个实现软件中耗时最大的数学运算部分作了全面 的手工汇编优化。将执行速度提高了3 2 倍。软件优化以后对所有的测试 矢量进行测试,全部都与测试要求一致。 关键词g s 滟,v 7 。蕊n g ,b c 赢 共5 6 页第3 页 a s t u d y o ng s mh a l fr a t e s p e e c hc o m p r e s s i o n a l g o r i t h m a b s i 融k c t s p e e c hc o m p r e s s i o nt e c h n o l o g yh a sb e e nw i d e l yu s e di nv a r i o u ss p e e c h p r o c e s s i n gs y s t e m s m o s t n l ( 证i e r ns p e e c h c o m p r e s s i o nt e c h n o l o g y i sb a s e do n a n a l y s i sb ys y n t h e s i sm a c h e n i s m g s ms p e e c hc o m p r e s s i o nt e c h n o l o g yi su n d e r f a s t d e v e l o p m e n t w h e n g l o b a lm o b i l es y s t e m i sw i d e l yd e p l o y e d w o f d w i d e o r ! i g i n a l 1 3 k b p sf u l lr a t es p e e c hc o m p r e s s i o ni su n a b l e t om e e t e x p l o s i v e d e m a n do ng s m c a p a c i t y 5 6 k b p sh a l f r a t es p e e c h c o m p r e s s i o na l g o r i t h mi si n v e n t e d t oa d d r e s st h i s i s s u e g s mh a l f r a t es p e e c h c o m p r e s s i o na l g o r i t h m d o u b l e sg s m s y s t e mc a p a c i t y w i t i l 叫te x t r ai n v e s t m e n t t h i sa l g o r i t h mh a sb e e na p p m v e d b ye u r o p e a n t e l e c o m m u n i c a t i o ns t a n d a r di n s t i t u ea se t s i6 2 0 g s mh a l fr a t es p e e c h c o m p r e s s i o na l g o r i t h ma d o p t sl a t e s ts p e e c hc o m p r e s s i o nt e c h n o l o g ya n da c h i e v e s h i g h e rc o m p r e s s i o n r a t i o t h i st h e s i sf i r s ti n t r o d u c e sd i f f e r e n t s p e e c hc o m p r e s s i o n s t a n d a r di ng s ms e r i a l s u c ha sf r , e f ra n da m r g i v e nr e a la p p l i c a t i o nr e q u h n 艟n t ,t h i sa r t i c l ed e s c r i b e s e t s i6 2 0g s mh a l fr a t es p e e c he n c o d i n g a l g o r i t h ma n di m p l e m e n t a t i o ni nd e t a i l g s mh a l fr a t es p e e c h c o m p r e s s i o na l g o r i t h mb e l o n g s t ov e c t o rs u me x c i t e dl i n e a r p r e d i c t i o n ( v s e l p ) t h ea u t h o r s t u d i e sl i n e a rp r e d i c t i o na n a l y s i s ,f l a m i n g ,p i t c h e s t i m a t i o n ,s p e e c hs y s t h e a i s ,e x c i t a t i o nc o d e b o o k a r t h i e t e c t u r e ,p e r c e p t u a lw e i g h t i n g f i l t e r , p i t c hp r e f i l t e ra n ds p e c t r a lp o s tf i l t e ra d o p t e d i nv s e l p a l g o r i t h m t h e nt h e a u l h o rs t u d i e ss p e e c h b u f f e r i n g ,v o i c ep a r a m e t e rq u a n t i z a t i o n ,e x c i t a t i o nc o d eb o o k f a s ts e a r c h ,v o i c ee n e r g y q u a n t i z a t i o na n dp i t c he s t i m a t i o nm e t h o ds p e c i f i e d i ne t s i 6 2 0 f i n a l l y t h i st h e s i si n t r o d u c e si m p l e m e n t a t i o no fg s mh a l fr a t es p e e c h c o m p r e s s i o na l g o r i t h m o nb c m l 5 0 0 a u t h o r b r i e f l yd e s c r i b e ss p e c i a lh a r d w a r e a r e h i e t e c t u r eo r lb c m i s 0 0a n ds o f t w a r eo p t i m i z a t i o nr a e t h o d a f t e rt h r o u g h b e n c h m a r ko ng s mh a l fr a t es p e e c hc o m p r e s s i o ns o f t w a r e ,s u b r o u t i n e sw h i c h c o n s u m l 七sm o s tp r o c e s s i n gc a p a b i l i t yi si d e n t i f i e da n dr e p l a c e db y h a n d w r i t t e n a s s e m b l y t h eo p t i m i z a t i o ni n c r e a s e ss p e e du p t o3 2t i m e s t h es o f t w a r eh a sb e e n t e s t e da g a i n s t t e s t i n g v e c t o r sa n dt h er e s u l tm a t c h e sa l lt e s t i n gr e q n i r m e n t s 麸5 6 页,第4 页 k e yw o r d s :g s m h r ,v s e l p ,s p e e c hc o d i n g ,b c m l 5 0 0 共5 6 页,第5 页 上湟交通太堂亟堂焦j 金塞 图1 1g s me f r 的原理框图 图1 2g s me f r 的原理框图 图2 1语音压缩编码合成分析法原理图 图2 2线性预测误差滤波 图2 3g s m 半速率编码器的原理框图 图2 4g s m 半速率解码原理框图 图2 5加权滤波器与语音频谱之间的关系 图3 1g s m 半速率语音编码技术中的编码部分 图3 2g s m 半速率语音编码技术中的解码部分 图4 1b c m l 5 0 0 的内部结构模块一 图4 2语音处理卡的结构示意图 图4 3 g a t e w a yx c h a n g e 软件的总体框架 图4 4语音编码的实现 图4 5语音解码的实现一 图4 6g s m 半速率编码算法的c 语言结构 图4 7 a浊音语音编码前的时域波形一 图4 7 b浊音语音编码后的时域波形一 图4 8 a浊音语音编码前的频谱 图4 _ 8 b浊音语音编码后的频谱 图4 9 a清音语音编码前的时域波形 图4 9 b清音语音编码后的时域波形 图4 1 0 a清音语音编码前的频谱 图4 1 0 b清音语音编码后的频谱 表3 1以帧速率刷新的参数 表3 2清音情况下以子帧速率更新的参数 表3 3浊音情况下以子帧速率更新的参数 表3 4g s m 半速率编码算法允许的基音周期值 表4 】未经优化的程序运行性能 表4 2经c 编译器优化的程序运行性能 表4 3经手工汇编优化的程序运行性能 表4 4未经优化的程序代码长度 表4 5经c 编译器优化的程序代码长度 表4 6经手工汇编优化的程序代码长度 共5 6 页,第8 页 n n巧协丝斟拍儿弛弘鲳勰的柏甜耜勰锣如姐兜 凹如筘私“驱非拍稻 缩略语和符号说明 代数码激励线性预测 自相关定点格型技术 自适应多码率编码 码激励线性预测 信号处理器 非连续传输 增强全速率编码 欧洲电信标准委员会 全速率编码 全球移动通讯系统 半速率编码 长时预涌 多脉冲激励线性预测 普通脉冲激励线性预测 矢量和激励线性预测 共5 6 页第9 页 思尝熙嚣嚣搿一 第一章语音压缩技术绪论 随着当今世界数字技术的飞速发展,数字业务急剧增长。话音业务开始从 公众电话网中延伸到包交换网络中。数字化语音以及语音的各种编码方式也随 之涌现。国际电信联盟为此制定出若干国际标准如g 7 2 8 ,g 7 2 9 ,g 7 2 3 1 等 ,并且已获得了广泛的应用。 移动通讯是当今最为热门的技术之一。第一代的模拟移动通讯技术已经被 淘汰。第二代g s m 全球移动通讯系统得到了高速的发展,中国目前是全世界手 机用户最多的国家之一。在第二代g s m 系统中,语音压缩采用e t s i 规范的全速 率编码( f r ) ,增强全速率编码( e f r ) 和半速率编码( h r ) 。现在移动通 讯正在向第听代系统发展,语音编码将采用更为高效和优质的自适应多速率编 码( a m r ) 技术。 本章首先介绍语音编码技术的基础知识包括语音产生模型,听觉掩蔽效 应以及量化编码方法。然后对g s m 中广泛使用的全速率编码,增强全速率编码 和自适应多速率编码作了简要的描述。 1 1 语音编码基础 1 1 1语音的产生 当语音产生时,气流首先从肺部出来并经过胭喉进入声道。然后通过声道 经嘴屠辐射,咽喉处的声带根据开合情况可以部分或全部阻碍气流的通过,从 而产生激励。 如果声带的开合是有周期性的,则表现为激励也是周期的。相应于声带开 合一个周期的激励波形也称为声门脉冲或基音脉冲。由于人在发音时声带的 开合是可以变化的,对应于基音脉冲的长度和形状也可以不断变化,从而激励 波形具有准周期性。声带开合的周期称为基音周期,其倒数为基音频率。基音 频率随讲话者和讲话内容而变化。一般男性的基音频率较低,其范围为6 0 一 2 0 0 h z ,而女性和小孩的基音频率较高,范围为2 0 0 - - 4 5 0 h z ,这类音还常称 为有声音或浊音。 如果气流经过声带时,声带不发生周期性的开合,则激励波形不表现出周 期性。这时的激励实际上是一种无序的噪声。这类音通常称为无声音或清音。 语音产生的时域性质表现到频域时就是浊音信号的频谱具有明显的谱振结 构,谱振频率对应于声带开合的基音频率。而清音信号不存在谱振结构,其频 谱非常类似于白噪声谱。激励不存在明显的包络,语音信号的谱包络是激励通 共5 6 页,第l o 页 过声道的结果。由于声道的频率响应不平坦,因此会在相邻的语音信号之间引 入一定的相关性,这种相关性称为短时相关性。同时,在浊音时,由于激励信 号的准周期特征又会导致相邻基音脉冲中对应样点之间的相关性。这种相关 性称为长时相关性。在频谱上,短时相关性对应信号的谱包络,而长时间相关 性对应于谱的精细结构。这两种相关性都会在语音信号间引入冗余度。语音编 码技术一般都会采用各种合理的方法来去除这些冗余,从而达到语音压缩的目 的。常用的方法有线性预测,l p c 分析,基音预测嚣等。 根据以上分析,一个简单的语音产生源波滤模型,如图1 1 所示。该模型在 实际应用时往往将声门脉冲模型,声道响应和辐射效应结合起来,用一个时变 滤波器表示。 图1 1g s me f r 的原理框图 1 1 2听觉掩蔽效应 听觉系统的掩蔽效应可以分为时域和频域两种。时域掩蔽又可以分为同步 掩蔽和异步掩蔽。同步掩蔽效应指两种高、低能量声音同时发生时,高能量声 音容易掩蔽低能量声音。异步时域掩蔽效应是因为人耳感知是一个逐步积累的 过程,当一个高能量声音结束后对人耳感知的影响还将持续一段时间,从而 对其后的低能量声音造成掩蔽。人耳对各种频率声音的感知都有一个阀值,即 听阀。只有当某个频率声音的能量超过其听阀时,该声音才能被感知。人耳的 听阀是动态的。当某个声音存在时,会影响其附近频率的听阀值从而造成掩 蔽效应。现在大多数语音编码算法中会利用同步掩蔽效应。 1 1 3量化 语音信号的许多特征参数和波形在进行编码前必许先进行量化,因此量化 是语音编码器中必不可少的一个组成部分。在语音编码中有时参数的编码值 等于其量化值。而在更多的情况下,编码值只对应参数量化值的一个索引。一 共5 6 页,第1 1 页 般,量化是对某个参数或矢量的低精度表示。原始值与量化值之间的差值就是 量化噪声。量化的方法可以分成标量量化和矢量量化。 标量量化: 如果每次量化只对一个参数进行。这种量化方法成为标量量化。此时该参 数由一组离散值即量化等级中某个最接近的值表示。均匀量化时,各量化等级 之间的间隔相等。只有当参数具有均匀概率密度分布时,均匀量化才能获得最 佳性能。一般每增加1 个量化比特可以提高6 d b 的量化信噪比。当参数分布非均 匀时,需要采用非均匀量化方法,如对数量化等。 矢量量化: 如果量化对一组变量进行,这种量化称为矢量量化( v q ) 。矢量量化是从 一组矢量中选出一个与待量化矢量距离最接近的矢量作为其量化值。这一组矢 量构成一个码本,编码值即为该矢量在码本中的索引值。矢量量化最关心两个 基本点指标,码体的存储量和码本搜索的计算量。为找到距离最近的矢量需要 对码本中所有的矢量进行比较,计算量较大。如果码本本身的结构具有某种有 序性,则可以减少搜索的计算量。采用哪种码本结构与特量化的矢量的性质有 关。比如在量化表征声道特征的l p c 参数时,分裂矢量量化是一种常用方案。 而在量化激励源信号时,多采用增益一波形矢量量化,或多级矢量量化。 1 2g s m 语音压缩编码 1 2 1全速率稿码( f u l lr a t e ) g s m 全速率编码算法e t s ig s m0 6 1 0 ( g s mf r ) 在全世界的移动电话网中 咀及在低速率的数据通信中存在广泛的应用g s m 全速率编码算法将6 4 k b p s 的 语音压缩至1 3 k b p s ,语音采样率为8 k h z 。g s m 全速率算法是一种r p e ( r e g u l a rp u l s ee x c i t e d 即规则脉冲激励) 算法。语音首先被分割成长度为2 0 m s 的连续语音帧。对每一帧语音数据计算一组8 个短时预测系数。每帧进一步分割 成5 m s 长度的子帧,对每一子帧计算一个延迟( 或音基周期) 以及长时预测增益。 最后对经过长时及短时预测滤波的残留信号进行量化编码。这种g s m 全速率编 码算法语音质量接近于g 7 2 8 而且实现起来相对比较简单,不需要d s p 等特殊的 硬件支持就可以做到实时实现。 1 2 2增强全速率螭码( e n h a n c e df u l lr a t e ) e t s is m g 1 l 在1 9 9 6 年制定了e f r ( e n h a n c e df u l l r a t e 即全速率编码算 法) 。这个算法被确定为e t s ig s m0 6 6 0 ( g s me f r ) 。其目的是为了在全速 率g s m 通道上进一步改善语音质量。这个算法是从g s m 全速率编码算法中发展 共5 6 页,第1 2 页 出来的。增强全速率编码算法是第一个在无线通道上提供有线语音质量的编码 算法。这个算法采用a c e l p 方式,压缩语音速率为1 2 2 k b p s 。由于采用了新的 编码技术。g s m 增强全速率编码算法相比较g s m 全速率算法复杂得多。图1 2 是g s me f r 的原理框图。g s m 增强全速率编码算法的特点是: 1 ) 在语音输入端采用了高通滤波器咀抵消直流产生的偏置效应。 2 ) 每一个语音帧,即每2 0m s 进行一次线性预测分析。这样每一个语音帧 就有2 组1 0 阶线性预测滤波参数。这些参数然后转化成线谱对l s p l i n es p e c t r u mp a i r s 再进行量化。 3 ) 每一个语音帧,即每2 0m s 进行一次开环延迟( 或基音周期) 搜索,从而 产生一组可能的延迟值。 4 ) 闭环延迟搜索是在5m s 的子帧中咀开环搜索的结果为基础进一步逼近 正确的延迟值。延迟的精度可以达到采样闻隅的1 6 ,而不必是整数。 同时,g s m 增强全速率编码算法中引入了一个虚拟延迟的概念。即允许 延迟值可以不到子帧的长度,然后对第一个子帧的延迟值进行量化。其 余子帧则是对相对于对前一子帧的延迟值的差进行量化。 图1 2g s me f r 的原理框图 5 ) 延迟的定义是在一个连续信号中两个长时周期之间的采样点数。在g s m 增强全速率编码中,延迟的取值范围在1 8 到1 4 3 之间,对应为5 6 到 4 4 4h z 。l t p 的精度也因为采用分数延迟值而得到提高。 共5 6 页第1 3 页 6 ) 假如延迟值比子帧长度更小就需要采用虚拟延迟的概念。因为在解码器 中只有过去的采样值可以使用。虚拟子帧可以提高对女声或孩童声音的 质量。 7 ) g s m 增强全速率编码算法采用a c e l p ( a l g e b r a i cc o d ee x c i t e d l i n e a rp r e d i c t i o n 即代数码激励线性预测算法) 。激励源码本采用代数 码本。激励源由1 0 个非零脉冲组成长度为一个子帧,即4 0 个采样点。 8 ) 合成滤波器包括主观加权滤波器。 1 2 3自适应多速率糖码( a d a p t i v em u l t i - r e t e ) e t s ig s m0 6 7 0 ( g s ma m r ) 是一种可变速率语音编码方式。可变速 率语音编码方式在以包传递的网络中是非常合适的e t s i 自适应多速率 a d a p t i v em u l t i r a t e ( a m r ) 源自于e f r ,同时增加了新的编码方法和半速率 编码算法以提高抗错性能以及增加网络的容量。g s m 自适应多速率算法将 8 k h z 采样的线性p c m 语音信号根据信道质量白适应地压缩到8 种速率中的一种 这8 种速率是1 2 2 0 0 k b p s ,1 0 2 k b p s ,7 9 5 0 k b p s ,7 4 0 0 k b p s ,6 7 k b p s , 5 9 k b p s ,5 5 k b p s 和4 7 5 k b p s 。g s m 增强全速率编码是自适应多速率中最高速 率的编码方式。a m r 算法属于a c e l p 的一种。 大多数现有的g s m 语音压缩编码方法包括全速率编码增强权速率编码和半 速率编码都是固定码率的编码方式。信道纠错冗余也是以固定码率的方式加入 到语音编码中。这种方式是在最佳条件下的编码性能与信道冗错之间取得一个 平衡。而自适应多速率编码方式则是充分利用信道的传输质量自动地调整编码 速率,在性能和冗错之间取得一个动态的平衡。自适应多速率编码方式可以在 全速率信道以及半速率信道中使用。半速率编码是在g s m 半速率编码之上发展 起来具有更好的语音质量。 共5 6 页第1 4 页 第二章g s m 半速率语音编码技术 2 1概述 现在流利的语音压缩编码方式基本上属于合成分析法。图2 1 是这种方法的 原理图。根据台成激励源的波形不同可以简单地分成多脉冲激励法 m p e ( m u l t i - p u l s ee x c i t e dl i n e a rp r e d i c t i o n ) ,规则脉冲激励法r p e ( r e g u l a r p u l s ee x c i t a t i o nc o d e r s ) 和码激励线性预测c e l p ( c o d ee x c i t e dl i n e a r p r e d i c t i o n ) 图2 1语音压缩编码合成分析法原理图 短时线性预测主要是用于提取语音的信道参数。人在说话时,语音信号是 随时间变化的,但是在一定的时间内又是平稳的。所以现代语音信号处理技本 采用短时加窗处理方式。通过加一个短时窗口函数,利用成熟的信号处理方法 来处理这种时变信号。 长时线性预测则是用于提取基音周期或在某些压缩算法中称为延迟l a g 。 每个人在说话的时候,声带的振动使得发出的语音信号带有明显的周期性特性 。从人的发声模型来看,声带的振动就是激励源。由于声带振动通常维持较长 的时间,至少为一个元音音节,所以信号处理时的窗口函数也应该相应地比较 长。所咀称为长时预铡。 共5 6 页,第1 5 页 激励源主要是通过闭环反馈或合成分析法来进行提取的。从图2 1 中可以看 到,一个激励源在经过短时滤波和长时滤波以后得当合成语音信号。这个台成 语音信号与原始语音信号的差经过一个主观加权滤波器以后计算均方差作为衡 量激励源与真实情况的近似程度。这种方法实际上构成了一个闭环反馈通道, 所以采用这种方法进行激励源匹配的方法称为合成分析法。 v s e l p ( v e c t o rs u m e x c i t e dc o d e r 即矢量和激励编码器) 与c e l p ( c o d e e x c i t e dl i n e rp r e d i c t i o n 即码激励线性预测) 之间的主要差别在于激励源产生 方法的不同。c e l p 是直接对预测残罾误差进行量化编码。而v s e l p 则是通过 几个激励矢量之和来逼近真实的激励源。 g s m 半速率语音编码器是属于一种v s e l p 。v s e l p 技术是从c e l p 技术中 推广出来。c e l p 自从1 9 8 5 年由b a t a l 提出以后,在中低速率语音编码器中被 证明是非常有效的。尤其是针对1 6 k b p s 到4 k b p s 之间的语音压缩编码。这种编 码技术由两个部分组成,语音分析技术和语音合成技术。 语音分析是对输入的语音信号进行分折,提取一些相应的语音( 或声道) 特征 参数,然后对这些参数进行编码,从而实现压缩的目的。压缩后的编码码字可 咀用于存储或传输。语音分析通常又被称为编码。 语音合成则是利用经过压缩量化以后的特征参数重新合成一个语音信号。 这个语音信号在听觉上应尽可能地与原始语音相一致。语音合成通常又被称为 解码。 2 2 帧与子帧 语音信号是时变信号,但是语音信号又在一段较短的时间内保持平稳。所 以简单的处理方法就是给语音信号加上一个短时时间窗口函数。这样就可以使 用现有的比较成熟的信号处理方法来处理比较复杂的时变语音信号。从编码质 量考虑,希望帧长度越短越好,以提高时域分辨率而从编码压缩考虑则希望 有较长的帧尺寸以提高信号的谱精度。如果帧尺寸越小,则相邻帧之间的短 时能量变化剧烈,无法体现语音信号的短时平稳特征。相反若帧尺寸过大,则 短时能量将是一段长时间的平均,不能充分反映语音信号的时变特性。为了兼 顾两者同时确保短时谱写的存在在语音编码中一般希望一帧信号包含有两个 左右完整的基音周期。由于语音信号的基音周期随讲话者和讲话内容的不同可 在2 1 6 m s 范围内变化。因此在大多数语音煽解码中为了便于处理及保证稳 定的编码速率,一般选择固定的帧长度为1 0 - - 3 0 m s 。在g s m 半速率编码算法 中采用2 0 m s 帧长度。 g s m 半速率编码算法中还同时采用5 m s 矩形窗。称为子帧。这样一个语音 帧进一步被分割成4 个连续的子帧。语音声道特征参数等每帧计算一次,基音周 共5 6 页,第1 6 页 期( 或延迟) 等参数每子帧计算一次。采用子帧的结构可以在主观昕觉上更精确 的逼近真实语音情况,进一步提高了g s m 半速率编码算法所能够提供的语音质 量。 2 3语音分析算法 语音信息从人体发声的结构来看,主要是通过声腔的共振峰的位置来表现 的所以语音信号在时域上的波形并不是最重要的,而且带有很大的冗余信息 相反语音信号的频谱特性恰恰是表征语音信息最直接,最简单的方式。因此 现在广泛使用的多种语音压缩方法都是通过频谱特征来描述和压缩语音的。 语音信号是一个时变信号,但是在一段时间内又保持平衡。所以一般通过 加窗函数的方式,将语音分割成连续的帧信号。再采用各种信号处理手段进行 短时信号处理,从而得到在宙函数限定的时间段内的短时频谱特性。g s m 半速 率编码算法采用2 0 m s 的矩形宙,通过线性预涮的方法来求得频潜特性。 语音频谱每帧分析一次。分析采用线性预测的方法,然后对得到的频率参 数则进行量化编码。通过线性预测分析得到的参数可以方便地推导出合成滤波 器参数1 a ( z ) 。台成滤波器的参数所表示的频谱恰好是语音信号本身的频谱。 因此语音频谱可以用合成滤波器参数来表示。合成滤波器采用1 0 阶全极点的方 程形式。自从线性预测被用于语音分析之后,这种方法被现代大多数语音压缩 方法所采用。这是因为线性预测算法简单,而且比较真实地反映了人体的发声 原理。它所得到的参数在1 0 阶以上时,可以非常好地代表了语音频谱特征。因 此采用线性预测的方法可以极大地提高压缩比。 2 3 1线性蔼测 线性预测的基本概念是当前的信号值可以由其过去的若干个值的线性组合 来预测得到。信号的逼近过程实际上是个线性预测误差滤波问题,线性预测误 差滤波是一种特殊的数字滤波。它的传递函数a ( z ) 由下式确定: a ( z ) = i - q z ( 2 3 - 1 ) i = i 如图2 2 所示,它的输出e ( n ) 与输入s ( n ) 满足关系: e ( n ) = s ( n ) 一s 【n ) = s ( n 卜艺a i s ( r - - i ) ( 2 3 2 ) i 爿 式中s ( n ) - - q 5 如一i ) 称f l z s ( n ) 的预测值或估计值。因为s ( n ) 由一组过去的样 f 本值s ( n 1 ) ,s ( n 2 ) ,s ( n p ) 线性组合而得,它可看成从s ( n ) 过去的样本值 来预测或估计当前值s ( n ) 的结果,故又称之为线性预测值。a ;则称为线性预测 系数,输出e ( n ) 是真值s ( n ) 和线性预测值s ( n ) 之差称作为线性预测误差。 共5 6 页,第1 7 页 设计一个预测误差滤波器,就是求解预测系数a ;使得预测误差e ( n ) 在某个预定 的标准下最小,这个过程我们称之为线性预测分析。理论上常采用的是均方误 差e i e2 ( n ) 】最小的准则。e 【1 表示对误差的平方求数学期望或平均值。 图2 2线性预测误差滤波 2 3 2声道参数的计算 g s m 半速率编码算法中采用自相关算法计算格型滤波器的反射系数r i ,然 后通过这些反射系数推导出合成滤波器的直接形式系数a 。格型滤波器的特点 是非常稳定,误差不会累计。而且判断滤波器稳定与否的标准也非常简单。 只需要所有反射系数的绝对值小于1 即可即i r i | r “l i - k 1 ) 窗函数的系数为: w ( 0 ) o 9 9 8 9 6 6 w ( 1 ) 0 9 9 6 0 3 7 州2 ) 0 9 9 1 6 6 3 州3 ) 0 9 8 6 3 9 9 w ( 4 ) 0 , 9 8 0 7 2 2 w ( 5 ) 0 9 7 4 9 1 5 w ( 6 ) o 9 6 9 0 5 4 w 门) o 9 6 3 0 6 0 w ( 8 ) 0 9 5 6 7 9 6 w ( 9 ) 0 9 5 0 1 2 7 共5 6 页,第1 8 页 o i , k s n 。 f l a t 采用递归方法计算反射系数。q 表示靳个反射系数,f j ,b j 和q 分别表示前向,反 向和交叉系数。 一, 刍:! ! ! 塑! ! ! :! ! 竺二! :竺二塑 。 一l ( o ,0 ) + b - l ( o ,o ) 十一l ( p l ,n p j ) + 占一( p j ,p 一,) ( 2 3 5 ) f j ( i ,七) = 一。( f ,七) + r j ( c j _ 1 “,t ) + q i ( 豇,f ) ) + 4 b , 一i ( f ) ( 2 3 6 ) b j ( f ,七) = b j l “+ 1 ,七十1 ) 十r j ( c j i ( f + 1 ,k + 1 ) + c j l ( 七十1 ,l + 1 ) ) + ,于f , - l ( f + l ,七+ 1 ) ( 2 3 7 ) c o ,正) = c 卜l ( f ,k + 1 ) + ( 口j l ( f ,j + 1 ) + ,l ( f 七+ i ) ) + r :c j _ t ( 七+ l t j ) ( 2 3 8 ) 其初始条件为: 矗( f 七) = 妒( f k ) 0 f ,k n ,一l ( 2 3 9 ) b o ( i ,t ) = 妒o 十l 。k + 1 ) 0 s i , k ,一l ( 2 3 1 0 ) c ;( f ,七) = 庐,( f ,k + 1 ) 0 0 的点。只有高过门限的 内插点才被认为是更优的估计值内插点的门限要求如等式2 3 2 6 所示。 勰g ( t o 湖( 一警,) 一 1 0 。 删5 l f 毒 ( 2 3 2 6 ) 下一步搜索的对象是当前基音周期的某个基频。即找到的点可能是某个基 音周期的谐波。基于同样的理由,需要检查一下当前延迟值的某个谐波是否具 有更高的c 2 g 值。从而是更好的基音周期预测。判断谐波或基频时都要求该点 的c z g 值超过门限值。 通过开环搜索对于每个子帧都得到了一个相对该子帧而言一个优化的值 。从人体发声原理可知,在有声音或浊音的条件下,相邻帧语音的基音周期是 不可能发生剧烈跳变的。即应该是连续的。所以在一定编码原则的约束下,4 个 子帧的基音周期应该统一到某个值的附近。也就是说4 个子帧的基音周期应该 在一个基音轨迹上。 基音轨迹在搜索时首先从某个子帧开始,以当前子帧的值作为起始点,分 别向前和向后子帧搜索基音轨迹。在向前搜索对,其范围定义在当前基音周期 的7 到+ 6 个允许值之闻。在向后搜索时,其范围定义在当前基音周期的6 到+ 7 个允许值之间。从4 个可能的基音轨迹中找到一个使l t p 预测误差最小的轨迹作 为当前帧的基音轨迹。当前子帧的l t p 预测增益定义为 纠0 1 0 8 1 寸毳 当前帧的l t p 预测增益定义为 共5 6 页第2 1 页 ( 2 3 2 7 ) 只= l o l o g m r ( 0 ,m ) ( 2 3 2 8 ) 闭环搜索是在开环搜索得到的基音轨迹基础之上,在轨迹的上下各一点允 许的值中找到一个在闭环条件下使c 2 g 最小的轨迹。 i n ) 吃雄。 善五“,吒 以一a 一手+ r g = n + l + 三 6 l 一置? ? 1 ( 2 3 2 9 ) 0 n 一l 。 。a = l q _ j = 6 ( 口一k q _ b r l ( n ) 从0 到n s - l 的值需要顺序从0 开始计算,以保证在计算下一点时之前 的值都已经计算好了。闭环搜索的原则是使c 2 ,g 值最小。其中 c = 虻卸) p ( n ) s f f i o 一i g = 虻( 驯 f 2 3 3 0 ) 佗3 3 1 ) 在实用中,所有计算的初始条件都是在每个子帧的开始时置为o 。初始条件 在语音分析中的影响是通过计算合成滤波器的零输入响应减去闭环搜索之前的 加权语音信号来加以体现的。图2 3 表示合成分析法原理。+ o i 忡i 呻- “t 而唔j k 、。一划 q n n 刚 岫口 、1 删1 卜以一,、扎 i 。 铲” 八小i h i ff m o d - i 一 图2 3g s m 半速率编码器的原理框图 共5 6 页,第2 2 页 2 4语音合成算法 在g s m 半速率解码器中语音的台成是将一个具有白色频谱特征的激励源 通过一个语音特征参数滤波器得到的。语音特征参数滤波器的传递函数代表语 音的频谱。这个特征参数滤波器又被称为合成滤波器,用l a ( z ) 表示。g s m 半 速率编码属于一种v s e l p ,它的激励源是多个激励矢量的加权和。激励矢量的 长度相当于一个子帧的长度,加权的权值为该激励矢量的激励增益。g s m 半速 率编码中的激励源采用2 个激励矢量的加权和。相应的,g s m 半速率编

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论