(模式识别与智能系统专业论文)基于mc68hc12的嵌入式语音系统的研究与开发.pdf_第1页
(模式识别与智能系统专业论文)基于mc68hc12的嵌入式语音系统的研究与开发.pdf_第2页
(模式识别与智能系统专业论文)基于mc68hc12的嵌入式语音系统的研究与开发.pdf_第3页
(模式识别与智能系统专业论文)基于mc68hc12的嵌入式语音系统的研究与开发.pdf_第4页
(模式识别与智能系统专业论文)基于mc68hc12的嵌入式语音系统的研究与开发.pdf_第5页
已阅读5页,还剩71页未读 继续免费阅读

(模式识别与智能系统专业论文)基于mc68hc12的嵌入式语音系统的研究与开发.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

华北电力大学硕士学位论文 丫 7 1 3 2 2 4 声明 本人郑 重声明: 所呈交的学位论文, 是本人在导师指导下, 独立进行研究工作所取 得的 成果。 尽我所知, 除文中已 经注明引用的内 容外, 本学位论文的 研究成果不包含任 何他人享有著作权的内 容。 对本论文所涉及的 研究工作做出 贡献的 其他个人和集体, 均 已在文中以明确方式标明。 特此申明。 签名 : f h l 日期:w n s , 关于学位论文使用授权的说明 本人完 全了 解华北电力大 学有关保留、 使用学 位论 文的 规定, 即: 学校有 权保管、并向 有关 部门 送交学位论文的原 件与复印 件: 学校 可以 采用影印、 缩印 或其它复 制手段复制并保存学 位论文; 学校可允许学 位论文被查 阅或 借阅; 学 校可以 学 术交流为目 的 ,复制赠 送和交 换学 位论文;同意学校可以用不同方式在不同媒体上发表、传播学位论文的全部或部分内容。 c 0密的学位论文在解密后遵守此规定) 作者签名: 勤 鱼导 师 签 名 : 人 五 ) 叨 日期:we日期 : - 3 华北电力大学硕士学位论文 摘要 本文主要研究基于单片微处理器的嵌入式语音编码系统。 研究过程中通过对各 种编码算法的对比分析,尤其是对g . 7 2 9 算法的深入分析,拟定了一套基于g . 7 2 9 算法的优化编码方案, 并首先通过v c +编程语言在w i n d o w s 下进行了仿真试验与 分析,证明了编码算法的有效性,论文的最后阶段又采用c 和汇编语言混合编程技 术,在m o t o r o l a 公司的m c 6 8 h c 1 2 处理器平台上实现了g . 7 2 9 压缩算法, 并进行了 优化,通过外扩语音信号放大、滤波电 路和数据存储器,构成了一个完整的高集成 度嵌入式语音编码系统。 最 终实现的语音编码系统其采样频率为8 k h z , 编码速率为 8 k b i t / s , 其带宽约为 4 k h z ,总延时为 1 5 m s ,话音质量达到全质的语音编码国际标 准,可应用于无线移动网、数字多路复用系统和计算机通信系统。 关键词:嵌入式语音编码系统,g . 7 2 9 ,语音编码, m c 6 8 h c 1 2 abs trac t t h e e m b e d d e d s p e e c h s y s t e m b a s e d o n t h e m i c r o p r o c e s s o r c h i p i s r e s e a r c h e d i n t h i s t h e s i s . o n t h e c o n t r a s t o f a l l k i n d s o f t h e s p e e c h c o d i n g , e s p e c i a l l y a n a l y s i n g d e e p l y t h e g7 2 9 , w e s t u d y o u t a s u i t o f s p e e c h c o d i n g o p t i m i z a t i o n s c h e m e o f g .7 2 9 . f i r s t , t h e s c h e m e i s e m u l a t e d a n d a n a l y s e d w i t h d e l p h i p r o g r a m m a b l e l a n g u a g e i n t h e wi n d o w s o p e r a t i o n s y s t e m . t h i s t e s t i f y s t h e v a l i d i t y o f c o d i n g a r i t h m e t i c . t h e m i x e d c o d i n g t e c h n o l o g y w i t h c a n d a s s e m b l e l a n g u a g e i s a d o p t e d i n t h e l a s t s e g m e n t o # t h e s i s , w h i c h a c c o m p l i s h a n d o p t i m i z e t h e c o m p r e s s a r i t h m e t i c o f g .7 2 9 i n t h e m c 6 8 h c 1 2 p e o c e s s e r p l a t f o r m o f mo t o r o l a . t h e c h i p t h r o u g h t h e a m p l i f y e d s p e e c h s i g n a l , f i l t e r c i r c u i t a n d d i g i t a l m e m o r i z e r m a k e u p o f t h e i n t e g r a t e d e m b e d d e d s p e e c h c o d i n g s y s t e m . t h e s p e e c h c o d i n g s y s t e m i s , 8 k h z i n s a m p l e fr e q u e n c y , 8 k b i t / s i n c o d i n g v e l o c i t y a n d a p p r o x i m a t e l y 4 m h z i n b a n d w i d t h . t h e w h o l e d e l a y e d t i m e i s 1 5 m s . i t s q u a l i t y o f v o i c e i n s p e e c h c a n r e a c h t h e s t a n d a r d o f i n t e r n a t i o n a l t o l l - q u a l i t y s p e e c h c o d i n g . t h e s p e e c h c o d i n g s y s t e m c a n a p p l i e d i n w i r e l e s s l o c o m o t i v e n e t w o r k , d i g i t a l m u l t i p l e x i n g s y s t e m a n d c o m p u t e r t e l e c o m m u n i c a t i o n s y s t e m k e y wo r d s : t h e e m b e d d e d s p e e c h s y s t e m , g . 7 2 9 , s p e e c h c o d i n g , mc 6 8 h c 1 2 华北电力大学硕士学位论文 一,. . . . . 叫 . . . , . , . . . . . . .一一-一一-一叫. 一. 一一一一一,- g 第一章 引言 2 1 世纪的通信应在人与人之间、人与机器之间提供高质量的无缝的信息交换手 段。 无论何时、 何地,以任何方式通信, 语音通信将是最基本、最重要的方式之一。 计算机的高速发展即对语音信号数字处理提出了越来越高的迫切要求 ( 如用语音输 入代替键盘以实现直接的人机对话) ,同时也提供了效率不断提高的软、硬件实现 手段。另一方面,语音也是人类赖以进行思维的工具,因此,这一学科与认知科学 和人工智能等研究领域,必然有千丝万缕的联系。语音编码由于数字化的语音传输 和存储,无论在可靠性、抗干扰性、速交换、 易交换和低廉的价格等方面都远胜于 模拟语音。从 5 0年代以来,在通信系统中数字化语音所占百分比不断增加。可以 看到,未来的 i s d n( 综合业务数字通信网) 、卫星通信、移动通信、微波捷列通信 和信息高速公路等系统中无一例外地都采用数字化语音传输和存储。语音编码有了 惊人的发展。最早的标准化语音编码系统是速率为 6 4 k b p s 的p c m波形编码器,到 9 0 年代中期,速率为4 -8 k b p s的波形与参数混合编码器,在语音质量上以逼近目 前前者的水平,且已达到实用化阶段。 1 . 1语音编码技术的现状 ( 1 ) 语音编码技术的研究开始于 3 0 年代d u d d l e y发明声码器,但是直至 7 0 年代中期,除了 p c m 脉冲编码调制)和 a d p c m( 自 适应差分脉冲编码调制)取得 了较好进展之外,中低比 特率语音编码一直没有大的突破。整个语音编码技术领域 在最近2 0 年中发生了一个大的飞跃,自 从美国政府1 9 8 0 年公布了一种2 . 4 k b p s 的 线性预测编码标准算法 l p c - 8 1 0以 后,人们梦寐以 求的在普通电话带宽信道中传 输数字电话的愿望终于变成现实。 众所周知, 数字电 话具有保密性高、容易克服噪 声累计现象、 便于进行程控交换等有点。 但是6 4 k b p s 的p c m , 3 2 k b p s 的a d p c m 要 占用几十千赫信道带宽,都不便于在普通话路中传输。因此语音压缩编码技术一直 是一个令人关注的课题。在众多的声码器中,l p c声码器终因其成熟的算法和参数 的精确估计成为研究的主流,并逐步走向实用。1 9 8 2年,美国国家安全局 ( n s a ) 公布了2 . 4 k b p s 的l p c -1 0 声码器标准 ( f s -1 0 1 5 ) ; 1 9 8 4 年,美国国防部制定了 s t u - ii i 计划, 采用2 . 4 k b p 。 的l p c - 1 0 增强型, 1 9 8 6 年正式投入使用, 这可以说是 5 0 年的研究总结: ( 2 ) 从 1 9 8 5 年,b . s . a t a l 和m . r . s c h r o e d e r 提出了c e l p 算法以来,闭环分 析算法 ( l p a b s )成为主流。除了 p c m , a d p c m , a m ( 增量调制) 、l p c( 线性预测) m e - l p c( 多脉冲激励线性预测编码)声码器之外,美国于 1 9 8 8年又公布了一个 4 . 8 k b p s 的c e l p ( 码激励线性预测编码) 语音编码标准算法, 欧洲电讯管3 ,fp r ( c s m ) 华北电力大学硕士学位论文 一,. . . . . 叫 . . . , . , . . . . . . .一一-一一-一叫. 一. 一一一一一,- g 第一章 引言 2 1 世纪的通信应在人与人之间、人与机器之间提供高质量的无缝的信息交换手 段。 无论何时、 何地,以任何方式通信, 语音通信将是最基本、最重要的方式之一。 计算机的高速发展即对语音信号数字处理提出了越来越高的迫切要求 ( 如用语音输 入代替键盘以实现直接的人机对话) ,同时也提供了效率不断提高的软、硬件实现 手段。另一方面,语音也是人类赖以进行思维的工具,因此,这一学科与认知科学 和人工智能等研究领域,必然有千丝万缕的联系。语音编码由于数字化的语音传输 和存储,无论在可靠性、抗干扰性、速交换、 易交换和低廉的价格等方面都远胜于 模拟语音。从 5 0年代以来,在通信系统中数字化语音所占百分比不断增加。可以 看到,未来的 i s d n( 综合业务数字通信网) 、卫星通信、移动通信、微波捷列通信 和信息高速公路等系统中无一例外地都采用数字化语音传输和存储。语音编码有了 惊人的发展。最早的标准化语音编码系统是速率为 6 4 k b p s 的p c m波形编码器,到 9 0 年代中期,速率为4 -8 k b p s的波形与参数混合编码器,在语音质量上以逼近目 前前者的水平,且已达到实用化阶段。 1 . 1语音编码技术的现状 ( 1 ) 语音编码技术的研究开始于 3 0 年代d u d d l e y发明声码器,但是直至 7 0 年代中期,除了 p c m 脉冲编码调制)和 a d p c m( 自 适应差分脉冲编码调制)取得 了较好进展之外,中低比 特率语音编码一直没有大的突破。整个语音编码技术领域 在最近2 0 年中发生了一个大的飞跃,自 从美国政府1 9 8 0 年公布了一种2 . 4 k b p s 的 线性预测编码标准算法 l p c - 8 1 0以 后,人们梦寐以 求的在普通电话带宽信道中传 输数字电话的愿望终于变成现实。 众所周知, 数字电 话具有保密性高、容易克服噪 声累计现象、 便于进行程控交换等有点。 但是6 4 k b p s 的p c m , 3 2 k b p s 的a d p c m 要 占用几十千赫信道带宽,都不便于在普通话路中传输。因此语音压缩编码技术一直 是一个令人关注的课题。在众多的声码器中,l p c声码器终因其成熟的算法和参数 的精确估计成为研究的主流,并逐步走向实用。1 9 8 2年,美国国家安全局 ( n s a ) 公布了2 . 4 k b p s 的l p c -1 0 声码器标准 ( f s -1 0 1 5 ) ; 1 9 8 4 年,美国国防部制定了 s t u - ii i 计划, 采用2 . 4 k b p 。 的l p c - 1 0 增强型, 1 9 8 6 年正式投入使用, 这可以说是 5 0 年的研究总结: ( 2 ) 从 1 9 8 5 年,b . s . a t a l 和m . r . s c h r o e d e r 提出了c e l p 算法以来,闭环分 析算法 ( l p a b s )成为主流。除了 p c m , a d p c m , a m ( 增量调制) 、l p c( 线性预测) m e - l p c( 多脉冲激励线性预测编码)声码器之外,美国于 1 9 8 8年又公布了一个 4 . 8 k b p s 的c e l p ( 码激励线性预测编码) 语音编码标准算法, 欧洲电讯管3 ,fp r ( c s m ) 华北电力大学硕士学位论文 公布了1 3 k b p s r p 1: =l t p 线性预测语音编码方案。1 9 8 9 年,北美蜂窝电话工业组织 ( c t u a )公布了 工 s -5 4 , 8 k b p s矢量和激励线性预测 ( v s e l p )语音编码方案 ( 日 本:6 . 7 k b p s ) o 1 9 9 2 年,c c i t t 公布了g . 7 2 8 5 . 5 / 6 . 3 k b p s a c e l p / m l q 短时延码激 励线性预测语音编码 ( l d - c e l p ) 方案,1 9 9 6 年公布了g . 7 2 9 8 k b p s c s - a c e l p 对 结构代数码激励的语音编码标准。 欧洲推出了一个1 6 k b p s 的规则脉冲激励线性预测编码算法, 其语音质量都能达 到高音质, 而不再像单脉冲l p c 声码器的输出语音那样不大乐于为人们所接受。 1 9 9 0 年国际海事卫星组织 ( i n m a r s a t )又公布了4 . 1 5 k b p s 改进型多带激励 ( m b e )编码 标准。这些算法都可以用单片数字信号处理器实时实现,目 前正努力进一步减小时 延,在移动通信中得到了 广泛应用。 语音编码产品化的过程比 语音识别来得容易, 因此其研究成果能很快转向实际应用,对通信事业的发展起了重要的推动作用。 ( 3 )近年来随着第三代移动通信的发展,变速率语音压缩编码技术相应得到发 展。 为了充分利用c d m a 技术, q u a l c o m m 于1 9 9 3 年提出了可变速率的c e l p ( q c e l p ) e 这 种 技术已 成 为 北 美 数 字蜂 窝 通 信标 准( c t i a - i s 9 5 ) o 1 9 9 9 年公 布 的 第三 代 伙 伴 计划 ( 3 g e n e r a t i o n p a r t n e r s h i p p r o j e c t ) 把自 适应多速率 ( a m r )语音编解码 作为主要技术。 采用语音激活技术 ( v a d ) 、 舒适背景噪声 ( c n a ) , 源控速率 ( s c r ) , 重帧及误码消除 ( e c u ) 、抗稀疏处理等先进技术. ( 4 ) 高保真音频信号压缩编码,即带宽1 5 - 2 0 k h : 的家用、专业高保真音响, 包括动画和 h d t v音频以及多媒体系统。目前国际上音频压缩算法主要集中在 i s o - m p e g 音频编码标准。1 9 9 2 年 1 1 月完成了它的第一个标准m p e g -1 e采样率为 3 2 , 4 4 . 1 , 4 8 k h z ,支持单声道模式、立体声模式、双声道立体声模式、联合立体 声模式等 4 种模式, 1 . 2语音编码技术的发展方向 压缩编码的理论基不 努 是仙农 ( s h a n n o n ) 信息论, 它是基于某种统计概率模型来 描述信源的。语音编码面临的问题如下:一是极低数码率,二是低速码率语音编码 合成语音音质要有更好的自 然度,三是声码器在高背景噪声环境下的使用,四是经 多次音频转接仍能正常使用。 语音压缩编码的意义在于去除语音信息中的 冗余度信息,降低传输比特率或存 储空间。 语音信号之所以能进行压缩编码, 主要是利用了 语音信号存在的冗余度, 己 经利用人耳的听觉特性。语音压缩本质上通过识别这些冗余度并设法去掉,语音 信号的冗余度表现在语音信号样本间相关性很强,即语音短时谱不平坦,可用滤 波去除。 浊音语音段具有准周期性。 声道的形状及变化速度有限。 2 , 3 点都可 用分帧处理,利用滤波器参数或谱包络的特性,按帧处理, 通过一定手段去除帧间 华北电力大学硕士学位论文 公布了1 3 k b p s r p 1: =l t p 线性预测语音编码方案。1 9 8 9 年,北美蜂窝电话工业组织 ( c t u a )公布了 工 s -5 4 , 8 k b p s矢量和激励线性预测 ( v s e l p )语音编码方案 ( 日 本:6 . 7 k b p s ) o 1 9 9 2 年,c c i t t 公布了g . 7 2 8 5 . 5 / 6 . 3 k b p s a c e l p / m l q 短时延码激 励线性预测语音编码 ( l d - c e l p ) 方案,1 9 9 6 年公布了g . 7 2 9 8 k b p s c s - a c e l p 对 结构代数码激励的语音编码标准。 欧洲推出了一个1 6 k b p s 的规则脉冲激励线性预测编码算法, 其语音质量都能达 到高音质, 而不再像单脉冲l p c 声码器的输出语音那样不大乐于为人们所接受。 1 9 9 0 年国际海事卫星组织 ( i n m a r s a t )又公布了4 . 1 5 k b p s 改进型多带激励 ( m b e )编码 标准。这些算法都可以用单片数字信号处理器实时实现,目 前正努力进一步减小时 延,在移动通信中得到了 广泛应用。 语音编码产品化的过程比 语音识别来得容易, 因此其研究成果能很快转向实际应用,对通信事业的发展起了重要的推动作用。 ( 3 )近年来随着第三代移动通信的发展,变速率语音压缩编码技术相应得到发 展。 为了充分利用c d m a 技术, q u a l c o m m 于1 9 9 3 年提出了可变速率的c e l p ( q c e l p ) e 这 种 技术已 成 为 北 美 数 字蜂 窝 通 信标 准( c t i a - i s 9 5 ) o 1 9 9 9 年公 布 的 第三 代 伙 伴 计划 ( 3 g e n e r a t i o n p a r t n e r s h i p p r o j e c t ) 把自 适应多速率 ( a m r )语音编解码 作为主要技术。 采用语音激活技术 ( v a d ) 、 舒适背景噪声 ( c n a ) , 源控速率 ( s c r ) , 重帧及误码消除 ( e c u ) 、抗稀疏处理等先进技术. ( 4 ) 高保真音频信号压缩编码,即带宽1 5 - 2 0 k h : 的家用、专业高保真音响, 包括动画和 h d t v音频以及多媒体系统。目前国际上音频压缩算法主要集中在 i s o - m p e g 音频编码标准。1 9 9 2 年 1 1 月完成了它的第一个标准m p e g -1 e采样率为 3 2 , 4 4 . 1 , 4 8 k h z ,支持单声道模式、立体声模式、双声道立体声模式、联合立体 声模式等 4 种模式, 1 . 2语音编码技术的发展方向 压缩编码的理论基不 努 是仙农 ( s h a n n o n ) 信息论, 它是基于某种统计概率模型来 描述信源的。语音编码面临的问题如下:一是极低数码率,二是低速码率语音编码 合成语音音质要有更好的自 然度,三是声码器在高背景噪声环境下的使用,四是经 多次音频转接仍能正常使用。 语音压缩编码的意义在于去除语音信息中的 冗余度信息,降低传输比特率或存 储空间。 语音信号之所以能进行压缩编码, 主要是利用了 语音信号存在的冗余度, 己 经利用人耳的听觉特性。语音压缩本质上通过识别这些冗余度并设法去掉,语音 信号的冗余度表现在语音信号样本间相关性很强,即语音短时谱不平坦,可用滤 波去除。 浊音语音段具有准周期性。 声道的形状及变化速度有限。 2 , 3 点都可 用分帧处理,利用滤波器参数或谱包络的特性,按帧处理, 通过一定手段去除帧间 华北电力大学硕十学位论文 的信息。传输码概率分布不均匀。 1 . 3本文研究的主要内容 对于 工 p网络电话的语音编码方案国际电信联盟 工 t u - t制订了 g . 7 1 1 , g s m , g . 7 2 3 . 1 , g . 7 2 8 , g . 7 2 9 , g . 7 2 9 a 等各对应的算法及速率如表 1 一1所示: 算法g . 7 1 1g s mg . 7 2 8g . 7 2 3 . 1g . 7 2 9g . 7 2 9 . a 标准 p c mr p e - l t p l 0 - c e l p m p c - m l qc s - c e l pc s - a c e l p 制定时间1 9 7 21 9 8 81 9 9 31 9 9 5 1 9 9 51 9 9 6 适应场合 公用通信 网 移 动 通 信 无 线 通 信 视频电话无线、室外、 卫星通信 g . 7 2 9 简化 版,室内 传输率 ( k b i t / s ) 6 41 21 653 / 6 . 388 帧长0 . 1 2 5 / 02 0 / 00 . 6 2 5 / 03 0 / 7 51 0 / 51 0 / 5 单向编码总 延时( m s ) 0 . 2 54 . 01 . 36 7 . 52 52 5 复杂度 ( m i p s ) 043 01 62 01 0 . 5 m o s4 . 34 . i4 . 14 . 14 . 13 . 4 表 1 一1语音编码标准的算法对比 比较以上几种编码标准, 决定采用g . 7 2 9 编码标准。 g . 7 2 9 综合性能适合现代多 媒体通信要求,具有带宽小、算法延时性短、适用范围广的优点。同时可以看出计 算量大, 硬件设备实现比 较难;数据传输率固定, 算法的复杂度约为2 0 - 3 0 m i p s . 但是该算法中的码激励线性预测 c e l p ) 技术计算复杂和数据存储量大等缺陷,我 们在用有卓越运算能力的芯片来实现语音编码算法的同时,进行算法的改进,具有 极大的意义。本文采用 m o t o r o l a公司的 m c 6 8 h c 1 2实现了该语音编码解码算法, 具 有一定的实际意义。 华北电力大学硕十学位论文 的信息。传输码概率分布不均匀。 1 . 3本文研究的主要内容 对于 工 p网络电话的语音编码方案国际电信联盟 工 t u - t制订了 g . 7 1 1 , g s m , g . 7 2 3 . 1 , g . 7 2 8 , g . 7 2 9 , g . 7 2 9 a 等各对应的算法及速率如表 1 一1所示: 算法g . 7 1 1g s mg . 7 2 8g . 7 2 3 . 1g . 7 2 9g . 7 2 9 . a 标准 p c mr p e - l t p l 0 - c e l p m p c - m l qc s - c e l pc s - a c e l p 制定时间1 9 7 21 9 8 81 9 9 31 9 9 5 1 9 9 51 9 9 6 适应场合 公用通信 网 移 动 通 信 无 线 通 信 视频电话无线、室外、 卫星通信 g . 7 2 9 简化 版,室内 传输率 ( k b i t / s ) 6 41 21 653 / 6 . 388 帧长0 . 1 2 5 / 02 0 / 00 . 6 2 5 / 03 0 / 7 51 0 / 51 0 / 5 单向编码总 延时( m s ) 0 . 2 54 . 01 . 36 7 . 52 52 5 复杂度 ( m i p s ) 043 01 62 01 0 . 5 m o s4 . 34 . i4 . 14 . 14 . 13 . 4 表 1 一1语音编码标准的算法对比 比较以上几种编码标准, 决定采用g . 7 2 9 编码标准。 g . 7 2 9 综合性能适合现代多 媒体通信要求,具有带宽小、算法延时性短、适用范围广的优点。同时可以看出计 算量大, 硬件设备实现比 较难;数据传输率固定, 算法的复杂度约为2 0 - 3 0 m i p s . 但是该算法中的码激励线性预测 c e l p ) 技术计算复杂和数据存储量大等缺陷,我 们在用有卓越运算能力的芯片来实现语音编码算法的同时,进行算法的改进,具有 极大的意义。本文采用 m o t o r o l a公司的 m c 6 8 h c 1 2实现了该语音编码解码算法, 具 有一定的实际意义。 华北电力大学硕十学位论文 第二章g . 7 2 9 语言编码解码器工作原理及优化 g . 7 2 9 协议是国际电信联盟( i t u - t ) 在1 9 9 6 年制定的编码速率为8 k b p s 的共 轨结构码本激励线性预测( c s - a c e l p ) 声码器语音编码算法标准, 其带宽约为 4 k h z , 编码速率为 8 k b i t / s , m o s在 4 . 0左右, 话音质量达到全质的语音编码国际标准。 g . 7 2 9 编解码器有较高的带宽利用率且语音质量同3 2 k b i t / s 的a c p c m 算法相当, 所 以被广泛推广应用于 d s v d ,数字卫星系统、电 视会议、可视电话、l p电话及各种 多媒体通信系统中。在这一章中,我们首先讨论语音产生的机理,然后将语音信号 看成是一个线性时变系统在随机噪声和准周期脉冲序列激励下的输出,应用这一方 法就得到了 语音信号的数字模型。在进行系统设计之前,我们主要描述g . 7 2 9 的编 码原理,并在此基础上研究它的系统可实用性,提出一些改进方案以 适用于单片机 m c 6 8 h c 1 2的开发。 2 . 1语音产生的机理 人类的发声过程是由于肺部的收缩,压迫气流由支气管经过声门和声道引起音 频振荡而产生的,其中声道起始于声门处而终止于嘴唇,包括声道起始于声门处而 终止于嘴唇,包括咽喉 ( 连接食道和口) 、口 腔,鼻道则是从小舌开始到鼻孔为止。 当小舌下垂时,鼻道与声道发生祸合而产生语音中的鼻音。发音过程中声道各处的 截面积取决于舌、唇、领以及小舌的位置。声道截面积随纵向 位置而变的函数,称 为声道截面积函数,声道的共振峰特性主要决定于声道截面积函数,声道的共振峰 特性决定所发声音的频谱特性,即音色。 人类发音过程有三类不同的激励方式,因而能产生三类不同的声音,即浊音、 清音和爆破音。当气流通过声门时声带的张力刚好使声带产生较低频率的张驰振 荡, 形成准周期性的空气脉冲, 这些空气脉冲激励声道便产生浊音( v o i c e d s p e e c h ) 或称有声语音。如果声道中某处面积很小,气流高速冲过此处时而产生湍流,当气 流速度与截面积之比 大于某个门限时( 临界速度) 便产生摩擦音, 即清音 u n v o i c e d s p e e c h ) 。如果声道某处完全闭合建立起气压, 然后突然 释放而产生的声音就是爆 破音 ( p l o s i v e s p e e c h ) . 声带开启和闭合使气流形成一系列脉冲。每开启和闭合一次的时间即振动周期 称为音调周期或基音周期,其倒数称为基音频率,它具有时变性和准周期性。声道 是一个分布参数系统,它有许多自然谐振频率,也称共振峰频率。 2 . 1 叫 1语音信号的数字模型 从声学理论分析了语音产生的过程,并得知语音信号是声道被激励发生共振而 华北电力大学硕十学位论文 第二章g . 7 2 9 语言编码解码器工作原理及优化 g . 7 2 9 协议是国际电信联盟( i t u - t ) 在1 9 9 6 年制定的编码速率为8 k b p s 的共 轨结构码本激励线性预测( c s - a c e l p ) 声码器语音编码算法标准, 其带宽约为 4 k h z , 编码速率为 8 k b i t / s , m o s在 4 . 0左右, 话音质量达到全质的语音编码国际标准。 g . 7 2 9 编解码器有较高的带宽利用率且语音质量同3 2 k b i t / s 的a c p c m 算法相当, 所 以被广泛推广应用于 d s v d ,数字卫星系统、电 视会议、可视电话、l p电话及各种 多媒体通信系统中。在这一章中,我们首先讨论语音产生的机理,然后将语音信号 看成是一个线性时变系统在随机噪声和准周期脉冲序列激励下的输出,应用这一方 法就得到了 语音信号的数字模型。在进行系统设计之前,我们主要描述g . 7 2 9 的编 码原理,并在此基础上研究它的系统可实用性,提出一些改进方案以 适用于单片机 m c 6 8 h c 1 2的开发。 2 . 1语音产生的机理 人类的发声过程是由于肺部的收缩,压迫气流由支气管经过声门和声道引起音 频振荡而产生的,其中声道起始于声门处而终止于嘴唇,包括声道起始于声门处而 终止于嘴唇,包括咽喉 ( 连接食道和口) 、口 腔,鼻道则是从小舌开始到鼻孔为止。 当小舌下垂时,鼻道与声道发生祸合而产生语音中的鼻音。发音过程中声道各处的 截面积取决于舌、唇、领以及小舌的位置。声道截面积随纵向 位置而变的函数,称 为声道截面积函数,声道的共振峰特性主要决定于声道截面积函数,声道的共振峰 特性决定所发声音的频谱特性,即音色。 人类发音过程有三类不同的激励方式,因而能产生三类不同的声音,即浊音、 清音和爆破音。当气流通过声门时声带的张力刚好使声带产生较低频率的张驰振 荡, 形成准周期性的空气脉冲, 这些空气脉冲激励声道便产生浊音( v o i c e d s p e e c h ) 或称有声语音。如果声道中某处面积很小,气流高速冲过此处时而产生湍流,当气 流速度与截面积之比 大于某个门限时( 临界速度) 便产生摩擦音, 即清音 u n v o i c e d s p e e c h ) 。如果声道某处完全闭合建立起气压, 然后突然 释放而产生的声音就是爆 破音 ( p l o s i v e s p e e c h ) . 声带开启和闭合使气流形成一系列脉冲。每开启和闭合一次的时间即振动周期 称为音调周期或基音周期,其倒数称为基音频率,它具有时变性和准周期性。声道 是一个分布参数系统,它有许多自然谐振频率,也称共振峰频率。 2 . 1 叫 1语音信号的数字模型 从声学理论分析了语音产生的过程,并得知语音信号是声道被激励发生共振而 华北电力大学硕士学位论文 产生的输出。由于在发音过程中声道是运动的,因此这个过程可以用一个时变线性 系统来模拟。 模拟得好不好, 只要看他产生的语音信号听说上去是否合乎预期结果, 至于它是否能准确地描述发音器官产生语音的物理过程并不重要。 这种“ 终端模拟” 方法已在语音合成和语音编码等方面的大量时间中证明是一种成功的方法。 研究了发声器官的产生过程以后,就可以建立一个离散时域的语音信号产生模 型,对于进一步的各项研究以及各种具体应用,这个模型是非常重要的。 利用数字技术来模拟语音信号的产生称为语音信号的数字模型,或者说,利用 数字信号处理技术来实现发音器官的模拟。发音器官能发出一系列声波,那么数字 模型就能产生与此声波相对应的信号序列。这种模型是一种线性系统,它的一组参 数选定之后就可以使得系统的输出具有所希望的语音性质,系统的这些参数是和语 音产生过程有关的。为了表示采样的语音信号,我们采用的是离散时间模型。 声道的系统函数v ( z ) ( 或称传递函数) 是一个全极点函数,虽然它是在多种假定 下推得的,但它基本上符合大多数语音的实际情况。如果声道的长度假定为 1 7 c m 左右,那么用无损声道管模型进行计算,在0 -5 0 0 0 h z 范围内可得到5 个共振峰, 其位置大体上处于5 0 0 h z , 1 5 0 0 h z , 2 5 0 0 h z , 3 5 0 0 h z , 4 5 0 0 h z 附近,每个共振峰对 应于 系统函 数中 一对几点。 从实际 语音信号 频 谱分 析得到的结果, 也正是中从5 0 0 h z 左右 起,每隔 1 0 0 0 h z左右有一共振峰, 可见理论分析结果与实测语音信号的共振 峰分布是基本上相吻合的。当然,声道中存在粘滞损耗和热损耗,口 唇存在辐射影 响,声道截面积也柄不是几段均匀截面管子级联而成的,因此,实际语音信号中的 共振峰的强度、宽度和位置的描述,需要对级联无损声管各模型进行某些修改才能 更好地描述。共振峰特性是语音信号的主要特性。 我们利用n 节无损声管来模拟,其传输函数可以用式 ( 2 . 1 ) , ( 2 . 2 )来表示: n n 0 .5 (1 十 具 (1 + r, )z z a ( z ) n 一 一 1 cy.m z -m ( 2 . 1 ) ( 2 . 2 ) 伺润 vd 声道系统可以用一组面积函数 a ( x ) 或一组反射系数 r 二 来表示。 ( 1 0 -2 0 m s )内,a ( z ) 或 r 。近似不变。另外, 如果一组数字系统, 示为: 在一个语音帧 其系统函数表 v (z ) m n只 _ 一 1 a ,“ 一 固定延迟2 - n / 2z 省略了 零点,称为全极点模型。 ( 2 . 3 ) ,而分母相同。事实上,上述系统函数v ( z 0 仅有极点没有 华北电力大学硕士学位论文 除了声道响应以外,一个完整的终端模拟模型还包括变化的激励函数和嘴唇处 声辐射影响的部分。 系统函数v ( z ,) 的极点对应于语音的共振峰。对大多数语音来说,全极点模型能 很好的模拟声道的效应。然而声学理论告诉我们,鼻音和摩擦音要求有谐振和反谐 振。也就是说,需要用零极点模型才能更好地模拟声道效应。但是由于零点在实际 处理中较困难,可以用多个极点来逼近一个零点,从而用全极点模型来代替零极点 模型。 嘴唇辐射作用可以用一个一阶差分方程近似描述:r ( 幻= r a 1 - z - 。根据语音信 号分析得知,嘴唇辐射影响引起的输出信号高频提升作用大约有每倍频程6 d b . 对于清音来讲,激励信号近似于白噪声,对信号频谱包络的形状不产生明显的 影响。 对于浊音来讲, 声门振荡产生准周期性的脉冲串, 每个脉冲9 ( n ) 有一定宽度 和一定的形状。这样的声门脉冲形状,与理想的6 脉冲相比, 对信号的频谱特性将 要产生大约一1 2 d b / 倍频程左右的高频衰减作用。不同人、不同语音,其声门脉冲 的形状不一定相同, 但在语音合成中对其形状要求不很苛刻,只要其傅立叶变换有 近似的特性就行了。 综合考虑声门 激励、 声道和嘴唇辐射影响就得到图2 -1 所示的语音发生的离散 系统模型,这就是说, 语音信号可看作是激励信号a . ( z ) 激励一个线性系统h ( z ) 而 产生的输出, 其中h ( z ) 是声道响应v ( z ) 与嘴唇辐射模型r ( z 相级联而成, 即: h ( z ) =v ( z ) * r ( z ) 。 对于浊音来讲,我们还可以把声门脉冲的影响也归并到传递函数中,即:h ( z ) =g ( z ) * v ( z ) * r ( z ) 。 这时, 浊音信号就可以看作是由一个准周期性的s 脉冲串激励 一个离散线性系统h ( z ) 而产生的输出了。 冲曦序列 发生器 浊音1 浩声道模型 wz ) 辐射模型 狱z ) 欣均 图2 -1语音产生的离散系统模型 华北电力大学硕士学位论文 在实践中,这个二元激励的模型是有局限性的。其一,在模型简历的分析过程 中是以持续音为前提的,持续音的参数变化很慢,一般在 1 0 - 2 0 m 。间隔内是不变 的, 所以转移函数v ( 幻实际上确定了一个参数随时间缓慢变化的模型结构, 即所谓 的 “ 短时”平稳概念, “ 准稳”的原理对诸如塞音这样的暂音,此模型欠佳。其二, 对理论要求有零点的鼻音和擦音也受到限制。其三,浊擦音不是简单的浊音和清音 的叠加,是很复杂的过程,此模型不能给出模拟。尽管如此,但此模型对大多数语 音仍不失为一个好的模型,而且合成较满意的语音,它一 直是分析语音最重要的基 础。 2 . 2 g . 7 2 9 编码原理 g . 7 2 9 是对电话带宽的语音信号编码的标准,对输入的模拟语音信号用8 k h z 采样, 1 6 b i t线性 p c m 量化。 c s - a c e l p 是基于码激励线性预测 ( c e l p ) 的编码模式, 图2 一2 c s - a c e l p 编码器的编码原理框图 每8 0 个样点为1 个语音帧, 对语音信号分析并提取各种参数 ( 线性预测滤波器 系数、自 适应码本和固定码本终码本序号、自 适应码矢增益和固定码矢增益) ,把 这些参数编码发送。所有这些参数被编码后传送。参数编码的比特分配如表 2 -1 所示。在解码端, 这些参数用于恢复激励信号来重建语音信号。短时综合滤波器是 华北电力大学硕士学位论文 在实践中,这个二元激励的模型是有局限性的。其一,在模型简历的分析过程 中是以持续音为前提的,持续音的参数变化很慢,一般在 1 0 - 2 0 m 。间隔内是不变 的, 所以转移函数v ( 幻实际上确定了一个参数随时间缓慢变化的模型结构, 即所谓 的 “ 短时”平稳概念, “ 准稳”的原理对诸如塞音这样的暂音,此模型欠佳。其二, 对理论要求有零点的鼻音和擦音也受到限制。其三,浊擦音不是简单的浊音和清音 的叠加,是很复杂的过程,此模型不能给出模拟。尽管如此,但此模型对大多数语 音仍不失为一个好的模型,而且合成较满意的语音,它一 直是分析语音最重要的基 础。 2 . 2 g . 7 2 9 编码原理 g . 7 2 9 是对电话带宽的语音信号编码的标准,对输入的模拟语音信号用8 k h z 采样, 1 6 b i t线性 p c m 量化。 c s - a c e l p 是基于码激励线性预测 ( c e l p ) 的编码模式, 图2 一2 c s - a c e l p 编码器的编码原理框图 每8 0 个样点为1 个语音帧, 对语音信号分析并提取各种参数 ( 线性预测滤波器 系数、自 适应码本和固定码本终码本序号、自 适应码矢增益和固定码矢增益) ,把 这些参数编码发送。所有这些参数被编码后传送。参数编码的比特分配如表 2 -1 所示。在解码端, 这些参数用于恢复激励信号来重建语音信号。短时综合滤波器是 华北电力大学硕士学位论文 一只 1 0阶线性预测滤波器,把收到的比特流恢复成参数编码,解码后得到各个参 数,用自适应码矢序号从自 适应码本中得到自适应码矢,用固定码矢序号从固定码 本中得到固定码矢,分别乘以他们的增益按点相加后构成激励序列。用线性预测滤 波器系数构成合成滤波器。用所谓的自 适应码本方法实现长时或基音合成滤波,计 算出合成语音后,用后置滤波器进一步增强音质。重建语音质量为 m o s 3 . 9分。 c s - a c e l p 的编码流程图如图 2 -l ; 参数码字子帧 1子帧 2每帧总数 线谱对l o , l i , l 2 , l 31 8 自适应码本延时p 1 , p 2851 3 基音试验奇偶校验 p oi1 i 固定码本序号 c l , c 2 i 3l 32 6 固定码本符号s i , s 2 448 码本增益 ( 阶段i )g a i , g a 2 336 码本增益 ( 阶段 2 )g b i , g b 2 448 总计8 0 表 2 - 1 , 8 k b / s c s - a c e l p 算法比特分配 ( t o m s 帧) 2 . 2 . 1语音信号的数字化与预处理 语音信号是一种典型的非平稳性的信号,但由于语音的形成过程是与发音器官 的运动密切相关的,这种物理运动比起声音振动速度来讲要缓慢得多,因此语音信 号常常可假定为短时平稳的,即在 1 0 -2 0 m s这样的时间段内,其频谱特性和某些 物理特征参量可近似地看作是不变的。因此用短时处理技术是适意的。 众所周知,语音信号数字化之前,必须先进行防混叠滤波,滤除高于 1 / 2采样 频率的信号成分或噪声。这种防混叠

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论