已阅读5页,还剩68页未读, 继续免费阅读
(机械电子工程专业论文)语音检测和噪声抑制算法的研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要3 6 8 5 18 针对一个接入电话网的战地对讲机系统的实际需求,本文详细的介绍了语 音和噪声判断的算法和战地璺声抑剑箕鎏,作了大量的分析计算,并用高速d s p 系统实现了预定的目标,达到了很好的效果。 ( 因为研究的对象是语音,所以在第一彰对语音处理领域当前的几个主要研 究方向做了大概的论述介绍,他们包括语音编码、语音合成、语音识别、说话 人辨别、i p 电话技术等等。第一章还同喇介绍了研究课题的应用背景,国际国 内语音检测算法和语音噪声抑制算法的当前研究状况,提出了本课题的研究任 , ,1 , 务。镣二萄介绍了语音信号的数字处理技术。包括时域处理方法和频域处理方 法;主要介绍语音的短时处理技术,包括短时能量,短时过零率,短时自相关, 短时傅立叶变换,短时倒谱等等,这些算法都是语音处理的理论基础。第三章 、一,。 是本论文的重点,介绍了语音和噪声判断的算法及其实现手段,详细推导了算 法的理论,并对其进行了详细的阐述,利用了高速d s p 系统,并对汉语的各个 音素进行了计算分析,和噪声的谱相关曲线进行了比较,证明了谱相关算法能 , r 7 用于实际的系统。第四剥介绍了自适应噪声对消用于语音噪声抑制的算法,并 作了大量的仿真,取得了很好的效果,理论上证明了这是一种有效的噪声抑制 算法。f 最后一章第五章对本论文做了简单的总结,并展望未来的技术趋势。 a b s t r a c t a i m i n ga t t h ed e m a n do ft h et e l e p h o n en e t w o r kc o n n e c t e di n t e r p h o n e s y s t e m ( t n c i s ) ,t h ep a p e r i n t r o d u c e st h es p e e c hs i g n a ld e t e c t i o na l g o r i s ma n d n o i s ec a n c e l l a t i o na l g o r i s mf o rs p e e c hs i g n a li nb a t t l e g r o u n de n v i r o n m e n ti n d e t a i l m o r e o v er ,t h ep a p e ra n a l y s e st h ea l g o r i s m sa n dl o t so fe x p e r i m e n t a lr e s u l t , a n du s e sah i g hs p e e dd s p i n t e g r a t ec i r c u i tt or e a l i z et h ea l g o r i s m ,w h i c ho b t a i n s c h e d u l e da i m s s i n c et h er e s e a r c ho b j e c ti s s p e e c hs i g n a l ,t h e f i r s t c h a p t e rg i v e s b e l i e f i n t l o d u c t i o nf o rt h em o s ti m p o r t a n tr e s e a r c hf i e l di ne u r r e a ta b o u ts p e e c hs i g n a l p r o c e s s i n g t h e y a r e s p e e c hc o d i n g ,s p e e c hs y n t h e s e s ,s p e e c hr e c o g n i t i o n , s p e a k e ri d e n t i f i c a t i o n ,i pp h o n et e c h n o l o g ya n ds oo n f u r t h e rm o r e ,t h ef i r s t c h a p t e ri n t r o d u c e st h eb a c k g r o u n do ft h er e s e a r c ht o p i ca n dt h ec u r r e n ts t a t e a b o u tt h er e s e a r c h e dt o p i c si ni n l a n da n do v e r s e a ,i nt h eb a s eo fw h i c ht h es e a r c h a i m sa r eb r o u g h tf o r w a r d t h es e c o n dc h a p t e ri n t r o d u c e st h ed i g i t a lp r o c e s s i n g t e c h n o l o g yf o rs p e e c hs i g n a l ,i n c l u d i n gt i m ed o m a i np r o c e s s i n gt e c h n o l o g ya n d f r e q u e n c y d o m a i n p r o c e s s i n gt e c h n o l o g y i tm a i n l y i n t r o d u c e ss h o r t t i m e p r o c e s s i n gt e c h n o l o g y ,i n c l u d i n g s h o r t - t i m e e n e r g y , s h o r t t i m ea v e r a g e z e r o c r o s s i n g r a t e ,s h o r t t i m e a u t o c o r r e l a t i o n f u n c t i o n ,s h o r t t i m ef o u r i e r t r a n s f o r m ,s h o r t - t i m ec e p s t r u m t h e s ea r ea l lt h ef o u n d a t i o no fs p e e c hs i g n a l p r o c e s s i n gt h e o r y t h et h i r dc h a p t e ri st h em o s ti m p o r tc h a p t e ri nt h ep a p e ni t i n t r o d u c e st h ea l g o r i s mo fv o i c ea c t i v i t yd e t e c t i o na n di t s i m p l e m e n t a t i o ni n d e t a i l u s eh i g hs p e e dd s p i n t e g r a t ec i r c u i tt or e a l i z et h ea l g o r i s m ,a n a l y s i sa n d c o m p a r ea l l t h e p h o n e m e so fc h i n e s e p i n y i nt on o i s e a n d p r o v e t h a tt h e a u t o c o r r e l a t i o no ff r e q u e n c yc a nb eu s e di nr e a l s y s t e m t o r e c o g n i z es p e e c h s i g n a la n dn o i s es i g n a l t h ef o u r t hc h a p t e ri n t r o d u c e st h eu s a g eo fa d a p t i v ef i l t e r t oc a n c e ln o i s ef o rs p e e c hs i g n a l ,a n ds i m u l a t e sal o t ,o b t a i n sa p p a r e n tr e s u l t , w h i c hp r o v et h a ti ti sag o o da l g o r i s mf o rs p e e c hn o i s ec a n c e l l a t i o n t h el a s t c h a p t e r t h ef i f t hc h a p t e r m a k e saa b b r e v i a t e dr e s u l to ft h ep a p er a n dg i v e st h e p r o s p e c t o ft h ef u t u r et e c h n o l o g ya b o u tt h er e s e a r c h t o p i c 一 笙= 童堕童竺堡塑堡 第一章语音处理概论 第一节概述 语音信号处理是研究用数字信号处理技术对于因信号进行处理的一门学科。处理的目 的是要得到一些语音参数以便高效的传输或存储,或者使用过某种处理运算以达到某种用 途的要求,例如人工合成语音、语音识别、语音检测。本论文研究的是语音与噪声判断算 法和语音质量改善即语音噪声抑制的算法。 语音处理是一闩新兴的边缘学科,是语言一语音学和数字信号处理两个学科的总和。现 代语音处理技术的发展,综合了信号处理、声学、模式识别、通信与信息理论、计算机科 学、数学等学科的理论。p 1 随着数字化应用越来越快,语音处理技术也在迅猛的发展,特别是智能语音技术,不 断的有成果的报道。作为对语音处理理论体系的了解,下面就语音处理技术的几个研究方 向做大概的介绍。 第二节语音处理技术当前的几个研究方向简介 语音处理技术的发展都是在现实的需要下发展起来的。原先,精确复制声音波形的概 念导致了电话的问世,待解决的科学问题是扩大传输距离和传输带宽。最初横渡大西洋的 电报电缆虽然跨距离很远,但是不能支持语音波形传输所需的带宽,于是越洋电话的需求 再次激励了语音压缩技术的研究,研究工作首次离开波形概念,转向语音信号的基本信息 特征。声码器( 语音编码器) 就是在这个意义下产生的。 在计算机和数字信息系统问世之前,电缆和无线电的带宽效率一直是语音处理的一个 非常重要的问题。随着计算机和信息系统的日臻完善,能为人提供各种服务的语音系统, 渐渐的成为研究的中心,特别是如何赋予复杂的机器同人类用户相互对话的能力,已经成 为当前人们研究课题,几年来,这种趋势已为世人所公认。 随着二十世纪各个方面的技术日趋成熟,出现了通信科学、计算技术和信息管理融合 起来的倾向。当代的先进信息系统般包含通信、计算和信息管理等部分,因此,存在一 种把语音、图像、数据、计算和会议通讯等信息综合到个现代系统中去的强大推动力量。 e i 前语音处理计算包括语音编码( 语音压缩) 、综合、识别、通话人验证及声频会议通信 等。这些技术的具体实现有赖于微电子技术的发展,特别是近几年高速d s p 芯片技术的发 瓞。 。 2 _ 1 语音压缩和编码技术f 3 j 【4 】 近f - - 来,随着人类社会信息化进程的加快,语音压缩编码技术也正在迅速发展,在移 动通信、卫星通信和i p 电话通信中得到了广泛的应用。作为语音处理技术的重要研究方 翌二:垩堕童竺堡垫笙 _ _ _ 一一。 向之一,下面对沿音压缩编码技术的现状与发展予以讨论。 2 1 1 语音压缩编码的概念和分类 现代通信的重要标志是实现数字化,而要实现数字化首先得把模拟信号转变为数字信 号,这种变换对语音信号来说就是语音编码。为了提高语音编码和语音信号数字传输的有 效性,通常还要进行语音压缩编码。语音压缩编码技术有多种,归纳起来大致可分为三类, 即波形编码、参量编码和混合编码。另外,根据编码速率的高低还可分为中速率和低速率 两大类。 2 1 2 语音压缩编码常用的基本技术 2 1 2 1 线性预测语音生成模型 语音信号相邻点之间有很强的相关性,因此,可以用过去样点的线性组合来预测未来 的样点,如式( 1 - 1 ) : = 日,s ( n - 0 ( 1 - 1 ) 式中,砒为预测器系数,m 为预测器阶数,s ( n ) 为语音信号。预测误差如式( 1 - z ) : 。( ;) :s ( ) 一g ( 。) :s ( 胛) 一兰日,s ( 月一j ) 一一一( 1 - 2 ) 上式可改写为式( 1 3 ) : s ( ) = e ( 月) + 臼,s ( n - o 一- ( 1 - 3 ) 一 式( 1 - 3 ) 可以解释为信号e ( n ) 激励全极点滤波器( 其传输函数日( z ) = 1 一) 得到语 1 一a ,z 音信号s ( n ) ,这同人的发声过程正好吻合。因此可以得到线性预测语音生成模型如图1 1 所示。 在此模型中,激励源分为两种,一是随机噪声,一是周期性脉冲序列。对于清音一般 作为随机噪声,而对于浊音一般作为周期性脉冲序列。周期性脉冲序列的周期为基音周期, 其声门、声道和唇辐射的作用全可简化为一个全极点滤波器( 声道滤波器) ,此滤波器是 时变的,即声道参数和增益随时间的变化而变化。通常认为激励信号和滤波器系数之间大 约5 m s 4 0 m s 更新一次。根据上述原理构成的l p c 声码器原理框图如图1 2 所示: 2 s b 、 语音 抽样 清浊音判别 编码器( 分析器) 编 码 第一章语音处理概论 信道 解阻 1g 码i 台成滤波器p 盐叫低通 煎塑盟l 蒜 耨堙型屯匦 译码器( 台成器) 图1 - 1l p c 声码器原理框图 清浊音开关 2 1 2 2 矢量量化 图1 2 线性预测语音生成模型 在语音编码中,矢量量化( 简称v q ) 是一种较新的技术,它与标量( 一维) 量化是不 同的,其不同之处在于它并不对单个抽样进行量化,而是将一组抽样( 矢量) 作为一个整 体来进行量化。v q 既可用于波形编码又可用于参量编码,是一种既能高效压缩码率又能 保持语音质量的编码方式。 v q 的基本原理就是将若干个标量构成一个矢量,然后在矢量空间中进行量化。为了 压缩速率,在矢量被量化后,不去传送量化矢量的本身而去传送量化矢量的一个序号。因 二进 编码器译码器 图1 3 矢量量化原理框图 此,应需预先将若干个典型的数据矢量( 码矢量) 贮存起来并给每个码矢量分配一个序号 或代码。这种表示码矢量与序号之间关系的表格称为码本或码书( c o d e b o o k ) 。每当编码 萎 第一章语音处理概论 时,输入的数掘矢量在每个预定的时间内都与每个码矢量相比较,并将与此数据矢量最相 似的码矢量所对应的序号,作为输入数据的编码来发送。在接收端则利用与发端相同的码 本找到与传送序号所对应的码矢量连同源信息一起来重建语音信号。矢量量化的原理如图 l 一3 所示。 2 1 2 3 混合编码的原理 在混合编码系统中,语音合成的基本模型是由激励信号来驱动一个全极点滤波器的传 统的l p c 模型,其系统参数e h 线性预测确定,而激励源则通过闭环优化来确定。优化的过 程就是确定一个激励序列,使得输入语音和编码语音之间的感知加权均方误差最小。这种 编码方式的特点就是将波形编码的优点( 激励序列与输入语音波形的匹i e ) 与参量编码的 优点( 用参数表示语音的共振峰和基音结构) 结合了起来,从而使语音质量有了明显的提 高。图1 4 即为典型的混合编码的原理框图。 该系统含有一个短时l p 合成滤波器( 表示语音共振峰的结构) 、一个长时l p 合成滤 耋霉h 岁警 4 - + 输入语音 i s & ) 白) 凡 _ | 望堕塑型翌i + 、,- - - _ , 长时合成滤波器 最小 均方误差 + 图1 - 4 典型的混合编码原理框图 波器( 表示语音基音的结构) 、一个感知加权滤波器( 对误差进行整形,使量化噪声能被 高能量的共振峰所掩盖) 和一个激励产生器( 进行激励序列的选择以便使加权均方误差最 小) 。由于有三种常用的激励模型,因而产生了三种混合编码系统,即多脉冲激励线性预 测( m p l p ) 编码、正规脉冲激励( r p e ) 编码和码激励线性预测( c e l p ) 编码系统。在 m p l p 编码的算法中,采用了由多个不均匀间隔脉冲所组成的激励序列,并通过如图1 4 所示的闭环优化系统来确定激励脉冲的幅度和位置。此算法在1 0 k b i t s 的低码率下能产生 比较好的语音质量,但对高基音说话者来说,其性能通常会有所下降。英国国际电信( b t i ) 机构所推出的空中电话系统( s k y p h o n e ) 采用这种编码算法,其码率为9 6 k b i t s 。 再r p e 编码的算法中,采用了问隔均匀的多脉冲激励序列的方式,而闭环优化系统与 典型的情况有所不同。这里先将输入语音通过逆滤波器变成预测残差,然后将此残差由正 规脉冲序列来代表,而此脉冲序列的选择则需使用加权最小均方误差的准则来实现。在此 闭环系统中只设有长时预测器( l t p ) 。 采用此编码算法的典型系统就是使用全速率g s m 泛欧数字移动通信标准的1 3 k b i t s 的g s m p r e l t p 编码器。据报道,该系统语音质量略优于s k y p h o n e 系统,而编码的复杂 度却低得很多。 对于c e l p 编码的算法,是利用矢量量化的码本,将激励序列编码按闭环系统来选择 卜一器r l潞一涨一知潞鬟蕊 第一章语音处理概论 最佳码矢量的。常规的c e l p 编码算法采用了前向预测的方式,编码器所传送的信息除激 励码矢量外,还包括l p c 参数、基因周期、基因预测器抽头和激励增益等。实践表明, c e l p 编码器在1 6 k b i t s 码率时提供了较高的语音质量,是最具有吸引力的语音压缩编码方 式之一。 2 1 3 语音编码的发展趋势 自从2 0 世纪3 0 年代末提出p c m 及通道声码器理论以来,语音编码技术已有7 0 余年 的发展历史,但只有近2 0 年随着计算机和微电子技术的发展才获得了飞速的发展,尤其 是近几年来高质量语音压缩编码的技术已开始大规模地走向实用化,各种国际标准的制定 均集中反映了这种技术发展的水平和趋势。这些标准均根据应用背景,对编码质量、编码 速率、编码延时以及算法复杂程度等进行综合权衡和最佳选择而制定的,以期在实际应用 中获得最佳的效益。表1 即列出了国际上些语音编码标准的性能及主要应用。此外,有 一些国际组织或国家也都在积极制定自己的标准,例如北欧、北美、日本等都先后公布了 他们的数字蜂窝移动通信系统的标准,分别采用了1 3 k b i t s 带长时预测规则码激励 ( r p e l t ) 线性预测编码、8 k b i t s 矢量和激励线性预测( v s e l p ) 编码及6 7 k b i t s 的v s e l p 编码等方案。国际海事卫星组织( i n m a r s a t ) 于1 9 9 0 年制定的语音压缩编码标准采用 了45 k b i t s 改进型的多带激励( i m b e ) ,而美国q u a l c o m 公司为c d m a 移动卫星通信系 统采用了4 k b i t s 8 k b i t s 的变速率语音压缩编码的标准,即c e l p 类型,dr i 作q c e l p ,并 纳入了i s 一9 5 标准。 表1 国际上一些语音编码标准算法的性能及主要应用 注:复杂程度以p cm 为标准按电路运算的复杂性而作的相对比较 o s 平均意见得分 口r t 4 断韵军测试 l 1 3 celp 短延时码、颢励线性预测编码 c5a celp 短延时共轭结构代数码澈厉b 线性预测编码 mpml q 多脉冲激励最大似然量化 rep ,ltp 长时预测规则脉冲激威编码 判断满意度测量 代数码激威线性预测 矢量和激励特性预测 数字话路扩客设备 分组交换扩容设备 实际的应用有时采用多种的编码方式相结合的方法,如最近i s o ( 国际标准化组织) 颁前i 了符合i n t e r n e t 网络传输特点的新的活动图象和音频信号的压缩编码标准:m p e g 4 就是采用多种编码相结合的方法来提高语音的编码质量,同时又使编码的速率不致太高。 p e e 州 洲 州 o a v d p 第一章语音处理概论 对音频信号的压缩编码采用了三种不同的方式:在2 - 6 k b i t s 的低速率下,采用参量编码方 式:在6 2 4 k b i f f s 的中速率范围内,采用码激励线性预测编码c e l p ( c o d ee x c i t e dl i n e a r p r e d i c t i v e ) 方式;在1 6 k b i f f s 以上的高速率中,采用了时域一频域编码方式。在m p e g - 4 中,当编码速率低于6 k b i f f s 时,采用了谐波矢量激励编码h v x c ( h a r m o n i c v e c t o r e x c i t a t i o n c o d i n g ) 算法来进行语音的参量编码。一 语音压缩编码技术的发展是十分迅速的,例如在目前已能在5 k b i t s - 6 k b i t s 的速率上 获得高质量的重建语音,在8 k b i t s 的速率上也可获得短延时高质量的重建语音,而下一个 目标则是要在4 k b i t s 速率上获得短延时高质量的重建语音。特别是对中长延时编码,人们 e 在研究其更低速率( 如4 0 0 b i f f s 1 2 0 0 b i t s ) 的编码算法,以应用于语音存储、短波通信、 计算机语音通信等方面。目前比较好的算法还有正弦变换编码( s t c ) 、混合激励线性预测 编码( m e l p c ) 、时频域插值编码( t f i ) 、基音同步激励线性预测编码( p s e l p ) 等等。 国内有人研究成功一种5 0 0 b i f f s 的编码算法【l “。另外,随着研究的深入,需要引入新的分 析技术,如非线性预测技术,多精度时频分析技术( 如小波分析在语音编码的应用) ,高 阶统计分析技术等等 引。发展的趋势是向着具有更低速率、更高质量和更低延时的压缩编 码方案方向发展。 2 2 语音合成 语音合成是讨论如何使机器说出人的语音,以满足人类的各种需要的问题,这包括各 种应用上的需要和对语音质量的要求。 从指导思想上来况,要使机器说话有两类方法:第一类可称为“分析一存储一合成”。 这里,存储是核心,也就是说只要事先将语音存储起来,然后在需要机器说话时只要再取 出来就可以得到语音了,如录音机一样。但是在数字语音合成中,为了便于存储,必须先 进行分析或变换。因而在取出合成前还必须进行相应的反变换。最简单的变换是“模数” ( a d ) 变换和“数一模”( d a ) 反变换,或称为p c m 波形合成法。可以料想,用这种 方法合成语音,其词汇量不可能做到很大,因为这个方法所需的存储容量太大了( 大约要 让机器讲一秒钟的语音,就需要6 4 k b i t 以上的存储容量) 。所以,为了节约存储量,必须 先对语音信号进行各种分析,得到诸如线性预测系数、线谱对参数或共振峰参数等有限个 参数,以压缩存储容量,这种方法就称为参数合成法。当然,在波形合成法中,也可以使 用波形编码技术( 如a d p c m ,a p c 等) 略为压缩一些存储量。通常,波形合成法可合成 的语音词汇量约在5 0 0 以下,而参数合成法则可达到数千左右。当然,用参数合成时,由 于抽取参数或编码过程中,难免存在逼近误差,所以合成的语音质量( 清晰度等) 也就比 波形合成法要差。在语音合成中,另一个重要的问题是合成基元的选择问题,也就是存储 的语音基元的选择问题。显然,合成词汇量愈大,必须采用愈小的基元,否则存储容量就 太大了;反之,合成词汇量愈少,可用较大的基元。例如在英语中,词的数量有千千万万, 但音素却只有成百个,所以存储全部词的容量远远大于存储全音素的容量。但是,我们知 道,基元愈大时合成的语音的自然度就会愈好。例如存储的是整个句子的语音波形或参数, 则合成的语音在该句范围内,合成语音的自然度就接近于原始语音,不会有那种不连贯的 所谓“机器”味。通常,在波形合成法中,由于合成的是有限长度的语音,甚至可用整个 句子作为一个合成基元;但在参数合成法中,则不得不用字至多也只能用词作为合成基元。 不过,在现代集成电路技术进展情况下,在几千词汇量的参数合成器中使用句子作为合成 基元也不是不可能的。 但是应该指出,在目前的技术水平下,要想合成任一语种的无限词汇量的语音,仅采 用上述的“分析一存储一合成”法是不可能的,甚至对于以音节字为基础,且字汇量较少 第一章语音处理概论 的汉语,若以音节字为合成基元,也有1 3 0 0 个音节字,即使使用参数存储也将是有困难 的。因而国际上都在努力开发另一类无限( 全) 词( 字) 汇量的语音合成的方法,这第二 类方法就是所谓“按语言学规则的从文本至语言”的语音合成法( t e x t t o s p e e c h ) 。在这项 努力中,人们还期望能合成出高自然度的语音来。 文语合成的指导思想是:挖掘出人在说话时,是按什么规则来组织语音单元的,并将 这些规则的知识赋与机器,因而在机器合成语音时,只要输入合成基元,机器就应该会按 照所赋给的规则来合成出与人说话时相同的语音来。例如,英语中什么情况下该加重音、 该加长音、两个相邻词该连读,两相同的文本性读有不同时该用哪一个音标等;汉语中除 了上述的音长、一字多音等问题之外,还要知道声母与韵母之间是如何产生发音的相互影 响的,哪些字可以构成一个单词、因而应该按单词来发音以及什么情况下该变声调等。可 以指出,所使用的文本的合成基元愈小,这些规则也就愈多愈复杂,当然所用的存储容量 也就可以愈少,因此在选择文本的合成基元时应该折衷考虑。目前英语中多用音素、双 音素为文本的合成基元:因为对于西方语言,用词为基元的按规则合成几乎是不可能的。 而汉语中则可以发挥上述优点,即可以用声母与韵母,甚至直接用音节字为文本基元, 以减少规则的知识。这时就不必考虑与音素有关的规则,而只需用到音节字之间的有关规 则就可以了。 一 日本学者f u j i s a k i 按照人在说话过程中所用到的各种知识,将按规则语音合成为三个 层次,如图1 5 所示。也就是说有三个层次的按规则语音合成, ( 1 ) 按规则从文本到语音的合成( t e x t t o s p e e c h ) ; ( 2 ) 按规则从概念到语音的合成( c o n c e p t t o s p e e c h ) ; 驾巨歪,缸曼乎匿巫壤孰亘三p 图1 5 安规则语音合成的3 个层次 ( 3 ) 按规则从意向到语音的合成( i n t e n t i o n - t o s p e e c h ) 。 尽管这种划分似乎很有条理,但是迄今为止我们对人类的语言产生过程的了解仍停留 在声道系统上,所以仍然只能进行按规则的从文本至语音的合成研究。至于更高层次的研 究还有待于通信、计算机的专家和生物学家、语言学家、人工智能专家等的共同努力。 2 3 语音识别 语音识别系统的基本任务是准确的识别整句话的意思( 如音标或拼音字母的语音一文字 打印系统) ,或者“理解”所说的话( 即以正确的方式回答说的是什么) 。对于大词汇量的 连续语音输入系统,理解话意( 而不是识别) 的概念是最为重要的,然而对于有限词汇、 说话人数较少或孤立字的系统,准确识别的概念却最为重要【l 。语音识别是目前相当热门 的一个研究方向,现在的学术杂志不断的有大量的论文发表,可见这是一种还处于高速发 展中的理论和技术。 2 3 1 语音识别的最新发展 尽管语音识别是一个很艰难的研究课题,经过4 0 多年的研究,还是取得了很大的进 展。近年来,各发达国家都投入很大的人力和物力来组织攻关,研究内容包括把大核心课 第一章语音处理概论 题:【1 4 1 高级语言分析 语言特征分析 语音识别 语言理解 语言合成 口语交互的知识处理和对话方法 噪音和干涉环境下的语言处理技术 人机交互系统和技术评价 九十年代后期继而进行自动电话翻译系统和目英等多语种语言互译系统等重要课题 的研究。美国从九十年代开始包括用于军事领域的语音识别和语言理解、通用预料库加工 出立等研究,目前主导语音识别发展方向的主要研究机构是i b m 和a t & t 公司的 b e l l l a b 。这两个公司使用的方法都是基于统计模型h m m ( 隐态马尔可夫模型) 。目前在 技术上i b m 领先于b e l l l a b 。h m m 之所以在语音识别中应用较为成功,主要是它具有较 强的对时间序列结构的建模能力。目前在技术上,i b m 领先于b e l l l a b 的原因大致可以 归结为以下几个方面:“ 一 ( 1 )b e l ll a b 采用的是连续参数h m m ,i b m 采用的是离散参数h m m 。研究表明, 对于中小规模词汇( c i p 。( x ) 拒绝说话人i ,若p i ( x ) p j ( x )j = l ,2 ,3 ,n ,i i 也就是把具有最小错误概率的选为说话人。在这种情况下,当使用的人数很大时,错误概 率将趋于1 ,因为无限多个分布在一个有限参数的空间中是不可能区别的,也就是说,在 集合中的两个更多个说话人的量度分布非常接近的情况将越来越多。在这种情况下,基本 上不可能可靠的说话人辨认。 说话人辨识的模型大致可以分为三类,即非参数模型,参数模型【1 9 】和神经网络。最近 邻模型( k n n ) 和矢量量化模型( v q ) 是典型的非参数模型。参数模型是指采用某特定 形式的概率密度函数来描述语音特征矢量在特征空间的分布情况,以该概率密度函数的一 组参数作为模型的特征。典型的概率密度函数是高斯分布函数。为了更加精确地描述语音 特征矢量的分布,可使用多个高斯分布的线性组合作为模型的概率密度函数,即高斯混合 模型( g m m ) 【2 1 1 。神经网络模型目前仍不够成熟,且系统开销较大。 目前说话人识别的方法比较常用的是线性预测系数( l p c ) 和对数倒谱相结合的方法, 在多年前就能达到9 5 的正确率i l ,目前还有不少关于这方面的新文章,甚至利用了时频 分析技术如小波分析来进行说话人的识别【1 8 】,还有自适应方法【1 9 】,神经网络【2 0 等等。国内 主要是清华大学、上海交通大学、西安交通大学在进行这个方面的研究。 2 5 i p 电话技术 i p 电话技术是随着i n t e m e t 技术的发展在最近几年发展起来的。它实际上可以说是语 音编码技术和网络传输技术的其他技术的实际综合应用。由于技术的进步和它低廉的价 格,最近两年已经走入普通百姓的生活,加上它还有系列自身特有的技术要求【2 4 】,所以 要特别的加以论述。 2 5 1i p 电话的概念和原理 i p 电话是利用i n t e r n e t 作为传输媒介的通讯技术。普通电话的采用程控交换技术,通 过公用电话网( p s t n ) 传送模拟话音信号,而且通话双方一旦建立连接,便独占一条电路 通道,直到通话完毕拆除连接。而i p 电话则是采用包( i p 包) 交换技术,借助i n t e r n e t 网 络传送经过语音编码处理的数字信号,在双方通话期间所建立的通道上,可同时传送其他 多媒体数据( 视频、图像、文本) 。目前,国家信息部已经批准中国电信、中国联通等几 第一章语音处理概论 家电信公司开展i p 电话业务。 2 5 2i p 电话的种类 根据终端类型的不同,可将i p 电话分为三类: ( 1 ) p c 到p c “p c 至p c 型”i p 电话,主要是通过计算机做承载,以多媒体技术为载体,通话 的双方都要有一台多媒体p c 、一个供上网的i s p 帐号和一套专用的通话软件。由于其 技术背景比较原始和简单,使用方法比较复杂,效果往往不佳,不能够作为提供公用 电话服务的通信手段而推广使用。 ( 2 1p c 到电话 “p c 到电话”是p c 机通过网关与对方电话机通信。它与“p c 到p c ”型产品的 技术背景相似,由上网用户通过某一i p 服务商的网关器拨叫到另一用户的普通电话, 只需要主叫方具有一台上网的多媒体p c 。主叫方必须在计算机上完成拨号以及通话过 程,而被叫方则通过普通电话机接听。当然也可以通过电话调制解调器连接到被叫计 算机上,此时,省略的只是被叫方操作计算机的过程。反过来,“电话到p c ”型产品 的原理与此相同,只是主叫和被叫关系相反而已。 ( 3 ) 电话到电话 “电话到电话”是利用现有的普通电话机及其交换网络而实现i p 电话,这是一种 图1 7 i p 电话网络 真正的、将能被广泛应用的i p 电话,也是本文所要讨论的i p 电话。由于电话机是直 接与专用电话交换机( p a b x ) 或公用交换电话网( p s t n ) 连接的,因此,要把语音 信号转送到i n t e r n e t j 2 传输,必需安装网关( g a t e w a y ) 设备,才能实现两端电话经i n t e r n e t 传输后的互通。网关完成i p 电话的信号转换,并处理全部通话过程。如图1 7 所示。 2 5 3 电话网关 一般而言,若要拨打i p 电话,用户在电话机上拨必要的号码,然后经过与p s t n 连 接的i p 电话网关,将地址信息和电话信息转换成i p 数据包,再将数据包传送到最近的 i s p 提供商由此上网。在电话的目的地,i p 电话网关将j p 数据包还原成语音,并将电话 第一章语音处理概论 转发至p s t n ,最后,p s t n 再将电话传送至被叫电话机。如上所述,在普通电话之间 进行i p 语音通信,必须通过在p s t n 与i n t e m e t 之间架构网关来实现。i p 电话网关采用 了分层模块化结构,可分为硬件层、软件模块层、维护管理层、控制接口层几个部分。 软件模块层又包括话音信号处理、p s t n 呼号控制、i p 呼叫管理、i p 呼叫控制、数据传 输、d s p 软件包等。其中话音信号处理包含了话音编解码、回波抵消和d t m f 检测等 功能。如图1 8 所示。 将数字化语音信号转换为能在i n t e r n e t 上传输的i p 包的i p 电话网关,是当前i p 电话 中的一个关键设备。根据实现方法的不同,可以将现有的电话网关分为两类: ( 1 ) 基于p c 服务器的i p 电话网关 这种电话网关适用于企业,与p a b x 连接。它的优点是比独立封闭的解决方案 更加灵活和开放,因此更适合于那些需要开发交互式语音应答定制应用程序的公 司。此外,它们通常基于为人们所熟悉的操作系统如w i n d o w sn t 等,因此比使用 专有操作系统的独立电话设备容易让人们学会使用。i p 电话服务器网关的缺点是比 较昂贵。 f 2 ) 基于路由器的i p 电话网关 网关控制接口 维护与管理计费 p s t n l d s p f g 。7 2 3 1 卿愎制器i 管理软件包旧; il 回波抵消 i p 呼叫管理 i p 呼叫控制 ( i l3 2 3 ) 数据传输 r t p f l t c p 硬件平台 图i - 8i p 电话网关的组成 这种电话网关通常是一种专用设备,或者是拥有嵌入式硬件和软件的路由器和 转换器。适用与p s t n 连接,主要对象是公用网的电信部门,以适应大容量的高度 独立设备的需要。电话网关中的核心功能是网闸( g a l e k e e p e r ) ,它是管理网关之间 通信业务的h 3 2 3 软件实体,能提供呼叫管理、记帐和类似目录的服务。如果没有 g a l e k e e p e r ,那么缺乏目的的i p 地址的呼入就无法被转接到最终目的的端点上。通 过与传统电信设备交叉连接的i p 电话网关,使用户在不更换原有电话设备,也无 需计算机多媒体技术做载体的条件下,直接用普通电话通过i n t e r a c t 拨打长途电话。 2 5 4i p 电话的协议标准 i p 电话的协议标准包括t c p i p 协议、h 2 3 2 标准、实时传输协议实时控制协议( r t p r t c p ) 、资源预留协议( r s v p ) 。 2 5 5 i p 电话的特点2 3 1 ( 1 ) 支持灵活多样的业务方式支持用户采用卡付费、普通帐户和固定主叫用户等 第一章语音处理概论 方式进行国际、国内长途业务,计费系统完整支持电话一电话、电话- - p c 等多种 业务及智能卡号业务,以及如来电指示及遇忙转移等新型增值业务,并充分利用 i n t e m e t 技术优势保证通话质量。 ( 2 ) 优异的性能价格比i p 电话最大的优点是价格上的优势,这是i p 电话崛起的根本 原因。系统传输成本包括本地市话费、i p 网络使用费以及远端市话费,与传统电 信网中昂贵的长途通信费相比,可以极大地降低用户通信费用。 ( 3 ) 兼容原有的电话网络i p 电话网关支持下的“电话到电话”方式,与传统电话相 连接的是普通电话线路,完全能够实现传统的电话功能,使用方便,并具有自动 识别和( p s t n 与i n t e r n e t 用户的) 网间转换、分帐、计费、语音信箱等一系列专 业化服务功能。 ( 4 ) 提高传输效率电话网关采用国际标准算法( g 7 2 3 1 、g 7 2 9 a ) 压缩语音信号进行 低速率语音编码,如g 7 2 3 1 可将常规6 4 k b i t s 语音信号压缩到5 3 k b i t s ,而仍可 以保持良好的声音效果。人们打电话时约有6 0 的静默时间,采用静音压缩技术 只传输双方通话过程中的实际交谈时段的数据,而将双方静默时段的带宽释放给 其他话音业务,从而提高带宽利用率,节省通信资源。 ( 5 ) 充分利用网络资源采用i p 的通信网络i n t e m e t 由分组交换与无连接的分组交换相 整合,因此,i p 协议对通信资源的利用远远高于传统的通信网络。 2 5 6i p 电话的发展趋势 经过多年发展,i n t e m e t 已经成为世界上覆盖面最广、规模最大的计算机信息网络。i p 电话的出现,必将引发我国传统电信业务的一次深远的革命,并会出现许多问题。对此, 相关的国际标准化组织还有新的建议或标准颁布。如i t u t 在1 9 9 2 年2 月通过的新建议 1 3 8 0 ,该建议考虑到i p 要支持话音业务( 对信息传送的时延性能敏感) 和图像业务( 对信 息传送的差错性能和信息传送的时延性能均敏感) ,因此,对i p 分组传送性能既定义了差 错性能参数,也定义了时延性能参数,并给出了暂定的i p 分组传送可用性指标,在5 分钟 时间间隔内端到端的i p 分组传送丢失率不大于7 5 。尽管当前i p 电话还存在诸如质量问 题和i p 电话网关在不同的厂商之间不能互联互通等问题,但数据、语音和图像的三网合一 一定是未来发展的方向之一。或者说,i p 网是网络发展方向之一。而且2 0 0 1 2 0 0 4 年左 右,i p 电话将会有一个较大发展。因此,i p 电话的发展与成长是必然的。 第三节课题的研究背景和研究任务 3 1 课题的研究背景 3 1 1 研究课题的应用背景 语音检测和噪声抑制的算法研究,是根据下属的实际课题的需要提出来的。这是一个 语音处理系统,具体的任务是通过一个程控交换机和语音检测板对信号的存储转发实现单 工步话机( 即对讲机) 和普话电话的通信。如图1 - l o 所示: 第一章语音处理概论 图卜1 0 接入电话网的对讲机系统工作简图 这是一个战地对讲机系统,战地对讲机与普通对讲机一样,是以单工方式通讯的。由 于战场指挥方便的需要,目前需要将战地对讲机网络接入普通电话网络,b h 实现对讲机与 普通电话系统程控交换机之间的连接。由于普通电话是双工的,要完成与单工的对讲机之 间的通讯,需要实现对电台接收、发送状态的切换。当电话网向对讲机系统有语音信号时, 需要程控交换机的电台处于发送状态,反之,电台处于接收状态。这一步工作对于对讲机 是靠一个p t t 键人工操作实现的,当需要说话时,按下p t t 键,让电台处于发送状态, 否则处于接收状态。当一台程控交换机需要实现与多路对讲机之间的通讯,切换工作由人 工实现显然是非常烦琐,而且很难做到及时快速的切换。因而希望能够实现对语音信号进 行实时检测,从而实现电台工作方式的自动切换,这就是语音信号的检测问题。由于战地 的环境噪声比较复杂,所以要完成语音的成功检测,就需要能判别声音信号属于语音还是 枪炮等噪声。另外一方面,战场上复杂而强烈的噪声,严重的影响了通话人之间的交流, 所以这里需要一种能够抑制语音噪声的算法,使接受方收到的是比较清晰的语音。 第一章语音处理概论 3 1 2 语音检测系统的地位与功能 如图l 所示,语音信号检测板处于电台与程控交换机之间,通过接口板同时与程控交 图1 1 1 每路话音接口示意图 换机及电台连接。其主要功能是对输入的信号进行计算,判断是否为语音信号,用以对电 台的工作方式进行控制。显然,语音检测的效果直接影响着电台工作方式的控制是否正确, 迅速。毫无疑问,语音检测系统在整个项目中有着举足轻重的作用。图1 1 l 为一路话音信 号接口示意图。从图中可以看到,每一个通道的信号有上行、下行两路,且每路均有各自 独立的时钟。由于每路信号在处理过程中均有延时,为了实现处理后的信号不会产生丢字 现象,需要对各路信号进行存储转发。另外,每一帧信号处理后需要输出处理结果,故每
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年产品推广活动函(5篇)范文
- 电子产品电池供应商质量不达标暂停供货通知4篇范本
- 系统维护期间服务变更说明4篇范文
- 医院放疗科三维水箱测量系统探头安全评估标准
- 玩具配件供应商资质认定流程变更公告(7篇)
- 医院医用直线加速器机房混凝土浇筑施工作业指导书
- 医院反物质治疗知情同意书签署指南
- 在线支付平台服务流程升级沟通函7篇
- 旅游产品策划师行程设计与市场反应绩效衡量表
- 员工月度工作考核表
- 宠物友好空间建设方案
- 幼教考试推理题目及答案
- 卫生院缺药登记制度
- (2026年)眩晕患者的中医护理及健康指导课件
- 2025年大学护理学(高级护理实践)试题及答案
- (正式版)DB61∕T 1989-2025 《 土地整治项目耕地等别评定及产能评估技术规范》
- 卫生监督协管员培训考试题及答案
- 床轮椅转移课件
- 软件需求迭代开发服务合同协议
- 第1-2章阶段性学习巩固月考模拟卷2025-2026学年(北师大版)九年级数学上册(含答案)
- 专升本《西方经济学》模拟试题和答案
评论
0/150
提交评论