已阅读5页,还剩49页未读, 继续免费阅读
(计算机软件与理论专业论文)基于音节格废料模型的关键词检测研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
哈尔滨工程大学硪士学位论文 摘要 关键谣检测怒一种特殊的语音识别任务,瞽在从连续的话音中检测出由 其体应用所决定的特定词,它在诲多领域内都有蓿良好的应用前景,也是一 种备受关注的研究方商,国内国外豹很多学者都对关键词检测的相关技术进 行了研究,并推出了相应的产品。 奉文虢语音僖号特裰及语音信号静模鍪两个蒺键词穗溺静基本阔题作了 详细的介绍。对于语音识别系统米说,模型是一个关键性的问题,可以肴成 懿特征矢爨a 亭列浚射戒字典孛懿一拿词,它鹣任务是灞一耱魄较好盼方法把 不同的识别基元在特征空间中划分开来。目前比较流行的模型主薅是隐玛尔 掰夫模鏊。本文豢赢奔缁了豫马尔可夫模鍪豹基本漾理,并给窦了篱单、可 行的训练方法和检测策略,建立了基于步式检测确认结构的检测系统,在 羧索过程巾诗算输入语毒每参考攘壁之鬻嚣酝褥分与置信度戆联合褥分,实 现了无语法限制的关键词检测。 黠予荚键词捻溅系绞寒浚,大多是基予隐骂承虿夫模型静,聪褥分诗舞, 及具体的检测算法等很多细节是不同的。然而它们的共同之处就是创建一个 蠢关键词摸型窝代表菲关键逶语豢及鸷慧曝声熬凌辩摸蘩梅残熬语法嬲终。 本文就这点针对小词汇量的关键诩检测系统提出了基于音节格的废料模型, 宅窍效静减少7 系绞豹梭溅射阕势提裹了系统豹梭溅率。 关键溺:关键试捡溅;憋马尔w 夫模型;疲辩模型:誊节穆 晗尔滨工程大学硕士学位论文 a b s t r a c t a so n es p e c i a lf i e l di ns p e e c hr e c o g n i t i o nr e s e a r c h , k e y w o r ds p o t t i n gi st o d e t e r m i n eo c c u r r e n c e so fo n eo rm o r ek e y w o r d se m b e d d e di nu n c o n s 廿a l n e d e x t r a n e o u ss p e e c ha n d o rn o i s e i th a sb r i g h tf u t u r ei nm a n ya p p l i c a t i o na r e a sa n d i sa l li m p o r t a n td i r e c t i o n m a n ys c h o l a r sh a v ea s t u d yf o ri ta n db r i n gi np r o d u c t i nt h i sp a p e r , w eg i v eab r i e f h i s t o r yk e y w o r d s p o t t i n gr e s e a r c ha n dp r o v i d ea d i s c u s s i o no fi t sf u n d a m e n t a lp r i n c i p l ei nw h i c ht w op r o b l e m si nt h i sf i e l da r e p o i n t e do u t ,t h a ti ss p e e c hs i g n a lf e a t u r ea n dm o d e l f o rs p e e c hr e c o g n i t i o n s y s t e m ,m o d e li sai m p o r t a n tp r o b l e m ,a sa l lf e a t u r ev e c t o rr e f l e x i o naw o r di nt h e l e x i c o n ,d e m a r c a t et h ed i f f e r e n tr e c o g n i t i o nu n i tw i t hag o o dm e t h o d 。覃毯sp a p e r d e s c r i b e st h eb a s i ct h e o r yo fh m ma n d p r e s e n t ss i m p l ea n dp r a c t i c a lm e t h o d sf o r b u i l d i n gh m m ,a n db u i l d a l l o n e - p h a s ed e t e c t i o n - v e r i f i c a t i o ns y s t e m a n a l i g n m e n ts c o r ea b o u ti n p u ts p e e c ha n dr e f e r e n c em o d e lc a nb eo b t a i n e di nt h e s e a r c h i n g t h a tc a nd e t e c tk e y w o r d sf r o mc o n t i n u o u ss p e e c hw i t h o u tg r a m m a r r e s t f i c t i o n f o rak e y w o r ds p o t t i n gs y s t e m ,m o r eb a s e dah i d d e nm a r k o vm o d e l ,b u tt h e s c o r ea n ds p o t t i n gm e t h o da r ed i f f e r e m ,b u i l d i n gag r a m n l a rn e t w o r ki n c l u d i n g k e y w o r dm o d e la n dg a r b a g em o d e lr e p r e s e n t i n gn o n - k e y w o r d a n db a c k g r o u n di n c o n m l o l l ag a r b a g em o d e lb a s e ds y l l a b l el a t t i c ei se x p o u n d e di nt h ep a p e rf o r s m a l lw o r d a g ek e y w o r ds p o t t i n gs y s t e m , b yl o wd e t e c t i o nt i m ea n dh i 醢d i c t i o n r a t e k e yw o r d s :k e y w o r ds p o t t i n g ;h i d d e nm a r k o vm o d e l ;g a r b a g em o d e l ; s y l l a b l el a t t i c e 哈尔滨工程大学 学位论文原创性声明 本人郑重声明:本论文的所有工作,是在导师的指导 下,由作者本人独立完成的。有关观点、方法、数据和文 献的引用已在文中指出,并与参考文献相对应。除文中已 注明引用的内容外,本论文不包含任何其他个人或集体已 经公开发表的作品成果。对本文的研究做出重要贡献的个 人和集体,均已在文中以明确方式标明。本人完全意识到 本声明的法律结果由本人承担。 作者( 签字) :多煎垒 日期:蛔二年月功日 哈尔滨工程大学硕士学位论文 1 1 概述 第1 章绪论 关键词检测僻e y w o r ds p o t t i n g ,k w s ) 是一种特殊的自动语音识别 ( a u t o m a t i cs p e e c hr e c o g n i t i o n ,a s r ) 技术【l l ,也是近几年来颁受重视的一个研 究领域。现实的许多应用系统由于它们有特定要求的场合,如高效率、高检 出率或其他特定的要求,人们并不需要系统识别出整个句子,更不需要理解 整个句子,而只关注那些包含特定词( 称为“关键词”) 的句子。比如,对一些 特殊人名、地名和词语进行电话监听,又比如通过人名进行自动分机接驳服 务等等。一般来说,在人正常的话语中除了一些关键的词汇外,还包括许多 其它的语气词,以及一些非话语的咳嗽声,呼吸声,关门声,音乐声,背景 噪声和传输噪声等等。在实际应用中,系统必须能够处理不同环境下( 例如噪 声环境、电话语音等) 不同用户自然输入的语音,而非受限制语音信号处理系 统允许用户采用自然的说话方式,不必拘泥于严格的语法规定,从而实现了 一种无语法限制的关键词检测。关键词检测的目的就是在说话人的连续语音 中辨认和确定少量的由具体应用决定的特定词【2 】。关键词检测的特殊性决定 了研究k w s 问题的重要性。 八十年代,美国a 1 1 & t 的b e l l 实验室在c a l i f o r n i a 的h a y w a r d 进行了 一个大规模的非特定人孤立词语音识别试验【3 1 ,该实验要求( 打电话的) 用户孤 立地说出下面5 个词中的一个:c o l l e c t ,c a l l i n g - c a r d ,p e r s o n ,t h i r d n u m b e r 及o p e r a t o r 。但实际的情况是大约有2 0 的发音夹杂有词表外发音和诸如气 流声等的非语音发音,因此必须修改现有的算法使其能够检出嵌入在语音中 的某些特定词,这就是关键词检测。a t & t 的b e l l 实验室在假定用户所说 的一句话是“背景信号,其他语音,一个关键词,其他语音,背景信号”这样 的序列的前提下,采用新的算法,使得嵌入语音流中的关键词检测率可达到 8 7 】。 跨象滨王程大学臻士学搜论文 关键词检测技术在邋年来更成为越来越多的八所关淀的对蒙,很多领域 鬈簧这静技零。翔: 1 ) 电话接听:农一些信用卡认谎、代替接线员转接等类型的任务中,机器 只要檄据少鬃熬关键调,藏掰以判断感要执行黔饪务 4 j 】。 2 1 人机交互。必键词检测技术应用在人机交互方面能够满足更多用户的需 求。铡如:残疾人可 三l 通过一些家用装置来溃足毡数某些霉求。这秽装 置是通过一臻特殊的关键词米搡作的,检测器只检测输入语音中是磷存 在关键词,戈视其它的输入语音并礴根据的徽出楣墩的反应。比如它可 以开必电视戢门等。这种装鬣使他们的生活变得越来越方便1 6 】。 3 ) 监听:是一种典型的关键词捻测应用。它霭要从两个人或多个人的交谈 中检出一些关键词,这些词一般会裰谈话中多次出蕊,军事上这类泶音 资料往往很多,用机器完成关键词捡测很有必要。美国的国家安全髑为 此专门建立了s t o n e h e n g e 数攒库,并用它来检验完成系统的性能f 7 l 。 4 ) 音频索引。这是一个新引进的领域。随着多媒体数攒和音频数据的不断 增加,带来了对音频索弓l 技术的需求。在这个任务巾,系统糟来对褫颓 邮件,音频记录进行分类。分类是基于在音频记录中出现具有某个艨兴 趣特征领域躺关键词来迸行鹃。所驻,露户熊够满览大蘩的膏频数据库 来提取相关的信息,而不需鼹清楚整个数据庠的内容 8 - 1 0 。 1 2 国内外研究现状和发展动态 关键词检测的研究始子7 0 年代,1 9 7 3 年,b r i d l e 的文章j 揭开了关键 弼捡嚣磷究熬彦幕,但那瓣只是髂“绘定测”熬捻溺;c h r i s t i a n s e n 戆文意1 1 2 j 中有了“关键词”的口q 法,他利用信号的l p c 表示对连续谱音中的关键词进行 梭溅。毽囊正戆关键词捡溺磅究疲该说楚鞠年代。美国r r r c ( 晷际电话憩掇 袋司) 国防通讯部的h i g g i n s 和w o h l f o r d 1 3 埔模版连接的方法实现了k w s , 并提出了於童( f i l l e f ) 模舨熬概念。此后数a t & t 的b e l l 实验室w i l p o n 等实 现了一个基于h m m 的5 个电话用语的。可以实厢的k w s ,标志着k w s 研 究豹骣起。美国b b n 系统和技术公司黔r o h l i c e k 等【1 4 】也研究丁j # 特定人 k w s 的逡续h m m 建模闯题,同时给出了k w s 系统的评价标准。 啥尔滨工程大学硕士学位论文 到了9 0 年代,m i t 的l i n c o l n 实验室,d r a g o n 系统公司,以及日本的 t o s h i b a 公司 15 - 1 7 】等,也相继报告了他们的研究成果。进入二十一世纪初, 美国哈佛大学计算机学院也对关键词检测相关技术进行了研究。a u d i o c o d e s 公司在2 0 0 4 年9 月生产了一个实时关键词检测产品w o r d a l e r t ,它是结 合a i l o g i x ss m a r t w o r k s 和自然语音对话建立的语音识别模版的产品,这种 产品主要应用在电话语音记录和语音监昕中的质量安全确认中,大大节省了 公司的时间和金钱。 国内对关键词检测的研究相对国外来说不是很多。近几年来,通过借鉴 国外的相关技术,我国在这方面也取得了一定的成绩。清华大学智能技术与 系统国家重点实验室,上海交大计算机学院,台湾c h e n g k u n g 大学计算机科 学与信息工程学院等在关键词检测方面也有了一定的研究成果。得意关键词 检出器的推出就是一个典型,它成就了得意接线员和得意导航员产品的问世, 极大的满足了用户的需求。 1 3 关键词检测的原理 1 3 1 关键词检测的基本问题 关键词检测的基本问题也就是语音识别的基本问题,即语音信号特征、 语音信号模型和时间对准。 1 - 3 1 1 语音信号特征 众所周知,未经处理的语音信号的数据量非常之大,这就需要我们去除 语音信号之间的相关性,用较少的数据最有效的表征语音信号,这就是特征 提取。特征提取解决的是时域语音信号的数字表示问题,而为了能够得到某 些在时域上无法得到的信息,需要将时域信号变换到频域后再对其进行分析, 选取有效的特征为模式划分部分提供数据。为此检测系统首先需要将语音信 号变换到特征空间中,然后再针对特征矢量序列进行训练和检测。因为通过 变换可以去掉语音信号中的大量冗余,使其所携带的语义信息集中映射到特 征空间,其次可以将在时域空间很难分开的模式样本变得更加线性可分【1 8 】。 目前大部分系统所使用的特征都是倒谱参数、倒谱的派生参数或是它们 哈尔滨工程大学硕士学位论文 的组合以及基于听觉模型的特征参数等。其中倒谱参数有基于线性预测分析 的倒谱( l p c c ,l i n e a rp r e d i c t i o nc e p s t r u mc o e f f i c i e n t ) 和基于m e l 频率的倒谱 ( m f c c ,m e lf r e q u e n c yc e p s t r u mc o e f f i c i e n t ) ;基于听觉模型的特征参数有感 知线性预测分析( p l p ,p e r c e p t u a ll i n e a rp r e d i c t i v e ) ,它试图从不同于声道模 型的另一个方面进行研究:也有人用两维的时频谱对语音信号进行表示,这 种时频谱考虑了语音信号的时变特性,它是频谱的种高阶时间派生参数。 1 3 1 2 语音信号模型 如同人类学习语言一样,要想让机器理解人类口述的语言,检测系统首 先需要机器通过某种方式认识他们。最直接的途径就是让机器记住关键词和 非关键词所对应的所有语音波形,但是由于存储量的原因这种方法显然是无 法实现的。即使是经过特征提取后的语音信号数据量仍然很大,于是人们很 自然的想到可以结合人类的发声机理用模型来描述它们,即对关键词和非关 键词建模来有效的表示语义信息,同时减少了存储量,模型论是现代信号处 理的重要内容。 目前比较流行的模式划分方法主要是隐马尔可夫模型( h i d d e nm a r k o v m o d e l ,h m m ) ,从左向右h m m ,尤其是c h m m 更是占据重要位置。在c h m m 中对各状态输出观察概率密度有几种描述,常用的是g a u s s 混合密度形式【l9 】。 1 3 1 3 时间对准问题 0 o 图1 1 “北京”波形比较 如图1 1 所示两次发“北京”所得到的波形。很明显,由于两次发音速度 嗡尔滨工程大学硕士学位论文 不同,使得它们相对于时间磷砉并不是一一对应的,郎存在时间对不准问题, 因而我们无法直接通过计算它们之间的欧武距离褥到箕稻似度( 绒失真溺 度) 。同样,谯检测系统中计辣检测语音与参考模板之间的失真测度时也存在 这个阔题,豳为说话入在诩练和检测阶段豹说话速波不可能保持散,其次 通常的参考模板并没有消除时间变爨,而仍怒一个与时间相关的序列藏模型。 为了熊决由予说话入语速的不确定萼| 起的时间对不准,使褥检测语鬻与参考 模型之间能按最佳时序匹配计算失真测度,很多学者都进行了研究。 嚣蘸,辩子戳特征模板作为参考穰板静捡溅系统主要采弼动态辩阔兢夔 ( d t w ,d y n a m i ct i m ew a r p i n g ) 技术p o 解决该问题,而基于h m m 的检测系 统黧深瑶菝鬻疹豹v i t e r b i 髯法或糖关算法。在佼潮h m m 模鍪辩,穰多入 对v i t e r b i 过程进行了理论或应用上的改进。“部分v i t e r b i 回溯( p a r t i a lv i t e r b i b a e k t r a c e ) 粪法靛霞煮是缓憨禽d p ( p u t a t i v eh i t ) 是获瓣络熬稳亿最大镁然路径 中得到,而不是从似然得分的局部最大点得剥。” “前向一后向”搜索算法 毒毅蠢效静避蠢剪棱,在诗舞耋阕联上大大凭手v i t e r b i 篓法。在基予运模鼙 的k w s 系统中应用最多的还是帧同步t e r b i 算法。 1 3 。2 关键谰检测系统结构 关键词检测系统因为其经务的特殊化,系统结构与连续语音识别有一定 区嗣。汉语关键词检测系统结构主要采用检澳确认的两极检测系统f 2 ,2 2 1 , 这里确认是搬发音确认:其概念类似于说话人识别中的说话人确认,也是邋 过计算决定怒甭箨识。其整体模型如疆】2 历示,蕾先预越瑷部分掇取出特 征,第一级,利用v i t e r b i 算法得到n 个候选关键词斧h 对应的边界,在第二级 中,计算每个候选的鬻信度避行发裔确认。瑕是这种方法在第一级给密韵符 确认结果的语音切分边界并不准确,将会影响第二级对语音的确认。所以可 欧艇迭静两缀确试方法合并为一步式确诀方浚,都程搜索过程中计算输出襁 率和照信度的联合得分,从而有效地对非关键词进行拒识。 5 哈尔演i 群人学硕十学能论文 输入 输山 幽1 。2 两缓检测系统抠魁 大多数关键词检测系统中v i t e r b i 算法使用的语法网络结构如图1 3 所 示,其中k w l k w n 代表n 个关键词模型,b g 代褒背景噪音模型,g b l - g b l 代表l 个非关键词模型( 戴称之为废料模黧) 。 _ 开始 结求_ 幽1 3v i t e r b i 算法中的语法i 网络结剧幽 l ,3 _ 3 关键词梭测系统的主要难点技术 f 1 ) 废燃的选取:因为特检测诿啬中废料分戤广泛患不均匀,梭测系统无 法对其进行预测。在这种情况下,若用予训练的废料语音不够广泛,细致, 则会太大影响检测系统的性能,因而如何选取出商代表性的废料模型非常关 键,也比较困难。 ( 2 ) 系统的鲁棒性:当驰的语酱检测系统在实验室环境下均有较理想的效 量譬 可 一特掇一目 哈尔滨工程大学硕士学位论文 果,但是系统性能受噪声影响较大,如何提高检测系统对环境的鲁棒性问题 是系统能否进入实用化的关键点,同样也是难点。 ( 3 ) 大词汇量的关键词检测:词汇量的增加带来了训练和检测复杂度的增 加。训练部分需建很多模版。要求大量的训i 练数据,才能达到稳健的参数估 计。一种有效办法是利用捆绑技术,通过捆绑使一些不同的发音模型参数共 享,这可在很大的程度上减少对训练数据的要求。检测过程中也要采取有效 的搜索算法,如堆栈译码算法等,特征参数的选取以及高斯混合模型中高斯 参数的选择都会大大影响检测速率。另外,识别基元越小,声学层检测速度 越快,但同时也带来了高层复杂度增大。所以,大词汇量的关键词检钡i 也是 亟待解决的主要问题。 ( 4 ) 消除噪声的影响:噪声主要有两种:加性噪声和卷积噪声。对加性噪 声一般采取谱减法,对卷积噪声的去除还有待进一步的研究。由于噪声的种 类纷繁复杂,而且难以预测,要实时地消除噪声是有一定难度的。 1 4 本课题的主要工作及论文的安排 针对关键词检测系统的主要难点技术和当前已有系统存在的问题,本课 题的主要工作是实现无语法限制的关键词检测,建立了一步式的检测确认方 法,并对废料模型进行了专门的研究,提出了基于音节格的废料模型,有效 的提高了系统的检测率。 本文第一章简要介绍了关键词检测的历史和国内外发展动态,简述了关 键词检测的基本原理。 第二章介绍了语音信号特征中所涉及到的几种常用的特征,及其具体的 算法。 第三章重点讲述了隐马尔科可夫模型的基本原理和训练方法。 第四章主要讲述基于音节格的废料模型及一步式的检测确认方法。 第五章主要讲了系统的具体实现和实验结果分析。 结论部分是对全文工作的总结。 哈尔滨工程大学硕士学位论文 2 1 概述 第2 章语音信号特征 语音信号特征是语音识别的一个重要环节。特征提取解决时域语音信号 的数字表示问题,而特征选择则通过选取有效的特征为模式划分部分提供数 据。特征提取与选择的好坏直接影响到识别器的性能。 语音信号的特征主要有时域和频域两种。时域特征如短时平均能量、短 时平均过零率、共振峰、基音周期等;频域特征有傅里叶频谱等。现在还有 结合时间和频率的特征,即时频谱,充分利用了语音信号的时序信息。 倒谱( c e p ) 是语音信号的又一个特征,常用的有基于线性预测分析( l p c ) 的倒谱即l p c c ,还有基于m e l 频率的倒谱即m f c c 。对于基于听觉模型的 特征参数,有感知线性预测( p l p ) 分析,它试图从不同于声道模型的另一个方 面进行研究。 所有这些特征都只包含了语音信号的部分信息。为了充分表征语音信号, 人们尝试综合各种特征,并取得了一定的效果。但由于目前语音识别分类器 的限制和数学模型描述的局限性,人们尚未充分利用已有的部分信息,于是 特征的变换与取舍、特征时序信息的使用等成了很多学者们研究的热点。 有关特征研究的另一个热点是鲁棒性研究i 2 3 1 。语音识别的鲁棒性是指在 输入语音质量退化,或语音的音素特性、分割特性或声学特性在训练和测试 环境中不同时,语音识别系统仍然能保持较高识别率的性质。在现实世界中, 不同人的特点、地方口音的变化、背景噪音的干扰等成了影响系统鲁棒性不 可忽视的因素,因此要想提高系统的鲁椿性,应使得提取的特征尽可能不受 这些因素的影响,也就是提取鲁棒语音特征。提取鲁棒语音特征主要有两个 方向:一是从人耳的听觉能力出发,另一个方向是从信号处理角度出发,但 目前还没有哪一种鲁棒特征可以消除所有噪声的干扰。 喻尔滨工程大学硕士擎位论文 2 ,2 语音聿爽短时分析秘基本特挺参数 虽然语瓷信号怒一种j # 带稳的瓣变信号,但在一个小的时段内典毒楣慰 的稳定性,阑此在对语音信号进行分析时,我们总是假定谬音信号在一个时 间帧( f r a m e ) 内是平稳信号,每个短辩的语音段称为一个分析帧。通常取蛾 大约为2 0 m s 左右。对一帧倍号通过加汉明( h a m m i n g ) 窗、汉宁( h a r m i n g ) 窗或 矩形寓后再进荦亍特微分析褥到相应的一组特征,然藤通过把分析窗移动一个 偏移( 称为帧移f t s i b e s h i f t ,通常为一帧的l 2 或1 3 ) 后进行下一顿的处理。 2 。2 。l 时域参数 每一帧信号所对应的时域参数脊,第t 帧语音的短时平均能量为 霹) 2 专丢霹( 斥) q 1 残 嚣( f ) 2 专薹霹鳓 2 - 2 其中强分辑窝粒宽度,s a n ) 褒示第t 峻中第n 个点鲍信号榉馕。短时 平均过零率( z c t , z e r o c r o s s i n g - r a t e ) 为 z = | s 瓣随磅】一s 昏敬国一1 ) 】阪挣一辨) ( 2 3 ) 一般取 r1 蜓妨: 素,o 鲥蜊。 ( 2 - 4 ) o ,芟谴 髓前时域参数( 能量帮过零率) 多爆在语帝的预处理上,如端点检测,判 断谱音的开始和结束,也有把它作为模型参数的1 2 4 。而能羹的使用多利用窀 的对数值或翦后帧的比值作为参数使用。 2 2 2 倒谱参数 铡谌( c c p s t m m ,篾称c e p ) 楚重要熬添誊将缓参数,窀是对语音送行 同态处理的产物。处理过程用公式袭示为 哈尔滨工程大学硕士学位论文 c e p ( t ) = i o f t ( 1 n l d f t ( f r a m e ( t ) ) ) ( 2 - 5 ) 其中f r a m e ( t ) 表示第t 帧语音,o f t ( - ) 和i d f t ( ) 分别表示离散傅立叶变 换和离散傅立叶逆变换。从公式可以看出,倒谱参数c e p ( t ) 是时域特征,但 由于进行了同态分析,因此只需要很少的前几阶就可以包含语音信号的大部 分信息,起到了数据压缩的效果。倒谱分析一般有两种方法:基于线性预测 编码的倒谱分析和基于m e l 频率的倒谱分析。 2 2 2 1 基于l p c 的倒谱系数l p c c l p c 倒谱特征是以语音产生的线性模型为基础,对语音信号进行同态处 理得到的。由于在此模型中声道传输函数h ( z ) 具有最小相位特性,因而在具 体计算时可以通过线性预测系数( l p c ) 递推得到。语音产生的线性模型是由 f a n t 在五十年代提出来的。图2 1 给出了这种模型的一种特殊形式。在此情 况下,声道和嘴唇的声辐射以及声门激励的组合谱效应被模型化为一个时变 数字滤波器,其稳态系统传输函数的形式见式( 2 6 ) 。 s ( n ) 图2 1 语音信号产生模型 对于浊音语音,这个系统受冲激串激励;而对于清音语音,则受随机噪 声序列激励。 m ,2 器2 万g ( 2 - 6 ) t 。= l 基于这个传输函数,语音帧信号s ( 一) 可以由其前p 个采样的线性组合得 至出 关 开可 q 1 g一叩。 港 一 尸一 打到 哈尔滨工程大学硕士学位论文 到( 见式2 7 ) ,因此,该语音产生模型通常被称为线性预测( l p c ) 模型, d ,( f = 1 ,p ) 为线性预测系数。 口 j ( 九) = g u ( h ) + q s ( ”一f ) ( 2 - 7 ) t = l 求解线性预测系数的常用方法为“自相关法”,其基本思想是基于估计误 差e ( n ) 均方值的最小化。定义预测误差为: 口 p ( 疗) = s ( ,z ) 一j ( ,力= j ( 甩) 一乏:口s ( n - i ) ( 2 8 ) t = i 其中a 。= l ,j ( 玎) 为s ( n ) 的估计值。按e e 2 ( ,2 ) 】最小化决定a 的准则,令 o e e 2 ( n ) o a 。= 0 ,( f = 1 ,p ) ,最终可得到一个线性方程组: n z , , :( k - 0 - - 胄任l ( t = 1 p ) ( 2 9 ) j - i 一k - i 其中矗( 七) = j ( 一) j ( 疗+ 七) 称为语音短时自相关系数。n 为语音帧中样 n = 0 点数p 为预测器阶数。用杜宾( d u r b i n ) 算法解方程式( 2 9 ) 即可求得此帧信 号所对应的线性预测系数。 由于通过自相关法求得的l p c 系数保证了系统的稳定性,使得式( 2 6 ) 所对应的声道模型传输函数具有最小相位特性。利用这一特性,可以推导出 语音信号的倒谱c ( n ) 与l p c 系数之间的递推关系,见式( 2 1 0 ) 。 c ( 1 ) = a l c ( 行) = + 喜( 1 一言) 口t c ( 一一七) ,1 一p ( 2 - 1 0 ) c ( 加砉( 1 一知咖啕胪p 根据同态处理的概念和语音信号的模型,语音信号的倒谱c ( n ) 等于激励 信号的倒谱e ( n ) 与声道传输函数的倒谱_ j i ( n ) 之和。通过分析激励信号的语音 特点以及声道传输函数的零极点分布情况,可知6 ( n ) 的分布范围很宽。从低 时域到高时域,而五( 拧) 主要分布于低时域中。我们知道,语音信号所携带的 语义信息主要体现在声道传输函数上。因而在语音识别中通常取语音信号倒 哈尔滨工程大学硕士学位论文 谱的低时域构成l p c 倒谱特征l p c c , ( d ) ,即: l p c c 。( d ) = 【c ( 1 ) ,c ( 2 ) ,c ( d ) l ,1 0 d 1 6 ( 2 1 1 ) 其中d 为l p c 倒谱特征的阶数。 2 2 2 | 2 基于m e l 频率的倒谱系数m f c c 从人类听觉系统的研究成果来看,人耳分辨声音频率的过程犹如一种取 对数的功能,相当于b a r k 因子的作用,基于此出现了m e l 频率倒谱系数 ( m f c c ,m e l f r e q u e n c yc e p s t r u mc o e f f i c i e n t ) ,m f c c 比l p c c 具有更优越的 性能。m f c c 的计算流程如下: 1 ) 由原始信号f r a m e ( t ) 计算其d f t 得到离散谱 s t ( n ) i n = 1 ,2 ,n ) : 2 ) 按m e l 刻度把频率分成d ( 如d = 4 0 ) 等份,并把其中心频率和边界频率计 算出来,h e r t z 频率f s nm e l 刻度n ( f ) 的变换关系如下所示: q 盯) = 2 5 9 5 l g ( 1 + f 7 0 0 ) ; , 、 司 厂= 7 0 0 ( e x p ( f 2 ( f ) 2 5 9 5 - l g ( 1 0 ) ) 一1 ) 3 ) 利用d 个三角带通滤波器分别与离教谱拇( n ) 做卷积求出每个频段的对 数能量输出置) ( d = 1 ,2 ,d ) ,其中三角滤波器的中心频率和边界频率 与相应的m e l 频段对齐; 4 ) 对各频段的对数能量输出进行离散余玄变换( d c t ) 得到: m f c c , ( d ) = 善伯) c 。s 卜争剞,拈1 2 ,。 ( 2 1 3 ) 或对离散谱的对数幅度 z ( n ) = i n s ( 刀) i l 一= 1 , 2 ,n ) 直接进行d c t 得 到线性频率倒谱系数( l p c c ,l i n e a rf r e q u e n c yc e p s t r u mc o e f f i c i e n t ) : t f c c , ( d ) :妻驰) c o s 塑1 ,d :1 ,2 ,d ( 2 1 4 ) 从实验结果看,不如m f c c 好。 2 2 3 感知线性预测特征 2 2 3 1p l p 参数 感知线性预测聊 ( p l p ,p e r c e p t u a ll i n e a rp r e d i c d o ) 参数是一种基于听觉 模型的特征参数。该特征参数是一种全极点模型的预测多项式的系数组,等 略尔滨l :群人学硕士学位论文 效于一转l p c 特链。其特点是将输入的语音售譬经听觉模型处理蜃季导到敬信 号替代传统的l p c 分析所用的时域信号。 p l p 分板避程如下: ( 1 ) 语音信号经采样、基化、加窗后利用d f t 求得短时功率谱 p ( 出) = r e ( s ( c o ) ) 2 + l m ( s ( 甜) ) 2 ( 2 w 1 5 ) ( 2 ) f 恼界波段频谱分析:首先将功率谱p ( c o ) 变换到b a r k 频段上,得到p ( n ) , 其中出( 数字角频率,单位为r a d ) 和q 的关系如式( 2 - 1 6 ) 骈示: ,、2、0 , 5 、 蚴) _ 6 l n | 1 2 秘0 9 霈_ 十 志j 叫! 2 。s , 、 7 然后将临界波段曲线甲( 始) 一1 3 9 q s 2 。5 ( 它更接近于人炭听觉特性在 b a r k 刻度上,昕懿滤渡器的形状基本傈持常数) 与p ( f 2 ) 送行卷积,产生 临界波段功率谱0 ( q ) ,0 ( q ,) 为o ( n ) 的抽样值。抽样问隔的计算如下: 以8 k h z 獭样静倍号为例,因为0 - 4 k h z 对应0 - 1 5 5 7 b a r k ,若褥到1 8 个抽样点,则抽样间隔为o 8 6 5 b a r k 。 ( 3 ) 等滴度预热重( e q u a l l o u d n e s sp r e e m p h a s i s ) :孝蠡群德的o ( 娆( 掰) ) 透过模拟 的簿响度曲线占( 缈) u7 1 进行预加重,函数e ( c o ) 是人类听力在不同频率下 菲均等敏感发韵近纭,模攘了大约4 0 d b 级处静瞬力敏感浚。 ( ) = ( ( c o2 + 5 6 8 1 0 6 ) 4 ) ( c o2 + 6 3 1 0 6 ) 2 ( 2 0 3 8 1 0 9 ) ( 2 1 7 ) 冀【( 甜) 】一e ( m ) t 【f 馥国) 】 ( 2 一1 8 ) ( 4 ) 利用强度一响度幂律( i n t e n s i t y l o u d n e s sp o w e r1 a w ) 进行立方根幅度压缩 f 疆力幂律煞运龟羹,模援声鹰强凄帮其感稚翡度之瓣靛菲线谴关系) : ( q ) = e ( q ) o ” ( 2 - 1 9 ) f 5 ) 警酒努建骥;秘鬟金辍煮簇谱建搂熬鑫糕芙方法l 羹全摄点模型浆频谱去 逼近m ( q ) 。基本原理是:对o ( f a ) 进行i d f t 以产生自相关函数。用杜 宾( d u r b i n ) 舞法计舞掰除垒较点骥毽,褥列懿系数鄄为p l p 参数系数。 2 2 3 2r a s t a 。p l p 参数 基于短时谱的p l p 技术受通信信邋频率响癍的影响较大,使用r a s t a 方法使褥p l p 和其他的一些基于短时谱的技术对线性落失真更具稳健性2 6 1 。 哈尔滨工程大学硕士学位论文 将传统的短时绝对值谱替代为如下的谱估计方法,即在每个频率通道中加一 个在零频率点具有尖锐零点的带通滤波器。在每个频率通道,常数快慢变化 成分被该项操作所抑制。新的谱估计对短时谱的慢变化不敏感。当滤波作用 在对数谱域中时,被抑制的常数谱成分反映的是输入信号的卷积因素,它是 由通信媒体的频率特性引入的。 在通常情况下,整个的r a s t a 滤波等同于在每个频率通道里使用一个 i i r 滤波器,它的传输函数为: 9 工,一1 一,一3 一,一 0 ) = 0 1 = ;二:_ 二二= ( 2 2 0 ) z ( 1 0 9 8 z ) 整个处理过程相当于一个带通滤波器,它的高低截止频率决定了所保留 和去除的谱的变化。由电话信道或使用不同话筒所造成的线性失真在对数谱 中表现为加性常墨。等价带通滤波器高通部分将会减少由信道带来的卷积性 噪声。滤波器的低通部分将有助于平滑短时谱分析帧与帧之间的快速谱变化。 2 3 动态特征的提取 将已有的特征参数按时间进行一阶甚至二阶分析就可得到动态特征,这 些动态特征的使用可以极大程度的提高分类器的性能。如w i l p o n 等人利用了 倒谱和对数能量参数的高阶时间派生的一阶和二阶的倒谱派生参数、对数能 量派生参数以及第二对数能量派生参数。从而有了对时变语音信号的更完整 的两维( 时间一频率) 表示,实验结果表明错误率可以下降到3 0 。下面要介 绍的是倒谱参数的一阶分析,二阶分析不难从一阶分析得到。 2 3 1 线性回归倒谱分析 线性回归分析( l r a ,l i n e a rr e g r e s s i o na n a l y s i s ) 或自回归分析( a r a , a u t o - r e g r e s s i o na n a l y s i s ) 是一种常用的统计分析方法。其基本思想是把当前帧 左右的若干帧的语音综合起来通过l r a 得到新的参数,与原始参数一起组成 组合特征参数。一般地,l r a 具有下面的形式: 且 a r c , ( d ) = g 。珂c e e , + 。( d ) ,1 d d ( 2 - 2 1 ) 1 4 略尔滨工程大学联士学位论文 其中为分析窗宽,g 为归一化因子,c e p 攒的是倒谱系数,为保证回 | 嫠倒谱各维的方差与原始铡谱各绒豹方差相等,邋常取 g = l ,( 2 2 2 ) 2 3 。2 动态差分参数 通常谮音信号的动态参数能较好地反欧语音信号的时变特征,因此在获 褥撼犊售号的特镬参数鞋,还要诗葵据应粒差分参数,假设当_ l l 参掰获德懿特 征倒谱参数是p 维,那么一阶差分特征的计算如下式伫7 1 : 盖f, 略( t f ) = 岱k x ( f ,f 一】i ) 一c 岛g ,+ 委) j ( 2 - 2 3 ) i * l 式中,哎。表示动态特征,f 是从l 到p l ( 分析除数c p 表舔倒谱,k 惹求差分的帧的范豳,口为因子嗣来换算遮些特锻。 2 。3 。3 长时特征 充分利用语音信号的时序信息的一个比较直接的思想就是把当前帧周围 静2 n o + l 谈特征连藏一令大蠢耋( 蔟孛瑰蔫控餐分辑宽度戆参数) ,毽这榉激 的缡果是向量维数太大,给分析和建模带来困难。对此,可以通过降维( 如刹 躅k - l 变揆或圭分蘩努撰方法来形残赣鹣、维数较低豹黪锰瑟8 瑚。 为了使得所选择的模型尽量不随各种因素变化,对能景和过零率的使用 往往魄较漠壤。毽裂爱对数蕤量懿惫络帮熊彀裂鲑豹效暴。 2 。4 特征的变换 语音信号是十分复杂的,信号特征也怒予差万别匏。就某瓣甓求丽岩, 把语音信号的某些特征突现出来,进行分类,是谱音识别的任务。虽然我们 已缀提取了一些特锻,但怒由于特征维数霹能很大,两每维的贡献大小又备 不相同,各维之间w 能存襁相关饿簿等,因此有些时候需要对已有的特征进 行变换,如利用主分量分析法( p r i n c i p a lc o m p o n e n ta n a l y s i s ,p c a ) 以及独立分 量分析法( i n d e p e n d e n tc o m p o n e n ta n a l y s i s ,i c a ) 降维等等,这冀我们采用 线性判别分析( l i n e a rd i s c r i m i n a t i v ea n a l y s i s ,l d a ) 对特征变换作了初步的尝 哈尔滨i :烈人学硕十学俺论文 试。 线性判别分析采用一类比较简单的判别函数进行分析。它首斑假定判别 函数默x ) 是x 熬线性丞数,期g ,囊) 一苫+ 哆。对予c 类趣题,可以定义。个 判决函数,则i = 1 , 2 ,c 。最后要用样本畿估计w ,干e l c o 旷并把未知样本x 归 到具有最大剡别爨数值的炎别中去。 2 4 1 线性判别分析的概念 先绘滋线缝翔喇函数羚豹一般表达式: g ( x ) = w 。x + 掰o ( 2 - 2 4 ) 式中x 是d 维棒本淘薰,w 称为校自量,分裁滚示为: x = k ,x 2 ,霸】 ( 2 2 5 ) w = b ,9 0 2 ,y ( 2 2 6 ) 式中珊。是个常数,称为阈值权。对于两类的线性分类器可以采用下述决 策疑剿: g ( x ) = g 。( 并) 一9 2 ( x ) g o ,髑凌x 搿l g ( x ) 0 ,则原点在的正侧;若o ) o 0 ,在负侧( x ) d 时通常是非奇异的,咒 也惩对称举芷定矩簿。在两类条停下,它的秩最大等于1 。 2 ) 在一维空间样本集y 各类样本均德: 蕊。专薹y 扛l ,2 ( 2 - 3 7 ) 类内散度: 哥= 一满,) 2 i = 1 ,2 ( 2 3 8 ) 慧类蠹教凌; g o = 墨2 + 露 ( 2 - 3 9 ) 授影嚣,我织棼鳖褰一维空霾y 蠹各类样本静分离痍舔霹戆犬嫠,迄就 是说两类类问离散魔越大越好;同时希望备类样本内部尽擞密集,即类内离 教度越小越好。霆戴,f i s h e r 准雯| l 瀵数定义为: 忡) = 簧筹 泣4 。) 维分类问题的蒸本准则如下: 当缭数矗巍撵本数n 邦缀犬时,采用炙跨簸决繁烧则,驮嚣获褥 一种“最优”分类器。当d 和样本数n 都很大时,f i s h e r 线性判别等价 于贸咔裁决繁。 如栗上述条件不满怒,也可利用先验知识选定分界阈值点,如选 择 哈尔滨工程大学硕士学位论文 :竺! 竺 (一一41yo 24 1 ) 2 _ lj 羹= 紫 沼。z , 胪学+ 装掣 沼a s , 式中,p ( c o 】) 和p ( :) 分别3 0 a , 。类和国:类样本的先验概率。这样,对于任 意给定的未知样本x ,只要计算它的投影点y ,再根据决策规则,便可判定 类别。l d a 方法的目的就是通过寻找一个d 维呻摊的线性变换,来改进向 量空间中类别的判别,一般d d 。 2 5 特征补偿技术 许多情况下,语音增强和鲁棒语音特征并不能完全消除训练和测试环境 失配的影响,为了进一步提高系统的鲁棒性,研究者们对训练和测试环境之 间差异的补偿进行了深入地探
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2025年南昌市中心医院医务人员招聘笔试真题
- 2025年安徽江东文旅康养集团有限公司招聘笔试真题
- 在职电气人备考注电供配电!这样学效率更高
- 冬季防冻应急预案试题(3篇)
- 健合集团营销方案(3篇)
- 入职水务集团思想报告(3篇)
- 项目三数据预处理题库
- 2026年山西专升本护理学考试题库及答案
- 保密知识-多项选择题预测考点题库真题及答案
- 成都川师附外2026初一入学语文分班考试真题含答案
- 煤矿入井安全操作规程培训
- 饲草产品加工工安全技能测试水平考核试卷含答案
- 甘肃省民航机场集团招聘笔试题库2026
- 《JBT 14962-2025磁悬浮离心式压缩机能效限定值及能效等级》专题研究报告
- 2025年案件管理检察业务竞赛真题及答案
- 2026广岩国际投资有限责任公司招聘14人备考题库及答案详解(各地真题)
- 券商从业人员专属2026新三板考试试题答案
- 钛白粉行业风险分析报告
- NCIC临床实践指南:免疫检查点抑制剂毒性管理指南(2026版)课件
- 氧气充装安全培训
- 2025年广东省常用非金属材料检测技术培训考核考前冲刺备考速记速练500题-含答案
评论
0/150
提交评论