已阅读5页,还剩61页未读, 继续免费阅读
(计算机应用技术专业论文)大词汇量连续语音识别的性能优化研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 大词汇量连续语音识别( l a r g ev o c a b u l a r yc o n t i n u o u ss p e e c hr e c o g n i t i o n , l v c s r ) 是语音识别研究的重点和难点之一,其涉及了声学模型、语言模型、 搜索算法等多方面的知识和技术;本文在介绍语音识别的基本原理基础上,就 如何提高l v c s r 的识别速度以及识别准确率两方面进行了研究和探讨。 在基于h m m 的l v c s r 系统中其声学建模常用连续密度h m m 来实现, 每个h m m 状态都表示为一个高斯混合模型( g m m ) ,而每个g m m 模型又包 含较多的高斯分量,这使得状态似然率的计算量非常大,是语音识别速度慢的 主要原因之一,因此有必要设计有效的似然率快速算法在不降低或不明显降低 识别准确率的前提下加快似然率的计算。本文首先分析了h m m 中的似然率计 算,并分析了采用并行方式实现似然率计算的可行性,在此基础上提出了一种 基于s i m d 的似然率并行计算算法,并利用h t k 3 4 工具包作为实验基线系统、 t i m i t 和w s j 0 语料库作为实验语料库搭建实验平台,将此算法与部分距离消 去算法( p d e ) 、最佳混合分量预测算法( b m p ) 、特征矢量重排算法( f c r ) 以及高斯选择算法( g s ) 等其他经典快速似然率算法进行比较;实验结果表明, 该算法在不降低识别准确率的前提下显著降低似然率计算开销,并且性能优于 其他几种似然率快速算法。 为了将语义信息与n g r a m 统计语言模型结合并运用到语音识别过程中以 提高l v c s r 系统的识别准确率,本文研究了潜在语义分析( l s a ) 理论及其 在l v c s r 系统中应用的相关技术,在此基础上利用w s j 0 文本语料库构建l s a 模型,并将其与n g r a m 模型进行插值组合,构建了包含语义信息的混合模型; 同时为了优化混合模型的性能,利用基于密度函数初始化类中心的k 均值聚类 技术对l s a 模型的向量空间进行聚类,并提出平滑计算方法对概率进行平滑。 w s j 0 语料库上的模型困惑度实验和连续语音识别实验结果表明:混合模型性 能优于n g r a m ,l s a 能在一定程度上辅助n g r a m 提高l v c s r 的识别率。 关键词:似然率快速计算;潜在语义分析;大词汇量连续语音识别 a b s tr a c t l a r g ev o c a b u l a r yc o n t i n u o u ss p e e c hr e c o g n i t i o n ( l v c s r ) i so n eo ft h em o s t i m p o r t a n ts u b j e c t so fs p o k e nl a n g u a g ep r o c e s s i n g ,w h i c hi n v o l v e sm a n yk n o w l e d g e s o u r c e sa n dt e c h n i q u e ss u c ha sa c o u s t i cm o d e l ,l a n g u a g em o d e la n dd e c o d i n g a l g o r i t h m t h i sp a p e rw i l li n t r o d u c et h eb a s i ck n o w l e d g eo fs p e e c hr e c o g n i t i o na n d t h e nd i s c u s sh o wt oi m p r o v et h er e a l t i m e p e r f o r m a n c eo fs p e e c hr e c o g n i t i o n s y s t e m sa n dh o w t oi m p r o v et h er e c o g n i t i o na c c u r a c y m o s tl v c s rs y s t e m sa r eb a s e do ns t a t i s t i c a lm o d e l s ,w h i c hu s ec o n t i n u o u s d e n s i t yh m m a st h eu n d e r l y i n gt e c h n o l o g yt op e r f o r ma c o u s t i cm o d e l i n go fs p e e c h s i g n a l s i nt h i ss y s t e m ,e a c hs t a t ei sag a u s s i a nm i x t u r em o d e l ( g m m ) w h i c hi s c o n s i s t e do fm a n yg a u s s i a nm i x t u r e s f o rt h i sk i n do fl i k e l i h o o d - b a s e ds p e e c h r e c o g n i t i o ns y s t e m s ,t h es t a t el i k e l i h o o d se s t i m a t i o ni sc o m p u t a t i o n a l l yi n t e n s i v e i t i so n eo ft h em o s ti m p o r t a n tr e a s o n sw h yt h er e c o g n i t i o ni ss os l o w t h e r e f o r ei ti s n e c e s s a r yt od e v e l o pe f f i c i e n tt e c h n i q u e si no r d e rt or e d u c et h ec o m p u t a t i o n a l o v e r h e a d o fl i k e l i h o o d c o m p u t a t i o nw i t h o u ta n yd e g r a d a t i o no ras i g n i f i c a n t d e g r a d a t i o no fr e c o g n i t i o na c c u r a c y t h el i k e l i h o o dc o m p u t a t i o no fl v c s rs y s t e m s w h i c ha r eb a s e do nc o n t i n u o u sd e n s i t yh m mi s a n a l y z e d t os h o wt h a tt h e c o n v e n t i o n a lw a yo fs e q u e n t i a lc o m p u t i n gi st i m e c o n s u m i n ga n dt h el i k e l i h o o d c o m p u t a t i o ni t s e l fc a nb ei m p l e m e n t e di np a r a l l e l as i m d b a s e da l g o r i t h mw h i c h c a nc a r r yo u tp a r a l l e ll i k e l i h o o dc o m p u t a t i o ni sp r e s e n t e di nt h i sp a p e r b yt a k i n g h t k3 4t o o l k i ta st h eb a s e l i n es y s t e ma n dt i m i t 、w s j 0 c o r p u sa st h ee x p e r i m e n t c o r p u s ,t h ee x p e r i m e n tp l a t f o r mi sb u i l t a n dt h e nt h ea l g o r i t h mi sc o m p a r e dt o o t h e re f f i c i e n tt e c h n i q u e ss u c ha sp a r t i a ld i s t a n c ee l i m i n a t i o n ( p d e ) ,b e s tm i x t u r e p r e d i c t i o n ( 8 m p ) ,a n df e a t u r ec o m p o n e n tr e o r d e r i n g ( f c r ) a n dg a u s s i a ns e l e c t i o n ( g s ) o nt h i sp l a t f o r m e x p e r i m e n t sr e s u l t ss h o wt h a tt h es i m d - b a s e da l g o r i t h mc a n s i g n i f i c a n t l yr e d u c et h et i m eo v e r h e a do fl i k e l i h o o dc o m p u t a t i o nw i t h o u ta n y d e g r a d a t i o no fr e c o g n i t i o na c c u r a c y a n dt h ep e r f o r m a n c ei sb e t t e rt h a no t h e rf a s t c o m p u t a t i o nt e c h n i q u e s i no r d e rt oi n t e g r a t et h es e m a n t i ck n o w l e d g ew i t hn - g r a ml a n g u a g em o d e lf o r l v c s rt oi m p r o v er e c o g n i t i o na c c u r a c y , t h et h e o r yo fl a t e n ts e m a n t i ca n a l y s i s ( l s a ) a n dt h er e l a t e dt e c h n i q u e sf o ra p p l y i n gi ti nl v c s rs y s t e mi sd e s c r i b e di n t h i sp a p e r a n dt h e nl s am o d e li sc o n s t r u c t e do nt h ew s j 0t e x tc o r p u s w eu s et h e i n t e r p o l a t i o nm e t h o dt oc o m b i n et h i sm o d e lw i t hc o n v e n t i o n a ln - g r a mt of o r ma h y b r i dl a n g u a g em o d e lw h i c hi n c l u d es e m a n t i ck n o w l e d g e t oo p t i m i z e t h e p e r f o r m a n c eo ft h eh y b r i dm o d e l ,w ea p p l yk - m e a n sa l g o r i t h mt op e r f o r mv e c t o r c l u s t e r i n gi nt h el s a v e c t o rs p a c ew h i l et h ed e n s i t yf u n c t i o ni su s e dt oi n i t i a l i z et h e c e n t r o i d s ,a n dp r o p o s eac o m p u t a t i o nm e t h o df o rs m o o t h i n gt h ep r o b a b i l i t i e s t h e m o d e lp e r p l e x i t yt e s t sa n dc o n t i n u o u ss p e e c hr e c o g n i t i o ne x p e r i m e n t sa r ec o n d u c t e d o nt h ew s j 0c o r p u s r e s u l t ss h o wt h a tt h ec o n s t r u c t e dh y b r i dl a n g u a g em o d e l o u t p e r f o r m st h ec o r r e s p o n d i n gn g r a ma n dc a l li m p r o v et h er e c o g n i t i o no fl v c s r t os o m ee x t e n t k e yw o r d s :f a s tl i k e l i h o o dc o m p u t a t i o n ;l a t e n ts e m a n t i ca n a l y s i s ;l a r g e v o c a b u l a r yc o n t i n u o u ss p e e c hr e c o g n i t i o n 厦门大学学位论文原创性声明 本人呈交的学位论文是本人在导师指导下,独立完成的研究成 果。本人在论文写作中参考其他个人或集体已经发表的研究成果, 均在文中以适当方式明确标明,并符合法律规范和厦门大学研究 生学术活动规范( 试行) 。 另外,该学位论文为() 课题 ( 组) 的研究成果,获得() 课题( 组) 经费或实 验室的资助,在() 实验室完成。( 请在以上括号 内填写课题或课题组负责人或实验室名称,未有此项声明内容的, 可以不作特别声明。) 陟至 缺钿 签 习 知人参 期严 眇 矽 厦门大学学位论文著作权使用声明 本人同意厦门大学根据中华人民共和国学位条例暂行实施办 法等规定保留和使用此学位论文,并向主管部门或其指定机构送 交学位论文( 包括纸质版和电子版) ,允许学位论文进入厦门大学图 书馆及其数据库被查阅、借阅。本人同意厦门大学将学位论文加入 全国博士、硕士学位论文共建单位数据库进行检索,将学位论文的 标题和摘要汇编出版,采用影印、缩印或者其它方式合理复制学位 论文。 本学位论文属于: () 1 经厦门大学保密委员会审查核定的保密学位论文, 于年月日解密,解密后适用上述授权。 ( v ) 2 不保密,适用上述授权。 ( 请在以上相应括号内打“ 或填上相应内容。+ 保密学位论 文应是已经厦门大学保密委员会审定过的学位论文,未经厦门大学 保密委员会审定的学位论文均为公开学位论文。此声明栏不填写的, 默认为公开学位论文,均适用上述授权。) 等:西斜 易黾 | ;b j 栅维 矿 一 第一章绪论 第一章绪论 语音识别技术是让机器通过识别和理解过程把语音信号转变为相应的文 本或命令的高技术;其以语音信号为研究对象,涉及语言学、计算机科学、信 号处理、生理学、心理学等诸多领域,是模式识别的重要分支,也是人机接口 设计的一项重要内容,其最终目标是实现人与机器的自然语言通信。 如今,语音识别几乎可以应用于人们日常生活的各个领域,目前已经在金 融、旅游等行业的语音咨询,工业生产部门的语音控制,声控智能玩具,电话、 电信系统的自动拨号以及辅助控制与查询等方面获得成功的应用,并且有望成 为下一代操作系统和应用程序的用户界面。随着信息产业和互联网的迅速发展, 对语音识别的需要也更加紧迫,因此研究语音识别,开发相应的产品有着广泛 的社会意义和经济意义【1 捌。 作为智能计算机研究的主导方向和人机通信的关键技术,语音识别一直受 到各国学界的广泛关注。现在不仅有以三个国际语音大会( i c a s s p 、i c s l p 、 e u r os p e e c h ) 为代表的各类国际会议论坛为语音研究者提供交流的舞台,有 i e e et r a n s s p e e c ha n da u d i op r o c e s s i n g 、s p e e c hc o m m u n i c a t i o n 等为代表的权 威杂志登载语音领域的最新进展,有h t k 【3 1 、s p h i n x t 4 1 、j u l i u s 5 1 等为代表的优 秀实验平台、有w s j 6 1 、t i m i t 7 】为代表的优秀语料库,还有很多成熟的商业实 用系统,如:i b m 的v i a v o i c e 、美国d r a g o n 公司的n a t u r a l l y - s p e a k i n g 等【8 】。 1 1 语音识别的发展 语音识别的研究工作开始于5 0 年代,当时a t & tb e l l 实验室实现了第一 个可识别十个英文数字的语音识别系统a u d 巧系统,这是语音识别研究工 作的真正开端。 到六十年代中期,由于计算机的发展提供了实现复杂算法的软、硬件环境, 以及数字信号处理的理论和算法的进展提供了语音识别的技术基础,大规模的 语音识别研究工作得以展开,并且逐步取得了实质性的进步。其中,最重要的 发展是语音信号线性预测编( l p c ) 技术和动态时间规整( d t w ) 技术的提出,它们 大词汇量连续语音识别的性能优化研究 有效地解决了语音信号的特征提取和不等长匹配问题,对特定人的语音识别十 分有效。 8 0 年代以来,统计方法逐步取代了传统的模板匹配方法,成为语音识别技 术的主流。统计方法不再追求语音特征的细化,而是更多地从整体平均( 统计) 的角度来建立最佳地语音识别系统。隐马尔可夫模型( h m m ) 就是其中的典型代 表,该方法可以在音素、半音节、音节、词、短语甚至句子中的任一级建立相 应的随机统计模型,并且可以把语言模型结合到识别过程中,提高识别的准确 率。统计方法的应用有效地把特定人、小词汇量、孤立词或连接词的识别,发 展到了非特定人、大词汇量、连续语音识别。1 9 8 8 年,美国c m u 大学用v q h m m 的方法实现了s p h i n x ,这是一个高性能的非特定人、大词汇量连续语音识别系 统。随着语音识别技术的进一步成熟,许多商用大词量连续语音识别系统被推 出,例如i b m 的v i a v o i c e ,微软的w h i s p e r 。 近年来,中文的语音识别取得很大的发展,我国语音识别研究工作一直紧 跟国际水平、大词汇连续语音识别的研究列入了国家“8 6 3 计划,由中科院声 学所、自动化研究所、北京大学等单位研究开发。同时鉴于中国未来的庞大市 场,国外的研究机构和公司也非常重视中文的语音识别研究和开发,i b m 、微 软、d r a g o n 等国际大公司相继投入到汉语语音识别系统的开发中,其投资也逐 年增加,产品逐渐走向市场【9 , 1 0 。 1 2 语音识别的分类 从不同的角度和要求出发,语音识别有不同的分类方法【1 1 1 。 按照词汇表大小分,有小词汇量( 词汇量小于1 0 0 ) 、中词汇量( 词汇量在 1 0 0 到1 0 0 0 之间) 、大词汇量( 词汇量在1 0 0 0 以上) 。 按照语音发音方式来分,有孤立词识别、连接词识别、连续语音识别3 种; 所谓孤立词识别( i s o l a t e dw o r dr e c o g n i t i o n ) 是指在发待识别音时,每次只含 词汇表中的一个词条;连接词识别( c o n n e c t e dw o r dr e c o g n i t i o n ) 是指每次说 词汇表中的若干词条来进行识别,该若干词条以慢速连续的方式连续说出,一 般指啦9 十个数字连接而成的多位数字的识别,并包含其他一些少量的操作指 令等;连续语音识别( c o n t i n u o u ss p e e c hr e c o g n i t i o n ) 指说话人以自然的方式 2 第一章绪论 讲述并进行识别。 按照说话人的限定范围来分,有特定人识别和非特定人识别;所谓特定人 ( s p e a k e rd e p e n d e n t ) 识别是指识别系统只针对特征的某个用户进行识别工作 的方式;非特定人( s p e a k e ri n d e p e n d e n t ) 识别是指识别系统可以针对任何人工 作。非特定人语音识别通用性好,应用需求更广,但实现难度更大。 按照识别方法来分,有模板匹配法、概率模型法;其中模板匹配法是指把 不同内容的语音转化为不同的模板,并基于模板匹配的相似性度量进行语音识 别的方法;而概率模型法主要是利用h m m 的概率参数来对似然函数进行估计 判决并得到识别结果的方法。除了上述方法外,另外还有基于人工神经网络、 支持向量机等方法的语音识别技术。 1 3 本文研究背景和目的 大词汇量连续语音识别( l a r g ev o c a b u l a r yc o n t i n u o u ss p e e c hr e c o g n i t i o n , l v c s r ) 具有重大的实际意义,它的发展与运用必将带来计算机普及程度的又 一次飞跃。然而,它同时也是语音研究中最困难,也是最具有挑战性的工作, 现有的大规模、非特定人连续语音识别系统在效果上并不理想,无论是精度还 是识别速度都还远远达不到大规模实际应用的要求,在系统的各个层面,包括 声学模型、语言模型,都仍然有很多难题需要克服,尤其是语言模型方面,许 多技术都未成熟,进一步的研究对于提高大词汇量连续语音识别系统的性能具 有重要的意义。 在l v c s r 系统中其声学建模常用连续密度h m m ( c d h m m ) 来实现,每 个h m m 状态都表示为一个高斯混合模型( g m m ) ,而每个g m m 模型又包含 较多的高斯分量,这使得状态似然率的计算量非常大。对于这种基于似然率计 算的统计语音识别系统来说,用于高斯估计的时间在总体识别时间中占有很大 的比例,通常占3 0 到7 0 t 1 2 1 。针对这个问题,人们提出了一系列降低似然率 计算时间开销的算法,其中包括:采用线性判别分析( l i n e a rd i s c r i m i n a n t a n a l y s i s ,l d a ) 1 3 】来降低特征矢量的维数;在矢量量化的基础上,通过对高斯 分量进行聚类来实现似然率的快速计算【1 4 】;采用k 维二叉搜索树对空间进行划 分,从而提高似然率计算的效率【1 5 1 ;利用近邻逼近( n e a r e s t - n e i g h b o r 3 大词亍l 量连续语音识别的性能优化研究 a p p r o x i m a t i o n ) 来降低似然率计算开销【1 6 】;利用高斯选择算法来加快似然率计 算【1 7 , 1 8 】等。因而设计有效的似然率快速算法,在不降低或不明显降低识别准确 率的前提下显著地加快似然率的计算,是提高l v c s r 系统实时性的重要研究 探索点。 传统的语音识别采用的语言模型是n 元文法统计语言模型,其只考虑了短 程距离的历史信息,这主要利用了一个句子中的句法和语法层次上的信息,无 法利用自然语言中的语义信息;为了融合语义信息,人们提出很多的方法,其 中包括:基于t r i g g e r 的长距离语言模型1 9 】;潜在语义分析语言模型和统计语 言模型相结合的混合语言模型【2 0 2 3 】;语义分析和结构化语言模型【2 4 】等。因此如 何构建一个包含语义信息的语言模型,从而提高l v c s r 系统的准确率也是一 个重要的研究探索点。 1 4 本文的主要工作与结构 本文首先提出了基于s i m d 并行计算的似然率快速算法用于提高语音识别 的识别速度;同时构建一种基于潜在语义分析的语言模型,将语义信息运用到 语音识别过程中从而提高连续语音识别的准确率。本文的结构如下: 第一章是本文的绪论部分,论述语音识别的发展与现状、语音识别的分类、 本文的研究背景和目的。 第二章介绍语音识别的基本理论,包括预处理、特征提取、声学模型、语 言模型、识别算法以及识别结果评测。 第三章在描述基于h m m 的似然率计算模型基础上,讨论了各种典型的似 然率快速算法,并提出基于s i m d 的似然率快速算法,然后通过语音识别实验 来比较基于s i m d 的似然率快速算法与其他似然率快速算法的性能。 第四章阐述了潜在语义分析( l s a ) 在l v c s r 系统中的应用,包括潜在 语义分析基本原理介绍,模型插值算法介绍、模型向量空间聚类算法及平滑技 术的设计,l s a 在l v c s r 系统中的应用方法、实验的设计与结果分析。 第五章对本文进行总结和展望。 4 第二章语音识别皋奉理论 第二章语音识别基本理论 语音识别一般分两个步骤:第一步是系统“学习”或“训练 阶段;这一 阶段的任务是建立识别基本单元的声学模型以及进行文法分析的语言模型等; 第二步是“识别 或“测试”阶段,根据识别系统的类型选择能够满足要求的 一种识别方法,采用语音分析方法分析出这种识别方法所要求的语音特征参数, 按照一定的准则和测度与系统模型进行比较,通过判决得出识别结果。因此, 语音识别系统本质上是一种模式识别系统,它的基本结构如图2 1 所示,主要 包括语音信号预处理、特征提取、特征建模( 建立参考模板库) 、模式匹配、后 处理等,其中后处理是可选部分【l ,2 5 1 。 2 1 预处理 图2 一l :语音识别框架图 语音识别系统的预处理主要是对输入的语音进行一些前期处理,主要包括 采样量化、预加重、加窗、端点检测等操作【2 6 】。 ( 1 ) 采用和量化 采样与量化发生在录音阶段,原始模拟语音信号经过采样、量化后,转化 成在时间和幅度上均为离散的数字信号;根据采样定理,采样频率大于信号的 两倍带宽时,采样过程不会丢失信息。语音信号的音频范围在2 0 h z 到2 0 k h z 之间,其中绝大部分能量是集中在5 7 k h z 以内,一般语音信号的采样频率为 8 k h z 或1 6 k h z 。 ( 2 ) 预加重 由于语音信号的平均功率谱受声门激励和口鼻辐射的影响,高频端大约在 5 大词汇量连续语音识别的性能优化研究 8 0 0 h z 以上按6 d b o e t ( 倍频程) 衰减。预加重目的就是提升高频部分,使信号的 频谱变得平坦,以便于频谱分析或声道参数分析。通常的措施是用一个数字滤 波器实现预加重,其公式表示为: n ( z ) - - j 一讹一7 ( 2 - 1 ) 其中口为预加重系数,一般取0 9 口j 。预加重处理公式如下: j ( 咒) = s ( n ) 一a s ( n j ) ( 2 - 2 ) 其中s ( n ) 为,l 时刻的语音采样值。 ( 3 ) 加窗 语音信号是一种典型的非平稳信号,只有在短时间内才表现出准平稳的特 性。我们假设语音信号在1 0 m s 3 0 m s 短时间内是平稳的,每一个短时间称为一 帧,为了将语音信号分成相继的短段信号,我们需要使用一个有限长度的窗函 数以,z ) ,加窗运算定义为:s 。( ,1 ) = s ( m ) w ( n - m ) 。窗函数主要有一下几种 ( n 为面长) : 矩形窗( r e c t a n g u l a rw i n d o w ) ,、l1 ( d ,z n j ) 以功2 1 d 粪他 哈明窗( h a m m i n g w i n d o w ) : 从加卜4 - 0 4 6 ( c o s - 是1 ) ( 怄胚_ j ) 【0 其他 哈宁窗( h a n nw i n d o w ) : “妒卜( 卜c o s ( 而2 ;r n ) ) ( o k 拓( i 雌,) = d r c ( w i _ ,) c ( 一j ) i f k , 0( 2 - 3 5 ) k ( w f 一,) 以) i f ,_ = 0 ,7 ( 尼+ j ) 疗川 这里七 取 值为 5 ,8 , d ,2 了r 万再n 丽1i , 毗。= 等一。 评价一个n g r a m 的性能优劣主要的方法是采用信息论的方法,根据 n g r a m 在测试文本上的困惑度( p e r p l e x i t y ) 来衡量。困惑度越小,语言模型对 上下文的约束能力就越强,模型就越好,困惑度定义为: 即= 2 h i w ) = r e ( 兀np ( iw i - n + l w i - i ) r ( 2 - 3 6 ) 其中形表示词串 w s ,w e , ,h ( w ) 表示这个词串所包含的信息量: 日( 川= 一l i 磐二l 0 9 2 以心) ( 2 - 3 7 ) 2 4 2 结构化语言模型 结构化语言模型是依靠某种结构信息而构造的语言模型,如依靠句法结构 信息构造而成的句法语言模型。目前已经提出并成功应用于语音识别领域的结 构化语言模型有基于上下文无关文法的模型、基于依存文法的语言模型等。 在语音识别中,上下文无关文法的语言模型可以先使用正则表达式的扩展 形式定义,然后再编译为静态网络用于语音识别。如果用 表示 e x p r e s s i o n 重复一次或多次,用e x p r e s s i o n lie x p r e s s i o n 2 表示在e x p r e s s i o n l 和 e x p r e s s i o n 2 之中选择其一,那么描述任意长度的数字串的上下文无关文法可以 定义为: ( s i l s i l ) 其中s i l 表示句子开始前和结束后的静音。随后将上述定义的语法编译成词的网 1 6 第二章语音识别基本理论 络【2 7 1 。 对于基于依存文法的语言模型研究,清华大学李明琴等人在其实现的中文 语义依存分析系统的基础上提出了两个结构化语言模型【2 4 】最优标注句子 模型和中心词三元文法模型。这两个模型均被应用在中文语音识别任务上并取 得了比n 元文法模型更好的效果。 2 5 识别算法 识别问题就是在一个由观测序列、声学模型、语言模型构建的空间中如何 有效地找到最佳匹配的词序列也即状态序列的问题,这个搜索的过程也常常被 称作解码。搜索算法从广义上可以分为宽度优先搜索算法和深度优先搜索算法。 2 5 1v i t e r b i - b e a m 算法 目前连续语音识别系统常用基于v i t e r b i 算法的宽度优先搜索算法。v i t e r b i 搜索算法是帧同步搜索算法,即处理某一帧语音特征数据时更新所有h m m 状 态,然后再处理下一帧数据。v i t e r b i 搜索算法采用如下的最佳准贝1 j 2 , 1 2 】: s t ( i ) = m a xp q j q 2 q t - l , g ,= f ,口j 口2 ,0 ,l 力】 q 一2 t 即在f 时刻选择状态f ,使得模型见沿状态序列q = 曲,9 2 ,q ,) 运动产生观察 序列0 = 0 ,吧,0 ,) 的概率最大。根据定义可得t ( f ) 的递推公式如下: 玩+ ( f ) = m a x s t ( i ) a i b j ( o h 。) 定义变量e + ,( ) = a r g m a x 8 , ( i ) a 驴】,表示使谚( f 值最大的f ,其作用是追踪 8 t ( i ) 在推导过程中的最佳路径。v i t e r b i 算法表达如下: ( 1 ) 初始化 4 ( f ) = 万f 6 j ( d j ) j i n e ( f ) = 0 ( 2 ) 递推: 1 7 大词汇量连续语音识别的性能优化研究 3 t ( j ) = m 。;。a :x 8 , 一j ( i ) a o b y ( o r ) 2 f t ;1 o r 氕= j 。( 3 - 1 ) 式中的各个混合概率分量通常可以表示为一个多变 k = l 量高斯概率密度函数: 最( x 。) = n ( x 。,t ,瓦) 2 矛而木e d 书吨啊吨) 。2 其中,d 是观察矢量的维数,。和乞分别表示状态s 的第k 个分量的均值 矢量和协方差矩阵。依( 3 2 ) 式定义各概率分量,则( 3 1 ) 式中的状态模型即 为具有m 个高斯分量的g m m 。在实际计算中,由于数据稀疏性,模型中各状态 的协方差矩阵往往采用对角矩阵,因而( 3 1 ) 式可以表示为如下形式: m p ( x 。l s ) = 文n ( x 。,量,乞) k = l m p 2 荟一i d 1 1 1 2 榭( 2 万) 删 e x p 一;薹与纠 = 差z 。e x p e j 1 荔d 等等k a 拈, 么铲, 口 i ( 3 - 3 ) 这里,对于每个高斯分量来说,z 。是个常数。由于构成z 。的各项参数在 识别前都是已知的,因此z 。可以预先计算好,在似然率计算时只需直接从内存 中读出即可。为了提高计算效率及避免出现下溢,概率计算通常在对数域中进 行。因此,我们可以按下式计算对数似然率: 。g p ( x 。i s ) 】= l 。g 肼a d ll o g ( z , ) - ? 7 兰q = l k = l ! 兰竺l 仃1 ( 3 4 ) 第三章罐于s i m d 的似然率快速计算 式中,函数 m l o g a d d 【】定义如下: 式中,函数 【】定义如下: 七= , 。g m k = a a ld b 】= 。g 善ie x p c ,ii =l ( 3 - 5 ) 分析( 3 3 ) 式和( 3 4 ) 式可知,似然率计算首先要在各高斯分量上进行d 个元素的减法、平方和除法运算,然后还需对m 个高斯分量进行l o g a d d 】运算。 我们假定( 3 4 ) 中d 维向量元素上的减法、平方和除法三种运算所需的时间 记之为疋,将任意两个分量间进行1 0 9 a d d 【】运算所需的时间记为瓦。这里,运 算时间包括了c p u 执行指令和访问内存所需的时间。由于在识别时,对于输入 的每一帧语音需要计算每一个有效的h m m 状态的输出似然率,因此假设系统 中有个有效状态,则观察向量x 。的对数似然率计算所需的时间乃可由下式 算出: 乃= n 阻牛瓦+ ( m j ) 毛】 ( 3 6 ) 通常,在连续语音识别系统中,常用基于m f c c 参数的3 9 维向量来描述 语音特征,因此d 常取为3 9 ,系统中c d h m m 模型的状态数约在2 0 0 0 到 6 0 0 0 之间,每个状态的高斯分量数m 通常在8 到6 4 之间取值f 1 2 】。正是由于这 些模型参数有很大的取值,使得兀的数值较大,导致似然率计算十分耗时。 3 2 似然率快速算法 3 2 1 部分距离消去算法 文献 1 6 】给出了一种采用近邻逼近( n e a r e s t - n e i g h b o r a p p r o x i m a t i o n ) 来降 低似然率计算开销的方法,基本思路是用数值最接近p ( x 。i s ) 的高斯混合分量 来取代各个混合分量之和,作为p ( x 。i s ) 的近似值,因此( 3 4 ) 式就变为: 。g【pc】c。i。r,】=:。m,。a:。x。lrlog,z,-么妻。;,掣 ( 3 7 ) 上式在很大程度上简化了似然率的计算。我们可以进一步将这种近邻搜索 大词汇量连续语音识别的性能优化研究 看作是矢量量化的码书搜索【3 ,每个状态的各个概率密度函数对应于矢量量化 码书中的码字,矢量量化的失真度由( 3 7 ) 式给定。记失真度为d ( x 。i y ) ,其 中y 为码书。由于失真度的计算是要取各个混合概率密度函数的最大值,因而 有: 弛护l o g ( 妒姜( 枷他) 2 去 ( 3 8 ) 与乘法运算相比,除法运算具有较大的计算开销,因此通常可以预先计算 出协方差的倒数,从而在式( 3 8 ) 的计算中用乘法运算代替除法运算。 在码书搜索问题中,一般通过求失真度的最小值来找到最佳码字。但是, 这里所讨论的是概率密度,因此最佳码字搜索应该通过求解失真度的最大值来 实现。对式( 3 8 ) 进行分析可知,等号右边的第二项实际上是一个加权的欧氏 距离,d ( x 。陟) 的计算是在观察矢量各个元素上的递归运算,随着每一次递归 的进行,d ( x 。l y ) 的值单调减小。因此,在最佳码字的搜索中可以采用部分距 离消去法( p d e ) 来降低计算复杂性。首先,对于第一个参与混合的高斯分量, 在观察矢量的全部d 个元素上用式( 3 8 ) 计算出码书搜索失真度的初始值,赋 值给d 。;然后对于其他每个参与混合的高斯分量( 码字) ,逐个地在观察矢 量的元素上递归计算d ( x 。l y ) 的中间结果,一旦在第i p 元素( f d ) 上的递 归运算结束后,d ( x 。l y ) 的中间结果值小于d 一,i g z , 就不必对这个观察矢量 的其他元素再进行递归运算,而可以直接进行对于下一个码字的失真度计算。 如果对于某一个码字,d 次递归运算得到的d ( x 。l y ) 的最终结果大于d 一,那 么d 一就取为这个d ( x 。y ) d 耋,接着对下一个码字进行失真度计算。由于对于 许多码字来说,d ( x 。i y ) 的递归运算不到d 次就终止了,因此这种p d e 算法大 大地提高了码书搜索的效率,可以快速地得到似然率的近似值。 同时,文献 1 6 】在p d e 算法的基础上提出了似然率计算的最佳混合预测 ( b m p ) 算法和特征矢量元素重排( f c r ) 算法。这两种快速计算方法的独特 之处在于不需要占用更多的内存空间,也不需要对底层的识别模块进行改造。 第三章基于s i m d 的似然率快速计算 另外,它们还具有不降低识别正确率的优点。b m p 算法和f c r 算法可以和其 他快速算法结合在一起,以进一步降低似然率计算的时间开销。 3 2 2 最佳分量预测算法 通过对p d e 算法的分析可知,p d e 算法的计算效率在很大程度上取决于 能否快速地得到d 一的一个较大估计值。实际上,由于观察序列中各相邻特征 矢量之间存在着高度的相关性,毗d m a x 的较大估计值很容易算得。对于状态 s ,记前一时刻的特征矢量的最佳匹配高斯分量为m 扩7 ,m ”。可由下式计算: m ”。= a r g m a x d ( x 州i y ) 1 s 七s m ( 3 9 ) 由于在特征提取时各相邻语音帧之间有重叠部分,因此通常情况下x 。与 x 州是相似的。基于这一点,可以认为d ( x 。l y ) 和d ( x 州i y ) 在数值上接近。在 用p d e 算法进行最佳码字搜索时,可以将前一个特征矢量对应的最佳匹配高斯 分量作为当前特征矢量对应的最佳匹配高斯分量,并且首先计算这个最佳匹配 分量上的失真度值,这样就能够立即得到当前码字搜索中的一个较大的d m 双估 计值,从而加速p d e 算法的执行。这就是b m p 算法的基本设计思路。 3 2 3 特征矢量重排算法 对式( 3 8 ) 进行进一步考察还可以知道,在失真度计算中,特征矢量的某 些元素具有比其他元素更大的“贡献”,也就是说,在这些元素上的递归运算使 失真度的中间结果有较大幅度的减小。显然,首先在这些元素上进行失真度递 归运算有利于提高p d e 算法的执行效率。为了达到这一目的,必须重新编排特 征矢量中各个元素的序号。令g 寸d 【g 】是元素序号q 到重排序号d 【g 】的映射, 那么式( 3 8 ) 的失真度计算可以改写为: d ( x n 沪y 1 0 9 ( z 七) _ 否山卜】广赢2 ( 3 - 1 0 ) 可以通过预先对测试样本集中的部分样本进行分析来建立映射g - - hd b 】; 大词汇量连续语音识别的性能优化研究 在识别过程中,固定地按照这个映射来实现特征矢量各个元素序号的重排。这 样的f c r 算法可以作为p d e 算法和b m p 算法的补充,进一步加快似然率计算 的速
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年自贡市沿滩区就业创业促进中心招聘第三批次公益性岗位人员考试备考试题及答案详解
- 2026年8月昌吉市智汇庭州人才发展有限责任公司招聘教育工作者笔试备考题库及答案详解
- 2026连云港市工投集团台北(华茂)公司招聘技术工人11人笔试备考试题及答案详解
- 2026南昌市消防救援支队轨道交通大队公开招聘专业会计1人考试备考题库及答案详解
- 2026山西临汾市汾西县人力资源和社会保障局开发城镇公益性岗位招用就业困难高校毕业生30人考试备考题库及答案详解
- 2026中国农业科学院草原研究所草种质资源与育种研究中心科研助理招聘1人考试模拟试题及答案详解
- 2026青岛华睿弘光能源科技有限责任公司招聘3人考试备考试题及答案详解
- 2026年湖北省就业援疆面向新疆阿克苏地区、兵团一师高校毕业生专项公开招聘事业单位工作人员23人考试参考题库及答案详解
- 2026年驻马店确山县遴选城区学校教师教研员93名考试备考试题及答案详解
- 2026西安西京社区卫生服务中心招聘招聘笔试模拟试题及答案详解
- GB/T 45942-2025填充矿物油的电气设备溶解气体分析(DGA)在电气设备工厂试验中的应用
- 重症医学科护理进修回院汇报
- FZ-T64103-2023矿用聚酯纤维柔性假顶网
- 三方协议格式电子版(2025年版)
- 医药代表销售经验分享培训
- 道化学(火灾爆炸危险指数评价法)
- 电子元器件代理合同模板(精美合同协议模板)
- 水轮机旋转油盆内甩油原因分析与处理
- 广东省2021年中考真题数学试卷(原卷和解析版)
- 酒店明住宿清单(水单)
- JTJ 003-1986 公路自然区划标准正式版
评论
0/150
提交评论