已阅读5页,还剩51页未读, 继续免费阅读
(模式识别与智能系统专业论文)基于电话信道的人名识别系统的研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于电话信道的人名识别系统的研究 基于电话信道的人名识别系统的研究 摘要 人类有个理想,让机器具有“听”,“说”人类语言的能力。语音识 别正是解决及其“听”懂人类语言的一项研究。 语音信号是非平稳的、时变的、复杂的、信息量大的信号,是语 音信息加个人特征的混合信号。目前的语音识别是以语音信号为原始 素材做三个层面的处理:物理( 声学) 层面、语言学层面( 自然语言理解) 和大脑神经层面( 智能) 。本文的主要侧重点在于声学层面上的研究。 h t k 是用于建立隐马尔可夫模型( h m m s ) 的工具。h t k 主要用 于设计并实现基于h m m 的语音处理工具,典型的应用就是语音识别 系统。在语音识别系统的设计过程中,h t k 主要完成两项任务:h t k 的训练工具利用训练数据,估计一系列h m m 模型的参数;h t k 的 识别工具利用测试数据,计算出一系列识别结果。 基于电话信道的人名识别系统,是电话语音识别应用中的一个亮 点。该系统在孤立词识别技术基础上,具备了两个特征:“电话”和 “人名”。“电话”指识别器获得的用于训练或测试的语音数据,是基 于“电话+ 语音板卡”的录音平台进行采集的,或通过电话信道传输 到识别器前端的;“人名”指孤立词的范围得到了限制,识别对象已 经明确为人的姓名。 在真实的电话通信环境中,说话人所处环境中的各种噪声和电话 信道的传输过程,会直接影响到电话语音数据的信噪比( s n r ) 。在p c 平台上进行录音的语音数据,经过编码格式的转换后,可以很好地模 拟高信噪比条件下的电话语音数据。低信噪比条件下的电话语音数 据,可通过人为添加噪声的方法获得。 本文将建立并测试一个基于h m m 的人名识别系统。测试结果与 分析将为与系统性能有关的多个问题提供答案。如h m m 模型参数与 系统性能之间的关系,不同信噪比训练策略与系统性能之问的关系 等。 关键字h t kh m m 电话人名识别信噪比 j ! 塞业皇查兰竺主兰些堡茎 苎王皇! i 笪望塑尘墨望型墨笙塑翌塞 ar e s e a r c h0 nt e l e p h o n e b a s e d n a m 匝r e c o g n i t l 0 ns y s t e m a b s t r a c t m a nh a sl o n gd r e a m e do fh a v i n gam a c h i n et h a tc a n “l i s t e n st o ”a n d “s p e a k s ”h u m a nl a n g u a g e s ,w h i c he n a b l e sh i mt oe n j o yaf a i r yw o r l do f w o n d e r s p e e c hs i g n a li sn o n s t a t i o n a r y , t i m e v a r y i n ga n dc o m p l e xw i t ha l a r g ea m o u n to fi n f o r m a t i o ni n c l u d i n gs e m a n t i ca n dp e r s o n a la l i k e t h e p r e s e n ts p e e c hr e c o g n i t i o ni st op r o c e s st h eo r i g i n a ls p e e c hs i g n a li nt h r e e l e v e l s :p h y s i c a l ( a c o u s t i c ) l e v e l ,l i n g u i s t i cl e v e l ( n a t u r a ll a n g u a g e p r o c e s s i n g ) ,c e r e b r a ln e r v el e v e l ( i n t e l l i g e n c e ) t h i st h e s i sw o u l dl i k et o m a i n l yf o c u so nr e s e a r c ho f p h y s i c a l ( a c o u s t i c ) l e v e l h t ki sat o o l k i tf o rb u i l d i n gh i d d e nm a r k o vm o d e l s ( h m m s ) h t ki sp r i m a r i l yd e s i g n e df o rb u i l d i n gh m m - b a s e ds p e e c hp r o c e s s i n g t o o l s ,i np a r t i c u l a rr e c o g n i z e r s t h e r ea r et w om a j o rp r o c e s s i n gs t a g e s i n v o l v e d f i r s t l y , t 1 1 eh t kt r a i n i n g t o o l sa r eu s e dt oe s t i m a t et h e p a r a m e t e r so fa s e to fh m 4 su s i n g t r a i n i n g u t t e r a n c e sa n dt h e i r a s s o c i a t e dt r a n s c r i p t i o n s s e c o n d l y , h d k n o 、, v nu t t e r a n c e sa r et r a n s c r i b e d u s i n gt h eh t kr e c o g n i t i o nt o o l s t e l e p h o n e b a s e dh u m a nn a m er e c o g n i t i o ns y s t e mi sah o ts p o to f t e l e p h o n es p e e c hr e c o g n i t i o na p p l i c a t i o n s b a s e do ni s o l a t e dw o r d r e c o g n i t i o nt e c h n o l o g y , t h es y s t e mg a i n e dt w on e wf e a t u r e s :“t e l e p h o n e a n d h u m a nb e i n gn a m e ”t e l e p h o n e ”i n d i c a t e st h a ts p e e c hd a t af o ra r e c o g n i z e rw e r ec o l l e c t e db yap l a t f o r mo f ”t e l e p h o n e1v o i c eb o a r d ” a r c h i t e c t u r e ,o ri no t h e rw o r d s ,t h e yw e r et r a n s f e r r e dt oaf r o n t e n do fa r e c o g n i z e ra l o n gt e l e p h o n el i n e ;”h u m a nb e i n gn a m e ”b r i n g sar e s t r i c t i o n t ot h er e s e a r c ht a s ko fi s o l a t e dw o r dr e c o g n i t i o n i nr e a lt e l e c o m m u n i c a t i o n s ,t h ee n v i r o n m e n ti nw h i c hs p e a k e r sa r e i r 北京邮电大学硕士学位论文基十电话信道的人名识别系统的研究 c a l l i n ga n dt h et r a n s m i s s i o no ft e l e p h o n ec h a n n e lw i l la f f e c tt h es n ro f s p e e c hs i g n a l a f t e rp r o p e rc o d i n gt r a n s f o r m a t i o n ,s p e e c hd a t aw h i c h w e r er e c o r d e da tp ce n v i r o n m e n tc a l lb eu s e dt os i m u l a t e t e l e p h o n e b a s e ds p e e c hd a t aw i t hh i 曲s n r i no r d e rt og e ts o m es p e e c h d a t aw i t hl o ws n r ,i ti sap o s s i b l ew a yb ya d d i n gn o i s e , i nt h i sp a p e r , ah 心4b a s e dn a m er e c o g n i t i o ns y s t e mw i l lb e e s t a b l i s h e da n dt e s t e d t h ep a p e rw i l lb ew i n gt og i v ea n s w e r st om a n y q u e s t i o n sw h i c ha l l a r er e l a t e dt o p e r f o r m a n c e so ft h es y s t e mb y a n a l y z i n gt h er e s u l t s o f e a c ht e s t t h e q u e s t i o n sm e n t i o n e da b o v e i n c l u d e s :t h e r e l a t i o n s h i p b e t w e e nt h e p a r a m e t e r s o fh m ma n d p e r f o r m a n c e so ft h es y s t e m ,t h er e l a t i o n s h i pb e t w e e nt r a i n i n gs t r a t e g i e s o fd i f f e r e n ts n r sa n dp e r f o r m a n c e so f t h es y s t e m e t c k e yw o r d s h t k ,h m m ,t e l e p h o n e b a s e dn a m er e c o g n i t i o n ,s n r i i i 声明 独创性( 或创新性) 声明 矿7 5 7 9 4 1 本人声明所呈交的论文是本人在导师指导下进行的研究工作及取得的研究 成果。尽我所知,除了文中特别加以标注和致谢中所罗列的内容以外,论文中不 包含其他人已经发表或撰写过的研究成果,也不包含为获得北京邮电大学或其他 教育机构的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任 何贡献均已在论文中作了明确的说明并表示了谢意。 申请学位论文与资料若有不实之处, 本人签名: 攘生i 本人承担一切相关责任。 日期: 砑e ;! ;j 关于论文使用授权的说明 学位论文作者完全了解北京邮电大学有关保留和使用学位论文的规定,即: 研究生在校攻读学位期间论文工作的知识产权单位属北京邮电大学。学校有权保 留并向国家有关部门或机构送交论文的复印件和磁盘,允许学位论文被查阅和借 阅;学校可以公布学位论文的全部或部分内容,可以允许采用影印、缩印或其它 复制手段保存、汇编学位论文。( 保密的学位论文在解密后遵守此规定) 保密论文注释:本学位论文属于保密在一年解密后适用本授权书。非保密论 文注释:本学位论文不属于保密范围,适用本授权书。 本人签名: 焦盏煎 日期: 盟12 :犁 导师签名 二埠j 卜一 日期:l 北京邮电大学硕士学位论文 基于电话信道的人名识别系统的研究 1 1 语音识别发展概述 第一章概述 语音识别的历史可以追溯到2 0 世纪5 0 年代。1 9 5 2 年a t tb e l l 实验室的 k h d a v i s 等人利用带通滤波器进行语音频谱的分析和匹配,并成功用于对1 0 个英文数字的识别,识别率达到9 8 。1 9 6 0 年e d e n e s 等研制成功第一个计算 机语音识别系统,同年g f a n t 提出了语音产生的声源一滤波器模型,对语音识 别工作起到了巨大的推动作用。 2 0 世纪6 0 年代末、7 0 年代初线性预测( l i n e a rp r e d i c t i o n ,l e ) 技术和动态时 间规整( d y n a m i ct i m ew a r p i n g ,d t w ) 算法被成功引入到语音信号处理中,有效地 解决了语音的特征提取和不定长匹配的动态时间对准问题。此时期的研究以孤立 字语音识别为主。 2 0 世纪8 0 年代语音识别研究进步走向深入,其研究重点是连接词语音识 别,用于连接词识别的分层构筑技术( l e v e lb u i l d i n g ) 得到发展。另一个重要的发 展是语音识别算法从模板匹配技术发展到基于统计模型的技术。其间,美国c m u 大学的j k b a k e r 等人将隐马尔可夫模型( h i d d e nm a r k o vm o d e l ,h m m ) 应用到语 音识别领域,在语音识别中获得极大的成功,成为语音识别的主要方法。 h m m 模型的研究使大词汇量连续语音识别系统的开发成为可能。1 9 8 8 年, 美国c m u 大学用v q ( v e c t o rq u n a t i z a t i o n ) h l v l m 方法实现了9 9 7 个词的非特定 人连续语音识别系统,其后,连续语音识别技术获得了长足的发展。 近年来,人工神经网络( a r t i f i c i a ln e u r a ln e t w o r k ,a n n ) 以及支持向量机 f s u p p o r tv e c t o rm a c l :d n e ,s v m ) 由于其较强的自适应性和自学习能力而获得了普 遍的重视,并在语音识别中获得了成功的应用。 汉语语音识别的研究紧密跟踪识别领域的最新研究成果并基本与之保持同 步。目前国内对大词汇量连续语音识别系统的研究已经接近国外最高水平。 目前美国i b m 公司开发的v i a v o i c e 非特定人连续语音识别系统已经成功推 北京邮电大学硕士学位论文 基于电话信道的人名识别系统的研究 向市场,芳获得了广泛的好评。此外,中国科学院、清华大学等都已经成功推出 了语音识别系统。 1 2 语音识别基本原理 语音识别本质上是一种模式识别的过程,其基本结构原理如图( 1 1 ) 所示,主 要包括语音信号预处理、特征提取、特征建模、相似性度量和后处理等几个功能 模块,其中后处理模块为可选部分。 图( 1 一i )语音识别基本原理框图 一个语音识别系统主要包括训练和识别两个阶段。无论是训练还是识别,都 需要首先对输入的原始语音进行预处理,并进行特征提取。下面具体说明各个模 块的功能。 预处理模块,对输入的原始语音信号进行处莲,滤除掉其中不重要的信息以 及背景噪声等,并进行语音信号的端点检测,即判定语音有效范围的开始和结束 位置,并进行语音分帧以及预加重等处理工作。 特征提取模块负责计算语音的声学参数,并进行特征的计算,以便提取出反 映信号特征的关键特征参数,以降低维数并便于后续处理。语音识别系统常用的 特征参数有幅度、能量、过零率、线性预测系数( l p c ) 、l p c 倒谱系数( l p c c ) 、 线谱对参数( l s p ) 、短时频谱、共振峰频率、反映人耳听觉特征的m e l 频率倒谱 系数( m f c c ) 等。特征的选择和提取是系统构建的关键。 在训练阶段,用户输入若干次训练语音,系统经过上述预处理和特征提取后 得到特征矢量参数( 序列) ,然后通过特征建模模块建立训练语音的参考模式库 北京邮电大学硕士学位论文基于电话信道的入名识别系统的研究 ( 可能为参考模板或者模型等) ,或者对已在模式库中的参考模式作适应性修正。 在识别阶段,将输入语音的特征矢量参数和参考模式库中的模式进行相似性 度量比较,将相似度最高的模式所属的类别作为模式的中间候选结果输出。 而后处理模块则对上述得到的候选识别结果继续处理,透过更多的矩识( 如: 语言学的语言模型、词法、句法和语义信息等) 的约束,得到最终的识别结果。 1 3 语音识别分类 从不同的角度和要求出发,语音识别有不同的分类方法; 按照词汇表大小分 每个语音识别系统都具有一个词汇表( v o c a b u l a r y ) ,系统只能识别词汇表中 所包含的词条。按照词汇表大小t 词汇表中所包含的词汇量的多少) 来分,有小 词汇表( 词汇量小于1 0 0 ) 、中词汇表( 词汇量在1 0 0 和1 0 0 0 之间) 、大词汇表 ( 1 0 0 0 词以上) 语音识别。一般而言,随着词汇表中词汇量的增多,各词汇之 间的混淆性增加,系统的实现将变得更托困难,系统的识别率也会降低。 按照发音方式分 语音识别按照语音的发音方式来分,可以分为孤立词识男l j ( i s o l a t e dw o r d r e c o g n i t i o n ,1 w r ) :连接词识另l j ( c o m l e c t e dw o r dr e c o g n i t i o n ,c w r ) 、连续语音识 别( c o n t i n u o u ss p e e c hr e c o g n r i o n c s r ) 3 种方式。 按照识别方法分 有模板匹配法、概率模型法等。所谓的模板匹配法是指把不同内容的语音转 换成不同的模板,并基于对模板匹配的相似性度量进行语音识别的方法。而概率 模型法主要是指利用隐马尔可夫模型( h i d d e nm a r k o vm o d e l ,h 5 4 m ) 的概率参数 来对似然函数进行估计判决并得到识别结果的方法。除了上述方法外,另外还包 括基于人工神经网络( a r t i f i c i a l n e u r a l n e t w o r k ,a n n ) 、支持向量机( s u p p o r t v e c t o r m a c h i n e ,s v m ) 等方法的语音识别技术。 根据上述分类准则,本论文所涉及的“基于电话信道的人名识别系统”,是 词汇量接近中词汇表规模、基于h m m 的孤立词识别系统。 接下来,将给出对“基于电话信道的人名识别系统”更为详尽的描述。 北京邮电大学颈士学位论文 基于电话信道的人名识刷系统的研究 1 4 本文的主要研究内容 14 电话语音识别系统概述 由于技术手段和计算资源的限制,自2 0 世纪9 0 年代中期起,语音识别的研 究由通用型听写机转为研制以语音为中心的应用和软件环境的结合,从而体现语 音作为一种交互手段的快捷方便的特性。同时这样的目标也使要解决的问题更具 有针对性,更方便利用特定环境下的语法约束和任务约束,从而也能达到更好的 识别率。电话语音识别技术的研究也应运而生。其中值得提的是,i b mv i a v o i c e t e l e p h o n y ,它是i b mv i a v o i c e 语音识别技术在电话通信领域中的延伸和发展, 提供了一个开放式的电话语音识别引擎和一系列的应用开发工具,使语音功能可 以方便快捷地被集成到电话系统中,为网上声讯服务、电子商务,以及涉及电话 通信的应用系统提供语音交互界面。同样,中文电话语音技术也同时支持普通话、 台湾普通话和广东话。 通过电话语音识别技术,可以使用户用电话( 座机或手机) 访问原来是能通过 网络的应用;在任何时间、任何地点快速便捷获取所需信息和进行在线交易。从 而在许多应用领域可以很方便地实现人机语音自动交互服务,例如:信息查询、 寻呼台、电话转接中心;金融领域,如家庭银行或股票信息查询:旅游服务领域, 如飞机订票或旅馆预定等。另外随着互联网的迅猛发展,电话轻松上网获取信息, 更是广大用户的迫切希望。通过电话上网,用户只需说出想得到的网上信息,机 器自动识别,将用户的请求送到互联网上,并把返回的相关信息用语音合成技术 回放给用户,提供人性化的语音应答交互界面。 随着电话语音应用的推广和深入,针对实际应用的需求,一系列新技术被开 发出来。例如,关键词辨识( k e y w o r ds p o t t i n g ,k w s ) 技术可使用户更加自然地和 远端服务器交互;针对字母及数字串专用声学模型的建立,为在线的语音驱动的 电子商务,个人化信息服务提供了有力的保证;针对许多应用中有中英文混合使 用的情况,还可以开发支持混合语音的技术,进一步拓展语音应用的广度。 北京邮电大学硕士学位论文基于皂话信道的人名识别系统的研究 电话语音应用示例一呼叫中心f c a l lc e n t e r ) 在竞争日趋激烈的今天,许多行业把越来越多的注意力集中到如何扩大规 模,在竞争中求发展,如何提高企业客户的服务水平及服务质量是一个企业成功 的关键所在,谁的服务领先,谁就求得更高效益,在市场竞争中占有先机。 电话服务中一g ( c a l lc e n t e r ) 经过较长时闻实豉中的发展,整体系统己日趋完 善,在国外广为流行,成为企业拓展业务、增强客户服务的重要手段之。从国 内情况来看,越来越多的客户,包括银行业、电信业、邮政业、证券和保险等, 已经开始把注意力集中到客户服务上来,并力求引进先进的c a l lc e n t e r 解决方 案。 1 4 2 基于电话信道的人名识别系统 基于电话信道的人名识别系统,是电话语音识别应用中的一个亮点。 实现基于电话信道的人名识别系统过程中涉及到的许多技术,同样是诸多电 话语音识别应用的实现过程中必然会涉及到的共性的部分。例如,在基于电话信 道的人名识别系统的核心技术基础上,增加端点检测和实时解码等技术,就可以 实现目前研究热度很高的关键词辨识( k e y w o r ds p o t t i n g k w s ) 技术。 基于电话信道的人名识别系统在孤立词识别技术基础上,具备了两个特征: “电话”和“人名”。 “电话”指语音识别器( r e c o g n i z e 0 获得的用于训练或测试的语音数据,是 基于“电话+ 语音板卡”的录音平台进行采集的,或通过电话信道传输到识别器 前端的;“人名”指孤立词的范围得到了限制,识别对象已经明确为人的姓名。 电话方式的数据采集,给用于训练和测试的语音数据赋予了两个主要特点。 首先,在语音数据的采样率和编码方式上,电话方式的选择通常是:采样率 为8 k h z ,编码方式为1 a w 或a l a w 编码。通常,在基于工作站p c 方式的语 音识别系统中,语音数据的采样率与编码方式为:1 6 k h z ,1 6 b i tp c m 编码。采 样率和编码位数的减少,意味着语音数据品质的下降,这最终会归结到识别难度 的提高。 其次,电话方式的语音采集,必须要考虑的内容是背景噪声对语音信号信噪 l ( s i g n a l - t o n o i s er a t i o ,s n r ) 的影响。通常,电话的摆放环境都是公共场所或是 北京邮电大学硕士学位论文基于电话信遘的人名识别系统的研究 居住场所,那里可能会存在大量可能的背景噪声源。是要求用户必须在足够安静 的环境下使用该人名识别系统,还是给系统增加足够强大的噪声处理前端功能, 还是在这两者中取一个折中,这是作为系统设计者需要考虑并给出解决方案的问 题。电话信道的传输,也会给语音数据带来一定的加性噪声,也会影响采集到的 语音数据的信噪比。 一个完整意义上的基于电话信道的人名识别系统,应具备的系统组成,如图 ( 1 2 ) 所示。 图( 1 - 2 ) 基于电话信道的人名识别系统组成 在上述系统组成中,我们可以看到:在集团电话程控交换机提供的交换功 能基础上,用户既可以通过公用电话网( p s t n ) 远程接入到自动语音总机,也可 以内线分机的形式接入到自动语音分机。语音板卡( v o i c eb o a r d ) 为语音数据的采 集提供了丰富的功能,负责完成电话信道上的语音信号到工作站p c 平台上的语 音数据文件的转换。 由于不具备在l i n u x 平台上语音板卡的开发经验,能够实现的基于电话信道 的人名识别系统并不是完整意义上的系统,它不包括电话信道和语音板卡部分。 北京邮电大学硕士学位论文 基于电话信道的人名识别系统的研究 综合考虑基于电话信道的人名识别系统的特点和本人在研究过程中能够利 用到的各种资源后,研究重点被确定为识别器各项参数与识别性麓的关系上。 由于本文所描述的基于电话信道的人名识别系统并不包括电话语音数据的 采集过程,研究所需的语音数据必须来自于现有的语音数据库。本研究将基于现 有语音数据库,通过数据模拟的方式,进行基于电话信道的人名识别系统的研究。 本文将通过独立的章节描述语音数据的准备过程。 1 4 3 语音识别单元的选取 语音识别单元( 基元) 的选择在语音识别中是非常重要的环节。识别基元的选 取应该基于如下几个原则。首先,对于不同的语言,基元选择的考虑是不同的, 因为各种语言的结构是不同的。例如,对于英语,可以用音素,也可以用词等作 为识别单元。对于汉语,则可用“声母一韵母”,也可用音节字、词等作为识别 基元。第二,识别基元选取具有灵活性,用它可以组成其他的语音或语法单位; 具有稳定性,它应该在不同的语音环境和语言环境中相对稳定。灵活性希望基元 尽可能地小,如音素;而稳定性则希望基元尽可能地大,如词甚至词组。然而, 基元的选择还需考虑搜索时间和模型存储开销。基元选得愈小,算法愈复杂,正 识率也愈低。另外,基元选择也与实际用途有关。一般地说,有限词汇量的识剐 基元可以选得大一些( 如:词或词组) ;而无限词汇量的识别基元则应选得小一些 ( 如:因素、声母一韵母等) 。否则,词或句的数量有千千万万,语音库就太大而 建立不起来。 语音识别基元有单词( 旬) 、音节和音素3 种,具体选择哪一种,由具体研究 任务决定。 综合分析上述内容,并考虑到基于电话信道的人名识别系统是一个中小词汇 语音识别系统,因此,本次研究决定采用人名( 词) 作为识别基元。换句话说,基 于电话信道的人名识别系统的基础是基于整词的h m m 建模( w h o l ew o r db a s e d h m mm o d e l i n g ) 方法。 7 j e 京邮电太学硕士学位论文基于电话信道的a 名识剩系统的研究 第二章研究平台的建立及描述 2 1 研究平台的建立 磨刀不误砍柴功。 需要达到一个预期的研究目标,在研究策略和研究工具的选择上投入的精力 和时间是必不可少的。通过大量的调查和阅读,了解学术界和产业界在自己选择 的研究方向上主流的策略和方法,并在不同的策略与方法之间进行充分的比较以 后,选择一个方向、一套方法,是我们的研究应该遵循的基本规律。 基于前麓调查结果,经过对各种研究策略与方法的优点和缺点进行取舍之 后,基本研究方案被确定为基于隐马尔可夫模型( k m m ) 的建模,劳采用英国 c a m b r i d g eu 咄v e r s i t ye n g i n e e r i n gd e p a r t m e n tf c u e d ) 发布的h t k ( h m mt o o lk i t ) 作为研究工兵。 若要采月h t k 作为研究工具,就必须选择一种操作系统( o p e r a t i n gs y s t e m ) , 作为h t k 的运行环境。 在国内外的许多大学和研究机构中,在语音识别与合成研究领域,l i n u x 研 发环境已经成为主流的选择。由于l i n u x 的开放源码特性,及l i n u x 环境下h t k 的开放源码特性,语音技术研究人员可以在研发过程中获得巨大的便利。 l i n u x 操作系统可以给学者提供非常强大的功能选择,但这同样意味着学者 要具备足够的知识和经验去使用这些功能。在我们日常的学习和生活中经常使用 的m sw i n d o w s 系列操作系统,为用户做好了非常完善的用户界面。m i c r o s o f t 在它设计的庞大的操作系统体系中,屏蔽了大量的系统操作有关的细节,这对普 通用户来说是一件非常体贴入微的好事,但对于从事计算机技术领域的研究人员 来说,这并不是我们所期望的。l i n u x 操作系统的正确安装和有效配置,对使用 者提出了很高的要求。尤其,当研究人员需要把l i n u x 操作系统配置成一个系统 研发平台时,研究人员需要考虑的内容会更多。 英国c u e d 发布h t k 工具时,采用了两种方式:一种是为w i n d o w s 系列操 北京邮电大学硕士学位论文 基于电话信道鲒人名识别系统的研究 作系统平台提供h t k 源代码和已经编译好的可执行工具;另外一种是为 u n i x l i n u x 系列平台提供的h t k 源代码。这就意味薏,如果研究人员采用了 u n i x l i n u x 系列的操作系统,他必须自己完成从h t k 源代码到h t k 可执行工具 的实现过程。 对c u e d 发布的h t k 源代码及相关文档进行认真细致的分析后,可以通过 三个步骤来实现源代码到可执行工具的转换: 首先,源代码的编译需要事先对系列环境变量进行定义。这些环境变量指 定了搡作系统的类型、编译器的名称、可执行文件的生成路径等重要信息,它们 涵盖了编译过程中操作系统和编译嚣所需的关键信息; 其次,h t k 的源代码的开发遵循了严格的功能模块化原则,因此,h t k 中 的每一个工具,在源代码层面上被划分为多个源码文件。为了正确反映各个源码 文件之间的依赖关系,并保证编译器的有效运行,h t k 为使用者提供了m a k e f i l e 。 ( m a k e f i l e :给编译器提供的编译配置文件) 透过m a k e f i l e 准确把握配置属性, 并做好必要的配置修改,并通过m a k e f i l e 实现编译; 最后,使用系统管理员的身份登陡,为需要使用h t k 韵用户,进行所需的 各种配置,让相关的研究人员获得能够使用h t k 工具的权限。 结束l i n u x h t k 研究平台的实现和配置后,接下来的步骤就是对h t k 各项 功能的了解和使用。h t k 平台建立之后,用户就可以随时查询h t k 提供的丰富 的帮助内容。 2 2h t k 概述 h t k 是用于建立隐马尔可夫模型( h i d d e nm a r k o vm o d e l s ,h m m s ) 的工具。 h t k 主要用于设计并实现基于h m m 的语音处理工具,典型的应用就是语音识 别系统。在语音识别系统的设计过程中,h t k 主要完成两项任务:h t k 的训练 工具利用训练数据,估计一系列h m m 模型的参数;h t k 的识别工具利用测试 数据,计算出一系列识别结果。 9 北京邮电大学硕士学位论文 基于电话信道的人名识别系统的研究 l a 协c e 挚 l 妇。媳鬻。s 鬈勰a 北。盎基。 攫澧。铷零“ n ( 2 1 1h t k 的功能体系结构 图( 2 2 ) h t k 应用各阶段示意图 o l d a m ;p r t 2 0 i t r a i n 曲a g :a r i a h s i s 北京邮屯大学硕士学位论文 基于电话信道的人名识别系统的研究 数据准备工具的作用 在数量和质量上满足要求的一组语音数据和相应的文本文件,是生成h m m 模型的必要条件。语音数据通常来自于已经建立好的语音数据搴中。把这些数据 用于训练之前,首先要转化成合适的参数文件格式,相应的文本文件也要转化成 正确的格式,即形成音素或词汇级别的标注文件。 模型训练工具的作用 在h t k 环境中,h v i m 可以具有任何拓扑结构。h m m 文件可以存储在简重 的文本文件格式中,可以使用任何常见的文本编辑器去浏览和编辑。在h m m 原 型( p r o t o t y p e ) 文件给出的拓扑结构基础上,h t k 训练工具可以计算出实际的模型 参数。 铡试及性能评估工具的作用 基于h m m 的识别器建立之后,性能评售是必不可少的关键环节。h t k 的 性能评估工具,在测试数据的标注文件和识别器的输出结果之间进行比较分析, 判定出那些数据被识别正确、那些数据被识别错误,并给出一个识别率的百分比。 北京部电大学硕士学位论文基于电话信道的人名识别系统的研究 第三章h m m 基本理论 3 1 隐马尔可夫模型( h i d d e nm a r k o vm o d e l ,h m m ) 隐马尔可夫过程是一个双重随机过程;一重用于描述非平稳信号的短时平稳 段的统计特性( 信号的瞬态特征,可直接观测到) ;另一重随机过程描述了每个短 时平稳段如何转变到下一个短时平稳段,即短时统计特征的动态特性( 隐含在观 察序列中) 。基于这双重随机过程,h m m 即可有效解决怎样识别具有不同参数的 短时平稳信号段,怎样跟踪它们之间的转化等问题。 人的语言过程也是这样一种双重随机过程。因为语音信号本身是一个可观察 的序列,而它又是由大脑里的( 不可观察的) 、根据言语需要和语法知识( 状态选择) 所发出的因素( 词、句) 的参数流。同时大量实验证明,h m m 的确可以非常精确 地描述语音信号的产生过程。隐马尔可夫模型( h a d d e nm a r k o vm o d e l ,h m m ) 被公 认为是在语音识别领域中最成功的统计模型之一。目前,其各种变形广为使用。 本章中,首先给出隐马尔可夫模型的概念,接着详细讨论隐马尔可夫模型的 三个基本问题及其求解方法,然后介绍隐马尔可夫模型的类型,最后讨论模型实 现的几个具体问题。 3 1 1 隐马尔可夫模型( h m m ) 的描述 在许多实际的问题中,随机序列的内部状态与其输出并不相同,例如下面叙 述的碗中取球问题。 有n 各己编号的碗,每个碗中装有确定数量的各种着色球,所有的球共有 m 种颜色。一个人甲每次首先随机选定一个碗,再从这个碗中取出一个着色球, 把该球的颜色告诉另一个人乙;对乙而言,能观察到的只是一个着色球的颜色系 列,而不知道每个球是从哪个碗中取出的。这里存在两个随机过程,一个是碗的 编号序列;另一个是观察到的着色球的颜色序列。显然,碗的编号序列与颜色序 列存在某种联系,如何完整地描述整个系统,只依靠观察马尔可夫模型不行,而 需要用所谓的隐马尔可夫模型来刻画。在语言处理中,也有一些类似的任务,实 北京邮电大学硕士学位论文 基于电话信道的人名识别系统的研究 践已经证明,用隐马尔可夫模型可以较好地进行建模,这在引入隐马尔可夫模型 后介绍。 一个隐马尔可夫模型可以由如下几个要素构成。 ( 1 ) 模型的状态。设状态集合为s = h s 二,j 、 ,时刻t 时所处的状态为 玑s 。状态之间可以互相转移。 ( 2 ) 描述状态之间如何进行转移的状态转移矩阵彳= ( ) 。 ( 3 ) 模型的观察值。设观察值集合为v = v 1 ,v 一 ,当t 时刻的状态转 移完成的同时,模型都产生一个可观察输出o ,v 。 ( 4 ) 描述产生输出的概率分布矩阵口= ( 巨,) 。其中, = 6 ,( j ) = 6 ,( 一) = 尸( d = 一 g = t ) l f ,1 j m 表示t 时刻状态为s ,时输出为v ,的概率。 ( 5 ) 模型的初始状态分布。设为z = _ ,码? ,丌。 ,其中, 一= p = s 。) 1 n 这样,一个隐马尔可夫模型可以由五元组( s :a ,v ,b z ) 完整摇述。但实际上, a ,b 中包括对s ,v 的说明。因此,通常用 l = 4 ,b ,疗 来记一组完备的隐马尔可夫模型参数。 图( 3 1 ) 是一个具有三个状态的隐马尔可夫模型。图中显示的一个状态序列为 ( 置,s ,s :,s :,毛) ,其输出的观察序列为( 0 1 。:,。3 ,。,啦) 。 在隐马尔可夫模型中,由于模型中对外表现出来的是观察向量序列 o = o ,) ,内部状态序列q = g l ,) 不能直接观察得到,因此而称为“隐”马 尔可夫模型。 北京邮宠大学硕士学位论文基亍雹话信道的入名识别系统的研究 4 1o t屯钆 0 5 图( 3 1 ) 具有三个状态的隐马尔可夫模型及其观察向量 在上述给定的模型框架下,为使隐马尔可夫模型能够用于解决实际问题,首 先需要解决三个基本问题,它们是: 问题一:给定观察向量序列o = ( o i 。:,0 ,) 和隐马尔可夫模型 丑= ( a ,b ,z ) ,如何计算由该模型产生该观察字列的概率p ( o j 丑) 。 阎题二:给定观察戽量序列p = ( o j ,o :,。t ) 和豫马尔可夫模型 五= ( 爿,b ,) ,如何获取在某种意义下最优的内部状态序列q = ( q 1q :,的) 。 问题三:如何选择( 或调整) 模型的参数五,使得在该模型下产生观察序列 o 的概率p ( 0 1 五1 最大。 从另一个角度去看问题一,可以看到它实际上是一个评估问题,即计算给定 的模型和观察序列的匹配问题。这个观点十分有用,当用几个模型去竞争匹配给 定的观察序列时,问题一的求解使我们可以从中选出一个最合适的模型。问题二 也被称为解码问题,即根据给定的模型和观察序列,寻找最有可能生成这个观察 序列的内部状态。闯题二的求解盘会在闯题三中接舷到。闯题三是训练问题,即 在给定一些观察序列作为样本的条件下优化模型参数,使得模型能够最佳地掐述 这些观察序列。可见,问题三是所有隐马尔可夫模型应用地基础。如果不能解决 训练问题,就根本无法得到隐马尔可夫模型,也就无所谓问题一和问题二了。 1 4 北京由屯大学硕士学位论文 基亍电话信遵的人名识别系统的研究 3 1 2 隐马尔可夫模型基本问题的解决 接下来分别给出隐马尔可夫模型中上述三个基本闻蕙的数学求解方法。 解决第一个基本问题 问题一为计算由给定模型兄生成某观察序列( 0 :0 二0 ,) 的概率p ( 0 1 z ) 。 为此,先定义前向变量口,( i ) : q ( i ) = p ( o j 。:q ,吼= t 五) ( 3 1 ) 前向变量表示的是在给定模型五下,时刻1 至,产生的观察序列为( 0 1 0 2 0 ,) 且t 时刻系统状态为s ,的概率。可以如下迭代求解口,( j ) 。 ( 1 ) 初始化 口1 = 万,6 f ( 0 1 ) 1 兰i n q + ,( ,) 1 ,n 1 f t 一1 p ( o l 五) = a 荆i 图( 3 2 ) 为前向变量迭代求解过程的示意图。可以看到,在h - 1 时刻,第, 个状态s ,可以由f 时刻的个状态转移而至。由于口,( i ) 是时刻f 时处于第f 个 状态和产生观察序列( o ,。:0 f ) 的联合概率,故口,( i ) a 。是时刻t + l 时由第i 个状态s ,转移至第j 状态s 和产生观察序列( 。,o :。r ) 的联合概率。i 从1 取 到n ,这个乘积加在一起,就获得了时刻f + 1 时处于第歹个状态_ 和产生 、7 +q ,l6 ,a :、,i 口 。 i!,。 北京邮电大学硕士掌位诠文基于电话瘩道的人名识茹系绕的研究 观察序列( 0 1 d :。,) 的联合概率。然后乘以在第,个状态产生观察向量0 i + ;的 概率,就获得了口。( j ) 。 气 s 1 f 呸( 0 f l q u ) 图( 3 2 ) 前向变量迭代求解过程示意 可以类似地定义反向变量层( f ) : 履( i ) = p ( q 。:一,。,j 毋= ,五) ( 3 2 ) 即在给定模型五且,时刻状态为s ,的条件下,自时刻t + 1 至时刻丁产生观察序列 ( 。,) 的概率。 反向向量同样可以如下迭代计算。 ( 1 ) 初始化 屏( i ) = 1 f i n ( 2 ) 迭代 屈( f ) = 屈+ ,( j ) a , j b j ( 钆,) 1 f n ,t = t 一1 ,丁一2 ,t ,1 尽管在问题一的求解中只需要计算前向变量,但反向变量在问题三的求解中 需要使用。 6 北京邮电大学硕士学位论文 基于电话信道的人名识别系统的研究 解决第二个基本问题 问题二和问题一有所不同,问题一能够给出一个礁切的解:而问题二却可能 有一些不同的解。问题就在于问题二叙述中所说的“在某种意义下”最优是什么 含义,不同的最优标准得至4 的结果可篚是不同的。 一个可能的标准是这样的:在绘定的观察序列0 下,q 是由每一个时刻r 最有可能处于的状态毋所构成的。该优化标准使状态序列q 中正确状态的麓望 数值最大化。为了求解这种标准下的问题二,定义变量 y ,( f ) = 尸( g = t 0 ,五) 目口在给定模型 和观察序列0 的条件下,系统在r 时刻状态为s 的条件概率。 利用前面所提及的前向变量和反向变
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 中小学完整版感恩主题班会课课件
- 网络平台运营经理年度述职报告
- 医疗器械法律法规知识培训考核试题(含答案)
- 以测促学闭环提质-高中周测常态化规范管理实施方案
- 市政工程挡土墙技术交底
- 施工现场布置专项施工方案
- 幕墙龙骨安装施工方案-施工组织设计
- 膀胱造瘘护理操作质量控制护理查房
- 野生菌健康教育
- 特种作业安全管理
- DB37-T 4581 2023 家庭养老床位设置与服务要求
- 文本课件制作教学课件
- 电力工程居间合作协议样本
- 小学生中医药科普知识讲座
- 施工勘察方案
- 《水浒传》名著导读优质课教学设计(部编版九年级上册)-
- 分布式光伏发电系统项目EPC总承包合同模板
- 5500必考词考研英语
- GM/T 0109-2021基于云计算的电子签名服务技术要求
- GB/T 5013.4-2008额定电压450/750V及以下橡皮绝缘电缆第4部分:软线和软电缆
- GA 1512-2018公安单警装备金属手铐
评论
0/150
提交评论