(电路与系统专业论文)基于进化神经网络建模方法的说话人辨认研究[电路与系统专业优秀论文].pdf_第1页
(电路与系统专业论文)基于进化神经网络建模方法的说话人辨认研究[电路与系统专业优秀论文].pdf_第2页
(电路与系统专业论文)基于进化神经网络建模方法的说话人辨认研究[电路与系统专业优秀论文].pdf_第3页
(电路与系统专业论文)基于进化神经网络建模方法的说话人辨认研究[电路与系统专业优秀论文].pdf_第4页
(电路与系统专业论文)基于进化神经网络建模方法的说话人辨认研究[电路与系统专业优秀论文].pdf_第5页
已阅读5页,还剩53页未读 继续免费阅读

(电路与系统专业论文)基于进化神经网络建模方法的说话人辨认研究[电路与系统专业优秀论文].pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

圭鎏奎翌盔兰堡圭兰尘圣圣。,。,。,。,。,。尘 基于进化神经网络建模方法的说话人辨认研究击 摘要 随着人机交互技术的发展,利用语音来确定说话人身份的说话人识 别成为身份鉴别的重要手段。尽管说话人识别技术的研究已取得了较 大的进展,但随着新应用场合的不断出现,这一领域内始终存在着挑 战。传统的基于统计方法的说话人识别技术,尤其在“与文本无关” 方式的说话人辨认中尚存若干未解决的问题。而进化计算和神经网络 等新兴的多学科研究领域,由于适合于大规模并行并且具有一定智能 特征,为解决这些复杂问题提供了新的契机。特别是它们可以实现更 加灵活的建模能力和更好的系统性能,因此为解决在传统理论框架下 说话人识别中的问题提供了行之有效的方法。 本论文以进化算法为优化方法,对说话人辨认中特征的自动选择和 神经网络模型的自动设计等问题进行了研究。 首先,针对说话人辨认系统中的特征选择和基于多层感知器( m l p ) 模型的自动设计问题,采用了共同进化的策略,将两者用一个进化过 程进行联合优化。针对m l p 的特点,我们改进了基于混合进化算法 的神经网络模型g a e p n e t ,提出了g a e p n e t l i 对m l p 进行结构和权 值的同时设计。通过设计合适的优化准则,一定程度上避免了局部最 优解并增强了网络在有限训练数据下的推广性能。同时,将特征选择 和分类器的设计相结合避免由人为划分带来的系统性能的下降。 接着,提出了一种进化高斯混合模型e g m m 。它在进化计算的框 架下,对模型的结构与参数同时进行优化,提供了高斯混合模型 ( g m m ) 结构设计的一种方法并在一定程度上提高了模型的泛化能 力。我们在目标函数中还引入了其它说话人的区分性信息以增加分类 的精度。算法中根据g m m 的特点设计了专门的遗传算子并采用了 * a k 文得到了国家自然基金项目( 6 9 6 7 2 0 0 7 ) 的资助 上海交通大学硕士学位论文 摘要 g a e p n e t i i 中的混合进化算法思想。 基于上述两种说话人建模方法,我们利用自建的语音数据库,对一 小型说话人辨认系统进行了实验测试。在每一种方法中,我们将基于 进化优化的方法与对应的常规建模方法进行了比较。初步实验结果表 明,基于进化的m l p 比固定结构的m l p 具有更好的性能。用本文方 法建立的新系统在正识率上比v q 系统与固定结构的m l p 系统均有较 大提高。每个用户模型对应的最优特征子集也要小于原特征集合,并 且各自都不相同。基于e g m m 的系统平均正识率比原有g m m 模型 也有所提高。较之基于类似性能的g m m 系统,e g m m 降低了系统的 平均高斯节点数量,有利于提高计算效率。 关键词:说话人辨认,进化神经网络,高斯混合模型,特征选择, 结构优化 as t u d yo fs p e a k e r i d e n t i f i c a t i o n b a s e do ne v o l u t i o n a r y n e u r a ln e t w o r k sm o d e l i n g a b s t r a c t w i t ht h ed e v e l o p m e n to ft h eh u m a n m a c h i n ei n t e r a c t i o nt e c h n o l o g y , s p e a k e rr e c o g n i t i o n ,w h i c h d e t e r m i n eo n e s i d e n t i t yb yh i s h e rv o i c e , b e c o m e sa ni m p o r t a n tw a yt oc h e c kp e o p l e si d e n t i t y a l t h o u g ht h es t u d yo f s p e a k e rt e c h n o l o g y h a sm a d ea g r e a tp r o g r e s s ,t h e r e a r es t i l ls o m e c h a l l e n g e si n t h i sa r e aw h e nn e wa p p l i c a t i o n sc o n t i n u o u s l ya p p e a r t h e s p e a k e rr e c o g n i t i o n b a s e do nt r a d i t i o n a l m e t h o d s ,e s p e c i a l l yt h e t e x t i n d e p e n d e n ts p e a k e r i d e n t i f i e a t i o nh a ss o m eu n s o l v e d p r o b l e m s m e a n w h i l e ,e v o l u t i o n a r yc o m p u t a t i o na n dn e u r a 】n e t w o r k sp r o v i d en e w o p p o r t u n i t i e st os o l v et h e s ec o m p l e xp r o b l e m sb e c a u s et h e ya r es u i t a b l ef o r m a s s i v e ,p a r a l l e lp r o c e s s i n g a n dh a v es o m ef e a t u r e so f i n t e l l i g e n c e e s p e c i a l l y , t h e s em e t h o d sc a np r o v i d em o r ep o w e r f u lm o d e l i n ga b i l i t ya n d b e t t e r p e r f o r m a n c e a s a r e s u l t ,t h e y a r ee f f e c t i v e w a y s t os o l v et h e p r o b l e m so fs p e a k e rr e c o g n i t i o ni nt r a d i t i o n a la p p r o a c h t h i st h e s i sp r e s e n t st h ea u t o m a t i cf e a t u r es e l e c t i o na n d d e s i g no f n e u r a l n e t w o r km o d e li ns p e a k e ri d e n t i f i c a t i o nu s i n ge v o l u t i o n a r ya l g o r i t h m sa s o p t i m i z a t i o nm e t h o d s f i r s to fa l l ,t od e a lw i t ht h ef e a t u r es e l e c t i o na n da u t o m a t i cd e s i g no f m 【l pm o d e l si ns p e a k e ri d e n t i f i c a t i o n t h i sp a p e r p r e s e n t sac o e v o l u t i o n a r y a p p r o a c h t o o p t i m i z e t h e m s i m u l t a n e o u s l y i no n ee v o l u t i o n p r o c e s s c o n s i d e r i n g t h ec h a r a c t e r i s t i c so fm l p w e i m p r o v et h ee v o l u t i o n a r yn e u r a l n e t w o r k sg a e p n e tw h i c hi sb a s e do na h y b r i de v o l u t i o n a r ya l g o r i t h m a n d p r e s e n tg a e p n e t l i t od e s i g nt h es t r u c t u r ea n d w e i g h t so f m l pa tt h es a m e t i m e b yd e s i g n i n gs u i t a b l ec r i t e r i o no fo p t i m i z a t i o n ,t h i sm e t h o da v o i d s t h el p e a l o p t i m aa n de n h a n c e s t h e g e n e r a l i z a t i o n o ft h en e u r a ln e t si n l i m i t e dt r a i n i n gd a t at os o m ed e g r e e a l s o ,t h ec o m b i n a t i o no ff e a t u r e + s u p p o r t e db yt h en a t i o n a ln a t u r a ls c i e n c ef o u n d a t i o no fc h i n a ( 6 9 6 7 2 0 0 7 ) i i i s e l e c t i o na n dd e s i g n o fc l a s s i f i e r sa v o i d st h es u b o p t i m a lp e r f o r m a n c e c a u s e db yt h em a n m a d es e p a r a t i o n n e x t 。a ne v o l u t i o n a r yg a u s s i a nm i x t u r em o d e l ( e g m m ) i sp r e s e n t e d u n d e rt h ef r a m e w o r ko fe v o l u t i o n a r yc o m p u t a t i o n e g 心o p t i m i z e st h e s t r u c t u r ea n dp a r a m e t e r so fg m ms i m u l t a n e o u s l y , p r o v i d e sam e t h o dt o d e s i g nt h es t r u c t u r eo fg 删a n di m p r o v ei t sg e n e r a l i z a t i o na b i l i t y a l s o , o t h e r s p e a k e r s d i s c r i m i n a t i v e i n f o r m a t i o ni s i n t e g r a t e d i n t o o b j e c t i v e f u n c t i o nt oi n c r e a s et h e a c c u r a c y o ft h e c l a s s i f i c a t i o n a c c o r d i n g t o c h a r a c t e r i s t i c so fg i v i m ,w ed e s i g nt w os p e c i a le v o l u t i o n a r yo p e r a t o r sa n d u s et h ei d e ao ft h eh y b r i de v o l u t i o n a r ya l g o r i t h mi ng a e p n e t l i b a s e do nt h o s et w oa p p r o a c h e si n s p e a k e rm o d e l i n g ,w ec o n d u c ta s e r i e so f t e s t i n ge x p e r i m e n t so nas m a l ls p e a k e ri d e n t i f i c a t i o ns y s t e mu s i n g s e l f - e s t a b l i s h e ds p e e c hd a t a b a s e 。i ne a c ha p p r o a c h ,t h em e t h o d sb a s e do n e v o l u t i o n a r y o p t i m i z a t i o n a n dt r a d i t i o n a l m o d e l i n g a r e c o m p a r e d t h e e x p e r i m e n t a lr e s u l t ss h o w t h a tt h ep e r f o r m a n c eo fn e u r a lm o d e ld e v e l o p e d b ye v o l u t i o n a r y m e t h o di sb e t t e rt h a nt h e o r d i n a r y m 儿pw i t hf i x e d s t r u c t u r e t h ec o r r e c tr e c o g n i t i o nr a t ea c h i e v e db yt h en e w s y s t e mb a s e do n o u rm e t h o di s h i g h e rt h a nb o t hv q m e t h o da n dt h e o r d i n a r ym l p t h e o p t i m i z e df e a t u r es u b s e to fe a c hs p e a k e ri sa l s ol e s st h a no r i g i n a lf e a t u r e s e ta n di sd i f f e r e n t c o m p a r e dt og m m t h ec o r r e c tr e c o g n i t i o nr a t eo ft h e s y s t e mb a s e do i le g 删i s a l s oi n c r e a s e dt h ew h o l es y s t e mh a sf e w e r g a u s s i a nn o d e st h a l lt h ec o n v e n t i o n a ls y s t e m sw i t hs i m i l a rp e r f o r m a n c e , w h i c hi sh e l p f u lt oi n c r e a s ec o m p u t a t i o n a le f f i c i e n c y k e y w o r d s :s p e a k e ri d e n t i f i c a t i o n ,e v o l u t i o n a r y n e u r a l n e t w o r k s , g a u s s i a nm i x t u r e m o d e l ,f e a t u r es e l e c t i o n ,s t r u c t u r e o p t i m i z a t i o n i v 圭鎏銮鎏盔主堡圭耋尘盘鎏二,。,。,。,。,塞= i l 。:坠 1 1 课题的研究背景 第一章绪论 随着人机交互技术的发展,语音处理技术成为其中最重要的研究领域之 一。当前人们主要将其作为语言的载体来研究,然而语音信号有着丰富的内涵, 它传递着不同层次的信息。首先,语音信号包含着说话人所要表达的语义内 容;另一方面,语音中也包含了说话人的态度、健康状况和感情等。这些由文 字所不能表达的信息有着重要的社会价值和交流功能。人的身份是语音中这类 信息的重要组成部分。由于人的话音这一生理特征具有与生俱来,不易丢失和 取代,较为稳定的特点,因此利用语音来确定说话人的身份,即说话人识别技 术成为身份鉴别的重要手段之一 2 。随着信息时代的到来,分布广泛的电话网 络和日益增长的计算机网络使得语音的获得和传输都较为容易,而语音和人机 交互技术的发展使得说话人识别系统的应用领域不断增长。这一发展趋势使得 说话人识别技术一直是语音处理领域中的研究热点b 。 尽管迄今为止说话人识别技术的研究取得了较大的进展h 】,在一些领域中 实用的说话人识别系统己获得一定程度的成功,但随着新的应用场合的不断出 现,对说话人识别系统的要求也越来越高。因此,这一研究中始终存在着挑战 。传统的基于统计方法的说话人识别技术在些要求苛刻的环境中无法发挥 其长处,而且在建立系统时需要大量的人工介入,缺乏理论上有效的指导。 同时,进化计算和神经网络是新兴的多领域学科一计算智能中的两大分支 临 “。它们都是通过拟物与仿生来寻求解决问题的途径。由于这些算法适合于 大规模并行并且具有如自组织、自适应、自学习等智能特征,不但成为人工智 能中新的研究领域,而且为解决某些复杂问题提供了新的契机。而近年来两者 的快速发展和相互交叉融合又产生了如进化神经网络等更为有效的计算模型 。用它们可以实现更加灵活的建模能力和更好的系统性能,因此为在传统理 论框架下说话人识别中一些难以解决的问题提供了行之有效的方法。 本论文以进化算法为优化方法,对说话人识别中特征的自动选择和神经网 络模型的自动设计等问题进行了研究。 上海交通大学硕士学位论文 第一章绪论 1 2 说话人识别概述 说话人识别可以看作语音识别的一种旧o 。当语音识别所关心的是提取发音 中的语言内容,则说话人识别所要处理的问题是提取发言人的身份信息。从技 术上讲,它和语音识别一样,都是通过对所收到的语音信号进行处理,提取相 应的特征或建立相应的模型,然后据此作出判断。 按照不同的应用场合,说话人识别可以分为两个具体的范畴,即说话人辨 认和说话人确认。前者根据个人的发音来判定说话者是参考人群中的哪一个 人,因而是一个多者选一的问题;而后者根据说话人的语音确定是否与其所声 称的参考说话人相符,这是一个二选一的问题,即或是确认,或是拒绝。说话 人辨认还可再细分为闭集问题和开集问题。闭集说话人辨认是指所有说话人都 是己知的n 个参考说话人中的某一个,而开集问题则包括说话人不属于n 个参 考说话者的可能性。开集说话人辨认通常采用设定门限的方法来判断说话者是 否在参考集合内。 按对语音内容的约束,不管是辨认还是确认,说话人识别都可分为与文本 有关的和与文本无关的两种方式。采用与文本有关的方式时,系统训练和测试 时所用语音的文本是一样或已知的。这时说话人需要按指定的文字或提示发 音。在该方式下工作的系统可利用词语及其序列的信息来达到较高的性能。采 用与文本无关方式的系统对训练和测试所用的语音文本没有约束,因而可以根 据说话人的任何话语来确定其身份。图1 1 显示了说话人识别的分类情况。 说话人自动识别的研究始于6 0 年代。近4 0 年来,在这一领域的研究取得 夕燮厌 与文本无关与文本有关与文本无关与文本有关 图1 1 说话人识别的分类 f i g l 1c l a s s i f i c a t i o no f s p e a k e r r e e o g n f f i o n 了重大进展“。从7 0 年代的模板匹配和长时统计量方法到9 0 年代基于h m m 和g m m 的统计模型方法,说话人识别系统的注册用户数不断地在增加,而正确 识别率也在不断地提高。同时,随着对信道中各种干扰和不匹配问题的深入研 圭鎏銮堡i 鐾堡圭兰堡鲨耋| ,。,。,。,。,。,圣:l 。:童垒 究,说话人识别系统从实验室走向了远程通信等要求更为苛刻的应用环境。 现在,尽管在安全要求严格的系统中,说话人识别技术必须同其它的识别技术 一起使用,但已达到的高性能使得基于这项技术的商用系统已经在若干领域中 得到了应用。而随着因特网和多媒体技术的发展,说话人识别的应用仍在不 断增加。这些应用领域包括【2 】 4 】【7 “: 1 ) 安全控制。当前人们主要使用名目繁多的号码和口令来进行安全控制。 但这样的号码容易遗忘和被窃取,应用不便。而用语音来确认个人身份是 一种非常自然和方便的途径。较之于其它方式的身份确认系统,如指纹和 虹膜识别,说话人识别系统成本低且容易实现。具体的应用有机密场所的 进入控制、合法使用通信线路、重要设备的身份核查及电子转帐业务的安 全检查等。 2 ) 语音数据的分类记录和检索。在会议、谈判和对话等场合,用说话人识 别技术可实现参加者的自动识别。若再和语音识别技术相结合,则可对发 言进行自动的分类记录。在庞大的语音数据库中,如每天的广播电视节目, 说话人识别是自动信息检索技术的基础之一。 3 ) 人机交互的说话人自适应。在连续语音识别等人机界面技术中,可利用 说话人识别技术对当前用户进行自适应或产生特定的响应。 4 ) 司法和军事领域。在案件审理中,此项技术可以帮助对嫌疑人的查证。 在战场上侦听时,说话人识别可用于辨认敌方指挥员。 在迅速发展的过程中,说话人识别技术中仍然有许多问题需要解决。由 于说话人识别各个分支的难易和研究程度不同,现存的技术难点也不同。说话 人确认问题是一个二值判决过程,较之于说话人辨认问题更为简单心j 。由于有 可能首先投入实用化,从而在研究中得到了更多的关注。基于语音的身份确 认系统已经有比较成熟的产品,目前的研究主要集中于实用化过程中判决规则 的确定和解决不同环境匹配等问题阳 。而和与文本有关方式的说话人识别技术 对所用的文本有着较强的约束,可充分利用已知的文本信息达到较高的识别 率。现在技术上最为成熟,但应用场合受到一定的限制 2 。与文本无关方式的 说话人辨认问题则既无一定的语句信息可利用,又是一个多者择一的问题,因 而至今仍具有其挑战性 8 。从应用的发展看,与文本无关的说话人辨认在语音 资料的自动分析,检索和协助法庭审理方面有着更广阔的前景。因此本文主要 考虑在与文本无关的说话人辨认背景下对若干尚未解决的问题进行研究。 上海交通大学硕士学位论文第一章绪论 1 3 与文本无关的说话人辨认 从语音处理的角度,说话人辨认与语音识别在原理上非常相似,因此它们 7 l r 一 音 l 特征提取( 选择) r _ ; 标号 图1 2 说话人辨认的通用模型“ f i g1 2 g e n e r a lm o d e l o f s p e a k e ri d e n t i f i c a t i o n 在各个阶段采用了相近的语音参数和模型。图2 是一个通用的说话人辨认系统 模型“。从模式识别的角度,说话人识别本质上是一个分类问题眙 。它可分为 特征提取和选择以及分类两个过程 。 1 3 1 特征提取和选择 特征提取过程是指从信号中取得其特征参量以区分各类信号“。在模式识 别中,提取具有显著区分性的特征是解决问题的关键步骤之一。然而对人的语 音感知研究表明,不同人说话中的差别包括先天和后天因素、低层次生理差异 和高层次习惯差异等不同方面,并且定量提取这些特征非常困难。因此从语音 信号中提取每个说话人所特有的特征是一个尚未解决的问题n 。 当前,说话人识别中主要根据前人研究的经验结果,采用反映声道等生理 特征的短时参数。对各种参数,如线性预测系数、冲激响应、自相关函数、声 道面积函数、基音和短时谱进行的比较实验表明“,倒谱系数的分类性能最好。 因此,倒谱系数是现在说话人识别技术中的主要特征参量。常用的倒谱系数有 线性预测倒谱系数( l p c c ) “和m e l 频率倒谱系数( m f c c ) 。 4 上海交通大学硕士学位论文 第一章绪论 在实际应用中,单一参量很难达到可靠的性能要求。为了提高系统的识别 率,也是由于对究竟那些参量是关键因素把握不充分,相当多的系统采用了混 合参量构成的矢量h3 。其中除倒谱外,还包括如倒谱的差分形式和基音等参数 等。但众多的特征参数增加了系统及其训练的复杂度,降低了识别的效率“。 因而,选择高效的特征子集在说话人识别技术中越来越受到研究人员的重视。 特征选择的搜索空间非常大,因此在传统的特征选择算法中,最优特征组 的构成都是用每次从现存特征中增加或去掉某些特征的方法直至特征数合适为 止。它们包括“自下而上”法和“自上而下”法【l “。但这些方法从优化的角度 来看都属于局部搜索法,往往会陷入局部极值。而进化算法为这问题提供了 较好的解决途径 1 “。然而目前的工作中特征选择与分类器的设计相互独立,忽 视了实际系统中不同部分之间的相互作用。本文在上述研究的基础上结合神经 网络分类器的设计,考察了利用进化算法对特征子集进行选择的方法。 1 3 2 分类方法 说话人识别中,特征向量所在的高维空间被称为说话人空间。说话人辨认 即在此空间进行的分类过程。在“与文本无关”的说话人辨认中,已采用了多 种不同的分类器。它们大致可分为非参数模型法、参数模型法和神经网络法三 种类型3 1 “”。 1 ) 非参数模型法 k 近邻法( k n n ) 和矢量量化法( v q ) 是两种典型的非参数分类法。它们不 对说话人的特征向量分布作任何假设,直接利用训练数据对说话人建立参考模 型。 k 近邻法可用于估计概率密度函数或直接作为分类器。最简单的k 近邻分 类器是当k = 1 时的最近邻分类器。最近邻分类器保留所有的训练数据,即所有 己知的特征向量及其类别标号。测试时,分类器计算给定的测试向量与所有训 练数据之间的距离,并将距离最小的训练向量( 即最近邻) 的类别标号赋予测 试向量。由于最近邻法需要存储所有的训练数据并进行穷尽式搜索寻找最近 邻,因此它的计算量和存储开销非常大陋】。 v q 法利用聚类算法构造训练数据集的代表点集,并用此点集代替原训练数 据集作为说话人的参考模型。在测试时,v q 法与最近邻法类似,测试向量与距 离其最近的代表点属同一类别。v q 分类器既无先验模型假定又具有较小的存储 上海交通大学硕士学位论文 第一章绪论 和计算开销,因此自从它引入说话人辨认以来,使用倒谱系数的v q 方法已成 为说话人辨认系统优良的测试基准。 2 ) 参数模型法 说话人辨认中的参数模型法借鉴了语音识别中的统计模型一隐马尔可夫模型 ( h m m ) 。由于在与文本无关的情况下特征序列无特定的相关性,通常采用遍历 h m m 模型。h m m 模型通过转移概率加入了时序信息,但研究结果表明“,在与 文本无关的应用中这一时间信息带来的性能改进非常有限。因此,在参数模型 中更为常用的是h m m 模型的退化形式一高斯混合模型( g m m ) “。 g m m 是仅有一个状态的连续h m m ,即多个高斯函数的线性加权组合。g m m 通 过最大似然估计对每个说话人的条件概率分布进行建模。因为每个说话人的先 验概率相当,测试时输入向量即属于输出概率最大的那个g m m 所表示的类别。 由于g m m 理论上可以逼近任意复杂的概率密度函数,它可以建立起稳健而光滑 的说话人模型;同时g m m 的训练可以由e m 算法高效地完成,因而基于它和它 的改进型的系统达到了较高的识别性能,是现在最主要的说话人辨认技术。然 而,作为统计方法,g m m 的性能受训练数据量的影响较大,同时对模型的结构 选择多依赖经验而无有效的指导。 3 ) 神经网络法 与上述两类方法不同,基于神经网络的说话人辨认技术利用监督式学习方 式进行建模,即在训练时,系统同时使用当前用户和其它用户的信息。实际上, 神经网络并不只学习说话人本身,而是对已知说话人之间的最佳分类决策函数 进行建模。因此,这一方法本质上具有区分特性,有利于提高分类的精度。另 一方面,说话人特征的统计分布位于高维空间且较为复杂,至今尚未弄清,而 神经网络具有学习任何复杂映射的能力,所以特别适合这一分类任务。神经网 络方法的缺点主要是缺乏对网络结构选择的指导,并且传统的训练算法收敛过 慢,易于陷入局部极值而导致训练不足或过训练等问题。 上面两种主要的分类方法中都涉及了模型结构的选择问题。这一问题在训 练数据较少时,变得更为重要。本文针对上述分类器的特点,提出了使用进化 神经网络的方法对模型的结构进行自动设计。由于g m m 模型在结构上类似于r b f 神经网络,因此在本文中将其作为一种特殊的神经网络来设计,这并不影响其 功能的实现。 6 皇堡銮鎏盔耋堡苎耋筌垒窒圣,。,。,。,。,。,。,。塞= 丝 1 4 进化计算与进化神经网络 自然界为我们解决各种问题提供了灵感的源泉。通过对各种生物过程的模 拟已产生了多种有效的问题求解方法和计算模型。进化计算是基于模拟自然界 经过进化过程提供答案的思想而发展起来的一种优化算法阳 1 ;神经网络则是 通过模仿生物神经系统组织结构和运行机制而形成的一种计算模型 。两者从 不同层次上对智能行为进行了模拟,为解决科学研究和工程领域中的复杂问题 提供了有力的工具。而两者进一步的融合,则为各自发展提供了新的动力并产 生了更为灵活有效的问题求解方法。 1 4 1 进化计算概述 进化算法是模仿生物界自然选择和遗传机制的一类随机搜索算法。它模拟 由个体组成的群体的集体学习过程,其中每个个体表示给定问题搜索空间中的 一点,随机地产生一初始群体,通过选择、杂交或重组以及变异操作,使群体 演化到搜索空间越来越好的区域。图1 3 给出了进化算法的一般流程。 图1 3 进化算法的一般流程 f i g 1 3g e n e r a lp r o c e d u r eo f e v o l u t i o n a r ya l g o r i t h m 现在,进化算法主要包括遗传算法、进化规划、进化策略等分支“。 遗传算法( g a ) 是最早出现的模拟进化中信息遗传机制和优胜劣汰的并行 全局搜索算法。g a 是一个群体迭代过程,群体由一组染色体组成,染色体代表 所求问题的一个可能解,常用串表示。迭代过程中g a 通过选择复制和遗传算 子的作用使群体不断优化。它的遗传算子同时采用杂交和变异,并以杂交算子 为主进行搜索。 7 圭鎏銮望盔兰婴主主堡彗奎二。,。,。,。,。,。,至:! ,i 童坠 进化策略( e s ) 利用类似于杂交的重组和变异算子,以多父本和多后代的 方式进行进化。与遗传算法不同的是,e s 直接在解空间上进行操作,强调进化 过程中从父代到子代行为的白适应性和多样性。 进化规划( e p ) 最初通过有限状态机的进化来获得预测所处环境状态并按 给定目标作出适当响应的能力,现在已推广到了数值优化和神经网络的训练等 问题。e p 模拟物种之间的竞争和进化过程中,因而仅使用变异算子。与e s 类 似,e p 也强调进化过程中从父代到子代行为的联系。 进化算法通过群体搜索策略和群体中个体之间的信息交换来进行问题求 解,因此具有如下共同的优点 :1 ) 在搜索过程中不易陷入局部最优值。2 ) 本质并行性使得算法具有较高的搜索效率并适合大规模的并行计算。3 ) 对求 解的问题结构要求不高,可以解决非规则、有噪声甚至结构尚无人能理解的复 杂问题。 上述三种进化算法具有各自的特点,并在发展的过程中不断相互借鉴、交 融,从而产生了许多新的混合进化算法。混合算法往往结合了几种方法的优点, 如粗粒度的全局搜索特性和细粒度的局部搜索能力,因此在具体问题的求解中 更为有效。此外,进化算法在发展中还出现了新的进化模式,如共同进化。 共同进化是指在进化算法中群体与环境一起进化的方式“。传统的进化算 法中可行解的群体在一个静态的环境中自适应,这要求有明确的静态目标函 数。但在某些情况下,目标函数的不断变化导致进化中种群的环境是动态的。 这样种群与环境的进化成为了不可分割的一体,因此要求用两个共同进化的过 程进行求解。根据两个群体之间的协作和竞争关系,共同进化可分为共生型“1 和竞争型“引两种。 1 4 2 基于进化算法的神经网络设计 人工神经网络以类比于生物神经系统处理信息的方式,用大量简单的处理 单元并行连接而构成一种独具特点的信息处理系统。自八十年代以来,这一系 统在理论上日趋完善并获得了广泛的实际应用 4 儿。但传统神经网络在特定问 题领域中应用时,尚需要一定的经验:一是生物学和工程应用表明神经网络的 信息处理能力是由它的结构所决定,因此需要对网络的结构作出估计,然而至 今还没有结构设计的理论指导;同时,一些网络的学习算法在解决实际问题时 还不能给出另人满意的结果,需要选择合适的参数。通常用尝试方法来解决上 述问题是非常复杂而低效的“。 圭鳖塑垒鎏耋耋丝圣。,。,墼垒 神经网络的结构设计是一个高度复杂的问题 2 。设计一个最优的神经网络 可以看作是在神经网络的权值一结构空间中的搜索问题。给定某一性能准则, 各种神经网络的结构性能组成的曲面具有无界、不可微、复杂并充满噪声以及 多峰值的特点。在神经网络的结构自动设计上,目前发展最成熟的是各种构造 和修剪算法【1 9 】。一般地,构造算法从一个最小的网络结构开始,在训练过程中 不断地增加新的连接、神经元以至隐层,逐步增长到一个合适的结构,而修剪 算法则相反。然而,这两种算法实际上是结构上的爬山搜索法,因而易于陷入 结构上的局部极值。此外,它们的搜索区域也只是网络结构空间的有限子集。 进化算法的引入为解决传统神经网络中的问题提供了有效的方法,其中最 成功的是进化神经网络( e a n n ) 【1 。e a n n 是一类利用学习算法和进化算法 两种方式进行自适应调整的神经网络,它的一个突出特点是可以适应动态的环 境。在进化神经网络中,进化和学习的共同作用使得对环境及其变化的自适应 更加有效。系统可以合理地改变其结构和学习规律而无需设计者的人为干涉。 从工程的观点看,e a n n 实际上是用进化算法对神经网络的一些组成要素进行 优化。 目前,进化神经网络可根据进化的对象分为三类:1 ) 权值进化的神经网络; 2 ) 结构进化的神经网络;3 ) 学习规则进化的神经网络。而具体的应用中可以 对它们进行任意的组合。在进化神经网络的算法中,最主要的两个问题是编码 表示和进化模式。 进化神经网络可以采用两种编码方式“:一是直接编码,这种编码形式包 含了神经网络的全部信息,优点是运算简单,易于实现,非常适合于搜索紧凑 的神经网络结构。但这一编码在表示大规模的网络时会导致进化的困难。另一 种是间接编码,它只对网络结构中最主要的特征进行编码,而用生成规则决定 网络的细节。这一编码的特点是简洁紧凑,可伸缩性强,但生成的网络规模一 般较大。 进化神经网络的进化模式最常用的有两种:遗传算法吨1 1 和进化规划口。遗 传算法更加强调杂交算子的作用,主要用于对网络权值或结构的进化;进化规 划则只用变异算子,现在成为网络权值和结构同时进化的主要方法。 随着进化神经网络研究的发展,算法中同时优化的神经网络成分不断增多, 而进化模式也更倾向于多种方法的集成。文献 2 明中基于结合遗传算法和进化规 划提出了一种新的进化神经网络,并在若干标准测试和实用问题中取得了迄今 占堡銮望盔茎堡三尘垄鎏三,。,。,。,。薹= 耋。i 鎏 为止最好的结果。本文在这一工作的基础上展开,主要研究了其算法上的扩展 及在说话人辨认问题中的应用。 1 5 本文的研究工作和组织结构 本文主要集中于说话人辨认中两种用户模型的进化优化:基于多层感知器 的说话人模型和基于高斯混合模型的说话人模型。作者的主要研究工作为: 首先,在分析了说话人辨认中多层感知器神经网络的优点与不足的基础上, 提出了应用进化神经网络的方法对多层感知器进行结构的自动设计。结合多层 感知器的特点,对一种新型的结合遗传算法和进化规划的混合进化算法进行了 改进。在算法中,提出了一种直接编码方式并设计了对应的杂交算子,克服了 原算法中的最大结构限制,并增加了局部竞争以提高搜索效率。此外,改进的 算法中还根据说话人问题中网络适应值的特点,采用了基于非线性排名的选择 方式。然后,本文针对说话人辨认问题中由于尚不清楚最优特征而使用较多特 征参量的问题,在设计神经网络分类器的同时用进化搜索方法对最优特征子集 进行了设计。同时,考虑到这一设计方式下分类器与特征子集的紧密联系,提 出了共同进化的设计策略,将优化神经网络和特征的进化过程结合在一个算法 框架中,提高了优化效率。 其次,作者将基于统计的高斯混合模型视为一种特殊的神经网络,并针对 当前说话人建模中不能对其大小进行合理估计的情况,提出了一种进化高斯混 合模型对其结构和参数进行设计。在优化中,着重考虑了在训练数据较少的情 况下,提高模型的泛化能力。本文在目标函数中还引入了其它说话人的区分性 信息,并将其统一在进化算法的框架下。这一措施有利于提高模型的分类精度。 算法中根据高斯混合模型的特点设计了专门的遗传算子并采用了前一模型中的 混合进化算法思想。 论文的安排如下: 论文的第二章讨论了说话人辨认系统中的特征选择和基于m l p 模型的自动 设计问题,提出了共同进化的策略,将两者用一个进化过程进行联合优化。针 对m l p 的特点,我们改进了基于混合进化算法的神经网络模型g a e p n e t ,提 出了g a e p n e t l i 对m l p 进行结构和权值的同时设计,并对算法的各个部分进 行了详细的讨论。 第三章提出了一种进化高斯混合模型e g m m ,提供了g m m 结构设计的一 1 0 占鎏銮鎏盔兰堡! 圭耋尘垄至呈,。,。,。,。,。,。,塞= i l ,:丝 种方法。在进化计算的框架下,讨论了优化准则设计问题,通过对模型的结构 与参数同时进行优化,在一定程度上提高了模型的泛化能力。讨论了根据g m m 特点设计的专门的遗传算子并对g a e p n e t l i 中的混合进化算法作了相应的改 进。提出了一种引入其它说话人的区分性信息的方法。 基于第二和第三章中的说话人建模方法,我们在第四章中在自建语音数据 库的基础上,对一小型说话人辨认系统进行了实验测试。在每一种方法中,我 们将基于进化优化的方法与对应的常规建模方法进行了比较,并分析了实验过 程。实验结果显示了本文方法的优越性,尤其在数据较少的情况下,提高了系 统的正识率和识别效率。 最后,在第五章总结全文,并指出了进一步的研究方向。 占兰銮鎏盔兰堡圭耋堡垒耋,。塞三耋塑型丝窒墼墼塑型鳖星丝堡堡垄墼堡重遨 第二章基于进化多层感知器与特征选择的说话人辨认 由于在求解模式识别问题中的优良性能,多层感知器( m l p ) 是最早用于 说话人识别的神经网络之一【2 4 】。然而,基于后向传播算法( b p ) 的传统m l p 在训练中尚存在一些不足,如设计时需要大量的人工介入以确定网络的规模和 避免系统训练时陷入局部最优值等,制约了m l p 在说话人辨认中的进步应 用 1 1 i 。本文首先通过引入一类新型神经网络一进化神经网络用以解决网络结构 的自动设计问题。由于进化算法的全局搜索特性和求解目标的多样性,我们还 通过设计合适的优化准则和对权值的进化,一定程度上避免了局部最优解并增 强了网络在有限训练数据下的推广性能。 特征选择也是说话人辨认中的一个重要问题。因为不同的特征集合可能 具有不同的分类能力。尽管倒谱系数及其差分被广泛地应用于说话人识别中, 通过优化特征子集可去除这些特征中的冗余信息,从而简化系统的设计并提高 其性能。另一方面,不同的分类器可利用不同的特征子集获得最好的性能。为 避免由人为划分带来的系统性能的下降,我们进一步将特征选择和分类器的设 计相结合,提出了设计说话人分类系统的共同进化方法。 2 1 基于多层感知器的说话人辨认 m l p 具有较强的分类能力,当输入信号的统计特性尚不清楚时,它便可通 过样本学习来逼近非常复杂的映射关系l l “,建立分类函数的模型。而说话人辨 认问题在本质上是一个分类问题,同时说话人特征的统计分布往往在高维空间 中且相当复杂,因此m l p 较为适合于这一问题的解决。m l p 具有区分性的特 点i “】,因此通常基于m l p 的说话人模型比独立的说话人模型具有更少的参数 但系统的性能相当。 2 1 1 系统结构和识别过程 作为一个多类别的分类问题,说话人辨认系统理论上可以用具有多输出的 单个神经网络网络来实现,但这样会大大增加网络的复杂度和训练的难度。因 此,在实际系统中,通常采用对每个说话人建立一个单输出神经网络模型的方 圭鎏銮翌查茎堡苎耋丝至篁耋,。,垒三耋二墼窒耋丝耋星堡塞些生丝墼塑叁垄墼些塞丝 法。每个用户的神经网络只将自身与其他用户区分开。这样,一个多类的分类 问题就转化为多个两类分类问题,从而降低了系统的设计难度。系统的结构同 第一章的通用模型,其中每个用户的模型及其典型的训练收敛过程见图2 1 。 输 入 特 征 ( a )( b ) 图2 1 ( a ) 基于m l p 的说话人模型;( b ) b p 训练收敛曲线 f i g2 1 ( a ) s p e a k e rm o d e l b a s e do nm l p ;( b ) c o n v e r g e n c ec u r v eo fb pt r a i n i n g 在图2

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论