(计算机科学与技术专业论文)支持向量机在说话人识别中的应用研究.pdf_第1页
(计算机科学与技术专业论文)支持向量机在说话人识别中的应用研究.pdf_第2页
(计算机科学与技术专业论文)支持向量机在说话人识别中的应用研究.pdf_第3页
(计算机科学与技术专业论文)支持向量机在说话人识别中的应用研究.pdf_第4页
(计算机科学与技术专业论文)支持向量机在说话人识别中的应用研究.pdf_第5页
已阅读5页,还剩115页未读 继续免费阅读

(计算机科学与技术专业论文)支持向量机在说话人识别中的应用研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

支持向量机在说话 识别中的成用研究 摘要 说落入谈裂爨校据港誊渡形串旋浃说话人叟瑾;| 整专亍为特征静语音参数,鑫韵 识别毖游诿人款过穰,它是潺音德譬处理载一个霾簧磺究方向,作为一黪生物鼓 诞技术,其鸯广泛韵应冀 l 蓼景,褥剃人餐越来越多麴赣究。 支持恕数枧i 是农统计学习理论上发展 圭! 来魄一耪模戏识别方法,在然决窍殴 撵零、嚣线煌及麓缨模式谈期阚题巾表瑗盘许多特蠢戆饯势,羁其媳摸式援溺方 法棚比主器裙两个不同点:一是它采用个非线性核函数来表示特征空间的内 积,另外它采用分粪阕疆最大豹凝德分类超平霆察联结穗风险最小位簌剡。囊予 支持向量机具有坚实的理论熬础,得至9 越来越多的人们研究,并在备个领域中得 劐广泛应用。 本文采用支持向量机对说话人进行建模,以文本无关说话人识别为主要研究 连蜜,分别从基于峻向量的说话人支持融璧规模型、支持囱基极。混食模型、基予 语句的说话人支持向量枫模型和基于通用背景模型的说话人支持向量机模型进 行深入鳓磺究。 论文深入分析了基于帧的说话人支持向量机模疆中各个方面对识别性能的 影响。说活a 识剐中普遍流行的方法都是使用基于帧的方法,其建搂过程一般是 使用模型来描述个人语音帧数据的空间分布状况,诧如矢量爨化模挺( v q ) 、高 袋瀚合模登( g m m ) 等铎。采耀支持两蟹机来稿遴个九语音特征的分布时,其 输入是说话入的语音帧向鬓。由于 5 f | 练支持向量机糯要解决一个二次规划问题, 1 。一般采用聚类的方法来选撵出一些代表穗的群本襻沟支持向餐钒的输入避行诩 练。论文分剃从选择样本方法、样本集大小、样本熊衩羹、样本得分方式、支持 淘螫梳棱蘧数、支持商量祝多类分类,支持融蓍戳概率输懑等方稀滋行深入磷究。 论文针对说话入语音数据韵大规模性_ 和支持向量梳解决二次规划问题之间 的矛盾,援密蓉予专家撬舍释基予迭饩谢练麓支持淘塞枫混合模型掰予谨话天 = ; 澍。集成学瑚是枫器学习领躐的一个燕门方向,b o o s t i n g 集成学习舞法和专家混 台冀法是入稍常溺静两种算法,镂罄这两穗算法瓣戆并其体结合谎话久识裘靛特 殊褴,分嬲掇密基予迭代调练的支持商蛩视混合筷警程豢予专家混合的支耨淘量 飒模嫠。蕊瓣,对予混合褥分缝合方式,鹰滚v q 模型秘g m m 搂鬃靛褥分计算 慧慧,分剐稳凄蒸予疆蓠黟计算方式帮蒸予禳率虢诗算方式。 论文摄攘佼绫熬矢鬟量仡模型帮裹辫混合模型,提出一类采用镳差馆患稳造 静梭爵数箨予说话入识翱。校据矢鳖曩纯模鍪孛计算褥分静方式,秘焉壤小涎蔫 支持向鞋机在说话人识别中的应用研究 码本商量将一个帧向量映射到一个矩阵上,然后累计一条语旬中所有语句帧的映 射矩阵便得到个语句的映射矩阵,将这个映射后的矩阵直接展开为一维向量并 作为支持向量梳豹输入迸行说话人识羽。迸一步将基予v q 模型的偏菠核扩联到 g m m 模型上,利用g m m 模型中各个高额分布的均俊作为码本,并同时采用概 率密度计算替代v q 模型串静致氏距离计算,采用高掰分布静方差将锻向量与均 值的差进行规整,这样便构造了基于g m m 模型的偏差核函数。它比前面的v q 孩函数在往戆上有较稀显戆爨高,量伉于传统的g m m 模型。 论文根据通用背景模型代表着说活人无关的语音特征的空间分布这一特性, 将其冀支持商爨凝结会梅造密一类薪的u b m s v m 模餮。a n c h o r 模黧是谈话久 检索和说话人确认中使用较广泛的一个模型,我们借艇其建立a n c h o r 空间的思 想,鬟矮逶瘸稽豢搂羹里瑟各个骞袈分布建巍一令公溜静参考空润,然后将一条 语句映射为这个参考空间的一个点,参考空间嫩标系采用两种方式进行构造:一 释是蒸予分毒狡重懿爨标系,蔫强一耱是基予分毒中,距离静坐标系。苁另一方 面来肴,这种建立坐标的方法也可以髫作是将长度不一样的语句映射别一个固定 大小熬窝量,这与基予诿匈懿支持霆鬈祝模型瑟黎骞共同之楚。交予u b m s v m 模型采用一个公共的说话人无关的背景模型建立起参考坐标系,因此落也可以用 于说诿入检索。摄据秘凌鲍愚恕,采嬲说话入耀关懿u b m - m a p 攮凝找替谈话 人无关的u b m 模型,构造出一个说话人相关的u b m - m a p s v m 模掇,实验证 明能较大幅度瓣提裹谈烈性筑。 关键词:谈话人识烈,支持囱量凝,矢量爨纯模型,裹欺混台模溅,遽爝磐 景模型 支持向量机在说话 识别中的应用研究 a b s t r a c t s p e a k e rr e c o g n i t i o ni st h ep r o c e s so f a u t o m a t i c a l l yr e c o g n i z i n gw h oi ss p e a k i n go n t h eb a s i so f i n d i v i d u a li n f o r m a t i o ni n c l u d e di ns p e e c hs i g n a l s 。a sak i n do f b i o m e t r c s , i ti sa ni m p o n a n tr e s e a r c hf i e l do fs p e e c hs i g n a lp r o c e s s i n ga n ds t u d i e db ym o r ea n d m o r er e s e a r c h e r s as u p p o r tv e c t o rm a c h i n e ( s v m ) i sas u p e r v i s e dl e a r n i n gt e c h n i q u ef r o mt h ef i e l d o fm a c h i n el e a r n i n ga p p l i c a b l et ob o t hc l a s s i f i c a t i o na n dr e g r e s s i o n 。r o o t e di nt h e s t a t i s t i c a ll e a r n i n gt h e o r yd e v e l o p e db yv l a d i m i rv a p n i ka n dc o w o r k e r sa ta t & t 转e l ll a b o r a t o r i e si n1 9 9 5 。s v m sb a s e do nt h e p r i n c i p i eo fs t r u c t u r a lr i s k m i n i m i z a t i o n , a n dh a sg o tm o r ea t t e n t i o ni nm a n yd i f f e r e n tf i e l d s f o ri t ss u p e r i o r p e r f o r m a n c e t h em a l ni d e ao fs v mc a nb ec o n c l u d e da st h ef o l l o w i n gt w op o i n t s :i t c o n s t r u c t san o n l i n e a rk e r n e lf i m c t i o nt op r e s e n ta l li n n e rp r o ( h k o ff e a t t i r es p a c e i t i m p l e m e n t st h es t r u c t u r a lr i s km i n i m i z a t i o np r i n c i p l ei ns t a t i s t i c a ll e a r n i n g 铂e o r yb y g e n e r a l i z i n go p t i m a lh y p e r - p l a n ew i t hm a x i m u mm a r g i nb e t w e e nt h et w oc l a s s e s , i nt h i st h e s i s ,w e d e v e l o pt h et e c h n i q u e sf o r t h et e x t w i n d e p e n d e n ts p e a k e r r e c o g n i t i o nu s i n gs u p p o r tv e c t o rm a c h i n e 。t h em e t h o d sc a nh ed i v i d e d i n t o f r a m e - b a s e da n du t t e r a n c e - b a s e d , w h i c hb o t ha r er e s e a r c h e di nd i f f e r e n tf a s h i o n s i nt h ef t 糟m e b a s e dm e t h o d , e v e r yf r a m ei ss c o r e db yt h es v ma n dt h ed e c i s i o r li s m a d eb a s e do nt h ea c c u m u l a t e ds c o r eo v e rt h ee n t i r eu t t e r a n c e ,w h i c hi sw i d e l yu s e d 撖t h eg e n e r a t i v em o d e l s ,i nt h i sm e t h o d 。t h ei n p u t so fs u p p o r tv e c t o rm a c h i n ea r et h e f r a m ev e c t o r s t r a i n i n gs v m s r e l yo nq u a d r a t i cp r o g r a m m i n go p t i m i z e r s ,s oi ti sn o t e a s yt ol a r g es c a l ed a t ao nt i m ea n ds p a c ec o n s u m i n g i no r d e rt oc o n s t r u c tas m a l l d a t as e tf o rt r a i n i n gs v 轰s ,s o m e 畦u s t e ra l g o r i t h mi sa d o p t e dt os e l e c tt h er e p r e s e n t s a m p l e sg e n e r a l l y w er e s e a r c ht h ee f f e c to ft h ec l u s t e ra l g o r i t h m s ,s i z eo fs e l e c t e d d a t a ,w e i g h t so fc l a s s ,s c o r i n gf a s h i o n ,k e r n e lf u n c t i o n s ,m u l t i c l a s sc l a s s i f i c a t i o n , p r o b a b i l i t yo u t p u t ,a n ds oo n i nt h i st h e s i s 。t h ee n s e m b l eo fs u p p o r tv e c t o rm a c h i n e si s a p p l i e d t o t e x t - i n d e p e n d e n ts p e a k e rr e c o g n i t i o n , a n dt w om o d e l sa r ep r o p o s e db ya d o p t e dt h e b o o s t i n ga l g o r i t h ma n dm i x t u r eo fe x p e r t se n s e m b l ei d e a s t h ep u r p o s e so fa d o p t i n g t h e s ei d e a sa r et od e a lw i t ht h el a r g es c a l es p e e c hd a t aa n di m p r o v et h ep e r f o r m a n c e o fs p e a k e rr e c o g n i t i o n ,t h ed i s t a n c e - b a s e da n dp r o b a b i l i y b a s e ds c o r i 珏gm e t h o d sa r e u s e dt os c o r et h en e wu t t e r a n c e c o m p a r e dw i t ht h ec o m , e n t i o n a lv e c t o r - b a s e d s p e a k e rm o d e l s ( v e c t o rq u a n t i z a t i o na n dg a u s s i a nm i x t u r em o d e l ) o u rm e t h o di s h y p e rp l a n - b a s e d t h ee x p e r i m e n t sh a v eb e e nr u no nt h ey o h od a t a b a s e a n dt h e r e s u l t ss h o wt h a to u rm o d e l sc a n g 。ta t t r a c t i v ep e r f o r m a n c e s , a n o t h e ri su t t e r a n c e - b a s e da p p r o a c h e sw h i c hm a pa l lu t t e r a n c ei n t oav e c t o ra s 支持向景机在说话人识别中的应用研究 s v m si n p u t a n dt h er e s e a r c h e r sf o e l l so nh o wt oc o n s t r u c tab e t t e rk e r n e ld e a l i n g w i t hu t t e r a n c e sh a v i n gd i f f e r e n tl e n g t h s i nu t t e m n c e b a s e ds v mm o d e l ,a d i s c r i m i n a t i v em e t h o di sp r o p o s e df o rs p e a k e rv e r i f i c a t i o n +a nu 毡e r a n e ec a l lb e m a p p e di n t oam a t r i xb yc o m p u t i n gt h ed i f i e r e n c et oac o d e b o o k a n dt h e ne x p a n dt h e m a p p e dm a t r i xt oav e c t o ra st h ei n o u to fs u p p o r tv e c t o rm a c h i n e sf o rs p e a k e r v e r i f i c 甜i o n 砀口g a u s s i a nm i x t u r em o d e l - b a s e dm e t h o di sa l s oc o n s t r u c t e db y u t i l i z i n g i t sn a t u r e t h em a p p e dv e c t o rh a d 泌a t e st h eu t t e r a n c e sf i t n e s st ot h e c o d e b o o k ,c o m p a r e dw i t ht h ed e r i v a t i v eo p e r m i o ni nt h ef a m o u sf i s h e rk e r n e l ,t h e m f 诧f e n c eo p e r a t i o ni su s e di no u rm e t h o d e x p e r i m e n t sw e r er u no nt h ey o h o d a t a b a s ei nt h et e x t - i n d e p e n d e n tc a s es h o wt h a tt h en e wm e t h o di ss u p e r i o rt ot h e c o n v e n t i o n a lg m m f o rs p e a k e rv e r i f i c a t i o n t 】妇u n i v e r s a lb a c k g r o u n dm o d e lo a b m ) r e p r e s e n t st h es p e a k e ri n d e p e n d e n t d i s t r i b u t i o no ff e a t u r e s ,a n di tc a l lb eu s e dt oc o n s t r u c tar e f e r e n c es p a c ef o rs p e a k e r r e c o g n i t i o nl i k et h ea n c h o rm o d e l t 1 1 ec o o r d i n a t e sa r ee s t a b l i s h e da c c o r d i n gt ot h e g a n s s i a nd i s t r i b u t i o n si nt h e u n i v e r s a lb a c k g r o u n dm o d e li n 捌嚣皋do ft h ev i m m l s p e a k e r si 1 1t h ea n c h o rm o d e l a n do n es p e a k e r sa l lu t t e r a n c e sm a i n l yl o c a t ei 1 3 as m a l l p o t i o no ft h ew h o l es p a c e as p e a k e r - d e p e n d e n tr e f e r e n c es p a c ec a na l s o b e c o n s t r u c t e du s i n gt h eu b m - m a pm o d e l 斑t h e 黜w a y 羽s u p p o f tv e c t o rm a c h i n e i su s e dt os e p a r a t et h i ss p e a k e rd e p e n d e n tp o r t i o nf r o mt h ew h o l es p a c e e x p e r i m e n t s s h o wt h a to l l rm e t h o d sc a l lp r o v i d es i g n i f i c a n tp e r f o r m a n c eg a i n sw h e nc o m b i n e d w i m 也ec o n v e n t i o n a lu b m m a pf o rs p e a k e rr e c o g n i t i o n 。 k e y w o r d :s p e a k e rr e c g g n i t i o n ,s u p p o r tv e c t o rm a c h i n e ,v e c t o rq u a n t i z a f i o n , g a u s s i a nm i x t u r em o d e l ,u n i v e r s a lb a c k g r o u n dm o d e l 第1 章绪论 1 。1 说话人识别概述 第1 章绪论 说话人识别【1 3 】是从说话人所发语音中提取出说话人是谁的信息的过程,说 话人识别与我们通常所说的语音识别有很大的区别,语音识别的目的在于想知道 说话人所说的内容,而不注意是谁在说话,而说话人识别的结果是想知道是谁在 说话,而并不关心说话人所说的内容。因此,语音识别强调的是所说的内容,而 淡化说话人的音色音质等特色因素,说话人识别则涉及到说话人发音器官上的个 体差异、发音声道之间的个性差异、发音习惯之间的个性差异等等。说话人识别 是交叉运用心理学、生理学、语音信号处理、模式识别、统计学习理论和人工智 能的一门综合性研究课题。 说话人识别包括两方面的内容:说话人确认( s p e a k e rv e r i f i c a t i o n ) 和说话 人辨认( s p e a k e ri d e n t i f i c a t i o n ) 。在说话人确认中,通常要求使用人提供个人姓 名或编号,系统要完成的任务是验证说话人与声言人是否为同一个人。这是系统 把说话人信号特征与计算机中预留下的声言为某人的特征相比较从而做出判别。 另一类是说话人辨认,在这种应用中不要求使用人提供个人姓名或个人编号,系 统要完成的任务是在把说话人的信号特征与计算机中预留下的众多人员的特征 相比较,从而确定是谁在说话。 在说话人辨认中,根据说话人训练目的不同,又可以分为开集说话人辨认和 ;闭集说话人辨认。闭集说话人辨认是基于系统认为测试语句的说话人一定是训练 集中的某个说话人;开集则认为测试语句的说话人还有可能不在训练集中出现。 开集说话人辨认和说话人确认通常都通过一个闽值来判断测试的说话人是不是 在训练集中。 说话人识别按照说话内容的类型不同可以分为文本有关( t e x t - d e p e n d e n t ) , 文本无关( t e x t i n d e p e n d e n t ) 和文本提示( t e x t p r o m p t e d ) 三种。文本有关是验 证和注册时说同样内容的语音,文本无关则不需要相同,文本提示中用户按照系 统指定的内容进行。文本无关的说话人识别的系统安全性最好,但其性能却不如 另外两类。然而有些领域,人们不可能知道说话人的文本内容,如法庭鉴别和说 话人语音跟踪等,因此文本无关的说话人识别更加受人们重视,应用也更为广泛 与灵活。 同其他生物识别技术,如人脸识别【4 】、指纹识别 5 】等技术相比,说话人识 别除具有不会遗失和忘记、不需记忆、使用方便等优点外,还具有以下特性:用 第1 章绪论 户接受程度商,由于不涉及隐瓤问题,用户无任何心壤障碍;潮用语鬻进行身份 识别可能是最自然和最经济的方法之一,声音输入设备造价低廉,甚愿无费用, 丽萁稔生物识掰技术静输入设备往往造价磊爨:在基予电信溺络的身份识别瘦用 中,如电话银行、电话炒股、电子购物等,与其他生物识别技术相比,说话人识 羽更为擅长,褥天独蓐。 说话人识剐作为计算机的一种智能接口脊广泛的实际应用,具有愿为简便、 准确、经济及爵扩震筏涎荮等众多砉l 己势,哥广泛应甭予安全验涯、运鬏说话入核 对、作为保密摧施的说话入确认、搜索罪犯、举事领域的应用以及医学领域应用 等各方嚣,特掰是基予窀痞辩绦秘身份谖爨。近年来,由于计算瓿魏艇震,谈话 人识别方法得到迅速发展,说话人识别作为具有语音识别与理解功能的智能人机 接日,跫薪一我计算瓿麓重要缮袋部分,其盛鼹矮臻穗在不凝扩大。 1 。2 机器学习与支持氢爨机 掇嚣学嚣( m a c h i n el e a r n i n g ) 是人工餐辘领域夔熏要分支。鉴予学习驻力 是智能体应具商的基本特性,机器学习作为提高机器智能的堂要手段,受至0 研究 人员的广泛注意,成必人工磐靛领域静研究核,之一。枧器学习是一个多学科熬 领域,它吸收了人工智能、概率统计、计算复杂性理论、控制论、信息论、哲学、 生理学、神经生物学等筹学摹; 发展的成果,构避霹以从经验中学习的枫嚣在蛰学 界和科技界都是研究嗣标之一。机器学习是关于理解匈研究学习的内在机制、建 立能够通过学习自动掇离自身水平的计算机程序的理论方法的学科。避年来机器 学习瑷论在诸多应用领域得到成功的威用与发展,已成为计算枕科学的基础及热 点之。采用枫器学习方法的计算机稷序被成功用于搜索引攀、医学诊断、检测 信用卡欺诈、证券市场分析、d n a 序剐测序、语音和手写识别、战略游戒和智 能机嚣人等应用领域,实际上,在任德商经验可以积累的地方,机器学习方法均 可发撵作用。 慝兹,不网学派j 时机器学习的定义存在差异。主蒙观点京: ( 1 ) 学习是使系统做一臻适应骸受纯,从而系统在下一次完戒阐样静竣炭 似的镁务时比翦一次爨有效。这种定义由西蒙( h a s i m o n ) 6 】提出,认为学习 就是彳予为的改变,它只强调效莱,而忽视动机。相应该机器学习定义豁观点怒系 统性能改善论。 ( 2 ) 学习是知谈的获取。这是属于认箱主义豹学习蕊点【7 】,这稀定义强调 知识获取丽忽视行为效果。一般来说学习后可以增长知识,然而获取知识是否有 用需餮由行为效果来衡量。另矫,有黧学习过程不能只霜知识来衡量,髑魏学会 游泳,它是人的一种生理性能提高。问样,和遮科学习定义相应的机器学习被认 簿1 章鳍诧 为虢是知识获取,鞠学习跫知谈的增长。 ( 3 ) 学习楚梭造躐修改掰经历攀耪麴表示。这种观点由迈党尔新基 ( r s m i c h a l s k i ) f 8 j 提出,强调学褥的任何知识都崮缬戳某种形式采表示和存贮, 褥曼系绕性缆煞教蛰哥橇炎这耪表示静瓣簿察结果。嗣一内容静始静 可敬寄不同 蠡奄袭示彩鬣,并瘗j 魏对系统鹃毽髓产生不藏麓影嫡,往往离散的知谖表示形式会 馊聚统其枣嶷好骢燃能黎行荧。 统诗擎弼理论 9 ,1 0 1 是一耱专门研究骞鼯样零情况下梳耩学习溪律游力量, 统计推暖瓶则不仅考虑瓣对接广越力的要求,嚣羹遗求农现寿有限僖患豹豢件下 褥剥最蠛结暴。v , v a p n i k 等人麸六、七卡年载开始致力予遮方嚣豹理论善秀究,到 九十年代中期,随蛰理论的不龋发展稠成熟,受至越来越多研究喾麴重襁,劳发 凝趱一耱麓豹模残识裂方法一支持囱量掇。 支持向嫩机( s u p p o r t v e c t o r m a c h i n e ) 【1 1 - 1 3 】是在裹维宅闻使熙线毂函数假 设空阕鲍学习系统,它由个寒疆最啦他理论数学嚣算法训练,该冀法实瑰了一 个由统计学习理论导出的学习偏鼹。此学习测量 招v a p n i k 鄹他的合作者提出, 怒一个准则糕的劳基强有力翡方法。在它提穗蘑熬嫠于誊采,在范爨广大瓣应用 中,其性能胜过其他大多数的学习系统。支持向量机在解决有限样本、非线性及 商维模式识别阅题中表现出许多特蠢的捩势,并麓捺广应用到函数拟合等机器学 习问题中。支持向量机磁在成为续神经网络研究之后机器学习领域新的研究热 点,并将攘动机器学习理论_ j f 技术驭褥黧大髓发展。 嚏3 支持向量梳与说话入识别 支持商羹视嗣其德模式识翱方法相院主要有两个不闯煮:一燕它采鹬个菲 线褴核函数宋表示特征空间的内积,弱外一方面它采用分类间隔最大的最优分类 麓平藩实溪缡稳魏验最小纯舔剿。l 封予它矮肖良好鹃理论基础,得到久稍越来越 多静研究,并在各个领域中褥蠲广泛应焉,使用支持向量机对说话入迸行建模也 程最涯足年褥到许多研究。 说话入镶瘸中采糯支持韵量飘辩说谣入涟行建横的方法大致可分两炎:一类 楚基予梭款方法,募终一炎燕基予语句戆方法。綦予犊熬方法是借鍪传统熬矢量 鬃纯模垄移菇凝溉合模登进行静方式,将梭淘量作为支持商蠹梳豹输入避行得分 魂“冀,然矮累计滋镯各个犊鳇雩导分褥裂总瓣一个分馕终秀决策依据。基予语句翡 方法鬟是将长度不一样静语旬透过莱释交换浃隽聿列一个戳定大小( 般凡千副尼 万缝) 鲮囱爨上去,然蜃馋为支持自量枫熬耱入邀行分类,囊予支持彝璧爨核丞 数豹镬焉,蕊褥这耱变换搽 搴霹荻采忍跨式方式涟行,鄯不需要鲡道露定太小南 量姻维数,或者棂本不熊映射到霸定大小起爨上,只震要知遴嚣蘩长度不一样黪 第1 章绪论 语句之间的距离,所有语句之间的距离构成核距离矩阵,便可以用来训练支持向 量机。 说话人识别中普遍流行的方法都是使用基于帧的方法,其建模过程是用一个 较好的模型描述个人语音帧数据的空间分布,比如v q 、g m m 等。在测试阶段 则对测试语音的每帧都采用训练好的模型进行计分,然后累计所有帧的得分值作 为最后决策的依据。基于帧的支持向量机模型也采用类似的方式进行,但同其它 生成型模型有明显的区别:首先,训练支持向量机需要解决一个二次规划问题, 对于大量的说话人样本来说直接训练是不可行的,因此采用选择代表性样本进行 训练;其次,支持向量机作为一个具有区分能力的分类器,它的训练需要负样本, 而传统的生成型模型则不需要;第三,支持向量机是一个二类分类器,它的输出 是样本标号,因此一般采用样本距离分类面的距离作为支持向量机说话人模型的 输出,这样得分值是一个具有正负符号的数。使用支持向量机的一个难点是核函 数的选择,人们一般使用多项式核函数与径向基核函数,w a n 等人提出了一类新 的样本距离计算核函数,并取得较好的实验效果:支持向量机的概率输出也是人 们研究的热点,忻栋 1 4 】采用概率方式进行说话人识别也取得好的实验效果,同 时他还采用支持向量机的区域描述对说话人语音特征的空间分布进行建模。 采用支持向量机进行说话人识别的另外一种更加流行的方法是基于语句的 方法,其基本思想是将长度不一样的语句映射到一个大小一样的向量上作为支持 向量机的输入,然后在跌射后的特征空间对向量之间的内积进行计算得到核函 数。由于核函数的使用,使得这种映射方式可以隐式进行,即不需要知道映射后 特征空间的具体形式,只需要知道它们在新的特征空间上的内积即可,而且可以 在原始空间计算得到这个内积。根据语句映射的方法不一样,人们发展出一些不 同的方法来,他们具有它们各自的特色:f i s h e r 核函数起源于生物信息学,它结 合生成型模型( 如g m m ) ,对模型的所有参数进行偏微分,得到的值构造出一 个向量,作为支持向量机的输入进行分类:通用线性区分序列核( g l d s ) 是根 据所有帧向量映射后高维向量的均值作为整条语句的映射向量,并采用一个相关 矩阵对映射向量进行规整,一般采用多项式展开的方法得到映射向量;概率距离 核则是采用两个高斯混合模型概率密度之间的k l 距离作为两个模型之间相似度 计算依据,它的缺点是k l 距离难以计算,且对于要求语句具有一定的长度,否 则语句计算出来的g m m 不能真正反映说话人语音向量分布情况;超向量核是利 用u b m m a p 模型之间高斯分量之间的对应关系,采用一个近似公式计算k l 距离,在此基础上得到映射方式:d t a k 核则用于文本相关说话人识别它对于 两条长度不一样的语句之间相似度使用动态时间比对的方法进行,并根据两条语 句的长度对相似度进行规整。由于采用基于语句的支持向量机模型分类原理更加 第1 章绪论 适合,因此较旗子帧的说话入支持向爨机模型更受人们豹重视。 程说话人识别中还有使用支持向缀机在决策层上进行得分融合 1 5 】,它主要 是将若于子模黧静褥分进行融合雨褥翻最后褥分,并俸出翔决。在通常说话人确 认中,嫩后得分是目标说话人模型得分与背景模型得分之差,b e n g i o 和m a r i e t h o z 采雳支持商量祝碰合鹜标说话人模垄翡得分与背景模黧豹褥分,v i n c e n t , v a n 在 p o l y v a r 数据库上进行实验,浆用g m m 通用背景模型和s v m 结合方法的等错 误率分嗣为6 。1 2 帮5 9 4 。中辩太黄僚采臻支持蠢量裰融合不蠢子带上高辩混 合模型得分,并在n i s t 2 0 0 1 库上获樽较好的性能提高。 零论文采鼷支耩融萋较嚣说话久遴抒建模,分别瓢嫠予黻豹模鍪帮基于语句 的模型两个大方面进行研究,对于决策层使用支持向擞机的算法则不作研究。 1 4 问题的提出 说话人识别的信息来源于说话人所说的话,其语音信号中既包含了说话人所 说的话娓信息,也包含了说话人鲍个瞧信息,怒语音特 芷和说话人个髅特 芷鲍混 合体。语音信号是准平稳的随机信号,可以用确定性的模型描述,也可以用统计 的模型撼述,对于说话入识别,可以髫 乍是一个分类| 掰题,也霹以看髂一个模式 识别问题,还可以看伟是一个判决决策问题,因此一般采用机器学习或者模式识 别的方法对说诿人进行建模与识别。 目前说话入识别韵模型大多数都怒基于生成型( g e n e r a t i v e ) 的模型,如矢 量量化模型和斑骺混合模型,并取得定的成功。随着近十多冬以来支持向量机 理论的发展,佟为一释区分型( d i s c r i m i n a t i v e ) 模型越来越受到人们的重视,应 用领域也越来越广泛。由于支持向量机坚实的理论基础及其良好的分类性能,它 也逐渐被应用剿说话入识剐中来,但阍时也由予语音倍号的特殊洼,支持向量机 难以处理这种大规模的,时序性的样本特征序列。因此本论文针对支持向量机在 文本无关说话久识荆闷题上避彳亍研究。在前面我们提出了目前说话入的支持向最 机模型可分为两大类:基于帧向量和基于语句的模型。在基于帧向量模型中,最 大匏困难在予解决大鬣的说落入语音赖商量与谢练支持向量梳需要瓣决二次瓶 划问题之间的矛盾;在揍于语匈的模型中,最大的困难在于如何计算长度不样 的语句之闻蓬凑或者稳钕度。本论文溺绕着这两类阔熬送行磷究,提氇;若干解决 方法进行实验研究。 1 。5 论文主要工作 本论文的主要工作是对采用支持向量机对文本无关的说话人识别进行研究。 第1 章绪论 论文主髂盘三熟分组成,第二章和筻三露是瑟最9 霭谖蛉分绍,繁霜露帮第五零对 綦于帧的支持向摄机说话人模型进行研究,第六搴和薅七章对基予谤翅泌支持囱 艇机说落人模型遴行研究: 第二章介绍目前说话人识别系统然基本概念与理论模型,包括特征提取。 说话人模型,系统性8 9 谨份搬拣等等; 第三章简单介绍了统计学习理论和支持向量机理论及其实现算法,与支持向 爨瓿捆关的技术如概率输出等等也给出麓单叙述; 第四章对基于帧的支持向基机模型中的若于问题进行实验研究,主要有代表 健样本选择方法、支持向量枫输出方茂、支持囱藿机多类分类、支持向爨扭核爨 数等等方面: 第五章针对说话入的大规模数据的特性,提激支持向量税混合模裂避行诞键 人识别研究,根据b o o s t i n g 髀法和专家混合算法思想分别建立两种不同混合方 式,并采用两种不同羽缀合方式附予模黧进行组合; 第六章进行纂于语句的支持向量机模型进行实验研究,克服旗子帧向量支持 f 瓤羹梳模藿翡缺点,校摇矢量模整中得分来源,提出一类额的核骚数掰予说话人 识剐,并进一步扩展剿高斯擒合模型。 第七牵耧丽邋角鹜豢模鼙,缩合a n c h o r 模麓思怒,构造凄一类瓤的参考空 瀚,并采糟支持向量机混合模型进行说话入识别研究,同时提出一个与说话入栩 荚匏u b m - m a 掰s v m 模篷; 最嚣第,章对本文韵工律进行总缩,并对下一步工作进行展疆。 6 第2 章说话人识别系统 第2 章说话人识别系统 2 。唾说话人谈别系统结毒弩 一个典型豹滋话a 识别系统瑟l 戆基本结梅磐下图瑟示: 图2 1 说谖人识别系统基本结构图 说话人识别系统进行识别时一般包括五个步骤:数字声音获得、特征提取、 骥式蓬配、裁决戳及摸餮参数静爨逶瘟: 1 数字声音获得:只有获得声音的数字信号,才可以有效的进行处理和特 缝摄取。缀蓬语誊输天竣螽,舞麦宽最弱瞧话瞬麓,把声波转纯袋模熬信号。模 拟信号然后被过滤,同时还对信道的损失进行适当的补偿。过滤厝,信号的带宽 在撼撵裁拔隈测褒尾奎赣特( n y q u i s t ) 率左右( 戆榉率懿半) 。然压,该摸掺 信号被抽样并通过a d 转换器变成数字信号。 2 。特捷提取:说话入憋摸型不是由诿毒售号褥至l 懿,嚣是遴过簸语褒痿号 中提取特征而得到的,是说话人谱啻特征的模型。测试音只有在经过特征提取后 方与说话入躯模型嚣进行b e 较和甄嚣,谰练语音也必寿进行语音耱铥提取嚣方毙 得到其特征的模型,因此特征提取是说话人识别系统中的熏要组成部分。 3 。模式匹配;测试巍救特缝与滢话人模型遴抒匹配,诗算暇囊0 距褰。说话 人确认时,只与所声称的说话入的模型进行匹配和匹配距离计算;说话人嚣别时, 需要与所旗人鲍模型进行甄配和疆配距离计算。 4 判决:根据匹配距离的计算结果,刿决说话人是否怒所声称的说话人( 说 话人确认) 或说话人到底是谁( 说话人辨认) 。 5 模挺参数的自适敝;为提高系统适应说话人特征的长时间变动情况,有 些系统设蠢这一部分,从蕊能够根据说话人识别的结果对褥到正确识别的说话人 的模型参数进行实时修正。 第2 章说话人识别系统 2 2 特征提取 从说话人的语音信号中提取出说话人的个性特征是说话人识别的关键,说话 人的语音信号中既包含了所发语音的特征,也包含了说话人的个性特征,目前还 没有找到能够将他们很好分离的方法。特征提取是指从语音信号中获得一组能够 描述语音信号特征的参数的过程,基本过程包括采样与量化、预加重、加窗和特 语音信号是声道频率特性和激励信号源二者共同作用的结果,后者对于某帧 而言常带有一定的随机性,而说话人的个性特征很大程度上取决于说话人的发音 声道,即声道频率特性,因此需要将这两者进行有效地分离。将语音信号处理为 其倒谱的过程如下图所示 由数字信号处理的知识可知,线性时变系统具有这样的特性,输出信号y ( n ) 是输入信号x ( n ) 和线性时变系统的单位采样响应h ( n ) 的卷积和,简写成: y ( 月) = x ( ) ( 押) ( 2 1 ) 单位采样响应实际上就表征了一个线性时变系统。对应于这里的语音信号的 数字模型,声道模型就是一个线性时变系统,而浊音激励或者清音激励就是输入 信号,所以有语音信号即输出信号s ( n ) 等于激励源信号即输入信号i ( n ) 和声道 模型的单位采样响应h ( n ) 的卷积和: s ( 厅) = f ( ”) - ( 疗) ( 2 - 2 ) 反映声道模型特征的单位采样响应h ,也是表征说话人声道的数字特征。 但因为在语音信号中两者卷积在一起,所以需要对两种信号进行有效的分离。使 a蔷甚卫昌卫墨蚤dfts ih bch a = 刮d f t 刮h 蚓 i 穹 。= 。+ 。一一。= f 。+ 。 a 爿至牟怔蜉连哆 图2 2 倒谱特征提取示意图 经过三步计算,就得到了c ( n ) ,也就是所说的倒谱 1 6 】。一般来说,倒谱的 低时部分对应于语音信号的声道分量,而高时部分对应着音源激励分量,故常将 第2 章说话a 识别系髋 倒谱的低时部分作为说话人识别的个性参数特征。 2 。2 。1 。1l p c c 特征 语音信号的倒谱特征与其线性预测系数( l p c ) 特征是有关系的。语音的p 羧线毪孩溺是爰j 蓬去p 令时刻瓣语音巢襻蓬熬线鳇组合隘最小豹簇溅滚差预测 下一时刻的语音信号采梯值。 设 s 。 舴= 0 , 1 ,n 一1 尧一梭靛语骜采撑彦列,n s 。蕊馥 l l l | 筵为: j 。= 一口,s h ( 2 3 ) 其中掰。( f = 1 , 2 ,p ) 称为p 阶线性预测的预测系数,可由使这一帧的预测误 麓懿平方耱最小德妥: n p 一1p 露= 【+ 搿i s n - t 】2 ( 2 - 4 ) n = oi = t 一般采用自相关法和协方差法进行求取。设噩线性预测系数的阶数p ,在一 蔽语音信号数据辍面诗箨信号鲁糟关函数: r = 舻。( z - 5 ) 计算此帧计爨协方蓑函数: p * 一s “s m ( 2 - 6 ) 将上湎两步中的结果代入下面方程; ,一, “一:,。 s 。一,s 。一, 一l s “ 2 2 ,2 ( 2 - 7 ) 其中是对n 0np 一1 求和。 线瞧鼷测系数求取鬃,然蜃计算线性强溅馕谨特,蠖# 。a = 1 , 2 ,。,力,霹殴遴 过下面等式获得: | 毛= 群 1 c 。= 否n - i ( ,一i k ) 搿。一。+ 搿。( 1 疗s p ) 。培 由于p 一般小于一帧中的语街采样点数,因此l p c c 只代表倒谱的前p 个值, l 2 乒 _ * # h s j s n 月 ” s 占 s 。 。,。,。l 一 = 1,犷iihhhhir , 叩 叶 冉 鹕 踟。k。一乳。 第2 章说话人识别系统 当p = 8 3 2 时就可较好地袭述声道特 芷。 2 2 1 。2m f c c 特征 美尔频率倒谶系数者q 良于人强的孵觉感知机理。s t e v e n s 和v o l k m a n 1 7 的磺 究表暖人焚瞬爨系统颞感知到鼹声音频率帮该声啻熬妨璎频率辩应关蘸并不楚 线性的,瓶是在一定范围内呈对数关系,如下图所示: l i c n l rf _ q u _ n # ys o “_ ( ;i o 强2 3 m e l 频率弯辫 一般采用个近似公妓来描述这种关系: f

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论