已阅读5页,还剩55页未读, 继续免费阅读
(计算机应用技术专业论文)远程语音通话实时说话人确认系统研究与实现.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 说话人识别技术是一种生物认证技术,其可按不同的标准分成说话人辨认 和说话人确认、文本相关和文本无关说话人识别等。在实用环境下,电话网络、 通信网络的文本无关说话人确认系统已成为当前说话人识别研究的重点,在现 阶段已开始出现基于这两个网络的实用实时说话人确认系统。本文的工作是围 绕构建一个基于网络语音通话的实时说话人确认系统展开的,主要研究了实时 语音端点检测、u b m 背景模型训练、说话人模型的建立以及最终的说话人确 认的判决等。 本文分析了实时说话人确认系统在现阶段的发展和应用,提出了本文系统 开发的背景和意义。 本文改进传统的双门限语音端点检测算法,在求短时平均能量和短时平均 过零率的阈值时,是对整个语音信号分别求能量值、过零率,再对帧能量值、 过零率进行排序再求解阈值,改变了传统的基于经验值或者语音的前几秒来计 算阈值的方法。经实验验证,该方法应用在实时的说话人确认系统中取得了很 好的效果。 按照g m m u b m 模型的说话人确认系统的流程,本文设计开发了基于网 络远程语音通话的实时说话人确认系统,且在端点检测算法的作用下系统能达 到较高的实时性。整个系统包括u b m 训练子系统、说话人模型训练子系统、 说话人确认子系统。最终针对2 0 个人的测试语音数据,设计了一个实验方案使 实验测试的结果更加可信。实验结果也显示了本系统可以达到了良好的效果。 关键词:实时说话人确认系统;g m m u b m ;实时端点检测 a b s t r a c t s p e a k e rr e c o g n i t i o ni sa k i n do fb i o l o g i c a la u t h e n t i c a t i o nt e c h n o l o g y i tc a r lb e d i v i d e di n t os p e a k e ri d e n t i f i c a t i o na n ds p e a k e rv e r i f i c a t i o n ,o rt e x t i n d e p e n d e n t s p e a k e rr e c o g n i t i o na n dt e x t - d e p e n d e n ts p e a k e rr e c o g n i t i o n n o w , t e x t - i n d e p e n d e n t s p e a k e rv e r i f i c a t i o no nt e l e p h o n es p e e c ho rv o i c eo v e ri n t e r a c th a sb e c o m eo n eo f t h ei m p o r t a n tf i e l d so fs p e a k e rr e c o g n i t i o n t h e r ea r es o m er e a l t i m es p e a k e r v e r i f i c a t i o ns y s t e m so ns e r v i c e ,w h i c hb a s e do nt e l e p h o n eo ri n t e m e tn e t w o r k t h i s t h e s i sf o c u s e so nt h ec o n s t r u c t i o no ft e x t - i n d e p e n d e n ts p e a k e rv e r i f i c a t i o ns y s t e m b a s e do ni n t e m e t r e a l - t i m ev o i c ea c t i v ed e t e c t i o n ( v a d ) ,u b m st r a i n i n gm e t h o d s , e s t a b l i s h m e n to fs p e a k e rm o d e la n dt h ed e c i s i o ns t r a t e g yo f a s va r em a i n l ys t u d i e d t h ed e v e l o p m e n ta n da p p l i c a t i o n so fr e a l - t i m ea s vn o w a d a y sa r ea d d r e s s e di n t h i st h e s i s t h eb a c k g r o u n da n ds i g n i f i c a n c eo f t h ep r o j e c ta r ea l s od i s c u s s e d w ei m p r o v et h ec o m m o nu s e dd o u b l et h r e s h o l dv a da l g o r i t h m ,w h i c h c a l c u l a t e st h et h r e s h o l do ft h es h o r t - t i m ee n e r g y ( e ) a n ds h o r t - t i m ez e r oc r o s sr a t e ( z c r ) b ye m p i r i c a lv a l u eo rt h ef i r s ts e v e r a lf l a m e so fs p e e c hd a t a o u rn e w a l g o r i t h mf i r s ts o r t sa l lf r a m e s e n e r g ya n dz c r , a n dt h e nc a l c u l a t e st h et h r e s h o l d s e x p e r i m e n t ss h o wt h a tt h ep r o p o s e da l g o r i t h mc a ng e tg o o dr e s u l t s u n d e rt h ef r a m e w o r ko fg m m - u b m ,w eh a v ed e s i g n e da n dd e v e l o p e da r e a l t i m ea s vs y s t e mb a s e do ni n t e m e t w i t ht h eh e l po fr e a l t i m ev a d ,t h i s s y s t e mi se v a l u a t e db a s e do nt h et e s td a t af r o m2 0p e o p l e s t h ee x p e r i m e n t a lr e s u l t s s h o wt h a tt h es y s t e ma c h i e v e dg o o dp e r f o r m a n c ei nt h eh i g hs n re n v i r o n m e n t k e yw o r d s :r e a l t i m ea s v ;g m m u b m ;r e a l - t i m ee n d p o i n td e t e c t i o n 厦门大学学位论文原创性声明 本人呈交的学位论文是本人在导师指导下取得的研究成果。本 人在论文写作中参考其他个人或集体已经发表的研究成果,均在文 中以适当方式明确标明,并符合法律规范和厦门大学研究生学术 活动规范( 试行) 。 另外,该学位论文为() 课题 ( 组) 研究成果,获得() 课题( 组) 经费或实验 室的资助,在() 实验室完成。( 请在以上括 号内填写课题或课题组负责人或实验室名称,未有此项声明内容的, 可以不作特别声明。) 声明人( 签名) :艨砌p 渺7 年6 月石日 厦门大学学位论文著作权使用声明 本人同意厦门大学根据中华人民共和国学位条例暂行实施办 法等规定保留和使用此学位论文,并向主管部门或其指定机构送 交论文( 包括纸质版和电子版) ,允许论文进入厦门大学图书馆及其 数据库被查阅、借阅。本人同意厦门大学将学位论文加入全国博士、 硕士学位论文共建单位数据库进行检索,将学位论文的标题和摘要 汇编出版,采用影印、缩印或者其他方式合理复制。 本学位论文属于: () 1 、经厦门大学保密委审查核定的保密论文,于 年月日解密,解密后适用上述授权。 () 2 、不保密,适用上述授权。 ( 请在以上相应括号内打“ 或填上相应内容。保密学位论 文应是已经校保密委审定过的,方可打“ ,未经审批均为公开论 文。此声明栏不填写的,默认为公开论文,均适用上述授权。) 作者签名:曲i 咖兮 导师签名:硅彳昏为 日期:炒7 年6 月占日 日期:印年多月多日 第一章绪论 第一章绪论 人类每一个个体本身携带着众多的“身份信息”即个人生物特征,而 且每个人的生物特征在理论上都是独一无二的,这使得人们可以根据个体的生 物特征来区分不同的人,乃至进行身份鉴别。当前,人类已经采用的生物特征 有手形、指纹、脸形、声纹、虹膜、视网膜、脉搏、耳廓、步态、d n a 等等, 并发展了相应的多种特征识别技术1 1 1 。人类的生物特征有的是相对比较容易获 取的,比如脸部特征、声音特征、步态特征等;也有的是相对较难获取的,如 指纹、虹膜、d n a 结构等,这些特征的获取一般都需要特殊的、复杂的设备。 从另一个角度来看,人类的生物特征有的是基于生理特征的( 如d n a 、手形、 指纹等) ,有的是基于行为特征的( 如步态等) ,还有的是生理特征和行为特征 相结合的。声音是同时兼有生理特征和行为特征的一种生物特征【2 】,它不仅仅 与先天的声道结构紧密关联,而且同后天的发音方式、语言环境也密切相关。 利用人的声纹特征作为生物识别的一种手段已有多年的历史了,而且其实际应 用也越来越广泛,这主要也是基于语音本身所具有的特点,如声音相对容易获 取、声音获取设备要求不高、语音数据传输容易、获取数据时不影响正常通话 交流等等【3 】。 i i 说话人识别技术概述 说话人识别( s p e a k e rr e c o g n i t i o n ,s r ) ,也称为声纹识别( v o i c e p r i n t r e c o g n i t i o n ) ,是指利用说话人的语音信号同预先提取的说话人语音特征相比较 来确定或鉴别说话人身份的技术。说话人识别问题的解决涉及到人的发音器官、 发音习惯、声学原理、生理学、数字信号处理、模式识别、人工智能等知识, 因此说话人识别技术是- - f - 综合性研究课题【3 】【4 j 。 说话人识别的具体应用可以分为两类,一类是说话人辨认( s p e a k e r i d e n t i f i c a t i o n ,s i ) ,另一类是说话人确认( s p e a k e rv e r i f i c a t i o n ,s v ) 。前者是把测 远程语音通话实时说话人确认系统研究与实现 试说话人的语音特征与数据库中已经存在的众多人员的模板相比较,根据匹配 程度,从而确定说话人的身份,这是一个多选一的问题;后者是要求待验证的 说话人需先进行身份声明,系统再根据输入的语音信号的特征与预先声明的库 中对应身份的声音模板进行匹配以确定说话人身份的真伪,这是一个一对一的 匹配问题,只能有两种结果可选择:或是肯定( 接受) ,或是否定( 拒绝) 。在 实际应用中,说话人确认的灵活性和应用性一般要好于说话人辨认,说话人确 认系统的识别性能不会因为系统用户数量的增加而下降,而说话人辨认系统的 识别性能则会随着用户数量的增加而下降。影响说话人识别系统性能的因素如 表1 1 所示。 表1 1 影响说话人识别系统性能的因素 录音通道特性 语音质量噪声大小与种类 训练语料与测试语料间之多变性 固定系统提示说话人选择 语音形式 文字语句,文字不特定 训练说话人模型时所用的语音长度 语音长度 说话人识别时所用的测试语音长度 说话人多寡 说话人构成 说话人性别 本文主要讨论的对象是说话人确认系统。 一个说话人确认系统可以分成两个不同的阶段训练阶段和验证阶段, 这两个阶段可以看成是两个连续的、独立的子过程。训练阶段的目的是生成说 话人或者背景的特征模型,系统根据说话人的若干训练语料,提取出适合于建 立统计模型的声学特征参数,通过训练、学习建立每个说话人的统计模型,最 终组成说话人模型库。说话人识别系统训练过程如图1 1 所示: 2 第一章绪论 目撇鑫的臣亟丑型气至乎霸篙人 图1 1 说话人识别系统目标模型训练过程 图1 2 描述的是一个说话人确认系统的验证阶段。系统的输入信息有两个, 一个是测试说话人的语音数据,另一个是系统所声明的说话人身份。测试说话 人的语音数据的特征参数提取同训练阶段;同时,所声明说话人的说话人模型 以及背景模型被提取出来参加验证。最后一个模块计算似然比分数并进行得分 规整,根据一定的相似性准则来判断测试说话人的身份。 来翔说话入的 溺巍数据 新声明的 赏鼢 图1 2 说话人确认系统验证过程 菝收拒绝 另外,根据训练和验证说话人的语音内容的不同,说话人识别系统还可以 分为与文本相关的( t e x t d e p e n d e n t ) 、与文本无关的( t e x t i n d e p e n d e n t ) 及文 本提示( t e x t p r o m p t ) 三种不同的方式。文本相关说话人识别系统要求用户按 照规定的内容发音,并根据特定的发音内容建立精确模型,因而理论上识别效 果较好,如果用户发音的内容与规定的内容不符合,则无法正确识别该用户。 文本相关系统所使用的文本可以当成是“密码 ,识别时用户除了要求必须知道 密码,而且必须是目标说话人,这类系统可以用在个人安全认证系统上,如银 行、保险柜等这类限于所有者才能使用的情况。文本无关说话人识别系统不规 定说话人的发音内容,说话人可以任意说话,这类系统主要应用在小集体用户 远程语音通话实时说话人确认系统研究与实现 上,即一组人共同使用一个识别系统,如专门会议室等。不过,无论是文本相 关还是文本无关,系统都存在着区分现场说话和回放录音的问题,文本提示识 别系统可以有效检测以录音来假冒真实说话人等类似情况,而且也可以有多种 方式来实现,例如系统可以随机播放一段语音,并要求用户照着发音;或者是 系统向用户提出一组问题,并要求用户给出正确回答,之后再进行文本相关说 话人识别。文本提示的说话人识别系统,可以减少用户使用录音等方式假冒目 标说话人声音情况的发生,使系统的性能进一步提高。 1 2 说话人识别技术研究进展 说话人识别也可以算是人的一种本能,因为人可以做到“闻声辨人”。人类 对说话人识别的研究始于2 0 世纪3 0 年代,早期的工作主要集中在人耳听辨实 验和探讨听音识别的可能性方面。而对说话人语音自动识别的研究则始于2 0 世纪6 0 年代,这一阶段的主要工作集中在各种参数的提取、选择和实验上,并 将倒频谱和线性预测分析等方法应用到说话人识别中。七十年代,模板匹配方 法、动态时间规整和矢量量化等逐渐应用于说话人识别中,使说话人识别的性 能得到了大幅度的提高。八十年代以来,m f c c 的出现,使说话人识别的系统 性能有了进一步的提高,人工神经网络( a r t i f i c i a ln e u r a ln e t w o r k ,a n n ) 和隐 马尔可夫模型( h i d d e nm a r k o vm o d e l ,h m m ) 在语音识别领域得到了成功和广 泛的应用,并且成为说话人识别的重要技术。特别是h m m ,由于其良好的概 率统计特性,已当之无愧地成为文本相关的说话人识别的首选【5 】【6 】。 进入九十年代后,高斯混合模型( g a u s s i a nm i x t u r em o d e l ,g m m ) 以及通 用背景模型( u n i v e r s a lb a c k g r o u n dm o d e l ,u b m ) 由于其简单灵活有效以及较 好的鲁棒性,迅速成为文本无关说话人识别的主流技术 7 1 ,将说话人识别引向 一个新的阶段。近几年,大量说话人识别新技术的出现,将说话人识别带入到 另一个新的发展阶段,如大规模连续语音识别应用于与文本无关的说话人识别、 s v m 和g m m 的结合、评分规整以及针对信道不匹配问题的补偿技术等等,都 对说话人识别技术有所促进。 4 第一章绪论 随着说话人识别技术的不断发展,说话人识别技术也逐渐走出实验室,应 用于实际生活中,目前成功应用的领域有公安司法、银行证券保险、信息安全、 门禁系统等。以下列举了一些说话人识别技术的实际应用: ( 1 ) 公安司法:现在录音证据已逐渐成为一种有效证据为法院所采信,通过 说话人识别技术可以确认录音材料中的说话人身份,为案件审理提供帮助,这 也是当前国内说话人识别技术应用的一个重要领域。在美国,有监狱管理部门 利用说话人识别技术作为监视狱外服刑和假释犯人的一种有效手段,被监视人 员必须通过电话进行身份认证以及汇报自己的活动情况。 ( 2 ) 银行证券等系统:加拿大的t dw a t e r h o u s e 已经提供了通过电话说话人 识别技术手段进行远程认证的方式来加强系统安全性。此外,在菲律宾的退休 金管理部门、澳大利亚的健康管理中心( a h m ) 均有采用电话说话人识别技术对用 户进行身份认证【踟。 ( 3 ) 信息安全等领域:爱尔兰联合银行( a l l i e di r i s hb a n k s ) 声称已在内 部配置了说话人验证系统以协助公司i t 服务部门帮助公司员工的密码重设工 作【8 1 0 ( 4 ) 军队安全系统上的应用:美国m i t 林肯实验室的多数说话人识别的合同 是与空军签订的协议,主要也是负责战时敌我飞机飞行员身份的鉴别,对敌军 飞行员的跟踪定位【9 】。 ( 5 ) 机密场所的门禁系统:说话人识别技术在嵌入式领域也有应用案例,目 前市面上已有语音门禁、语音门锁、语音箱柜锁等产品。 目前,已有不少成熟的说话人识别技术开发商为政府部门、企业单位等提 供技术服务支持,如以色列的p e r s a y ,美国的v o i c e v a u l t ,加拿大的d i a p h o n i c s 等,这些企业都已经有把说话人识别技术应用到政府部门、银行业、电信公司、 电话语音服务、网络认证、语音签名等的案例【引。国内说话人识别技术研究和 开发相对领先的科研机构和企业有中科院声学所、中科院自动化所、北京大学、 清华大学、北京得意音通技术有限责任公司、上海优浪信息科技股份、安徽科 大讯飞信息技术股份有限公司等。 在国内,当前说话人识别技术主要还是应用在司法鉴定、嵌入式设备( 声 5 远程语音通话实时说话人确认系统研究与实现 纹锁、门禁等) 等方面,不过也开始了其他领域的尝试,如招商银行于2 0 0 8 年开始与p e r s a y 接触,有意部署说话人验证系统【1 0 1 。 1 3 论文的主要工作及组织结构 本文的工作是实现了一个基于远程语音通讯的实时说话人确认系统,该系 统采用高斯混合通用背景模型( g m m u b m ) ,并且考虑了实际应用场合而采 用了较为常用、有效的端点检测方法。该系统采用的是文本无关的说话人确认 方法,系统在实际使用过程中,可以一直对说话人进行检测,并根据确认结果 做出验证通过或者可能假冒的提示信息。 本论文由以下几个章节组成: 第一章是绪论部分,主要介绍了说话人识别系统的分类、训练和验证的基 本过程、说话人识别的发展简史以及当前说话人识别系统在国内外的最新应用 和发展趋势,并对本文的研究内容、章节安排做了阐述。 第二章系统地介绍了说话人识别过程的涉及的基本技术,包括语音采集、 说话人特征参数的选择、端点检测、特征规整原理、说话人识别相关模型的训 练、说话人识别的判决策略以及说话人识别系统的性能评价标准,对说话人识 别实际应用系统所面临的现实问题的解决方案做了较全面的介绍。 第三章介绍了本论文实现的m u l t i a s v 系统所采用的基于短时平均能量和 短时平均过零率的端点检测方法,并对端点检测的实验结果进行分析。 第四章介绍了说话人识别技术在远程语音通讯中的实际应用,概述了说话 人识别技术基于电话系统的应用详细介绍了本文实现的基于网络语音对话的 m u l t i a s v 系统的结构,以及各功能子系统的设计,最后设计了实验方案,对实 验结果进行分析。 第五章作为全文总结,对论文做了总结,提出了系统存在的问题以及待研 究的方向。 6 第二章说话人识别中的基本技术 第二章说话人识别中的基本技术 一个语音信号携带着几个不同层次的信剧1 1 】,它不但能表达语义内容,而 且也能传递说话人的个人身份特征,还可以表现说话人的情感、心态等等。对 不同层次信息的研究,形成了几个不同的各有侧重的研究领域。语音识别研究 的是给定的内容在该段语音信号中的特征,语音情感识别研究的是语音信号中 包含的情感特征,说话人识别研究的则是语音中所蕴含的说话人的个人身份信 息的特征。对于同一个语音信号,不同的识别任务所关注的特征是不一样的。 说话人识别就是要从一段语音中提取出某一种特征,使得根据这一特征可以最 大程度上令目标说话人区别于其他说话人,强调同一个人所说的多个语音中所 体现的说话人共同的特征信息。 每个人所发出的声音有其特质,发声的器官和过程确定了语音中特定说话 人的特征,其中声道的结构是最重要的生理因素,发声习惯、速度、口音等是 影响说话人特征的后天行为因素。说话人之间的差异使我们能借此建立体现说 话人声音特征的说话人模型,达到说话人识别的目的。本章将介绍说话人识别 过程涉及的基本技术以及系统性能的评价指标。 2 1 声音采集 声音在说话人识别系统中相当于是“原材料 ,后续的特征提取、说话人模 型的建立都是建立在对语音数据加工处理的基础上,所以声音的采集对于语音 识别相关技术有着重要的影响。不同的采样设备、采样频率以及采集数据中的 人员性别分布、年龄结构等,都很有讲究,可以说声音采集是一个庞大的系统 工程。现在国内外有不少专门的机构正在做声音的采集工作,包括语音数据库 的设计、语音的采集、标注等等,从中也可以看出建立一个科学的语音数据库 对语音技术基础研究和实际应用有着多么重要影响。 人类说话产生的声音是一种模拟信号,说话人识别系统对声音的采集不可 避免地涉及到声音采样的概念。声音在采样时有两个重要的技术参数【1 2 】采 样量化精度和采样频率。采样量化精度可以理解为声音采样设备处理声音的解 7 远程语音通话实时说话人确认系统研究与实现 析度,这个数值越大,解析度就越高,录制和回放的声音就越真实,它客观地 反映了数字声音信号对输入语音信号描述的准确程度。常见的量化精度有6 位 采样位数、8 位采样位数和1 6 位采样位数,其中6 位和8 位较常见于电话系统、 呼叫中心以及嵌入式系统中,而1 6 位表示用6 4 k 精度来描述一段语音,多在 p c 机平台上使用。采样频率是指录音设备在一秒钟内对声音信号的采样次数, 采样频率越高,还原的声音就越真实。现在多数的说话人识别系统采样时都是 8 k h z 采样频率和8 b i t 采样位数,主要的原因是现在的说话人识别研究和实际 应用系统多数是基于电话线的【l ,而电话线的带宽有限( 电话线数据传输的频 带是6 0 0 3 0 0 0 h z ) ,即便是超过8 k h z 的采样频率对提高声音质量帮助也不大。 同时也有研究显示,语音的更高采样率有助于提高系统性能【1 3 1 ,这也说明如果 声音质量更高的话系统性能仍有进一步提高的空间。 2 2 特征提取 直接采样后的语音并不能直接用于说话人识别,而是必须经过前端处理进 行特征提取,将语音信号转换成特征向量集合,从而生成了与该语音信号相对 应的说话人特征信息。特征提取的目的就是从原始、具体的语音信号中获取抽 象的、冗余度低的信息,使不同说话人的特征信息得到最大程度的区分,并且 提取出来的特征便于用统计模型表示和计算【1 4 】。通过观察语音信号可以发现, 在时域上,语音信号的变化是非常快速的,但若转由频域观察其频谱( s p e c t r u m ) 则可以发现,其频谱随时间而缓慢变化,有着短时稳定的特点。因此,说话人 识别系统中,在做特征提取时,经常将语音信号作短时分割处理,如以1 0 m s 至3 0 m s 为一帧,求出每帧的特征参数。 语音特征参数的选择对说话人识别系统意义重大。如果选择了好的特征参 数,将有助于提高系统的识别率。特征提取就是要尽量去除或削减语音信号中 与识别无关的信息的影响,减少后续识别阶段需处理的数据量,生成表征语音 信号中携带的说话人信息的特征参数。理想情况下,这些特征参数应具有如下 特点: ( 1 ) 有效区分不同说话人,但又能在说话人的语音发生变化时保持相对稳 定; 8 第二章说话人识别中的基本技术 ( 2 ) 易于从说话人的语音信号中提取和测量,可以经常从说话人的语音中表 现出来; ( 3 ) 尽量不随时间和空间变化,对环境的适应性和鲁棒性较强。 语音特征参数可以是能量、基音频率、共振峰值等特征参数,目前在语音 识别中较为常用的特征参数为线性预测倒谱系数l p c c ( l i n e a rp r e d i c t i o n e e p s t r u mc o e f f i c i e n t ,l p c c ) 和m e l 倒谱系数( m e l - f r e q u e n c yc e p s t r u mc o e f f i c i e n t , c c ) 。二者都是将语音从时域变换到倒谱域上,前者从人的发音模型角度出 发,利用线性预测编码( l p c ) 技术求倒谱系数;后者则构造人的听觉模型, 以语音通过该模型( 滤波器组) 的输出为声学特征,直到通过离散傅里叶变换 ( d f t ) 进行变换。m f c c 因为其具有与l p c c 不同的优点而在说话人识别中 占主要地位: ( 1 ) 语音的信息多集中在低频部分,而高频部分易受环境噪声干扰。m f c c 将线性频标转化为m e l 频标,强调语音的低频信息,从而突出了有利于识别的 信息,屏蔽了噪声的干扰。l p c c 是基于线性频标的,所以没有这一特点。 ( 2 ) m f c c 无任何前提假设,在各种情况下均可使用。而l p c c 假定所处 理的信号为自回归信号,对于动态特性较强的辅音,这个假设并不严格成立。 另外,当噪声存在时,a r 信号会变为自回归滑动平均信号,m f c c 的抗噪声 能力也优于l p c c 。 2 2 1m f c c 特征参数的计算过程 m f c c 的计算首先用f f t 将时域信号转化成频域,之后对其对数能量谱用 依照m e l 刻度分布的三角滤波器组进行卷积,最后对各个滤波器输出构成的向 量进行离散余弦变换( d c t ) ,取出m 个数。如图2 1 所示,m f c c 的计算过 程如下【3 】【1 6 】: 9 远程语音通话实时说话人确认系统研究与实现 图2 1m f c c 计算流程 ( 1 ) 预加重,减少尖锐噪声的影响,提升高频信号,x ( n ) 为原始信号,y ( n ) 为预加重后的信号。 y ( 疗) = x ( 疗) 一0 9 7 拳x ( n 一1 ) ( 2 - 1 ) ( 2 ) 加窗,减少g i b b s 效应。m ( n ) 是窗函数,j 。( 疗) 是加窗后信号。 s w ( 刀) = y ( 以) 木r e ( n )( 2 2 ) ( 3 ) 对信号s w g ) 做d f t 变换得到频谱,完成时域信号到频域信号的转换。 ,一l、 s ( 刀) = i n l s 。( 后) 日( 后) l o 刀n - 1 ( 2 3 ) k = 0 ( 4 ) 把式( 2 3 ) 得到的频谱系数用三角滤波器组进行滤波处理,得到一组 系数m 1 ,m 2 ,m 一,m m ( i = 1 , 2 ,m ) ,m 为滤波器组个数,一般取2 0 至2 8 之 间。滤波器组中每一个三角滤波器的跨度在m e l 标度上是相等的,所有滤波器 总体上覆盖从0 h z 到n i q u i s t 频率。三角滤波器组的加权系数为式( 2 4 ) 。 o - , ( k ) = l + 1 ) 一2 八( k f - 一f 1 ) ( ) i - 1 ) ) ) 而 k f ( i + 1 ) f ( i 一1 ) 七 朋 ( 2 - 4 ) 丽而丽2 ( f 面( i + d 而- k ) 而巾) 七邝+ 1 )( 厂o + 1 ) 一八f 1 ) ) ( 厂( f + 1 ) 一八d ) 。、7。、7 f ( i ) 是三角滤波器的中心频率,满足: m e l ( f i + 1 ) 一m e l ( f 【妇) = 始,( 厂【司) 一m e l ( f i 一1 】)( 2 5 ) 1 0 第二章说话人识别中的基本技术 对于三角滤波器组,设d ( 1 ) ,c ( 1 ) ,h ( 1 ) 分别是第一个滤波器的下限、中心和上限频 率,则第k 个三角滤波器与其相邻的三角滤波器之间有如下关系: c ( 七) = h ( k 一1 ) = d ( 七+ 1 ) ( 2 - 6 ) 三角滤波器组示意图如图2 2 所示: 图2 2 三角滤波器组示意图 ( 5 ) 由于每一个频带中的分量作用在人耳中是叠加的,因此将每个滤波器频 带内的能量进行叠加。计算每个滤波器组输出的对数能量: s ( 所) :l n r 芝i x ( 圳2 巩( 后) 、l o 聊m ( 2 7 ) i = o ( 6 ) 对所有滤波器输出求对数,得到相应频带的对数功率谱,再进一步做离 散余弦变换( d c t ) ,得到m 个m f c c : j 一l c ( ,z ) = s ( i ) c o s ( n n ( i - o 5 ) m ) o n m ( 2 8 ) j = o 通过上述步骤得到的m f c c 系数是标准的m f c c ,其受到滤波器组中滤波 器个数、形状、分布及能量谱等因素的影响,但是这里的特征提取过程通常是 基于一个不精确的假设,即不同帧之间的语音是不相关的。但是现实情况却是, 人在发音时,不同的帧之间的语音是相关,且变化是连续的。因此通常用差分 参数来描述语音帧之间的相关性。这些动态信息和静态信息互补,能在很大程 远程语音通话实时说话人确认系统研究与实现 度提高系统的噪声鲁棒性【1 7 1 。差分参数最常用下面的公式求取: 刃= 掣, 0 2 i 。 ,) v 时 。厶拈。 ( 2 9 ) 一般而言,o = 2 ,也就是通过一个宽度为5 帧的窗函数来求差分,有时 也可以采用下式求取: 吐= 垒 鱼( 2 - 1 0 ) 2 0 i 动态参数简单有效,因而在说话人识别中被广为使用。另外,二阶的动态 参数也被认为代表了一定的说话人特征,对某些平稳或变化较慢的噪声也具有 一定的抑制作用,因而有时也被用来作为补充参数使用。 2 2 2m f c c 特征参数各分量的相对重要性 在语音识别和说话人识别的特征中,通常丢弃第零阶倒谱系数以规整功率 谱,文献 1 8 】在标准英文数字语音库上的实验表明最有用的说话人信息包含在 m f c c 分量的c 2 到c 1 6 之间,m f c c 分量c o 和c l 包含有负作用的说话人信息, 将其作为特征会引起识别率的降低。低阶m f c c 分量较高阶分量更容易受到加 性噪声和卷积噪声干扰。较高阶倒谱系数表示语音功率谱较快变化的成分,说 话人识别刚好是从谱的快变化中提取信息。c o 和c l 负贡献率表示说话人识别 需要谱能量c o 和谱斜率c l 的规整,在通常的说话人识别系统中,c o 被丢弃, 而c l 被保留作为有用信息【1 8 】。 2 3v a d 语音端点检测 2 3 1 端点检测的作用和过程 在实际应用系统中,难以保证特征参数文件所对应的数据全部是有效语音, 多数情况下,这些语音数据中会有停顿、环境噪声等存在。为了避免过多地对 非有效语音数据作训练和测试,端点检测就变得不可缺少。端点检测是把文件 分割成一个或者多个片段,训练和测试操作只针对提取的有效语音段,而忽视 无效语音段。作为说话人识别的前端处理之一,理想的端点检测算法应该具有 1 2 第二章说话人识别中的基本技术 以下特点:( 1 ) 可靠性和鲁棒性;( 2 ) 准确性;( 3 ) 自适应性;( 4 ) 简单;( 5 ) 实时处 理;( 6 ) 不需要噪声的先验知识。端点检测的困难在于无声段或者语音段前后人 为呼吸等产生的杂音、语音开始处的弱摩擦音或弱爆破音以及终点处的鼻音, 这些语音的端点比较模糊,需要综合利用语音的各种信号特征,从而确保定位 的精确性,避免包含过多噪声信号和丢失语音信号。详细来说,端点检测有两 个过程: ( 1 ) 基于语音信号的特征,用能量、过零率、熵( e n t r o p y ) 、音高( p i t c h ) 等参 数以及它们的衍生参数,来判断信号流中的语音非语音信号。 ( 2 ) 在信号流中检测到语音信号后,判断此处是否是语句的开始或结束点。 在语音系统中,由于信号多变的背景和自然对话模式而更容易使句中有停顿( 非 语音) ,特别是在爆发声母前总会有无声间隙。因此,这种开始结束的判定尤 为重要。 2 3 2 常用端点检测方法的特征参数 近2 0 年来,人们对端点检测方法作了全面的研究,主要的端点检测方法与 相关的特征参数,可以分成两大类: ( 1 ) 利用语音信号的时域特征,计算量比较小,如基于能量和过零率的端点 检测方法即双门限方法,利用能量区分语音段和噪声段大概检测出语音的起止 端点,利用过零率进一步精确的定位语音的最终起止端点。 ( 2 ) 利用语音信号的频域特征,计算量比较大,如频谱的熵作为判断端点的 基准。 2 2 2 1 能量 能量是最经常使用的音频特征参数之一,是对语音信号最直观的表示 【1 9 】【2 0 1 。语音信号的能量分析基于语音信号幅度随时间有相应的变化这一现象。 能量可以用于区别发音的清音段和浊音段,能量值较大的对应于浊音段,能量 值较小的对应于清音段。对于高信噪比的信号,可以用能量来判断有无语音。 无语音信号的噪声能量较小,而有语音信号时能量会显著增大,由此可以粗略 区分语音信号的起始点和终止点。 在端点检测方法中,时域分析上经常采用“短时能量”作为主要的特征参 1 3 远程语音通话实时说话人确认系统研究与实现 数之一。所谓短时能量,就是先对音频信号进行分帧处理,然后对每一帧求其 能量,它被定义为一帧中所有采样值的平方和。第i 帧的短时能量定义为: 骂= 霹 ( 2 1 1 ) 其中,表示第i 帧中所包含的音频采样数量,瓯表示语音信号的第n 个采样 值。 在语音信号中,某一帧所对应的声音越大,其短时能量的值越大。一般来 说,在纯语音的环境中,语音的能量要比背景噪声的能量大,背景噪声对应的 短时能量较小,接近于0 。由此可以判断语音的起始点和终止点。但是当信噪 比比较小时,比如背景噪声比较嘈杂时或者有突发的噪声时,或者有开关门声、 咳嗽声以及机器轰鸣声时,即使没有语音,背景噪声的短时能量仍然比较大, 虽然说语音的能量仍然比噪声的能量大,但此时,仅凭能量这个语音特征参数 就无法有效的区分语音和背景噪声。 2 2 2 2 过零率 过零率是另一个常用的音频特征参数【3 】【1 2 1 。当离散语音信号的时域波形通 过时间横轴时,相邻时刻的采样值如果具有不同的符号,称为“过零”。单位时 间的过零次数称为“过零率 ,即单位时间内音频采样值符号变换的次数。同能 量的定义,短时过零率指的是每一帧的过零率,定义第n 帧的短时过零率如下: z 。= 去i s g n 。) g n ( s 一。) i ( 2 - 1 2 ) 其中,瓯表示语音信号第n 个采样值,s g n ( ) 为符号函数,定义为 s g n 仅) = 二。,三三 c 2 - 3 , 过零分析是语音的时域分析中最简单的一种分析。利用短时过零率可以从 背景噪声中找出语音信号。在有背景噪声的情况下,一般背景噪声的平均过零 率较低,而单词起始段的平均过零率急剧增大,由此可判定过零率较大的帧为 单词的起始点。 但是,在连续语音的端点检测中,如果单独应用过零率,结果会非常不可 靠。因此过零率经常被用来辅助能量、信息熵等特征参数,以期得到更为精确 1 4 第二章说话人识别中的基本技术 的结果。 2 2 2 3 信息熵 对语音信号进行频谱分析,是认识语音信号和处理语音信号的重要方法, 可以假设其在频域是短时平稳的【2 1 1 。 信息熵是频域的重要音频参数,它反应了语音信号所传达的信息量的大小。 每一帧都计算其信息熵,称为短时信息熵,计算方法如下: ( 1 ) 利用f f t 对每一帧的信号进行由时域向频域的转换: x 0 ) = 瓯p 。棚 ( 2 1 4 ) 计算每一频率的出现概率 a :盟,江1 , j ( ) k = l ( 2 - 1 5 ) 其中j ) 表述了频率厂的频谱能量,p ,表示了相应频率的出现概率,n 表示了 f f t 变换之后得出的频率总数,即加窗时的窗口宽度。 且做如下两个约束条件: j ( z ) = 0 fz 3 7 5 0 h z p f = 0i fp f 磊 ( 2 - 1 6 ) ( 2 - 1 7 ) 公式( 2 1 6 ) 用来保证语音信号的频率范围,因为人的发音频率基本集中 在2 5 0 h z 到3 7 5 0 h z 之间,公式( 2 1 7 ) 用来滤除某些频率上持续发生的噪声。 ( 3 ) 计算语音的信息熵 , 日= 一仇l o g p t ( 2 1 8 ) 文献 2 l 】实验表明,语音信号的信息熵和非语音信号的信息熵之间存在很 大的差别,由此可以用来寻找语音端点的位置。在很多情况下,尤其是当背景 噪声主要是机械噪声时,使用信息熵作为特征参数比单纯使用能量更加可靠。 远程语音通话实时说话人确认系统研究与实现 2 4 特征规整技术 目前说话人识别方法主要是基于概率统计模型,因此要求系统的训练环境 和测试环境尽可能匹配,两者之间的不匹配将影响说话人识别系统的性能。但 是,在实用系统中,训练环境和测试环境很难保证不发生变化,如加性噪声、 麦克风差异、说话人情绪及信道传输差异等都会引起训练和测试环境的不匹配, 这就会降低说话人识别系统的实用性,甚至会导致说话人识别系统性能显著下 斛2 2 1 。为了减少训练环境和测试环境之间的不匹配程度,一个非常直接的想法 就是对训练或者测试的语音特征进行某种变换,以使得它们的特征参数的概率 分布能够比较接近,从而减少训练和测试的不匹配程度。 特征规整是指在提取特征之后,通过对特征的规整等处理,进一步降低训 练语音特征和测试语音特征之间的不匹配,其基本思想就是通过对特征向量的 均值和方差仃2 进行规范化的技术,提高识别系统的噪声鲁棒性。 由于对特征参数的概率密度函数的估计既不方便也很难准确,所以,普遍 的方法是通过概率密度函数的积分累积分布函数( c u m u l a t i v ed i s t r i b u t i o n f u n c t i o n ,c d f ) 来表述概率分布匹配,即通过使训练环境和测试环境的累积分 布函数匹配,达到降低两者语音特征之间的不匹配程度的目的。根据这个原理, 特征参数变换函数可以由数据的累积分布函数获得,如下: 设特征参数变换函数为x = r m ,y 是规整前的特征参数,石是规整变换后 的特征参数;再设x 的累积分布函数为c ( x ) ,y 的累积分布函数是c ,( y ) ,则 特征参数变换函数应该使得: e ( 石) = c 。( y ) 由此可以得到: x = 丁陟】= c 1 ( c ,( y ) )( 2 1 9 ) 实际应用中,为了简化算法实现过程,经常把训练和测试的数据概率分布 都变换到同一个事先给定的标准分布( 通常是标准高斯分布) ,这一过程即实现 了对特征参数的规整。 特征规整算法主要包括 2 3 】:倒谱直方图均衡( c e p s t r a lh i s t o g r a m 1 6 第二章说话人识别中的基本技术 e q u a l i z a t i o n ,h e q ) 、倒谱均值方差规整( m e a n - v a r i a n c en o r m a l i z a t i o n , m v n ) 、 倒谱均值规整( c e p s t r a lm e a nn o r m a l i z a t i o n , c m n ) 、倒谱方差规整( c c p s t r a l v a r i a n c en o r m a l i z a t i o n , c v n ) 。 2 5g m m u b m 模型 2 5 1g m m 说话人模型 近年来,高斯混合模型( g m m ) 已经成为文本无关的说话人识别系统中最 主要的建模方法,其理论依据主要有以下两点【1 1 1 :一方面,一个说话人的声学 特征参数在特征空间中的分布可以认为是由他在发不同的音时特征向量的分布 集合而成,可以认为g m m 的各个高斯成分描述了同一个说话人的不同的未知 音素类语音的声学特征;另一方面,根据统计理论,用若干个高斯概率密度的 线性加权组合可以逼近任意分布。因此,理论上g m m 模型可以用来描述各个 不同形式的语音特征的统计分布。 作为概率统计模型,g m m 通过高斯概率密度函数的线性加权组合刻画语 音的特征参数的统计分布。不同说话人的语音特征的统计分布也是有所不同的, 因此通过比较不同说话人的g m m 模型,就可以用于区分不同的说话人。 工
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026事业单位工勤技能-海南-海南印刷工二级(技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-浙江-浙江电工四级(中级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-山西-山西铸造工一级(高级技师)历年参考题库含答案详解3套试卷
- 2026年11月立冬主题教育 立冬食俗文化
- 银行信贷风险管理制度(2026完整版)
- 2026年8月全民健身日知识课堂 体育精神与健康
- 2026 年汛期多种地质气象灾害避险指南
- 2026年秋季开学大学开学第一课(生命教育)课件
- 2026年云南省弥勒市《行测》考试考前冲刺试卷含答案详解(培优B卷)
- 2026年河南省永城市《行测》考试备考题库含答案详解(突破训练)
- 牛羊布病流行病学调查表
- 外科学教学课件:乳房疾病
- 塔山煤矿综合物探施工设计说明
- 2023年司法考试真题卷二答案及详解
- 2023年公务员体检表
- JJG 596-2012电子式交流电能表
- GB/T 1095-2003平键键槽的剖面尺寸
- 新发传染病流行病学
- 新生儿脐部护理技术操作考核评分标准
- 瑶药浴知识课件
- (完整版)《赤壁之战》课文讲解课件
评论
0/150
提交评论