已阅读5页,还剩61页未读, 继续免费阅读
(信号与信息处理专业论文)说话人识别算法研究(2).pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大连理工大学硕士学位论文 摘要 说话人识别是语音识别的一种,它根据测试语音来辨别说话者的身份。说话人识 别在司法查证、机要保密、电子商务等领域有着广泛的应用前景。从具体应用的角度 可将说话人识别分为说话人辨认和说话人确认两类,从识别条件的角度可将其分为与 文本有关的说话人识别和与文本无关的说话人识别两类。本文的主要研究对象是与文 本无关的说话入辨认系统。 说话人辨识系统主要是由特征提取和模式分类两部分组成。特征提取部分就是寻 找能够有效代表一个人的特征参数。模式分类部分就是能有效地计算一段语音与某测 试者的特征参考模板之间距离的算法。由于说话人辨识系统的性能主要取决于上述两 个方面,因此本论文的工作重点就放在了对这两个问题的研究上,主要包括: 1 ) 分别实现了基于v q 算法和h m m 算法的说话人识别系统,并对其识别性能 进行了比较; 2 ) 比较了l p c c 和m f c c 两种常用的说话人识别特征参数的识别率; 3 ) 分析了m f c c 与基音频率联合特征参数和长时倒谱特征对说话人系统识别率 的影响; 4 ) 采用m k m 算法进行码本训练,并采用改进方法降低其计算量; 5 1 采用全搜索码本形成树状码本进行码本的快速搜索,降低了识别过程的计算 量: 6 ) 提出了整帧信噪比分段加权法,在低信噪比的情况下,提高系统的识别率。 并根据f p g a 的特点,对其进行改进,使其更适合在f p g a 上实现。 关键词:说话人识别;特征提取;倒谱:基音周期;矢量量化;隐含马尔科夫模型 说话人识别算法研究 a b s t r a c t s p e a k e rr e c o g n i t i o nt e c h n i q u e i so n eo ft h es p e e c hr e c o g n i t i o nt o p i c sa n di t i st h ep r o c e s so f a n t o m a t i c a l i d e n t i f y i n g t h e s p e a c k e r w h oi s s p e a k i n ga c c o r d i n g t ot h et e s t e d s p e e c h s p e a k e r r e c o g n i t i o nt e c h n i q u eh a sab o r a d e r na p p l i c a t i o np r o s p e c t ,s u c ha st h ea d m i s s i o nc o n t r o lo ft h es e c u r e p l a c eo r u s e r s i d e n t i t y v e r i f i c a t i o ni ne - b u s i n e s s a c c o r d i n g t oi t sv a r i o u s a p p l i c a t i o n s ,s p e a k e r r e c o g n i t i o nm e t h o d c a nb ed i v i d e di n t o s p e a k e rr e c o g n i t i o n a n d s p e a k e ri d e n t i f i c a t i o n s p e a k e r r e c o g n i t i o nc a na l s ob ed i v i d e di n t ot e x t d e p e n d e n ta n dt e x t i n d e p e n d e n tm e t h o d st h i st h e s i sm a i n l y d i s c u s s e st e x t i n d e p e n d e n ts p e a k e rv e r i f i c a t i o n as p e a k e rv e r i f i c a t i o ns y s t e mi s m a i n l yc o m p o s e do ff e a t u r es e l e c t i o na n dp a t t e r nm a t c h i n g t h e p u r p o s e o ff e a t u r es e l e c t i o ni st of i n dt h ec h a r a c t e r i s i t i cp a r a m e t e r sr e p r e s e n t i n gas p e a k e r p r o p e r l y t h e g o a lo fp a t t e mm a t c h i n gi st od e s i g nv a l i da l g o r i t h m st h a tc a np r e c i s e l yc a l c u l a t et h ed i s t a n c eb e t w e e n ap e r s o n sc h a r a c t e r i s t i ct e m p l a t ea n dt h et e s t e d s p e e c h t h em a i nt a s ko ft h et h e s i sc o n c l u d e st h e f o l l o w i n gp a r t s : 1 ) r e a l i z i n g a s p e a k e rr e c o g n i t i o ns y s t e mu s i n gv ea n dh m m r e s p e c t i v e l y , a n dc o m p a r i n gt h e p e r f o r m a n c e so f t h e t w om e t h o d s ; 2 ) c o m p a r i n g t h er e c o g n i t i o nr a t i oo f l p c cw i t ht h a to f m f c c ; 3 ) a d d r e s s i n gt h ep r o b l e m so fm f c c ,u n i t e df e a t u r ep a r a m e t e ro fp i t c ha n dl o n g - t i m ec e p s t r u m , a n da n a l y z i n gt h e i ri n f l u n c e so nt h es y s t e m r e c o g n i t i o nr a t i o 4 ) t r a i n i n gt h ec o d eb o o ku s i n gt h em k ma l g o r i t h m ,a n da d o p t i n gt h ei m p r o v e dm e t h o dt o d e c r e a s et h ew a s t eo p e r a t i o n 5 ) u s i n g t h eb i n t r e ec o d eb o o kw h i c hr e s u l t sf r o mt h ef u l l ys e a r c h i n gc o d eb o o kt or e d u c et h e c o m p u t a t i o n 6 ) p r o p o s i n g as e g m e n tw e i g h tm e t h o do ft h ew h o l es n rw h i c hc a ni m p r o v e st h ei d e n t i f i c a t i o n r a t i ou n d e rt h el o w e rs n rc i r c u m s t a n c ea tt h es a m et i m e ,i m p r o v i n gt h en e wm e t h o dt o r e f i n ei t si m p l e m e n to nf p g a k e yw o r d s :s p e a k e rr e c o g n i t i o n ;f e a t u r es e l e c t i o n ;c e p s t r u m ;p i t c h ;v q ;h m m 独创性说明 作者郑重声明:本硕士学位论文是我个人在导师指导下进行的瑚 工作及取得研究成果。尽我所知,除了文中特别加以标注和致谢的地 外,论文中不包含其他人已经发表或撰写的研究成果,也不包含为获 大连理工大学或其他单位的学位或证书所使用过的材料。与我一同工 的同志对本研究所做的贡献均已在论文中做了明确的说明并表示了 意。 作者签名:! 銎盔! 日期:兰型 大连理工大学硕士学位论文 致谢 本论文是在导师殷福亮教授的悉心指导下完成的。从论文的选题、研究方法到技 术路线以及在论文撰写的整个过程中,殷老师都给予我精心指导和孜孜不倦的教诲。 导师精深的理论知识基础、渊博的学识、严谨的治学作风、敏捷的思维、授以学问、 教以为人的工作方法,都将使我终生受益。每次与导师的促心交谈都使我受益匪浅, 导师的言传身教让我铭记在心,必会导航我今后的人生道路,谨此向殷老师表示诚挚 的感谢。 在我学习、科研、生活中,自始至终得到陈哲老师的精心指导,陈老师不仅授以 我专业知识,而且从他身上学到为人处世的做人道理,在同陈老师进行项目研发合作 中,他扎实的理论、解决问题的技巧、一丝不苟的态度都在潜移默化地影响着我,成 为我学习的楷模。“低调处世、着别人所想”是他人格的写照,在论文研究方法和实 验方案上均得到了陈老师的无私帮助,这些将连同本科、研究生阶段的生活将会永远 铭记于我的心中。 还要感谢传授我专业知识的郭成安老师、邱天爽老师、胡家升老师、孔祥维老师、 马晓红老师和李建华老师。正是从这些老师那里,我学到了信号处理方面的专业知识 和很多做人的道理。 本论文能够顺利完成,还要感谢给我带来快乐的数字信号处理实验室这个大家庭 的所有师弟、师妹们,他们营造了良好的实验氛围,读研期间,我的师兄初正伟、徐 晓聃、师姐况鑫给了我很多帮助,特向他们表示感谢。同时对同届的郭海涛、马晓冬、 王志飞、卞洁等同学做论文期间对我的帮助表示谢意。 最后,我要将此文献给我的家人和我的女友,你们的支持是我最大的动力。无论 现在还是将来,我都将努力奋斗以不辜负你们对我的殷切期望。 i j i 大连理工大学硕士学位论文 1 1 研究背景 第一章引言 说话人识别是语音识别的一种。它和语音识别一样,都是通过对所采集到的语音 信号进行处理,然后据此做出判断。两者的不同之处在于说话人识别希望从语音中提 取不同说话人的特征,并加以利用;而语音识别则力图减少不同说话人对于同一语音 的差别。说话人识别是通过对说话人语音信号的分析和特征提取,确定说话人是谁。 在很久以前人们就已经开始利用说话人识别。早在1 6 6 0 年,英国国王查尔颠一 世之死的侦破过程中,就利用了声音作为找出犯人的线索。1 9 6 6 年美国法院就第一 次采用此方法进行取证。随着时代的进步,说话人识别的应用领域也在不断扩大,目 前主要应用在: 说话人核对:在电子商务和电话预约服务中,以用户的声音实现汇款、转账、 余额通知等;用特定人的声音实现机密场所的出入人员检查;用工厂职工的 口令实现职工签名管理等。 司法取证:判断犯罪时所记录的声音究竟是多个嫌疑犯中的那个的声音,有 时可能嫌疑犯中不包括真正的罪犯,这时需要说话人辨别和说话人确认的 有机结合。 医学应用:如使说话人识别系统只响应患者的命令,从而实现对患者假肢的 控制等。 声控电子密码锁:实时执行军事指挥官和飞机驾驶员的口述命令、只有有经 验的操作人员才能进行的高精度控制等。 1 2 说话人识别的基本概念 说话人识别从具体应用的角度,可以分为两部分:说话人辨认( s p e a k e r i d e n t i f i c a t i o n ) 和说话人确认( s p e a k e rv e r i f i c a t i o n ) l 2 jo 顾名思义,前者是根据一段语音 从说话人集合中找出最有可能的说话人,这是个“n 分之一”的问题:而后者是根据 一段语音判断该语音是否是由某个说话人发出的,这是个“二分之一”的问题。 另外,从说话人识别条件的角度,可以将说话人识别分为与文本有关的 ( t e x t d e p e n d e n t ) 说话人识别和与文本无关的( t e x t i n d e p e n d e n t ) 说话人识别两类。一段 语音实际上包含两部分信息,即与说话内容相关的信息和与说话人相关的信息。目前 尚没有合适方法可以把这两部分信息完全分离开来。因此,在一些说话人识别方法中 说话人识别算法研究 常将说话内容固定,这样在说话人识别的比较过程中就可以抵消因说话内容而导致的 差异,这就是与文本有关的说话人识别。另一种方法是通过对较长的语音进行统计分 析,从而消除由具体的说话内容而引起的差异,这就是与文本无关的说话人识别。这 两种说话人识别有各自不同的应用领域,由于后者对识别条件的限制较小,因此在实 际中具有更广阔的应用前景。 无论是与文本有关的说话人识别还是与文本无关的说话人识别,其基本原理都是 为每个说话人建立一个能够描述这一说话人个性特征的模型。在目前语音特征与说话 人个性特征尚未能很好的分离的情况下,为每一说话人建立的说话人模型实际是说话 人的语音特征的模型。在进行说话人辨认时,取与测试音匹配距离最小的说话人模型 所对应的说话人作为说话人辨认的结果;在进行说话人确认时,用测试音的模型与所 声称的说话人的模型进行比较,若匹配距离小于一个规定的闷值,则该说话人得到确 认。说话人识别的基本原理如图1 1 所示。 塑算尘f 酒嗣。橇藕爵。一噗蓊翮型孽 l 。列出盐围耻2 譬黝 f i 墨曩未基飘露_ _ i = 曩= 曩幕墨焉飘 f 瀚囊i 蠛辩。”。噗 | 镶麟图 图1 1 说话人识别基本原理 f i g u r e 1 1 p r i n c i p l e o f s p e a k e r i d e n t i f i c a t i o n 实现说话人识别需要解决以下几个基本问题: 说话人特征的提取; 说话人模型的建立和模型参数的训练; 测试人与说话人模型的匹配距离计算; 其中最关键的两个问题是提取什么样的特征和建立什么样的模型。对这两个问题 的解答就构成了一个说话人识别算法,而一个说话人识别系统的效果也是由这两部分 决定的。 目前已知的语音特征包括频谱、自相关系数、能量、平均幅度、过零率、共振峰、 线谱对、线性预测系数、线性预测倒谱( l p c c ) 、m e l 频标倒谱( m f c c ) 等 3 1 1 4 1 。有关语 音特征的具体内容将在第二章中详细介绍。 为了保证对说话人个性特征描述的一致性,常将每个说话人的模型结构取得相 同,不同的只是模型中的参数,这些参数可以通过用训练语音对模型进行训练的方法 得到。采用不同的说话人模型结构,对应了说话人识别的不同方法。在已经实现的说 话人识别系统中,所采用的方法有传统的模板匹配法、统计建模法、神经网络法及这 大连理工大学硕士学位论文 些方法的综合和改进【4 j 。 f 1 1 模板匹配法 这种方法的要点是,在训练过程中从每个说话人发出的训练语句中提取特征矢 量,即说话人的参考模板。而在测试阶段,按同样的处理方法从说话人的测试语音中 提取测试模板,并与相应的参考模扳相比较,得出结果。此类方法中,较常用的是 v q 法。采用矢量量化技术不仅可以避免困难的语音分段问题和时间归整问题,而且 可以有效压缩训练数据而保留较充分的数据特征,从而大大减少系统所需的数据存储 量。v q 法的分类特征可以作为识别说话人的一种有效的手段。在这种方法中,将每 个说话人看作一个信源,用一个码本表征,码本中只含有少量代表性的码字,用来代 表说话人的语音特征。码本由从该说话人的训练序列中提取的特征矢量聚类生成。只 要训练序列足够长,可以认为这个码本有效的包含了说话人的个人特征,而与说话内 容无关。可利用多种方法得到码本,例如:l b g 法。 ( 2 ) 统计建模法 与模板匹配法相比,统计建模法更具灵活性,并且在理论上其似然概率更为有意 义,因此近年来在说话人识别中得到广泛应用。一种非常有效且常用的统计模型是 h m m 模型。 该类方法给定随机模型a ,然后通过计算产生一个观察d ,( 来自某说话人的矢量 集中的一个矢量) 的似然概率p ( d ,舰) o 随机模型为从说话人训练话音得到的特征矢量 估计出的概率密度函数。每个说话人训练出个随机模型。给定随机模型a ,后,各 说话人产生观察0 ,的概率即被确定。当获得由某测试人产生的观察集o ,时,则可计 算出各个随机模型产生0 ,的概率值p ( o ,五) ,表示该测试语音属于各己知说话人的 概率值,从而做出判决。 f 3 1 神经网络法 与语音识别不同,这里利用人工神经网络的目的是希望通过对人工神经网络的训 练,更好的提取语音样本中所包含的说话人的特征。因为目前还难以对这些特征的提 取形成公认的规则,所以神经网络方法在一定程度上表现出它的优越性。虽然神经网 络已经被认为是解决模式分类问题的一个强有力的工具,但是它们通常难以处理时变 信号。而语音信号却是典型的非线性时变信号。为了更好的适应语音信号的动态特性, 目前对说话人识别的研究多集中于时延神经网络t d n n ( t i m e d e l a yn e u r a ln e t w o r k l 和循环网络等。 另外将h m m 与a n n l 5 j 、h m m 与支撑向量机s v m ( s u p p o r t v e c t o rm a c h i n e ) 6 1 的 结合用于说话人识别也是研究的热点。因为采用当前的神经网络拓扑结构难以实现对 说话人识别算法研究 时间序列的建模,而h m m 对时间序列的变化提供了一个良好的描述,但其分类能力 却比较弱,因此将上述两者的结合可以改善时变信号模式分类的性能,己被广泛的用 于说话人识别。 1 3 说话人识别的研究现状与难点 对说话人识别的研究始于2 0 世纪6 0 年代。近3 0 年来,这一领域内的研究工作 取得了重大进展,动态规划、线性预测、矢量量化、隐含马尔可夫模型等技术先后成 功应用于说话人识别。2 0 世纪8 0 年代出现了语音处理技术产品化的热潮,这些产品 多集中于语音识别方面,如i b m 公司著名的软件产品v i a v o i c e ,以及卡内基梅隆大 学研制成功的s p h i n x 等。 说话人识别的方法和技术在近十几年来得到了更加迅速的发展。识别的模型从单 模板模型发展到多模板模型,从模板模型发展到v q 模型、高斯混合模型、隐含马尔 科夫模型,再到人工神经网络模型:识别环境从无噪声环境下对少数说话人的识别发 展到复杂噪声环境下对大量说话人的识别:所采用的识别技术从仅涉及动态规划发展 到涉及统计信号处理、矢量量化与编码、模糊系统理论与方法、最优估计理论、人工 神经网络、灰色系统分析等多学科领域。 尽管目前说话人识别技术已经取得了相当大的进展,在实验室条件下获得了良好 的识别效果,但将说话人识别技术大规模地应用到实际生活中仍有很长的一段路要 走。这主要是因为实验室条件和实际条件的差异很大。一方面,实验室条件较少考虑 到噪声的问题,而在实际应用中,噪声是不可避免的,尤其在一些特殊应用中,如犯 罪现场录制到的犯罪嫌疑人的声音不可能很清晰;又如i n t e r n e t 信息服务中,声音在 通过通讯线路的传播时不可避免的会引入噪声。另一方面,实验室里使用到的说话人 集合往往是比较小的,而在实际应用中说话人集合可能非常大,当说话人集合扩大时, 不论是系统效率,还是识别率往往会急剧降低。具体来说,说话人识别的难点包括以 下几个方面: 语音信号既包含了说话人所说的内容信息,也包含了说话人的个性信息,它 是语音信息和说话人个性信息的混合体,而目前还不能将这两者完全分离开 来; 说话人的声音常常与环境、情绪、健康状况等有密切关系,具有长时变动特 性,会随着时间和年龄的变化而变化; 说话人的声音往往是可以模仿的,而且使用高精度的数字录音机可以窃取他 人的声音,从而降低了声音在身份验证方面的可靠性; 大连理工大学硕士学位论文 声音通过通讯线路传输时,不可避免地引入线路噪声,而且不同的通讯线路 所引入的噪声情况可能是不同的。 1 4 f p g a 简介 f p g a 是现场可编程门阵列( f i e l dp r o g r a m m a b l eg a t ea r r a y ) 的简称,是8 0 年 代中期出现的高密度可编程逻辑器件( p l d ) 。f p g a 器件及其开发系统是开发大规 模数字集成电路的新技术,它利用计算机辅助设计,以绘制出的实现用户逻辑的原理 图、编辑布尔方程或硬件描述语音等方式作为设计输入;然后经一系列转换程序、自 动布局布线、模拟仿真等过程;最后生成配置f p g a 器件的数据文件,对f p g a 器件 初始化。这样就实现了满足用户要求的专用集成电路,真正达到了用户自行设计、研 制和生产集成电路的目的。 f p g a 器件具有下述优点:小型化、低功耗、多功能、数字化、标准化、系列化、 集成度高、可无限次地反复编程、保密性好、快速、方便实用、可现场模拟调试验证。 f p g a 器件包含丰富的寄存器及函数发生器,并具有固定的延时。除了电源和地 以外,几乎所有的器件引脚都可作为用户定义的双向i o 。 f p g a 器件的内部结构为逻辑单元门阵列l c a ( l o g i c c e l la r r a y ) 。l c a 结构由 三类可编程单元组成;周边是输入输出模块i o b s ( i n p u t o u t p u tb l o c k s ) ;核心阵列是 可配置逻辑块c l b s ( c o n f i g u r a b l el o g i cb l o c k s ) :以及互联资源。i o b s 为内部逻辑 和器件封装引脚之间提供可编程接口:c l b s 阵列让用户指定逻辑功能;互联资源在 模块间传递信号。存储在内部静态存储单元的配置程序。确定逻辑功能和互联状态, 在加电或得到指令时,配置数据自动装入器件。 经过模拟验证后的设计文件转换成比特流文件及p r o m ( 可编程只读存储器) 格式文件后,就可以用常规的编程器对e p r o m ( 可擦可编程只读存储器) 编程,然 后把e p r o m 与f p g a 器件适当连接,此f p g a 器件就可作为大规模专用集成电路应 用了。用不同的设计文件配置同一块f p g a “白片”,可实现不同的逻辑功能。用f p g a 器件进行设计工作,通常在几小时或几天内就能够完成一个设计,并可以随时修改它。 这样就加速了产品设计开发的进程,缩短了产品由设计到上市的时间,免去了昂贵的 a s i c 器件半导体生产工艺费用及投资风险,增强了产品的竞争力。 目前提供f p g a 器件的主要厂家有a l t e r a 、x i l i n x 、a t & t 、a c t e l 和s i g n e t i c s 等,它们采用的结构体系、处理工艺和编程方法都有所不同。 本文算法的实现平台为a l t e r a 公司的s t r a t i xe p l $ 2 5 ,其中可加载n i o s 软核。 说话人识别算法研究 1 5 基于n i o s 的s o p c 设计流程 在采用n i o s 处理器设计嵌入式系统1 7 j 时,通常会按照以下步骤: ( 1 ) 分析系统需要说明,包括功能需求和性能约束等; ( 2 ) 根据分析结果,选择片外外设或片内1 p ( 知识产权核) 。除此之外,还要 对选择的i p 和外设进行初步性能评估,以保证能够满足系统需求: ( 3 ) 设定i p 和系统参数; ( 4 ) 确定系统互联逻辑,分配f p g a 的引脚等; ( 5 ) 结合n i o s 提供的软件开发包进行软件开发。 图1 2 是典型n i o s 系统的框图。 图1 2 采用n i o sc p u 的系统框图 f i g 1 2s y s t e mb l o c kd i a g r a ma d o p t i n gn i o sc p u 图1 2 的结构可以划分为: ,片外设各 采用n i o s 的系统,系统模块( s y s t e m m o d u l e ) l 片内逻辑 o 用户逻辑区域( u s e r l o 画ca r e a ) 片内逻辑是指实现在f p g a 内部的电路设计,系统模块指的是由s o p cb u i l d e r 自动生成的设计。s o p c b u i l d e r 会根据用户选择的i p 生成相应的h d l 描述文件( 系 统模块文件) ,这些文件与用户逻辑区域内的设计描述文件一起由q u a r t u s 软件综合, 然后下载到f p g a 内,这样就构成了系统的硬件基础。 系统模块中包含至少一个a v a l o n 主外设和整个a v a l o n 总线模块。系统模块通常 人连理工大学硕士学位论文 还包含一些a v a l o n 从外设,例如u a r t 、p i o 和定时器等。s o p cb u i l d e r 可以帮助设 计这从i p 库寻找合适的i p 并很快地集成一个系统,它采用图形用户界面( g u i ) 显 示和组织i p 模块,能够自动生成i p 模块互联逻辑,并生成用于综合和模拟的文件, 使得设计者可以轻松完成系统设计。 当用户使用s o p cb u i l d e r 创建一个新的系统时,s o p cb u i l d e r 会为该系统自动 生成一个p t f 文件,所有的设计信息都存储在该p t f 文件里。当使用s o p cb u i l d e r 重新打开一个已有的系统时,s o p cb u i l d e r 会从且仅从p t f 文件中读取系统具体设计 信息。 用户逻辑区内可以包含用户自定义的a v a l o n 外设,以及与系统模块无关的其他 的用户自定义逻辑。 硬件系统建立起来以后,用户可以利用a l t e r a 公司提供的n i o ss d ks h e l l 工具, 结合s o p cb u i l d e r 生成的与硬件系统对应的软件开发包来开发用户软件。 1 6 本文的主要工作 本文的研究对象是与文本无关的说话人识别系统,针对系统的特征提取和模式分 类两个部分进行了仔细的研究,比较了多种特征对系统识别率的影响和多种模式分类 方法的性能。并针对集成电路的特点,进行了一定的改进,降低了计算量,为说话人 识别算法在集成电路上的实现打下了一定的基础。 本论文完成的工作如下 1 ) 分别实现了v q 法和h m m 法的说话人识别系统,并对其性能做了比较;采 用改进的m k m 算法进行码本训练降低了码本训练的计算量;对码本搜索部 分,采用了全搜索码本形成树状码本,降低识别过程的计算量; 2 ) 比较了l p c c 和m f c c 两种常用的特征参数的识别率,分析了m f c c 与基 音频率联合特征参数对v q 系统识别率的影响,分析了长时倒谱特征对v q 系统识别率的影响。并针对f p g a 的特点,对m f c c 的求取过程进行了改进, 使其适于在f p g a 平台上实现。 3 ) 提出整帧信噪比分段加权法提高低信噪比时的说话人识别系统的识别率,并 针对f p g a 的特点进行改进,减少了运算量。 大连理工大学硕十学位论文 第二章语音信号处理和特征提取 每个说话人的语音信号既含有文本信息又含有说话人信息,说话人识别就其本质 来讲,就是要把语音信号中的文本信息与说话人信息分离开,提取其中表征说话人身 份的信息。另一方面,我们希望能够简单而可靠地提取说话人的特征,并且该特征要 尽可能地做到与文本无关,不易受外界环境、身体状况等因素的影响。所以,从语音 信号中提取的说话人特征参数应满足以下准则: 对局外变量( 例如:身体状况、情绪、系统的传输特性) 不敏感; 能长期地保持稳定: 容易对其进行测量和存储; 然而同时满足以上要求的特征通常不易找到,因此一般要采取一些折中措施。 根据参数的稳定性,可把说话人特征参数大致分为两类:一类是反映说话人生理 结构的固有特征( 例如,声道结构等) ,这类特征主要表现在语音的频谱结构上,包 含了反映声道共振的频谱包络特征信息和反映声带震动等音源特性的频谱细节构造 特征信息,具有代表性的特征参数有基音和共振锋。这类特征不易被模仿,但容易受 健康状况的影响。另一类是反映声道运动的动态特征,即发音方式、发音习惯等。主 要表现在语音频谱结构随时间的变化上,包含了特征参数的动态特性,这类特征相对 稳定却比较容易模仿,代表性的特征参数是倒谱系数。 在对说话人识别的研究中已使用过的特征参数主要有语音能量、基音周期、共振 峰、线性预测系数、倒谱系数等。不同的特征参数,其物理意义也不同。以全极点模 型为基础的线性预测参数,可以较为精确地反映语音信号的频谱幅度。基音周期及共 振峰是表征说话人固有特征的参数。把语音信号看成是准周期脉冲或随机噪声激励一 个线性时不变系统的输出,用解卷积的方法将激励信号和系统冲激响应分离,可以得 到倒谱系数。倒谱系数可以将信息量较小的峰值信息与更为重要的声道形状信息分离 开,它反映了声道的共振性能,它是目前普遍采用的说话人特征参数。倒谱系数也可 以由线性预测系数推出线性预测倒谱系数,它是语音帧倒谱的自相关序列,与直接计 算倒谱相比,线性预测倒谱的计算量较小。另外一种常用的倒谱系数是m e l 倒谱系数, 它是一种基于听觉感知机理的倒谱系数。以往的研究表明,在环境噪声的识别鲁棒性 方面,采用m f c c 比l p c c 要好。 2 1 语音的产生模型和基本特征 人类声音的差异,主要来自于两个方面:发声器官不同和后天养成的习惯不同。 发声器官的不同主要表现在构成发声器官的各个生理器官的体积和形状的差异上。发 说话人识别算法研究 声器官主要由三个子系统构成:肺、气管,喉,声道和鼻道。肺、气管、支气管构成 了次声门系统,它是产生语音的源泉。喉中有声带,决定基音频率。声道始于声门( 声 带的开口) 止于嘴唇,是气流传输的通道。这些结构对于每个人来说都有差异,由此 就造成了每个人的声源谱、基音频率、共振峰频率以及带宽的不同。后天人们学习发 音的过程中,还形成了自己的发音习惯,这些习惯所带来的差异主要表现在:说话人 的发音方式、停顿方式及轻重程度等方面,因此就造成了说话人的语调和韵律的不同, 即声道的动态性能方面的不同。 无论先天发生器官的不同还是后天发音习惯的不同,都可以作为说话人识别的参 考。但是由于语音信号中包含着复杂的信息,很难将发声器官与后天养成的习惯所产 生的特征完全分开,所以对于语音的分析,首先应该从语音产生的机理入手,建立p 种数学模型加以描述。 经过前人的大量研究,人们认为语音信号主要的不同产生于空气从次声门系统呼 出后的传播过程中,语音信号的处理便是对以后的传输过程进行模型化。气流从次声 门系统呼出后,由于声道某一处的收缩而受到扰动,这种扰动可以看成是抽象出来的 语音模型的激励。对于浊音而言,这种扰动发生在气流通过气门时,由于声带张力的 影响,产生准周期的空气脉冲,其频率为3 0 5 0 0 h z ,我们称之为基音频率。对于清 音和摩擦音而言,扰动发生在声道的某处,一般在接近嘴唇的那端这一扰动迫使空气 以高速冲过这一处而产生湍流,这个湍流十分类似宽带噪声,所以对于清音激励抽象 为随机噪声。声道和鼻道类似于非均匀声管,当声音顺着声管传播时,它的频谱会被 声管选择性地改变,所以声道和鼻道对语音信号起调制作用。声道通过其形状变化将 信息加入到语音信号中,在语音信号的数字模型中,声道和鼻道相当于对信号起调制 作用的系统。声道管的固有频率称为共振峰( f o r m a t ) ,共振峰和声道的大小、形状有 关,共振峰反映了语音的频谱特性,因此当声道形状改变时,语音信号的频谱特性就 随之改变。实际声音在鼻道和声道中还要受到其他许多因素的影响,使得信号在传播 过程中有能量损失。从声学理论去考虑,这些影响因素主要包括: 声道形状的时变性质; 由于声道壁的热传导和粘滞摩擦的损耗: 声音在嘴唇处的辐射; 鼻腔的耦合: 声道壁的柔度。 由以上分析,我们可以抽象出语音信号的模型【8 】,如图2 1 所示。 大连理工大学硕士学位论文 激励源 声道模型 辐射模型 s f n 、 图2 1语音信号产生的离散时域模型 f i g 2 1 m o d e lo fd i s c r e t et i m ed o m a i n r e s u l t i n gf r o ma u d i os i g n a l 由图2 1 可以看出,语音信号是激励信号( n ) 经过一个线性系统h ( z ) 而产生的 输出。其中,声道模型h ( z ) 为离散时域的声道传输函数,通常可以用全极点函数来 近似。不同的说话人其声道形状是不同的,因此具有不同的声道模型。在上述语音生 成模型中,h ( z ) 最能体现不同说话人之间的区别。h ( z ) 的表达式为: 11 坝力2 高。毒嘉 。d 式中p 为全极点滤波器的阶数,q ( f _ 1 ,2 ,p ) 为滤波器的系数。p 值越大,则模型 的传输函数和实际声道的传输函数的吻合程度就越高。当然p 值也不能取得太大,一 般情况下,p 取8 1 2 e ”。 上述语音产生模型的基本思想是将激励与系统相分离,使语音信号解体来分别进 行描述,而不是直接研究信号波形本身的特性。这种思想是带动语音处理技术飞速发 展的关键。 2 2 语音信号的基音频率提取 在人的发音模型中,产生浊音的周期激励脉冲的周期称为基音周期( p i t c h ) 。只 有浊音才有基音周期,清音没有基音周期。基音周期是语音信号的一个重要参数,在 语音编译码器、语音识别、说话人识别等许多领域中都是重要的一个部分。到目前为 止,s u v ( s i l e n c e u n v o i c e d v o i c e d ) 的判决和基音周期的准确检测仍然是尚未很好 说话人识别算法研究 解决的难题,其困难主要体现在:语音信号的时变性,背景噪声的影响,共振峰的影 响,区别清音和低电平的浊音较困难,确定基音周期的起止点较困难等方面。 尺u ) r 。口) 。q ) 图2 2窗长对语音信号短时自相关函数的影响 f i g 2 2 i n f l u e n c eo f t h ew i n d o w l e n g t h o nt h ea u t o c o r r e l a t i o nf u n c t i o no fa u d i o s i g n a l 基音周期检测方法大体上可以分为三大类:时域方法、频域方法和综合利用信号 的时域、频域特性的方法。时域方法直接利用语音信号的采样点,计算信号的波峰、 波谷和过零率等。其特点是原理简单,计算量小。典型的方法是g o l d 和r a b i n e r 提 出的并行处理( p p r o c ) 方法【9 】。频域的方法主要是计算信号的相关性、功率谱和最大 似然函数等,其精度要高于时域的方法。典型的方法有中央消波自相关法( a u t o c ) 平 均幅度差分函数( a m d f ) 法和倒谱法( c e p ) 等 8 1 。近些年来,又提出了一些精度更高、 抗噪能力强的检测算法,但计算量都很大。由于我们处理的都是信噪比较高的语音信 号,与文本无关的说话人识别系统主要基于语音的统计信息,个别帧的基音周期检测 不准,对系统性能影响不大。为了降低系统的复杂度,这里选用较简单的中央消波自 相关法( a u t o c ) 1 0 1 。自相关法的原理是语音的短时自相关函数在基音周期的整数倍点 上有很大的峰值,只要找到最大峰值点的位置,便能估计出基音周期。但实际情况并 没有这么简单,最大峰值点的位置有时并不能同基音周期相吻合。产生这种情况的主 要原因有两个: 第一是窗的长度太短。图2 2 给出了一段浊音的短时自相关函数r “) 随窗长_ v 的 变化情况( 窗形为方窗) ,语音的采样率为l o k h z ,基音周期为7 2 m s ,这对应7 2 个 采样点。图2 2 中( a ) 、( b ) 、( c ) 分别给出了窗长为4 0 1 m s 、2 5 1 m s 、1 2 5 m s ( 相应 2 大连理工大学硕士学位论文 的点数为n = 4 0 1 、2 5 1 、1 2 5 ) 时的r ( f ) 图形。可以看到对于( a ) 和( b ) 两种情况,第一最大 峰值点与基音周期是吻合的;而对于情况( c ) ,由于窗长过短,第一最大峰值点与基 音周期不一致。一般认为窗长至少应大于两个基音周期,才可能得到较好的效果,语 音中最长基音周期值约为2 0 m s ( 这相当于基音频率为5 0 h z ) ,因此在估计基音周期时, 窗长应选大于4 0 m s 为宜。 第二是因为声道特性的影响,这里主要是指声道共振峰特性的干扰。为了克服这 个困难,可以从两条途径入手。第一种途径是先将语音信号通过6 0 9 0 0 h z 带通滤波 器或0 9 0 0 h z 的低通滤波器。高端截至频率定位9 0 0 h z 既可以去除大部分共振峰的 影响,又可以保证当最大基音频率为4 5 0 h z 时仍可以保留其一、二次谐波。低端截至 频率可以抑制5 0 h z 电源干扰。第二条途径,将通过带通滤波器后的信号再进行非线 性处理。中央消波就是- - 7 十有效的非线性处理方法。消波函数如图2 3 所示。 弋 + c 。 图2 3 消波函数示意图 f i g 2 3 s k e t c hm a po ft o n s u r ef u n c t i o n 若输入语音信号为x ( ”) ,中心消波后的输出为,( n ) = c b ( ”) ,消波电平为,r ( ,) 和r ( ,) 分别为x ( 一) 和y ( n ) 的自相关函数。语音信号经过消波处理后,自相关函数在基 音周期点上的峰变得尖锐突出了,如图2 4 所示。 说话人识别算法研究 面z ) 鼬辩 c x ( 砷】= y ) v ”l 鲫。 2 盎” i 胁 图2 4 消波处理前后的波形和自相关函数 f i g 2 4 w a v e f o r ma n da u t o c o r r e l a t i o nf u n c t i o na r o u n d t o n s u r i n g 消波电平c r 是这样确定的:将输入的语音数据分为3 个等长的子帧,分别在第 一和第三子帧中寻找最大波峰值,消波电平取为两个峰值中较小的峰值和一个比例因 子的乘积。 可以用一个能量门限来进行浊音的判决,也可以用估计出来的基音周期的连续性 进行浊音的判决。 估计出来的基音周期轨迹在大部分段落中可能同真实的基音周期轨迹是吻合的, 而在一些局部段落中,有一个或几个基音周期估值偏离了正常的轨迹( 通常是偏离到 了正常值的2 倍或0 5 倍) 。为了去除这些野点,可以采用各种平滑算法。 综上所述,提取基音周期的步骤为: 1 ) 将输入语音信号通过低通滤波器; 2 ) 利用中央消波法估计基音周期; 3 ) 平滑估计出的基音周期; 2 3 语音信号的倒谱分析 语音信号s ( n ) 可以视作由声源激励e ( n ) 和声道系统函数 ( 行) 卷积得到 s ( n ) = p ( 月) + ( n ) 吼而说话人特征在很大程度上取决于说话人的发音器官,即声道的 频率特性。如果能使这两者有效分离,就可以得到有效表征说话人特征的参数。由于 语音信号是由激励信号与声道频率响应相卷积的结果,因此可将信号变换到倒谱域 ( 即同态滤波) ,从而将相卷积的两个部分分离。同态滤波的关键是先将卷积处理化 为乘积,然后作对数处理,使之化为可分离的相加部分。设信号通过一个特征系统 n 】变换到倒谱域,则n 定义为: 大连理工大学硕士学位论文 x ( e x p j c o ) = f x ( 月) _ x ( n ) e x p ( - j c o n ) = n t c ( e x pj c o ) = l n ix ( e x pj 6 0 ) 口 c ( 珂) = n x ( 删= r 1 c ( e x p ) = 击e c ( e x p j 甜) e x p ( j c o n ) d c ( n ) 称为x ( n ) 的倒谱。类似的可以定义其逆特征系统。 ( 2 2 ) ( 2 3 ) ( 2 4 ) 语音信号s ( n ) 通过特征系统n 后,可以得到语音信号s ( n ) 、声源激励p ( 咒) 、 和声道系统函数 ( n ) 的倒谱分别为;( 月) 、;( n ) 和( 竹) ,三者的关系为: s ( n ) = e ( n ) + h ( n )( 2 5 ) 语音信号的倒谱中h ( n ) 的特性取决于h ( n ) 中零极点的分布。当h ( n ) 中零极点的 模值不是很接近1 时,厅( h ) 将随n 的增大迅速减小。在正= 1 0 k h z 时,i ( n ) 在【_ 2 5 , 2 5 以外的值就已经非常小f 】。所以用维数不多的倒谱分量便足以表征语音的声道分 量,这样就可以有效地将h ( n ) 分离出来。再经过逆特征系统处理,就可以
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 八年级道德与法治上册价值判断选择题考点精练卷专项精练版
- 溺水患者出院指导-1
- 咳嗽患者康复指导-1
- 廊坊人工智能奖金申报指南
- 脑瘫儿童健康宣教
- 病历书写与医保违规警示2026
- 2026年10月自考00874特殊儿童早期干预押题及答案(江苏)
- 法律职业资格客观题核心考点题库(解析版)
- 法律职业资格客观题模拟试卷(含答案详解)
- 远离网络沉迷点亮快乐童年小学主题班会课件
- 国家保密培训课件
- 安全驾驶从这里开始
- 2025-2030年中国椰壳行业市场现状供需分析及投资评估规划分析研究报告
- 会议签到表(模版)
- 中外航海文化知到课后答案智慧树章节测试答案2025年春中国人民解放军海军大连舰艇学院
- 2025年宁夏宁东融资担保有限公司招聘笔试参考题库含答案解析
- 煤业公司经营管理实施方案
- 中国医院质量安全管理 第 2-6 部分 患者服务 门诊服务
- DZ∕T 0218-2006 滑坡防治工程勘查规范(正式版)
- (正式版)YBT 6328-2024 冶金工业建构筑物安全运维技术规范
- 造粒车间应急预案及流程
评论
0/150
提交评论