已阅读5页,还剩68页未读, 继续免费阅读
(信号与信息处理专业论文)基于矢量量化(vq)和人工神经网络(ann)的说话人识别的研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 摘要 基于矢量量化( v q ) 和人工神经网络( a n n ) 的说话人识别的研究 硕士研究生杨彦导师赵力教授 东南大学无线电工程系 随着计算机技术的发展和多媒体信息的广泛应用,语音信号处理技术已经成为计 算机界研究的热点说话人识别始于2 0 世纪3 0 年代,从2 0 世纪6 0 年代开始日益成 为当今的一个研究热点。说话人识别技术作为语音信号处理技术的一个代表和重要组 成部分,具有广泛的应用前景,如保安、公安司法、军事、财经和信息服务等领域。 正因为说话人识别具有如此广阔的应用前景,国内外许许多多的工作者投身于这一领 域的研究中,使得说话人识别方面出现巨大发展。 本课题以语音信号的l p c 倒谱系数、m e l 倒谱参数和基音周期的混合特征参数作 为识别的特征矢量集。运用矢量量化( v q ) 和人工神经网络( a n n ) 技术实现与文本有 关及无关的说话人识别。在一个1 0 人,1 8 0 0 个的语音库上进行了系统的识别实验。 本论文的主要工作有:1 、在说话人识别系统的语音特征参数提取部分,详细阐 述了声道模型、线性预测编码( l p c ) 分析、l p c 倒谱系数、m e l 倒谱系数的求解;2 、 介绍了说话人识别的不同方法,主要介绍了矢量量化技术及其在说话人识别中的应 用,其本质是在一个解空间中用少数的几个特殊的点来代表空间中全部的有效点,以 达到聚类的目的,并介绍了模糊矢量量化和改进的模糊矢量量化在说话人识别中的应 用。同时,还阐述了遗传算法的基本思想和处理方法。将遗传算法的全局优化与v q 技术结合起来,采用科学的编码方案,动态的定标技术,高效的交叉策略,得到了模 型的优化作用,提高了说话人识别率。3 、提出了一种新的网络结构,这种网络能够 很好地解决神经网络语音识别中的时间规整问题。该网络从输入语音信号的特征矢量 序列中提取出一组固定数目的特征矢量,然后将这特征矢量馈入神经网络分类器进行 识别。和其他的神经网络说话人识别方法相比较,用这种网络进行前端处理,可以缩 短后端神经网络分类器的训练和识别时间,简化分类器的网络结构并保持较高的识别 率。根据该方法分别对m l p 和r b f 神经网络分类器建立了一个说话人识别系统,并 对系统进行了识别测试。实验结果表明,该方法具有上述优点。 本篇论文从以上三方面讨论了说话人识别的理论,最后介绍了系统的实现与实验 结果,并对实验结果进行了讨论、比较。 关键词:说话人识别;矢量量化;l p c 倒谱系数;遗传算法;人工神经网络 a b s t t a c t a b s t r a c t r e s e a r c ho nt h es p e ak 赵:rr e c o g n i i i o n b a s e do n v q a n d a n n c a n d i d a t e :y a n gy a n ,s u p e r v i s o r :z h a ol i d e p a r t m e n to f r a d i oe n g i n e e r i n g ,s o u t h e a s tu n i v e r s i t y , c h i n a s t a r t i n gi n19 3 0 s ,s p e a k e rr e c o g n i t i o nh a si n c r e a s i n g l yb e c o m eah o t s p o to fr e s e a r c h s i n c e19 6 0 s i tc a nb ea p p l i e dt oan u m b e ro ff i e l d s ,s u c ha ss e c u r i t y , j u s t i c e ,m i l i t a r y a f f a i r s ,f i n a n c ea n ds e r v i c e s b e c a u s eo ft h a t ,l o t so fs c i e n t i f i cr e s e a r c h e r sa r ei n v o l v e di n t h er e s e a r c h ,m a k i n gg r e a td e v e l o p m e n t h o w e v e ri ti sn o tr i p ev e r ym u c h t h i sp a p e ri sm a i n l ya b o u tat e x t d e p e n d e n ts p e a k e rr e c o g n i t i o ns y s t e mb a s e do n v e c t o rq u a n t i f i c a t i o n ( v q ) a n d ( a n n ) m e t h o d s ,at e x t i n d e p e n d e n ts p e a k e rr e c o g n i t i o n s y s t e mb a s e do ng a u s s i a nm i x t u r em o d e l s w eu s el p c d e r i v e dc e p s t r a lc o e f f i c i e n t s , p i t c h e sa st h ef e a t u r ep a r a m e t e rs e t t h r o u g ht h et e s to fas p e e c hl i b r a r yc o m p o s e do f1 0 s p e a k e r sa n d18 0 0s p e e c h e s m a i n l yw o r k si nt h i sp a p e r :i ) ,t h ep r o b l e mo ft h ef e a t u r ep a r a m e t e rp i c k u pi n s p e a k e rr e c o g n i t i o n ,e x p o u n d t h ev o c a lt r a c k ,l p ca n a l y s i s ,l p c d e r i v e dc e p s t r a l c o e f f i c i e n t , c e p s t r a lc o e f f i c i e n t ,m e l c e p s t r a lc o e f f i c i e n ti nd e t a i l i i ) ,i tm a i n l yi n t r o d u c e s o m ed i f f e r e n tm e t h o d so ft h es p e a k e rr e c o g n i t i o n t h eu s a b i l i t yo ft h ev e c t o rq u a n t i z a t i o n ( v q ) t e c h n i q u ea n df u z z yv qt e c h n i q u ei ns p e a k e rr e c o g n i t i o ni sd i s s e r t a t i o ni nd e t a i l t h ee s s e n c eo fv qi st ou s es e v e r a ls p e c i a lf e a t u r e st or e p r e s e n tt h ew h o l ef e a t u r e si n s o l u t i o ns ot h a tt oa c h i e v et h ea i mo fc o d i n ga n dc o m p r e s s i n g a tt h es a m et i m e ,i tm a i n l y e x p o u n d st h eb a s et h o u g h ta n dd i s p o s a lm e t h o d so ft h eg e n e t i c a l g o r i t h m w h i l ei fw e c o m b i n eg e n e t i c - a l g o r i t h mw i t hv q t e c h n i q u e ,u s i n gs c i e n t i f i cc o d i n gm e t h o d ,d y n a m i c a l s c a l e rt e c h n i q u e ,e f f i c i e n tc r o s s o v e rs t r a t e g y , w ec a l lo p t i m i z et h es p e a k e rm o d e l ,s ot h a t t oi n c r e a s er e c o g n i t i o nr a t e i i i ) an e ws o r to fn e t w o r ks t r u c t u r ei sp u tf o r w a r dt os e t t l et h e p r o b l e mo ft h et i m ed a r i n gt h en ns p e e c hr e c o g n i t i o n i tp i c k su pt h ec h a r a c t e rv e c t o r so f ag r o u po fn u m b e r sf r o mt h es e q u e n c eo ft h ec h a r a c t e rv e c t o r so ft h ei n p u ts p e e c hs i g n a l s , a n dt h e np u tt h ev e c t o r si n t ot h en ns o r t e rt or e c o g n i z e c o m p a r e dt ot h eo t h e rm e t h o d so f t h en n s p e e c hr e c o g n i t i o n ,w i t ht h en e t w o r kf o r m e rt r a n s a c t i n g ,i tc a r ls h o r t e nt h et i m eo f t r a i n i n ga n dr e c o g n i t i o no ft h eb a c k e n dn n s o r t e ra n ds i m p l i f yt h en e t w o r ks t r u c t u r eo f t h es o r t e rt om a i n t a i nh i g h e rr e c o g n i t i o nr a t e t h i sp a p e ri n t r o d u c e st h et h e o r yo f t h es p e a k e rr e c o g n i t i o nt e c h n i q u et h r o u g ha b o v eo f t h r e ea s p e c t s f i n a l l y , w ei n t r o d u c et h er e a l i z a t i o no ft h es p e a k e rr e c o g n i t i o ns y s t e ma n d t h er e s u l t so f t h es p e a k e rr e c o g n i t i o ne x p e r i m e n t s ,a n dc o n t r a s tw i t he a c ho t h e r k e y w o r d s :s p e a k e rr e c o g n i t i o n ;l p c d e r i v e dc e p s t r a lc o e f f i c i e n t s ,v e c t o r q u a n t i f i c a t i o n ;g e n e t i c a l g o r i t h m ;a r t i f i c i a l l yn e r v en e t w o r k i i 东南大学学位论文独创性声明 本人声明所呈交的学位论文是我个人在导师指导下进行的研究工作及取得的研 究成果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含其他人已 经发表或撰写过的研究成果,也不包含为获得东南大学或其它教育机构的学位或证书 而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明 确的说明并表示了谢意。 东南大学学位论文使用授权声明 东南大学、中国科学技术信息研究所、国家图书馆有权保留本人所送交学位论文 的复印件和电子文档,可以采用影印、缩印或其他复制手段保存论文。本人电子文档 的内容和纸质论文的内容相一致。除在保密期内的保密论文外,允许论文被查阅和借 阅,可以公布( 包括刊登) 论文的全部或部分内容。论文的公布( 包括刊登) 授权东 南大学研究生院办理。 研究生签名:垃鑫导师签名:堕日期:肼似 第一章绪论 1 1 引言 第一章绪 论 对于说话人识别的研究始于6 0 年代,近3 0 年来,在这一领域取得了重大进展, 商用系统已经在若于领域中得到应用。说话人辨认系统在司法领域中可以帮助对嫌疑 人的查证,通过犯罪记录中所记录的声音判断究竟是多个嫌疑犯中的哪个声音,或者 判断罪犯是否真的存在于嫌疑犯中。在军事领域中,它可以用于战场的侦听,以辨认 敌方指挥员。同时,它也可以应用在对于实时执行军事指挥员和飞机驾驶员的口述命 令( 如实时发炮命令) 等需要特定指挥人员的场所。说话人识别系统较多的应用在保 安领域,如机密场所的进入控制、合法使用通信线路、机要设备的身份核查。在电话 服务中,可以利用说话人系统以用户语音来实现汇款、转帐、余额通知、转款、股票 行情信息查询等服务。在医学领域中,如使说话人识别系统只响应患者的命令,则可 以实现对患者假肢的控制。 随着i n t e m e t 的飞速发展以及大规模宽带网络的迅速建立,过去只能在电话网络 上进行各类语音增值服务已经可以在互联网上找到新的增长点。随着网络上各类商务 流程的蓬勃发展,网上交易和网上购物已经逐步成为人们日常生活中不可缺少的一个 重要环节。利用说话人识别技术,结合现在使用的各种安全密码技术,来辨识标志各 人身份的d 代码,以及各种购物卡、信用卡等,将使网上交易更安全,使人们购物 放心。同时,将电话系统中已有的利用用户语音实现汇款、转帐、余额通知、转款、 股票行情信息查询等服务转移到互联网络上,可以建筑真正的一天2 4 小时营业的网 上银行和网上股市 1 2 说话人识别的基本概念及其分类 说话人识别是语音信号处理技术的一个重要分支,它是指通过对说话人语音信号进 行相应的分析处理,提取相应的特征或建立相应的模型,然后依次做出判断,自动确 定说话人是否在所记录的说话人集合中,进而确定说话人是谁的过程。 自动说话人识别( a u t o m a t i cs p e a k e rr e c o g n i t i o n :a s r ) 很久以来是一个既 具有巨大吸引力而又有相当困难的课题,说话人识别技术按其最终完成的任务可以分 东南大学硕士学位论文 为两大类:自动蜕话人辨认( a u t o m a t i cs p e a k e ri d e n t i f i c a t i o n ,a s i ) 和说话人确认 ( a u t o m a t i cs p e a k e r v e r i f i c a t i o n ,a s v ) 。其中,说话人辨认又可分为“闭集”和“开集” 两种开集假定待识别说话人可以在集合外,而闭集假定待识说话人一定在集合内如 果话者集中注册的说话人个数为n ,则在识别时,说话人辨认需要进行n 次比较和判决 即测试语音与话者集中的每个说话人的参考模型( 模板) 间都要进行一次匹配计算如 果是开集的情况,还要对这n 个人以外的语音作出拒绝的判决因此,说话人辨认系统 的识别率一般会随话者集人数的增加而降低而对于说话人确认系统识别时只涉及 到一个特定的参考模型和测试语音之间的比较和判决,因此其性能基本接近一个常数 可以认为与话者集的规模无关根据说话人识别的内容上来分类,不管是辨认还是确 认,说话人识别按照话语的文本可以分为与文本有关( t e x t ,d e p e n d e n t ) 的说话人识 别、与文本无关的( t e x t i n d e p e n d e n t ) 的说话人识别和文本指定型( t e x t - d e p e n d ) 的 说话人识别。与文本有关的说话人识别用同样的词汇表进行系统的识别和训练,与文 本无关的说话人识别的训练和识别采用不同的词汇表。与文本有关的说话人识别由于 发音内容固定,较早被研究和应用,识别率高,但容易被录音模仿;与文本无关说话 人识别发音内容随机,识别率低些,但不易被录音模仿,是当前研究的重点。然而只 有这两种类型是不完全的,因为如果没法事先用录音装置把说话人本人的讲话内容记 录下来,然后用于识别,则往往被识别装置有误接受的危险。而在指定文本型说话人 识别中,每一次识别时必须先由识别装嚣向说话人指定需发音的文本内容,只有在系 统确认说话人对指定文本内容正确发音时才可以被接受,这样可以防止本人的语声被 盗用。 1 3 说话人识别的基本原理 无论是与文本有关的说话人识别还是与文本无关的说话人识别,其基本原理都是 为每一个说话人建立一个能够描述这一说话人个性特征的模型。在目前话音特征与说 话人个性特征还未很好地从语音特征中得到分离的情况下,为每一个说话人建立的说 话人模型实际是说话人的语音特征模型。在进行说话人辨认时,取与测试音匹配距离 最小的说话人模型所对应的说话人作为说话人辨认的结果;在进行说话人确认时,用 测试音的模型与所称的说话人的模型进行比较,若匹配距离小于一个规定的阂值,则 该说话人得到确认。由此可以看出,说话人辨认和说话人确认在本质上并没有什么区 别。 第一章绪论 因此,若要实现说话人的识别,需解决以下几个基本问题: 对语音信号的预处理和特征提取; 说话人模型的建立和模型参数的训练; 测试音与说话人模型的匹配距离计算; 考虑到说话人的状态在不断的变化,如何使说话人识别系统的特征参数不断 更新以适应说话人。 图1 - 1 说明了说话人识别系统的基本过程: 训练 识别结果 + 图卜l说话人识别系统框图 建立和应用这一系统可分为两个阶段,即训练和识别阶段。在训练阶段,系统的 每一使用者说出若干个训练语句,系统据此建立每个使用者的模板或模型参量参考 集。而在识别阶段,在待识别人说的语音信号中导出的参量,要与在训i 练过程中得到 的参考参量集或模型模板加以比较,并且根据一定的相似性准则进行判定。对于说话 人辨认来说,所提取的参量要与训练过程中的每一人的参考参量加以比较,并把与它 距离最近的那个参考量所对应的使用者辨认为是发出输入语音的说话人。 说话人识别主要出以下几部分组成: 1 预处理 预处理包括对语音数据进行降噪、预加重、分帧和加窗等处理。 2 特征提取 在说话人识别系统中特征提取是最重要的一环,特征提取就是从说话人的语音 信号中提取出表示说话人的个性特征。提取的特征应能有效地区分不同地说话人, 并且对同一说话人保持相对稳定。说话人识别系统中常用的特征参数有: 1 )由语音信号直接导出的参数:短时能量、短时平均幅度、短时过零率和基音频率。 2 )由于语音的短时谱中包含有激励源和声道的特性,因而可以反映说话人的差别。 所以分析语音频谱导出说话人个人特征的参数:功率谱、基因轮廓、共振峰频率带 东南大学硕土学位论文 宽及其轨迹、复倒谱、m e l 倒谱系数等。 3 )由语音信号的线性预测分析也可得一些表示说话人特征的参数:基因频率、声道 冲激响应、自相关函数、声道面积比函数、线性预测系数( l p c ) 、l p c 倒谱系数和线 谱对参数( l s p ) 等,目前,l p c 倒谱系数和差值倒谱系数是最常用的短时谱参数, 并获得了较好的识别效果。 4 ) 混合参数:为了提高系统的识别率,部分原因也许是因为究竟哪些参数是关键因 素把握不充分,相当多的系统采用了混合参量构成的矢量。如将“动态”参量( 对数 面积比与基频随时间的变化) 与“统计”分量( 由长时间平均谱导出) 相结合,还有 将逆滤波器谱与带通滤波器谱结合,或者将线性预测参数与基音轮廓结合等参量组合 方法。如果组成矢量的各参量之间的相关性不大,则效果会很好,因为它们分别反映 了语音信号中不同的特征。 综上所述,常用于蜕话人识别的特征参数有:语音短时能量、基音周期( 现已 证实基音周期及其派生参数携带有较多的个人信息) 、语音短时谱或b p f g 特征( 包 括1 4 1 6 个b p f ) 、线性预测系数l p c 、共振峰频率及带宽、l p c 倒谱等,以及反 映这些特征动态变化的线性回归系数等,其它的特征参数还包括鼻音联合特征、谱相 关特征、相对发音速率特征、基音轮廓特征等。其中倒谱特征和基音特征是较常用的 特征,并获得了较好的识别效果。1 9 9 0 年日本人m a t s u i 和f u r u i 在与文本无关的说 话人识别系统中利用倒谱系数、差值倒谱系数、基音频率、差值基因频率作为特征矢 量,得到了比单用任意一个参数好得多的识别效果。 3 模式匹配方法 目前针对各种特征而提出的模式匹配方法的研究越来越深入。这些方法大体可归 为下述几种: 1 ) 概率统计方法 语音中说话人信息在短时内较为平稳,通过对稳态特征如基音、声门增益、低 阶反射系数的统计分析,可以利用均值、方差等统计量和概率密度函数进行分类判 决。其优点是不用对特征参量在时域上进行规整,比较适合文本无关的说话人识别。 2 ) 动态时间规整方法( d t l i l ) 说话人信息不仅有稳定因素( 发声器官的结构和发声习惯) ,而且有时变因素 ( 语速、语调、重音和韵律) 。将识别模板与参考模板进行时间对比,按照某种距 第一章绪论 离测定得出两模板间的相似程度。常用的方法是基于最近邻原则的动态时间规整 d t w 。 3 ) 矢量量化方法( v q ) 矢量量化最早是基于聚类分析的数据压缩编码技术。h e l m s 首次将其用于说话人 识别,把每个人的特定文本编成码本,识别时将测试文本按此码本进行编码,以量 化产生的失真度作为判决标准。b e l l 实验室的r o s e n b e r g 和s o o n g 用v q 进行了孤立 数字文本的说话人识别研究。这种方法的识别精度较高,且判断速度快。 4 ) 隐马尔可夫模型方法( h m m ) 隐马尔可夫模型是一种基于转移概率和传输概率的随机模型,最早在c m u 和i b m 被用于语音识别。它把语音看成由可观察到的符号序列组成的随机过程,符号序列 则是发声系统状态序列的输出。在使用h 姗识别时,为每个说话人建立发声模型, 通过训练得到状态转移概率矩阵和符号输出概率矩阵。识别时计算未知语音在状态 转移过程中的最大概率,根据最大概率对应的模型进行判决。h m m 不需要时间规整, 可节约判决时的计算时间和存储量,在目前被广泛应用。缺点是训练时计算量较大。 5 ) 人工神经网络方法( a n n ) 人工神经网络在某种程度上模拟了生物的感知特性,它是一种分布式并行处理 结构的网络模型,具有自组织和自学习能力、很强的复杂分类边界区分能力以及对 不完全信息的鲁棒性,其性能近似理想的分类器。其缺点是训练时间长,动态时间 规整能力弱,网络规模随说话人数目增加时可能大到难以训练的程度。 其中说话人模型的建立的是问题的关键。为了对说话人个性特征描述的一致起 见,常将每一说话人的模型结构取得相同,不同的只是模型中的参数,通过训练语音 对模型进行训练得到。采用不同的说话人模型结构对应了说话人识别的不同方法。随 着计算机、数字信号处理、人工智能等的不断发展,说话人模型已从单一的模板模型 向矢量量化( v q v e c t o rq u a n t i z a t i o n ) 模型、高斯混合模型( g m m - g a u s s i a nm i x t u r e m o d e l ) 、隐马尔柯夫模型( h m m - h i d d e nm a r k o vm o d e l s ) 、人工神经网络( n n n e u r a l n e t w o r k ) 模型以及它们的混合模型等多方向发展,对说话人个性特征的描述也越来 越精细和完善,并且从无噪声环境下的识别向复杂背景噪声下的识别方向发展,同时 各种高速信号处理芯片、专用语音信号处理芯片的出现,也为语音信号处理和说话人 识别提供了有力的支持,从而使说话人识别技术不断走向使用。 东南大学硕士学位论文 1 4 说话人识别的发展和现状 由上节可知,说话人识别技术能广泛的应用于现代通信、银行金融、公安司法及 机要保密等众多研究领域,因而,说话人识别系统的研究在国际上受到了极大的关注 和重视。 说话人识别的研究始于2 0 世纪3 0 年代。早期的工作主要集中在人耳听辨实验和 探讨听音识别的可能性方面。随着研究手段和工具的改进,研究工作逐渐脱离了单纯 的人耳听辨。b e l l 实验室的l g k e s t a 目视观察语谱图进行识别,提出了“声纹 ( v o i c e p r i n t ) ”的概念。之后,电子技术和计算机技术的发展,使通过机器自动识别 人的声音成为可能。b e l l 实验室的s p r u z a n s k y 提出了基于模式匹配和概率统计方 法分析的说话人识别方法,而引起信号处理领域许多学者的注意,形成了说话人识别 研究的一个高潮,其间的工作主要集中在各种识别参数的提取、选择和实验上,并将 倒谱和线性预测分析等方法应用于说话人识别。 从2 0 世纪6 0 年代开始,说话人识别的研究分别在参数的提取和选用、识别方法 和模式匹配的测度等方面蓬勃发展。现在,说话人识别的研究重点转向语音中说话人 个性特征的分离提取、个性特征的增强、对各种反映说话人特征的声学参数的线性或 非线性处理以及新的说话人识别模式匹配方法上,如动态时间规整( d t w ) 、主分量( 成 分) 分析( p c a ) 、矢量量化( v q ) 、隐马尔可夫模型( h m m ) 、人工神经网络方法 ( a n n ) 以及这些方法的组合技术上等。 1 5 论文内容安排 第一章主要介绍说话人识别的基本概念、分类和基本原理,并简述了说话人识别 技术的发展及其现状。 第二章从语音的发声原理开始,分析了语音参数对说话人识别性能的影响,并详 细介绍了基音频率、l p c 系数、复倒谱、倒谱、m e l 倒谱等参数特征。 第三章主要说话人识别的识别方法,讲述了矢量量化( v q ) 、模糊矢量量化( f v q ) 、 遗传算法等识别理论。 第四章介绍人工神经网络及其在说话人识别中的应用。 第五章介绍系统的实现和实验结果。 第二章语音信号的特征参数分析及提取 第二章语音信号的处理和特征矢量的分析 及提取 2 1 引言 1 9 6 3 年b e l l 实验室的s p r u z a n s k y 1 1 和1 9 7 1 年p d b r e a k e re ta 1 2 1 提出 了短时谱中的信息提供浇话人特征。随后在1 9 6 8 年b s a t a l 3 1 采用基音频率、1 9 7 1 年g d o d d i n g t o n l 4 i 提出共振峰频率、1 9 7 2 年m r s a m b u r 7 l 的线性预测系数( l p c ) 、 1 9 7 3 年c l u m m i s s l 的时域音栓配合法的语音响度、1 9 7 3 年s f r u r u i 和f i t a k u r a 6 1 的语音对数域比例、1 9 7 2 年j j w o l f 8 1 和1 9 7 5 年m r s a m b u r 9 1 从元音和鼻音 中提取出最好的说话人个人特征、1 9 7 4 年b a t a l i l o 】通过比较各种参数得出倒谱系 数为说话人识别提供最好的结果。 在说话人识别系统中特征提取是最重要的一环,特征提取就是从说话人的语音 信号中提取出表示说话人个性的基本特性。为了从语音信号中提取出表征各个不同说 话人的有用信号,语音信号在经过预处理后要进行语音特征的抽取。说话人样本模型 的训练和特定说话人的识别都是基于所选取的语音特征参数来进行的。因此,语音特 征参数的提取是说话人识别系统中的一个关键部分。选取不同的特征参数对识别结果 将产生较大的影响,如何选取合适的参数以达到最佳的识别效果也是本课题的一个难 点。一般而言,说话人所发出的语音信号中既包含说话人所要表达的语音信息,又包 含说话人本人特有的个性特征。在理想情况下,选取的特征应当满足下述准则: 1 能够有效地区分不同的说话人,但又能在同一说话人的语音发生变化时相对 保持稳定; 2 易于从语音信号中提取; 3 不易被模仿; 4 尽量不随时间和空间变化。 同时满足上述全部要求的特征通常是不可能找到的( 至少在目前是如此) ,只能 使用折衷方案。对人的语音感知多年研究表明,不同人之间说话的差别既有先天因素 也有后天的因素。不同的说话人的发音器官的生理尺寸有差别,发音时的器官动作也 不同,这些差别会影响收听者对语音的感知以及在收听过程中的回忆性能;此外,还 7 东南火学硕士学位论文 有一些通过语音信号间接表现出来的信息,如说话人的习惯风格、情感状态、遣词用 句的特点等。人们往往是利用这些高层次的间接效应来帮助进行说话人识别的,尽管 也曾尝试过把这些特征量化,但迄今为止还没有成功的例子。因而现在的说话人识别 系统不得不利用物理上可以度量的参量来表征说话人,而单一的参量很难达到可靠的 性能要求,所以实际应用中往往使用多种参量的集合。 2 2 语音信号的产生原理 人们用来产生语音的器官,自下而上有肺、气管、喉、咽、口和唇。其中,喉位 于气管的上端,由四块软骨组成,在喉上有声带,两片声带之间的空隙成为声门 ( g l o t t i s ) 。喉以上由咽腔、鼻腔和口腔组成的传输声音的通道称为声道( v o c a lt r a c t ) 。 肺中呼出的气流是语音产生的动力。在发音时,肺中的气流向上经过气管到达喉,喉 中的声带在呼出气流的作用下振动,形成一连串的脉动气流,称为声门波,声门波经 过口腔等组成的声道,从口和鼻辐射出去,就形成语音。 下面给出一个离散时域的语音产生模型,如图2 1 所示。这个模型是许多研究和 应用的基础,它由激励源、声道模型和辐射模型三个部分组成。开关所给出的信号对 应于声门对声道的激励信息,激励源分为清音和浊音两个分支,当发浊音时,开关和上 方接通时,声门对声道的激励时声带振动周期为t 的脉冲信号,当发浊音时,开关与下方 接通,声门对声道的激励为一随机脉冲信号。时变数字滤波器v ( z ) 用来模拟声道的形 状,在处理时,常认为在一个短时段声道形状基本保持不变,即可设在短时段内数字 滤波器是时不变,当设滤波器的z 传递函数是全极模型时,有 矿( z ) = 士 , = 1 ,q 为实数 ( 2 一1 ) q z l f _ 0 第二章语音信号的特征参数分析及提取 基音频率 激励部分调制部分 图2 一l 语音信号产生的离散时域模型 其中a ( i = l ,2 ,p ) 随短时段而变动。实际上,对于大部分的语音信号,其 短时信号都可以认为是由脉冲信号激励线性系统的结果,只是语音的不同,说话人的 不同,所处的短时段不同,对应的线性系统也不同。在语音信号处理中,每一短时段 称为一帧,帧和帧之间可部分重叠。由发音方式和声道形状的不同,人类可以发出无 穷多种、听觉系统可以将它们相互区分的声音。但语音又可以分割成可辨别的基本语 音单位,即音素,且这样的音素是有限的。这样一个语句就可以分解为一串音素,但 一串音素不等于一个语句,语句中还含有反映语义、语感的韵律信息。这里的韵律信 息包括各音素的相对强度、相对时长、相对音高、音高之间的停顿以及音素之间相互 影响而产生音素的变异等。 2 3 语音信号的特征分析 语音信号的表示方法一般有两种:波形表示和参数表示。波形表示通过对语音进 行采样和量化获得,是一种简单而直接的表示方法,也是获得参数表示的基础。用参 数表示可使数据量减少一百倍以上。用参数表示的关键是如何获得能反映语音信号特 征的参数。语音信号的分析方法主要有时域分析、频域分析和倒谱分析。识别系统性 能的好坏与语音特征参数有着直接的关系。选取特征应尽可能摈弃无关信息,准确合 理地描述语音的实质性质。语音信号具有时变性,其中反映声道响应的部分,其随机 性很强,而另一部分则是受发音器官控制的,这部分的变化相对缓慢。因而可以把语 音信号分成一段一段来分析,并假设在每一段内其性质是相对平稳的,也就是假定它 东南大学硕士学位论文 具有短时平稳性( 这些语音段常称为分析帧,帧长一般取l o m s 至2 0 m s ) 短时处理技术 正是基于这种思想来进行语音信号的处理的,它是处理语音信号的一种最基本的技 术。对每一帧信号进行时域分析和频域分析,分别称为短时时域分析和短时频域分析。 在对语音信号进行时域或频域分析前,一般首先要对语音信号进行一定的预处理,其 中主要包括语音信号的预加重、分帧和加窗。 ( 1 ) 预加重 预加重是一种重要的前处理技术。语音信号频谱的高频部分的能量比较小,易受 干扰。为此,在分析语音信号之前,需对其高频部分进行增强。另外,为了对数字化 的语音信号进行平滑处理以及减少在以后的信号处理中受到有限精度的影响,也必须 首先对语音信号进行预加重。方法是使用一阶固定数字传输函数: h ( z ) = l o 9 5 丰z 。1( 2 2 ) 因此预加重的输出结果瓦是由它的输入值s ,经下列方程式计算得出的: s = 一0 9 5 s 。一( 2 3 ) ( 2 ) 分帧 取连续的n 个语音信号作为一帧。对于l o k h z 的样本频率,典型的帧尺寸为l o m s n 2 0 m s ,b f f n = 1 0 0 至2 0 0 。为了保证特征矢量系数的平滑,帧与帧之间有部分样本重叠 使用,比如重叠2 3 帧。所以设m 为两个帧的取样间隔,& p m = n 3 ( 3 ) 加窗 在语音帧的起始点,线性预测方法以零值预测非零值或以非零值预测零值时,一 般都会使预测误差增大。若对数据先作适当的加窗处理,可以减少预测误差。一般采 用加窗算法包括海明窗( h a m m i n gw i n d o w ) 和汉宁窗( h a n n i n gw i n d o w ) ,其中海明窗 ( h a m m i n gw i n d o w ) 定义为: w ( r 1 ) = o 5 4 0 4 6 $ c o s ( 2 石 n ( n - 1 ) ) ,0 n n - 1( 2 - 5 ) 2 4 语音信号的时域分析 语音信号的时域分析就是分析和提取语音信号的时域参数,时域分析的参数主要 由短时平均能量、短时平均幅值、短时平均过零率、自相关函数和短时平均幅度差函 数利用窗函数w ( n ) 从语音信号中取出一小帧,窗函数可以看作一个屏蔽其它语音信 号的过滤函数设某帧语音信号的起始为n ,那么该帧的各个参数分别为: ( 1 ) 短时平均能量 1 n 第二章语音信号的特征参数分析及提取 e n = s :n ( 2 ) 短时平均幅值 m 。= i s 。i n ( 2 6 ) ( 2 7 ) 短时平均能量和短时平均幅值的主要用途有:可以区分浊音段和清音段,因为浊音时 e n 值比清音时的大的多;可以用来区分声母和韵母的分界,无声与有声的分界;作为一 种超音段信息,用于语音识别中 ( 3 ) 短时平均过零率 乙= z i s 朋 s 。g ) 】一酋即陋。( f + 1 ) 】( 2 ) i = 0 ( 2 8 ) 短时过零率是指在一帧中信号通过零值的频率平均过零率可以用来粗略地估计 信号的频谱性质除以2 n 是因为计算中每个样本取用了两次 ( 4 ) 自相关函数 b 犯) = 口。0 + f ) p 。o + f + 七) 】 ( 2 9 ) 它表示在样本s 。如) 处延迟时间为k 个样本的自相关函数。 2 5 线性预测编码( l p c ) 分析 1 9 4 7 年维纳首次提出了线性预测( l i n e a rp r e d i c t i o n ) 这术语,而板仓等人在 1 9 6 7 年将线性预测技术应用到了语音分析和合成中,将线性预测应用于语音信号处 理,不仅是因为它的预测功能,而且更重要的是因为它能提供一个非常好的声道模型 及模型参数的估计方法。线性预测系数可以作为语音信号特征参数用于语音识别、语 音合成等。线性预测是一种很重要的技术,几乎普遍的应用于语音信号处理的各个方 面。 按照图2 1 所示的语音产生模型,采用全极点模型,辐射、声道以及声门激励的 阶揣2 矗g i 2 丽g 智 日r 为实数 ( 2 1 0 ) 东南大学硕士学位论文 其中p 是预测阶数,口- 为l p c 预测系数,g 是声道滤波器的增益。由此,语音抽样 值5 ( ,z ) 和激励信号8 ( 行) 之间的关系可以用下界的差分方程来表示: p j ( 胛) = 伪( 胛) + 盯,j ( 聆一f 1 i = 1 ( 2 1 1 ) 语音样点之间有相关性,可以用过去的样点值来预测未来的样点值。对于浊音 激励8 ( ”) 是以基音周期重复的单位冲激;对于清音,p ( n ) 是稳衡白噪声。 在模型参数估计过程中,把如下系统称为线性预测器: q s ( n f ) 在式( 2 3 ) 中的4 ( :) 称作逆滤波器,其传输函数为 彳( z ) = 1 一q z l 预测误差占( 月) 为 占( n ) = s ( n ) - q s ( n - i ) ( 2 1 2 ) ( 2 1 3 ) ( 2 1 4 ) 线性预测要解决的问题是:给定语音序列3 ( 川,使预测误差在某个准则下最小,求预 测系数的最佳估值“。 短时平均预测误差定义为: e p 2 c ”,) = e s c n ,一荟p 口,s c n z , 2 。:。, 为使e 叠2 ( 心) 最小,对q 求偏导数,并令其为零,有: e s c n ,一喜a , s ( n - i ) s c n 一, = 。;,= ,:,a ,p 。:,。, 上式表明采用最佳预测系数时,预测误差与过去的语音样点工f 交。由于语音信号的短 时平稳性,要分帧处理( 1 0 3 0 m s ) ,对于一帧从n 时刻丌窗选取的n 个样点的语音 段踟,记中”( ,f ) 为: 中。( f ) = e 矗。( 删一j ) s 。( 聊一力 ( 2 1 7 ) 第二章语音信号的特征参数分析及提取 则有: p 口;巾。( ,f ) 卸。( ,o ) ,= 1 ,p ( 2 1 8 ) 上式祢为l p c 正则方程。显然,如果能找到一种有效的方法求解这组包含p 个未知 数的p 个方程,就可以得到在语音段s n 上使均方预测误差为最小的预测系数妇,) , i 2 1 ,“一p 。 利用式( 2 6 ) 和( 2 7 ) ,可得最小均方预测误差为: r p 1 咿e 1 2 一擎跏m 肛) ( 2 - 1 9 ) , 0 6 = o ( o ,o ) 一q o ( o ,力 “ ( 2 2 0 ) 语音信号具有短时平稳性,在一个短时段( 一般2 0 m s 左右) 上可以认为是平稳的。 般可分帧求取语音序列的l p c 系数。对于式( 2 1 0 ) 的l p c 正则方程,已经有了 一些高效的递推算法求解。其中主要有杜宾( d u r b i n ) 算法、格型算法和舒尔递推算 法( s c h u r ) 。下面给出文本采用的杜宾算法的计算步骤,详细推导过程可以参考文献。 1 ) 给定预测阶数p 2 ) 计算r d2 丢5 w + 啪w h ,b 。1 a 一,其中,s w 是加窗后的语音序列 3 ) 计算k 1 = 一r ( 1 ) r ( o ) 4 ) 计算日f ”= k o 5 ) 计算字= 1 - k m 2 j r ( 0 ) 6 ) 令m = 2 ; 7 ) 计算k “= - r 沏) + i = 1 口? 叫r ( i f m _ 。 8 ) 计算a 。( m = k 9 、d = 口p + k “a 卿,f _ 1 ,2 ,a ,m 一1 东南大学硕上学位论文 1o ) 计算箩= 1 - ) 2 】 1 1 ) 判断m k 1 、h h 、h o ) m o ( 2 3 3 ) 5 、若吼= o ,c 女= 0 ,则z ( z ) 仅在单位圆外有极零点,称为最大相位信号,且最大相 位信号的复倒谱是稳定反因果序列。此时复倒谱和倒谱间的关系为 f 2 c ( n ) 算( 聆) = c ( 盯) 1 0 刀 0 6 、若信号x ( n ) 为一串有限长周期性的冲击信号,即 x ( ”) = d ,j 一r n p ) ( 2 - 3 4 ) ( 2 3 5 ) 其中m 、r 均为正整数,r o sr s m ,口,为幅度因子,n p 为周期。则其z 变换 一o一聆 np厶【,厶 丝n m 一聆 。f厶f厶h 东南大学硕士学位
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026-2027学年甘肃省贺阳教育兰州校区高一(上)月考数学试卷(9月份)(含答案)
- 室内 CAD 绘图员岗位技能考试试卷及答案
- 山洪灾害监测员岗位技能考试试卷及答案
- 木模板工创新意识竞赛考核试卷含答案
- 办公设备维修工安全意识强化知识考核试卷含答案
- 工业炉燃料系统装配工操作规程评优考核试卷含答案
- 2026年师德师风知识竞赛题库+答案(试题+答案)
- 等静压成型工冲突管理考核试卷含答案
- 环氧树脂装置操作工工作质量强化考核试卷含答案
- 装卸搬运工跨领域知识强化考核试卷含答案
- 2026年新教科版科学六年级上册第一单元检测题(含答案)
- 2026年特种作业登高考试试题及答案
- 网评员管理办法
- 2026年辽宁省中考数学试卷(含答案及解析)
- 2026年民航事故调查人员法规专项试题及答案
- 河南推拿职业学院2026年高职单招《职业适应性测试》面试题目及答案
- 2022电能量计量系统设计规程
- 2026年中国华能集团招聘笔试试题(含答案)
- 《危险化学品安全法》与《危化品安全管理条例》条款对照表
- 鲁科版二年级劳动实践指导手册全册教案
- 方言词汇调查条目表
评论
0/150
提交评论