(通信与信息系统专业论文)连续语音识别算法研究及在嵌入式系统上的实现.pdf_第1页
(通信与信息系统专业论文)连续语音识别算法研究及在嵌入式系统上的实现.pdf_第2页
(通信与信息系统专业论文)连续语音识别算法研究及在嵌入式系统上的实现.pdf_第3页
(通信与信息系统专业论文)连续语音识别算法研究及在嵌入式系统上的实现.pdf_第4页
(通信与信息系统专业论文)连续语音识别算法研究及在嵌入式系统上的实现.pdf_第5页
已阅读5页,还剩57页未读 继续免费阅读

(通信与信息系统专业论文)连续语音识别算法研究及在嵌入式系统上的实现.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

武汉理工大学硕士学位论文 摘要 自动语音识别是当前学术界与工程界中的一个很活跃的研究领域。语音识 别的目的在于让机器“理解”人类的话语,从而使得信息的直接输入能在更广泛的 领域以更快捷、更自然地替代间接输入( 如键盘、手写板、扫描仪等录入设备) , 甚至完全淘汰间接输入。语音识别是- i - j 涉及到很多学科的交叉学科。近年来, 国内外在此领域取得持续进步,使语音识别逐步从实验室走向市场。语音识别 技术将应用于工业、家电、通信、汽车电子、医疗、家庭服务、消费电子产品 等各个领域。尤其是在以嵌入式系统为核心的终端电子消费产品中,语音识别 技术正在成为其人机界面和智能辅助操作的重要的应用手段。 本文深入地研究了自动语音识别中各个环节的算法与信号处理流程。从研 究孤立词语的识别算法入手,讨论了包括语音产生机理和语音信号采集、去噪、 变换、参数提取、训练以及模式匹配识别在内的信号流程和算法原理,对于提 高识别正确率的引马尔可夫模式进行了分析:针对连续语音识别相对于孤立词 语识别面临的新问题:如语言模式、语法规则约束等进行了讨论;在基于w 3 c 的s r g s 标准规范上,设计了一套实验用语法规则文件规范。分析了一个语法 文件的案例,并在g n uo c t a v e 平台进行算法验证。本文还利用c c + + 语言在桌 面p c 平台下开发了一套算法程序以测试性能。并且使用c m u 提供的l e t s g o d a t a 语音数据库做了性能上的测试,分析了识别误差的产生原因和算法的改进方向。 在桌面p c 机器上程序通过验证后,在w i n d o w sm o b i l e5 0 嵌入式平台上进 行了移植。随后描述了向此平台移植程序的过程,分析了嵌入式系统上我们设 计的语音识别系统的性能瓶颈所在。针对所面临的问题,又提出了一种针对特 定的没有浮点协处理器的嵌入式平台的提高识别速度与正确率的算法策略上的 改进。并且设计了种定点运算方式,用于替换软件模拟的浮点运算数学库以 提高识别系统的速度性能。实验证明,在损失一定识别精度的条件下,通过调 整算法策略与使用定点运算程序能显着改善嵌入式平台上的识别实时性能。 关键词:语音识别,连续语音识别算法,h m m ,嵌入式系统实现 武汉理工大学硕士学位论文 a b s t r a c t a u t o m a t i cs p e e c hr e c o g n i t i o ni sc u r r e n t l yah o ts p o ta m o n gb o t ht h ea c a d e m i c a n dt h ee n g i n e e r i n gc o m m u n i t y t h ep u r p o s eo ft h er e s e a r c hi st om a k et h em a c h i n e ”t m d e r s t a n d i n g ”o fh u m a nd i s c o u r s e ,h e n c ea l l o w i n gd i r e c ti n p u tm e t h o dt or e p l a c e i n d i r e c ti n p u to n e s ( n a m e l y , t h ek e y b o a r d ,h a n d w r i t i n gp a d ,s c a n n e ra n do t h e r s ) i na m o r en a t u r a la n dm o r ee f f i c i e n tw a y , f u r t h e r , e v e nt oe l i m i n a t et h ei n d i r e c ti n p u t m e t h o d s a s ri sac r o s s - d i s c i p l i n a r y , 、析t l lm a nd i s c i p l i n e si n v o l v e di n i nr e c e n t y e a r s ,a c a d e m i c sa n de n g i n e e r sf r o md i f f e r e n tc o u n t r i e sh a v ea c h i e v e dc o n t i n u o u s p r o g r e s si nt h i sa r e a , w h i c hb r i n g st h i si m p o r t a n tt e c h n o l o g yf r o mt h el a bt ot h e c o n s u m i n gm a r k e tg r a d u a l l y a s rw i l l e n t e rt h e i n d u s t r y , h o m ea p p l i a n c e s , c o m m t m i c a t i o n s ,a u t o m o t i v ee l e c t r o n i c s ,m e d i c a l ,f a m i l ys e r v i c e s ,c o n s u m e r e l e c t r o n i c sa n do t h e rf i e l d s p a r t i c u l a r l y , o nt h ee m b e d d e ds y s t e m sb a s e dc o r ee n d c o n s u m e re l e c t r o n i c sp r o d u c t s ,a s ri sb e c o m i n ga ni m p o r t a n th u m a n - m a c h i n e i n t e r f a c ea n ds m a r t a s s i s t a n c em e t h o d t h i sp a p e rs t u d i e sm o s ta s p e c t so fa l g o r i t h m sa n ds i g n a lp r o c e s s i n gf l o w si n a s r f i r s t ,s t a r t i n gb yt h es t u d yo fi s o l a t e dw o r dr e c o g n i t i o na l g o r i t h m ,i td i s c u s s e s t h es i g n a lf l o wa n da l g o r i t h mt h e o r yi n c l u d i n gt h es p e e c hg e n e r a t i o nm e c h a n i s ma n d s p e e c hs i g n a la c q u i s i t i o n ,d e n o i s i n g ,t r a n s f o r m a t i o n ,p a r a m e t e re x t r a c t i o n ,t r a i n i n g a n dp a t t e r n m a t c h i n g r e c o g n i t i o n f o ri m p r o v i n g t h e r e c o g n i t i o na c c u r a c yo f i m p o r t a n tm a t h e m a t i c a lm o d e l s ,t h ec h a p t e rc a r r i e do u tad e t a i l e da n a l y s i so fh m m ; s e c o n d ,i ti n t r o d u c e si nt h ec o n c e p to f t h ec o n t i n u o u sa s r a l g o r i t h m sa n dan u m b e r o fn e wi s s u e s ,s u c ha sl a n g u a g em o d e l ( l m ) ,g r a m m a rr u l e ,e t c w e r ed i s c u s s e d a n d b a s e do nt h ew 3 cs t a n d a r ds p e c i f i c a t i o ns r g ;t h ec h a p t e rd e s i g n e das e to f e x p e r i m e n t a lr u l e sf i l es y n t a xs p e c i f i c a t i o na n d h e n c ea n a l y z e do fac a s eg r a m m a rf i l e a f t e rt h es u c c e s sv e r i f i c a t i o nt ot h ea b o v et h e o r ya l g o r i t h m so nt h eg n uo c t a v e p l a t f o r m ,as u i t eo fp r o g r a m sh a v eb e e nd e v e l o p e do nt h ed e s k t o pp ct ob e n c h m a r k t h ep e r f o r m a n c eu s i n gc c + + l a n g u a g e h e n c e ,ap e r f o r m a n c eb e n c h m a r kh a sb e e n d o n eu s i n gas p e e c hd a t a b a s e :l e t s g o d a t a , p r o v i d e db yt h ec m u h e n c et h e 武汉理工大学硕士学位论文 a n a l y s e so ft h er e c o g n i t i o n sr e s u l ta n ds e v e r a li m p r o v e m e n t so nt h ea l g o r i t h mh a v e b e e np r o p o s e d f i n a l l y , s e v e r a li m p r o v e m e n tm o d i f i c a t i o n sh a v eb e e np r o p o s e d , a f t e rt h ew o r ku n d e rt h ed e s k t o pp ch a sb e e nc o m p l e t e d ,t h ep o r t i n gp r o c e s s f r o mt h ep cp l a t f o r mt ot h ee m b e d d e dp l a t f o r mh a sb e e nd e s c r i b e d t h ep e r f o r m a n c e b o r l e n e c ko nt h ee m b e d d e dp l a t f o r mh a sb e e na n a l y z e d ,t o o t ot h ep r o b l e m s ,t h e p a p e rr a i s e das p e c i f i cr e c o m m e n d e dm e t h o dt oi m p r o v et h es p e e da n da c c u r a c y p e r f o r m a n c eo nt h ee m b e d d e dp l a t f o r m sw i t h o u tf l o a tp o i n tc o p r o c e s s o r s a n da f i x e d p o i n ta l g o r i t h mh a sb e e np r o p o s e dt or e p l a c et h es t a n d a r ds o f t w a r ef l o a t - - p o i n t e m u l a t i o nl i b r a r yf o rs p e e dp e r f o r m a n c ei m p r o v e m e n t t h ee x p e r i m e n t ss h o wo u t t h a t 谢t 1 1s o m ea c c u r a c yp e r f o r m a n c el o s s ,t h er e a l t i m ep e r f o r m a n c ec o u l db e i m p r o v e do b v i o u s l yt h r o u g hs o m ea l g o r i t h mm o d i f i c a t i o na n dp a r a m e t e rf i n et u r n k e yw o r d s :s p e e c hr e c o g n i t i o n , c s ra l g o r i t h m ,h m m ,i m p l e m e n t a t i o no n e m b e d d e ds y s t e m i 独创性声明 本人声明,所呈交的论文是本人在导师指导下进行的研究工作及 取得的研究成果。尽我所知,除了文中特 3 1 3 1 1 以标注和致谢的地方外, 论文中不包含其它人已经发表或撰写过的研究成果,也不包含为获得 武汉理工大学或其它教育机构的学位或证书而使用过的材料。与我一 同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说 明并表示了谢意。 签名: 学位论文使用授权书 本人完全了解武汉理工大学有关保留、使用学位论文的规定,即 学校有权保留并向国家有关部门或机构送交论文的复印件和电子版, 允许论文被查阅和借阅。本人授权武汉理工大学可以将本学位论文的 全部内容编入有关数据库进行检索,可以采用影印、缩印或其它复制 手段保存或汇编本学位论文。同时授权经武汉理工大学认可的国家有 关机构或论文数据库使用或收录本学位论文,并向社会公众提供信息 服务。 ( 保密的论文在解密后应遵守此规定) c 漱、pc 警 加l 啤娟l 调 武汉理工大学硕士学位论文 第1 章绪论 1 1 课题研究的背景与意义 近几十年来计算机技术飞速发展,人类社会发生了有史以来最空前的变化, 计算机已成为日常工作生活中必不可少的组成部分。但是,人与计算机之间的 交互水平却严重地滞后于计算机其它技术的发展,远远不能满足人类的需求。 因此,如何提高人机交互的友好程度,是一个有着重要意义的研究课题。 语言是人类进行交流的最直接、最自然的方式,而语音是语言的重要载体。 与机器直接进行语音交流,是人类长期以来梦寐以求的事情。语音识别技术就 是让机器通过识别和理解过程把语音信号转变为相应的文本或命令的技术。语 音识别是- - 1 3 交叉学科,涉及到概率论、信息论、发声机理、听觉机理、模式 识别、信号处理、人工智能、心理学等多个学科【l j 。语音识别技术是发展人机通 信和新一代智能计算机的重要组成部分,也是目前被普遍认为很有前景的一项 技术。自从开始被关注研究以来,人们一直期望将其广泛应用于工业、通信、 汽车电子、医疗、消费电子产品等各个领域。目前,该技术已经在多个领域开 始进入试用或者实用阶段。随着计算机处理能力和存储能力的不断增强,一些 非常复杂的语音识别算法能够得以实现,语音识别器的性能也得以不断提高, 这就为更加自然方便的人机交互水平以及更加广阔的应用前景提供了可能。 目前,m i c r o s o f t 、g o o g l e 、i b m 等各大公司都在积极地研究与应用语音识 别技术。以剑桥大学、卡耐基梅隆大学为代表的高校、以美国国防部高级研究 院为代表的科研机构也在积极参与。目前,语音识别不仅是国际竞争的一项重 要的技术,也成为国民生活中不可缺少的- - 1 7 重要基础研究【2 】。 1 2 相关研究领域国内外研究现状 1 2 1 语音识别技术研究现状 早在1 9 5 2 年,美国的d a v i s 等人成功研制了可识别1 0 个英文数字的实验性 系统【3 1 。1 9 6 0 年,d e n e s 等人研究成功了第一个智能语音识别系统,自此开始了 武汉理工大学硕士学位论文 计算机语音识别的阶段。进入7 0 年代,小词汇量、特定人、孤立词的语音识别 研究取得了实质性的进展,出现了线性预测分析技术【4 】,动态时间规整算法,矢 量量化技术等大量研究成果。8 0 年代中期以来,h m m 的广泛应用和研究,推 动了语音识别的快速发展,使得语音识别的任务得以由连接词向连续语音扩展。 并陆续出现了许多基于h m m 模式的语音识别系统。其中卡内基梅隆大学的 c m u s p h i n x 系统【5 j 被认为是8 0 年代末9 0 年代初的典型代表,在英语的大词汇 量、非特定人连续语音识别方面能够达到9 7 的识别率。进入9 0 年代,语音识 别技术更是展现出其蓬勃生机和广阔的发展前景。基于关键词识别及朗读式连 续语音识别的语音识别应用系统已经初步走向市场,并进入实用或半实用阶段。 如i b m 的v i av o i c e 、p h i l i p s 、d r a g o n 等公司的听写机和其它语音产品。语音识 别、语音合成、语音编码等技术在手机、p d a 等嵌入式设备中以及在进行菜单 控制和阅读方面也已得到广泛应用。m i c r o s o f t 公司推出的家用游戏机x b o x3 6 0 附带有语音识别技术的游戏控制器。g o o g l e 公司把语音识别技术、嵌入式技术、 搜索技术结合起来,于a n d r o i d 手机平台推出了语音搜索功能。随着应用领域的 进一步扩大,尤其是基于自然语音或电话语音的信息查询,预约、订票、导游 等新需求的不断提出,语音识别研究的内容也开始由朗读式的连续发音向非受 限的、自然的口语或对话系统扩展。 目前语音识别技术水平在实际使用中达到了较好的效果,但如何克服影响 语音的各种因素还需要更深入地分析。目前听写机系统还不能完全实用化以取 代键盘的输入,但识别技术的成熟同时推动了更高层次的语音理解技术的研究。 由于不同的语言有着不同的特点,针对一种语言提出的技术,在其它的语言中 如何使用,也是一个重要的研究课题。某种语言本身特有的问题( 比如汉语中 的四声、拉丁语言中的连读等) 也有待解决。到目前为止,基于朗读式发音的 连续语音识别技术已经可以达到比较好的识别性能。然而对于自然、随意发音 的连续语音( 例如电话中的自由对话) 来说,由于其本身发音过程的随意性, 使得识别性能与实用化目标之间,仍有非常大的差距。国内外对语音识别技术 的研究目前存在如下问题: ( 1 ) 标准输入的难题 语音识别技术目前的应用瓶颈在于缺少统一的输入标准和精准的视觉反 馈。不同的语言、不同的方言、不同的口音等输入不标准的问题导致识别错误 率高过键盘,是目前语音识别无法取代传统输入方式( 比如:鼠标、键盘、手 2 武汉理工大学硕士学位论文 写板等) 的首要原因。不仅是各种方言存在口音差异,每个人都有独有的发音 习惯。因此在目前的语音识别系统( 比如m i c r o s o f t 的s a p i 识别系统) a e ,每个 用户在用语音控制电脑前,都需要以自己的语音,对电脑进行适应训练,使其 习惯自己的发音,识别出正确的指令。在一次公开示范中,s a p i 语音识别系统 认“m o m ”为“a u n t ,误读了演示者的意思。对这个错误,开发人员做出这样的解 释:“演示组里每个员工都有自己的适应模式,正是演示人员a 慌忙中误使用了 b 的身份和模式,才导致了这样的错误。”这从一个侧面也可以反映出语音输入 不易规范的弊病。除去口音参差不齐,还有观点认为,输入设备没有统一标准 也导致了语音输入的不标准。在语音识别状态下,麦克风录音交由机器解码。 而现在很多现存设备上的录音质量是以人可以听懂为依据的。至于在什么标准 范围内,机器才能听懂,目前还没有统一标准。这一点需要对数据进行进一步 测试、收集及分析研究才能确定。 ( 2 ) 噪声的困扰 语音输入很难规范,从某种程度上说由人为因素造成,但噪声却是一种不 可抗力。噪声环境的处理是目前此领域公认的技术难题。机器无法像人那样分 辨出人声和噪声。同时,不同场景有不同噪声,训练场景难以精确匹配真实环 境,使得语音识别在噪声中比在安静的环境下难得多。目前,主流的技术思考 方向是,研究出尽可能好的算法,使误差降到最低。在前端,在已混入噪声的 语音中,提取抗噪性高的语音特征;在语音训练的时候,利用“最小识别错误训 练方法”,结合噪声处理算法训练出一个语音模式,使识别系统在噪声环境里的 鲁棒性比较高;在语音解码的过程中进行多重选择,凭借放入解码机制的信息, 判断第一顺位的答案是否正确,如不正确可以看看第二、三顺位的方法。这些 方法都可以提高语音识别在噪声环境中使用的精准性。 1 2 2 嵌入式系统研究现状 美国麻省理工大学多媒体实验室d o u g l a s 教授曾提出过在p c 时代之后会出 现一个”后p c 时代”的概念1 6 。意指计算能力将逐渐渗透到日常生活用品当中去, 而不仅限于在桌面p c 或者是服务器中进行。嵌入式的智能设备在近年来越来越 备广泛使用,逐渐有削弱甚至取代传统计算机的趋势。最早出现于6 0 年代晚期 的嵌入式系统,最初被用于控制机电、电话交换机,如今已被广泛的应用于工 业制造、过程控制、通讯、仪器、仪表、汽车、船舶、航空、航天、军事装备、 武汉理工大学硕士学位论文 消费类产品等众多领域。每年在全球范围内的产量大概在二十亿颗左右的c p u 器件,超过8 0 应用于各类专用性很强的嵌入式系统。一般的说,凡是带有微 处理器的专用软硬件系统都可以称为嵌入式系统。目前国内外应用比较广泛具 有代表性的嵌入式系统有如下: 嵌入式l i n u x 系列:由于l i n u x 系统自身的开放性与模块性,使得其在嵌入 式系统市场占有很大的市场份额。目前市场领先优势正在逐步扩大,软硬件提 供厂商都在增加在这方面的投资与研发。g o o g l e 公司的a n d r o i d 、n o k i a 公司的 与i n t e l 公司的m e e g o 、m o n t a v i s t a 系统都是目前学术界与商业界比较热门的嵌 入式l i n u x 平台。l i n u x 是一种可完全订制的系统,所以除了大厂商之外,任何 研究者与开发者都可以依据自己的需求建立开发平台来订制自己的系统,所以 l i n u x 开发人员是在所有的嵌入式系统中最广泛的。 w i n d o w sc e 系列:由m i c r o s o f t 公司主导的w i n d o w sc e 系列产品在工业 控制与消费产品市场占有较大的市场份额。有着m i c r o s o f t 公司强大的资金与研 发资源作为支持,其在嵌入式市场的前景也被看好。w i n d o w sc e 系统是一种半 开放平台,使用者可以通过m i c r o s o f t 公司的付费开发工具来订制自己的内核。 由于支持与兼容性的优势,使得其在大客户中占有较大的份额。 各种专有系统:专有系统指那些完全不能由普通开发者与用户订制的系统。 比如a p p l e 公司的i p h o n e 系统、r i m 公司的b l a c k b e r r y 系统、p a l m 公司的p a l m o s 等系统。还有形形色色的专用设备上的封闭式操作系统。这类系统的特点在于封 闭性带来的平台的统一性,所以对与专门的应用开发者来讲,在失去了订制的灵 活性的同时也带来的相应的规范性。这类系统都需要系统的发布厂商来维护与更 新。当然近年来,嵌入式系统与传统的桌面系统的界线越来越模糊。有很多中间 类型的系统发布,比如a p p l e 公司2 0 1 0 年1 月发布的平板电脑i p a d 系列产品、 o l p c 项目组率先开发的n e t b o o k 产品等等。为方便叙述,本文使用传统公认的嵌 入式系统定义r 7 】:运行在特定硬件平台( 通常意味着低功耗、小体积) 上的软硬 件集合。随着消费类电子产品的大量开发和应用和嵌入式操作系统的不断健壮和 强大,嵌入式系统越来越多的进入人们的生活之中,应用范围越来越广。 1 3 论文的主要研究内容和组织结构 全文共分为5 章: 第一章介绍了自动语音识别研究领域的相关概念与发展现状,以及自动语 4 武汉理工大学硕士学位论文 音识别研究领域中目前所面临的问题与挑战:第二章研究了从语音信号获取、 处理、参数提取、训练模式、至识别网络算法的孤立词识别的整个相关理论并 作了相应的算法仿真;第三章讨论连续语音识别引入的语言模式、语法规则约 束等相关理论;第四章则论述了各个单元模块的设计,基于一种嵌入式平台, 开发了一个大词汇量的自动语音识别系统,并提出了几条针对于嵌入式平台的 优化改进措施。将分别在p c 平台与嵌入式平台上的设计进行了性能对比,分析 了性能差异的来源并且提出了改进方向;第五章总结了全文,和未来工作的展 望。 5 武汉理工大学硕士学位论文 第2 章孤立词识别算法研究 2 1 语音信号获取和预处理 2 1 1 语音信号的采集与去噪 人类在一般情况下的发声频率与其谐波频率范围为8 5 h z 3 4 0 0 h z ,语音频谱 有小峰点,出现在基音点和基音谐波点上,能量主要集中在低于3 k h z 的范围【8 】。 某些声乐歌唱家在演唱时候能够超越这个范围,但不是本文关注的部分。声音 在介质中是震动的纵波,要采集首先要将其转换为电信号与数字信号。首先使 用一种叫驻掇体的电子元器件将声波转换成模拟的电压信号。图2 - 1 所示波形即 为音节a 1 的电压波形。 图2 - 1 声音 a 】的波形 使用a d c 对其进行采样以获取数字信号。根据采样定理嗍:如果信号是带 弓= g g 武汉理工大学硕士学位论文 限的,并且采样频率高于信号带宽的一倍。即:六咄l 。那么,原来的连 续信号可以从采样样本中完全重建出来。因为语音谐波最高分量大致上在 3 4 0 0 h z 左右,所以i t u t 的g 7 1 1 i l o 】标准规定每路话音采样率为8 k h z ,每样点 量化为8 b i t 。根据本领域的惯例,学术界一般使用采用1 6 k h z 的采样率,量化 位数采用1 6 b i t 。在测试性能时候,也有使用8 k h z 与8 b i t 的。采样后的数据即 为数字编码的数字语音信号,一般称之为p c m ( p u l s e - c o d em o d u l a t i o n ) 。通常声音 采样流程如图2 2 所示。 图2 2 声音采样流程 采样得到的原始数字语音信号中既有有用信号也含有噪音: x ( m ) = s ( m ) + n ( m )( 2 - 1 ) 其中x ( m ) 是采得的信号序列,一般情况下没有关于n ( m ) 的知识,把x 近 似地看作s ( m ) 。信号与噪音的功率之比称作信噪比: s n r = 导 ( 2 2 ) d 、 7 这里p 为平均功率。如果信噪比太低,则需要先去除噪音。信号功率与噪 音功率必须以相同的系统带宽在同样的点被采样。如果信号与噪音在相同的阻 抗上测量,则信噪比也可以通过计算幅度之比的平方来得到: s n r = i e s t g n a l _ ( 等 2 p 3 , l 屯妇j 、7 这里a 为均方根幅值( 一般来讲即为电压的均方根) 。因为很多信号拥有很 宽的动态范围,信噪比一般用对数级数来表达。用分贝来表示信噪比: s n r c 扭) = 1 0 l o g l o ( 誓 = 2 0 1 0 9 l o 陲 - 矿扭, 噪音不仅使识别精确度下降,而且增加了数据量,造成额外的数据处理与 7 武汉理工大学硕士学位论文 存储负载。在通常的语音信号生成过程中,可能引入的干扰因素可以分为以下 四类【1 1 l :说话人的影响、环境影响( 背景噪声和回声等) ,信道影响( 包括采样 麦克风的距离和方向,传输信道畸变和线路噪声等) 和量化影响( 包括滤波效 应和量化误差等) 。声学特征对这些因素和抗干扰能力直接关系到语音识别的鲁 棒性能。消除噪音的干扰是当前此领域的努力方向之一,本文中使用以下几种 方法来除去噪音影响: ( 1 ) 带通滤波 根据现有的文献与研究结果 1 2 1 ,语音的谐波频谱分量大致集中在 3 0 0 h z 3 4 0 0 h z 以内,此范围之外的频谱分量对语音识别影响很微小。所以本文 对采集到的原始数据进行了3 0 0 h z 3 4 0 0 h z 的带通滤波。具体做法是设计一个数 字滤波器,其中使用f f t 进行频谱分析。设原始语音信号序列为,【刀) ,则经过 y - 滤波得到f i l t e r e dv v 的过程如下: f 【,( 聆) 】- r ( 归) ( 2 5 ) r ( j r a ) 幸h ( j a o = r 删( 缈) f 。1 l 删( 归) j 2 ,:i 删( 刀) r 1 6 0 0 z 口, 6 8 0 0 万 其中,( j o ) 2 “缈取其它值 为此带通滤波器的传递函数。 图2 3 所示即为发音【a 】的数据滤波前后的波形对比。可以看到静音部分由于 滤波而产生高频分量( 高于带通滤波器的高截止频率) 的小幅度噪音,这部分可以 通过下面的压缩去除,不会影响运算结果。 8 武汉理工大学硕士学位论文 图2 - 3 发音【a 的数据滤波前后的波形对比 f 上:带通滤波前,下:带通滤波后) ( 2 ) 压缩识别静音部分 通过对语音时域数据的分析,能发现很多静音部分,有很多数据冗馀。英 文语音中需要检测音节阈隔、单词间隔、句子间隔这三个间隔。所以压缩这些 间隔数据对识别正确率与实时性能都有所提高【l ”。具体的实现方法是根据波形 的变化使用适当的两个门限值:t h r e s o l d , , l 。“与t h r e s 。埘掣一对语音信号序列进 行判决。这两个门限值也跟随着信号的变化在几秒钟后更新一次。原始样本分 为帧,计算每个帧信号的功率,并积累l u 一个状态变量。此模块输出两种状态: sll=e 4cai|l 武汉理工大学硕士学位论文 s h e n c e 或s p e e c h 。通过一个检测若干帧连续的窗口来切换两者。这些闽值 中的内容,在低功率信号结束的第一个高峰更新。每个数据帧的绝对时间戳也 被保存下来已各后面的处理过程来判断语音边界与单词边界等。图2 - 4 所示即为 消除静音后发音【a 的波形。 图2 - 4 消除静音后发音【a 的波形( 除静音前波形见图2 - 3 ) 2 1 2 语音信号的预处理 在输入至下面的模块之前,输入的语音信号还要进行预处理,包括抗混叠 滤波、声音的预加重、加窗分帧处理与端点检测等。预加重的目的是在于滤出 低频干扰尤其是5 0 h z 或6 0 h z 的工频干扰,将对于语音识别更为有用的高频 部分的频谱进行提升,以便于语音参数分析。 ( 1 ) 抗混叠与预加重 对采样后的语音先预滤波,去掉工频干扰( 5 0 h z 或6 0 h z ,我国的工频交流 电为5 0 r z ) ,然后进行归一化。根据采样定理,本文使用1 6 k h z 的采样率,可 武汉理工大学硕士学位论文 以得到完全代表原始语音信号的数字信号。本文采用以下差分方程所定义的数 字滤波器: 】,( 力) = x ( 胛) 一g x ( n 一1 ) ( 2 6 ) h ( z ) = 1 一a z 一1 以提升高频部分,使信号频谱变得平坦。其中x ( n ) 是原始信号序列,y ( n ) 是预加重后序列,h ( z ) 为相应的传函,口是预加重系数,通常口取值为0 9 3 7 5 。 图2 5 所示为预加重滤波器的幅频响应。 图2 5 预加重滤波器的幅频响应 ( 2 ) 端点检测与加窗分帧 语音信号起止点的判别是任何一个语音识别系统必不可少的组成部分。常 用的端点检测方法有下面两种: 1 ) 短时平均幅度 短时平均幅度定义如下: m n = i x ( m ) w ( n - m ) l( 2 7 ) 式中,j 2 ( 朋) = 1 w ( n 一所) i 。 即用移动窗h ( n m ) 选取出语音信号,然后计算该语音取样值的绝对值的和, 便得到该段语音的平均幅度或者,用移动平均窗h ( n 砌选取语音信号绝对值序 列中的一段,并将各取样值求和,也能得到短时平均幅度。通常所用的移动窗 为矩形窗和汉明窗,它们分别定义为: 矩形窗 :,( 武汉理工大学硕士学位论文 蝴州炉f 以4 6 c o s ( 2 n 一1 ) ,1 n n n 取其他值 它们的频率特性( n 均等于3 0 ) 如图2 - 6 所示。 0 - o 5 - 1 1 5 2 - 2 5 o 2 0 - 4 0 - 6 0 o - 5 0 1 0 0 - 1 5 0 2 0 0 - 2 5 0 - 3 0 0 3 5 0 - 4 0 0 1 o 5 0 - o 5 1 1 5 2 0 0 - 2 0 0 - 6 0 - 8 0 一 o 1 一2 3 - 4 0 0 5 - 6 0 0 7 0 0 、 p a s s b ;n d ( d 劭 s t o p 晶n d ( d b ) 、 v 、厂、厂、厂、 、 i v yvyvv v vvvvv i i l 、 p h a s e ( de g r e e s ) 、 、 k卜卜j 、kij n 、f f i 、i j 、 卜、 i 、,、i i、,inn1 、j 、lil、ffijn 、,、 inn y 一 n 00 10 2 0 3 0 40 5 0 60 70 80 9 n 翻砷w 硎f r e q u e n c y i p a s sb a n d ( d b ) 一 | | 、 s t o p 鼬州( d b ) 一 、 、 4 、一、 yvvvvv v vv vvv p h a s e “e g r e e s ) 卜 i f r卜f 、i f f 、i f 、j nn 、unn 0o 10 20 30 40 50 60 70 80 9 n o r m a l i z e df r e q u e n c y 图2 - 6 矩形窗口与h a m m i n g 窗口的频率特性 1 2 ( 2 8 ) ( 2 9 ) m 雌以期 一取 o n l 仉 ,、 = 穆 武汉理工大学硕士学位论文 矩形窗的谱平滑性较好,但波形细节易丢失,并且矩形窗会产生泄露频谱 现象,而h a m m i n g 窗可以有效地克服频谱泄露现象,所以在处理中一般都选择 汉明窗。本文使用2 5 6 点的汉明窗进行分帧,帧移为8 0 点。 2 ) 短时平均过零率 短时平均过零率的计算方法是:首先用一个移动窗口( n m ) 选取出位于1 1 时 刻的语音段,然后计算出该时段的过零率总数,并除以该时段的长度。若采用 矩形窗,设窗的宽度为n ,这时的短时平均过零率可用式2 1 0 计算: 乙= 素i s g n x ( 聊) w ( 刀一朋) 卜s e n x ( 所一1 ) w ( n - 所+ 1 ) 】i ( 2 1 0 ) = 石1 i s g n x ( m ) - s g n x ( m - 1 ) i 似n - m ) 2 2 特征参数及其提取 语音识别中,特征提取与处理是一个重要的部分。特征提取与处理的任务 是从数据量庞大的原始数字采样语音时域信号中,提取一方面能表征不同识别 基元的声学差异,另一方面又能表征相同识别基元不同样本之间的声学相似性 的信息。特征提取与处理的另一个作用是减少原始时域信号的信息冗余度。 2 2 1 发音原理模式 语音的产生和传播与下列的发音器官特征有关【1 4 】: ( 1 ) 时变的声道形状; ( 2 ) 鼻腔联结的影响; ( 3 ) 声道壁软组织的影响; ( 4 ) 声门下系统( 肺,气管) 与声道共振结构联结的影响; ( 5 ) 沿声道壁的粘性摩擦以及热传导的损耗。 一个经典的语音信号产生的模式如图2 7 所示。 武汉理工大学硕士学位论文 基 音 周 期 声门脉冲模型g ( z ) 冲击序列发生器e ( z ) 随机噪音发生器e ( z ) 振 幅 振幅 声 道 模 型 h ( z ) 辐 射 模 型 r ( z ) 语 j 匕 日 信 号 图2 7 经典语音信号产生简化模式 其中人类的发音器官模式分为以下三个部分: ( 1 ) 激励模式( z ) ) 激励模式表示发音器官中的声门子系统,包括负责产生气流的肺和气官以 及产生振动的声带,在图2 7 中分别由e ( z ) 和g ( z ) 表示。根据语音的不同发音特 性,声带激励的情况大致以分为浊音和清音。 ( 2 ) 辐射模式( r ( z ) ) 由于从声道模式输出的速度波与语音信号的声压之间存在辐射阻抗。它表 征了口唇的辐射效应。研究证明辐射模式可简化为: 巧= 百1e x , v i ( 2 1 1 ) l r- ”ij e 昌 其中民是一个常数。由式2 1 1 可得知,辐射模式是一个一阶类h p f 。 ( 3 ) 离散化声道短管模式( h ( z ) ) 语音的变化主要和声道的变化有关,声道参数是表征语音信号特性的主要 参数。对于声道的建模,经典的语音信号处理技术主要有两种观点:一是共振 峰模式;二是把声道看成是由不同截面积的管子串联而成的系统。离散化的声 管模式应用最广泛。 1 4 武汉理工大学硕士学位论文 a 声门 a 1 a 2a 3a 4 a n 唇 l 声门 l 口唇 l 1 l 4 l 2 图2 8 离散化声管模式截面示意图 如图2 - 8 所示,声道由多个截面积不同的管串联而成,假设以下三个条件: 1 ) 声波在声道类是沿着管轴传播的平面波; 2 ) 在一个”短时”期间声道形状无变化; 3 ) 短管中的一体及管璧都没有热传导与损耗。 由p 个短管组成的声管模式的传递函数可以表示为一个p 阶全极点函数: y a z 一 玎m 一智 ( 2 - 1 2 ) 日( z ) = 三5 l 一 卜7 其中,a o = 1 ,a i ( 1 i p ) 为常数。对声门子系统,声道系统以及辐射系统分 别建模后,语音信号的产生系统的传递函数s ( z ) 就可以用一系列的传递函数的乘 积表示: s ( z ) = - u ( z ) h ( z ) r ( z ) 2 e ( z ) g ( z ) h ( z ) r ( z )( 2 13 ) 上文中所述的经典语音产生机理模式以及由此得到的数字语音信号特征参 数存在局限性。经典语音产生模式是对人类实际语音系统的简化【15 1 。它将人类 的发音系统划分为激励模式,声道模式与辐射模式的串联,认为这三部分之间 独立,这不符合实际的发音系统机理。在激励模式中,简单的把激励分为浊音 和清音两种情况,这种划分是有缺陷的。在利用空气流体力学推导声道模式传 递函数时,需要上节提出的三个简化假设条件,即声波的平面传播性、声道形 状的短时不变性和声管壁的无损性。以上这三个假设是不成立的。以声波的平 武汉理工大学硕士学位论文 面传播性为例,认为声波在声道中传播是呈平面传播的,图2 - 9 是声波平面传播 的声道截面示意图,而声道中气流的实际传播情况并不符合此条件。 图2 - 9 声波平面传播的声道截面示意图 2 2 2 语音识别中的声学特征提取与处理 语音信号是一个非平稳信号,现有的语音信号处理基本上基于语音信号具 有短时平稳性,在对语音信号进行分析时候,假定语音信号在一个时间帧内是 平稳信号,从而利用平稳信号的分析方法对其进行处理。语音信号的特征参数 主要有以下三类:( 1 ) 频域及倒谱特征。 音信号的频域特性。包括f o u r i e r 频谱, 由时域信号进行频谱变换得到,反映语 倒谱以及利用了语音信号的时序信息的 时频谱等时域特征;( 2 ) 直接从时域信号计算得到,反应了语音信号时域波形特 征。如短时平均能量、短时平均过零率、共振峰与基音周期等;( 3 ) 听觉特征。 不直接对声道模式进行研究,而是从听觉系统对语音感知特性来刻画语音信号。 ( 1 ) 时域参数 第t 帧语音的短时平均能量为: e n g ( f ) = 寺s 2 ( 刀) ( 2 1 4 ) yn = o 或 e n g ( t ) = 寺i s ( 刀) l 工n = o 1 6 武汉理工大学硕士学位论文 其中n 为分析窗的宽度,s ( 刀) 表示第t 帧第n 个点的信号样值。短时平均 过零率为: z c t ( f ) 2 万l 己i 1 1 一s g n ( s , ( ,z ) s t ( 玎一1 ) ) 】 2 - 1 5 ) 其中符号函数定义为:s g n ( x ) = 三1 ,二三: ( 2 1 6 ) 目前时域参数( 能量和过零率) 多用在语音的预处理上,如端点检测,判 断语音的开始与结束。也有人把它作为模式参数进行使用,但都进行了归一化 处理。而能量的使用多利用其对数值或把能量的包络作为参数使用。能量和过 零率参数的缺点是其

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论