已阅读5页,还剩68页未读, 继续免费阅读
(计算机应用技术专业论文)基于神经网络的语音识别研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
浙江大学硕士学位论文 摘婴 摘要 语音识别技术具有重要的理论价值和广阔的应用前景,近年来受到了人们的 广泛重视。随着电子计算机的不断应用与发展以及人工智能的不断进步与完善, 人们越来越希望让机器能够理解人类的自然语言,这种需求使得语音识别技术有 着十分广阔的发展前景。一直以来,语音识别研究大部分以线性系统理论为基础, 主要包括应矢量量化( v q ) 、动态时问规整( d t w ) 与隐马尔可夫模型( h m m ) 等技术。然而,人的发音实际上是一个复杂的非线性过程,基于线性系统理论的 语音识别方法的局限性渐渐显示了出来。语音识别技术若要取得突破,就必须引 入非线性理论的方法。近年来,人工神经网络( a 卜n ) 等非线性理论研究和应 用的逐渐深入,将这些理论应用于语音识别成为可能。 本文对语音识别的主要过程进行了详细的介绍。在语音的特征参数提取阶 段,本文着重介绍了实际应用中经常使用的线性预测倒谱系数( l p c c ) 和美尔 频率倒谱系数( m f c c ) 等。本文主要研究了基于b p 神经网络的语音识别,并 提出了基于m f c c 与l p c c 混合参数的语音识别方法,以更好地表现语音的特 征,避免传统的分段线性处理所产生的局限性,提高了识别性能。实验结果显示, 该方法比传统的m f c c 参数的语音识别方法具有更好的识别性能。本文还对识 别系统中的b p 神经网络进行了优化,改进了性能,缩短了训练时间,为将来移 植到嵌入式系统中打下了良好的基础。 关键词:语音识别,人工神经网络,特征提取 浙江大学硕上学位论文a b s t r a c t a b s t r a c t l a n g u a g ei so n eo ft h em o s ti m p o r t a n tm e a n so fe x c h a n g i n gi n f o r m a t i o na m o n g t h em a n k i n d w i t ht h ec o n t i n u o u sd e v e l o p i n ga n da p p l i c a t i o no fe l e c t r o n i cc o m p u t e r a n dt h ei n c r e a s i n gi m p r o v e m e n to fa r t i f i c i a li n t e l l i g e n t ,p e o p l ee x p e c tt om a k et h e c o m p u t e rr e c o g n i z eh u m a nl a n g u a g e t h i sr e q u i r e m e n tm a k e st h et e c h n i q u eo fs p e e c h r e c o g n i t i o nh a v ei m m e n s es p a c et od e v e l o p u pt on o w , m o s ts p e e c hr e c o g n i t i o ni s b a s e do nc o n v e n t i o n a ll i n e a rs y s t e mt h e o r y , s u c ha sd y n a m i ct i m ew a r p i n g ( d t w ) a n dh i d d e nm a r k o vm o d e l ( h m m ) w i t ht h ed e e ps t u d yo fs p e e c hr e c o g n i t i o n ,i ti s f o u n dt h a ts p e e c hs i g n a li sac o m p l e xn o n l i n e a rp r o c e s s i ft h es t u d yo fs p e e c h r e c o g n i t i o nw a n t st ob r e a kt h r o u g h ,n o n l i n e a rs y s t e mt h e o r ym a h o dm u s tb e i n t r o d u c e dt oi t r e c e n t l y , w i t ht h ed e v e l o p m e n to fn o n l i n e a r - s y s t e mt h e o r i e ss u c ha s a r t i f i c i a ln e u r a ln e t w o r k s ( a n n ) ,i ti sp o s s i b l et oa p p l yt h e s et h e o r i e st os p e e c h r e c o g n i t i o n t h i sp a p e rf o c u s e so nt h o r o u g ha n a l y s e sa n di n v e s t i g a t i o n so ft h em a i np r o c e s s o fs p e e c hr e c o g n i t i o n i nt h es t a g eo fd r a w i n gt h ec h a r a c t e r , t h eu s u a l l yu s e dc h a r a c t e r p a r a m e t e r sl p c ca n dm f c ca n ds oo n ,a r ed e s c r i b e di nt h i sp a p e r t h i sp a p e r m a i n l ys t u d i e ss p e e c hr e c o g n i t i o nb a s e do nb pn e t w o r k i no r d e rt or e p r e s e n tt h e f e a t u r eo fs p e e c hb e t t e ra n da v o i dt h el o c a l i z a t i o no f u s i n gs u b s e c t i o nl i n e a rm e t h o d , t h em e t h o df o rs p e e c hr e c o g n i t i o nb a s e do nm i x e dp a r a m e t e ro fm f c ca n dl p c ci s a l s o p r o p o s e d e x p e r i m e n t a lr e s u l t ss h o wt h a tu s i n gm i x e df e a t u r ep a r a m e t e r s a c h i e v e sb e t t e re f f e c t st h a nu s i n gm f c cf e a t u r ep a r a m e t e r s k e y w o r d s :s p e e c hr e c o g n i t i o n ,a r t i f i c i a ln e u r a ln e t w o r k ,f e a t u r ee x t r a c t i o n 1 i 浙江人学硕十学位论文图目录 图目录 图1 1 语音识别系统框图1 0 图2 1 基于模板匹配的语音识别系统结构1 4 图2 2 帧长与帧移的示例1 6 图2 3 双门限端点检测的流程图1 9 图2 4 汉语语音“5 ”端点检测后的时域波形2 0 图2 5 语音信号的声道模型2 1 图2 6 汉语语音“3 ”的l p c 系数波形图2 4 图2 7 线性预测倒谱系数求解流程一2 5 图2 8 汉语语音“3 ”的l p c c 参数波形图2 7 图2 9m f c c 参数的计算流程图2 8 图2 1 0 汉语语音“3 的m f c c 参数波形图2 8 图2 1 1 基于矢量量化技术的语音识别过程3 0 图3 1 神经元模型。3 5 图3 2 有教师学习流程图3 8 图3 3 多层b p 网络结构图4 0 图3 4b p 算法流程图4 1 图3 5 基于b p 神经网络的语音识别流程4 7 图4 1 语音识别实验平台主界面4 9 图4 2 端点检测参数设置窗口5 0 图4 3 汉语数字样本“0 ”端点检测前的各项参数波形图5 1 图4 4 汉语数字样本“0 ”端点检测后的各项参数波形图5 1 图4 5 特征参数的时间规整结构图5 3 图4 6 使用批处理的动量梯度下降算法训练图5 5 图4 7 语音“0 ”识别结果图6 1 浙江大学硕士学位论文 表目录 表目录 表1 1 中英文数字音节比较1 2 表4 1 方案一隐层神经元个数对训练时间和识别性能的影响5 6 表4 2 方案二隐层神经元个数对训练时间和识别性能的影响5 7 表4 3 方案三隐层神经元个数对训练时间和识别性能的影响5 7 表4 4 不同的特征参数方案的系统性能5 8 表4 5 语音信号识别结果5 8 表4 6 方案四输出层神经元编码方案6 0 表4 7 方案四隐层神经元个数对训练时间和识别性能的影响6 0 表4 8 不同的输出层神经元方案的系统系能6 0 v i i 浙江大学研究生学位论文独创性声明 本人声明所呈交的学位论文是本人在导师指导下进行的研究工作及取得的研究成果。 除了文中特别加以标注和致谢的地方外,论文中不包含其他人已经发表或撰写过的研究成 果,也不包含为获得逝姿盘堂或其他教育机构的学位或证书而使用过的材料。与我一 同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说明并表示谢意。 糊张刁年努弋槲飙一年易月7 日 学位论文版权使用授权书 本学位论文作者完全了解浙鎏太鲎有权保留并向国家有关部门或机构送交本 论文的复印件和磁盘,允许论文被查阅和借阅。本人授权迸姿态鲎可以将学位论文的 全部或部分内容编入有关数据库进行检索和传播,可以采用影印、缩印或扫描等复制手段 保存、汇编学位论文。 ( 保密的学位论文在解密后适用本授权书) 学位论文作者签名: 。盼 稗醐一悻厂日 导师签名: 6 月7 日 | 浙江人学硕士学位论文 第l 章绪论 1 1 课题背景 1 1 1 语音识别概述 第1 章绪论 随着计算机技术的发展,人与机器之间的交流也越来越广泛和深入,从科学 研究到日常生活,计算机己经渗透到人们生活的各个方面。在现代社会中,人们 逐渐习惯借助计算机来完成各项事务。在这种情况下,如何让计算机智能化地与 人进行通信,使人机交互更加自然方便成为现代计算机科学的重要研究课题之 一。 语言是人类特有的功能,是人类之间交流、传递信息的最简便、最有效、最 自然的工具,也是人类进行思维的一种依托。如果计算机能够听懂语言,能够说 话,那么就不会有键盘,不同语言的人们交流也就会更容易,这个愿望实现的技 术基础是语音识别和理解。语音识别将人发出的声音、音节或短语转换成文字和 符号,或者给出响应,如执行控制、做出回答。在2 0 世纪中期,语音识别作为 一门新学科产生,而且语音识别技术将是未来的信息领域的最为重要的科技发展 技术之一。 语音识别( s p e e c hr e c o g n i t i o n ) 主要是指让机器听懂人说的话,即在各种情 况下,准确地识别出语音的内容,从而根据其信息,执行人的各种意图。 语音识别是一门涉及面很广的交叉学科,它是目前发展最为迅速的信息研究 诸领域中的一个,与计算机、通信、语音语言学、数理统计、信号处理、神经心 理学和人工智能等学科都有着密切的关系。语音识别的最大优势在于使得人机用 户界面更加自然和容易使用。随着计算机技术、模式识别和信号处理技术及声学 技术等的发展,使得能满足各种需要的语音识别系统实现成为可能。近二三十年 来,语音识别在工业、军事、交通、医学、民用诸方面,特别是在计算机、信息 处理、通信与电子系统、自动控制等领域中有着越来越广泛的应用。 语音识别技术作为声控产业,必将对编辑排版、办公自动化、工业过程和机 器操作等的声控技术起到重大的推进作用。语音识别技术在人机交互应用中,也 已经占到了越来越大的比例。如基于电话的语音识别技术,使计算机直接为客户 浙江大学硕士学位论文 第1 章绪论 提供金融、证券和旅游等方面的信息查询及服务成为可能,进而成为电子商务进 展中的重要一环。在电话与通信系统中,智能语音接口正在把电话机从一个单纯 的服务工具变成为一个服务的“提供者”和生活“伙伴”;使用电话与通信网络, 人们可以通过语音命令方便地从远端的数据库系统中查询与提取有关的信息。 总之,科学技术推动了社会发展,满足人们的需求,社会需求也反过来推动 科学技术发展。多媒体时代的来临,迫切要求语音识别技术的快速发展,必然推 动语音识别理论和应用研究的进展,语音识别技术将会在理论上和应用上都取得 突破性进展。 1 1 2 数字语音识别研究的意义 语音识别的目标是让机器能听懂人类口述的语言,语音识别中的汉语数字语 音识别,具有更为重要的意义,在众多场合的实用化都会给人们带来极大的便利。 数字语音识别的任务是识别“0 ”到“9 ”等十个非特定人汉语数字语音。信用卡 号码、电话语音拨号、个人身份证号码、电子密码等都具有数字化特征,因此, 数字语音识别成为语音识别中极其重要的一项任务。 语音电话拨号的应用是现阶段语音识别技术中最重要的一个应用方向,在很 多场合下,如司机开车、黑夜或盲人拨打电话时,用手指拨电话号码是很不方便 或不安全的,此时最自然的方式就是采用语音拨号,这就需要高性能低成本的数 字语音识别系统,口述要拨打的电话号码,就可以连通电话的另一端,用一句轻 松的命令接通电话。 微电子技术发展到今天,计算机和电子通信设备日益微型化,未来的计算机 将会微缩成腕上的手表般大小,而如果仍采用键盘输入是不可能的。对于金融领 域一些主要以数字输入为主的工作,有了数字语音识别技术,就可以在桌面上用 声音命令、控制或操纵计算机,让计算机成为一名出众的打字员。让计算机真正 成为你最忠实的伙伴,最得力的助手,且不需劳累你的手指,摆脱了庞大的键盘, 远离了辐射较强的显示屏,也不必再害怕什么电脑综合症了。 利用语音进行工业控制可以避免复杂的控制面板,而工业控制中也需要大量 的对数字的识别。只要一声令下,所有的机器就都在你的指挥之下了,它们真的 可以做到听到你的话了。 2 浙江大学硕士学位论文第1 章绪论 语音控制也是以后家电遥控的一个必然发展方向,而家电遥控中不可避免地 会用到数字的识别,如电视机的频道、空调设定的温度、洗衣机的定时等,所以 数字语音识别将成为语音遥控家电的重要环节。 而在大词汇量语音识别中,独立出的数字语音识别也有其重要的意义;这是 因为数字语音具有高度的混淆性,采用普通的识别方法很难达到很好的识别性 能,而语音中的数字往往具有极其重要的意义,其识别错误的代价可能会远远高 于其他语音识别的错误,这就需要专门对数字语音的识别采用特殊的方法以提高 其识别率。 总之,数字语音识别( d s r ,d i g i ts p e e c hr e c o g n i t i o n ) 是语音识别领域中 一个具有广泛应用背景的分支,其研究对于推动社会发展具有重要的作用。我们 将在生活工作中渐渐体会到数字语音识别带来的种种便利,它将有可能涉足人类 生活的每一领域。 1 2 语音识别的发展和现状 1 2 1 语音识别的发展历史 语音识别的研究工作可以追溯到2 0 世纪5 0 年代。在1 9 5 2 年,a t & t 贝尔 研究所的d a v i s ,b i d d u l p h 和b a l a s h e k 研究成功了世界上第一个语音识别系统 a u d r y 系统,可以识别1 0 个英文数字发音【l 】。这个系统识别的是一个人说出的孤 立数字,并且很大程度上依赖于每个数字中的元音的共振峰的测量。1 9 5 6 年, 在r c a 实验室,o l s o n 和b e l a r 研制了可以识别一个说话人的1 0 个单音节的系 统,它同样依赖于元音带的谱的测量1 2 】。1 9 5 9 年,英国的f r y 和d e n e s 研制了一 个能够识别4 个元音和9 个辅音的识别器,他们采用了谱分析仪和模式匹配器【3 】。 所不同的是他们对音素的序列做了限制( 相当于现在的语法规则) ,以此来增加 字识别的准确率。同一时期的还有m i t 林肯实验室的元音识别器,它以一种非 特定人的方式来识别元音,同样运用了语音波形的频率谱和谱序列的信息【4 】。但 当时存在的问题是的理论水平不够,都没有取得非常明显的成功。 6 0 年代,计算机的应用推动了语音识别技术的发展,使用了电子计算机进 行语音识别,提出了一系列语音识别技术的新理论动态规划线性预测分析技术, 较好的解决了语音信号产生的模型问题。主要有三项研究成果。首先是美国新泽 浙江大学硕十学位论文 第l 章绪论 西州普林斯顿r c a 实验室的m a r t i n 和他的同事提出一种基本的时间归一化方 法,这种方法有效的解决了语音事件时间尺度的非均匀性,能可靠的检测到语音 的起始点和终止点,有效地解决了识别结果的可变性【5 】。其次,苏联的v i n t s y u k 提出了用动态规划的方法将两段语音的时间对齐的方法,这实际上是动态时间规 整( d y n a m i ct i m ew a r p i n g ) 方法的最早版本,尽管到了8 0 年代才为外界知唰6 1 。 第三个是卡耐基梅隆大学的r e d d y 采用的是音素的动态跟踪的方法,开始了连 续语音识别的研究工作,为后来的获得巨大成功的连续语音识别奠定了基础【7 j 。 7 0 年代,语音识别研究取得了重大的具有里程碑意义的成果,伴随着自然 语言理解的研究以及微电子技术的发展,语音识别领域取得了突破性进展。首先, 在小词汇量、孤立词的识别方面取得了许多实质性的进展。其次,m m 语音研 究小组,就是在7 0 年代开始他的大词汇语音识别研究工作的。最后,a t & a 的 贝尔研究所也开始了一系列有关非特定人语音识别的实验。这一时期的语音识别 方法基本上是采用传统的模式识别策略。其中苏联的v e l i c h k o 和z a g o r u y k o 的研 究为模式识别应用于语音识别这一领域奠定了基础【8 】;日本的迫江和干叶的研究 则展示了如何利用动态规划( d y n a m i cp r o g r a m m i n g ) 技术在待识语音模式与标 准语音模式之间进行非线性时间匹配的方法【9 】;日本的板仓的研究则提出了如何 将线性预测分析技术( l p c ) 加以扩展,使之用于语音信号的特征抽取的方法【l 0 1 。 同时,这个时期还提出了矢量量化( v q ) 和隐马尔可夫模型( h m m ) 理论。 8 0 年代,语音识别研究进一步走向深入。实验室语音识别研究的巨大突破 产生于2 0 世纪8 0 年代末:一些小词汇量的识别系统具备了较高的识别率。同时, 人们终于在实验室突破了大词汇量、连续语音和非特定人这三大障碍,第一次把 这三个特性都集成在一个系统中,比较典型的是美国卡耐基梅隆大学开发的连续 语音识别系统s p h d ,它是第一个高性能的非特定人、大量词汇的连续语 音识别系统。语音识别技术获得突破的主要原因在于半导体技术、软件技术和存 储技术突飞猛进的发展。这一时期所取得的重大进展还有:( 1 ) 隐马尔科夫模型 ( h m m ) 技术的成熟和不断完善,并最终成为语音识别的主流方法【l l 】。( 2 ) 以 知识为基础的语音识别的研究日益受到重视。在进行连续语音识别的时候,除了 识别声学信息外,更多地利用各种语言知识,诸如构词、句法、语义、对话背景 等方面的知识来帮助进一步对语音识别和理解。同时在语音识别研究领域,还产 4 浙江大学硕士学位论文第1 章绪论 生了基于统计概率的语言模型【12 1 。( 3 ) 人工神经网络( a n n ) 在语音识别中的 应用研究的兴起【1 3 】。a n n 具有较好的区分复杂分类边界的能力,显然它十分有 助于模式识别。在这些研究中,大部分采用基于反向传播算法( b p 算法) 的多 层感知网络。 1 2 2 语音识别的应用现状 进入9 0 年代,在语音识别的系统框架方面并没有什么重大突破。但是,随 着多媒体时代的来临,迫切要求语音识别系统从实验室走向实用,在语音识别技 术的应用及商品化开发方面出现了很大的进展。许多著名的大公司都对语音识别 的实用化投以巨资。语音识别有一个很好的评估基准,就是识别准确率,而这项 指标在9 0 年代中后期得到提高,比较有代表性的有:m m 公司推出的v i a v o i c e 和d r a g o ns y s t e m 公司的n a t u r a l l ys p e a k i n g ,n u a n c e 公司的n u a n c ev o i c ep l a t f o r m 语音平台,m i c r o s o f t 的w h i s p e r 和s u n 的v o i c e t o n e 等。 其中,i b m 公司推出的嵌入式v i a v o i c e 系统标志着非特定、人大词汇量连 续语音识别的实用化,也是目前市场上的主流产品【1 4 】。v i a v o i c e 系统可以理解 1 4 种语言,以前曾用于智能手机、个人数字助理和其他汽车系统。先锋公司也 在新型号a v i c h d l b t 卫星系统控制台中采用m 这项技术。作为语音识别软 件系列的产品,它可以使p c 、手提设备、汽车系统和自动客户服务系统之间的 信息交流变得轻松快捷。作为第一个全功能的语音指令桌面程序,运行在 w i n d o w s 下的v i a v o i c e 支持m i c r o s o f to m c e2 0 0 3 ,为不同要求的用户提供了精 确的语音识别技术。v i a v o i c e 识别率可达9 5 以上,使用便利,特别适合于起草 文稿、撰写文章、和准备教案,是文职人员、作家和教育工作者的良好助手。 v i a v o i c e 还提供了若干特殊的“主题 来帮助你进一步提高对专有名词的识别准 确度,它可以使v i a v o i c e 的引擎对这些主题下的特殊词组给予重点注意。m m v i a v o i c ef o rw i n d o w sr e l e a s e10p r ou s be d i t i o n 是语音应用的良好选择,它采用 了新的引擎,能够更好地去除背景噪音,此外还带有效果出色的立体声u s b 麦 克风。在这一版本中,m m 更多地把注意力集中到了提高语音识别的准确性上, 而没有花太多力气去实现通过语音来操作p c 。v i a v o i c e 提供了几个新的向导程 序,同时也对以前的向导程序作了改进,从而改善了软件的易用性。其识别向导 浙江大学硕士学位论文 第1 章绪论 可以很好地帮助你解决声音或其它方面的疑难。新的v o i c e c e n t e r 工具条上还提 供了应用程序菜单,并可在工作区的任意位置浮动显示。在测试中,标准发音 的听写可以产生非常好的结果。在经过几小时的使用之后,就能达到9 5 到9 8 的识别准确率( 根据文档的复杂程度不同会有所差别) 。与其它语音识别系统 一样,它能够不断学习和适应用户的特定语音,并不断提高识别的准确。 s p e e c h w o r k s 公司是世界领先的电话自动语音识别系统( a s r ) 解决方案的 提供者,其代表产品为s p e e c h w o r k s 6 。利用该产品,用户可以通过电话用自然 语言与系统进行交互,进行旅游预约、股票交易、银行服务、订票服务、宾馆服 务和寻呼服务等,由于系统是自动的,无需服务人员的介入。目前市场上还出现 了语音识别电话、语音识别记事本等产品。 在小词表语音识别领域中,各公司也纷纷推出了单片的语音识别系统,其中 较为典型的是美国s e n s o r y 公司的语音识别芯片r s c x6 4 系y d ;各种电子产品上 也加入了语音识别的功能,如p h i l i p s 和三星的手机即加入了特定人人名识别的 功能。 我国语音识别研究工作起步于五十年代,但近年来发展很快,研究水平也从 实验室逐步走向实用。从1 9 8 7 年开始执行国家8 6 3 计划后,国家8 6 3 智能计算 机专家组为语音识别技术研究专门立项,每两年滚动一次。我国语音识别技术的 研究水平己经基本上与国外同步,在汉语语音识别技术上还有自己的特点与优 势,并达到国际先进水平。其中,具有代表性的研究单位是清华大学电子工程系 与中科院自动化研究所模式识别国家重点实验室。 由清华大学电子工程系语音技术与专用芯片设计课题组研发的非特定人汉 语数码串连续语音识别系统,识别精度达到了9 4 8 ( 不定长数字串) 和9 6 8 ( 定长数字串) 。在有5 的拒识率情况下,系统识别率可以达到9 6 9 ( 不定长 数字串) 和9 8 7 ( 定长数字串) ,这是目前国际上最好的识别结果之一,其性 能已经接近使用水平。研发的5 0 0 0 词邮包较核非特定人连续语音识别系统的识 别率达到9 8 7 3 ,前三选识别率达9 9 9 6 ,并且可以识别普通话与四川话两种 方言,达到了实际应用的要求。 中科院自动化所及其所属模式科技( p a t t e k ) 公司2 0 0 2 年发布了他们共同 推出的面向不同计算平台和应用的“天语”中文语音系列产品巾a t t e l a s r , 6 浙江大学硕士学位论文第1 章绪论 彻底结束了中文语音识别产品自1 9 9 8 年以来一直由国外公司垄断的历史。 1 2 3 语音识别的发展趋势 语音识别技术是目前世界上最热门和最具有发展前景的技术之一。从某种意 上说,语音识别是将计算机变成真正的“智能化”设备的最佳途径。语音作为当 前通讯系统中最自然的通信媒介,随着计算机和语音处理技术的发展,不同语种 之间的语音语音翻译将成为语音研究的热点。自然语音数据库的设计;语音 特征的提取;利用语音料库进行声学模型训练的研究;适应说话人声学模型的研 究;语音识别算法的研究;语言翻译和对话处理的研究等成为语音技术的热点方 向。语音识别研究的另一个发展方向是人体语言与口语相结合的多媒体人机交 互。目前这种采用声觉和视觉两种信息融合进行识别的研究在全球范围内己经展 开,成为语音识别研究的重要发展方向和研究热点之一。 曾有一位业界的资深人士对产业发展的提出的八大预言,其中之一即为: 语音成为新人机界面。语音识别技术的成熟使人机界面发生革命性突破,网络时 代用户需要更自然、更简单、更方便的以语音为中心点的人机界面。未来五年里, 真正实用的语音识别和音字转换技术将首次走出实验室,走进千家万户的电器设 备中。摩尔定律所预言的硬件产品奇迹般的更新速度使计算机处理复杂运算的能 力突飞猛进,也使体积庞大的语音库有机会栖身于普通用户的硬盘或其他存储介 质上:技术方面,新的语音统计算法日趋成熟:市场需求方面,简化p d a 、移动 电话和其他信息家电原本繁琐的操作步骤的最佳途径便是通过语音技术。 另外,语音识别是一门交叉学科,语音识别技术关系到多学科的研究领域, 在不同领域上的进步都会促进语音识别的发展。( 1 ) 物理学:声音产生与传播原 理、声电转换以及声音在房间回响等相关知识。( 2 ) 生理学:有关人的声道与耳 朵的生理结构、耳朵的听觉特征,在脑内高层的语言处理等。( 3 ) 统计学和模式 识别理论:基于各种统计方法对模式进行匹配,以及建立有关的统计模型,对语 音特征参数进行估值和分类。( 4 ) 信息理论和计算机科学:各种算法的研究、快 速搜索查找匹配的方法。( 5 ) 语言学:有关人的语言产生、感觉方面的知识。( 6 ) 数字信号处理技术:信号的时域分析、噪声消除、数字滤波、线性预测等方面的 知识。( 7 ) 微电子技术:超大规模集成电路( v l s i ) 技术的发展对语音识别的 7 浙江大学硕士学位论文 第1 章绪论 具体应用有很大的影响,v l s i 使语音识别系统商品化成为可能。 1 3 语音识别的分类 语音识别系统按照不同的角度、不同的应用范围、不同的性能要求会有不同 的系统设计和实现,也会有不同的分类。一般语音识别系统按不同的角度有下面 几种分类方法。 1 3 1 根据语音类型 根据被识别的语音类型来划分,一般可以分为: ( 1 ) 孤立字( 词) 识别( i s o l a t e dw o r dr e c o g n i t i o n ) 对字、词、短语或者命令等语音单元进行建模,并且在识别的时候,被识别 的语音也是这些字、词、短语或者命令中的某一个。 ( 2 ) 连接词识别( c o n n e c t e dw o r dr e c o g n i t i o n ) 连接词识别一般特指十个数字( o 一9 ) 连接而成的多位数字识别或由少数指 令构成的连接词条的识别。构建模型时,不但可以识别建模时词汇表中所有的“词 汇”,而且还可以识别这些“词汇”中间的几个( 一般只有两三个) “词汇”的组 合。例如:词汇表为“0 到“9 ”十个数字,在识别时可以识别单个的数字“1 , 也可以识别简单的数字串“1 2 ”、“1 2 3 ”等等。 ( 3 ) 连续语音识别( c o n t i n u o u ss p e e c hr e c o g n i t i o n ) 对于连续语音识别,不论建模时采用的是孤立词表还是连续语音,关键是在 识别时被识别的语音己经不仅仅是几个词的连接了,而是词汇表中的词汇不间断 地连续输入,识别系统是对这一连串连续的语音的在线识别,因此对于连续语音 识别而言,一般都会对识别速度有所要求。 ( 4 ) 会话语音识别( c o n v e r s a t i o n a ls p e e c hr e c o g n i t i o n ) 有时也称连续语言识别与理解,是在语音识别的基础上,用语言学知识来推 断语音的含义。对于这种识别,用于建模的词汇量比较大,被识别的语音是一些 完整的句子。在识别过程中,不必完全地识别出语音内容,只需要理解语句的意 思,它是更高一级的语音识别。当然理解是在能够识别句子中的关键词汇为基础 的,然后才能根据语言学知识来推断语音的含义。 浙江大学硕士学位论文第l 章绪论 1 3 2 根据语音词汇量大小 每个语音识别系统都有一个词汇表,系统只能识别词汇表中所含的词条。根 据词汇表可以将语音识别分为有限词汇识别和无限词汇识别两种: ( 1 ) 有限词汇识别 这一类又可以按词汇表中识别单元( 字、词或短语) 的个数而分为小词汇量 识别( 词汇量小于1 0 0 ) 、中词汇量识别( 词汇量在1 0 0 和1 0 0 0 之间) 和大词汇 量识别( 词汇量在1 0 0 0 词以上) 。一般而言,随着词汇表中词汇量的增多,各词 汇量之间的混淆性增加,系统的实现变得更加困难,系统的识别率也会降低。 ( 2 ) 无限词汇识别( 全音节识别) 当识别单元为可以发音的所有情况时,它的词汇量也就大得无法计量了,因 此称其为全音节语音识别。全音节语音识别被认为是实现无限词汇或中文文本输 入的基础。 1 3 3 根据说话者的依赖程度 语音识别系统根据对说话者的依赖程度可以分为以下两种: ( 1 ) 特定人语音识别系统( s p e a k e rd e p e n d e n t ) 特定讲话人的语音识别比较简单,能得到较高的识别率,但使用前必须由特 定人的用户输入大量的发音数据、对其进行训练。在建模时,使用者必须按照词 汇表中的每个字、词或短语,在识别时系统也只适应被训练的这个人建立自己的 标准模板,对于其他人,需要重新建立自己的标准模板。m m 的v i a v i o c e 就类 似于这种情况,所不同的是对于其他人而言,v i a v i o c e 系统不是完全重新建立一 个标准模板,而是通过调整己有模板的部分参数来适应当前说话人的特点,但最 后的目的还是要重新建立一个该说话人的标准模板,因此它应归属于特定人的语 音识别,而不是非特定人的语音识别。 ( 2 ) 非特定人语音识别系统( s p e a k e ri n d e p e n d e n t ) 非特定人识别系统通用性好、应用面广,但难度也较大,不容易得到高的识 别率。在建模时,标准模板是由指定的某一范畴的说话人( 如说标准普通话) 中 的一部分或几个人通过训练而产生的,而在识别时的使用者可以是参加训练的发 音人,也可以是未参加训练的同一范畴的发音人( 如同是说标准普通话的人) 。 9 浙江人学硕士学位论文第l 章绪论 非特定说话人识别系统通用性好、应用面广,但难度也较大,不容易得到高的识 别率。 不同的语音识别系统,虽然具体实现细节有所不同,但所采用的基本技术相 似。一个典型语音识别系统的实现过程如图1 1 所示。 图1 1 语音识别系统框图 1 4 语音识别的问题和困难 果输出 作为高科技应用领域的研究热点,语音识别技术从理论的研究到产品的开发 已经走过了半个世纪并且取得了长足的进步,它正在直接与办公或商业系统的数 据库语音查询、数据库维护与管理、语音输入,工业生产部门的语声控制,电话 与电信系统的自动拨号、辅助控制与查询以及医疗与卫生部门的专业报告的语音 创建与编辑等各种实际应用相接轨,并且极有可能成为下一代操作系统和应用程 序的用户界面。在1 9 9 7 年有人提出,“语音时代”已经来临,商家也都对此充满 ,了信心:希望语音识别能力能跟人一样。语音识另i j 技术变得如此受欢迎,让人不 得不相信,语音技术将无处不在。然而,事实并非如此。目前的语音识别技术研 究水平还远远不能达到使计算机与人类之间能够自然交流的这个终极目标,甚至 曾有专家比喻其难度要超过“人类登上月球 。可见虽然实用语音识别技术的研 究是一项极具市场价值和挑战性的工作,但其存在的问题和困难是不可低估的。 主要表现在: ( 1 ) 鲁棒性:目前的语音识别系统对环境条件的依赖性强、适应性差,要 求保持测试条件和训练条件一致,否则系统性能将会严重下降。 ( 2 ) 噪声问题:现有的语音识别系统大多只能工作在安静的环境下,一旦 在噪声环境下工作,识别率会急剧下降,这是因为此时人的发音变化很大,比如 声音变高、语速变慢、音调及共振峰变化等等,这就是所谓l o m b a r d 效应,必 须寻找新的信号分析处理方法。现在也有很多关于去噪方面的研究,常用抑制噪 声的方法,可以概括为四个方面:谱减法、环境规整技术、不修正语音信号而是 l o 浙江大学硕士学位论文 第1 章绪论 修正识别器模型使之适合噪声、建立噪声模型。 ( 3 ) 语音识别基元的选择:如何根据存贮空间和搜索速度的要求,选择合 适的识别单元,如字、词、音节、音素。一般来讲,要识别的词汇量越多,所用 的基元应越小越好。如何能够构建更好的语音发音模型也是一个关键问题,需要 深入地研究。 ( 4 ) 端点检测:研究表明,即使在安静的环境下,语音识别系统一半以上 的识别错误来自端点监测器。提高端点检测技术的关键在于寻找稳定的语音特征 参数。 ( 5 ) 语音的模糊性:说话者在讲话时,不同的语词可能听起来很相似。而 这一点不论在汉语中还是在英语中都是常见的现象。 ( 6 ) 韵律信息的利用:韵律信息指的是说话之中的重音、语调等超音段信 息。实验表明,人可以从说话的静律中获取很多重要信息。但目前的语音识别系 统却忽略了韵律信息。因此,如何结合韵律信息来进行语音识别还有待于进一步 的研究。 ( 7 ) 知识的运用:语言学、生理学、心理学方面的研究成果已有不少,但 如何把这些知识量化、建模并用于语音识别,还需研究。而语言模型、语法及词 法模型在中、大词汇量连续语音识别中是非常重要的。 ( 8 ) 商品化的具体问题:语音识别系统从实验室演示系统到商品的转化过 程中还有许多具体问题需要解决,识别速度、拒识问题以及关键词( 句) 检测技 术( 即从连续语音中去除诸如“啊 、“唉 等语音,获得真正待识别的语音部 分) 等等技术细节要解决。 除了以上语音识别系统共有的难点外,汉语数目字因为具有以下一些特点, 造成识别率偏低: ( 1 ) 音节少:根据表1 1 我们可以看到,与英语数字相比,汉语数字音节 偏少,语音之间相似程度比较大,从而造成汉语数目字语音的混淆度比较高,特 别当一些元音成为连续语音时这个问题更加突出。而语音混淆程度能在很大程度 上决定语音识别的困难程度,并且直接影响识别的结果。 浙江大学硕士学位论文第1 章绪论 表1 1 中英文数字音节比较 数字 英语英语音节数汉语发音 汉语音节数 oz e r o4 l i n g 3 1o n e3y i1 2t w o 2 e r 1 3t l l r e e3s a n3 4f o u r2s i2 5f i v e 3纾么1 6s i x 3 l i u3 7s e v e n4 q i 2 8 e i g h t 2b a2 9n i n e 3 j i u 3 平均 2 92 1 ( 2 ) 方言特征:由于汉语具有多方言的特性,所以即使采用普通话系统, 口音仍然保留有各地方言,很大程度上增加了语音识别的苦难。 1 5 本文的主要工作及创新点 本文主要以语音识别与神经网络的基本理论为基础,研究了基于b p 神经网 络的语音识别问题。对语音识别的过程进行了系统的研究,提出了基于m f c c 与l p c c 混合参数的语音识别方法,并且构造了相应的语音识别模型与算法,对 b p 神经网络进行了优化,设计编写了语音识别实验平台,并对系统的识别性能 进行了比较和分析。 本文的主要工作主要表现在以下方面: 首先,对语音信号的各种特征参数进行了深入的分析,包括线性预测系数 ( l p c ) 、线性预测倒谱系数( l p c c ) 、m e l 频率倒谱系数( m f c c ) ,为语音识 别的特征提取提供理论支持。 其次,对语音识别的关键环节语音端点检测进行了深入研究,在孤立词的端 点检测的基础,研究编写了连续语音的端点检测程序,为连续语音识别提供了条 1 2 浙江大学硕士学位论文 第1 章绪论 件。 最后,借助g u i ,设计了语音识别实验平台,将信号的特征参数提取显示、 端点检测、语音样本训练和语音识别等功能集成在平台,方便语音识别的分析处 理。 通过实验,对本文所使用到的各种语音识别模型进行了仿真计算,对其识别 性能作了比较,并对影响语音识别的因素作了综合分析。 1 6 本文的研究内容安排 本文安排如下: 第一章,绪论。结合国内外研究的现状和发展趋势,介绍了语音识别的定义、 历史、主要技术与遇到的困难。 第二章,语音识别的基本原理与技术。详细介绍了语音识别的各个处理环节, 包括预处理、特征提取与识别算法等。对本文所涉及到的几种特征参数的算法作 了详细的介绍。这一章还介绍了几种常用的语音识别算法,如动态时间规整 ( d t w ) 、矢量量化( v q ) 、隐马尔可夫模型( h m m ) 等。 第三章,讨论了神经网络的基本原理及其在语音建模及匹配中的应用,提出 了本文的建模匹配方法,比较了本文方法和传统方法的区别。 第四章,仿真计算及结果分析。对本文提出的语音识别方法进行了实验分析, 将本文所涉及的几种语音识别方法进行了性能分析比较,也讨论了影响语音识别 性能的各种因素,如特征参数、神经网络设计原则等。 第五章,总结与展望。总结了全文的主要工作,给出了结论,并讨论了今后 的研究设想与挑战。 1 7 本章小结 在本章中,我们首先介绍了语音识别的概念和重要意义,然后简要介绍了语 音识别的发展历史和现状。然后我们介绍了语音识别的不同分类方法,以及模板 匹配法、随机模型法和概率语法分析法和基于神经网络的方法等技术,并提出了 当代语音识别研究的主要困难。另外,我们还列出了本文的主要研究内容,研究 目标以及文章的组织结构。 浙江大学硕上学位论文第2 章语音识别的基本原理 第2 章语音识别的基本原理 大多数的语音识别系统采用了模板匹配的原理,其处理过程可看成一个框 架,如图2 1 所示。 图2 1 基于模板匹配的语音识别系统结构 果 从上图我们可以看到,在语音识别系统中,输入的语音信号首先要进行预处 理,对信号进行适当放大和增益控制,包括声音的预加重、加窗分帧处理和端点 检测等。在语音信号预处理后,接下来很重要的一环就是特征参数提取。特征参 数有很多种,应根据实际情况选取合适的参数。 在识别之前,首先要进行训练。在训练阶段,将特征参数进行一定的处理之 后,为每个词条得到一个模板,保存为模板库。在识别阶段,语音信号经过相同 的方法得到语音参数,生成测试模板,与参考模板进行匹配,将匹配相似度最高 的参考模板作为识别结果。如果需要,可以在专家知识的指导下,提高识别的准 确率。 2 - 1 语音信号的预处理 语音信号的预处
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026中国细胞治疗CDMO行业监管政策演变与产能扩建可行性研究
- 2026中国物业服务数字化升级与增值业务拓展报告
- 2026中国新能源汽车二手车市场培育与估值体系报告
- 2026年跟痛症诊疗指南考试试卷试题及答案
- 2025届江西省景德镇市浮梁县四年级数学第二学期期末联考试题(含答案)
- 生命活动的调节系统构建与中考应用-初中科学九年级一轮复习教学设计
- 剖宫产术后出血知识试题及答案
- 标准法规培训测评题及答案展示
- 2025届江苏省扬州市江都区大桥片数学四年级第二学期期中检测试题含答案
- 2026年初中成语故事《拾人牙慧》世说新语阅读教案
- 《中华人民共和国生态环境法典》专题全解读课件
- 2026年生态环境局工作人员岗位高频面试题包含详细解答
- 药品质量投诉管理制度培训
- 生物医学新技术临床研究和临床转化应用管理条例
- 管理学基础(经管专业)教案 李镜
- 放射科医患沟通与投诉处理手册
- 甲状腺功能亢进的手术与护理
- 普通高中美术课程标准(2017年版2025年修订)
- GB/T 21558-2025建筑绝热用硬质聚氨酯泡沫塑料
- 生产产品变更流程与管理指南
- 2026年软件定义汽车:SOA和中间件行业研究报告
评论
0/150
提交评论