(计算机软件与理论专业论文)基于前馈型人工神经网络的语音和音乐识别.pdf_第1页
(计算机软件与理论专业论文)基于前馈型人工神经网络的语音和音乐识别.pdf_第2页
(计算机软件与理论专业论文)基于前馈型人工神经网络的语音和音乐识别.pdf_第3页
(计算机软件与理论专业论文)基于前馈型人工神经网络的语音和音乐识别.pdf_第4页
(计算机软件与理论专业论文)基于前馈型人工神经网络的语音和音乐识别.pdf_第5页
已阅读5页,还剩49页未读 继续免费阅读

(计算机软件与理论专业论文)基于前馈型人工神经网络的语音和音乐识别.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于前馈型人工神经网络的语音和音乐识别 专业:计算机软件与理论 硕士生:刘乔辉 指导教师:欧贵文副教授 摘要 本文提出使用前馈型人工神经网络对连续音频流中纯语音、纯音乐、语音+ 音乐3 类音频进行分类的方法。主要针对两个方面:1 、哪些特征向量可作为分类 的依据以及哪种特征向量会取得最佳识别效果;2 、前馈型人工神经网络的建立、 训练和仿真,并根据已提取的特征向量实现语音和音乐的自动分类。 本文的主要内容包括: 1 、从i n t e r n e t 特色电台实时播放的节目中录制实验数据,包含纯语音、纯 音乐、语音+ 音乐3 类,每类2 2 5 s 。 2 、探讨了各种参数提取方法对分类结果的影响,通过对实验结果的比较, 确认t m f c c 参数作为特征参数时系统将取得最佳识别效果。 3 、介绍了前馈型人工神经网络的特点,并叙述了在m a t l a b6 5 中如何实现 前馈型人工神经网络的建立、训练和仿真,以及利用该网络对纯语音、纯音乐、 语音+ 音乐3 类音频进行分类。 4 、提出了利用l e v e n b e r g w l a r q u a r d t 算法对网络进行训练,并且设立一个确 认集来指示训练的终点,防止无休止的训练使网络过度适应训练集,而对其它数 据有较差的推广能力。 5 、给出了部分m a t l a b 源程序以供参考。 6 、给出了相关图表及数据,分析了本文方法的优缺点。 实验结果表明,本文叙述的方法对纯语音、纯音乐、语音+ 音乐3 类音频文件 取得了平均9 4 的正确识别率。 关键词:语音;音乐;识别:前馈型人工神经网络 s p e e c ha n dm u s i cc i a s s i f i c a t i o n b a s e do nf e e d f o r w a r da n n m a j o r :s o f t w a r ea n dt h e o r yo fc o m p u t e r n a m e :l i uq 5 a o h u i s u p e r v i s o r :a s s o c i a t ep r o f e s s o r o ug u i w e n a b s t r a c t i nt h i sp a p e r ,t h ea p p r o a c h e s ,w h i c hb a s e do nf e e d f o r w a r da r t i f i c i a l n e u r a ln e t w o r k s ,t os p e e c ha n dm u s i cc l a s s i f i c a t i o ni nc o n t i n u o u sa u d i o a r ed e e p l ys t u d i e d t h ew o r kc o n s i s t so ft w oa s p e c t sm a i n l y :1 w h a tk i n d o fa u d i of e a t u r ev e c t o r sc a nb et h eb a s iso fc l a s s i f i e a t i o na n dw h i c ho n e i st h eb e s t :2 t h ec r e a t i n g ,t r a i n i n g ,s i m u l a t i n go f f e e d f o r w a r d a r t i f i c i a ln e u r a ln e t w o r k s ,a n dt h er e a l i z i n go fs p e e c h a n dm u s i c c l a s s i f i c a t i o na e c o r d i n gt h ea u d i 0f e a t u r ev e c t o r s t h em a i nc o n t e n t so ft h i sp a p e ri n c l u d i n g : 1 t h ec o r p u sw a sr e c o r d e df r o mt h er a d i oo nt h ei n t e r n e t i tc o n s i s t s o ft h r e ea u d i od o c u m e n t s :p u r es p e e c h 、p u r em u s i c 、s p e e c h + m u s i c ,w i t h2 2 5 s e a c ho n e 2 t h ee f f e c to fe v e r yp a r a m e t e ro nt h ec l a s s i f i c a t i o na r es t u d i e d t h e r e s u l to fe x p e r i m e n t ss h o w st h a tm f c cp e r f o r m e dt h eb e s t 3 t h ef e a t u r e s o ff e e d f o r w a r da r t i f i c i a l n e u r a l n e t w o r k sa r e i n t r o d u c e d h o wt oc r e a t ,t r a i na n ds i m u l a t et h ef e e d f o r w a r da r t i f i c i a l n e u r a ln e t w o r k sa n dt oc l a s s i f yt h ea u d i od o c u m e n t si nm a t l a b6 5a r e d e s c ri b e d 4 t r a i n i n gt h en e t w o r ku s i n gt h el e v e n b e r g m a r q u a r d ta l g o r i t h mi s p u r p o s e d av a li d a tjo n s e ti se s t a b l i s h e di no r d e rt oi n d i c a t et h ee n d p o i n to ft r a i n i n ga n dt oa v o i de n d l e s st r a i n i n gw h i c hw o u l dm a k e t h e i i n e t w o r ka d a plt h et r a i n i n gs e t ne x c e s sa n dh a sw e a ka b i li t yt oe x t e n d t oo t h e rd a t a 5 p a r t yc o d e so ft h em a t i a b f u n c ti o n sa r eg i v e nf o rr e f e r e n e e 6 d a t aa n dc h a r t sa r egi v e n i nt h i sp a p e r t h ea d v a n t a g ea n d d i s a d v a n t a g eo 。t h em e t h o d sm e n t i o n e di n t h i sp a p e ri sa n a l y z e d t h er e s u ts h o w s :t os p e e c h ,m u s i c ,s p e e c h + m u s i cd o c u m e n t s , f e e d f o r w a r da r t i f i c i a ln e u r a ln e t w o r k sp e r f a r mt e r r i f i c ,t h ea v e r a g e c l a s s j f ic a t i o na c c u r a c yi su pt o9 4 k e yw o r d s :s p e e c h :m u s i c :c l a s s if i c a t i o n :f e e d f o r w a r da r t jf i c i a ln e u r a l n e t w o r k i u 基于前馈型人:i 一神经网络的语音;f l _ 】音乐识别 1 1 研究背景 第1 章引言 随着电台、电视台开展数字化广播,人们可收听的节目越来越多。有的用户 可能喜欢听纯音乐类的节目,语言类节目对于他们来说会是个负担。而有些人可 能恰恰相反。当然,还有些人可能喜欢歌曲、配乐诗朗诵等有音乐背景的节目。 面对种类繁多的节目,用户有选择性收听的要求应运而生,这一要求已经成为了 多媒体应用中的一个技术问题。如何将语音类、音乐类节目与其他类节目区别开 来,是实现这一技术的关键。本文正是基于这一背景展开研究的。 1 2 国内外研究现状、水平和发展趋势 音频自动分类的早期研究工作以文献 1 ,2 为代表。文献 1 训练一种神经元 网络直接将声音类别映射到所标注的文本。文献 2 使用自组织映射 ( s e l f o r g a n i z i n gm a p p i n g ,简称s o m ) 聚类算法对具有相似感觉特征的声音进行 聚类。真正意义上的基于内容的音频自动分类工作是由美国m u s c l ef i s h 公司 e r l i n gw o l d 等人完成的 3 ,他们详细分析了音频的区别性特征,包括响度 ( 1 0 u d n e s s ) 、音调( p i t c h ) 、亮度( b r i g h t n e s s ) 、谐度( h a r m o n i c i t y ) 等,并且根 据最近邻准则( n e a r e s tn e ig h b o r ,简称n n ) 年u m a h a l a n o b i s 距离设计音频的分类 器,所用的数据集包括笑声、铃声、电话声等1 6 类共4 0 9 个样本数据。利用该数 据集,文献 4 - - 6 采用不同的特征和分类器实现音频的分类。其中,文献 4 采 用1 2 阶的m f c c 系数和能量作为音频的特征表示,根据极大互信息准则( m a x i m u m m u t u a li n f o r m a t i o n ,简称m m i ) 训练决策树量化特征空间为离散的区域,并且根 据最近邻准则对音频作分类,文献 5 ,6 分别采用最近特征线( n e a r e s tf e a t u r e l i n e ,简称n f l ) 和支持向量机( s u p p o r tv e c t o rm a c h i n e ,简称s v m ) 作为分类器。 近年来,音频的自动分类在视频的检索和摘要、基于内容的语音检索等相关 领域也日益引起了人们的重视。在视频的检索和摘要中,人们发现简单的视觉特 征,例如颜色、纹理、运动向量等并不能很好地反映视频的内容和结构语义,而 更高级的视觉语义特征的提取则相当困难。因此,文献 7 9 尝试在视频的检索 和摘要中结合音频( 语音、音乐) 、文本( 字幕、标题) 等信息,以克服单纯的视觉 特征语义表达能力较弱这一缺点。文献 1 0 ,1 1 根据音频特征分别训练 o c o n ( o n e c l a s s i n o n e n e t w o r k ) 神经元网络和隐马尔可夫模型( h i d d e n m a r k o vm o d e l ,简称h m m ) 对电视节目作5 种视频场景的分类:天气预报、新闻、广 基于前馈型人i 神经网络的语音雨i 音乐识别 告、足球和篮球。文献 1 2 采用相位补偿g k l l l l n l a 滤波器组提取音频特征,并用于 音频的分割、音乐内容的分折、暴力镜头的检测等方面。 基于内容的语音检索机制有关键词发现( k e y w o r ds p o r t i n g ) 、子词格 ( s u b w o r dh a i t i c e ) 索引和大同汇量连续语音识别3 种形式 1 3 ,但是它们的开 销都比较大,而且检索效果依赖于具体的语音环境。如果首先经过音频的自动分 类以确定所处的浯音环境,则可以提高识别精度和效率。文献 1 4 提出使用能量、 潜熵等作为参数区分语音音乐的方法,取得9 0 的正确识别率。文献 1 5 提出使 用美尔频标倒谱系数、线谱对参数并采用分类建模的方法来区分浯音非语音、 音乐非音乐,并分别取得9 9 5 幂u 9 3 的识别准确率。文献 7 ,1 6 1 7 采用基于 简单决策树的语音音乐多步层次分类方法,即每一步根据一种或者儿种音频特 征及其闺值判定音频所属的类别,分刖取得了9 1 9 、9 0 、8 2 的准确率。文献 1 8 从音频的节奏等出发,对语音、音乐、背景三种音频进行分类,取得9 5 正 确识别率。文献 1 9 提出使用能量、潜熵等作为参数区分语音非语音、音乐 非音乐,并分别耿得9 0 9 # u 8 6 9 的识别准确率。 但是,层次分类模型只能表示均值、方差等统计特性,而音频信号特矸通常 具有时间统计特性 2 1 。例如,音乐中一般都存在揭示主题的韵律或者鼓点,在 语音中,清音和浊音往往交替出现。层次模型对这些特征的识别效果较羞。所以, 仅凭频域特性来识别音频文件,显然有着一定的局限性。人1 神经网络模型是一 个超大规模非线性连续时间自适应信息处理系统,是在现代神经科学研究成果的 基础上提出来的基于判别模型的方法,在一定程度上反映了人脑功能的基本特性 2 1 。通过对人工神经网络进行合理的训练,可以使其具备较强的判别能力。另 外,, v f a t l a b 6 5 提供了一个神经网络工具箱( n e u r a ln e t w o r kt o o l b o x ) ,利用这 个工具箱,可以很方便地运用神经网络的算法来解决问题,而不必理会它的具体 运算过程。因此,本文选择人工神经网络作为分类模型。 1 3 论文工作及内容安排 论文的1 二作是进行连续无限制音频流中语音和音乐识别方法的研究,并实现 一个基于前馈型神经网络的语音和音乐自动识别系统。所谓连续无限制指的是: 1 ) 对说话方式、说话人或乐器的种类没有限制:2 ) 对语音或音乐的内容没有限 制,语音或音乐是以连续的、完全自然的方式发出的。 本文做了如下的工作: ( 1 ) 对特征参数的提取和选择疗法进行了研究,对不同的特征参数进行了大 量的统计分析和比较实验,确定了m f c c 参数作为音频文件的特征参数。 ( 2 ) 研究和比较了各种语音识别模型,提出了基于前馈型神经网络的i _ 【 别模 牙u ( f e e d f o r w a r da n n ) 。 基于前馈到人一i :神经网络的语音和音乐识别 ( 3 ) 其中对训练周期的控制方法确认集方案对解决训练饱和问题有很好 的效果。 整个语音识别系统的流程如图卜l 所示。 i网络模型j t f 捉取m f c c 参1 - 蜮h 默蜘l _1 数 j 预处到 图卜1 整个语音识别系统的流程 本文篇章是这样安排的:第二章介绍语音分类的基本理论;第三章介绍音频 特征提取和选择;第四章介绍神经网络的选取;第五章介绍识别与分类;第六章 介绍实验数据与结果:第七章进行工作总结和展望。 基丁前馈型人1 :神经网络的语音丰音乐识别 第2 章语音分类基础理论 2 1 语音分类的概念 让机器听懂和辨别人类的语音,这是人们长期以来梦寐以求的事情。语音 分类是一一门交叉学科,关系到多学科的研究领域,不同领域上的研究成果都对 语音分类的发展作出了贡献。语音与音乐分类技术就是让机器通过分类和理解 过程对语音与音乐信号进行分类的高技术。 h 算机语音分类过程与人对语音分类处理过程基本上是致的。目前主流 的语音分类技术是基于统计模式分类的基本理论。一个完整的语音分类系统可 大致分为三部分: ( 1 ) 语音特征提取:目的是从语音波形中提取随时间变化的语音特征序列。 ( 2 ) 声学模型与模式匹配( 分类算法) :声学模型是分类系统的底层模型, 并目是语音分类系统中最关键的一部分。声学模型通常由获取的语音特征通过 训练产生,目的是为每个发音建立发音模板。在分类时将未知的语音特征同声 学模型( 模式) 进行匹配与比较,计算未知语音的特征矢量序列和每个发音模 板之间的距离。声学模型的设计和语言发音特点密切相关。声学模型单元大小 ( 字发音模型、半音节模型或音素模型) 对语音训练数据量大小、系统分类率 以及灵活性有较大影响。 ( 3 ) 语义理解:训算机对分类结果进行语法、语义分析,明白语言的意义 以便作出相应的反应。通常是通过浯言模型来实现。 2 2 语音分类的应用 语音和音乐分类过程实际上是一种认识过程。就像人们听语音时,并不把 语音和晤言的语法结构、语义结构分开来,因为当语音发音模糊时人们可以用 这些知识来指导对语言的理解过程。对机器来说,分类系统也要利用这些方面 的知识,只是鉴于语音和音乐信号的多变性、动态性、瞬时性,语音与音乐分 类技术与人类的大脑还有定的差距。因此在语言分类技术选择及其应用模式 和系统开发上,都需要专业的设计和调试,以实现最好的应用效果。 1 9 9 6 年9 月,c h a r l e ss c h w a b 开通了首个大规模商用语音分类应用系统: 股票报价系统。该系统有效地提高了服务质量和客户满意度,并减少了呼叫中 心的费用。不久,s c h w a b 又丌通了语音股票交易系统。 基于前馈型人工神经网络的语音和音乐识别 美圉主要电信运营商s p r i n t 的p c s 部门以卓越和有创新的客户服务著称。 2 0 0 0 年,该公司为客户开通了语音驱动系统,提供客j j 服务、语音拨号、查号 和更改地址等业务。2 0 0 1 年9 月开通的可以自然方式对话的咨询系统,更实现 了以自然、开放的询问方式实时获得所需要的信息。 b e l c a n a d a ,加拿大最大的电信运营商,也拥有多个语音驱动系统,提供 从客户服务、增值业务到资讯服务等多种功能。这些系统不但减少了用户的投 诉,也为无线网络服务增值,增强了客户的忠诚度并开辟了新的收入来源。 仔细分析这些案例不难发现,一个成功的语音应用首先是基于详细准确的用 户需求调查。只有详细了解客户需求,才能根据需要选用不同类型的产品。目 前市场上的语音识别产品基本可分为2 种: 特定人月 特定人:是按照声学模型建立的方式来划分的。特定人识别的声 学模型是针对某一特定用户训练的。一般来说用户需要先训练系统,然后爿能 识别该用户的发音。而非特定人识别的声学模型是针对某一种特定的语言来训 练的,发音人不需要训i 练即可使用。虽然在建立模型时需要大量的语料,对用 户来说却提供了更大方便,他们甚至不需要了解该过程。 嵌入式服务器模式:嵌入式是将语言识别软件及模型,写在设备( 如手机) 的存储器里,识别过程在终端完成。在服务器模式中,终端只负责收集和传导 语音信号,由服务器负责完成识别。因此,对于大规模,多用户和有大量识别 需求的系统,服务器模式提供了有效的方式。 目前运营商和企业用户的需求多数适合采用非特定人服务器模式的服务。 例如上面提到的c h a r l e ss c h w a b 、s p r i n t p c s 和b e l lc a n a d a 都选用了 n u a n c ec o m m u n i c a t i o n s 提供的语音识别软件。加之专业的系统集成方案及 n u a n c e 技术服务所提供的良好的语音用户界面设计和后期优化,使得应用系统 获得了很高的客户满意度,在很多方面超过了接线员。 2 3 语音分类的相关技术 在语音识别应用领域,有许多相关技术直接影n 向着客户的最终体验并关系 到应用系统的使用效果,也就是自动化率( a u t o m a t i o nr a t e ) ,即系统毋须人 工干预独自完成的比例。例如端点检测及相关问题、噪音环境下的语音处理、 系统结构、对口音的适应性及语音界面的设计,都是语音分类整体应用系统需 要考虑的。 m i c r o s o f t 研究和开发语音技术已经十年有余了。1 9 9 3 年,它雇佣了 x u e d o n g ( x d ) h u a n g 、f i la 1 l e v a 和m e i y u hl l w a n g 一他们是负责c a r n e g i e m e l i o nu n i v e r s i t ys p h jn x i i 语音识别系统的四个人中的三个,该系统因其空 前的准确性于1 9 9 2 年即受到语音界的广泛赞誉。正是从那时开始,随着s p e e c h 基丁前馈型人嚼十经网络的语音剥音乐识月0 a p i ( s a p i ) 1 0 小组在1 9 9 4 年成立,m i c r o s o f t 志在创建一种允许开发人员 通过强大的a p i 访问的准确的语音技术。该小组在不断成长,在过去的这些年 中,他们已经发布了一一系列功能日益强大的语音平台。 基丁前馈型人一l 神经网络的语音和音乐识别 第3 章音频特征参数提取方法 音频压缩和i n t e r n e t 媒体流( m e d i as t r e a m i n g ) 技术的发展,推动着各种基 于i n t e r n e t 的音频应用逐步走向实用。但是,由于原始音频数据除了含有采样 频率、量化精度、编码方法等有限的注册信息外,本身仅仅是一种非语义符号表 示和非结构化的二进制流,缺乏内容语义的描述和结构化的组织,因而音频的识 别、检索和内容过滤等应用都受到极大的限制。如何提取音频中的结构化信息和 内容语义,使得无序的音频数据变得有序,是基于内容的音频检索技术能否得以 实用的关键所在。 本章将从信号处理的角度去分析各类音频文件的特点,并阐述了m f c c 参数 的优越性。 3 1 三类音频的波形 语音、音乐、语音+ 音乐是电台的三种主要信号,它们的波形有比较大的差 别。 本文所用的音频文件是从w i n d o w sm e d i ap l a y e r 的“收音机调谐器”一栏 里的网上电台中录下的。录音工具采用c o o le d i tp r o2 i 。我分别从3 类节目 中抽取出了l 段音频( 5 1 2 个采样值) ,然后利用m a t l a b6 5 提供的w a v r e a d 函 数和p l o t 函数,读取并绘制了3 类音频文件的波形,见图3 1 至图3 - 3 。 4 , l 一l li i f 啊1 y 1 l - 005115225335 x ,0 图3 1 语音音频的波形 , 明 叫 蛇 。 叩 睢 o 基丁前馈型人瞎十经网络的语音利音乐识别 00 51152 2 5335 x 1 0 5 图3 - 2 音乐类音频的波形 图3 3 语音+ 音乐类型音频的波形 x ,0 5 由图可见,各类音乐的波形有其自己的特征。例如,语音类音频由于其成分 为语音,因此其波形具有变化大、高频成分较多等特征;音乐类音频的波形比较 平滑、高频成分很少;语音+ 音乐类旨频波形的特征是:高频成分能量较强,波 形有一定的走势,较容易看出语音成分。这些特征容易被人u 别,在计算机上也 只需要根掘基本的信号特征便可将它们分类。 踮 啦 。 舢 舢 舶 舶 吡 。 衄 州 舶 舶 基丁前馈型人一:神经网络的语音和音乐识别 3 2 特征参数概述 特征提取与选择是浯音识别的一个重要环节。特征提取解决时域语音信号的 数字表示问题,而特征选择则通过选取有效的特征为模式识别部分提供数据。特 征提取与选择的好坏直接影响到识别器的性能。 语音信号的特征主要有时域和频域两种。时域特征如短时平均能量、短时平 均过零率、共振峰、基音周期等;频域特征有线性预测系数、傅立叶频潜等。现 在还有结合时问和频率的特征,即时频谱,充分利用了语音信号的时序信息。 倒谱( c e p ) 是语音信号的又一个特征,目前有基于线性预测分析( l p c ) 的倒浩 即l p c c ,有基于m e l 频率弯折的倒谱即m f c c 。 基于听觉模型的特征参数提取,如感知线性预测( p l p ) 分析,试图从不同于 声道模型的另一个方面进行研究。 所有这些特征都只包含了语音信号的部分信息。为了充分表征语音信号,人 们尝试综合各种特征,并取得了一定的效果。但由于目前语音识别分类器的限制 和数学模型描述的局限性,人们还不能充分利用已有的部分信息,于是特征的变 换与取舍、特征时序信息的使用等成了重要的研究课题。 本文针对上述问题进行了讨论,对一些特征参数进行了比较实验,在分析的 基础上对特征参数进行了选择。 3 3 语音帧短时分析和基本特征参数 虽然语音信号是非平稳信号,但在一个小的时段内具有相对的稳定性,因此 在对语音信号进行分析时,我们总是假定语音信号在一个时间帧( f r a m e ) 内是平 稳信号,这就是语音信号的短时分析假设。通常一帧大约为2 0m s 左右。对一 帧信号通过加h a m m i n g 窗、h a n n i n g 窗或矩形窗后再进行特征分析就可以得到 相应的一组特征,然后通过把分析窗移动一个偏移( 称为帧移f r a m e s h if t ,通 常为一帧的l 2 或1 3 ) 后进行下一帧的处理。实践证明这种短时平稳的假设是 有效的 2 2 j 。 3 3 1 时域参数 每一帧信号所对应的时域参数包括短时平均能量等 时平均能量为: 瞅,= 专舸 其中第t 帧语音的短 ( a - 【) 基于前馈型人1 神经刚络的语音利音乐识别 或: f n g ( t ) = 亩酗( n ) i ( 3 - 2 ) 其中为分析窗的宽度,s t m ) 表示第f 帧中篼门个点的信号样值。短时平 均过零率( z c t ,z e r o c r o s s i n g r a t e ) 为: z c r ( o = 罗争跏( s ( n ) s ,( n 一1 ) ) + 1 】 ( 3 3 ) 其巾符号群i 数定义为: s g n ( x ) = l1 一, x 1 ,x 。0 。 ( 3 4 ) 目前,时域参数( 能量和过零率) 多用在语音的预处理上,如端点检测、判断 语音的歼始与结束。也有人把它作为模型参数进行使用,但都进行了归一化处理。 而能量的使用多利用其对数值或把能量的包络作为参数使用。多数研究者认为, 由于各人特点和不同环境会造成能量和过零率的很大变化,不宜直接使用。 时域的另外一个参数是基音周期,这个参数对汉语尤为重要。i b m 在其语音 听写机系统中,把基调( p i t c h ,与基音周期互为倒数) 当作一个随帧号变化的瞬 时特征参数,稚为t o n e m e 2 6 。出于没有使用绝对值而是使用变化包络,因此 效果颇佳。 以别基元( 音素、音节、字或词等) 的驻留时间( 音长) 是另外一个时域信息。 对它的使用大多是对其概率分布进行离散捕述 2 7 ,2 8 ,通过强制最小状态驻留 来利用驻留信息。然而,语音的长短变化是很大的,因此分布律描述方法不能对 说话语速有很好的适应性 2 9 。我的观点是,以均匀分布( 矩形窗) 代替分布律描 述,辅以后续处理中的搜索算法,可达到充分利用的目的。 3 3 2 频域参数 3 3 2 i 线性预测系数( l p c ) 信号模型的逼近过程本质上是个线性预测曝差滤波问题,它的传递函数a ( z ) 由下式确定: p a ( z ) = 卜x a i z l ( 3 - 5 ) 一 = 1 之的输出e ( n ) 与输入s ( n ) 满足关系: p e ( r - ) 2 s ( n ) s ( n ) 2 s ( n ) 一d 。j ( n 一) j = l ( 3 6 ) 其中s ( n ) 是线性预测值,“,是线性预测系数,e ( n ) 是线性预测误差。线性预测分 析就是求解线性预测系数d ,理论上常用均方误差e e2 ( n ) 最小的准则来求解。 令s ( f i ) 的自相关序列为: 基于前馈型人一l 。神经网络的语音和音乐识别 r ( j ) = e s ( n ) s ( n j ) ( 3 7 ) 得到尤勒一沃尔克( y u e w a l k e r ) 方程: a ,= j r ;1 r ; ( 3 - 8 ) 又令: e p = e p 2 ( h ) k = e e ( n ) ( s ( n ) 一口s ( n f ) ( 3 9 ) 组合式( 3 8 ) 、( 3 9 ) 可得到: 爿 尺,+ - 。 ! 爿, 2 孑9 ( 3 - 1 0 ) 这是完整的、针对平稳信号的线性预测误差滤波器求解方程式。 m a t l a b6 5 提供了l p c 函数,该函数对上述方程式运用经典算法:莱文逊一 德宾( l e v i n s o n d u r b i n ) 算法来求解,这是一个快速算法。该算法假定声音信号 序列s ( n ) 在间隔o n n 一1 以外等于零。该函数的调用格式为: ag = l p c ( x ,n )( 3 一1 1 ) g 是滤波器增益,在运算结果中反映出很小的虚部,所以要用r e a l 函数去 除它。值得一提的是,上述算法中,线性预测系数a 是一个p + l 元数组,其中第 一个数为l ,第二个数开始才是真正的线性预测系数。 3 3 2 2 快速傅立叶变换( f f t ) 在信号处理中,离散傅立叶变换d f t 具有举足轻重的地位,信号的相关、滤 波、谱估计等都要通过离散傅立叶变换来实现。然而,当n 很大时,求一个n 点 的d f t 要完成“nxn 次复数乘法和n ( n 一1 ) 次复数加法,其计算量相当大。1 9 6 5 年库利( j w c o o le y ) 和图基( j w t u k e y ) 巧妙地利用w ,因子的周期性和对称性, 构造了一个f f t 算法。目前常用的f f t 算法是基一2 算法和分裂算法。其中基一2 f f t 算法为: 其中,。= e ”。 具有n 个采样值的信号经过f f t 后,得到n 个复数,设其形式为 = 口。+ i b : ( i 2 0 ,1 ,n - 1 ) ,则很容易得到对应频率的幅度q 和相角竹: 巴:lfl = 口2 + 6 2 ( 3 1 3 ) 妒,= t a n 。1 兰( 3 - 1 4 ) a 由于语音和音乐的分类依据之一是不同音频信号在各个频段的能量大小的 区别,所以通常用幅度谱来近似地描述这一特征。 哪 一 渺 秽 蒙 琊 州 基1 j 前馈型人1 神经嘲络的语音利音乐识别 3 3 3 倒谱参数( c e p ) 倒谱( c e p s t r u m ,简称倒谱或c i ;p ) 参数是重要的语音特征参数,它是对语音 进行同态处理的产物。处理过程用公式表示为 3 0 j : c e p q ) = d f t 。r l n d f t ( f r a m e ( t ) 1 1 ( 3 15 ) 其中尼彻e ( f ) 表示第t 帧语音,例7 ( ) 和d f t 。( ) 分别表示离散傅立叶 变换和离散傅立叶逆变换。从公式可以看出,倒谱参数c k p ( 幻表现了时域特征, 但由于进行了同态分析,因此只需要很少的前几阶就可以包容语音信号的大部分 信息,起到了数据压缩的效果。 倒潘分析一殷有两种方法:基于线性预测编码( f 。p c ) 的倒谱分析和基于m e l 频率弯折的倒谱分析。 3 3 3 1 基于l p c 的倒谱系数l p c c 该特征是基于声音信号为自回归信号的假设,利用线性预测分析获得倒谱 系数。由l p c 可以推导出声音信号的倒谱l p c c 与l p c 系数之间的关系: h i, c w 。( h ) = c m ( n ) + 坐c 。0 一i c ) c l 。c ( k ) ( 3 1 6 ) 届n 根据同态处理的概念和语音信号产生的模型,语音信号的倒谱c ( n ) 等于激 励信号的倒谱e ( n ) 与声道传输函数的倒谱h ( n ) 之和。通过分析激励信号的语音特 点以及声道传输函数的零极点分布情况,可知e 伽) 的分布范围很宽,c ( n ) 从低时 域延伸到高时域,而h ( n 1 主要分布于低时域中。我们知道,语音信号所携带的语 义信息主要体现在声道传输函数上,因而在语音识别中通常取语音信号倒谱的低 时域构成l 。p c 倒谱特征c ,即: c = c ( 1 ) ,c ( 2 ) ,c ( q ) 1 0 q 1 6 ( 3 - 1 7 ) 式中,q 为l p c 倒谱特征的阶数。 l p c c 参数的优点是计算量小,易于实现,缺点是在所有的频率上都是线性 逼近声音的,而这与人的听觉的特性是不致的。另外,它包含了语音高频部分 的大部分噪声细节,这些都会影响系统的性能。 3 3 3 2 基于m e l 频率弯折的倒谱系数m f c c 从人类听觉系统的研究成果来看,人耳分辨声音频率的过程犹如一种取对 数的功能,相当于b a r k 因子的作用 3 1j 。基于此出现了m e 频率倒谱系数 ( m f c c ,m e l f r e q u e n c yc e p s t r u mc o e f f i c i e n t ) :3 2 ,它将频谱转化为基于m e 基于前馈型人 :神经网络的语音和音乐识别 频标的非线性频谱,然后转换到倒谱域上。由于充分考虑到了人的听觉特性, 而且没有任何前提假设,m f c c 参数具有良好的识别性能和抗噪能力,但其计算 量和训算精度要求高。 m f c c 是采用滤波器组的方法计算出来的,这组滤波器在频率的美尔坐标上 是等带宽的。这是因为人类在对约1 0 0 0 1 i z 以上的声音频率范围的感知不遵循线 性关系,而是遵循在对数频率坐标上的近似线性关系。式( 3 一1 8 ) 是美尔刻度与 频率的关系式。 l “= 3 3 2 2 2 3 1 9 ( 1 + 0 0 0 1 ) 丘 f 3 1r 1 图3 4m f c c 的计算过程 m f c c 计算过程如图3 4 所示,具体计算步骤如下: ( 1 ) 语音信号在经过加窗处理后变为短时信号,用f f t 将这些时域信号z m l 转化为频域信号x 沏) ,并由此可以计算出它的短时能量谱p ( ,) 。 ( 2 ) 将e ( f ) 由在频率轴上的频谱转化为在美尔坐标上的p ) ,其中m 表 示美尔频率,式( 3 一1 8 ) 可以完成该变换。 ( 3 ) 在美尔频域内将三角带通滤波器加于美尔坐标得到滤波器组日。 ) ,然 后计算美尔坐标上的能量谱p ( m ) 经过此滤波器组的输出: rk1 o ( m 。) = l n i 防 ) 1 2 h 。l k = l ,2 ,k( 3 1 9 ) 【箱j 式中k 表示第k 个滤波器,k 表示滤波器个数。 ( 4 ) 通过一个具有4 0 个滤波器( k = 4 0 ) 的滤波器组。这个滤波器组的特点 是:中心频率1 0 0 0 h z 以下的三角滤波器有1 3 个,它们的中心频率是线性分布 的,相隔6 6 6 6 6 6 6 7 h z ;中心频率1 0 0 0 h z 以上的三角滤波器有2 7 个,它们的 中心频率是以等比数列形式分布的,比例为1 0 7 1 1 7 0 3 。最低频滤波器的低频 截止频率为1 3 3 3 3 3 3 3 h z 。后个滤波器的低频截止频率等于前一个滤波器的 中心频率。频域信号经过这4 0 个三角滤波器后,便把线性频标转化为了美尔频 标。 ( 5 ) 如果o ( m 。) 表示第k 个滤波器的输出能量,则美尔频率倒谱。,( n ) 在 美尔刻度谱上可以采用修改的离散余弦反变换( i d c l 、) 求得: k 巳。以) = e o t m 。) c o s ( n ( k o 5 ) 乡 n = l ,2 ,p( 3 2 0 ) 雨 a 式中,p 为m f c c 参数的阶数。 从图3 - 4 中可以看出,m f c c 实际上已经包含了多种特征参数变换,包括快 基丁前馈型人i 神经刚络的语音和音乐识别 速傅立叶变换、离散余弦变换等,并纳入了能量信息,所以从直观上分析,它 的性能要优寸1 其中某一种参数,当然这需要进一步的实验来证明。 3 4 关于特征参数的比较实验 合适的特征参数既能提高识别准确率,又能简化网络规模。为此,我对z c r 、 l 1 ,c 、l p c c 和m f c c 参数进行了一些比较实验。 文献 2 4 采用了6 种参数作为音频文件的特征参数,分别是线性预测编码 ( l p c ) 、线性预测倒谱系数( l p c c ) 、快速傅立叶变换( f f t ) 及其自然对数谱、 美尔频率倒谱系数( m f c c ) 、过零率( z c r ) ,得到了一个跃达1 4 2 的特征向量。 由于特征向量维数太多,导致网络规模太大,内存和时间开销都无法承受,所以 在进行网络训练和识别时不得不将维数降低( 从1 4 2 降到2 9 ) ,之前取得的特征 值很多都因此丢失了。 其实,纵观上述几种参数,虽然其算法各不相同,但都是从音频文件的时域、 频域、倒谱、能量等方面提取音频的特征参数的,所以结果大同小异。我认为, m f c c 参数既包含了时域和频域方面的特征,也包含了能量方面的特征,用它作 为音频的特征参数己经足够了。为证实这一观点,我做了个实验,先后使用7 种方法来提取特征参数,然后用同神经网络对同一批音频数据样本进行测试, 测试结果如表3 一l 所示。 从该表可以看出,前面6 种方法中,第一种方法采用6 种特征参数进行分类, 其分类准确率为9j ,比只用其中一种( 如l p c c ) 或儿种( 如l p c c + m f c c ) 的识 别器仅高了3 5 个百分点。 而第7 利一方法使用m f c c 作为特征参数,特征向量的k 度仅为1 3 ,为7 种方 法中最短的,而识别准确率达到了9 4 。和其它6 种特征参数相比,m f c c 参数所 占用的内存宇间、时间开销都要小,而识别率都要高。这印证了本文此前的推测, 即:m f c c 实际上己经包含了多种特征参数变换,包括快速傅立叶变换、离散余 弦变换等,并纳入了能量信息,所以它的性能要优于其中某一种参数。 基于此,本文将选择m f c c 作为特征参数。 从表31 也可以看出,特征参数越多,效果未必就越好。 基丁前馈型人j l 神经网络的语音利音乐识别 表3 - 1 不同特征参数提取方法的识别结果 序号 提取特征参数的方法特征向量长度识别结 果 1l p c + l p c c + f f t + m f c c + z c r 1 4 2 9 1 2l p c c3 28 6 3l p c c + m f c c4 58 8 4l p c c + m f c c + z c r4 68 9 5l p c c + z c r3 38 6 6m f c c + z c r1 48 9 7m f c c1 39 4 基丁。i j ( 馈型人一神经州络的涪音和音乐识别 第4 章前馈型人工神经网络 目前语音识别的模型建立的方法中,有两大类方法是较为流行的:一是基于 概率生成模型的方法,如高斯混合模型( g m m ) 和隐马尔可夫模型( 】m m ) 等;二是基 于判别模型的方法,如人e 神经网络( a n n ) 、支持向量机( s v m ) 等。两类方法各 有特点,虽然识别原理不同,但是识别性能相差不大。概率生成模型的优点足可 以从统计的角度充分表示数据的分布情况,反映的是同类数据本身的相似度特 性;而判别模型的特点是寻找不同类别之问的最优化分类面,反映的是异类数据 之间的差异。判别模型往往要比概率生成模型的性能稍好一些,这是因为它们利 用了训练数据的类别表示信息,但其缺点是不能反映训练数据本身的特性。本文 的任务是对语音、音乐、语音+ 音乐三类音频进行分类,相应的识别模型应能最 大程度地表示类别信息,所以人工神经网络模型( a n n ) 就成为了较理想的选择。 4 1 人工神经网络简介 人工神经网络( a r t i f i c i a ln e u r a ln e t w o r k s ,a n n ) 是对生物神经系统的 一阶特性的一种描述。它是一个数学模型,可以用计算机程序来模拟,是人工智 能研究的一种方法。通过人工神经网络,可以在一定程度上模拟生物神经系统的 运作,从而实现生物神经系统所具有的感知、认识、学习、分析等功能。 4 1 1 生物神经系统的生理结构 图4 1生物神经系统的生理结构 基丁前馈型人工神经网络的语音和音乐识别 在生物的神经系统中,神经元是构成神经网络的最基本单元。在数学上的神 经元模型是和生物学上的神经细胞对应的。或者况,人工神经网络理论是用利i 经 元这种抽象的数学模型来描述客观世界的生物细胞的。很明显,生物的神经细胞 是神经网络理论诞生和形成的物质基础和源泉。这样,神经元的数学描述就必须 以生物神经细胞的客观行为特性为依据。因此,了解生物神经细胞的行为特性就 是一件十分重要而必须的事了。神经网络的拓朴结构也是以生物学解剖中神经细 胞互连的方式为依据的,对神经细胞相互作用情况的揭露也是十分重要的。 神经元是彼此联接的,它是一种特殊的细胞,主要由胞体( s o m a ) 、枝蔓 ( d e

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论