(通信与信息系统专业论文)基于gmm和svm的音频分类算法.pdf_第1页
(通信与信息系统专业论文)基于gmm和svm的音频分类算法.pdf_第2页
(通信与信息系统专业论文)基于gmm和svm的音频分类算法.pdf_第3页
(通信与信息系统专业论文)基于gmm和svm的音频分类算法.pdf_第4页
(通信与信息系统专业论文)基于gmm和svm的音频分类算法.pdf_第5页
已阅读5页,还剩51页未读 继续免费阅读

(通信与信息系统专业论文)基于gmm和svm的音频分类算法.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

大连理工大学硕士学位论文 摘要 随着计算机技术、网络技术和通讯技术的不断发展,图像、视频、音频等多媒体数 据已逐渐成为信息处理领域中主要的信息媒体形式,其中音频信息占有重要的地位。 原始音频数据是一种非语义符号表示和非结构化的二进制流,缺乏内容语义的描述 和结构化的组织,给音频信息的深度处理和分析工作带来了很大的困难。如何提取音频 中的结构化信息和内容语义是音频信息深度处理、基于内容检索和辅助视频分析等应用 的关键。音频分类与分割技术是解决这一问题的关键技术,是音频结构化的基础。本文 在总结前人研究成果的基础上,研究了音频特征的分析与抽取、基于g m m 的音频分类 和基于s v m 的音频分类问题。 本文工作主要包括以下内容: ( 1 ) 分析了语音和音乐的特征参数,并提取其相关特征。 ( 2 ) 分别使用g m m 和s v m 分类算法做为语音和音乐的分类器,并比较了这两种 分类器的性能。 ( 3 ) 使用s v m 分类器实现语音端点检测,并与基于能量和过零率的端点检测方法 进行了比较。 ( 4 ) 给出了一种基于g m m 统计特性参数和s v m 结合使用的音频分类系统。该方 法结合了g m m 鲁棒性好和s v m 分辨力好的优点,提高了系统的性能和鲁棒性。 关键词:音频分类;音频特征分析;高斯混合模型;支持向量机;端点检测 大连理工大学硕士学位论文 a u d i oc l a s s i f i c a t i o na l g o r i t h mb a s e do ng m ma n ds v m a b s t r a c t w i t ht h ed e v e l o p m e n to fc o m p u t e r , n e t w o r ka n dc o m m u n i c a t i o nt e c h n o l o g y ,m u l t i m e d i a d a t a , w h i c hi n c l u d ei m a g e ,v i d e oa n da u d i o ,b e c o m e sp r i m a r yi n f o r m a t i o nm e d i ai nt h ef i e l d o fi n f o r m a t i o np r o c e s s i n g a u d i od a t ai sa ni m p o r t a n tp a r to fm u l t i m e d i aa p p l i c a t i o n s r a wa u d i od a t ai sn o n - s e m a n t i ca n dn o n s t r u c t u r e db i n a r yd a t as t r e a mw h i c hl a c k s s e m a n t i cc o n t e n td e s c r i p t i o na n ds t r u c t u r e do r g a n i z a t i o n t h e s ec h a r a c t e r i s t i c so fa u d i od a t a b r i n gm u c hd i f f i e u l wf o ra u d i oi n f o r m a t i o np r o c e s s i n ga n da n a l y s i sd e e p l y h o wt oe x t r a c t t h es t r u c t u r ei n f o r m a t i o na n ds e m a n t i cc o n t e n tf r o mr a wa u d i od a t ai sa k e yp r o b l e mf o ra u d i o s t r u c t u r ep a r s i n gw i n la u d i oa s s i s t a n c e a u d i oc l a s s i f i c a t i o ni sk e yt e c h n o l o g yf o rs o l v i n g s u c hp r o b l e m s ,a n di st h eb a s i so fa u d i os t r u c t u r e d i n c o r p o r a t i n gt h ep a s tr e s e a r c hf r u i t s ,t h i s t h e s i ss t u d i e sa u d i oc l a s s i f i c a t i o nt h a ts o l v e st h ef o l l o w i n gp r o b l e m s ,s u c ha sa u d i of e a t u r e a n a l y s i sa n de x t r a c t i o nf o ra u d i oc l a s s i f i c a t i o n ,g m m - b a s e da u d i oc l a s s i f i e ra n ds v m - b a s e d a u d i oc l a s s i f i e r a tl a s t ,as y s t e mb a s e do ng a u s s i a nm i x t u r em o d e l ( g m m ) s t a t i s t i c a l p a r a m e t e r sa n ds u p p o r tv e c t o rm a c h i n e ( s v m ) f o ra u d i oc l a s s i f i c a t i o ni sp r o p o s e da n d e v a l u a t e d t h er e s e a r c hw o r kc a nb ec o n c l u d e da sf o l l o w s : ( 1 ) a u d i of e a t u r e sa l ed e s c r i b e da n de v a l u a t e d ( 2 ) g m m - b a s e da u d i oc l a s s i t i e ra n ds v m b a s e da u d i oc l a s s i f i e ra r es t u d i e d ,a n dt h e p e r f o r m a n c e so ft h e s et w oc l a s s i f i e r sa l ec o m p a r e d ( 3 ) av o i c ea c t i v i t yd e t e c t o ra l g o r i t h mu s i n gs u p p o r tv e c t o rm a c h i n ei sp r o p o s e d 。 ( 4 ) as y s t e mb a s e do ng a u s s i a nm i x t u r em o d e l ( g m m ) s t a t i s t i c a lp a r a m e t e r sa n ds u p p o r t v e c t o rm a c h i n e ( s v m ) f o ra u d i oc l a s s i f i c a t i o ni s p r o p o s e d t h es y s t e mc o m b i n e dt h e r o b u s t n e s so fg e n e r a t i v em o d e la n dt h ep o w e r m lc l a s s i f i c a t i o no fd i s c r i m i n a t i v em o d e lt o i m p r o v et h ep e r f o r m a n c ea n dr o b u s t n e s so fc l a s s i f i c a t i o n k e yw o r d s :a u d i oc l a s s i f i c a t i o n :a u d i of e a t u r ee x t r a c t i o n :g m m ;s v m :v a d 大连理工大学学位论文独创性声明 作者郑重声明:所呈交的学位论文,是本人在导师的指导下进行研究 工作所取得的成果。尽我所知,除文中已经注明引用内容和致谢的地方外, 本论文不包含其他个人或集体已经发表的研究成果,也不包含其他已申请 学位或其他用途使用过的成果。与我一同工作的同志对本研究所做的贡献 均已在论文中做了明确的说明并表示了谢意。 若有不实之处,本人愿意承担相关法律责任。 学位论文题目:基王鱼避塑曼迎鲍童题佥娄篡洼 一 作者签名: 2 委i 兰恩 日期:二咀年上月l 日 大连理工大学硕士研究生学位论文 大连理工大学学位论文版权使用授权书 本人完全了解学校有关学位论文知识产权的规定,在校攻读学位期间 论文工作的知识产权属于大连理工大学,允许论文被查阅和借阅。学校有 权保留论文并向国家有关部门或机构送交论文的复印件和电子版,可以将 本学位论文的全部或部分内容编入有关数据库进行检索,可以采用影印、 缩印、或扫描等复制手段保存和汇编本学位论文。 作者签名: 导师签名: 日期:冱星年上月卫日 日期:迦2 年l 月j 生日 大连理工大学硕士学位论文 1 绪论 1 1研究背景 人类社会已经进入数字化时代,随着信息产业的高速发展,信息获取的方式和技术 产生了革命性的进步,音视频等多媒体数据已成为信息处理领域中主要的信息媒体形 式。如何快速有效地分析和利用多媒体数据已经成为一个非常重要的问题,而对信息数 据有效的处理和组织是深入分析和充分利用的前提。 音频是多媒体中的一种重要媒体,通常认为数字音频是一种非结构化流媒体,而传 统的信息处理主要是面向结构化数据的。结构化数据是指数据个体间相互独立、特征易 于计算机表示,并且包含的数据可以直接从其物理表示中提取的数据。音频的非结构化 组织特点阻碍了音频应用的发展。因此,如何将无序的音频数据变得有序,是解决问题的 关键。音频的自动分类,是提取音频内容语义和结构的重要手段之一,也是音频信号进 一步处理的基础。我们能够听见的音频频率范围在6 0 h z 到2 0 k h z ,其中语音大约分布 在3 0 0 h z 到4 k h z 之内,而音乐是全范围分布。作为两类最重要的音频信号,语音和音 乐的自动分类在基于内容的语义提取、音频检索、视频的摘要以及语音识别等众多领域 都有重要的应用价值。 音频分类是音频信息深度处理的基础,是音频结构化的核心技术。语音音乐检测在 很多应用场合具有重要意义: ( 1 ) 多媒体信号的有效编码 通常音频数据流由语音和音乐片段组成。音频编码器用于对信号流进行编码。如果 我们可以把语音信号从信号流中分离出来,就可以对语音信号用语音编码器编码,这比 音频编码器的带宽要小很多。系统对语音和音乐的检测一定要精确,因为如果音乐进入 语音编码器错误的编码,则会显著的削弱音频质量。 ( 2 ) 自动语音识另0 ( a s r ) a s r 有很多应用,包括可以将语音自动转化为文本。语音音乐分类和检测可以被用 于a s r 系统的第一步。例如,在输入语音识别器前应该将音频流中的非语音部分去掉。 如果转化为文本的音频文件中含有音乐片段,就一定要在识别器中使其无效;否则,识 别器会将它们转化成垃圾文字。所以,语音和音乐检测对有效的a s r 是很重要的。 ( 3 ) 基于内容的索引和视听数据的修复 基于内容的音频检索是当前多媒体信息检索领域的一个研究热点,它在远程教学、 数字图书馆、新闻节目检索等众多领域都具有极大的应用价值。相似性检索是基于内容 基于g m m 和s v m 的音频分类算法 的音频检索的重要特点,而音频分类需要衡量音频的相似度,因此,分类问题是基于内 容的音频检索的核心问题。 ( 4 ) f m 广播信号的自动选台 这可以用于查找音乐频道或者当商业节目出现时切换频道。很多人对广播中的商业 和谈话节目不感兴趣,他们只喜欢音乐。通常他们不能够跳过音乐中含有商业和语音的 片段。因此,需要一种低成本自动节目检测。他可以确保当内容不符合使用者的预先设 定后,自动进行频道转换。另一种应用是对特定节目频道的音乐检测,以确保其符合广 播要求。监控及可以忽略背景音乐更有效的检测出有效内容。 ( 5 ) 音乐流派分类和乐器识别 语音音乐分类和检测也通常被用于音乐流派分类的第一步。 ( 6 ) 认知多媒体 认知多媒体是一项正在进行的研究工作,基于认知规则和认知科学的指导方针被用 于发展多媒体系统以支持人类学习和问题处理。自然语言和机器人的通信在家庭和办公 环境中的服务型机器人的应用有很大需求。在真实世界应用中,机器人对语音和环境声 音的识别是基本的要求。大多数机器人使用麦克风阵列实现声源定位和分离技术。分离 出的声音还需要分类成语音信号和非语音信号。语音识别系统中,语音激活检n ( v a d ) 区别出输入信号中的语音和非语音信号。但是因为语音和音乐信号在周期上的共同特 性,在语音和音乐检测中用一般的v a d 分离效果就不是很好。为了减轻此问题,可以 使用一种自动语音和音乐检测技术。此技术在家庭环境中的t v 和音频系统中的语音识 别是很有效果的,检测器在a s r 的输入信号中将音乐流设定为无效,使得语音信号的 识别效果有所改进。 ( 7 ) 辅助视频分析 近年来,一些研究人员借助视频中伴随的音频信号,将其与可视信息结合,完成视 频的分割、分类及视频索引等。在视频分类和检索中,人们发现简单的视觉特征,如颜 色、纹理、运动向量等并不能很好地反映视频的内容和结构语义,而更高级的视觉语义 特征的提取则相当困难,因此,z h ul i u 等人尝试根据音频特征训练马尔可夫模型,作5 种视频场景的分类:新闻节目、天气预报、篮球比赛、广告和足球比赛。p a t e l 等人在 m p e g 压缩数据中,利用音频信号特征把视频分成对话、非对话和沉默三种。 ( 8 ) 其他 大连理工大学硕士学位论文 音频分类用于使用麦克风阵列和可控制摄像机的现代视频会议,区分语音和静音 段,完成自动追踪麦克风阵列中的讲话者。生物学家利用音频分类技术识别自然环境中 的鸟类和其他动物的呜叫声,从而可以发现珍惜动物的踪迹。 综上所述,音频分类作为音频结构化的核心技术在多媒体信息处理中有着重要的作 用。对于随机给出的一段音频,首先使用音频分类进行分类和分割。假若判断是一段语 音,那么就可以采用语音识别的方法来获取音频内容;假若是一段音乐,那么就采用分 析音乐的相关操作。这样,针对不同类型的音频数据采取不同的处理过程,既减少了处 理过程的时间和空间消耗,同时也提高了处理的精度。 此外,通过分类可以事先确定语音或音乐所处的音频环境,为模型的自适应调整算 法提供线索,从而提高音频信号处理的效率和精度。可见,作为解决音频结构化问题的 关键技术,音频分类为音频信息深度分析和利用提供了坚实的基础。 1 2 音频分类的研究现状 和语音信号处理与识别相比,有关一般音频信号分析的研究工作相对较少。但进入 2 0 世纪9 0 年代以后,这个领域的研究工作取得了很大进展。b f e i t e n 在1 9 9 1 年的一篇 文章中将神经网络用于音频分类中,训练了一支歌神经网络,直接将声音类别映射到 所标注的文本。在19 9 4 年,b f e i t e n 又提出用自组织映射( s o m ,s e l f - o r g a n i z a t i o nm a p s ) 聚类算法嘲对具有相似感觉的声音进行聚类。真正意义上的基于相似性的音频内容自动 分类的研究工作是由美国m u s c l ef i s h 公司的e r l i n gw o l d 等人【3 】在1 9 9 6 年间完成的。 在此之后,音频分类技术的研究真正发展了起来。 对音频进行处理之前,通常要进行预处理,将音频流切分成时间长度较短的单元, 音频分类就是指对这些音频单元类别进行识别的过程。音频分类本质上是一种模式分类 的过程,包括特征提取和分类两个基本过程,当前绝大多数的音频分类算法都是采用如 下图1 1 所示的结构: 图1 1 音频分类结构框图 f i g 1 1 a u d i oc l a s s i f i c a t i o na l g o r i t h ms t r u c t u r e 基于g m m 和s v m 的音频分类算法 目前,该领域的研究重点主要在两个方面:音频特征分析与提取和分类器的设计与 实现。早期的音频特征大致包括短时能量、静音率、过零率、和谐度、基频、频谱、带 宽、谱中心、子带能量,后来又引入了线性预测系数和m e l 倒谱系数等多种时域和频域 的特征。系统中所用的分类器主要包括基于高斯模型的分类器、基于神经网络的分类器、 基于决策树的分类器、基于隐马尔科夫模型的分类器等。 当前已存在许多成熟有效的音乐分类算法,它们都是基于图1 1 所示的音频分类结 构,其中一些较为常用著名的方法包括: 1 9 9 6 年,w o l d 等【i j 首先提出了根据内容对音乐进行分类的方法( m u s c l ef i s h ) ,在此 方法中,从每一首样本( 训练样本或测试样本) 音乐中提取出一些时域或频域的统计特征, 包括均值、方差及自相关系数等,它们代表了该首音乐的感知特征:晌度( 1 0 u d n e s s ) 、带 宽( b a n d w i d t h ) 、亮度( b r i g h t n e s s ) 及音调( p i t c h ) 等等,这些特征用于后一阶段的分类器中 进行分类。 1 9 9 7 年,f o o t e 4 1 从音乐中提取1 2 阶m f c c 加能量项作为代表待分类音乐的特征, 使用一种树状结构的矢量量化器将特征空间分隔为数个不重叠的区域,计算待分类音乐 特征与这些区域的距离( 欧几里德距离或余弦距离) ,使用n n ( n e a r e s tn e i g h b o o 规则作为 分类器。 2 0 0 0 年,l ip 】选取m f c c 和包括基音频率、子带能量等在内的感知参数的级联作 为特征,并使用了新的模式分类方法n f l ( n e a r e s tf e a t u r el i n e ) 作为分类器,他的实验表 明这种分类方法优于n n 、n c 及5 - n n 等分类器,最终在1 9 8 首待分类音乐中出现4 0 首分类错误。 2 0 0 1 年,c h o u 等 6 1 提出了一些新的特征用于语音信号与歌曲类信号的区分。h u g h e s 等| 7 1 采用小波变换与神经网络相结合的方法来解决这个问题。 2 0 0 2 年,t z a n e t a k i s i s 提取局域音色结构( t i m b r a lt e x t u r e ) 、节奏内容( r h y t h m i cc o n t e n t ) 和音调内容0 i t hc o n t e n t ) 特征,使用一种层次性的分类结构对音频进行分类,特征集由 3 0 个特征组成,在总共1 0 类的音频分类中最终精确率达到6 1 。 2 0 0 3 年,f e n g 等1 9 1 采用最大熵模型,并结合一些通用特征对语音和音乐进行分类。 2 0 0 4 年,b e i e r h o l m 等【l0 1 提出了一种无需训练的语音、音乐区分算法。 2 0 0 5 年,l i n 等b i i 在l id i 的基础上使用小波变换的方法提取子带能量及基音频率等 特征,这种方法得到的特征与其他方法相比更为精确,分类阶段采用一种由底向上的分 类结构,并使用s v m 作为分类器,利用s v m 优秀的泛化能力,取得了较好的分类精 确率。 大连理工大学硕士学位论文 2 0 0 7 年,m u n o z 等【1 2 l 将遗传模糊系统与混合高斯模型融合使用,分类效果远远优 于混合高斯模型分类器。 除了上述一些典型的音乐分类算法外,还有许多其他的有效的音乐分类算法。当前 的研究重点在于如何在音乐中获得更能体现音乐本身性质的特征,例如利用小波变换等 高等信号处理方法提取频域特征,或使用时频变换获取时频参数特征等等。 1 3 本文主要工作和论文结构 本文主要研究的内容是语音和音乐的分类技术。主要包括音频分类的基本原理,音 频特征的分析与提取,及最优分类器的选择。分别使用了混合高斯模型和支持向量机两 种分类算法对语音和音乐进行分类,并将两种分类器结合使用。本文采用g m m 的模型 参数作为s v m 分类器的训练数据,建立了基于g m m 统计特性参数和s v m 的音频分 类系统。 一 音频分类问题本质上是一个模式识别过程,因此主要实现以下目标: ( 1 ) 预处理。音频信号的预处理包括预加重、分帧、加窗和端点检测。端点检测部 分本文尝试使用了支持向量机进行音频和噪声的分类,并与原始的基于能量和过零率的 端点检测方法进行比较。 ( 2 ) 提取用于分类的音频特征。特征的选择和提取是模式识别系统的最重要的环节, 本文选择能较好反映语音和音频信号差异的美尔频率倒谱系数和其他感知音频特征作 为特征参数。 ( 3 ) 选择分类器。利用机器学习的方法进行音频信号的自动分类。高斯混合模型 g m m 和支持向量机s v m 是两种广泛使用的统计学习算法。本文首先研究了高斯混合 模型的不同阶数对分类的影响,选择了最优阶数做为系统参数。其次,又使用了支持向 量机作为分类器,并比较了不同核函数的分类效果。 ( 4 ) 研究基于g m m 统计特性参数和s v m 的音频分类系统。音频特征经g m m 聚 类实现特征变换,并以g m m 多维概率输出组成后级s v m 模型的输入矢量。该系统综 合了g m m 的概率统计分布描述能力强和和s v m 分类性能好的优点。 论文的章节内容如下所示: 第一章:绪论。介绍本课题的研究背景及意义,国内外的研究现状,简要说明本论 文的主要研究内容及如何实现该技术,并概述了论文的主要工作。 第二章:音频分类的基本理论。对音频分类这一模式识别过程进行基本描述,介绍 了主要音频特征参数,并对用于模式分类的常用算法进行概述。 基于g m m 和s v m 的音频分类算法 第三章:高斯混合模型。介绍高斯混合模型的基本概念和算法原理。并使用高斯混 合模型作为音频分类器,通过实验分析了g m m 模型的阶数对系统性能的影响。 第四章:支持向量机。介绍统计学习理论和支持向量机的基本原理。并使用支持向 量机作为音频分类器,比较了不同核函数的音频分类精度。最终选择径向基函数作为系 统分类器的核函数。 第五章:基于g m m 和s v m 组合的音频分类系统。介绍本文音频分类系统的基本 模块及相关结果。在预处理部分比较了s v m 端点检测和基于能量和过零率端点检测的 分类效果。在特征分析部分对比了语音和音乐信号特征参数的不同特点。最后,采用基 于g m m 统计特性参数和s v m 的分类算法。阐述了基于g m m 聚类的特征变换的原理。 给出了系统结构,以g m m 模型的统计参数来训练s v m 音频分类系统,最终实现语音 和音乐的判决。 第六章:总结与展望。 大连理工大学硕士学位论文 2 音频分类技术及原理 2 1音频分类概述 音频分类从本质上讲是一个模式识别过程,包括特征抽取和分类两个基本过程。音 频分类技术是一个交叉研究领域,它涉及多个方面的知识,包括人耳的听觉特征、信号 与系统、数字信号处理、语音信号处理、模式识别、统计学习、人工智能等。目前,该 领域的研究重点主要在以下两个方面:音频特征分析与抽取以及分类器设计。 训练过程 图2 1 模式识别系统的基本构成 f i g 2 1 t h ee l e m e n tm o d e lo fp a t t e r nr e c o g n i t i o ns y s t e m 一般来说,为了描述声音文件,关键字,关键声音和音调都被半自动提取,并检测 说话者。然而,所有的检测系统预示了元素和齐次声音成分的提取。当研究语音检索( 相 对的为音乐检索) ,语音片段选择( 相对的为音乐) ,另一部分片段就被丢弃。 2 2 音频信号特征分析 音频特征分析与提取是音频分类的基础,所选取的特征应该能够充分表示音频频域 和时域的重要分类特性,对环境的改变具有鲁棒性和一般性。 2 2 1 基于帧的音频特征 帧是我们处理的音频信号的最小单位,计算出每一帧的特征值,然后在此基础上计算 出片段层次上的特征值。通常在帧层次上有以下几种典型的音频特征。 ( 1 ) m f c c 系数( m e l - f r e q u e n c yc e p s t r u mc o e f f i c i e n t s ) m e l 频率倒谱系数【1 2 】【1 3 1 是根据人耳听觉机理导出的声学特征。人类在对1 0 0 0 h z 以 下的声音频率范围的感知遵循近似线性关系:对1 0 0 0 h z 以上的声音频率范围的感知不 遵循线性关系,而是遵循在对数频率坐标上的近似线性关系。m e l 标度描述了人耳对频 率感知的非线性特性。m f c c 是在m e l 标度频率域提取出来得倒谱参数。该特征具有较 高的识别率和较好的噪声鲁棒性。 基于g m m 和s v m 的音频分类算法 m f c c 是基于两条听觉系统的研究成果导出的”“:其一,人类对瞽个音调的感知强 度近似与该音调频率的对数成正比。所谓m e l 频率尺度,它的值大体上对应于实际频率 对数分布关系。在m e l 频率域内,人对音调的感知度为线性关系。 m e l 频率与实际频率的关系可用下式近似表示: r m e l ( ) 22 5 9 5 o g ( 1 + 赢) ( 21 ) 其二,当两个频率相近的音调同时发出时,人只能听到一个音调。临界带宽( c r i t i c a l b a n d w i d t h ) 指的就是这样一种令人的主观感觉发生突变的带宽边界。当两个音调的频率 差小于临界带宽时,人就会把两个音调听成一个,这称之为屏蔽效应。临界带宽计算公 式如下: 口吃。2 5 + 7 5 4 ( 1 + 盎) 2 r ( 22 ) 其中f 为中心频率。 因此,町以构造临界频带滤波器组( c r i t i c a lb a n df i l t e rb a n k ) 来模仿人耳的感知特 性。m e l 频率倒谱系数( m f c c ) 就是在频瑶上采用滤波器纽的方法引算出来的,将音频 频瞽划分成一系列三角形的滤波器序列,这组滤波器仵频率的美尔( m e l ) 半标r 是等带宽 的。 1 3 1 3 02 咖加佃口 f r e q u e n c y | h z l p ic 1 (l1 雌爿 倒22m e l 尺度滤被器组 f i g22 m e l - s c a l e f i l t e r so na l i n e a r f r e q u e n c y f h z ) s c a l e ( 2 ) 频域能量( 矗。q u e n 。yd o m a i ne n e r g y 频域能量“5 1 定义如下- 大连理工大学硕士学位论文 e = l o g ( 【”i f ( 缈) ld c o ) ( 2 3 ) 其中f ( 妫是该帧的f f t 变换系数,为采样频率的一半。利用频域能量e 来判断静音 帧,如果某一帧的频域能量小于阈值,则将该帧标记为静音帧,否则为非静音帧。同时, 频域能量也是区分音乐和静音的有效特征。通常,语音中含有比音乐中更多的静音,因 而,语音的频域能量变化要比音乐中的大很多。 ( 3 ) 子带能量比( s u b - b a n de n e r g yd i s t r i b u t i o n ) 将频域划分为4 个子带,分别为【o 警】、譬,争、【导,詈】、【譬,鳓】,并计算各子带能量 的分布,计算公式如式( 2 4 ) d = 吉i :7 l f ( 神i d 国 ( 2 4 ) 其中,和日,为子带的上下边界频率。不同类型的音频,其能量在各个子带区间的分布有 所不同。音乐的频域能量在上述各个子带区间的分布比较均匀;而语音中,能量主要集中 在第0 个子带,约有8 0 以上【1 5 】。 ( 4 ) 过零率( z e r oc r o s s i n gr a t e ) 在离散时间信号情况下,相邻的抽样具有不同的代数符号就称发生了过零。过零率 是描述过零的速度,是信号频率量的一个简单的度量,计算公式如式( 2 8 ) : 揪。夏而i 刍v - - i i s g n x ( 肌+ 1 ) 】- s g n x ( 删) 】l 乇5 _ ) 其中z ( 所) 为离散音频信号。通常,语音信号是由发音的音节和不发音的音节交替组成, 音乐没有这种结构。语音产生模型表明,由于声门波引起了谱的高频跌落,所以浊音语 音能量约集中在3 k h z 以下,而对于清音语音,多数能量却是出现在较高的频率上,既 然高频率意味着有高的过零率,低频率意味着有低的过零率,那么,在过零率和能量的 频率分布之间就有很强的相关关系。合理的归纳来说,语音信号是清音,过零率高:语 音信号是浊音,过零率低。所以,对语音信号来说,的过零率的变化要比音乐大。z c r 是比较常用的音频特征。 ( 5 ) 频率质一已, ( f r e q u e n c yc e n t r o i d ) 在一帧中音频亮度( b r i g h t n e s s ) 是用频率质心来度量的,一般的,音乐的频率中心比 语音要高。计算方法如式( 2 6 ) : 基于g m m 和s v m 的音频分类算法 冗:塑型2 丝 r i f ( 圳如 ( 2 6 ) 而音乐的带宽范围比较宽,在2 2 0 5 k h z 左右。计算公式如式( 2 1 0 ) : 曰矿嚣 r ( 彩一f c ) 2 i f ( 酬2 咖 p lf ,。n 2 _ , ( 2 7 ) ( 7 ) 基音频率( p i t c hf r e q u e n c y ) 基音频率是衡量音调高低的单位。基音是指发浊音时声带振动所引起的周期性特 征,基音周期值是声带振动频率的倒数。基音携带有非常重要的语音信息,是语音语音 信号的一个重要参数。 基音周期检测方法大体上可以分为三大类:时域方法、频域方法和总和利用信号的 时域、频域特征的方法。通常,采用较简单的中心削波短时自相关函数的波峰检测算法 估计基音周期。自相关法的原理是语音的短时自相关函数在基音周期的整数倍点上有很 大的峰值,只要找到最大峰点的位置,便能估计出基音周期。提取基音周期的计算步骤 如下: ( a ) 预处理:利用中心削波函数( 2 8 ) 对音频进行削波减少共振峰的影响,削波阈值 由语音信号的峰值幅度来确定,一般取最大信号幅度的6 0 7 0 。 fx ( 珂) 一三, x ( 刀) 三 y ( 以) = c ( x ( 刀) ) = 0 ,i x ( 以) i 二 ( 2 8 ) l x ( 丹) + 三,x ( 刀) 0 y ( ,z ) = c ( 工( 靠) ) = 0 , y ( 以) = 0 ( 2 9 ) l - 1 ,j ,( 刀) t ) ,o = 0 1 听,t 为观察序列长度; ( b ) 在给定的h m m 模型五的条件下,求观察序列d 最有可能历经的状态序列& ( c ) 在已知样本集合的条件下,如何根据样本集合训练模型并获得模型参数。 问题( a ) 可以由前向( f o r w a r d ) 或者后向( b a c k w a r d ) 算法解决,问题( b ) 是典型的状态空 间搜索问题,经典的算法有基于动态规划的v i t e r b i 算法、b e a ms e a r c h 和a 算法,问题( c ) 是统计学习过程,其学习算法有b a u m w e l c h 算法、梯度算法等。b a u m w e l c h 算法能够 大连理工大学硕士学位论文 在理论上证明经过有限次迭代就能收敛,但它和梯度算法一样都会陷入局部极值点,而 不能得到全局最优的结果引。 ( 3 ) 人工神经网络a n n 人工神经网络是对人脑神经系统的数学模拟,其目的是学习和模仿人脑的信息处理 能力。它是一种分布式并行处理结构的网络模型,具有自组织和自学习能力、很强的复 杂分类边界区分能力以及对不完全信息的鲁棒性,其性能近似理想的分类器。其缺点是 训练时间长,动态时间规整能力弱。 a n n 具有很强的非线性映射能力和对复杂问题的模式分类能力,是一种解决模式 分类和回归的有力工具,是模式识别领域常用的分类方法。在训练一个a n n 模型时, 可以很方便的将目标类的训练数据与其他类的训练数据混合训练,这样得到的模型就体 现了目标类和其他类的不同,具有很强的分类能力目前。己有多种a n n ,如多层感 知器( m u l t i l a y e rp e r c e p t i o n ,m l p ) 、r b f 网络( r a d i a lb a s i sf u n c t i o n ) 、自组织映射神经网 络( s e l f - o r g a n i z a t i o nm a t u r em a p p i n g ,s o f m ) 、预测神经网络( p r e d i c t i v e n e u r a ln e t w o r k , p n n ) 、时延神经网络( t i m ed e l a yn e u r a ln e t w o r k s ,t d n n ) 等等。但是,a n n 存在最佳模 型拓扑结构的设计闯题,其训练算法不能保证收敛,以及存在过学习的趋向。 ( 4 ) 支持向量机s v m 支持向量机也是一种基于统计学习的算法,是v a p n i k 等人提出的以结构风险最小 化原理为基础的一种分类方法,这种方法在九十年代末开始被研究人员关注,由于其泛 化能力较好,在小样本的情况下就可以达到较好的精度。s v m 是在统计学习理论基础 上发展起来的一个重要的学习方法,其中心思想就是调整判别函数使得它最好的利用了 边界样本点的分类信息,能够很好的解决小样本情况下的机器学习问题。支持向量机本 身的概念很简单,但是由于其有很强的扩展性,使得它具有很强的区分能力。s v m 本 质上是一个线性分类器,但是由于引入了核函数的概念,使得其也可以解决非线性判决 的问题。另外,通过适当的选择核函数,使得支持向量机也可以模拟其它的基于非线性 判决的分类器。例如,当采用多项式核函数时,支持向量机就可以模拟一个多项式分类 器。 每一种分类器都在各自的发展阶段取得了惊人的成绩,但它们也不可避免的存在着 一些缺点,比如模板匹配法易受噪声影响,作为评估基准的矢量量化q ) 通常被认为丢 失了语音的时序信息,广泛采用的隐马尔科夫过程( h m m ) 的输出独立的假设是不合理 的,参数模型方法需要大量的数据才能收敛到正确的参数,神经网络以其训练的复杂性 著称,且还有收敛到局部最优的危险,高斯混合模型( g m m ) 需要大量的训练样本并且在 基于g m m 和s v m 的音频分类算法 嗓声环境下性能恶化。而基于最优分类的s v m 不仅克服了神经网络存在的某些问题, 而且在小样本情况下依然能达到较好的识别率。 大连理工大学硕士学位论文 3 高斯混合模型 3 1高斯混合模型的基本概念 3 1 1高斯混合模型的含义 高斯混合模型( g a u s

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论