【《音乐喷泉景观乐曲特征提取分析案例》7700字】_第1页
【《音乐喷泉景观乐曲特征提取分析案例》7700字】_第2页
【《音乐喷泉景观乐曲特征提取分析案例》7700字】_第3页
【《音乐喷泉景观乐曲特征提取分析案例》7700字】_第4页
【《音乐喷泉景观乐曲特征提取分析案例》7700字】_第5页
已阅读5页,还剩10页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

音乐喷泉景观乐曲特征提取分析案例目录TOC\o"1-3"\h\u8937音乐喷泉景观乐曲特征提取分析案例 185931.1引言 1131851.2神经网络简介 176521.2.1卷积递归神经网络(ConvolutionalRecurrentNeturalNetwork,CRNN) 224659图1.2RNN网络结构 311696图1.3LSTM记忆单元 3315661.2.2残差网络 422084图1.4残差网络 428431.3乐曲风格识别方法 5102061.3.1数据预处理 5149591.3.2网络模型介绍 9143641.3.3乐曲风格识别实验结果与分析 1038811.4乐曲音高序列处理 1223551.4.1道格拉斯-谱克法算法 1338911.4.2音高序列分段实现 131.1引言传统音乐水景观可解析的乐曲特征十分有限,并且存在喷泉表演响应速度滞后,或是与乐曲特征不匹配等问题。本文需要研究的是一款将园林设计与音乐艺术更好地相结合,且符合国际流行趋势的音乐水景观系统。本章将对乐曲风格以及乐曲音高两种特征提取方法进行改进。提取出准确度更可靠且更适用于水景观后台系统计算的控制信号。本文主要针对wav格式文件进行数据处理。1.2神经网络简介人工神经网络是基于生物学原理通过计算机设计出的一种数学模型,它模拟了人脑在处理信息时的方式以及相应的反应,这使得网络模型可以更好地处理各种复杂信息并且具备学习能力。人工神经网络中提出了感知器的概念来代替人脑中神经元的概念,不同感知器之间的作用类似神经元之间的信息传输功能。人工神经网络设计初,以随机数值填充感知器中的各个参数,随后通过损失函数,根据网络的输出和预期值的差值,利用梯度下降法,对网络中的感知器进行逐步调整,最后使网络的输出达到理想值。图1.1神经网络结构示意图人工神经网络经过长时间的发展,已衍生出多种结构,每种结构具有不同的功能。卷积神经网络前后两层神经元建立链接,通过卷积层和池化层提取出目标的局部特征,适用于图形数据的处理。递归神经网络通过序列建模的概念,对前后事件建立连接,从而使事件的特征保持存在,适用于文字识别等需要联系上下文的智能识别领域。但无论是何种神经网络的结构形式,它们的计算原理都相对简易但却具备十分强大的非线性学习能力。但是神经网络仍存在一些缺陷,主要问题在于过分依赖数据集的质量和数量。然后数据集的样本形式不充足,即使花费大量时间进行迭代学习,神经网络仍无法达到理想情况。1.2.1卷积递归神经网络(ConvolutionalRecurrentNeturalNetwork,CRNN)在文字识别领域,CNN经常与递归神经网络(RecrrentNetualNetworks,RNNs)相结合使用。该模型称为CRNN。CRNN由CNN将最后的卷积层替换为RNN修改而成。在网络中,CNN和RNN各自扮演着不同的作用。卷积层可以有效提取出音频信号的局部特征,而RNN网络可以更多地对全局结构进行考量[64],图1.2显示了RNN的结构。CRNN可以很好的完成音乐标记任务。音频信号中的一些标签(如情绪)可能会受全局结构的影响,而例如乐器之类的标签又可能受到局部结构的影响。相比于原本的CNN网络结构,RNN的加入可以更灵活地选择并整合经过卷积层和池化层得到的音频信号的局部特征[65]。图1.2RNN网络结构因为梯度消失问题,反向传播法十分困难训练递归神经网络。LSTM与RNN结构相同,只是在隐藏层更新为新的记忆单元,如图1.3所示。LSTM包含输入门、输出门以及遗忘门,用以保护细胞的状态[66]。遗忘门决定了网络需要记住之前多少的内容,采用sigmoid函数,输出一个(0,1)的数值。因此LSTM更善于发现并利用数据信息中的长期依赖关系。图1.3LSTM记忆单元LSTM记忆单元的实现如下式所示: (5-3)其中σ函数为sigmoid激活函数,i为输入门,f为遗忘门,o为输出门,c为神经元向量,它们的大小与隐藏层向量h相等。Who和Whi分别为隐藏输出门矩阵和隐藏输入门矩阵,Wxo和Wxi分别为输入输出门矩阵和输入门矩阵。1.2.2残差网络本文通过引入残差网络来解决因网络深度增加所引起的“退化问题”。残差网络和典型CNN之间的主要区别在于它们的网络结构不同。不同于简单的堆叠网络,残差网络将输入以恒等映射的形式直接连接网络层输出,其在数学上的表达为:图1.4残差网络其中H(x)为层之间的隐藏映射,x表述这些层中的第一个输入,F(x,Wi)为残差映射,激活函数为relu,为了简化符号,式中省去了偏差部分[67]。如图1.4所示,网络通过快捷连接将恒等映射和残差映射相加来实现F(x,Wi)+x,即不引入额外的参数,不增加计算复杂度。式中恒等映射x和残差映射F(x,Wi)的维数必须相等,如果两者维数不同时,通过用0填充F(x,Wi)得到的特征来维持特征矩阵的维度,残差函数内必须包含不小于两层卷积层。如图1.5所示,本文实验中,采用残差模块(Residuallearningblocks,ResLblocks),其中函数F(x,Wi)内部包含两层大小为卷积层。残差模块利用多层网络组合得到隐藏层输出,相比于原始数据,网络对残差的学习更容易。而将多个残差模块连接,可以有效的避免网络可能产生的梯度弥散或梯度爆炸问题,从而使网络的深层特征更稳定,增强了网络结构的鲁棒性[68]。BN层通过把每层数据转换为均值为0,方差为1的形式,可以使网络更快地训练和收敛。跨界连接中依旧采用恒等映射,即将上一层得到的特征一并作为这一层的参考,丰富了这一层网络的特征提取。图1.5残差模块1.3乐曲风格识别方法卷积神经网络(ConvolutionalNeuralNetwork,CNN)已经被广泛应用于音乐信息检索领域,如音乐标记,风格分类、音乐推荐系统等。CNN假定音乐在不同层次结构中存在不同的特征,并且可以通过卷积内核对其进行提取。但是卷积层和池化层的执行都不考虑其他区域。这种设置有一些明显的缺点。例如,在对前半段音频信号进行卷积或池化处理时,无论后半段是什么样子,前半段的特征始终保持不变。因此,它们无法捕获上下文的空间依赖性。针对这个问题,本文提出一种由卷积递归神经网络(ConvolutionalRecurrentNeuralNetwork,CRNN)和残差网络组成的混合网络,并同时提取音乐的时域特征和频域特征作为网络的输入,使网络可以学习到更多的音乐特征,从而做出更准确的风格识别。CNN与递归神经网络(RecurrentNeuralNetwork,RNN)结合组成卷积递归神经网络(ConvolutionalRecurrentNeuralNetwork,CRNN)常应用于文字识别领域。CRNN可以理解为是通过将CNN最后的全连接层替换为RNN后得到的网络模型。该结构首先在文献[69]中提出用于文档分类,后来应用于图像分类[70]和音乐转录[71]。1.3.1数据预处理在每首乐曲中,各种音频特征反映了这首音乐的本质特征,所以从音乐中先提取出音频信号的各种特征,通过识别这些特征来得到乐曲风格的分类,可以有效的提升模型识别能力的准确性。(1)过零率(Zero-crossingRate,ZCR)过零率是指,在采样到的每帧音乐信号中,信号从正到负或是从负到正的次数,即信号经过零点的次数。过零率可以有效地用于分辨清音、噪音和浊音。过零率在数学上的定义如下: (5-4)式中N表示帧内样本的个数,Fn表示第N个样本的振幅。Sign表示符号函数。(2)频谱质心(Centroid)频谱质心作为一个度量特征,反映的是频谱的“质心”的位置。频谱质心反映的是音乐声音的亮度。通常我们将频谱质心用于区分音乐声音中的不同音色。频谱质心在数学上的定义如下: (5-5)式中fn是第n帧,N是采样的总帧数。A(fn)是第n帧上的傅里叶变换的谱幅度值。(3)频谱通量(SpectralFlux,SF)频谱通量常是用来表示音乐信号频率的变化速度,基本原理是通过将当前帧的频率和前一帧的频率进行归一化处理得到二范数,随后比较并得出变化情况。归一化处理主要目的是使频谱通量不再依赖相位,只需要比较幅值的大小。频谱通量常用于区分音乐的音色或判断音乐信号是否发声。频谱通量在数学上的定义如下: (5-6)式中fn是第n帧,N是采样的总帧数。A(fn)是第n帧上的傅里叶变换的谱幅度值。(4)基于八度的光谱对比度(Octacve-basedSpectralContrast,OSC)相比于MFCC,OSC可以反映谐波和非谐波分量在频谱中的相对分布情况,保留更多的特征信息,从而使音乐风格识别网络具有更好的区分度。在一帧音乐信号中OSC的估计过程如下所示:图1.6OSC估计过程在特征提取过程中,将分窗大小设为200ms,重叠率50%。首先,对于每一帧信号,通过快速傅里叶变换(FastFourierTransformation,FFT)得到频谱分量。然后,通过八度音阶滤波器将频谱分为7个基于八度的子频带,其具体频率范围为:0赫兹-32赫兹、32赫兹-65赫兹、65赫兹-130赫兹、130赫兹-260赫兹、260赫兹-500赫兹、500赫兹-1000赫兹、1000赫兹-2000赫兹。在第k个频带中将FFT向量按升序排列得到{xk,1,xk,2,……,xk,N}。通过式(5-7)和式(5-8)计算每个子频带中的光谱峰谷值,通过式(5-9)对光谱对比度进行估计。 (5-7) (5-8) (5-9)最后,将光谱对比度映射到正交空间,并通过K-L变换来消除不同纬度之间的相关性。得到OSC特征信息。(5)梅尔倒谱系数(Mel-FrequencyCepstralCoefficients,MFCC)研究表明,人类听觉对不同频率的声波有着不同的敏感度,与真实声波的频率高低不成线性正比关系。通常当声波频率在200赫兹到5000赫兹之间时,声波信号对音频清晰度影响显。当人耳收到不止一种声音时,响度较小的声音通常不易察觉,这是因为人耳的屏蔽效应,即高响度的声波频率会覆盖地响度的声波频率。对此,MFCC利用梅尔频率的刻度对真实声波频率进行非线性转换,如下式所示: (5-10)梅尔频率倒谱系数反映的是音频信号的短时功率谱,经过倒谱分析,得到N维系数。对于一段音频信号,频谱反应的是短时内信号频率和信号强度之间的关系,常见的频谱图有相位频谱图和振幅频谱图。梅尔频率倒谱系数是根据梅尔谱进行倒谱分析计算得出。其提取算法如图1.7所示:图1.7MFCC提取算法框图首先采用一个高通滤波器1-az-1对信号进行预加重处理。每一帧信号可以看作是语音波形的轮廓和瞬时脉冲的乘积,这解释了在每一帧的开始和结束处会出现随机信号显著噪声的原因。针对这个问题,需要对每一帧添加一个汉明窗,如式(5-11)所示: (5-11)其中N取160,n∈[1,N-1]。随后音频信号经过快速傅里叶变换将时域信号转换到频域进行分析后,每帧的频谱将通过一组滤波器组进行过滤,计算出每个音带的音强。滤波器组由33个三角形带通滤波器组成,在梅尔频率中以0Hz~4Hz的等分间隔为中心频率。滤波器组的输出频率如式(5-12)所示: (5-12)其中Sk表示滤波器组中第k个滤波器的输出功率,n∈[1,12]。因此,我们可以通过式()计算出每帧的能量作为系数之一: (5-13)为了提高音频识别系统的表现,将时间变量考虑到静态参数中。通过下式得到delta系数: (5-14)根据上述计算,最后我们将从音频信号中提取出一个32维的梅尔频率倒谱系数。过零率、频谱通量、频谱质心为音频信号的时域特征,OSC和MFCC为音频信号的频域特征。本章对每首乐曲进行分帧处理,每帧帧长为1024个采样点,提取以上5种特征,组成一个55维的特征向量,作为音频信号这一帧的短时特征。每首乐曲的时长相同,且数据集的采样频率为22050Hz。首先对音频以16kHz的采样率进行下采样处理,将原始音频转为单声道,目的是为了去除音频多声道的重复信息。经过分帧加窗处理后,每帧包含1024个采样点,对于每一帧信号,提取时域特征过零率、频谱通量、频谱质心以及频域特征OSC、MFCC,组成55维的特征向量。同时窗口长度设为1024,重叠率为50%,可以得到936个特征向量。因为不能整除,936*512+1024=480256,多出的256个采样点通过0来进行填补。最后得到一个55*936的特征矩阵,作为网络的输入。1.3.2网络模型介绍尽管CNN在音乐风格识别任务中表现出良好性能,但仍有改进的空间。特别是,目前的技术只应用CNN来提取音频信号的局部特征,而忽略了音频信号在时间维度上存在依赖性。针对此问题,本文将在CNN的基础上进行改进,提出了由2层卷积层、2层残差网络和一个RNN网络组成的混合网络。首先利用卷积层从音频信号中提取局部特征,再利用RNN提取音频信号的时间依赖性。RNN能够额外捕获音频信号的时间依赖性,可以有效提高网络的性能。本文通过将CRNN和残差网络结合,实现了如图1.8所示的网络结构框架。CNN层可以提取出有效的中层特征,而残差网络可以学习到稳定的高层特征,这帮助RNN层更好地学习音频信号特征之间的空间依赖关系。图1.8网络模型图对音频信号进行预处理,提取到一个大小为1290×55的特征矩阵作为网络的输入。首先使用64个大小为7×7的卷积滤波器对输入矩阵进行卷积,生成许多特征映射共后续继续处理。卷积层后还需要经过批量规范化层(BatchNormalization,BN)、relu层以及最大池化层。这种处理是为了捕获音频信号的噪声因素之间许多不同类型的依赖关系。其目的是使网络能够提取足够的统计属性,从而准确检测特征矩阵的重要信息。残差学习子网络用于提取音频信号的有效高层特征。本方法采用四个二层恒等残差块组成残差学习子网络。对于二层恒等残差块,它有两个大小为3×3的卷积层,每个卷积层后是BN层、ReLU激活层和最大池化层。残差块的输入和输出大小应是一样的,但是在维度上,残差块输出的特征矩阵的大小将增加至输入的两倍。为了使输入输出具有相同的复杂度,在输出的维数增加后,通过大小为2×2的最大池化层对特征矩阵进行下采样映射。在本文方法中,残差学习子网络有四个处理阶段,将特征矩阵的维度从64维增加到512维。最后,网络原本的全连接层由RNN网络代替。RNN的加入,并且由其来总汇局部特征,可以使网络拥有更好的联系上下文的能力。RNN可以更好地聚合时间模式,同时也依赖于通过残差学习子网络提取到的音频信号局部特征。网络模型中各模块的参数和输出大小如下表所示:表1.1网络模型参数参数大小输出大小Input936×55×1CONV7×7@64930×49×64MAXPOOLING[2×2]465×25×64RESLBLOCKS3×3@64233×13×64RESLBLOCKS3×3@128117×7×128RESLBLOCKS3×3@25659×4×256RESLBLOCKS3×3@51230×2×512Reshape30×1024LSTM12830×512FC153601024FC102410该方法在网络结构和参数学习方面都比传统的CNN神经网络有着更高的效率。网络的第一部分由两层卷积层组成,卷积核个数分别为64和32,卷积核大小均为3×3,在每一层卷积层中,使用relu作为激活函数,随后是一个大小为1×3的最大池化层,设计为1×3的目的是为了保留音频信号时域的信息。第二部分由两个残差网络模块以及一个1×3的最大池化层组成,残差网络的加入,使得网络可以提取到音频信号中更稳定的深层特征,并且避免梯度弥散的问题发生。第三部分中,将提取到的特征映射重构为一个大小为的30×1024矩阵,然后输入到一个输出为30×512的LSTM网络中。最后,输出层是一个由10个单元组成的softmax层,它将特征映射到10种音乐风格的输出。1.3.3乐曲风格识别实验结果与分析本节将本文提出的方法与其他现有方法进行横向对比,证明本章提出的混合网络结构以及扩充输入特征的有效性。本实验分别在GTZAN数据集和ISMIR2004数据集下进行。对于GTZAN组,将数据集中的80%作为训练集,将剩余的20%作为测试集。对于ISMIR2004组,因为数据集本身已经对等分为训练集和测试集两部分,无需二次划分。(1)乐曲风格识别数据集在2002年GeorgeTzanetakis和Cook制作并公开了GTZAN数据集[72]。目前GTZAN数据集仍是音乐信息检索领域使用率最多的数据集之一。该数据集中分为乐曲风格和乐曲语音两个子数据集,乐曲风格集由市面上的CD、广播、麦克风等渠道收集的音频文件组合而成,共计1000首乐曲文件,每个音频文件的采样频率均为22050Hz,单声道数字信号大小为16bit,每首乐曲时长均为30s。整个数据集分为10种乐曲风格,它们分别是爵士、布鲁斯、古典、乡村、重金属、迪斯科、摇滚、流行、雷鬼和嘻哈,每个风格包含100首乐曲。ISMIR2004数据集来源于2004年音乐信息检索国际会议(InternationalConferenceonMusicInformationRetrieval,ISMIR)主办的音频信息比赛[73]。数据集由训练集和测试集两部分组成,两部分音频文件数量一致,古典乐320首、电子乐115首、世界音乐122首、爵士与布鲁斯26首、重金属朋克45首、以及101首摇滚乐和流行乐。数据库将乐曲风格划分为六类,样本共计1458首。每个音频文件的采样频率均为44100Hz,单声道数字信号大小为16bit,每首乐曲时间不等,时长最短为30秒,时长最长为5分钟。(2)不同方法的对比过去二十年,在音频内容分析领域中,对音频信号中提取各种特征信息的音频内容进行了许多研究。Tsunoo等[74]提出了一种基于均值聚类对音频信号的音色特征、节奏特征和低音特征进行处理的方法。Panagakis等[75]首次将音频信号的频谱时间调制特征(spectro-temporalmodulationfeatures)用于乐曲分类任务,并结合非负张量因子分解(Non-NegativeTensorFactorization,NTF)和高阶奇异值分解(theHigh-OrderSingularValueDecomposition,HOSVD)的多线性方法处理大数据张量推导出适合乐曲分类任务的特征向量。Seyerlehner等[76]通过块处理框架进行乐曲分类、标签分类和音乐相似性估计任务,其中模型对乐曲风格识别的表现较出色。Cao等[77]提出了一种以声学特征MFCC作为输入以及GSV-SVM作为建模框架的音频分类的方法。Costa等[78]将音频信号转换为声谱图,并从中提取LBP纹理特征代替基于音频内容的特征,证明了在乐曲分类实验中纹理特征比常用的音频特征效果更优。Wu[79]使用Gabor滤波器对音频信号捕捉纹理特征,同时通过最大后验自适应算法提取出信号的声学特征,将二者结合作为支持向量机的输入,得到了理想的准确率提升。表中将本章提出的方法与以上的现有方法分别在GTZAN和ISMIR2004两个数据集下进行比较。表1.2在GTZAN数据集和ISMIR2004数据集与现有方法对比%GTZANISMIR2004方法准确率方法准确率Tsunoo[74]76.1Cao[77]79.0Panagakis[75]78.2Costa[78]80.7Seyerlehner[76]81.5Wu[79]82.2CRNN+ResLBocks81.9CRNN+ResLBocks87.1表中显示了本章方法的最佳结果。从表中可以看出本章方法的乐曲风格识别准确率在两个数据集上均高于其他已发表论文的方法。输入特征的扩充为网络提供了更丰富的音频信号信息,残差模块使得网络能提取到更稳定的特征,最后由RNN网络对特征信息进行有效的归类。使得本章方法在GTZAN数据集中较其他方法提高了0.4%准确率,在ISMIR2004数据集中较其他方法在准确率上提高了4.9%。1.4乐曲音高序列处理演奏乐曲的时长通常在30秒至5分钟不定。如图1.9是一首4分钟时长乐曲的声谱图,可以看出波形的采样点数量非常大,信息长度很长。但是对于音乐水景观系统的水型控制,只需要知道乐曲在一段时间内的变化趋势,因此并不需要这么高精度的数据。而喷泉水型的切换相对缓慢,不需要获取乐曲在极短时间内的变化情况。因而在准确提取音高序列的后,还需要在音高包络的基础上进行简化采样,即在曲线上取少量点,在保留原本曲线特征的情况下,将其变换为折线图。图1.9声谱图对音高序列的分段处理,对于控制系

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论