利用独立分量分析法提取语音特.doc_第1页
利用独立分量分析法提取语音特.doc_第2页
利用独立分量分析法提取语音特.doc_第3页
利用独立分量分析法提取语音特.doc_第4页
利用独立分量分析法提取语音特.doc_第5页
已阅读5页,还剩2页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

利用独立分量分析法提取语音特性在此文中,我们提出一种新的利用独立分量分析法的讲话的语音特性。独立分量分析方法提供语音信号适合的Gabor-like 特性的基本函数的有效编码。基础函数有些冗余,所以我们利用排列方法选择一些基本函数。基本函数在低频基本矢量到高频基本矢量几乎都是有规律的。这也和人类的实际语音信号在低频段有较多信息是相一致的。这些特性能够被应用到自动语音识别系统中,而这种新的方法比常规的melfrequency cepstral features方法有更快的识别速度。一、 导言语音信号是composed of independent higher order statistical characteristics.独立分量分析方法已经基于higher order statistics从自然的语音信号和音乐声中提取特征向量1,2。这些特性是时域和频域同时起作用的。然而,没有人类语音的特性被提取用作语音识别。在本文中,我们将叙述从人类语音中提取of Gabor-like features。提取语音特性很像一个有窄带宽度和中心频率的带通滤波器。带通滤波器用数学处理方法设计成有中等大小的中心频率,而他们的带宽也取决于一个特定的数学工具。在听觉特性提取处理中,滤波器的作用就和耳膜的作用一样.在内耳的耳蜗,语音信号引起耳膜上的mechnical的振动。耳膜的不同的局部的振动是对不同频率的语音信号的反应。然后在听觉中基于特征处理的每个带通滤波器都耳膜的频率特性为模型。另外一方面,在这篇文章中摆列基本矢量反映输入语音统计特性比其他滤波的方法都好。对于有时的结构设计,提取特性系数矢量被用于行列基本矢量中。最后,对ICA-based features识别速率与mel-frequency cepstral coefficients (MFCCs)做一个对比。二、 用ICA提取语音特性为了从语音信号中提取独立分量特性矢量,ICA算法应用了很多人类的语音片断。一个ICA网络是为了获得独立分量u从语音片断x中,还有从x中用顺序分量矩阵W取出基本函数系数u。ICA假设x是独立分量u的线性混合。如果A代表W的逆矩阵那么A的列表示x的基本特性矢量。 为了提取基本函数一必须利用混合矩阵A或者分离矩阵W,所以我们用混合矩阵W。图一:基本向量ICA网络图已知的准则是基于最大互信息量H(y),可以表示成3 (1) (2)这里p(u)代表语音信号的近似概率密度函数,。这里g(u)是一个非线性函数,它近似于语音信号u的积累分配函数3。自然梯度被引入来改善收敛速度,特别是这种方法不要求逆矩阵W,还提供了一下的规则: (3)这里是源信号的概率密度函数,被叫做score function. 用已经知道(3)式的规则,W被反复用梯度上升的方法校正只到达到收敛,让我们令N是随机发生语音信号片断的尺寸。图一所示的基本向量工作网络图。ICA网络是composed输入N和输出N,N基本向量是由矩阵A()从N中产生的。三、 SELECTION OF DOMINANT FEATURE VECTORS为了语音识别,我们可能要从基本向量N中选择主要特征向量。ICA算法从繁多的输入信号中找出独立分量,可能这样的结果时会有多余的分量混在其中。为了减少这种分量,几个技术已经被提出5。图形二:(a)规则的非混合矩阵W列向量,(b)频谱 在本文中,基本向量在语音信号和基本向量系数的可变性中的贡献是要被尊重的。尊重的意思就是基本向量在语音信号中的强大作用,能表示基本向量的重要关系。因此,从基本向量N规责的 ,M的主要特征能被选择出来。可变性表示了基本向量系数的变化,而这就是基本向量和语音信号识别的重要关系的表现。图4(a)所示的基本函数重先排序,(b)表示相应的基本向量的系数系数可变性。One can see those two ordering methods provide almost same basis vector order and basis vectors after about 30th are negligible in both contribution and variability. The obtained M feature vectors constitute theM-channel filter-bank, and provide a spectral vector every time frame.图3:(a)基本向量的排列 (b)频谱四、 真实数据和识别实验为了从人类的语音信号中获得基本向量,75种口音和59个人被用来完成这个实验。Speech segments composed of 50 samples, i.e., 3.lms time interval at I6kHz sampling rates, were randomly generated. Total segments were generated, and each segmentxwas pre-whitened to improve the convergence speed I. The whitening filter, Wz 是:This removes both first- and second-order statistics from the input data, x and使协方差矩阵的x =I.接下来,ICA中的分离矩阵W可以从等式(3)中华的。W被初始化为一个确定的矩阵,假设是一个sign函数。这个假设是基于真实语音信号分量的拉氏变化的。这改进了语音信号的编码效率,大部分u的系数总是0只有很重要的语音信号被编码在拉氏变换以后。图4:(a)基本向量(b)基本向量系数的变化整个语音片断被分割成300 sweeps through,W每100个语音片断就被校正一次。第一个100sweeps区速率被确定为0.001,接下来的100sweeps为0.0005,最后100sweeps被确定为0.0001。获得分离相量如图2(a)所示,(b)为他们的频率变化范围。最后,50个基本向量被从W的逆矩阵中获得。图3的(a)和(b)表示50个基本向量和他们的频率变化范围。几个已知的像Gabor-like滤波器的基本函数是同时使用于时域和频域的。图3所示,基本向量绝大部分是从低频分量到高频分量排列的,这和人类语音的有很大的信息在低频分量是相关的。 图5:(a)ICA基本向量的中心频率(b)MFCC滤波器的中心频率ICA基本特性被用作为独立的识别任务。75个韩语单词组成的词汇,The vocabulary consists of 75 Korean words, and 38 and IO speakers uttered once to form training and test data, respectively.整个单词模型被用作分级,and were represented by 15-state left-toright continuous-density hidden Markov model (CDHMM).语音特性被提取出来和M特性向量如图3(a),a) on 30ms time window every 1Oms。The Mspectral components energies were scaled logarithmically, and 13 cepstral coefficients were extracted. For comparison, standard MFCC features were extracted. In MFCC feature extraction process, filter bank which have 18 mel-scaled center frequencies in figS(b) were used. Then, logarithmically scaled 18 spectral components were transformed to 13 cepstral coefficients by discrete cosine transform (DCT).图5(a)和(b)表示ICA基本向量和MFCC滤波器的中心频率。比较它们可以看出他们有线性分布的中心频率。30th基本向量有接近4600Hz的中心频率,在这个范围我们可能得到更充分的频谱信息来识别语音信号。表1表示MFCC标准和特征提取得方法对于不同的M的结果。在图4(a)中找出20的特性向量,我们的方法使错误率减少了47.4%。这个结果表示,只要很少的u的系数就可以充分的为语音信号编码。五、 结论这篇文章中,我们用信息最大化方法为ICA语音识别提出了一个新的语音特性。ICA成功的应用到语音信号的有效编码中提取语音特性。很多提取特性是在时域和频域都有用的,这些语音特性使新的滤波器出现,and each filter provides localized spectral compoents in every time frame of input speeches.新的特性证明了比MFCC有更好的识别能力。ICA基本向量取得比MFCC滤波器更好的语音信号。六、 参考书目 1 Bell A.J. and Sejnowski T.J.: The ”Independent Components”of natural scenes are edge filters, Vision research,1997, vol. 37, (23), pp.3327-33382 Bell A.J. and Sejnowski T.J.: Learning the higherorderstructure of a natural sound, Network: Computationin Neural Systems, 1996,7, pp.26 1-2663 Lee T.W.: Independent component analysis - Theoryand applications, Kluwer Academic Publishers, 19984 Amari S., Cichocki A., and Yang H.: A new learningalgorithm for blind signal separation, Advances in Neurallnformation Processing Systems, 1996, 8, pp.757-7635 Bartlett M.S., Lades H.M., and Sejnowski T.J.: Independentcomponent representations for face recognition,Proceedings of the SPIE Symposium on ElectronicImaging: Science and Technology; Conferenceon Human Vision and Electronic Imaging 111, San Jose,California, January 19986 Oja E.: The nonline

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论