DSP课程设计报告--语音识别._第1页
DSP课程设计报告--语音识别._第2页
DSP课程设计报告--语音识别._第3页
DSP课程设计报告--语音识别._第4页
DSP课程设计报告--语音识别._第5页
免费预览已结束,剩余16页可下载查看

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、DSP课程设计实验报告语音识别院(系:电子信息工程学院设计人员:学号:班级:吴凡08212020通信0807成绩.工程设计50报告20答辩30总分指导教师签字:日期:、设计任务书二、设计内容10三、设计方案、算法原理说明四、程序设计、调试与结果分析15五、设计(安装与调试的体会2526六、参考文献、设计任务书语音识别(Sp eech Recog nition是指让机器听懂人说的话,即在各种情况下,准确的识别语音的内容,从而根据其信息,执行人的各种意图或执行特定的任务,其最终目标是实现人与机器进行自然语言通信。利用DSP可以对语音信号进行实时采集、 提取语 音特征向量、进行语音识别。语音识别系统

2、对语音特征参量的提取可以采用FFT等算法,不同的参数表示不同的频谱包络。本设计要求利用DSP的DMA方式进行信号采集和信号处 理,对语音信号进行实时识别。语音识别按不同的角度有以下几种分类方法1. 识别的单位分类:有孤立词识别、音素识别、音节识别、孤立句识别、连续语音识别和理解。2. 识别的词汇量分类:有小词汇(10-50个、中词汇(50-200个、大词汇(200以上等。3. 讲话人的范围分类:有单个特定讲话人、多讲话人和与讲话者无关。4. 识别的方法分类:有模块匹配法、随机模型法和概率语法分析法。本实验的主要任务就是通过 TMS30VC5402对语音信号“ 0” “ 1、“ 2进行训练和识别

3、,并由相应的灯LED0、LED1、LED2亮来显示结果是否正确;该系统核 心识别算法采用动态时间规整(DTW算法,主要流程包括预处理、端点检测、提取 特征值、模式匹配和模板训练。二、设计内容(1对A/D、D/A进行初始化;(2根据识别系统的类型选择一种识别方法,采用语音分析方法分析出这种识别 方法所要求的语音特征参数,作为标准模式由机器存储起来,形成标准模式库。(3对语音进行特征参数的分析,语音信号经过相同的通道得到语音参数,生成 测试模板;(4将测试模板与参考模板进行匹配,将匹配分数最高的参考模板作为识别结果 从而实现语音的识别。三、设计方案、算法原理说明1系统概述输入 语者一预处理f图1语

4、音识别基本原理图语音识别基本原理如图1所示。模拟语音信号经过数字化处理(即采样和量化 过程之后,再经去噪和预加重环节得到较干净的数字语音信号。信号起止点检测的 主要作用是从各类背景噪声中找出语音的开始和终止点。这一环节对于后续特征 参数的提取非常重要。在孤立词语音识别中,确定语音起止点可有效减少系统计算 量。另外,在相对较 安静的环境下,依靠短时能量与过零率这两个特征就可以很好地 完成语音信号的起止点判决。整个语音识别系统可分为两个阶段,即训练阶段和识别阶段。 在训练阶段,由 用户说出若干训练字,系统根据一定算法建立上述训练语句的特征参考模板 ;在识别 阶段,则从使用者的发音资料中先导出相关特

5、征参量,再将这些参量与事先训练好的 特征参考模板进行相似度计算(即模式匹配。若两者的相似度大于设定的门限值, 则予以确认,反之系统则会拒识。(实际中,采用相似度最大者作为匹配结果输出2. 硬件构成(1.系统构成这里采用DSP芯片为核心(图2,系统包括直接双访问快速SRAM、一路ADC/ 一路DAC及相应的模拟信号放大器和抗混叠滤波器。外部只需扩展FLASH存储器、电源模块 等少量电路即可构成完整系统应用。电源楼块13 V25 VIB V功KDAC- ADCPGACluck OeoXTAL1报側LEDRS 212 jGP】OIf ARTIt ,nii理需«,t-丿DSP片 i RAMA

6、 ROM样 ft囲2 语音识别电路(2.系统主要功能模块构成语音处理模块采用TI TMS320VC5402,其主要特点包括:采用改进的哈佛结构,一条程序总线(PB,三条数据总线(CB, DB , EB和四条地址总线(PAB, CAB , DAB ,EAB ,带有专用硬件逻辑CPU(40位算术逻辑单元(ALU,包括1个40位桶形移位器 和二个40位累加器;一个17 X7乘法器和一个40位专用加法器,允许16位带或不带符号的乘法,片内存储器(八个辅助寄存器及一个软件栈,片内外专用的指令集, 允许使用业界最先 进的定点DSP C语言编译器。TMS320VC5402含4 KB的片内ROM和16 KB的

7、双存取RAM , 一个HPl(HostPortlnteface接口,二个多通道缓冲单 口 MCBS P(Multi-Cha nnel Buffered Serial Port ,单周期指令执行时间 10 ns ,带有符合IEEE1149. 1标准的JTAG边界扫描仿真逻辑。语音输入、输出的模拟前端采用TI公司的TLC320ADSOC ,它是一款 集成ADC和DAC于一体的模拟接口电路,并且 与DSP接口简单,性能高、功耗低,已成为当前语音处理的主流产品。16位数据结 构,音频采样频率为222. 05 kHz,内含抗混叠滤波器和重构滤波器的模拟接口芯片还有一个能与许多DSP芯片相连的同步串行通信

8、接口。TLC320AD50C片内还包 括一个定时器(调整采样率和帧同步延时和控制器(调整编程放大增益、锁相环PLL、主从模式。TLC320AD50C与TMS320VC5402的硬件连接,如图3所示。f TO afa-fbcodec (a aw帳程测谓音3. 语音识别算法软件实现(1系统流程图(初始化codec a HE+5征參败禮立議慑J(检测语咅返回检测结町结車 (2端点检测端点检测的目的就是在复杂的应用环境下的信号流中分辨出语音信号和非语音信号,并确定语音信号的开始及结束。好的端点检测方法能改变语音识别软件存在的检测效果不理想、识别率低等问题。用短时能量短时过零率结合的方法,此方法实现简单

9、,在噪声干扰不大的环境中可以取得较好的识别效果为了减小语音帧的截断效应,需要加窗处理,采用hamming窗,10, 12cos(46. 054. 0 (w<=N n N n n w 因为矩形窗的主瓣宽度最小,旁瓣高度最高, 会导致泄漏现象,哈明窗的主瓣最宽,旁瓣高度最低,可以有效的克服泄漏现象,具有 更平滑的低通特性,应用更广泛。短时能量定义为:语音信号强度的度量参数02(1On S E N n w -=§短时平均能量的主要用途: 可以从语音中区别出浊音来,因为浊音时短时平均能量的值要比清音时短时 平均能量的值大很多; 可以用来区别声母和韵母的分界、无声和有声的分界等 作为一种

10、超音段信息,用于语音识别中。短时过零率:波形穿过横轴的次数&=|1(sg n (sg n|210n s n s Z w w ? <-> =0, 10, 1 sgn(x x x短时过零可以看作信号频率的简单度量:浊音时能量集中于较低频率段内,具有 较低的过零率,而清音时能量集中于较高频率段内,具有较高的过零率。短时平均幅度:Z-=100(N nwn S M这里用计算加权了的信号的绝对值之和替代平方和,因而短时处理的方法比较简单,硬件更易实现。因此本实验采用短时平均幅值和短时过零率相结合的双门限端 点检测法双门限端点检测顾名思义需要两级检测,即短时平均幅值检测和短时平均 过零率

11、检测.首先用短时平均幅值进行第一次判别,然后用短时平均过零率进行第二次判 别开始检测之前,为计算整体平均幅值,当短时平均幅值大于 的整体平均幅值或者 第m+1帧的短时过零率大于3倍的第m帧的短时过零率,即找到了语音的开头.当短时平 均幅值小 于的整体平均幅值,就找到了语音的结尾。两种可能会引起端点检测的误判,一是短时噪音引起的误判,此时则需要引入最 小语音长度门限进行噪声判定,即语音段时间小于一定数值则认定为是噪声.二是语 音中字与字的时间空隙引起的误判,此时需要设定最大静音长度门限来降低识别的错误率。这种双门限端点检测是最常用的孤立词识别所采用的端点检测方法,其方法物理意义明确,计算量小,在

12、安静的环境中有较好的识别率,但它也有很多不足,例 如门限值 需要由经验来设定,更换实验环境,则效果不理想等可以采用的改进方法:采用动态窗长短时能量检测语音端点。检测时首先要对 语音信号进行加窗分帧处理,如果窗的长度过大,在提高检测速度的同时导致识别 率的下降,如果窗的长度过短,在提高检测识别率的同时增加了检测的时间.考虑此种 情况,采用动态窗长短时能量端点检测方法,在静音段使用大窗长,进入过度段后,改 用小窗长,进入语音段则使用正常窗长.(3特征量提取矢量量化的过程是:将语音信号波形的K个样点的每一帧,或有K个参数的每参数 帧,构成k维空间中的一个矢量,然后将这个矢量进行量化临界带特征矢量是指

13、:将一帧信号的功率谱按频率高低分成若干个临界带,每 个临界中的功率谱求和,即可得到相应的临界带特征矢量。每一帧信号都对应一个 若干维的临界带特征矢量临界带特征矢量算法的过程第一步,求出每一帧的加窗语音 Xn(m:m=0(N-1,的DFT的模平方值| Xn(k|2 此即为功率 谱。做256点的DFT变换,采样频率 为8kHz,窗长为38ms(即N=256, 窗形为汉明窗。| Xn(k|2与原始加窗语音信号的频谱模平方|Xn (exp( jwk|2具有下列关系:| Xn (k| 2=|X n (ex p( jwk| 20-256其中,wk =2 n fk , fk=第二步,划分临界带。在o fs

14、/2中确定 若干个临界带频率分割点。确定的方 法是将i=1,2, 3?代人下面的式子中,即可求出相应的(以Hz为单位。由此可以求出并且,由构成第一临界带,构成第二临界带,以此类推。在实验数 据中需要安排了 16个临界带。第三步,求临界带特征矢量。将每一个临界带中的功率谱I Xn (k|2取和,即可得到相应的临界带特征矢量。如果用 表示临界带特征矢量,则每一个分量可通过以下的式子求得。h严、1X2) F从而,每帧都可以得到一个16维的临界带特征矢量:(4特定人语音识别算法(两个特征量的比较目前较为常用的语音识别算法有 DTW算法(动态时间归整法、HMM算法(隐马尔可夫模 型法和ANN算法(人工神

15、经网络法 等。考虑到DSP存储资源的有 限性与系统运行实时 性等要求,本文设计采用了计算量相对较小,内存空间占用少,算 法简单、高效的DTW算法。该算法基于动态规划 (Dynamic Programming, DP的思 想,很好地解决了发音长短 不一的模板匹配问题,在小词汇量的语音识别中获得了较 优的识别效果。动态时间归整算法基本原理如下:以T和R分别表示测试和参考模板,为计算两 者之间的相似度,可以计算它们之间的距离 D T, R。距离越小,相似度越高。设n 和m分别是T和R中任意选择的帧号,d(n, (m表示这两帧之间的距离。距离函数 取决于实际采用的距离度量,在DTW算法中通常采用欧氏距

16、离。欧氏距离(Euclidean distanee也称欧几里得度量,是一个通常采用的距离定义,它是在m维空间 中两个点之间的真实距离。在二维和三维空间中的欧氏距离的就是两点之间的距离。二维 计算公式P = V( -x22+(y1-y22。若n=m,则可以直接进行计算,否则要考虑将T(n和R(m对齐。对齐可以采用线性扩张的方法,但这样会忽略掉语音中各个段在不同 情况下的持续时间,将会出现或长或短的变化情况,使识别效果难以达到最佳。因此, 更多时候采 用的是动态规划(DP的方法。以n为横轴、m为纵轴构建一个二维网 格,网格中的每一个交叉点(n, m表示测试模板中的某一帧与训练模板中的某一帧的交汇点

17、。动态规划算 法就是确定一条路径,路径通过的格点坐标即为进行距离计算的帧号。路径不是随 意选择的,首先任何一种语音的发音快慢都有可能变化,但是其各部分的先后次序不 可能改变,因此所选的路径必定是从左下角出发,在右上角结束,如图所示DTW算法路径原理示意图一I 1 4I:J为了使路径不至于过分倾斜,将各段线段的斜率限制在0.52。如果路径已通过 图中格点(ni-1,m i-1,则下一个通过的格点(ni , m i只可能是下列三种情况之一: 用n表示上述三个约束条件,求最佳路径的问题可以归结为:满足约束条件n时,求最佳路径函数,使沿该路径的积累距离达到最小值,即编程时,可以在数据区开辟出两个n X

18、 m的矩阵,即积累矩阵D和帧匹配距离矩其中帧匹配距离矩阵d(i, j的值为测试模板的第i帧与参考模板的第j帧的距离, 而D(n, m则为最佳匹配路径所对应的匹配距离,DTW算法可以直接按上面的描述 来实现。通 过将测试模板和模板库中各个参考模板分别进行DTW运算,就可以找到与测试模板匹配 距离 最小”的参考模板。当这一匹配距离值小于所设的门限值 时,就可识别出所输入的语音信号。四、程序设计、调试与结果分析(1程序清单:(见工程文件中,vr.c(2测试数据:输入语音为“ 0 ”输入语音为“ 1”输入语音“ 2 ”J73.-327Tlfl-1已qICH- M删lOfl-弘S-TTTDlEfLObe

19、00 m血丐.皿L;(1耐1iQirti的fi 1柑flfii r口 I和i«iAfln-i “!«测试结果及分析:识别识别“ 0识别“ 2 ”通过多做数据的采集及结果分析:据实际测试数据可得系统识别率较低,不是很理想,分析原因可能有以下几点:1、程序中端点检测的门限是由经验所得,不能完整获得语音的起点和终点,同 时,不确定的外界噪音干扰也会影响端点的检测。2、特征提取算法不够完善及提取特征比较单一,只是语音信息提取不够完整, 致使语音 的比较产生较大误差。3、模板的录入也是经过此算法,因此,录入模板过程和测试过程,外界环境和说 话者发 音不可能一样,这也会造成最后结果产生偏差。五、设计(安装与调试的体会吴凡:在实验

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论