语音识别的研究_第1页
语音识别的研究_第2页
语音识别的研究_第3页
语音识别的研究_第4页
语音识别的研究_第5页
已阅读5页,还剩17页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

西北师范大学物理与电子工程学院2006届电子信息工程毕业设计语音识别的研究作者:庞 明 杨 玲 执导教师:裴 东 王全洲 (届别:2006届 专业:电子信息工程 班级:2002级电子甲班 学号:200272020126 20022020138)摘要: 与机器进行语音交流,让机器明白你说什么,这是人们长期以来梦寐以求的事情。语音识别技术就是让机器通过识别和理解把语音信号转变为相应的文本或命令的技术。而我们对语音识别系统的研究主要由三部分组成:主控系统、语音录入播放部分、执行部分;由主控系统发出命令,接着进行语音播报,执行部分执行主控命令。 本系统采用SUNPLUS公司生产的一款集16位MCU, A/D,AGC, 2KRAM, 32K Flash等在一块芯片上,且具有DSP功能的SPCE061A单片机。由它来完成语音识别及对直流电机的控制。本语音识别系统除了识别准确度高、系统体积小、耗电省、价格低、性能可靠的特点以外,还具有较快的运算速度,可实现实时的语音识别。并且本系统的语音提示功能为人机交流提供了一个良好界面。以上的特点充分体现了嵌入式语音识别的优势。本系统在进行语音训练的基础上可以实现特定人的语音识别和人机对话,如在此基础上进一步改进,会实现非特定人的语音识别,将更为完善。关键字:语音识别,主控系统,SPCE061A单片机,人机交流Research of Speech RecognitionAuthor :Yang ling Pang ming Tutor : Pei dong Wang quanzhou( Year:2006th falls due Major: Electronic information projectClass:In 2002 level electronic first class Number:200272020138 200272020126)Abstract:Human being earnestly long for the communication and understanding with machines through speech. Speech recognition means the high technology which lets machines understand the speech on basis of the text or command converted from speech signal. The research field of speech recognition system which this paper focuses on is made up of three main parts including host-control system, speech record & play and implementation. Firstly host-control system sends out command, and the secondary play & record part broadcast this speech, then the host-control command executed by the implementation part.Host-control system adopts SPCE061A single-chip made by SUMPLUS. SPCE061A implements the speech recognition and controlling of servo motor. For instance, when sent out the command “BROTHER”, the system prompts to be in speech recognition. While sent out the command “Turn left”, the servo motor implements through the turning of specific angles. The system will go on with the repeated recognition in that way. Although at current time the system has not achieved the unrestricted communication between human being and machines, its advantages are simple operation, convenient control and expanding.KEY WORDS: speech recognition, host-control system, servo motor, speech between human being and machines引 言 语音识别是一门交叉学科,语音识别正逐步成为信息技术中人机接口的重要技术,语音识别技术与语音合成技术结合使人们能够甩掉键盘,通过语音命令进行操作。语音技术的应用已经成为一个具有竞争性的新兴高技术产业。我国语音识别研究工作起步于五十年代,近年来发展很快。研究水平也从实验室逐步走向实用。从1987年开始执行国家863计划后,国家863智能计算机专家组为语音识别技术研究专门立项,每两年滚动一次。我国语音识别技术的研究水平已经基本上与国际同步,在汉语语音识别技术上还有自己的特点与优势,并达到国际先进水平。其中具有代表性的研究单位为清华大学电子工程系与中科院自动化研究所模式识别国家重点实验室。 我们的学习研究是先从以下几个方面入手的,首先利用网络和图书馆等资源查阅相关资料,并对资料加以分类、整理。通过讨论我们先确立该题目的大致轮廓,接着在王老师、裴老师的指导下,我们确立了开题报告和工作计划,这样我们就有了明确的方向,两人的任务也就明确了。以上工作的确定后便是前期的调试工作,通过学习凌阳单片机的硬件和IDE开发环境,我们掌握了其开发设计流程,这样我们完成了语音录入播报的调试。前期工作的完成便进入了设计的主题其关键是怎样利用语音识别去控制电机,这其中主要包括语音压缩与编码、语音训练、语音识别等问题。在指导教师的指导与启发下,先解决语音压缩与编码,利用凌阳提供的语音压缩算法,对所需的语音进行压缩编码,以成为微处理器可处理的文件,这样由程序流程图,我们再次利用凌阳的专用语音API函数,来完成软件编程。而电路则按照原理图PCB图实物板焊接调试检测。以上只是粗略的对语音识别进行的初步研究,以下的篇章是对此的详细介绍!目 录1总体设计思路5 1.1语音学的相关知识5 1.2电机的相关知识6 1.3语音信号的压缩和编码72 方案比较与论证82.1中央控制系统82.2电机的选择93 系统设计103.1语音识别原理分析与说明103.1.1语音识别基本原理103.1.2特征提取和谱失真测度分析113.1.3语音信号的矢量量化分析113.1.4语音信号的模板匹配法113.1.5语音信号的隐马尔可夫模型123.2器件的选型与外围部件的制作123.2.1中央控制系统SPCE061A123.3电路设计与说明133.3.1控制系统电路133.3.2电源电路143.3.3语音录入和播放电路143.4软件设计153.5语音词汇量的选择164系统调试174.1硬件调试174.2软件调试174.2.1第一阶段174.2.2第二阶段175指标测试176系统说明176.1使用说明176.2系统说明187结束语188致谢及参考文献191 总体设计思路第一步,研究语音学的相关知识;第二步研究语音信号的压缩和编码及语音识别的相关知识;第三步,设计运用二个伺服电机和凌阳61板实现左转右转的功能.总体设计流程图如下:否否开 始复 位识别播放语音播报语音识别语音训练成功否右转前进后退左转1.1语音学的相关知识 人类说话的声音就是语音。语音的声学四要素是音强、音调、音色和音长。音强表明了语音的振幅强弱;音调表征了语音的频率快慢;音色表征了语音的频谱特征;音长是指语音持续的长短。对于汉语来说,音强与音长只能区别声音的强弱,而语义则要依靠音调和音色来区别。因此,对语音的研究包括语音信号处理和语言理解两部分。语音信号处理包括:数字化、预加重处理、防混叠滤波。语言理解即语言要表达的思想、观点等语义信息。1.2电机相关知识1.2.1伺服电机简介 伺服电机是由一个小型直流电机,一组变速齿轮组,一个反馈可调电位器以及一块电子控制板组成。高速转动的直流电机提供了原始动力,带动变速(减速)齿轮组,使之产生高扭力的输出。微行伺服电机的工作原理一个微型伺服电机是一个典型闭环反馈系统,其原理可由下图表示:减速齿轮组由电机驱动,其终端(输出端)带动一个线性的比例电位器作位置检测,该电位器把转角坐标转换为一比例电压反馈给控制线路板,控制线路板将其与输入的控制脉冲信号比较,产生纠正脉冲,并驱动电机正向或反向地转动,使齿轮组的输出位置与期望值相符,令纠正脉冲趋于为0,从而达到使伺服电机精确定位的目的。1.2.2直流电机简介直流电机的电磁感应导电的绕组称为电枢绕组。电枢绕组是直流电机实现机电能量转换的枢纽。电枢绕组的构成,应能产生足够的感应电动势,并允许通过一定多电枢电流,从而产生所需的电磁转矩和电磁功率。此外,节省有色金属和绝缘材料,结构简单,运行可靠;所以直流电机系统应用更为广泛。1.2.3步进电机简介步进电机是一种直接将电脉冲转化为角度位置的机械装置,角度的多少取决于脉冲的数量,它和与其配套的步进电机驱动装置共同组成了一种非常简单,低成本的开环控制系统。可预先发出具体的脉冲数量,从而得到需要输出的角度。也可根据发送脉冲的速度,得到需要的电机的转速。通过对系统的高低电平控制,得到正/反旋转的效果,在电机锁定情况下(电机绕组中存在电流,外部没有要求旋转的电脉冲),仍有静止力矩的输出;通过对脉冲速度的控制,可直接得到极低的转速而不需要通过齿轮箱的过渡,从而避免了功率的损耗和角度位置的偏差。不需要象普通的直流电动机通过电刷和换相器换相,从而减少了摩擦,增长了寿命。1.3语音信号的压缩和编码 1.语音压缩编码中的数据量 数据量=(采样频率*量化位数)/8*声道数(字节数) 压缩编码的目的是通过对数据的压缩,达到高效率存储和数据转换的目的。即在保证一定音质的条件下,以最小数据量来表达和传送声音信息。2.压缩编码的必要性 PC机中的音频文件占用的存储空间很大,对于微处理器来说想要存储大量的信息显然是不可能的,必须将音频文件进行压缩。3.常见的几种音频压缩编码 1)波形编码 是将时间信号直接变换为数字代码,使重建语音波形信号保持原来语音信号的形状。其特点是话音质量高,数码率高,适用于高保真音乐及语音。2)参量编码(声源编码) 是将信源信号在频率域或其他正交变换域提取特征参数,并将其变换成数字代码进行存储或传输的过程。其特点是压缩比大,计算量大,音质一般,廉价。3)混合编码 是将参数编码技术和波形编码技术结合起来使用。为了方便使用,凌阳公司提供了各种音频压缩编码的算法及API函数库,即SACMLIB。如下表格:模块名称(Model_Index)语音压缩编码率类型采样率/KHZSACM_A200016Kb/s,20Kb/s,24Kb/s16SACM_S480/S7204.8Kb/s,7.2Kb/s16SACM_S2402.4Kb/s24SACM_MS01音乐合成(16,20,24)Kb/s16 2 方案比较与论证2.1 中央控制系统对于一个应用系统主控电路是其“心脏”,所有功能的实现都是有其发出指令通过外围电路来实现,因此中央控制系统的好坏决定了这个系统的好坏。方案一:SUNPLUS的SPCE061A单片机优点:内含2K字SRAM,32K字FLASH,内部集成了语音处理功能的DSP模块、AGC和ADC电路。外围电路简单易控制,对于语音处理非常方便。缺点:体积大与之相应的功能和结构就较复杂,这样上手起来较难。指令是SUNPLUS自有的与MCS-51不兼容,因此通用性较低。方案二:AT89C51单片机优点:高性能CMOS 8位单片机,片内含2Kbytes FLASH和256bytes的RAM,兼容标准MCS-51指令。体积小,控制简单、灵活、自由。缺点:RAM和FLASH过小,语音程序不能直接存储,需进行扩展增加了电路的难度而且存在语音压缩问题。当处理大容量的语音时速度慢而且难度较大。方案三:DSP TMS320VC5402 优点:多总线结构,可完成各种复杂的功能,片内采用哈佛结构处理速度高(达到100MHZ),采用多级流水线技术处理大容量的程序非常方便,支持多处理器结构这样更容易处理语音压缩程序;功耗低。 缺点:结构和功能复杂较难掌握,而且需要较深的数学算法推算。专用的指令及CCS仿真环境上手比较难;硬件配置较复杂。为了能自由的控制语音程序,以及考虑到电路的难度问题我们决定采用SUNPLUS单片机作为主控芯片。2.2电机选择从广义上讲,电机是电能的变换装置,包括旋转电机和静止电机。旋转电机是根据电磁感应原理实现电能与机械能之间相互转换的一种能量转换装置;静止电机是根据电磁感应定律和磁势平衡原理实现电压变化的一种电磁装置,也称其为变压器。我们这里使用的是旋转电机,其具体分类如图2:方案一:直流电机 优点:价格低廉,体积小巧。 缺点:速度与电压相关,不便于控制调节。方案二:伺服电机 优点:控制简单,反应速度快,体积小,功耗小,大扭力,装配灵活,相对经济。缺点:首先它是一个精细的机械部件,超出它承受范围的外力会导致其损坏,其次它内藏电子控制线路,不正确的电子连接也会对它造成损毁。方案三:步进电机优点:通过控制脉冲个数来控制角位移量,从而达到准确定位的目的;同时您可以通过控制脉冲频率来控制电机转动的速度和加速度,从而达调速的目的。因此在需要准确定位或调速控制时均可考虑使用步进电机。缺点:由于步进电机存在空载启动频率,所以步进电机可以低速正常运转,但若高于一定速度时就无法启动,并伴有尖锐的啸叫声;不同厂家的细分驱动器精度可能差别很大,细分数越大精度越难控制;并且,步进电机低速转动时有较大的振动和噪声。为了在体积、质量上尽量的小,而且控制方便,我们选择了结构简单,运行可靠,价格低廉,体积小巧的直流电;而且我们对此驱动电路的技术比较成熟。3 系统设计3.1 语音识别原理分析与说明3.1.1 语音识别原理分析语音识别分为特定发音人识别(Speaker Dependent)和非特定发音人识别(Speaker Independent)二种方式。特定发音人识别是指语音样板由单个人训练,对训练人的语音命令识别准确率较高,而其他人的语音命令识别准确率较低或不识别;非特定发音人识别是指语音样板由不同年龄、不同性别、不同口音的人进行训练,可以识别一群人的命令。下面我们介绍采取特定发音人语音识别方式。我们将标准模式的存储空间称之为“词库”,而把标准模式称之为“词条”或“样板”。所谓建立词库,是将待识别的命令进行频谱分析提取特征参数作为识别的“标准模式”。识别过程(如图3-1所示)首先要滤除输入语音信号的噪音和进行预加重处理,提升高额分量,然后用线性预测系数等方法进行频谱分析,找出语音的特征参数作为未知模式,与预先存储的标准模式进行比较,当输入的未知模式与标准模式的特征一致时,计算机便识别出输入的语音信号并输出结果。语音 语音分析滤波、预加重滤波器组PARCOR线性预测系数相关函数模式匹配词典识别结果输出图3-1 识别过程框图输入的语音与标准模式的特征完全一致固然好,但是,语音含有不确定因素,完全一致的情况几乎不存在,事实上没有人能以绝对相同的语调把一个词说二遍。因此,要预先制定好计算输入语言的特征模式与标准模式的类似程度(或距离度)的算法规则,把距离最小(即最类似)的模式作为识别相应语音的方法。3.1.2语音识别中的特征提取及谱失真测度 语音识别的第一步是特征提取也称前端处理。与之相关的内容是特征间的距离度量。特征的选择对语音识别的效果至关重要。其常用的方法有如下三种:带通滤波器组法的频谱参数及其失真测度、线性预测频谱系数及其谱失真测度、Mel频率倒谱系数极其失真测度。3.1.3语音信号的矢量量化矢量量化VQ(Vector Quantization)是一种极其重要的信号压缩方法,从20世纪70年代才发展起来的。它广泛用于语音编码、语音识别与合成、图象压缩等方面。量化分为标量量化和矢量量化。标量量化是将取样后的信号值逐个的进行量化;而矢量量化是将若干个取样信号分成一组,即构成一个矢量,然后对此矢量进行一次量化。矢量量化的过程是先将语音信号波形K个样点的每一参数帧,构成K维空间中的一个矢量,然后对这个矢量进行量化。3.1.4语音信号的模板匹配法 模板匹配法是多维模式识别系统中最常用的一种相似度计算方法。因为语音信号具有相当大的随机性,在进行模板匹配时,这些变化回影响相似度的计算,从而使识别正确率降低,因此在模板匹配时如果只对特征矢量序列进行线性时间规整,词中的音素就可能对不准,所以最好采用DTW(Dynamic Time Warping)-一种非线性时间规整模板匹配法,适用于运算速度、存储容量等资源有限的嵌入式语音系统。DTW采用动态规划技术DP(Dynamic Programming)把一个复杂的全局最优化问题化为许多局部最优化问题,再一步一步的进行决策。3.1.5语音信号的隐马尔可夫模型 隐马尔可夫模型HMM(Hidden Markov Models)是一种描述随机过程统计特性的概率模型。语音信号是一种时变非平稳的随机信号,建立一个模型来表征它是对其分析和处理的前提和基础。HMM是一个双重随机过程,包括一个代表状态转移的马尔可夫链和一个代表观察值输出的随机过程,通过将隐马尔可夫的状态与语音的某个平稳段相对应,以及各个平稳段之间移动与状态转移相联系,可以很好的表征语音信号整体上的时变非平稳性和局部的短时平稳性。此外HMM既可以描述暂态的,又可以描述动态的特性,所以它能够利用这些超音段和语音结构的信息。3.2 器件的选型与外围部件的制作3.2.1 中央控制系统 SPCE061ASPCE061A是型单片机是凌阳科技公司最新推出的一款16位微处理器,具有体积小、集成度高、易扩展、可靠性高、功耗低、结构简单、中断处理能力强等特点,内嵌32K字闪存FLASH,处理速度高,能够很方便的完成普通单片机的功能,61A内嵌DSP功能尤其适应于数字语音播报和识别等应用领域,是数字语音识别与语音信号处理的理想产品,得到了广泛的应用。主要性能如下: 16位nSP微处理器; 工作电压:内核工作电压VDD为3.03.6V(CPU),IO口工作电压VDDH为VDD5.5V(I/O); CPU时钟:0.32MHz49.152MHz; 内置2K字SRAM; 内置32K闪存ROM; 可编程音频处理; 晶体振荡器; 系统处于备用状态下(时钟处于停止状态),耗电小于2A3.6V; 2个16位可编程定时器/计数器(可自动预置初始计数值); 2个10位DAC(数-模转换)输出通道; 32位通用可编程输入/输出端口; 14个中断源可来自定时器A / B,时基,2个外部时钟源输入,键唤醒; 具备触键唤醒的功能; 使用凌阳音频编码SACM_S240方式(2.4K位/秒),能容纳210秒的语音数据; 锁相环PLL振荡器提供系统时钟信号; 32768Hz实时时钟; 7通道10位电压模-数转换器(ADC)和单通道声音模-数转换器; 声音模-数转换器输入通道内置麦克风放大器和自动增益控制(AGC)功能; 具备串行设备接口; 低电压复位(LVR)功和低电压监测(LVD)功能; 内置在线仿真板(ICE,In- Circuit Emulator)接口。3.3 电路设计与说明 3.3.1 控制系统电路用32768HZ晶振和两个20P的电容构成一个61的最小系统,而且系统时钟有锁相环电路可提供多种实时时钟源;芯片内集成看门狗,可通过程序的方式清看门狗或者手动复位电路防止程序跑飞,而不用关闭电源。061A芯片的A和B口线全部以插针形式引出方便外部扩展。3.3.2 电源电路系统电路采用稳压电路电路如下图所示。5V直流电压经过SPY0029(稳压为3.3V)后给整个系统供电,并通过电解电容和瓷片电容分别滤去低频和高频的干扰波。3.3.3 语音录入和播放电路 语音录入和播放的原理框图: SPCE061A麦克风读/写存储器A/D转换编码、解码D/A转换喇叭语音录入如图所示语音录入主要有Microphone、AGC、和ADC电路构成,61A内置了AGC电路和ADC电路,所以只需一些电阻和电容就可完成。语音播放如图所示SPCE061A内置两路10位DAC,只需外接功放电路即可。采用SPY0030做功率放大(工作电压2.4V,输出功率700mW)。3.4软件设计开 始檫除RAM中的语音命令模型调用第1条提示音播放训练触发名称成功否训练第1条命令成功否训练第2条命令成功否开始识别初始化语音识别器启动实时监控调用提示识别音播放识别主循环获取识别结果 图3-4 语音识别主程序框图3.5语音词汇量的选择 语音识别以规模分,有小词汇(10-50个)、中词汇(50-200个)、大词汇(200以上)。在所有的情况下,语音识别的识辨率都随单词量的增加而下降。根据我们使用的SPCE061A的FLASH的限定以及电路难度我们选择小词汇量。4 系统调试4.1 硬件调试首先,我们对直流电机的性能作了一系列的测试:扭矩、PWM的控制问题及两电机相互工作的协调性;其次对录放音电路进行测试(包括声音的大小,外界干扰对识别率的高低等)。4.2 软件调试语音的软件调试分为几个阶段第一阶段:先独立对电机进行控制,实现电机的正、反转和两电机的协调转动。接着添加语音进行控制来实现我们所要达到的指标。第二阶段:整体的统调 ,首先进行语音训练,看是否有干扰,再进行识别与电机的相互协调。5 指标测试可持续工作时间:2小时电机转速:5圈/秒(通过程序可调节速度)训练指令:4条6 系统说明6.1 工作流程本产品的运行流程概述:启动开关后,先进行一次语音播报,进入语音训练阶段。训练成功时有语音提示;接着便进入语音识别阶段;例如:先发出识别命令得到提示后发“左拐”命令,电机就转动。如遇到强干扰源使得程序跑飞,只需安下复位键或关闭电源,重新启动。要让它停止时只需再次按下开关即可。6.2 系统说明1本系统采用价格低廉、体积小、高速度的SPCE061A作为主控芯片,提高了系统的稳定性,增强了系统的抗干扰能力,其内部集成了AGC和ADC电路,电路制作简单,易于扩展。2.系统采用C语言和汇编语言交叉的方式,程序自有、灵活,代码执行率高,开发周期短,可移植性强。3.系统使用3节1.5V镍氢电池供电,而其本身体积小,便于移动、携带,适应于不同的工作场合。4.我们此次的研究只是对语音识别技术的初步探讨,实现了一些相对简单的功能,下一步还有许多工作要做: .我们利用语音识别实现了对电机的控制,怎样将电机应用到实际中去,例如制作成机器人、智能玩具,实现人机交流或者和它们做游戏等。对于特定人语音识别的特性,还可将其应用于安防系统;例如:保险柜的开启,将主人的特定语音存储到系统中并加以固化,这样只有主人才能打开此保险柜。.我们只是对特定人的语音识别进行了一些探讨,对于非特定人的语音识别其前景更广。对电路进行扩展(扩展存储空间),并建立语音词库,这样可实现多人与机器的对话。例如:2000年7月在

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论