(电子科学与技术专业论文)基于嵌入式的特定人语音识别智能轮椅设计.pdf_第1页
(电子科学与技术专业论文)基于嵌入式的特定人语音识别智能轮椅设计.pdf_第2页
(电子科学与技术专业论文)基于嵌入式的特定人语音识别智能轮椅设计.pdf_第3页
(电子科学与技术专业论文)基于嵌入式的特定人语音识别智能轮椅设计.pdf_第4页
(电子科学与技术专业论文)基于嵌入式的特定人语音识别智能轮椅设计.pdf_第5页
已阅读5页,还剩42页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 针对人们特别是残疾人愈柬愈需要智能轮椅来改善他们的生活质量和生活自山 度的需求。本文设计了一种物美价廉的智能轮椅柬满足人们的需要。 本文以$ 3 c 2 4 4 0 作为主控芯片,在l i n u x 操作系统下,通过对电动轮椅增加由凌 阳( s p c e 0 6j a ) 单片机,稳压电源电路,驱动电路组成的语音控制系统,实现用声音 对电动轮椅的控制。该系统的软件采用隐马尔可夫模型( h 删) 的特定语音辨识,可以 有效的解决特定人的语音识别,拓展现有电动轮椅的使用人群的范围。其中研究内 容主要是语音识别部分,l i n u x 系统下控制部分,以及基于q t e m b e d d e d 的图形用户 界面。语音识别如果通过硬件束实现不仅比较困难,而且制作成本较高t 别效果不好; 选择通过软件柬实现语音识别,这不仅降低了成本而且减少了元件缩小了整机的体 积。 关键词:l i n u xo t e m b e d d e dh m m 语音识别电动轮椅 a b s t r a c t p e o p l ew i t hd i s a b i l i t i e sm o r ea n dm o r en e e df o ri n t e l l i g e n tw h e e l c h a i r st oi m p r o v et h e i r q u a l i t yo f l i f ea n d f i e e d o mo f l i f e n e e d st h i s p a p e r p r e s e n t sas m a r ta f f o r d a b l e w h e e l c h a i r t om e e tt h en e e d so f t h e m i nt h el i n u xo p e r a t i n gs ) s t e n l s 3 c 2 4 4 0a st h em a s t e rc h i p 、o i c ec o n t r o ls y s t e mi s c o m p o s e db yi n e r e a s i n gs l u s f s p c e 0 6 1 a im i c r o c o n t r o l l e r p o w e rs u p p l yc i r c u i t d r i v e c i r c u i t t oa c h i e 、7 eu s i n gv o i c ec o n t r o lo fe l e c t r i cw h e e l c h a i rt h es y s t e m ss o f t w a r e h i c h u s e sh i d d e nm a r k o vm o d e l ( h m m ) s p e e c hr e c o g n i t i o n s p e c i f i cc o u l de f t e c t i v e l 3s o l v e s p e c i f i ch u m a ns p e e c hr e c o g n i t i o n a n de x p a n dt h eu s eo fe x i s t i n ge l e c t r i c h e e l c h a i r r a n g ec r o w da m o n g t h e mt h es t u d yi sm a i n l yi n c l u d e dp a r to fs p e e c hr e c o g n i t i o nl i n u x s y s t e mc o n t r o ls e c t i o n a n db a s e do nq t e m b e d d e dg r a p h i c a lu s e ri n t e r f a c e i ti si n o r e d i f f i c u l tt oa c h i e v es p e e c hr e c o g n i t i o nb ) t h eh a r d w a r e m e a n w h i l ep r o d u c t i o nc o s i si s h i g h e rr e c o g n i t i o nr e s u l t s a r en o ts a t i s t h c t o r yc h o o s et oi m p l e m e n tv o i c er e c o g n i t i o n t h o u g hs o f t w a r e t h i sn o to n l yr e d u c e st h ec o s tm a dc o m p o n e n t t h ev o l u m eo ft h ew h o l e r o a c h i n e k e ) w o r d s :l i n u x $ 3 c 2 4 4 0q t e m b e d d e d h m m s p e e c h - r e c o g n i t i o n s p c e 0 6 1 a e l e c t r i c w h e e l c h a i r 目录 摘要 a b s t r a c t 目录 第一章绪论 11 设计背景 12 研究概况和发展趋势 13 语音阻别存在的问题 14 本沦文的主要内容和研究步骤 第二章智能轮椅语音识别的理论基础及原理 2l 语音学基础知诅 22 语音识别的前端处理、 23 语音特征提取 24 模型训练与模型匹配 第三章嵌入式智能轮椅语音识别系统的硬件设计及实现 3l 系统硬件电路的构成 32 主控模块$ 3 c 2 4 4 0 33 电源模块 34 语音模块 35 存储模块 36 通信模块 37 电机模块 第四章嵌入式智能轮椅语音识别系统的软件与实现 1 系统软件的总体设计方案 2b o o t l o a d e r 引导程序的设计 3l i n u x 系统在a r m 平台上的移植 4 系统程序设计 5 基于刚e m b e d d e d 的界丽程序设计 第五章实验测试与结果分析 第六章总结与展望。 61 总结 62 展望 致谢 参考文献 :4 o墙m m圬埽虬船踮龋卯蚋酾如虬钔叭北 第一章绪论 11 设计背景 赫i t 曝查显示我固各类残疾人总数为8 2 9 6 万人,占人口总数63 蛳其中肢体妓 障人士有2 4 0 0 多万占残疾人总数的2 90 7 ,而难以操纵普通轮椅的严重肢体残疾 人士有1 0 0 0 多万,占有相当大的比例。随着我国人口的老龄化,这个数字还在以每年 1 0 的速度增长,因此对智能化轮椅的需求量将越来越大。目日口在国外市场上智能化 轮椅售价大约在25 玎到6 万美元而普通的电动轮椅也要1 0 0 0 到1 万美元,这对于 我国普通百姓是很难以承担的,同时对生产工艺要求较高出现故障叫一般维修人员 很难处理短时l 刊内难以大规模推广,因此我们迫切需要一种物美价廉的智能轮椅米 满足人们的需要。 随着社会的发展和人类文明程度的提高,人们特别是残疾人愈来愈需要运用现代 高新技术柬改善他们的生活质量和生活自由度。对很多肢体残疾人来说,轮椅作为一 种辅助工具在他们的生活中起到越来越大的作用。普通轮椅可以满足轻微残疾人的需 求,而对于那些伤践严重及一些肢体麻痹或身体瘫痪的入束说,即使是电动轮椅也显的 “力1 ;从心”。为了让这部分人可以有更大的活动自由度,国内外的研究人员一直致力 于智能轮椅的开发。目前德国的乌尔姆大学已经研制出一种依靠计算机作为处理器的 智能轮椅:r 本的索尼公司也研制出一种依靠识别使用者的面部表情来控制运动方同 的智能轮椅:这些智能化较强科技台量较高的电动轮椅,较普通电动轮椅相比价格高 昂。而运用免费的丌源l i n u x 操作系统的嵌入式设备,可目主研发经费较低。且具 有良好的人机交互界面g u i 。因此研究基于嵌入式智能轮椅的语音识别技术,对解决 残疾人问题有很重大的意义。 1 2 研究概况和发展趋势 在智能控制发展领域,语音这种人类最原始,最自然的交换方式,其实际应用较 少其技术还不太成熟。语音控制智能轮椅技术是语音识别技术在智能控制领域的应 用。因此,语音诎j 别技术的研究状况就决定了语音控制技术方面的研究。 语音口 别技术有悠久的历史,语音识别技术最早丌始于2 0 世纪5 0 年代,人们门: 始认识到语音识别技术的研究意义,并丌始一些简单的数字元音部分的研究研究其 频谱特性。并取得了可喜的成绩,其识别率达到9 8 。随后的2 0 年i 可,语音识别技术 迅猛友展人们并不满足单个元音的语音识别,丌始致力于孤立词的识别研究。并在 硬件上出现了滤波器组,束实现频率特性的提取。软件上出现了几种较成功的以别算 法。有线性预测分析法、动志蚬整算法,这两种算法的出现是语音识别发展上的重大 突破解班了语音信号产生模型的问题并解决了语音不等长的匹配问题。此后, 研究人员在这两种算法的基础上又研究出两种算法,矢量量化模型和隐马尔科夫模型。 最重要的一点是出现了特定人孤立词的语音识别系统,并把语音识别技术推广到很多 领域,出现了语音打印机。语音电再等产品。2 0 世纪8 0 年代,出现了语音识别的重大 突破t 即隐马尔科夫模型和人工神经网络在实际中的应用。出现丁英语听写机,且是 基于统计模型技术研制而成的。非特定人连续语音识别系统在现实中得到应用。这是 语音识别技术的又一次质的飞跃。随f 6 n , 研究都是基于隐马尔科夫模型并以此加以 改进。近2 ( ) 年内,语音识别技术更加成熟,识别率越来越高, 别的词汇量越来越多。 且伴随着嵌入式领域的迅猛发展,语音识别技术的实际应用越来越广泛,出现了语音 拨号的手机语音网络信息检索等语音产品。在工业、通信、家电、汽车电子、医疗 等领域都取得了可喜的成绩,使语音产品广泛的应用到人们的生活中。 而嵌入式这种可剪裁,低功耗,高性价比等特点,为语音识别提供了广泛的发展 空l w 。使语音识别技术的应用更,“泛。但目前语音识别还存在一定的困难,整个嵌入 式语音识别系统还不是很完善,特别是对语音信号的噪声处理方面一直存在着不完 善的地方需要我们进一步的研究与学习。 13 语音识别存在的问题 语音识别的优劣受很多因素的影响,如说话的语调,晓话快慢,环境噪声及电气 噪声等。目前,语音识别存在的问题主要有以下几个方面: 首先是自适应性方面存在的问题。只有在语音训练的环境下应用语音识别爿会有 较高的识别率,而在与语音训练环境有差异的环境下应用语音诎别技术,有时会产生 较严重的偏差。 二是对连续语音的识别进展很慢,由于汉语语音连续音节具有相似性及山于说话 人的情绪,说话方式等方面的影刑,连续性极易识别错误。 三是在高噪声环境下,由于语音为非平稳信号高噪声源易与之混叠,分离出干 净的语音信号较难。 1 4 本论文的主要内容和研究步骤 本课题通过对语音识别技术的学习,综合本研究对象的特点提出了一种新的应用 于叫、词汇量、孤立词、特定人”场合的汉语语音识别方法。结合a r m 9 硬件平台,l 】i i u x 操作系统以及q t e m b e d d e d 图形用户界面,把汉语语音识别方法应用于嵌入式智能轮 椅设计中使轮椅具有良好的人机交互功能,使用者可以用简单的口令柬自动控制轮 椅的运动。本论文主要研究步骤如下: ( i ) 简要地介绍了本论文的设计背景,语音识别的研究概况及发展趋势,晟后阐 述本论文的研究步骤。 ( 2 ) 智能轮椅语音识别基本原理,即语音学知识、语音识别的d h 端处理。分析语 音识别的模板训练的几种算法,及模扳匹配方法的优缺点,选出种适用于叫、词汇 量、孤立词”的训练匹配算法。 ( 3 ) 讨论语音识别所采用的常用的芯片选择,及选择实时性较好的硬件平台。介 绍语音芯片s p c e 0 6 1 语音识别的硬件设计选用l i n u x 操作系统作为开发环境并选 用$ 3 c 2 4 4 0 作为主控芯片实现语音训别系统的硬件设计。 ( 4 ) 介绍嵌入式设计的软件平台,l i n u x fb o o t l o a d e r 引导程序的设计l i n u x 在a r m 硬件平台上的移植,分析语音识别的基本算法完成智能轮椅语音识别系统的 驰动程序设计及基于o r e m b e d d e d 的图形显示: ( 5 l 对实验测量的结果进行统计分析。 第二章智能轮椅语音识别的理论基础及原理 我们每个人都有独特的声道特性和发音特点,语音识别i t 是依据这种特点进行特 定人辨识的- 但是语音议别如果通过硬件柬实现不仅比较困难而且制作成本较高且 识别效果并不理想:于是我们选择通过软件柬实现语音识别,这不仅降低丁成本而且 减少了元件,缩小丁整机的体积。 语音识别程序原理是依掘s d 及特定人辨议的原理,该语音样板由单个人训练,也 只能识别某人的语音命令,对他人的命令识别率较低或几乎不能识别,语音识别的步 骤分为两步,第一步称为学习或训练,通过对特定人的小词汇量孤立词进行训练, 形成模型库存储起来,以各模式匹配比较。第二步就是识别,根据模式匹配原理构成 的语音识别系统如图21 所示语音识别系统本质上是一种模式泌别系统,他包括常 规模式识别的三个基本要素,即语音信号的特征提取,模型库模板匹配。首先先对 输入的带有噪声的语音信号进行前端处理,得到较干净的语音信号。然后对语音信号 进行特征提取提取其特征参数,与己存在的模型库进行匹配比较,若匹配则语音输 出或输出相应的控制命令等后处理操作。语音识别系统的实现是非常复杂的,他会在 这三个基本要素的基础上进择适当的算法,并结舍语音学基础知识分析处理其特性, 实现其功能。所以在实现语音匹配等算法前,应首先了解语音学的基础,即语音的产 生,及其产生模型。以便我们理解其识别原理。 h 前端处理fh 特征提取ih 模式匹配h 后处理 一一i 。一 语音输 识别结果 图21 语脊识别原理 21 语音学基础知识 2 11 语音的产生 人类的发音器官包括三大部分:肺部、喉部、口部。发音器官又可以分为喉上器 官和喉两大部分喉上器官由口腔、鼻腔和咽腔几个部分组成的。声带是两条有弹性 筋肉的带,事实上是气管内壁延伸的术端。前端固定在甲状软骨上,后端固定在杓状 软骨的的声带突上。两条声带之削隔以声门裂,声门裂d 口方是音声门,后方是气声门。 当呼吸时声门大开。当发声时声门关闭呼出的气流必须冲丌声门而出。由于伯努 利效应,声门复归关闭,当声门下气压足够大时又冲肝声门。如此反复开闭,就形 成声带周期性的颤动,发出乐音性质的声音。喉腔、咽腔、口腔、唇腔和鼻崆组成人 类发音器官的声腔是非常灵活富于变化的共振腔“。 声带的声学功能是为语音提供主要的激励源。由声带振动产生的音统称为浊音 而不由声带振动产生的音统称为清音。 21 2 语音信号产生模型 经过长期的实验研究表明,不同的激励所产生的声音是不同的。如图22 所示 表示语音信号的产生模型。 幽22 语音信呼的产生模型 激励模型产生的是斜三角脉冲波,它是由周期脉冲发生器经过声门脉冲模型与随 机l 曝声发生器相级联,产生的斜三角脉冲波。单个斜三角波的频谱为2 0 i gg ( e 4 舯1 l 。 它是一个低通滤波器。其幅度谱按1 2 d b 倍频程的速率衰减。将其表示为z 变换的全 极模式的形式有 g ( z 、= ,:一 ( 。g ,zi ) ( 1 - g ,z 1 ( 21 如果g ,和g ! 都接近于1 ,则由此形成的激励信号频谱很接近于声门脉冲的频谱, 需要指出的是,不同人不同声音其声门脉冲的形状不一定相同。我们只要其博立 叶变换的近似特性即可。单位脉冲串及幅值因子表示成z 变换 e ( = ) 2 与 ( 22 ) 所以整个激励模型可表示为 吣) _ g 即j _ 尚f 嘉= 面 ( 2 : 声道模型是指将声道视为一个谐振腔,共振峰就是这个模型的谐振频率。一般用 个共振峰表示一个元音就够了。对较复杂的辅音和异音则需五个以上的共振峰。 辐射模型是指从口唇段辐射出的模型。从图中可以看出语音信号的产生模型是由 这三种模型级联而柬的 22 语音识别的前端处理 2 21 语音信号的数宇化和预处理 为了将原始的模拟语音信号变为数字信号必须经过取样和量化两个阶段,从而 得到和幅度上均为离散的数字语音信号。 语音信号是随时间而变化的一维信号,它所占据的频率范围可达到l o k h z 以上 但其有用的信号频带限于3 0 0 1 i z 至3 4 0 0 1 t z 范围。根据采样定理,数字化采样频率取 8 k h z ,但在实际语音信号处理中,取样频率经常取1 0 k h z ,本设计为了得到更高的识别 率将语音频率高端扩展到7 k h z ,相应的取样频率提高到1 5 k h z 。为了防止不明确信 号带宽是出现频率混叠现象,本设计在取样前接八反混叠滤波器即低通滤波器,使带 宽限制在一定范围内”。 取样之后要对信号进行量化,将整个幅度值分割为有限个匡l 可,将落入同一区间 的样本部赋值相同的幅度值。量化后的信号等于量化前的取样信号和量化噪声的和。 一般量化噪声是一个自噪声,等概率分布,且与输入信号不相关。 对语音信号处理分析前要进行反混叠滤波等处理如图23 所示,反混叠滤波器做 成带盘为34 k h z 的低通滤波器,阻带为4 6 k h z 以上,防止了混叠失真。培后经过平 滑滤波防止高次谐波失真。 语音 输入 r 一 r r 一麟:凇h 柚ch 分析处理卜 语音输出 _ | 平滑滤波l d a c lj 合成处理i 一 削23 语音数字分析的原理框幽 2 22 噪声处理 噪声因应用环境的变化而变化特别是语音信号,其噪声源很多。有风、呼吸噪 声、随机噪声、电气噪声、及本设计中电机周期性运转而产生的周期性噪声等等。不 可能每一种噪声都进行处理,本设计中只滤除干扰性较大的噪声,即噪声源眦、呼l 殁 噪声、随机噪声的宽带噪声。 此种噪声遍布于语音信号整个频谱之中,不容易处理。本设计用减谱法处理,语 音在1 0 m s 至3 0 m s 的分析帧内可近似看成是平稳的。从带噪声的语音的短时谱中减去 频谱估值,便可得到较纯净的语音信号。减谱注的原理图如图24 所示。 带噪声 的语音 去噪的语音 1 ”r1 | | 2 一一目一 位 1 医习厂习 1 1 ,一【_ _ + o 噪声 方差 目24 减谱法的原理幽 首先,将带有噪声的语音信号先经过傅立叶变换,再对其求功率谱,其功率谱减 去噪声方差就可以还原较干净的语音。再将功率信号转换为幅度信号。最后一步就是 想办法还原语音方法是用噪声相位对语音信号进行补偿,经过傅立叶逆变换重现语 音。此时的语音便为本设计中前期处理得到的较纯净的语音。 2 23 端点检测 端点检测是指在语音信号中将语音和非语音信号时段区分开束,准确地确定 出语音信号的起始点。经过端点检测后,后续处理就可以只对语音信号进行,这 对提高模型的精确度和识别f 确率有着非常重要的作用。 端点检测技术可以节约系统处理时日j ,因为端点检测技术把语音信号和非语 音信号时段区分丌柬,所以在语音识别系统中可以减少数据的采集量。在语音编 码中端点检测还能降低噪声和静音段的比特率,提高编码效率。而且它还能排除 无声段或噪声段的干扰。提高语音识别系统的抗噪声性能。 目前,端点检测技术分为基于短时能量和短时平均过零率的端点检测,基于 倒谱特征的端点检测,基于熵的端点检测和基于复杂性的端点检测。 图25 为数字4 的短时能量与平均过零率。从图中可以看出语音信号和 噪声信号在能量上是可以区分丌柬的。在信噪比较高的情况f ,通过基于短时能 量和短时平均过零率的端点检测便可把语音信号分离出来。这种方法可蛆较粗略 的分辨出清音和浊音,有无说话。从表21 中可以看出当信噪比较低时这种方法 的识别率会很低,低于7 0 。根据本设计的设计要求。无论信噪比的高低,识别 率要求不能低于8 0 ,故本设计不能选用此种方法。 哪 2 0 0 04 0 0 06 0 0 0 0 0 0 01 0 0 0 01 2 0 0 01 4 0 0 0 1 6 0 0 0 1 8 0 0 0 刃 2 0 4 08 01 0 01 2 01 4 01 0 0 1 0 02 0 02 2 0 从j 八一 2 0 4 06 08 01 0 01 2 01 4 01 6 01 8 02 0 0 2 2 0 凹25 数字“4 ”的短时能撼与平均过零率 , 0 1 柏 如 0 加 0 5 d s ;。e 5 n 表2i 孤立词基丁短时髓培自短时平均过零率的端点检测的准确率 s n r 白噪声( ) 办公室噪声)工厂噪声( ) s t a r te n ds t a r te n ds t a r te n d 3 0 d b 1 0 0 】0 09 89 79 7g j 2 0 d b9 69 69 68 88 8 8 9 15 d b8 l8 37 47 37 7 7 6 1 0 d 87 37 46 26 57 06 9 表22 孤立词基于倒谱特征的端点检测的准确奉 s n r 白噪声( )办公室噪声( )工厂噪声f ) s t a r te n ds t a r te n ds t a 】一te n d 3 0 d b】0 01 0 09 69 39 79 5 2 0 d b9 6 9 ( 5 8 3 8 l8 5 4 3 1 5 d b8 i8 36 96 57 27 j 1 0 d b7 37 46 2j o0 86 0 5 d b6 05 8 表23 孤立词基丁熵的端点检;9 1 | l 的准确率 p 白噪声( )办公室噪声( )工厂噪声( ) s 1a r le n ds t a r e n ds t a rlf n d 3 0 d b 1 0 0 】0 0 1 0 0 1 0 0 1 0 0 1 0 0 2 0 d b 9 89 69 8 9 6 9 69 7 1 5 d b 9 j 9 d 9 4 9 2 9 d 9 3 l o d b9 08 9 9 l 8 99 08 9 5 d g7 96 3 7 4 6 3 7 9 6 3 o d g6 04 2j 6j 1j 04 4 表2 - 4 孤立词基丁c 。复杂度的端点检测的准确率 p 白噪声( )办公室噪声( )工厂噪声( ) s t a r te n ds t a r te n ds 1 a r te n d 3 0 d b1 0 0】0 01 0 01 0 0】( 1 01 0 0 2 0 d b9 89 j9 j9 59 59 5 15 d b9 99 89 69 99 99 8 io d b9 68 09 99 09 78 8 5 d g8 78 09 98 4 8 7 8 4 o d b8 47 8 9 9 7 98 2 7 3 上表是对15 0 个说话人经试验测定的数据,从表中可以看出只有基于c 。复杂 度的端点检测在较低的信噪比下仍有很高的准确率。故根据数据要求本设计选用 基于岛复杂度的端点检测。其步骤如下: 首先求x ( ) 的离散傅立叶变换,( ) ,有: x ( 女) = f i x n ) 】 ( 24 ) 然后可求出幅度谱的平均值为 ;= 专喜。( ) 其中,1 ( 25 ) 为频域变量,n 为( ) 的长度即女的虽大值。 对规则部分贡献的频谱( ) 作博立叶反变换f “( ) ,即得x ,( ”) 。 所以有: 五( h ) = f “i ( x ( 女) ( 2 6 ) 至此t 求得了规则部分时问序列五( n ) 。 a o 日2 善曲“( 27 ) c 。2 舞 汜。, 求得复杂度o 。 23 语音特征提取 语音特征的提取与选择是语音识别的个重要环节。常用的一些声学特征有 线性预测系数l p c c ( i ,in e a r 卧e d l c t iv ec e p s t r a lc o d i n g ) ,m e l 倒谱系数m f c c ( m e lf r e q u e n c yc e p s t r u mc o e f f lc ie n t ) 。t f c c 参数具有良好的识别性能和 抗噪能力但其计算量和精度都要求很高。l p c c 的优点在于计算量小。易于实现, 缺点在于抗噪性能差,在对于汉语识别的时候对辅音识别差,所以本课题采取 的是m 0 1 频率倒谱系数( m f c c ) 。 实际上人耳的听觉特性是一个特殊的非线性系统,它的响应不同频率的信号 的灵敏度也不同,是一个倒数的关系9 。所以选用基于人的听觉的特征参数,即 m e l 频率倒谱参数来实现对语音的特征提取。倒谱系数是一种描述语音信号的良 好参数t 其优点在于:它比较彻底的去掉了语音信号产生过程中的激励信息,主 要反映声道额响,而且只用十几个参数就能较好地描述语音的共振峰特征j 。 m e l 频率倒谱系数( m f c c ) 的提取过程如图22 所示。 “嘲。! 圈“醒圈“柱 幽26w e l 频率倒谱系数( m f c c ) 的提取过程 m f c c 参数的提取包括以下几个步骤:首先对语音信号预加重,通过一个一阶 有限激励响应高强滤波器,使信号的频谱变得平坦,不易受到有限字长教应的影 响。对预加重后的语音信号进行分帧处理加一个汉明窗将语音信号划分为很 多短时的语音段,在语音短时平稳允许的时间间隔内,增加可处理的帧数,可减 少语音分帧处理造成的不连续性。再对分帧加密后的语音信号进行快速傅晕叶变 换,得到语音信号的功率谱。用m e l 频率滤波器组滤除频谱中的高频分量。最后 对其求倒谱,即司盎处理,使其可以分开激励源与信道,最终得到倒谱系数,语 音信号中的主要信息都集中在倒谱中。 24 模型训练与模型匹配 模型训练和模型匹配是语音识别最核心的部分模型训练是根据已有的准则 从大量的模型中提取其特征参数及统计特征参数形成模型库。模型匹配是指录入 的语音的特征参数与模型库的按照一定的规则进行比较匹配获得最佳匹配结 粜。 语音识别的模式匹配和模型训练有:动态时间规整模型d t w ( d y n a m i ctj f i e w a r p in g ) ,隐马尔可夫模型h 删( h i d d e nm a r k ovm o d e l ) 、人工神经网络模型a n n ( a r t i f ic l a ln e u r a ln e t w o r k sm o d e l ) 别中,h m m 的f 识率己达到d t w 的水平, 。实验证明,在与讲话者无关的语音识 而所需要求的存储量和计算时问却小_ 1 计选择隐马尔可夫模型( h m m ) 。 在隐马尔可夫模型( h m m ) 中、模型的i l 练是指在给定韧始模型参数后,用 模型输出对其进行校j 下。来优化模型参数。对隐马尔科夫模型而占,状态转换序 列是隐臧的,一个观察序列可能由任何一种状态转换序列产生必须考虑所有的 状态装换序列。但是,实际上要列出所有的转换状忐并不现实。本设计用迭代法, 设已知输出y ( 即给定观察序列) 和仞始模型五= 九且b z ) 则定义n 时刻状态为 s ,”+ l 时刻状奋为s 的概率为 善。“舻p ,【l = s ,k = 棚 ( 2 9 ) 其归一化值为 和,= 业嗡等业 汜,。, 山于n ( ,) 为抑制y 及工的条件下,月时刻出现状卷为s ,的概率,有 棚2 骑幢弗( 2 而r 。( f ) 就是出现状态s 次数的均值,那么从状态s ,到状态s ,转移次数的 均值为和m 当p , 黝值达到某极限时,得到的模型就是是佳的。模型参数的重估公式有 三个:n = l 时状态为s 的概率为 刀,2 n ( ,) ( 1 - i l ) ( 21 2 ) 状态s 向s 转移次数的均值与状态s ,开始转移次数的均值的比为 函。善六( “) 7 善一( “( 21 3 ) 由状态s ,得到输出y 。的次数的均值与状态s 出现的次数的均值的比为 b 。= r _ _ ) r ) ,钏 ( 214 五是由这些重估计公式得到的参数云瓦,瓦束构成得,那幺一定有 p , 乃】) p ,【 t 因此在得到五= ,( 爿口,月) 的估值j = ,( j 面,;) 后,又令五= j 重新估计模型参数得到新的五,如此逐步优化递推。直到五几乎不变为止。此时 参数达到某个最佳的某个极限。这样对给出的那个训练序列训练完毕,即完成隐 马尔科夫模型的处理。 第三章嵌入式智能轮椅语音识别系统的硬件设计及实现 眶掣 眄叫一渊辛薹 篡、卫 j 竺竺l 竺jl 二兰j 32 主控模块s 3 c 2 “0 $ 3 c 2 4 4 0 微处理器包含一个a r m 9 2 0 t 内核并增加了丰富的外围资源其结构框图 32 所示。包含外部存储控制器,l c d 控制器,4 路d m a ,3 路u a r t ,2 通道s p i ,】路1 2 c ,l 路1 2 s ,且兼容v 10 的s d 主接口协议和v 21 1 的m m c 卡协议4 路p 删定时器和】路 内部定时器1 1 7 个通用i 0 ,2 4 路外部中断,r t c 时钟,及外部锁相环p l l 。$ 3 c 2 4 4 0 的主频可达到5 3 3 m h z 符合语音信号处理所需要的频率。 幽32 $ 3 c 2 4 4 0 结构框幽 a r m 9 处理器使用5 级流水线结构同时内核采用了li m i p s m h z 的哈佛结构,使 得指令执行效率更高,而且a r m 9 系列微处理器拥有单一的3 2 位州b a 总线接口以及全 性能的l ,支持w i d o w s c e 、l in u x 等操作系统,其高执行效率解决了语音实时性等问 题。 低成本、低功耗、高性能是嵌入式系统应用的首要要求,由于$ 3 c 2 4 4 0 处理器处 理功能强大性价比极高,在高性能和低功耗特性方面提供最佳的表现,适合本设计 对功耗以及其它性能等方面的需求。 本设计的主控芯片$ 3 c 2 4 4 0 的外网电路主要电源电路、复位电路、时钟电路、存 堵电路、f l a g 电路、外接s p c e 0 6 1 a 组成的音频电路。外部电机所需电源为2 4 v 经转换 后变为5 v t 再经过稳压使j v 转换为$ 3 c 2 4 4 0 外部】0 和存储器所需要的33 v 供电,和 $ 3 c 2 4 4 0 内核所需要的12 7 供电。复位电路和时钟电路为$ 3 c 2 4 4 0 工作所必须硬件要 求,为系统提供工作时钟和上电复位,本设计连接2 4 m h z 的外部晶振并提供3 27 6 8 k i i z 的宴时时钟,为整个系统提供工作频率。$ 3 c 2 4 4 0 用j t a g 烧写程序,还有存储电路, 存储系统运行的程序。音频电路为专门语音甚片s p c e 0 6 1 a 构成,主控芯片外围电路设 置要尽量简单实用,以便实际应用。 33 电源模块 本论文整体设计所需要的电压为电动轮椅的2 4 v 电压,s p c e 0 6 1 a 的j v 电压。以及 $ 3 c 2 4 4 0 的l _ 2 v 和33 v 电压。单片机稳压电路可以使电动轮椅的2 4 v 电源降压得到 s p c e 0 6 i a 所使用的5 v 电源,如图33 所示,2 4 v 电压经7 8 l 1 2 转换为1 2 v 电压,再经 7 8 l 0 5 转换成所需的j v 稳定电压输出。 本设计的核心处理器$ 3 c 2 4 4 0 内核采用的供电电源为l2 v ,片内存储及外部i o 供电电压为33 v 其最大电流为3 0 0 m a 。从整个系统的电源消耗功率上柬看,这部分 消耗的功率1 i 是很大但一直处在供电状态。部分外围器件如s p c e 0 6 1 a 的c p u 采用的 是33 v 独立供电,它们的电源功率消耗也不是很大,所采用33 v 电源的电流最大不 超过6 0 0m a 。其电路原理圈如图34 所示。从7 4 l 0 5 转换柬的;v 稳压电压经过 a s l l l7 d t l2 和a s l l l7 d t 3 : 分别得到12 v 和33 v 的工作电压。电源屯路在实际应用 中要加上性能较好的散热片挺高电路的散热性。 阳”1 : 上 蹦332 4 v 转5 v 稳爪电源 - 5 删 尉3d 5 v 转33 vl2 v 电源l 乜路 34 语音模块 本设计采用s p c e 0 6 1 a 单片机作为语音处理模块,其内含语音处理电路,进行语音 的处理。5 p c e 0 6 a 单片机是凌阳公司生产的1 6 位结构的微控制器,c p u 的时钟为 3 2 7 6 8 h z 、4 91 5 2 m h z ,因此它具有较强的信息处理能力和较快的运行速度,为实时控制 及语音信息处理提供了必要的保证。尤其是其内部嵌入了含有数字信号处理( d s p ) 功 能的电路,这样不仅大大降低了成本,还缩小了器件的体积:不足之处是其无法达到 专业d s p 所达到的信号处理效果,因此,对语音的辨识率会有一定的影响。当前语音 识别价格昂贵,所以它的性价比较高,有利于成本控制,于是我们选择它作系统处理 器。由其组成的语音识别系统,可达到每秒8 k 的语音采样率,音频压缩频率在2 0 0 1 1 z - - 34 k h z 之间,能达到所需要求。如圈35 语音电路原理图所示,语音的录入由麦克 风( m l c ) 经过电容滤除其部分噪声后送给s p c e o b a 的m i c p 和m i e n 引脚,交给s p c e 0 6 1 a 来完成s p c e 0 6 1 a 内部有对语音信号的处理电路,如自动增益电路等这里只需把语 音信号接到s p c e 0 6 1 a 的语音录入引脚便可完成对语音录入的硬件设计。播放语音的 硬件设计是由s p c e 0 6 1 a 的d a c l 引脚输出语音,经s p y 0 0 3 a o 音频放大器完成对输出语 音信号的放大作用,与扬声器相连完成语音播放的处理 瞠3 、5 语音电路原理酗 35 存储模块 主控芯片$ 3 c 2 4 4 0 有三种存储器接口电路有n o rf 1 a s h 接口、n a n df i a s h 接口 和s d r a m 接口电路。由于本设计要处理较复杂的语音信号。j = i ;要装载】, i i u x 内核及相 应的驱动程序,故需要外接存储系统。因为n o rf l a s h 虽然读速度较n a n df l a s h 快, 但写速度没有n a n df i a s h 快,且其单元尺寸为n a n df 1 a s h 的一倍。并且n a n df i a s h 的擦写次数为n o rf l a s h 的1 0 倍。n a n df l a s h 价格较便宜,故基于价格的考虑和本设 计需求的考虑应选择n a n df 1 a s h 对程序进行擦写和再编程,且$ 3 c 2 4 4 0 微处理器提供 了n a n df 1 a s h 接口,可以方便的与n a n df 1 a s h 处理芯片对接。a r m 嵌入式系统中程 序的运行空侧、数据及堆栈区用s d r a m 束存储,由于$ 3 c 2 4 4 0 片内有独立的s d r a i 刷 新控制逻辑电路,可以方便地与s d r a m 对按。 首先选择一款适合本设计的n a n df l a s h 处理芯片,由于$ 3 c 2 4 4 0 微处理器的外音i j 1 0 口电压为3 驯,为了设计电路简单,应选择】0 电压也为33 v 的n a r df i a s h 芯片 以免还需要外接电平转抉电路。考虑的第二个因素为总线宽度和存储容量,出于本没 计要移植l i n u x 内梭,还要存储较多的处理程序,故选择存储容量为6 4 m ,总线宽度为 8 位的n a n df l a s h 芯片k 9 f 2 8 0 8 u 附。其工作电压为2 7 v 至36 v 系统的编程和椽除 电压仅需要33 v 。 $ 3 c 2 4 4 0 与n a n df l a s h 的连接电路图如图36 所示。s 3 c 2 4 4 0 的d a t al 0 :7 与 k g f 2 8 0 8 u d m 的8 位数掘位相连,实现对数掘的双向传输。$ 3 c 2 4 4 0 的a l e ,c l e 等控制 引脚与k 9 f 2 8 0 8 u d m 对应引脚相连。实现对芯片的控制及选择。 d n o 盯n d m d 盯 3 d a t a d a t a 5 i ) a t a 6 n 丁 7 + 3 计 幽36 $ 3 c 2 4 4 01 df l _ a s h 的i 雠电路悦 当系统启动时,c p u 先从复位地址o x o 处读墩启动程序代码,完成系统的初始化后, 为提高系统的运行速度,程序代码应装到s d r a m 中运行。同n a n df l a s h 芯片选取相同 首先本系统要选择有33 vi o 输出的s d r a m 芯片,二是考虑其总线宽度和存储容量。 根据本设计的要求,进择2 片k 4 s 5 6 1 6 3 2 ds d r a m 存储器。k 4 s 5 6 1 6 3 2 d 存储器是4b a n k x 蜘x 1 6 的动态存储器,工怍电压为:j 3 v ,数据宽度为1 6 位,支持自刷新功能。本 设计选择两片k 4 s 5 6 1 6 3 2 d 存储器芯片就组成了1 6 mx3 2 位的s d r 删存储系统,其电 1 9 路图如图37 所示 幽37k 4 s 3 6 1 6 3 2 0 组成的3 2 位s d r a m 存储系统 采用n a n df 】a s h 和s d r a m 存储芯片的$ 3 c 2 4 4 0 的存储空间分配如图3h 示 s f r a r e a i b c o t s r a m 4 k b ) ( n g c s 6 )( n g c s 6 ) n g c s 5 m e m e t n g c s 3 i d e n g c s 2 n g c s ln g c s l a m 2 9 l v 8 0 0 b o o t i r i t e m a l s d a m ( 4 k 8 1 幽38 $ 3 c 2 4 4 0 的存储空间分配 本设计采用n a n df l a s h 启动,系统将b o o t o a d e r 和操作系统映像放在n a n df l a s h 中。当处理器上电复位时通过内胃的n a n df l a s h 访问接口将b o o tl o a d e r 代码自动 加载到内部的s d r a m 中,在s d r a m 运行的b o o tl o a d e r 程序将操作系统映像加载到s d r a m 中。启动完毕后s d r a m 就可以用于其他用途。 36 通信模块 本设计用s p e c 0 6 i a 对语音信号进行处理,包含语音的录入,特征提取,以及语音 模型训练和模板匹配,最后得到最佳匹配结果。得到的匹配结果需要转换为语音命令 信号传递给$ 3 c 2 4 4 0 主控芯片,通知$ 3 c 2 4 4 0 使其根据语音命令信号对智能轮椅进行 智能控制并把智能轮椅运行状态实时显示到图形用户界面上。 袁31 语音命令状志 s p c e 0 6 l a】0 b l j1 0 b 】4i ( ) b 1 3i o b l 2】o b l l 语音命令 $ 3 c 2 4 4 0 g p h o g p i i l g p h 26 p h 3g p h 4 0o0o1 左转 o 0 o10 右转 00100 前进 01o0o后退 j0ooo 停止 如表3 1 所示,由于s p c e 0 6 1 a 的i ( 1 电平为j v ,而$ 3 c 2 4 4 0 的i ( 1 电平为33 v , 故需要电平转换用s n 7 4 l v c 8 t 2 4 5 双电源电平转换芯片实现s p e c 0 6 1 a 与$ 3 c 2 4 4 0 的 通信。本设计用s p c e 0 6 l a 的i o b l l 、1 0 8 1 2 、【o b l3 、1 0 8 1 4 、i o b l5 口输出语音控制命 令,它作为数据位,经过s x 7 4 l v c 8 t 2 4 5 分别与$ 3 c 2 4 4 0 的g p h o 、g p h i 、g p h 2 、g p h 3 、 g p h 4 口对应相连。如图39 所示,i o b 6 引脚作为5 3 c 2 4 4 0 的数据接收控制引脚经过 s n 7 4 i ,v c s t 2 4 5 与$ 3 c 2 4 4 0 主控芯片的g p f o e i n t o 引脚相连:i o b l e x t i 经过 s n 7 4 l v c s t 2 4 5 与$ 3 c 2 4 4 0 的g p i ;o 引脚相连,实现$ 3 c 2 4 4 0 通知s p c e 0 6 1 a 已经接收完 数掘。s n 7 4 l v c s t 2 4 5 的d i r 与o e 引脚控制数据传输方向如表32 所示 表3 - 2s n 7 4 l v c 8 1 2 4 5 数据传递方向控制 d i r o e数据传递方向 llb 口到a 口 lha 口到b 口 hx 断开 $ 3 c 2 4 4 0 与s p c e o b l a 的通信原理如图39 所示为,当有语音

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论