已阅读5页,还剩64页未读, 继续免费阅读
(微电子学与固体电子学专业论文)基于fpga的dsr系统前端算法实现.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
s :,o 沁工 苏州大学学位论文使用授权声明 本人完全了解苏州大学关于收集、保存和使用学位论文的规定, 即:学位论文著作权归属苏州大学。本学位论文电子文档的内容和纸 质论文的内容相一致。苏州大学有权向国家图书馆、中国社科院文献 信息情报中心、中国科学技术信息研究所( 含万方数据电子出版社) 、 中国学术期刊( 光盘版) 电子杂志社送交本学位论文的复印件和电子 文档,允许论文被查阅和借阅,可以采用影印、缩印或其他复制手段 保存和汇编学位论文,可以将学位论文的全部或部分内容编入有关数 据库进行检索。 涉密论文口 本学位论文属 在年一月解密后适用本规定。 非涉密论文口 论文作者签名:皇雌日 期:竺j 6 5 导师签名:至垒! 圣e l 期:j 竺l 。钐兰 基于f p g a 的d s r 系统前端算法实现 摘要 基于f p g a 的d s r 系统前端算法实现 中文摘要 随着语音识别技术日新月异的发展,语音识别正逐渐应用于生产生活的各个方 面,对语音信号处理的准确性、实时性要求越来越高,这就对系统的软、硬件提出更 高的要求。 分布式语音识另i j ( d s r ) 系统的提出,有效地减轻了前端系统繁重的计算负担。因 此近年来,分布式语音识另i j ( d s r ) 系统的研究引起了广泛的关注。本文对d s r 前端系 统进行了详细的分析,提出了一个基于f p g a 的前端处理系统结构,并通过a l t e r a 公司 新一代可编程逻辑器件验证和实现。 论文的主要内容有4 点: ( 1 ) 在对d s r 前端算法的深入研究的基础上,分析对比了不同的硬件设计方案, 详细分析提取语音特征参数的典型架构。 ( 2 ) 通过对前端算法的m a t l a b 建模和大量语音样本的统计学分析,确定特征参数 的定点表示宽度,为系统的设计奠定基础。 ( 3 ) 在已有设计架构的基础上,提出新的系统结构,对于自相关函数的求解、 l e v i n s o n d u r b i n 递推算法和l p c c 系数的求解三个功能模块进行了设计,完成了硬 件实现,并做了详细分析。 ( 4 ) 经过仿真,采用a l t e r af p g a 芯片c y c l o n ee p l c 2 0 进行系统测试,通过逻辑 分析仪s i n g a l t a pi i 观察输出的结果,通过m a t l a b 将硬件仿真结果与m a t l a b 的建模 结果进行对比。 最终结果表明,本系统能够在较短的时钟周期内提取出语音信号的l p c c 系数, 满足d s r 系统的前端使用,数据误差在可接受范围之内。 关键词:语音识别;分布式语音识别系统( d s r ) ;l p c c ;f p g a 作者:刘文姝 指导老师:王子欧 a b s t r a c t r e a l i z a t i o no ff r o n v e n da l g o r i t h mi nd s rs y s t e mb a s e do nf p g a r e a l i z a t i o no ff r o n t - e n da l g o r i t h mi nd s r s y s t e mb a s e d o nf p g a a b s t r a c t w i t ht h es p e e c hr e c o g n i t i o nt e c h n o l o g ye v e r - c h a n g i n g ,s p e e c hr e c o g n i t i o nh a sb e e n g r a d u a l l ya p p l i e dt oe v e r ya s p e c to fb u s i n e s sp r o d u t i o na n dh u m a nl i f e t h i st e n d e n c yc a l l s f o rs p e e c hs i g n a lp r o c s s i n gt om e e tm o r es t r i c tt e c h n o l o g yd e m a n do na c c u r a c y ,r e a l - t i m e p r o c e s s i n ga n dp e r f o r m a n c eo f h a r d w a r e d i s t r i b u t e ds p e e c hr e c o g n i t i o n ( d s r ) p r o p o s e da ne f f e c t i v es o l u t i o nt or e d u c et h e c o m p u t a t i o n a lb u r d e na tt h ef r o n t e n do f t h es y s t e m s oi nr e c e n ty e a r s ,t h ed s rs y s t e m h a sa t t r a c t e dm o r ea n dm o r ea t t e n t i o n b a s e do nt h er e s e a r c ho ft h ed s r s y s t e m ,u s i n gd i g i t a lp r o c e s s i n ga d v a n t a g eo ft h e a l t e r a sn e w - g e n e r a t i o np r o g r a m m a b l el o g i cd e v i c e s ,t h i st h e s i sp r o p o s e saf p g a - b a s e d f r o n t - e n ds y s t e ma r c h i t e c t u r e t h e r ea r ef o u rp r i m a r yp a r t so ft h ew o r ki nt h i sp a p e r : ( 1 ) b a s eo nd e l i b e r a t ea n a l y s i so na l g o r i t h mi nd s rs y s t e ma n dc o m p a r i s o nb e t w e e n d i f f e r e n td e s i g n s ,t h ea r c h i t e c t u r ei nh a r d w a r es y s t e mo fs p e e c hf e a t u r ee x t r a c t i o nh a sb e e n e x p l o r e dp a r t i c u l a r l y ( 2 ) a c c o r d i n gt ot h es t a t i s t i cr e s u l to fm a n ys p e e c hs a m p l e sa n dn u m e r i c a ls i m u l a t i o n b a s e do nm a t l a b ,t h ew i d t ho ff i x e dp o i n ti ns p e e c hc h a r a c t e r i s t i cp a r a m e t e r , w h i c hi st h e b a s i sf o rt h es y s t e md e s i g n ,h a sb e e nd e t e r m i n e d ( 3 ) t h i st h e s i sp r o p o s e dan e ws y s t e ma r c h i t e c t u r eb a s e do nt h ee x i s t i n gm e t h o d s , i n c l u d i n g t h r e ef u n c t i o n a l m o d u l e s ,c o m p u t a t i o n o ft h e a u t o - c o r r e l a t i o nf u n c t i o n , r e a l i z a t i o no fl e v i n s o n - d u r b i nr e c u r s i o na l g o r i t h ma n dc o m p u t a t i o no fl p c c ( l i n e a r p r e d i c a t i o nc e p s t u mc o e f f i c i e n t ) f i n a l l y , c o n s e q u e n th a r d w a r ei m p l e m e n t a t i o np r o j e c t a n dd e t a i la n a l y s i sa r ep r e s e n t e d i i r e a l i z a t i o no f f r o n t - e n da l g o r i t h mi nd s rs y s t e mb a s e do nf p g a a b s t r a c t ( 4 ) a d o p t i n ga l t e rf p g ac y c l o n ee p1c 2 0c h i pt ot e s t ,e m u l a t ea n dv a l i d a t et h e s y s t e m ,o b s e r v i n gt h eo m p mo ft h er e s u l t sb yl o g i ca n a l y z e rs i g n a l t a pi i h a r d w a r e s i m u l a t i o ni sc o m p a r e dw i t hm a t l a bm o d e l i n gr e s u l t s u s i n gm a t l a b f i n a lr e s u l t ss h o wt h a t ,t h i s s y s t e mc a ne x t r a c tt h el p c cc o e f f i c i e n t so fs p e e c h s i g n a li nas h o r t e rc y c l e ,w i t hd a t ae r r o ri na na c c e p t a b l er a n g e ,w h i c hc a nb eu s e da st h e f r o n t e n do fd s r s y s t e m k e yw o r d s :s p e e c hr e c o g n i t i o n :d i s t r i b u t e ds p e e c hr e c o g n i t i o n ( d s r ) s y s t e m ; l p c c ;f p g a w r i t t e n b y :l i uw e n s h u s u p e r v i s e db y :w a n gz i o u 目录 第一章绪论1 1 1 语音识别集成电路1 1 2 研究动态评述1 1 3 课题主要工作5 1 4 章节安排5 第二章语音识别系统与d s r 前端算法分析6 2 1 语音识别系统6 2 1 1 语音识别系统的分类6 2 1 2 语音识别系统的组成7 2 2d s r 前端系统语音识别算法分析7 2 2 1 预处理8 2 2 2 自相关9 2 2 3l p c c 系数10 2 3 小结1 3 第三章系统结构优化与模块划分1 4 3 1 基于f p g a 的系统设计方法与流程1 4 3 2 系统结构设计方案对比及优化1 6 3 2 1 定点与浮点16 3 2 2 语音特征参数1 7 3 2 3 自相关系数模块18 3 2 4l p c c 系数模块2 0 3 3 系统模块划分2 2 3 3 1 自相关系数模块2 3 3 3 2l p c 模块2 3 3 3 3l p c c 模块2 3 3 3 4 存储器2 4 3 4 小结2 4 第四章系统硬件结构设计2 5 4 1m a t l a b 仿真与定点模型的确定2 5 4 1 1 训练自相关系数r 2 5 4 1 2 训练线性预测系数l p c 2 6 4 1 3 训练偏相关系数k 2 6 4 1 4 训练复倒谱系数l p c c 2 7 4 2 硬件结构实现2 8 4 2 1 跨时钟域设计2 8 4 2 2 自相关系数模块设计3 0 4 2 3l p c 系数模块设计3 4 4 2 4l p c c 系数模块设计3 8 4 3 仿真验证4 0 4 4 ,j 、结4 4 第五章系统验证测试与结果对照4 5 5 1 系统验证与测试4 5 5 1 1 仿真平台介绍4 5 5 1 2 系统仿真结果与资源报告4 6 5 1 3s i g n a l t a pi i 仿真结果4 8 5 2 可靠性分析5 0 5 - 3 小结5 0 第六章总结与展望51 6 1 总结51 6 2 展望。51 参考文献5 3 攻读学位期间发表的学术论文5 8 致谢5 9 基于f p g a 的d s r 系统前端算法实现第章绪论 第一章绪论 语音识别属于多维模式识别和智能计算机接口的范畴,通过识别把语音信号转变 为相应的文本。语音识别的研究目的是让计算机“听懂”人类口述的语言,而“听懂 的目的又是让计算机能够对人类语言中所包含的要求或询问做出正确的响应。 随着语音识别技术的不断发展,语音识别正逐渐应用于语音通信系统、声控电话 交换、数据查询、订票系统、宾馆医疗服务、银行服务、计算机控制、工业控制领域 等生产生活的各个方面。它也在机器人控制、保密系统等领域中成为关键的、具有竞 争力的技术【。 1 1 语音识别集成电路 根据识别性能以及语音识别算法的不同,语音识别专用芯片大致经历了这样几个 过程。在二十世纪8 0 年代初期,最早期的语音识别专用集成电路主要是由带通滤波 器及线性匹配电路构成。带通滤波器用来提取电路特征,再经过线性匹配电路进行模 式匹配。在此基础上发展出了由m c u 组成的语音识别专用i c ,核心为8 位或1 6 位 机,外加a d 和d a 转换器以及存储剁2 1 。典型芯片是1 9 9 6 年美国s e n s o r y 公司生 产的r s c 1 4 6 。随着数字信号处理器( d s p ) 的发展,以其为基础的语音识别系统在 后来得到了广泛的应用。一般由定点1 6 位d s p 组成,外加a d 和d a 、存储器以及 r o m 、r a m 、f l a s h 等。由于d s p 具有较强的数据处理能力,故以此为基础的语 音识别系统性能较高,也是当今语音识别系统所采用的主流硬件技术【3 j 。最新的发展 包括了以人工神经网络构成的语音识别专用集成电路【4 】,以及语音识别系统级芯片 ( s o c ) 等1 5 j 。 随着语音识别技术的不断发展,语音识别集成电路也是日新月异,将对人类的生 产和生活产生深远的影响。 1 2 研究动态评述 语音识别起始于2 0 世纪5 0 年代的a u d r y 系统,这是语音识别研究工作的开端。 第章绪论 摹于f p g a 的d s r 系统前端算法实现 2 0 世纪6 0 年代末的语音信号线性预测技术和i t a k u r a 提出的动态时间规划 ( d t w d y n a m i ct i m ew a r p i n g ) 的观点,解决了语音的特征提取和不等长匹配问题, 其研究特点以孤立字语音识别为主,把孤立字作为一个整体来建立模板。2 0 世纪8 0 年代初,l p 技术和d t w 技术催生矢量量化( v q ) 技术和隐马尔科夫模型( h m m ) 理论, 实现了基于线性预测倒谱和d t w 技术的特定人孤立词小词汇量语音识别系引6 1 。8 0 年代中期,在实践中成功应用了h m m 模型和人工神经网络( a n n ) ,这被认为是语音 识别历史上的一个里程碑。2 0 世纪9 0 年代之后,人工神经网络技术的应用成为语音 识别的一条新途径【7 1 ,标志着语音识别技术进一步成熟,语音识别系统从实验室走向 实用化道路【l j 。 近二三十年来,语音识别在通信与电子系统、自动控制等领域中有着广泛的应用。 其中一个重要的发展方向是硬件实现语音识别算法的研究。这个方向主要针对小型 化、便携式语音产品的应用,这类设备例如:手机、p d a 以及车载应用等装置,通 常是小词汇量的孤立词识别。国外在硬件实现方面的研究较早,而国内起步较晚1 8 j , 急需开展该领域的研究。 在未来的嵌入式系统和移动设备上,人机交互将会慢慢取代传统的自然语言。语 音识别将会应用到各个方面。在这方面,语音识别的人机交互既继承了嵌入式系统设 计的约束,例如:硬件资源、存储器、功耗约束、成本要求等,同时,也对传统的语 音识别系统提出了新的架构上的要求。 早期的客户一服务器架构的网络式语音识别n s r ( n e t w o r ks p e e c hr e c o g n i t i o n ) 系统,在客户端用标准的语音编码技术将语音信号编码,然后通过信道传送到后端的 服务器;在服务器端,将语音信号解码,再进行所有的识别过程。两部分的通信通过 有线无线信道进行。这种架构对于客户端的要求较低,可以降低客户端的硬件成本 和功耗。但是,这种设计有两方面的问题:1 普通的语音编码解码技术无法保存许多 用于语音识别的有效信息,从而使后端的错误识别率w e r ( w o r de r r o rr a t e ) 降低; 2 声音信号的编码使其更容易受到传输过程中信道错误的干扰,特别是可靠度不高的 无线传输【9 1 。 最近几年,随着移动无线设备的使用率大幅增加,消费类电子和通信产业正在逐 渐增加无线数据服务器的数量,使用户即使在移动的情况下也能正常接收访问数据, 2 基于f p g a 的d s r 系统前端算法实现 第一章绪论 其中的大多数应用能够使用自动语音识别系统a s r 。a s r 系统需要具备两个主要因 素,首要因素就是在前端能够提取代表语音信号的参数或者是特征。这些特征通过后 端的分类器进行处理,从而识别出语音信号。 语音识别过程是繁重的计算过程,数据处理和存储是其中的关键过程u o 。由于 物理尺寸和电池寿命的限制,用于处理和存储的资源是有限的。从另一方面讲,a s r 的服务器端相对来说约束较少,能够分担移动设备用户的计算负荷,也能够方便地进 行语音识别技术和服务的升级。然而,低质量的传输信道与移动设备的低比特率的语 音编码,也能够引起语音信号质量退化,从而使得语音识别率降低。 近两年国际上提出了分布式语音识别d s r ( d i s t r i b u t e ds p e e c hr e c o g n i t i o n ) ,如图 1 1 所示。移动终端只需进行语音采集、特征提取,有关信息则通过无线数据信道送 往网络中的远程服务器,由服务器中的识别单元完成语音识别功能1 1 1 | 。 图1 1d s r 系统组成图 分布式语音识别d s r ( d i s t r i b u t e ds p e e c hr e c o g n i t i o n ) 能够避免n s r 系统所产生 的低错误识别率和低抗干扰性的问题。多模式应用是指用户和计算机之间的信息交互 能够代替传统的手敲键盘、声音命令、手写输入,这就要求有语音和数据两条信道。 而d s r 将这两条信道并为一条信道,发送参数化的语音信号,而不是像n s r 系统当 中被编码的语音信号。这就有两个优点:1 语音信号不是被直接地编码与传输,这就 保证其不被信道错误所干扰,也提高了在可靠度不高的信道当中传输的识别率;2 应用了专门的编码和分帧算法,在保证语音信号识别率的前提下,减小了数据量1 1 2 1 。 近几年,一些研究团体对于分布式语音识别的兴趣越来越高,特别是欧洲电信标 第一章绪论 基于f p g a 的d s r 系统前端算法实现 基于f p g a 的d s r 系统前端算法实现第一章绪论 l p c c 相比可以看到,虽然m f c c 符合人们的听觉特性,在有信道噪声和频谱失真的 情况下具有较好的稳健性,但是,其不足之处是多次用到快速傅里叶变换( f a s tf o u r i e r t r a n s f o r m a t i o n ,简称f f t ) ,故算法的复杂程度远大于l p c c 方法。并且,目前比较成 熟和最常用的语音特征提取方法还是l p c c 方法。 1 3 课题主要工作 本工作对d s r 系统语音识别算法进行了深入分析,对其国内外现有硬件实现方 案进行了对比研究。良好的d s r 系统前端算法硬件设计应当使得系统架构能够在较 短的时钟周期内提取出语音信号的特征参数,使得由于浮点转为定点而产生的误差能 够达到系统要求,同时又使硬件耗费最低。 基于上述几点,本论文提出了一种新的基于f p g a 的d s r 前端系统架构,对自 相关系数的累加过程和l p c c 系数的提取过程进行了优化设计,经过系统的仿真验 证,最终通过硬件测试,提取出系统的l p c c 系数,并且与m a t l a b 结果进行了对比, 验证了系统的可靠性。其中,在算法的实现和系统架构的设计方面,有一定的创新点。 1 4 章节安排 全文分为6 章,内容结构为: 第一章,绪论中重点介绍了语音识别集成电路发展历史与研究动态,阐述了本工 作的意义和关键内容。 第二章,介绍了语音识别算法的基本概念,重点分析了d s r 前端系统的语音识 别算法原理,得出新设计的关键考虑。 第三章,对比分析各种不同d s r 前端系统设计方法,提出新结构需要解决的关 键问题,确定系统设计方案,并进行系统模块的划分。 第四章,分模块介绍了系统的硬件实现与仿真验证。 第五章,完成了对系统的完整仿真测试,并验证系统的可靠性。 第六章,通过梳理前述理论与分析实验结果,总结与展望基于f p g a 的d s r 系 统前端算法实现。 第二章语音识别系统1 jd s r 前端算法分析 基于f p g a 的d s r 系统前端算法实现 第二章语音识别系统与d s r 前端算法分析 语音识别系统本质上是一种模式识别系统,包括语音信号处理、特征提取、特征 建模( 建立参考模式库) 、模式匹配和后处理等几个功能模块。d s r 系统的前端处理, 本质上就是语音识别过程的前端处理。 2 1 语音识别系统 语音识别可以分为小词汇量识别、中词汇量识别、大词汇量识别;也可以分为特 定人识别、非特定人识别等。语音识别过程包括训练与识别两个部分。 2 1 1 语音识别系统的分类 从不同的角度和要求出发,语音识别有不同的分类方法。 按照词汇表大小分:每个语音识别系统都具有一个词汇表( v o c a b u l a r y ) ,系统只 能识别词汇表中所包含的词条。按照词汇表中包含的词汇量的多少来分,有小词汇表 ( 词汇量小于1 0 0 ) 、中词汇表( 词汇量在1 0 0 和1 0 0 0 之间) 、大词汇表( 1 0 0 1 词以上) 语音识别。 按照说话人的限定范围分,有特定人识别和非特定人识别两种方式。所谓特定人 识别是指识别系统只针对特定的某个用户进行识别工作的方式;而非特定人识别则 是指识别系统可以针对任何人工作。 按照语音的发音方式来分,可以分为孤立词识别、连接词识别、连续语音识别。 所谓孤立词识另l j ( i s o l a t e dw o r dr e c o g n i t i o n ,i w r ) 是指在发待识别语音时,每次只包 含词汇表中的一个词条,比如一个字( 词) 、一个词组或者一条命令。连接词识别 ( c o n n e c t e dw o r dr e c o g n i t i o n ,c w r ) 是指每次说词汇表中的若干个词条来进行识别, 该若干词条以慢速连续的方式说出,一般指0 - 9 十个数字连接而成的多位数字的识别, 并包含其他一些少量的操作指令等。连续语音识另l j ( c o n t i n u o u ss p e e c hr e c o g n i t i o n , c s r ) 指说话人以f 1 常自然的方式讲述并进行识别。 6 基于f p g a 的d s r 系统前端算法实现第二章语音识别系统与d s r 前端算法分析 2 1 2 语音识别系统的组成 语音识别系统本质上是一种模式识别系统,主要包括语音信号处理、特征提取、 特征建模( 建立参考模式库) 、模式匹配和后处理等几个功能模块。 一个语音识别系统主要包括训练和识别两个阶段。无论是训练还是识别,都需要 首先对输入的原始语音进行预处理,并进行特征提取。下面具体说明各个模块的功能。 预处理模块,对输入的原始语音信号进行处理,滤掉其中的不重要的信息以及背 景噪声等,并进行语音信号的端点检测,即判定语音有效范围的开始和结束位置,并 进行语音分帧以及预加重等处理。 特征提取模块负责计算语音的声学参数,并进行特征的计算,以便提取出反映信 号特征的关键特征参数,以降低维数并便于后续处理。语音识别系统常用的特征参数 有幅度、能量、过零率、线性预测系数( l p c ) 、l p c 倒谱系数( l p c c ) 、线谱对参数( l s p ) 、 短时频谱、共振峰频率、反映人耳听觉特征的m e l 频率倒谱系数( m f c c ) 等。特征的 选择和提取是系统构建的关键。 在训练阶段,用户输入若干次训练语音,系统经过上述预处理和特征提取后得到 特征矢量参数( 序列) ,然后通过特征建模模块建立训练语音的参考模式库( 可能为参考 模板或者模型等) ,或者对已在模式库中的参考模式作适应性修改。 在识别阶段,将输入语音的特征矢量参数( 序y 0 ) 和参考模式库中的模式进行相似 性度量比较,将相似度最高的模式所属的类别作为识别的中间候选结果输出。而后处 理模块则对上述得到的候选识别结果继续处理,通过更多的知识( 比如:语言学的语 言模型、词法、句法和语义信息等) 的约束,得到最终的识别结果。 对于分布式语音识别d s r ( d i s t r i b u t e ds p e e c hr e c o g n i t i o n ) ,移动终端只需进行语 音采集、特征提取,有关信息则通过无线数据信道送往网络中的远程服务器,由服务 器中的识别单元完成语音识别功能。 2 2d s r 前端系统语音识别算法分析 对于d s r 语音识别前端系统而言,重点在于特征参数的提取,这也是本论文的 研究重点。一般的特征参数提取流程如下图2 1 所示。下面将按照模块分别进行分析。 7 第二章语音识别系统jd s r 前端算法分析 基于f p g a 的d s r 系统前端算法实现 语爵信号输入 预处理 自相关l p c 系数l p c c 系数 2 2 1 预处理 图2 1 语音特征参数提取流程图 在预处理中首先进行预加重( p r e e m p h a s i s ) 处理。由于语音信号的平均功率受 声门激励和口鼻辐射影响,高频端大约在8 0 0 h z 以上按6 d b 倍频程跌落,即6 d b o c t ( 2 倍频) 或者2 0 d b o c t ( 1 0 倍频) ,所以求语音信号频谱时,频率越高相应的成份 越小,高频部分的频谱比低频部分的难求。预加重的目的是提升高频部分,使信号的 频谱变得平坦,保持在低频到高频的整个频带中,能用同样的信噪比求频谱,以便于 频谱分析或声道参数分析。 预加重一般在语音信号数字化之后,在参数分析之前,一般是一阶数字滤波器。 对每一个采样预加重,预加重采用 h = 1 一h z 1 ( 1 ) 其中o 9 h 1 0 ,采用定点,取办:菩1 6 1 。 j ,( 甩+ 1 ) = 砌+ 1 ) 一h x ( 门) = 砌+ 1 ) 一而1 5 砌) = 砌+ 1 ) 叫卅去砌) ( 2 ) 经过预加重数字滤波处理之后,要进行加窗分帧处理。对已加重的语音信号y ( n ) 分帧,使得每1 帧有n = 2 5 6 个采样,所以帧率为塑学= 3 1 2 5 帧秒( 采样 率为8 k h z ) 。为了使帧与帧之间平滑过度,保持其连续性,前1 帧和后1 帧需要有交 叠的部分一帧移,我们取的帧移为6 4 。 第n 帧n = 2 5 6 _第n + 1 帧1 帧移6 4 图2 2 分帧示意图 8 = 2 5 6 基于f p g a 的d s r 系统前端算法实现第二章语音识别系统与d s r 前端算法分析 采样频率是8 k h z ,且每帧有2 5 6 个采样,所以帧长为菊1 丽2 5 6 = 3 2 聊s ,帧移 为6 4 个采样点,即面蒜6 4 = 8 聊s 。一般每秒的帧数为3 3 1 0 0 帧( 具体帧数视情况 而定) 。分帧是用可移动的有限长度窗口进行加权的方法来实现的,这就是用特定的 窗函数来乘以语音信号,从而形成加窗的语音信号。 将语音信号加窗还有一个目的,是为了减小语音帧因为数据截断而产生的误差。 因为在时域中是语音波形乘以窗函数,所以要减小时间窗两端的坡度,使窗v 1 边缘两 端不引起急剧变化而平滑过渡到零,这样可以使截取出的语音波形缓慢降为零。所以, 我们选择性能较好的汉明( h a m m i n g ) 窗,按照需要把预加重后的每帧语音采样乘以 h a m m i n g 窗函数,得到加窗的语音采样。 采用汉明( h a m m i n g ) 窗,对每一帧( 2 5 6 个采样) 进行加窗,汉明窗的形式为 w ( 泸0 5 4 - 0 4 6 c o s ( 而2 i z r ) ,o f 一1( 3 ) 【0 , o t h e r w & p 以上步骤完成,即完成了语音信号的预处理过程,在随后的处理中,按帧从数据 区中取出数据处理,来完成特征参数的提取过程,最后得到由每一帧组成的语音特征 参数时间序列。 2 2 2 自相关 自相关分析是一种常用的时域波形分析方法。语音信号x ( i ) 的自相关函数公式为: n 1 月( 尼) = x ( i - k ) x ( i ) ,0 七p ( 4 ) 其中p 是l p c 的阶数,k 是最大延迟点数,n 是采样数。 自相关函数具有以下一些性质:( 1 ) 如果x 。( i ) 是周期的( 设周期为n ) ,则自相 关函数是同周期的周期函数,即r ( k ) = r ( k + n ) ;( 2 ) r ( k ) 是偶函数,即r ( k ) = r ( 一k ) ; ( 3 ) 当k = o 时,自相关函数具有最大值,即r ( o ) i r ( k ) l ,并且r ( 0 ) 等于确定性信号 序列的能量或随机性序列的平均功率。我们把自相关函数的这些性质应用于语音信号 时域分析中,特别是在进行线性预测分析时,将用到自相关函数。对每一帧已经加窗 的采样,进行自相关分析。 0 第二章语音识别系统与d s r 前端算法分析 基于f p g a 的d s r 系统前端算法实现 2 2 3l p c c 系数 要计算线性预测复倒谱系数l p c c ,则必须要先通过自相关系数来计算线性预测 系数l p c 。 根据参数模型功率谱估计的思想,可以将语音信号x ( n ) 看做是由一个输入序列 u ( n ) 激励一个全极点的系统( 模型) h ( z ) 而产生的输出,如图2 3 所示。 叫h ( z ) 卜_ + i一 图2 3 语音信号的模型化 系统的传递函数为: 日( z ) : ( 5 ) 1 一a t g 一 式中,g 为增益常数,a i 为实数,p 为模型的阶数。显而易见,这种模型是以系 数a i 和增益g 为模型参数的全极点模型,即a r 模型。 用系数 a i n - f i 以定义一个p 阶线性预测器f ( z ) ,即 p f ( z ) = 口,z 1 ( 6 ) i = l 可将这个p 阶线性预测器从时域角度理解为,用信号的前p 个样本来预测当前的 样本从而得到如下预测值: 量( 刀) :圭叩( 玎一f ) j - l 因为线性预测器f ( z ) 是用a r 模型的系数 a i ) 来构造,而a r 模型是在最小均方 意义上对数据的拟合,所以线性预测器f ( z ) 必然是一个最佳预测器,即此时预测器的 预测误差短时总能量最小。 语音信号的线性预测分析就是根据这一性质,从语音信号x ( n ) 出发,依据最小均 方误差准则,估计出一组线性预测器的系数 a i ) ,这就是所要求的信号a r 模型的系 数。 a j 被称为线性预测系数或l p c 系数。 由于语音信号的时变特性,线性预测分析应该在短时的语音段上进行,即按帧进 1 0 基于f p g a 的d s r 系统前端算法实现第二章语音识别系统与d s r 前端算法分析 行。又由于自相关函数的特性,公式( 4 ) 可以写成下式f 1 7 】: r ( f ) :圭兄0 f 一七1 1 1 f p k = l 其中p 是l p c 的阶数,取1 0 ,写成矩阵的形式为1 8 】 尺。( o ) r 。( 1 ) r 。0 1 ) r ( 1 ) 月。( 0 ) r 。0 2 )燕2 鬻 r 0 一) 8 口: 兄【o ) j l 口p r 。( 1 ) r ( 2 ) r 0 ) ( 8 ) 线性预测分析要解决的问题是:给定语音序列( 按帧进行) ,使预测误差在最小 均方误差准则前提下,求预测系数的最佳估计a i 。 计算l p c 系数有三种方法:1 ) 自相关法;2 ) 协方差法;3 ) 格型法。协方差法因为 不需要加窗,所给出的参数估计要比自相关法精确得多,同时也优于格型法的精度; 但协方差法不如自相关法稳定,虽然在算法中,可以用判根和最小相位化的方法来纠 正极点位置,但终究是件麻烦的事。在实际应用中,当n 和p 很接近时,自相关法 的误差非常大,协方差法误差小的优势就非常明显。但是在大部分应用中很容易满足 n p ,这时协方差法误差小的优点就不再突出,而自相关法具有高效递推算法的优 势就非常明显。因此在语音信号处理中,自相关法比协方差法用得多。格型法无需加 窗,也不需要计算自相关矩阵,可直接通过语音样本递推得到预测器系数。其计算结 果精度很高,对系统的稳定性也有保证,同时避免了前两种算法的缺陷,是一种很好 的线性预测求解方法。但是用格型法求解时,多次调用相同的语音样本,运算量很大, 大致为自相关法或协方差法的4 倍以上。综合考虑,本论文选用自相关法解l p c 正 则方程。 用自关法解l p c 正则方程求特征参数又有两种方法:1 ) l e v i n s o n d u r b i n 算法;2 ) 舒尔递推算法。在国际电联i t u g 7 2 9 协议公布的标准中采用的是l e v i n s o n d u r b i n 算法,并且也是常用方法。所以在本系统的设计里,解l p c 正则方程的算法选择了 德宾递推算法。 解矩阵公式( 9 ) ,采用经典的l e v i n s o n d u r b i n 方法来解,具体流程见图2 4 所 示【2 0 】。求得l p c 方程的解为口,= 口,l f p ,其中p 是l p c 的阶数。在运算过程中 出现的各阶预测系数的最末一个值被称为偏相关系数k 。 第- 二章语音识别系统与d s r 前端算法分析基于f p g a 的d s r 系统前端算法实现 计算切始值 k i ,a 1 1 ,e ( 1 ) , i = 2 , i = 1 扩 计算l ( i ,0 ,e t i ) 扩 计算a j l 余轩州 _ y i j = l i v ;盒滴澍;币。卜 图2 4 l e v i n s o n d u r b i n 算法流程图 通过线性预测分析得到的合成滤波器的系统函数为日( z ) = ,其冲激响 l 一q z l i = 1 应为h ( n ) 。求h ( n ) 的倒谱j | ;( 刀) ,根据同态处理方法,有 膏( z ) :艺衲z 一一 n = l 将上式两边同时对z 一1 求导,得到j 5 ( 以) 和a i 间的递推关系: 啊= 一 ( 1 0 ) h n = - - 口n - 茎( 一詈) 口。已一朋其中行p c , 虎= 一喜( 一詈) 口。巳一, 其中尸甩q l p c 系数是线性预测分析的基本参数,可以把这些系数变换为l p c c 系数来得到 语音信号的特征参数。因为l p c c 比l p c 的识别效果好,l p c c 分析的最大优点是运 1 2 r 基于f p g a 的d s r 系统前端算法实现第二章语音识别系统与d s r 前端算法分析 算量小,在语音识别中可以采用l p c c 作为特征矢量,利用复倒谱可以提高特征参数 的稳定性,它能比较彻底地去掉语音产生过程中的激励信息。目前在语音识别系统中, l p c c 复倒谱参数获得了广泛的应用。 由l p c 系数求其复倒谱( l p c c ) 系数的计算公式为公式( 1 1 ) 。其中p 是l p c 的阶数,q 是l p c c 的阶数,最终求得l p c c 系数为h i ,具体流程见图2 5 所示。 2 3 小结 图2 5 计算l p c c 系数算法流程图 通过本章内容分析,看到语音识别系统由语音信号处理、特征提取、特征建模( 建 立参考模式库) 、模式匹配和后处理等几个功能模块组成。本文所要设计的d s r 前端 系统,实质上i f 是语音识别特征参数提取( 包括) 之前的全部过程。 在预处理阶段,主要是预加重和加窗的实现,硬件设计时,要充分考虑面积与性 能的折中;在参数提取部分的硬件设计中,要充分考虑到自相关系数求解过程的累加 性和l p c c 系数提取的可靠性,重点考虑算法实现的可行性。在下一章中,将重点进 行方案分析与系统设计优化,为硬件的实现打下坚实基础。 13 第三章系统结构优化与模块划分基于f p g a 的d s r 系统前端算法实现 第三章系统结构优化与模块划分 f p g a 作为专用集成电路( a s i c ) 领域中的一种半定制电路而出现,具有丌发过程 投资少、周期短、可反复修改等许多优点,在硬件设计中的作用越来越明显。 本章在一般f p g a 的系统设计方法与流程基础上,对基于f p g a 的d s r 前端系统的 设计方案进行了对比与分析,最终确定本文的设计方案,并将系统模块进行划分,确 定了最佳的系统结构。 3 1 基于f p g a 的系统设计方法与流程 一般来说,完整的f p g
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年中考数学百校联考冲刺押题密卷及答案(共十八套)
- 2026秋人教版八年级上Unit 1 Happy Holiday section A 同步练习
- 全国计算机等级考试二级web程序设计习题及答案
- 计算机等级考试四级嵌入式系统真题库
- 2025年资产评估师资产评估实务二真题及答案
- 2025网络安全知识竞赛题库(含答案)
- 《小学语文b p m f》课件
- 六年级下英语课件1-10单元复习
- 装卸搬运工考核试题及答案
- 方剂学章节测验题及对应答案
- 2025广东食品药品职业学院教师招聘考试题目及答案
- CN117855594B 一种固态聚合物电解质的原位制备方法及其回收方法和锂离子电池 (中国科学院长春应用化学研究所)
- (2025年)传染病上报培训考试题附答案
- 全国工业产品生产许可证目录(2026年版)
- 新华书店行测考试题库
- 建设质量安全培训制度
- 2025年区县级考试公共基础试卷
- 统编版(2024)七年级上册语文期末复习:高频考点汇编(附例题和答题模板)
- 血小板抗体检测及临床意义
- 2025内蒙古恒正实业集团有限公司招聘10人考前自测高频考点模拟试题附答案
- 发酵车间机电安装工程用户需求响应程度
评论
0/150
提交评论