已阅读5页,还剩64页未读, 继续免费阅读
(检测技术与自动化装置专业论文)语音控制中智能滤波器的研究与设计.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
桂林工学院硕士学位论文 摘要 近年来,随着信息技术飞速发展,语音技术广泛应用在数字通信、智能控制等领域。 由于语音信号的引入,打破了原有人机接口在地点和设备方面的限制,直接改变人机接 口技术,这将成为“智能化 控制设备的最佳途径,也给操作控制带来极大方便。 然而,由于语音信号本身的复杂性以及各种应用环境的复杂多变,尤其在抑制语音 干扰问题方面存在诸多困难,如模型建立、计算量及硬件实现等。可以说,目前各方面 研究也都还在寻找、探索区分不同语音信号的有效特征和比较完备的分离手段。 针对这种情况,本文以语音技术在控制领域的应用为背景,尝试将语音降噪、语音 分离技术以一种智能滤波器的思想提出。所谓“智能滤波 并不是传统概念上时域、频 域的滤波,而是从语音共振峰特征入手,从能量分离角度去除干扰语音的主要特征信息, 尽可能多而且完整的保留有用语音特征。论文主要研究内容如下: 1 对语音控制系统中前端语音滤波处理的必要性和可能性进行分析。 2 收集大量现场语音数据,包括纯净语音、混叠语音干扰等,为论文的分析研究提 供实验依据;掌握语音信号基本特性、表示方法、初步处理等相关理论,是分析处理的 理论基础。 3 尝试以一种“智能滤波 的思想描述了对频谱范围极其相似的干扰语音的滤波算 法,并对该算法进行了m a t l a b 仿真验证。以语音产生的非线性调幅一调频模型为基础, 从语音的共振峰特征角度考虑,运用t e o 能量算子,利用g a b o re s a 算法依次对干扰语 音的前三个共振峰进行能量分离操作,跟踪估计出其对应共振峰的瞬时幅度和频率,再 从观测的混叠信号中减去所估计干扰信号主要分量,从而达到滤除主要干扰分量的目的, 有别于传统的滤波器设计,充分体现智能滤波的特色所在。经m a t l a b 仿真验证,整个算 法在时域平移、g a b o r 滤波、e s a 分离迭代等部分算法相对简单,迭代过程没有增加太多 时间和运算量,而且都得到基本符合要求的各仿真结果。 4 在算法仿真分析的基础上,尝试以f p g a 结合n i o si i 软核处理器以s o p c 方案完 成硬件实现。对所提出的智能滤波算法的s o p c 实现进行总体框架设计和功能模块划分, 为后续继续研究提出了一定思路并傲了一些准备工作。 本课题研究的语音智能滤波器适用于各种语音控制系统。利用本滤波算法预处理, 在混叠语音分离技术尚不完善的情况下在一定程度上达到净化处理的效果。因此,该算 法从语音分析处理中现状来看,具有一定应用价值,而且有继续完善算法和进一步讨论 算法实现的必要性。 关键词:共振峰;t e a r e r 能量算子;g a b o r 滤波;能量分离算法:m a t l a b 仿真 桂林工学院硕士学位论文 a b s t r a c t i nr e c e n ty e a r s ,w i t hr a p i dd e v e l o p m e n ti ni n f o r m a t i o nt e c h n o l o g y ,s p e e c ht e c h n o l o g yi s 、7 l ,i d e l y u s e di n d i g i t a lc o m m u n i c a t i o n s ,i n t e l l i g e n t c o n t r o la n do t h e rf i e l d s s i n c et h e i n t r o d u c t i o no fs p e e c hs i g n a l ,b r e a kt h er e s t r i c t i o n sw h i c ha l ei no r i g i n a lh u m a n - m a c h i n e i n t e r f a c ep l a c ea n de q u i p m e n t ,a n dc h a n g e sh u m a n - m a c h i n ei n t e r f a c et e c h n o l o g yd i r e c t l y w h i c hw i l lb e c o m et h eb e s tw a yo f ”i n t e l l i g e n t ”c o n t r o le q u i p m e n ta n da l s ob r i n gg r e a t f a c i l i t a t i o nt oo p e r a t i o n a lc o n t r 0 1 h o w e v e r , a st h ec o m p l e x i t yo ft h es p e e c hs i g n a li t s e l fa n da p p l i c a t i o ne n v i r o n m e n ti s c o m p l e xa n dc h a n g e a b l e e s p e c i a l l yi nt h ei n h i b i t i o ns p e e c hi n t e r f e r e n c ep r o b l e m se x i s t i n g m a n yd i 伍c u l t i e s ,s u c h 器m o d e lb u i l d i n g ,t h ea m o u n t o fc o m p u t a t i o n , h a r d w a r e i m p l e m e n t a t i o na n ds oo n i tc a l lb es a i dt h a tt h ec u r r e n ts t u d ya r ea l s os e e k i n gt oe x p l o r e m o r ee f f e c t i v ec h a r a c t e r i s t i c sa n dm o r ec o m p l e t es e p a r a t i o nm e a n st od i f f e r e n ts p e e c hs i g n a l s a c c o r d i n gt ot h i ss i t u a t i o n , t h i sa r t i c l et a k e st h a ts p e e c hc o n t r o lt e c h n o l o g yi nt h ef i e l do f a p p l i c a t i o na sb a c k g r o u n d ,t r i e st op r o v i d es p e e c hn o i s ea n ds p e e c hs e p a r a t i o nt e c h n o l o g yi n t o a i n t e l l i g e n tf i l t e ri ni d e a m ss o c a l l e d ”i n t e l l i g e n tf i l t e r ”i sn o tt h et r a d i t i o n a lc o n e 印to f t i m ed o m a i na n df r e q u e n c yd o m a i nf i l t e r i n g ,b u ts t a r t sf r o mt h es p e e c hf o r m a n t sc h a r a c t e r i s t i c s f r o mt h ev i e wo fe n e r g ys e p a r a t i o na n dr e m o v et h em a i nf e a t u r e sa n di n f o r m a t i o no f i n t e r f e r e n c es p e e c h ,a n dr e t a i nt h ei n t e g r i t ya n du s e f u ls p e e c hc h a r a c t e r i s t i c sa sm u c ha s p o s s i b l e 1 1 l et h e s i sm a i n l yc o n c l u d e sc o n t e n t sa sf o l l o w s : 1 a n a l y z et h en e c e s s i t ya n dp o s s i b i l i t yo ft h es p e e c hp r o c e s s i n gp r e - f i l t e ri ns p e e c h c o n t r o ls y s t e m 2 c o l l e c tl o t so fs p e e c hd a t a , i n c l u d i n gp u r es p e e c h o v e r l a p p i n gs p e e c hi n t e r f e r e n c ea n d s oo nt op r o v i d ee x p e r i m e n t a lb a s i sf o ra n a l y s i sa n dr e s e a r c h ;m a s t e r i n gb a s i cc h a r a c t e r i s t i c s , m e t l l o d t h ei n l t i a lp r o c e s s i n ga n do t h e rr e l a t e dt h e o r yo ft h es p e e c hs i g n a li st h et h e o r e t i c a l b a s i so ft h i sa r t i c l e 3 a t t e m p tt od e s c r i b et h es p e e c hi n t e r f e r e n c ef i l t e r i n ga l g o r i t h mw h o s es p e c t r u mi s s i m i l a rt ou s e f u ls p e e c hu s i n ga ”i n t e l l i g e n tf i l t e r ”a n ds i m u l a t et h ea l g o r i t h mi nm a t l a b b a s e do nn o n l i n e a rs p e e c ha m f mm o d e la n df r o mt h ev i e wo fs p e e c hf o r m a n tf e a t u r e s t h i s a r t i c l eu s e sg a b o re s aa l g o r i t h mb vt e oe n e r g yo p e r a t o ro nt h ef i r s tt h r e ef o r m a n t so f i n t e r f e r e n c e s p e e c h , e s t i m a t e s a n dt r a c k si n s t a n t a n e o u sa m p l i t u d ea n df r e q u e n c yo f c o r r e s p o n d i n gf o r m a n t s ,t h e nc u t si n t e r f e r e n c es i g n a lm a i nc o m p o n e n tf r o mt h eo b s e r v e d o v e r l a p p i n gs i g n a l ,s oa st oa c h i e v et h em a i np u r p o s eo fi n h i b i t i n gi n t e r f e r e n c e i ti sd i f f e r e n t f r o mt h et r a d i t i o n a lf i l t e rd e s i g n ,a n de m b o d i e si n t e l l i g e n tc h a r a c t e r i s t i c si nt h i sf i l t e rd e s i g n f u l l y a f t e rs i m u l a t i o ni nm a t l a b ,t h ea l g o r i t h mi nt i m ed o m a i nt r a n s l a t i o n , g a b o rf i l t e r i n g , e n e 嘲rs e p a r a t i o na n ds oo i la r er e l a t i v e l ys i m p l e ,i t e r a t i v ep r o c e s sd o n ti n c r e a s et o om u c h t i m ea n dc o m p u t i n gc a p a c i t y , a n dm e e tt h er e q u i r e m e n t so ft h es i m u l a t i o nr e s u l t sa l m o s t 4 b a s e do nt h ea l g o r i t h ms i m u l a t i o na n a l y s i s ,t r yt ou s ef p g ac o m b i n i n gw i t hn i o si i s o f tc o r ep r o c e s s o rt oc o m p l e t eh a r d w a r ei m p l e m e n t a t i o no ns o p c g i v et h eg e n e r a l f r a m e w o r k d e s i g na n dt h e f u n c t i o n a lm o d u l e so nt h i s i n t e l l i g e n tf i l t e r i n ga l g o r i t h m i m p l e m e n t a t i o no ns o p c ,p r o v i d es o m ei d e a sa n dd os o m ep r e p a r a t i o nf o rf o l l o w i n gs t u d y 1 1 l er e s e a r c ho fi n t e l l i g e n ts p e e c hf i l t e rc a nb ea p p l i e di nv a r i o u ss p e e c hc o n t r o ls y s t e m u s i n gt h i sf i l t e r i n ga l g o r i t h mp r e p r o c e s s i n g ,i ti sp u r i f i c a t i o ni nac e r t a i ne x t e n tw h e nt h e o v e r l a p p i n gs p e e c hs e p a r a t i o nt e c h n o l o g yi sn o ty e tp e r f e c t t h e r e f o r e ,t h i ss p e e c hp r o c e s s i n g a l g o r i t h mi ss t i l lv a l u a b l et o d a y ,a n di sa l s ow o r t h yt oc o n t i n u ei m p r o v i n ga n df u r t h e rd i s c u s s t h en e c e s s i t yo fi m p l e m e n t a t i o n k e y w o r d s :f o r m a n t ;t e a g e re n e r g yo p e r a t o r ;g a b o rf i l t e r i n g ;e n e r g ys e p a r a t i o na l g o r i t h m ; 队t l a bs i m u l a t i o n i i 桂林工学院硕士学位论文 研究生学位论文独创性声明和版权使用授权说明 独创性声明 本人声明:所呈交的论文是我个人在蒋存波副教授指导下进行的研究工作及取得的研究 成果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含他人已经发表或撰 写过的研究成果,也不包含为获得桂林工学院或其它教育机构的学位或证书而使用过的材料。 对论文的完成提供过帮助的有关人员己在论文中作了明确的说明并致以了谢意。 学位论文作者( 签字) :蕴堕整 签字日期:纫矽_ 彭, 版权使用授权说明 本人完全了解桂林工学院关于收集、保存、使用学位论文的规定,即:按照学校要求提 交学位论文的印刷本和电子版本:学校有权保存学位论文的印刷本和电子版,并提供目录检 索与阅览服务;学校可以采用影印、缩印、数字化或其它复制手段保存论文;在不以赢利为 目的前提下,学校可以公布论文的部分或全部内容。( 保密论文在解密后遵守此规定) ,学位论文作者( 签字) : 指导教师签字: 签字日期:圣竺乡羔f6 桂林工学院硕士学位论文 1 1 课题背景及研究意义 1 1 1 课题来源,项目名称 第1 章绪论 本课题来源于广西科技攻关项目:“多维数控系统 ( 桂科攻0 3 3 0 0 0 5 - 1 2 ) ;“c n c 精密成型磨削装置数控系统研制 ( 桂科攻0 2 3 5 0 0 9 - 5 ) ;“特种罐体焊接机人工智能多 维控制系统研究”( 桂科攻0 4 2 8 0 0 7 9 ) :专利支持项目“液体物料运输车智能卸料控制 技术研究 ( 2 0 0 7 0 0 z l 0 2 1 ) 。 项目名称:语音控制中智能滤波器的研究与设计。 1 1 2 课题背景 语音是人类最重要、最有效、最常用和最方便的信息交换形式,是在说话人与听者 之间通过声波这一媒介来传递信息。说话人的发音器官做出发声动作,接着空气振动形 成声波,声波传到听者的耳朵里,立即引起听者的听觉反应,语音的传递就是这样一个 复杂过程,其中发音动作属于生理现象,空气振动属于物理现象,而听觉反应属于心理 现象。因此,对语音信号的分析处理是一个涉及多学科的交叉技术【1 1 。 语音技术是目前世界上最热门和最具有发展前景的新型信息技术之一。从某种意义 上说,语音识别是将计算机变成真正的“智能化设备的最佳途径。最近几年来,语音 识别技术得到了突飞猛进的发展,在某些领域己经进入了实用化的阶段,已广泛应用在 数字通信、智能控制、语音控制等领域,尤其是在语音控制领域的具体应用,如车载语 音系统、智能家居系统、楼宇安全门、声控轮椅、语音数控系统等等。由于语音信号的 引入,打破了原有人机接口在地点和设备等方面的限制,直接改变了传统的人机接口的 关键技术1 2 】,突出了人性化、智能化的发展趋势。 本文就是针对语音技术在控制领域的应用这一问题提出的,由于语音技术的引入,将 给现场操作控制带来很大的方便。然而,由于语音信号本身的复杂性以及应用现场的复 杂环境,存在各种背景干扰,尤其是混叠语音干扰问题,所以将语音降噪、语音分离技 术,以一种智能滤波器的思想提出。所谓“智能滤波 并不是传统意义上时域、频域的 滤波,而是从提取语音特征入手,去除干扰语音的主要特征信息,尽可能多而且完整的 保留有用语音特征这一角度进行尝试和探索。 桂林工学院硕士学位论文 1 1 3 语音技术的应用领域及前景 语音技术与各个领域结合为开发商提供了自由发展广阔的天地,高速增长的市场又 为开发商带来了无数商机和优势。在这里,仅列举一些典型领域的具体应用。 语音听写机:用口述代替键盘,实现文字输入并且打印输出,这是人们长久以来的 一个迫切愿望。这对于办公自动化将带来革命性的变化( 用机器秘书代替人类秘书) 。由 于汉语计算机输入的特殊性,汉语语音听写机的重要性尤其突出。一方面,它使人机接 口更加友好和自然:但更重要的是,它可以促进计算机应用在中国的普及。 在通信工程中的应用:世界各大通信公司,如美国a t t 公司,日本n t t 公司都一直 长期致力于语音识别的研究,因为它在通信的各个领域都有着广泛的应用。例如手机语 音拨号、股市查询、信用卡认证等。此外,一项更加雄心勃勃的计划是实现两种语言之 间的直接交流,即通过“语音识别机器翻译语音合成技术将一种语言直接转 换成为另外一种语言。目前有一些欧美及日本的研究组织正在开发这个领域的产品。 数据库检索:政府部门、银行、金融机构、军事指挥所和工业管理部门无不需要对 庞大的数据库进行频繁的检索和查询,其中很多是通过电话来进行的。通过自然语言直 接检索数据库可以免除大量操作人员的重复劳动,既经济又快速。 语音命令控制:在很多场合下,由于手脚已被占用进行其它动作或照明不足无法进 行操作时,必须用语音发出指令,例如驾驶员在高速行驶的汽车中拨打电话。另一方面, 随着第三代移动通信技术的发展,个人智能终端体积越来越小,通过按键进行控制越来 越不方便,语音命令控制是十分理想、便利的人机接口方式。此外语音识别显然还会给 失明者、行动不便者带来很大的方便。 语音技术的应用实例还有很多,在此不能穷举,总之,随着科技的飞速发展以及人 类对生活质量的要求不断提高,语音技术是一项非常有发展前景信息技术之一,这也就 是如此多的科研机构、专家学者一直以来孜孜不倦地研究该技术的原因所在。 1 2 国内外研究概况及发展趋势 1 2 1 国内外研究概况 近几十年来,各国都逐渐开展了对语音应用技术的研究开发工作,并取得初步成果, 其中美国、日本、欧洲一直在该领域的研究中处于领先地位。由于数字信号处理理论和 实践的广泛成熟,电子计算机和超大规模集成电路的蓬勃发展也为语音信号处理提供了 良好的契机,该领域的研究一度成为信号处理技术的高潮,基于m a t l a b 的信号仿真,基 于d s p ,a s i c ,f p g a 的硬件实现也为语音技术的实用化提供了载体。国内对语音技术的 研究虽然起步较晚,但随着科研条件的不断改善,汉语语音识别研究工作也一直紧跟国 2 桂林工学院硕士学位论文 际水平,并且在近二十年来也取得了不少成果并逐步形成了“汉语语音识别 学科,并 把大词汇量语音识别的研究列入国家“8 6 3 计划。 就语音信号的降噪、增强技术来说,以提高语音识别系统前端预处理的抗噪声能力, 提高输入信噪比:或者以寻找稳健的耐噪声的语音特征参数,如以m a n s o u r 和j u a n g 提 出的短时修正相干系数( s h o r t - t i m em o d i f i e dc o h e r e n c ec o e f f i c i e n t ,简称为s m c ) 作 为语音特征参数,因为该参数是基于自相关函数序列的线性预测技术,对宽带语音具有 较好的抗噪性;或以基于模型参数适应化的噪声补偿算法,如针对加法性噪声的h m m 合 成法、p a r a l l e lm o d e lc o m b i n a t i o n 法和针对乘法性噪声的s t o c h a s t i cm a t c h i n g 法以 及两方面都考虑的方法等 。 同时,在几十年孜孜不倦的研究中,除了最初关注的语音降噪、增强问题外,噪声 环境下( 含干扰语音) 的语音信号处理逐渐成为国内外学者重视且具有应用价值的焦点研 究课题,其中这方面的研究尤以语音的自动分离最为困难,但这正是实现语音处理技术 走向实用的有效途径之一心j 。 混叠语音信号可以由不同的基音频率、谐波、相位、声音强度及空间方位等构成, 混叠信号分离以声场景分析( a s a ) 和盲源分离( b s s ) 技术为主流,前者就是模拟人的听觉 感知特性,根据上述不同信息,尤其是提取最能反映语音感知特征的基音和谐波信息,从 而形成单一语音流,以实现混叠语音的自动分离【9 1 3 1 。其中,p a r s o n s 最早提出了选择基 音频率( 及其谐波) 的方法分离两个同时说话者的元音成分;m e d d i s 提出了考虑音调混叠 中谐波分量间相位关系敏感特性的听觉心理生理模型;苏州大学赵鹤鸣教授在声场景分 析方面做了诸多研究,对h e r m e s 提出的子谐波累加算法加以改进用于混叠语音的多基音 检测,并以语音信号的正弦模型重建各语音分量。后者也称为独立分量分析( i c a ) 其中 d y e l l i n 和e w e i n s t e i n 提出了著名的关于盲源分离问题的数学框架,其算法将盲分离 问题转化为一个特征值的求解问题,从而可用成熟的线性代数方法解决1 1 4 1 6 1 。具体来说, 在信号混合模型未知的情况下,利用混合语音信号的特征基来进行分离处理,或者引入 延时估计,或者利用基音周期信息,在频域对各频率成分的归属进行判断,将属于目标 语音的部分分离出来合成最终的输出语音,进而完成分离源信号的过程【1 7 - z o 。 此外,近几年随着研究的深入,由于语音的菲线性特征有效地提高了特征参数的鲁 棒性和辨别能力,这些优势也引起了国内外很多专家学者的极大兴趣,该方向也成为语 音分析的一个研究热点【2 卜翻。如d i m i t r i o s 等人提出了基于t e o 的非线性特征结合6 a b o r 滤波组分析处理技术相结合的多分辨率思想对语音的情绪识别,以及其在抑制背景噪声 中起到语音增强的作用都进行了诸多研究和探索,从与短时傅里叶变换相比较发现将这 一角度作为时频变换方法的优势是非常显著的团 2 7 】。上海交通大学的胡光锐教授针对 t e a g e r 能量算子在噪声抑制上的特殊作用,改进了传统的倒谱参数提取方法,提出一种 新的语音识别特征参数,对多组语音库进行识别实验的结果表明,该算法简单,直接又 3 桂林工学院硕士学位论文 i i i 有效,在保持较低计算量的同时有效地提高了特征参数的鲁棒性和辨别能力,这些优势 都引起了该领域诸多学者的极大兴趣,该方向也成为语音分析的一个研究热点【2 3 2 9 1 。 1 2 2 目前存在的问题 纵观国内外已有的该领域的研究成果,由于混叠信号处理中存在太多的未知条件, 一般情况下其分离非常困难,更不用说此情况下的语音识别。总体而言,目前的语音应 用系统还存在以下问题: 1 就信号的降噪、分离技术来说,以语音增强技术和混叠信号分离中的声场景分析 ( a s a ) 和语音盲源分离( b s s ) 技术为主流。前者是通过提取最能反映语音特征的感知因素 基音和谐波信息,来完成语音端点的检测,但多基音检测的困难成为制约该方法的重要 “瓶颈;后者是指在信号混合模型未知的情况下,从混合信号即观测信号中分离出源信 号的过程,但其算法计算量大、复杂度高,尤其是硬件实现困难,各种b s s 算法也还在 探讨完善之中。可以说,目前还没有找到区分、分离不同语音信号最为有效的特征和最 完备的分离手段。 2 语音识别、语音控制技术由于其本身技术的复杂性,对研发工作的要求高、投入 成本大,目前主要都是如微软、i b m 、a t & t 等大公司掌握此方面的核心技术,故价格之昂 贵使得其应用并不普及,正所谓“难入寻常百姓家 。 3 现有的语音识别系统对应用环境的要求都很高,大多都是针对实验环境设计的, 显然并不适用复杂的现场环境。 4 由于语音分析算法的复杂、难度大,而且实现困难,并且运算量之大、复杂度之深 对于普通高校由于师资力量和实验条件的限制,都是不容忽视的问题。 然而,虽然深知前面的道路困难重重,但是由于语音技术在工业控制以及现实生活 领域的极大发展,以及当前的语音识别、语音控制系统还难以满足生产、生活领域的应 用需要,加之本人对语音信号的浓厚兴趣,故以控制领域的应用为背景,希望通过本课 题的研究能够为控制领域向语音化、智能化、便捷化方向迈进的过程做一些工作。 1 3 主要研究内容、创新点及可行性分析 1 3 1 本课题的主要研究内容 本课题依托广西区科技攻关项目“多维数控系统 ( 桂科攻0 3 3 0 0 0 5 - 1 2 ) 、“c n c 精密 成型磨削装置数控系统研制( 桂科攻0 2 3 5 0 0 9 5 ) 、“特种罐体焊接机人工智能多维控制 系统研究 ( 桂科攻0 4 2 8 0 0 7 9 ) 及专利支持项目“液体物料运输车智能卸料控制技术研 究 ( 2 0 0 7 0 0 z l 0 2 1 ) 进行,立足点是针对语音控制领域现场环境下的特殊语音降噪研究, 4 桂林工学院硕士学位论文 最关注的是如何解决语音识别之前的净化预处理的问题,结合现有的研究成果中各类语 音模型以及滤波、降噪、分离算法,有针对性地重点研究以下几方面的闻题: 1 对语音数控系统中前端语音滤波处理的必要性和可能性进行分析; 2 收集现场语音数据( 包括纯净语音、机械噪声、撞击噪声、混叠语音干扰等) ,为 混叠语音的降噪分析提供实验依据: 3 通过对实验数据的深入分析,寻找针对周期性噪声、窄带、宽带噪声、干扰语音 的不同解决方案,尤其是对频谱范围极其相似的干扰语音的抑制。从语音特征角度考虑, 通过对孤立共振峰分量的能量分离操作,力求达到抑制干扰语音能量的目的,有别于传 统的滤波器设计,充分体现智能滤波的特色所在; 4 通过m a t l a b 对3 中推导得出的算法进行仿真验证,完成智能滤波算法的仿真; 5 在算法仿真的基础上,尝试以f p g a 形式结合n i o si i 软核处理器完成硬件实现的 总体设计框架。 综上,重点在于通过对原始的语音数据分析,寻找在嘈杂环境提取出操作人员的有 用语音信息、滤除人为语音干扰的有效算法,从而提高语音控制系统的准确性、可靠性。 因此,上述步骤中的3 、4 步是本论文所要攻克的重点和难点所在。 1 3 2 本课题的创新点及可行性分析 本课题立足国内语音分析、处理技术发展的现状,针对语音控制系统的特殊应用环 境,借鉴语音识别和声纹识别技术中的特征提取,提出一种有别于传统时域、频域滤波 的新的智能滤波思路,通过对不同噪声区别对待,尤其是对于同声道的语音干扰从提取 语音特征和能量分离的角度,去除干扰语音信息能量、保留目标语音有用信息的智能滤 波算法。简言之,从提取语音特征这一角度进行智能滤波的尝试和探索,具体思考本课 题的创新点体现在以下方面: 1 本文的立足点是语音控制应用领域特殊、复杂的声学环境,多个干扰话者存在的 情况下对有用语音的提取;实质是将语音增强、语音分离技术的综合应用,作为语音识 别之前的个智能滤波器子系统设计; 2 作为系统前端语音预处理,与识别、控制过程分开,仿真和实验测试环节也分开 进行,逐步解决,有利于降低整个系统的复杂性; 3 将混叠语音分离以智能滤波器的思想提出,前人还没有比较成熟的实现方案,而 且滤波过程还要考虑保留有用语音信息为后面的识别、控制系统所用。 纵观前入在该领域的研究方案之后,本入经过认真考虑、反复论证,认为本研究课 题是有一定可行性的: 1 带噪混叠信号分离的数学描述虽不十分成熟完善,但近年来一直是语音处理领域 的热点,国内外很多学者一直致力于这方面的研究,还是有很多方案可以借鉴,在前文 桂林工学院硕士学位论文 中现有成果部分已有介绍,为本课题的研究提供了一定的理论支持; 2 语音识别在生产、生活各方面都有应用,尤其是语音控制方面,因此本文针对语 音控制种特殊的声学环境对其进行降噪、分离预处理,是对语音控制系统进行完善,具 有实际意义: 3 开发工具的发展为本项目的研究提供了基础工具。如k a t l a b 为算法的分析和改进 提供了很好的分析工具,也为语音信号的特征分析提供了方便、可靠的手段; 4 语音信号获取的实验手段方便、可行,现有的实验条件能够满足本选题实验要求。 语音数据可取自现成的语音数据库,也可通过w i n d o w s 自带的“录音机 采集,具备实 验可行性: 5 本人具有一定的信号与系统、数字信号处理相关方面的知识储备,而且对信号处 理有较浓兴趣,而且在此前所做的研究工作也奠定了一些基础。 1 4 本课题的研究方法 1 4 1 采用的研究方法 研究方法选择的合理、正确是科学研究工作进展顺利的重要前提,正所谓“好的开 始是成功的一半”,本入在完成语音控制中智能滤波器的研究与设计过程中,主要运用了 以下三种研究方法: ( 1 ) 文献检索:在分析目前语音应用领域的发展趋势基础上,明确本课题需要解决的 核心问题,有重点地大量检索国内外该领域近年来的相关资料,借鉴前人的科研成果来 考虑解决本课题针对的语音控制领域的语音干扰问题。 ( 2 ) 理论推导:在前期文献资料收集的基础上,已初步掌握了语音这一复杂信号的处 理方法。此阶段,从语音物理特征到数学模型的建立、时一频分析、以及各语音特征的提 取方法,尤其是对能量算子应用到本课题中的这种从特征参数入手、以能量滤除为思路 的智能滤波算法进行必要的算法推导和分析证明。这部分内容是本课题的理论基础和依 据,也是对这种智能滤波思路尝试和探索的核心部分。 ( 3 ) 仿真分析与实验:“实践是检验真理的唯一标准刀,任何理论都需要有实验数据支 撑,以验证理论的正确性。针对本课题的研究需要,实验分为仿真实验和电路测试,其 中仿真实验又根据设计的不同阶段的需要分为m a t l a b 算法仿真和在q u a r t u si i 下对滤 波器s o p c 实现的功能仿真、时序仿真。如果仿真实验基本满足了事先确定的功能要求, 接下来进行电路测试。 若要完成整个智能滤波器的设计实现确实是一项非常艰巨的工作,本人作为此课题 的“先头部队”主要按照下图1 1 对语音信号处理过程的统一框架结构利用上述三种研 6 桂林工学院硕士学位论文 究方法,重点进行了算法推导证明及m a t l a b 仿真分析验证,以及s o p c 设计的功能模块 划分等部分工作。 图1 1 语音信号处理框架 在此对图1 1 所示的语音信号处理的框架结构作以下说明,一般来说,在不考虑具 体应用系统的要求下,先从剖析语音产生模型入手,以提取时变模型的基本参数,通过 足以估计语音模型参数的时域和频域方法完成:然后,用反映语音信号特点的若干参数 来代表语音,基于该模型的参数将信号恢复;最后,根据具体应用系统任务的不同,采 取不同的处理方法。 1 4 2 基于m a t l a b 的实验平台 本文采用m a t l a b 作为语音处理的仿真实验平台,它是由美国t h em a t h w o r k s 开发, 集数值分析、矩阵计算、信号运算、信号处理和图形显示于一体,构成了一个方便的、 界面友好的用户环境。它提供了强大的科学运算、灵活的程序设计流程、高质量的图形 可视化与界面设计、便捷的与其他程序和语言接口的功能。借助系统提供的各种信号处 理工具箱及系统自带的各种函数,使信号处理较以前更简洁方便且效果更好【3 0 3 2 l 。正所 谓“站在巨人的肩上更加直观、方便地进行分析、计算与设计工作,从而大大地节省 了时间。 进行m a t l a b 仿真的语音数据来源分为两部分:孤立英文数字单词的发音取自于国际 通用的标准语音数据库t i m i t ,采样频率为l o k h z :单个浊音字母和连续语音的发音是在 一般环境下通过p c 机的录音软件用普通麦克风录制的,采样频率为2 2 0 5 k h z 。 1 。5 本论文的主要工作安排 本课题研究的实质就是将语音降噪、语音分离技术在语音控制现场的特殊环境下的 结合应用,提出以一种智能滤波器的设计思想完成对强噪声环境下的语音预处理。带智 能滤波的语音控制系统总体示意图如下: 7 桂林工学院硕士学位论文 千扰说话者千扰音, 图i 2 带智能滤波的语音控制系统示意图 在上图1 2 中语音智能滤波作为语音识别和控制系统的一个预处理部分,根据这部 分设计工作的需要并结合语音信号处理的统一框架,本论文章节安排如下: 第l 章:综述课题来源、研究意义,语音应用技术的现状及趋势,阐述了本课题的 主要研究内容、创新点以及可行性,最后对论文的研究方法、结构安排情况进行了说明。 第2 章:针对本课题提出的混叠语音干扰的问题,首先介绍了语音信号处理的相关 理论,包括语音信号的基本特性、表示方法、初步处理以及人耳的听觉感知特性,这些 都是后续章节分析处理语音信号的理论基础。 第3 章:主要是关于本课题提出的针对语音控制系统的智能滤波算法的描述以及对 该算法的m a t l a b 仿真验证。首先从语音产生的数学模型入手,通过对语音信号特性的研 究,以非线性的调幅一调频模型为基础,运用t e o 能量算子,利用g a b o re s a 对各主要共 振峰进行迭代估计,再从输入的混叠语音信号中滤出干扰语音的主要分量。因为本课题 就是对于语音滤波算法的一种尝试和探索,故本章是本论文的核心所在。 第4 章:在前一章算法仿真分析的基础上,尝试以f p g a 结合n i o si i 软核处理器的 方案完成硬件实现。首先介绍了s o p c 系统设计的平台、设计流程与设计特性,然后结合 本课题对所提出的智能滤波算法的s o p c 实现进行框架设计和功能模块的划分,为后续继 续研究提出了一定思路并且做了一些准备工作。 第5 章:对全文的研究工作进行了总结,并提出了本课题研究值得进一步深入探讨 之处。 8 桂林工学院硕士学位论文 ! 苎! 竺竺皇! ! 烹| 一一i i n i n li ! 苎烹 第2 章语音信号的基本特性及处理方法 在研究和分析各种语音信号处理技术之前,必须了解有关语音信号的一些基本特征, 本章就是对语音信号的产生、基本特性、常用的语音信号处理方法、人耳听觉感知特性 做一简要的介绍,它是本论文内容在m a t l a b 下仿真,w i n d o w s 下实现的理论基础。 2 1 语音的声学特征 声波从声源向四面八方传播,声波具有两个特点:频率( f r e q u e n c y ) 和幅度 ( a m p l i t u d e ) 。声音的频率与音调有关,振幅则与音强有关,而频率和振幅之间没有必然 联系。 2 1 1 语音的产生 人类的发声过程是人体发音器官( 包括肺、气管、喉、咽、鼻、唇等) 在大脑控制下 的生理运动过程。具体来说,由于肺部的收缩,压迫气流由支气管经过声门和声道引起 音频振荡,最后从嘴唇或鼻孔,或同时辐射出来而形成语音。其中,肺和气管是整个发 音系统的能源,喉亦称之为声门,是主要的声音生成机构,声道起始于声门处而终止于 嘴唇,则是对生成的声音进行调制。 声带开启和闭合使气流形成一系列的脉冲,每开启和闭合一次的时间即振动周期称 为基音周期,其倒数称为基音频率,简称为基频,基频决定了声音频率的高低,基频的 范围大致为8 0 - - - 5 0 0 h z 。 从发生过程中声带振动与否,可以将声音分为浊音和清音,浊音中包括所有的元音 和部分辅音,而清音则包括另一部分辅音。浊音具有明显的准周期性和较强的振幅,它 们的周期所对应的频率就是基音频率;清辅音的波形类似于白噪声并具有较弱的振幅,在 语音增强中可以利用浊音具有的明显的准周期性来区别和抑制非语音噪声。 关于这些在此只简单介绍,在本章后面内容将会对其具体介绍,而且还会结合时一频 域表示给出感性认识,以加深理解。 2 1 2 语音的物理特征 语音是一种特殊的声音,它具有被称为声学特征的物理性质,它是由人的发音器官发 出的、具有一定语法和意义的声压波。和其他声音一样,仍是以波的方式在空气中传播, 同样具有声压波的三个物理属性:幅度、频率和相位。但语音又与一般的波不同,它要 9 桂林工学院硕士学位论文 被入耳这一听觉器官正确接收之后才能使人类的思想和行为做出相应反应。大量实践证 明,声音虽然是客观存在的,但是人的主观感觉( 听觉) 和客观实际( 声波) 并不完全一致。 人耳听觉系统有其独有的特性,所以从听觉感知角度来说,主要是从声音四大要素对语 音物理特性加以描述。 ( 1 ) 音强。亦称之为响度,是人耳对声音强弱程度,即声音轻、响的主观反应,它取 决于声波振动的振幅,主要是声压的函数,但和频率、波形也有关。根据实验,人耳对 于3 0 0 0 - - 4 0 0 0 h z 声音的音强的感觉是最灵敏的。 ( 2 ) 音调。即声音的高低,亦称之为音高,也是一种主观心理量,是入耳对声音频率 高低的感受。音调取决于声波的频率:频率高的声音听起来感觉它的音调高,频率低的 声音,听起来感觉它的音调低。但音调与声音的频率并不成正比,而是近似为对数关系, 另外它还和声音的强度及波形有关。 ( 3 ) 音色。亦称为音质,它反映了声音属性,是一种声音区别于其他声音的基本特征。 每个声音具有特殊的音色,人耳根据音色在主观感觉上区别具有相同响度和音调的两个 声音。 ( 4 ) 音长。即声音的长短,它取决于发音持续时间的长短。 除了上述声音的物理属性外,它还有一个重要性质,这就是语音总是和一定的意义 相联系,一定的语音要表达一定的思想和意义,不同的语气、情感,甚至“言外之意 的表达使得语音中所包含的信息十分丰富和多种多样。 人类听觉器官对声波的音调、音强、声波的动态频谱具有一定的分析感知能力,通 过对音调、音强、音色、音长这四大感知要素对听觉感知特性有所深入研究,建立了各 类声学产生和感知的数学模型,并应用于语音分析处理以及各种语音应用技术中,取得 了一定的成果。 2 1 3 语音特性的数学描述 上面从声波的音调、音强、音色、音长这几个听觉感知特性对语音的物理特征进行 了描述,下面将结合语音信号的数学表达形式
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年秋季开学高中开学第一课(文明用语)课件
- 2026年秋季开学初中开学第一课(理想教育)课件
- 2026年秋季开学高中军训结营仪式课件
- 租赁期间房屋出售带租约合同 买卖不破租赁专用模板
- 数据要素市场化配置与资产化转化路径研究
- 数字人民币的场景拓展路径与应用效能研究
- 高等教育志愿填报的梯度构建模型与优化策略研究
- 智能网联汽车人机交互界面设计原则与实践
- 前沿科技对新质生产力的催生作用深度剖析
- 耐心资本背景下企业长期价值评估与成长路径研究
- 【新教材】人教版(2024)九年级上学期物理(13-17章)必背知识清单
- 2026乐山市市中区国有企业第二批社会招聘6人考试模拟试题及答案详解
- 小学一年级数学《分一分》跨学科主题式教学设计
- 江苏《城镇供水水表安装及维护技术规程》
- 四川成都市成华区2025-2026学年八年级下期期末学业水平监测英语试卷
- 剖宫产术的护理配合
- 第15讲 开学综合摸底检测试卷及答案-2026年秋三升四小学数学(人教版新教材适配)
- 公立医院行政管理岗招聘考试核心考点笔记:公共卫生应急管理
- 2026年江苏省事业单位公开招聘考试真题与答案
- 净水厂调试 运营方案
- 2026年初中历史中国近现代史专题讲座
评论
0/150
提交评论