(通信与信息系统专业论文)汉语普通话易混淆音素的声学区分.pdf_第1页
(通信与信息系统专业论文)汉语普通话易混淆音素的声学区分.pdf_第2页
(通信与信息系统专业论文)汉语普通话易混淆音素的声学区分.pdf_第3页
(通信与信息系统专业论文)汉语普通话易混淆音素的声学区分.pdf_第4页
(通信与信息系统专业论文)汉语普通话易混淆音素的声学区分.pdf_第5页
已阅读5页,还剩59页未读 继续免费阅读

(通信与信息系统专业论文)汉语普通话易混淆音素的声学区分.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 随着世界经济一体化和我国在世界经济中地位的逐步提高,汉语普通话的学 习成为国内外越来越多人士的迫切需求,由于学习人数的急剧增多,普通话教学 资源显得越来越匮乏。计算机辅助教学,一方面可以节省大量的汉语教师资源, 同时又能满足学生随时随地独立学习的要求,是解决上述问题的一种有效手段。 目前世界上主流的计算机辅助教学技术是采用语音识别的框架,这种框架的 缺点就是声学模型对相似发音的鉴别能力有限,因此对易混淆音素的评估准确程 度不高。为了弥补语音识别框架的这一缺点,本文对计算机辅助教学中汉语普通 话易混淆音素的区分进行了研究,针对易混淆音素的声学特征,提出了三种新的 特征参数,并采用高斯混合模型( g m m ) 分类方法,形成一个针对易混淆音素区 分的识别算法。 在易混淆音素的区分框架中,针对发音方法相同发音部位不同的平舌音和卷 舌音的区分,提出了采用强频集中区的能量分布作为区别特征的方法;针对平舌 音和卷舌音的能量分布不同,通过美尔三角滤波器组提取高低频的能量累积和, 提出了基于美尔倒谱系数( m f c c ) 特征的新参数作为区别特征的方法;针对人耳 听觉感知模型,采用了小波包分解的方法,对易混淆音素的频谱特征进行了精细 的描述,提出了基于感觉加权线性预测系数( p l p ) 特征的新参数作为区别特征的 方法,使用g m m 对新的特征参数进行分类,并且针对不同的模型阶数进行实验, 从而达到区分的目的。 关键词:语音识别强频集中区m f c c 特征p l p 特征g 删模型 a b s t r a c t a st l l ei n t e a t i o no fw o r l de c o n o m y 锄dm ee n h a n c 锄e n to fo u rc o u n 姆s p o s i t i o ni nw o d de c o n o m y ,l e a r i l i n gc l l i n e s eh a sb e e nm eu r g e n t 糟q u i r e m e n tf o rm o r e a n dm o r e p f e s 蹦t a t i v ep c o p l ea lh o m ea 砖a b 妁a d ,b c c a u s eo ft h es h a 翠l yi 薹l c f e a s eo f l e a = m c l l i l 他t c a c i l i i 培心s o u r c e sg os h o r t c o i n p u t e 卜a s s i s t e dl 粕g u a g el e 锄i n gc a n s 熬潜c 毯l 搀s e 专鼹c h 嚣髂q 粼so 薹薹壤eo 萎eh 甜砖,a 差氇e 髓m e 蠹羚e 主耄c 褪越s om e e 专专k l e 锄e r s r e q u i r c m e n t st 0l e a mc h i n e s ei n d e p e n d e n t i ya ta r 班i m e 舭l d 锄妒眺e r e ,w i l i c h i s 强e 胝垃v e 掇如丽幻s o l v e 也e 即挝e m n o 岫s n 地m a i nt c c h n o l o 舒o fc o m p u t e r - 舔s i s t i 砸s t 醐d a r dm 觚d 撕nl e 锄i n g i sm a “n gu o f 跚屺宅c h c o g l l i t i o n 您强1 e ,t :h ed i 翮d 、瑚姆o ft 址s 包m i s 出a tm e a c o 璐t i em c 成lh 弱al 锨d i s c l 弧i l 觚o na b i l i t yo fs 诚i l a rp n 黼c i a t i o n 孙m a k e 坤 n l ed i s a d v 锄t a g eo fs p e e c hr e c o g n i t i o n 胁e ,t l i sp a p c rd i 8 c u s s e smd e t a i lm e 蠢s c 五黻嫩a 磊。建o fe a s i l yc c 眭f l l s c d 糙a l 话a f 试p 幻n ep 鼗主r s 主鑫氇ee o 掰搿玩势蹈s i s t d 搬比l l i n g ,d i r e c t st o w 2 们sa c o u s t i c 觑咖啪o f 也e p h o mp a j r s ,n 1 1 优n e wf - e a t l 玳 e 趣嚣c 熏i 溅蠢g o 磊妇黟a f ep 羚p o s e d ,觚i 雒m i 舔暇m o 穗l 趣g g m 购i s 璐e d 协 c l 嬲s i 母也en e w f e a t u r e s an e w r e c o g i l i t i o na l g o r i m mo fe a s i l yc o 缸e dp h o n ep a i r si s 娶印o d h lm ed i s 商m i i l a t i o n 觑瞄eo fe a s i l yc o 耐l l s e dp h o ,a e c o r d i n gt ot l l ef l a tt o n g u e a r l dr a i s e dt o n g u ec o r 璐o n a n tw i 也t l l es 锄ea 】r t i c u l a :t i o nm a m l e ra f l dd i g i e r e n ta f t i c u l a t i o n p l a c e s ,馕ep 8 p e rp f o p o s e s 也em e 魄o dw 量l 主c h 搬1 0 p t s 壤ee n e f g ye 雠e e n 艇撩磁f e 驴e 赫c y a r e a 粥t l l ed i v i s i o n a lc 慨t e r d i 擞曲gt o w 篁耐s 1 ed i 俄r e n te n e 嘲,d i 嘶b u t i i l go f 鑫a 耋专。藏签瓣a 砖豫i s 谑幻建g 鹳溺盘谶l 妇瘿e 纛l 据搀e x 麟堍鞠娌嚣辩mo f 赫g 基撼d l o w 触l u e n c y ,龇m e t h o db a s e do nm e lf 嘲u e n c yc e p s t n 珊c o e 伍c i c n t ( m f c c ) 凳a t 瑾- ei s 即p o s 甜。a i m 遮g 越也e 狐拄嘲e a f sa l l d i 幻猡m o d e l ,姆璐i 鹅也ew a v e l e t p a c k e td e c o m p o s i t i o 玛d e s c r i b i n gf 酶q 联l n c ys p e c t n 腓o fe a s i l yc o n f l l s e dp h o n ep a i r s m o r ea c c u 】瓣l y ,龇m e t h o db a s e do np e r c e p t u ml 洳e a rp r e d v e ( p l p ) f e a l 础i s p r o p o s 丽t l l ep a p e ru s e sg m m t oc l a s s i 每t h en e w a 訇田e 如rp 酗n ed i s c r i m i 瑚【t i o 娃 n ee x 耐m e n ti sd o n eb yd i 腩r e n tor d i e ro fg m m ,w m c h 甜a i l l st h ep u 印o s eo f r e e o 簪遗傩凌ep b 鑫e 羿i r s 薹( 锣w o 砖s :s p e e e h 托e o 龄主量主。珏 m f c cf e a t u r e e 矬e l + g yc o 瓤c e 珏塞l a 删薹警唾疆e 臻l :ya 1 e 曩 p l pf e a t u r eg m mm o d e i 创新性声明 本人声明所呈交的论文是我个人在导师指导下进行的研究工作及取得的研究 成果。尽我所知,除了文中特别加以标注和致谢中所罗列的内容以外,论文中不 包含其他人已经发表或撰写过的研究成果;也不包含为获得西安电子科技大学或 其它教育机构的学位或证书而使用过的材料。与我同工作的同志对本研究所做 的任何贡献均已在论文中做了明确的说明并表示了谢意。 申请学位论文与资料若有不实之处,本人承担一切相关责任。 本人签名: 醐二与坐, 关于论文使用授权的说明 本人完全了解西安电子科技大学有关保留和使用学位论文的规定,即:研究 生在校攻读学位期间论文工作的知识产权单位属西安电子科技大学。本人保证毕 业离校后,发表论文或使用论文工作成果时署名单位仍然为西安电子科技大学。 学校有权保留送交论文的复印件,允许查阅和借阅论文;学校可以公布论文的全 部或部分内容,可以允许采用影印、缩印或其它复制手段保存论文。 ( 保密的论文在解密后遵守此规定) 本人签名: 导师签名: 日期上牲 日期垒2 :兰:二 , 耋一 益墟堑 第一章绪论 第一章绪论 1 1 研究背景 近年来随着我国国际地位的不断提高和国际交往的日益广泛,世界各国对汉 语学习的需求急剧增长。汉语是世界上使用人口最多的语言,也是联合国规定的 六种工作语言之一,它正在受到越来越多的国家政府、教育机构、企业以及传媒 的重视。据统计,学习汉语的外国人每年大幅度增长,目前全世界有近1 0 0 个国 家的2 0 0 0 多所大学在教授汉语,英、泰、印尼等国更把汉语纳入正规教育体系, 全球学习汉语的人数达到近3 0 0 0 万,预计数年后全球学习汉语的人数将达一亿人。 在中国的近邻韩国,上百所大学开设了汉语课程,学习汉语的人数超过l o o 万,一些著名的企业出于战略考虑越来越重视培养员工的汉语能力;在日本,“汉 语热 直追“英语热,成为继英语之后的第二大外语,学习汉语的人多达2 0 0 万 左右。仅日本五大主要中文培训学校,2 0 0 4 年的入校生已突破5 0 0 0 人,比2 0 0 0 年增加了5 倍;2 0 0 2 年到2 0 0 5 年,英国大学里把汉语作为主课选修的学生数量已 经翻了一番。英国汇丰银行从2 0 0 1 年起每年都投入大量资金,通过英国文化委员 会主办若干支持汉语教育和赞助青年才俊学习中文的项目;法国的汉语热更是保 持了强劲的增长势头。汉语学习人数在法国增长很快,英语、日语、西班牙语的 年增长率是2 4 ,汉语则高达3 8 ;美国公立中小学学习汉语的学生在2 0 0 4 年有2 万多名,到2 0 0 6 年则猛增到5 万多人;2 0 0 3 年,美国有2 0 0 所中小学校开 设中文课,2 0 0 6 年增长3 倍。美国大学理事会的一项调查显示:愿意把汉语列入 大学预修课程的高中有2 5 0 0 所。 在国外的汉语学习热潮出现的同时,国内也在逐渐加大汉语普通话的普及和 推广力度。早在5 0 年代,国家就提出了“大力提倡,重点推行,逐步普及”的普 通话推广方针。进入社会主义建设新时期以来,推广普通话工作进入一个新的阶 段。1 9 8 2 年修订的中华人民共和国宪法规定“国家推广全国通用的普通话 , 第一次在根本大法中明确了普通话的通用语言地位。随后,推广和使用普通话陆 续写进民族区域自治法、义务教育法、教育法等多种法律、法规。改革开放以来, 随着社会主义市场经济以及中文信息处理技术的迅速发展,使得推广普通话成为 日益紧迫的任务。同时,随着教育的逐步普及和教育手段现代化程度的提高,广 播电视等有声传媒的迅速普及,以及范围越来越广的人员流动,掌握普通话的人 越来越多,在全民范围内普及普通话和提高普通话应用水平已经具备了现实基础。 推广普通话要从实际出发,实事求是,针对不同地区、不同行业、不同年龄 等情况,应提出不同的要求。因此,国家语委1 9 8 6 年正式提出讨论普通话水平等 2 汉语普通话易混淆音素的声学区分 级的问题,此后先后成立了相关的课题组,研制“普通话水平测试等级标准”和 “普通话水平测试大纲”。经过五六年的准备,于1 9 9 4 年底,e l l 国家语畜文字工 作委员会、国家教育委员会、广播电影电视部联合发布了关予开展普通话水平 测试工作的决定,普通话水平测试( p s c ) 自此在全国正式开展起来。2 0 0 0 年l o 月颁布的中华入民共和匿国家通用语言文字法又通过立法手段对普逶话水平 测试加以强调。近几年全国各地( 包括港澳地区) 测试工作发展十分迅速,形成 了比较科学规范的管理和运霉亍体系,产生了广泛的社会影响。普通话水平测试已 成为国内由政府机构主办的测试汉语普通话水平的权威考试,也是国家备级公务 员和各级教师上岚前必须经过的考试。 随着国内外汉语普通话热潮的兴起,汉语教师匮乏的问题也越来越突出。根 据国家汉办提供的数字,马来西亚汉语教师缺阴9 万人,印度尼谣亚缺口l o 万人。 同时,嚣本、韩国、泰国、菲律宾、越南、印尼、中亚五国、印度、巴基斯坦等 周边国家对汉语教师的需求都非常迫切;非洲、阿拉伯地区、南美、欧洲、北美、 澳大利亚、薪西兰等国家纛地区,瞧都希望在汉语教学方面得到中重的帮助。尽 管我国教育部门努力做好相关工作,但教师缺口仍然很大。问题主要表现在以下 两方面。 第一,传统的教室语言教学模式已经无法满足第二语言学习的需要。随着信 息技术的发展、全球经济一体化的形成和工作生活节奏的逐渐加快,语言教学和 学习的模式发生了巨大的变化,已经逐步从传统的语法学习转向了更加注重相互 交流能力的培养,语言学翔越来越强调发音的学习和训练,因为它是相互交流的 基础。然焉,传统的教室语言教学的模式己经无法满足语言学习特别是第二语言 学习的需要,在新的历史条件下,这种方式遇到了很多无法解决的问题: ( 1 ) 发音教学需要一个老师专注于一个学习者,根据每个学习者簿发音掌握 的程度不同,提出不同的要求,而在教师语言教学中,一个老师不可能同时满足 教室中所有学习者的需要; ( 2 ) 发音学翔过程中,学习者需要进行大量单调的重复练习,这需要语言教 师足够的耐心和大量的时间,而教师语言教学中,至少在时间上无法满足学习者 的要求; ( 3 ) 教室语畜教学模式对于学习者的时间和学习地点要求严格,而随着工作 生活节奏的加快,学习者希望可以在任何地方自己方便的时润、地点进行像在教 室中有教师辅导一样的学习。 第二,普通话东平测试采用的主观测试方法亟待改进。譬翦,由国家语委组 织的普通话水平测试主要是采用主观测试的方法,这使得测试成本很大,测试员 的工作强度很高,丽且由予人工测试员不可避免的主观性,造成不同测试员之闻, 甚至相同测试员在不同时间、地点的测试标准难以统和准确掌握,从而使得测 第一章绪论 3 试信度受到一定的局限。 1 2 研究意义 基于上文提到的关于语言的教室教学模式和主观测试方面存在的问题,目前 由于国内大力推广普通话和国外汉语学习热潮的兴起造成的汉语普通话教学资源 的严重匮乏。随着计算机技术的发展和语音处理技术的不断完善,计算机辅助语 言学习和测试已经成为可能,基于计算机的语言学习软件已经从最初的只能进行 阅读、听力和简单的输入等功能发展到了更高的阶段。 目前世界上主流的计算机辅助语言学习是在语音识别的框架下,假设声学模 型代表标准发音,通过计算待测语音的短时频谱特征与声学模型的匹配程度,确 定待测语音的发音质量。这种评估框架的优点是计算简单,它使用一个统一的流 程就可以处理待测语言中的所有音素。但是,由于语音识别框架中声学模型的建 模方法单一,这种框架也有其致命的缺点,那就是声学模型对相似发音的鉴别能 力有限,因此对易混淆音素的评估准确程度不高。 为了弥补语音识别框架的这一缺点,本文针对汉语普通话易混淆音素的区分 展开研究,针对不同音素的声学特征,提取不同的声学特征用于训练统计模型, 然后采用与声学特征相适应的分类方法对易混淆音素进行区分。这种方法虽然针 对不同音素采用了不同的特征和分类策略导致增加了计算复杂度,但是能够获得 更好的识别效果,因此是经典语音识别框架的良好补充。 1 3 国内外研究现状 自上世纪9 0 年代以来,国内外很多研究单位和学者对计算机辅助语言学习发 音评估进行了研究。美国s 融公司【1 2 1 、英国剑桥大学【3 卅、英国爱丁堡大学【5 1 、日 本京都大学【w 】等机构的研究人员分别在带有各种口音的英语、法语、西班牙语和 日语等语言上进行过研究。国内的清华大学嘲、北京大学f 9 】、中国科技大学1 1 0 1 、哈 尔滨工业大学【l l 】和台湾清华大学【1 2 】等单位在带有口音的汉语和英语上进行了研 究。 计算机辅助语言学习发音评估的初期研究集中在使用文本相关算法对发音质 量进行评估。文本相关算法是通过把测试者的发音与相同内容的标准参考发音进 行各种参数的比对,对测试者的发音质量进行估计。如b e m s t e i n 【1 3 j 和d i g a l a h s l l 4 j 采用离线训练的隐马尔科夫模型对测试者的发音进行切分后,通过比对测试者发 音和标准发音的频谱特征和段长特征对音素发音质量进行评估。虽然文本相关算 法的评估结果与人工的评估结果有比较高的相关性,但是这种方法需要额外建立 一个标准语音数据库作为评估模板,如果学习内容有所改变,必须在更新升级标 汉语普通话易混淆音素的声学区分 准语音数据库后才能对新的内容进行评估,而且随着学习内容的增加,数据库的 规模将不断增大,这使得该方法应用起来非常不便。 9 0 年代中期,随着美国s 黜公司“语音交互语言训练系统( v i l t s ) 项目的 进展,基于语音识别技术的文本无关发音质量评估算法逐渐成为研究的主流。文 本无关的评估算法提取语音的声学特征,用统计的方法训练声学模型代表标准发 音的声学特性,然后用语音识别的相关技术计算待测语音和声学模型的似然度, 根据这个似然度对发音质量进行评估。l9 9 6 年n e u m e y e r 和鼬m 使用s 公司的 d e c i p h e r 语音识别系统把待测语音切分为音素段,用隐马尔可夫模型和v i t e r b i 解 码算法计算每个音素的对数后验概率作为待测语音和标准语音之间相似性的测 度,在带有美语口音的法语上进行了音素和句子发音质量评估的研究。1 9 9 9 年 n e u m e r y e r 和f r a n c o 使用类似音素识别器的分类器对待测者的句子发音进行了评 估。音素分类器由目标语言的语音数据训练得到,如果被测者的发音与训练用的 语音数据接近,那么分类器将输出较高的似然概率。2 0 0 0 年f 姗c 0 使用和 n e l l m e y e r 类似的方法计算音素似然度概率作为衡量发音质量的主要指标,同时他 还提取了音素段长、语速等信息作为辅助测度,研究使用各种方法融合这些信息 对句子级别的发音质量进行评估。2 0 0 0 年s 砌公司正式推出了e d u s p e a k 发音评估 及语言教学系统用于英式英语的辅助教学,这是世界上第一款比较成熟的文本无 关的商用发音教学软件。 同时期,英国剑桥大学在文本无关的自动发音评估方面也开展了卓有成效的 研究。1 9 9 7 年w i t t 使用自动语音识别技术切分待测语音中的音素段,对于每个音 素段用它在标准答案上的强制对齐概率和在音素循环网络上的强制对齐概率计算 “发音良好度”作为衡量发音质量的测度。学习者在学习第二语言时,总会用自 己母语的某些发音来模拟第二语言中的某些音素,但是两种语言中的发音不可能 做到一一对应,所以对这些发音的评估效果很差。因此l9 9 9 年w i t t 对系统进行了 改进,在评估语法网络中引入了学习者母语的发音单元用来预测规律性的发音错 误,同时采用了语音识别的声学模型自适应技术消除说话人的个性影响,取得了 很好的效果。 使用语音识别框架可以为所有发音提供统一的评估算法,这简化了发音评估 系统的结构和评估流程。但是语音识别框架也有它自身的缺点:因为声学模型的 鉴别能力有限,用它评估相似发音往往并不准确。因此很多研究者研究了使用其 他方法和特征进行评估。日本w 蕊d a 大学的s u z u l ( i 【l5 】研究了非本土说话人的发音 自然度,从音素、音节、词等方面分析比较了非本土说话人和本土说话人在发音 自然度方面的区别,采用了线性回归模型和回归树模型来提取比较参数进行发音 评估。日本东北大学的i t o 【l 倒提出了一种基于错误规则决策树聚类的发音错误检测 方法,发音错误检测阈值的设定依赖与音素所属类别的划分。台湾清华大学的陈 第一章绪论 5 江村采用四种特征参数对英文发音进行评分:音量强度曲线、基频轨迹曲线、发 声急缓变化( 段长) 和h m m 对数概率。在评分方面,针对不同的特征参数设计 合适的图样比对及评分机制,以建立一个合理的评分系统。荷兰的t r u o n g i l 7 j 则提 出了一种使用“声学一音素学”知识进行发音错误检测的新方法。 在学习者对目标语言的音素、字的发音熟悉以后,随着流利程度的增加,对 目标语言韵律的掌握变得越来越重要。在对韵律质量进行评估时,特征的选取十 分关键。韵律特征一般包括重音、语调、节奏等,而在现有技术中,段长,基频、 能量等超音段信息的使用比较多。b a g s 姗通过在音节层对语音的基频、段长、能 量等超音段信息进行建模来描述英文发音中的韵律特征,然后仅依靠韵律特征来 评估学习者的发音质量。t e i x e i m 提取语句中单词的重音节奏、段长和基频作为韵 律特征来评估测试者语句的自然度。 1 4 主要研究内容 汉语普通话是一种音节语言,音节是构成单字和多字词的基础,而单字和多 字词又是构成句子的基本元素。每个音节一般包含声母、韵母和声调三部分,具 有严格的“声一韵”结构,如图1 1 所示,音节的前半部分是声母,后半部分是韵 母,声母和韵母拼读构成音节,音节的声调取决于韵母的基频变化模式。 声母【介音 韵母【韵尾】 元音辅音 图1 1 汉语普通话音节结构 正是由于普通话这种严格的组织结构,普通话的发音质量绝大程度上取决于 音节的发音是否正确。根据国家普通话水平测试大纲,测试的重点正是单音节字 和双音节词。在评价普通话的音节发音质量时,考虑到音节的构成方式,我们的 评估方法采用先对每个音节的声母、韵母和声调分别进行评估,然后综合三项得 分得到音节的发音质量得分。与主流发音质量评估系统一样,系统首先使用“强 制对齐 技术把待测语音按照音素进行切分;然后计算每个音素后验概率的置信 度作为评估其发音质量的依据;最后用设定的阈值把置信度得分映射为韵母或声 调的发音质量评估结果。对声母的评估是在“强制对齐切分得到的声母部分上 单独进行:对声母部分提取声学特征用统计分类器识别,然后根据识别结果对声 母质量做出判决。 在基线系统的基础上,本文对易混淆声母的评估提出了一系列的改进技术。 对声母评估的改进主要是在基线系统框架内,对特征提取采取一些优化措施,在 语音识别框架内的改进主要是使用g m m 模型进行分类。 6 汉语普通话易混淆音素的声学区分 本文研究的章节安排如下: 第二章将首先介绍汉语语音学及语言学知识,详细讲述发音机理和声母的特 征,以及语音信号的预处理和数字化。 第三章主要介绍传统描述语音信号特征的参数,包括短时能量谱、倒谱、m f c c 参数和p l p 参数。 第四章主要介绍描述汉语普通话易混淆音素声学特征的新特征参数算法。 第五章主要介绍高斯混合模型( g m m ) 及其相关理论,包括g m m 模型的基 本概念、参数估计和识别算法。 第六章主要介绍实验的流程和m a t l a b 仿真的结果及结果分析。 第二章汉语语言学及语音学知识 7 第二章汉语语言学及语音学知识 2 1 发音的生理结构和过程 语言是从千万人的言语中历史的概括出来的规律性的符号系统,是人们用以 进行思维、交际的形式。语音是声音和意义的结合体,语音的声音是语言的物质 形式,语音是语言的物质外壳,信息的载体。但是声音和意义之间没有必然的联 系,也就是声音表达什么意义不是天然生成的,而是社会约定俗成的结果。 语音是由一连串音所组成的,这些音在相互间的过渡就是代表信息的符号, 这些音( 符号) 的排列由语音规则所控制。对这些规则及其在人类通信中含意的 研究属于语言学的范畴,而对语音中音的分类和研究称为语音学i l 引。 人的发音生理机构如图2 1 所示,发音时由肺部收缩送出一股直流空气,经气 管流至喉头声门处( 声门及声带开口处) ,在发音之初,声门处的声带肌肉收缩, 声带并拢间隙小于l i m n ,这股直流空气冲过很小的缝隙,使声带得到横向和纵向 的速度,此时,声带向两边运动,缝隙增大( 成年男性开到最大时,截面积约为 2 0 舢一) ,声门处压力下降,弹性恢复力将声带拉回平衡位置并继续趋向闭合,即 声带产生振动,而且具有一定的振动周期。 图2 1 发音器官图1 1 9 】 1 上下唇2 上下齿3 齿龈4 硬腭5 软腭6 ,j 、舌7 舌尖8 舌面9 舌根1 0 咽腔 1 1 会厌软骨1 2 声带1 3 喉头1 4 气管1 5 食道1 6 口腔1 7 鼻腔 一般把声门以上,经咽喉、口腔( 舌、唇、腭、小舌) 的这一管道称为主声 道,成年男子的主声道长度约1 7 c m ,而经小舌和鼻腔的这一管道称为鼻道。此外, 汉语普通话易混淆音素的声学区分 经肺支气管和气管的管道称为次声门系统。由声带振动激发声道中空气发生振动, 并从口和鼻两处内外辐射产生声音。声道的口、鼻两个管道中,从鼻咽郝到鼻孔 的分支称为鼻道分支,只有在发鼻音时才打开,从声门到唇是主声道,它被舌面 隆起点隔开,近视可看出咽腔( 后腔) 、小管、口腔( 前腔) 等几部分,期发一语 音时,声道腮岗( 包括舌谣) 运动到一令特定的部位,构成一定声道的缀形,形 成该语音的特定音色。 语音按其激励形式的不同大致可以分为三类。当气流通过声门时。如果声带 的张力刚好使声带产生张弛振荡式振动,产生一股准周期脉冲气流,这气流激 励声道就产生浊音或称为有声语音。如果声带不振动,丽声道在某处收缩,迫使 气流以高速通过这收缩部分而产生湍流就产生清音戡摩擦音,或称无声语音。 如果声道在完全闭合的情况下突然释放就产生爆破音。 语音信号随时润丽变化的谱特性可以利熙语图仪用图形显示,此图有时也称 为语谱图,是一种三维图形,纵轴对应于频率,横轴对应于时间,图像的黑白度 正比于语音信号酶能量。 2 2 1 声母概述 2 2 声母的特征 声母是汉语普通话中音节的起始方式,它的声学特征基本上反映了生理的发 音部位与发音方法。相对韵母来说,声母一般发音持续时间较短,但是其对于整 个音节的听辨却起到十分重要的作用。 在基于删的汉语普通话客观测试方法中,对于声母发音水平的评价依然 存在着和韵母相同的问题,即方法所使用的声学模型在某些声母之间豹鉴别力不 高,导致提取出的描述和量化测试者发音质量与正确发音的发音质量之间接近程 度的评估特征不准确,性能较差,不缝准确反映测试者在声母上的发音水平。这 也是整个客观测试方法性能下降的原因之一。 图2 2 是汉语普通话声母知觉相似度聚类图。聚类图是利用普通的听力正常的 听音人,在不同的传递条件下所俸的语音清晰度试验数据,建立语音混淆矩阵, 再借助心理数学方法进行多维分析和群集分析得到的。试验中的听音人都是普通 的听音入,不是语音学家,听音前也没接受_ 过语音学的特殊谶练围l 苁图中可以看 出,声母的语音相似度与传统语音学按发音方法和发音部位对辅音做出的分类具 有很高的相关度,同时,其他国家的语言和我国的方言中也总会有其中某些类别 的发音产生混淆。 语音的区别特征,是构成语音信号的基本元素,它不但是语音学和誊系学研 究的重要内容,也是语音信号处理技术所面对的重要处理对象1 2 0 l 。本文提出了基 第二章汉语语言学及语音学知识 9 于语音区别特征的方法,对汉语普通话中在图2 2 中容易被混淆的声母讹、s l l s 和c 肌进行评价和区分。 2 2 2 音位与区别特征 图2 2 汉语普通话声母知觉相似度聚类图 本世纪五十年代初,由于现代音系学和实验语音学的发展,产生了一种新的 分析语音的方法和理论,叫做“区分特征 ( 或作“区别性特征 ,简写为d f ) 。 它的基本精神就是认为一切语音之所以能表达意义,是由于各音之间有了区别, 而这些区别,都可以用二分法和“偶分法则 来予以归类和分析。 区别特征是一种比传统语音学分析语音方法更加周密的方法,它有一套严格 的规则。传统语音学从发音的生理和物理过程分析,对语音进行分类取得了很大 成绩。可是语言学家发现,由生理和物理属性分析得到的语音最小单位音素, 常常与人们听觉主观感知的印象不一致。因为语音信号具有特殊的双重属性,那 就是它既有自然属性又有社会属性。同样的生理物理属性,在不同的语言中所起 的作用是不一样的。所以从语言的交际功能来考虑,就又产生了区分意义最小的 语音单位音位。从宏观上来看,音素和音位都可以算是最小的单位,但是从 微观上来分析( 主要利用声学分析,如频谱) ,却又可以看到一个语音里面诸多有 特色的细节1 2 0 1 。也可以理解为,音位是比音素更小的区分单位,其负载了语音更 加精细的区别特征。 1 9 5 2 年j a k o b s o n ,f 锄和h a l l e l 2 l 】提出了把语音分解为“终极单位” ( u l t i i i l a t e u i l i t ) 的思想,能够区分不同音位的最小差别就叫区别特征。一个言语消 息负载着两维信息。其中一维是在一个音位里边,几个特征同时集总的;另一维 是这些音位又是相继出现的时间序列。因此区别特征在相互链接时,又受一定的 语言规则的约束。任何一种语言的编码,都只是由有限的区别特征和精细的规则 所构成的序列。 删 | 耋 舢 伽 棚 脚 姗 o m o o o o 0 1 0 汉语普通话易混淆音素的声学区分 2 2 。3 声母的区羽特征 声母,属于汉语普通话中的辅音,其发音特点不阉予韵母。声母发音时,口 腔中存在不同程度的阻塞或阻碍;气流类型一般是脉冲波和湍流;并且发音成阻 部位肌肉紧张。 普通话中辅誊发音般有三个阶段:成阻、持阻秘除阻。所谓成阻是指舌头 某部分开始上举直到与上腭构成阻塞和阻碍;持阻是指保持阻塞一段时间以便口 蠹蓄足一定气压:除阻是指构成阻塞的两部分突然放开,一毅强气流释放盘来, 好像爆破音一样。塞音和塞擦音都有这三个阶段,而擦音是在持阻过程中除阻的, 也就是说除阻过程中伴随着持阻过程。 普通话中辅音一般是按照发音的部位和发音的发法进行分类的。发音部位即 在辅音发音过程中成阻时,舌与上腭接触构成阻塞和阻碍的位置;发音方法是指 辅音发音过程中除阻的方式。辅音发音时不同的发音部位和发音方法,可以在语 图上形象地分解为一组基本模式【2 2 1 ,如图2 3 所示: v b i c eb a r 圈2 3 辅鸯声学特征基本模式 冲直条( s p i k e ) :塞音破裂产生的脉冲频谱,表现为一直条,意味着在所有的 频率成分上都有能量分布; 无声空间( g a p ) :在塞音和塞擦音破裂之前有一段空白,这是辅音成阻、持 阻时段的表现,造成渍塞音的效果;这一段虽是空自,僵对塞音来说是不可缺少 的; 嗓音横条( v o i c eb a f ) :这是声带振动的浊音流经鼻腔辐射到空气中在语图上 表现。冲宜条之前若有一条5 0 0 h z 以下的嗓音横条,说明这是浊塞音; 乱纹( f i l l s ) :这是气流流经口腔某部位狭窄通道造成的湍流,所有的塞音在 第二章汉语语言学及语音学知识 语图上都表现为乱纹: 共振峰( f b m 托t ) :其定义与元音不同,鼻音、边音都有共振峰。 普通话所有的辅音的声学特征都是这些基本特征的组合【2 ”。以上声母的声学 特征在不同的音位的表现也构成了声母的区别特征。本文针对不同声母的不同特 征对其进行一对一的区分。 2 3 平舌音和卷舌音的特点 汉语普通话包含六个平舌音和卷舌音 s 】, 出】, c 】, c h , z 】, z h ,其中, 对应的平舌音和卷舌音容易混淆,比如 s 】和 s h 【c 和 c h 容易混淆,本文要区分 的就是发音方法相同、发音部位不同的对应的平舌音和卷舌音。 汉语普通话中的平舌音和卷舌音,对应的发音部位不同。平舌音均为舌尖齿 龈音即发音时成阻是由舌尖和齿龈相接触而形成的:卷舌音均为舌尖后硬腭音, 即发音时成阻是由舌尖与后硬腭相接触而形成的。而它们对应的发音方法是相同 的。不同的发音部位是在生理分析上对它们进行区分的特征。 图2 4 平舌音 s 】的频谱图2 ” 图25 卷舌音【s h 】的频谱图8 ” 汉语普通话易混淆音素的声学区分 对应的平舌音和卷舌音,其发音部位不同,即发音过程中成阻的部位不同, 则造成发音时共鸣腔大小的不同,不同大小的共鸣腔使得共鸣频率不同,即能量 得到加强的频率位置不同,这就造成了强频集中区的不同。图2 4 和图2 5 是平舌 音 s 】和卷舌音【s h 】的频谱图。 2 4 语音信号的数字模型 发声是由于肺部的收缩,压迫气流由支气管经过声门和声道引起音频振荡而 产生的。其中声道起始于声门处而终止于嘴唇,包括咽喉( 连接食道和口) 、口腔, 鼻道则是从小舌开始到鼻孔为止。当小舌下垂时,鼻道与声道发生耦合而产生语 音中的鼻音。 发声过程中声道各处的截面积取决于舌、唇、颌以及小舌的位置。声道截面 积是随纵向位置而变的函数,称为声道截面积函数,声道的共振峰特性主要取决 于声道截面积函数,它决定所发声音的频谱特性,即音色。人类发音过程有三类 不同的激励方式,因而能产生三种不同的声音,即浊音、清音和爆破音。当气流 通过声门时声带的张力刚好使声带发生较低频率的张弛振荡,形成准周期的空气 脉冲,这些空气脉冲激励声道变小产生浊音;如果声道中某处面积很小,气流高 速冲过此处时产生湍流,当气流速度与横截面积之比大于某个门限时便产生摩擦 音,即清音。如果声道某处完全闭合建立起气压,然后突然释放而产生的声音就 是爆破音。 利用数字技术来模拟语音信号的产生称为语音信号的数字模型,或者说利用 数字信号处理技术来实现发音器官的模拟。发音器官能发出一系列声波,那么数 字模型就能产生与此声波相对应的信号序列,这种模型是一种线性系统,它的一 组参数选定之后就可以使得系统的输出具有所希望的语音性质,系统的这些参数 是和语音产生过程有关的,为了表示采样的语音信号,我们采用的是离散时间模 型。 当发音时,激励和声道形状都是随时间而改变的,但语音信号随时间的改变 是非常缓慢的。对大多数语音信号来说,通常认为激励与声道的面积函数在 l o 3 0 m s 的时间范围内是近似不变的。在发浊音时,激励为准周期脉冲。在发清 音时,激励为随机噪声。因而可以设想,语音的数字模型是一个缓慢时变的线性 系统,这个线性系统的参数在l o 3 0 m s 时间范围内是近似不变的。目前语音处理 的许多场合都是基于上述短时平稳的假定的。 综合考虑声门激励、声道和嘴唇辐射影响就可以得到图2 6 所示的语音信号发 生的离散系统模型。也就是说,语音信号可以看作是激励信号坛( 甩) 激励一个线性 系统h ( z ) 而产生的输出,其中( z ) 是声道响应y ( z ) 与嘴唇辐射模型尺( z ) 相级联 第二章汉语语言学及语音学知识 1 3 而成,即 日( z ) = y ( z ) 宰足( z ) ( 2 - 1 ) 对于浊音来说,我们还可以把声门脉冲的影响也归并到传递函数中,即 日( z ) = g ( z ) 宰y ( z ) r ( z )( 2 - 2 ) 这时,浊音信号就可以看作是一个准周期性的脉冲串激励一个离散线性系统 日( z ) 而产生的输出。 基音周期 图2 6 语音信号产生的数字模型 2 5 语音信号的数字化和预处理 2 5 1 语音信号的数字化 语音信号的数字化【2 4 1 是数字处理的前提,语音信号的数字化包括两个步骤: 取样和量化。n y q u i s t 采样定理要求采样率必须大于或等于信号带宽的2 倍,因此 一般需要对输入的语音信号作低通( 反混叠) 滤波,然后进行a ,d 转换,如图2 7 所示。如果工频干扰( 5 0 h z 或6 0 h z ) 不严重或另有措施抑制,则不必用带通滤波 器而只需用低通滤波器就可以了,截止频率由实际语音信号带宽确定。典型的反 混叠滤波器的技术指标是:通带内波动绝对值小于l d b ,通带带宽3 4 0 0 h z ,在 4 0 0 0 h z 处衰减1 4 d b ,4 6 0 0 h z 以上衰减3 2 d b ,对某些更高要求的应用,阻带衰减 5 0 d b 以上。 取样之后要对信号进行量化,量化后的信号值与原信号之间的差值称为量化 误差,又称为量化噪声。目前8 b i t 量化较通用,实验表明,如果语音波形的动态 范围为5 5 d b ,1 0 b i t 以上量化更为合适。 汉语普通话易混淆音素的声学区分 2 5 2 语音信号的预处理 图2 7 语音信号的数字化 语音信号的预处理是指对语音信号的特殊处理:预加重或称高频提升,分帧 处理。 由于语音信号的平均功率谱受声门激励和口鼻辐射的影响,高频端大约在 8 0 0 h z 以上按6 d b 频程跌落,为此要在预处理中进行预加重。预加重的目的是提 升高频部分,使信号的频谱变得平坦,以便于进行频谱分析或声道参数分析。预 加重可在a d 变换前,在反混叠滤波之后进行,也可在加变换之后进行。用具 有6 d b 倍频程的提升高频特性的预加重数字滤波器实现,它一般是一阶的,即 日( z ) = l 一z 一1( 2 3 ) 式中,值接近于l ,典型值为0 9 4 。 由于语音信号是非平稳过程,是时变的,但是人的发音器官的肌肉运动速度 较慢,所以语音信号可以认为是局部平稳的,或短时平稳。因此,语音信号分析 常分段或分帧来处理,一般每秒的帧数约为3 3 1 0 0 ,视实际情况而定,分帧既可 用连续的,也可用交叠分段的方法,在语音信号分析中常用“短时分析刀表述。 短时分析实质上是用一个窗截取信号。数字信号处理理论告诉我们,两个信 号的时域相乘,在频域相卷积,如果采用矩形窗,则矩形窗频谱高频成分必将影 响语音信号的高频部分,一般用高频分量幅度较小的窗形,以避免这些影响。如 哈明窗的带宽是矩形窗的两倍,但带外衰减却比矩形窗大得多。根据处理的要 求,以不影响或少影响处理需要的语音特性为标准来选窗形较为适宜。 对语音信号的各短段进行处理,实际上就是对各短段进行某种变换或施以某 种运算。设该变化用符号玎】表示,它可以是线性的或非线性的,可以是时不变 的或者时变的,所有各段经处理后便可以得到时间序列,用q 表示: q = 丁【x ( 小) w ( 玎一聊) 】( 2 - 4 ) 第三章语音信号的特征参数 1 5 第三章语音信号的特征参数 3 1 短时平均能量 短时平均能量是语音信号分析的常用参数。 对语音信号分析时,信号流的分帧是采用可移动的有限长度的窗口进行加权 的方法来实现的,以刀) 为矩形窗。 俐= 器 怄掰。1 协t , 图3 1 语音信号的短时平均能量 也可以采用其他形式的窗口来分帧,因此,可以定义以门为标志的某帧语音 信号的短时平均能量( s h o r t ea v e r a g ee n e 啊) e ,如下式所示: e = 【x ( m ) w ( ,一所) 】2 = 【x ( 坍) 吣一所) 】2 ( 3 2 ) m=月t=一“ 短时能量的解释有两种: ( 1 ) 上式可以解释为( 如图3 1 ) :首先计算原始语音信号各个采样值的平 方,然后通过一个冲激响应为办( ,z ) 的滤波器,最后输出能量序列,这里 ( 刀) = w ( 行) 2 。 ( 2 ) 首先计算原始语音信号各个采样值的平方,然后用一个移动窗厅伽一朋) 选 取出一个一个短时平方序列,并将各短段的平方值求和得到短时能量序列。 不同窗函数的选择( 形状,长度) 将决定短时平均能量的性质。一般窗函数 是中心对称的,用的较多的是矩形窗和哈明窗。 选择的原则是:使得短时能量既能及时跟踪语音能量的缓变规律,同时又要 对语音振幅一个基音周期内的瞬时变化有显著的平滑作用。 通常选择1 0 k h z 采样时,取值l o o 2 0 0 。 短时平均能量e 的主要用途有以下几点: ( 1 ) 可以从清音中区分出浊音来,因为浊音时e 值比清音时e 值大得多。 ( 2 ) 可以用来确定声母与韵母,无声与有声,连字等的分界。 ( 3 ) 可以作为一种超音段信息用于语音识别。 1 6 汉语普通话易混淆音素的声学区分 3 2 倒谱分析 倒谱特征是语音信号分析的常焉特征参数。语音信号是声道频率特性和激励 信号源二者共同的结果,后者对于某帧而言常带有一定的随机性,由于语蒲信号 是由激励信号与声道频率特性相卷积的结果,可以把信号作适当的同态滤波将卷 积的两个部分分离,滤波的关键是将卷积处理化为乘积,然后作对数处理,使之 化为可分离的相加成份。 图3 2 倒谱系数的提取过程 将一帧中的语鸯信号或= t 毒处理为其倒谱( c e p 姗m ) 的过程如图3 2 所示。图中表示语音信号的音源激励分量,鬼表示声道分量( 即声道冲激响 应) 。用f f t 算法计算s 。的短时傅里叶变换,就会在b 点得到音源激励与声道冲激 响应僖里叶变换的乘积,取逮一乘积的幅度的对数,在c 点就得到音源激励与声 道冲激响应的傅里叶变换的对数之和。再对其进行傅里叶逆变换,将在d 点所得 到的信号称之荚是s 。的倒谱繇也稼为倒谱系数,它是音源激励分量的倒谱毛与声 道分量玩的倒谱之和。考虑到作i d f t 的时间开销以及计算结果是复数,所以一 般用离敖余弦变换( d c t ) 替代。 对倒谱推导的过程进行分析,可以得知语音信号的倒谱具有如下性质: ( 1 ) 倒谱的低时部分对应于语音信号的声道分量,且按l 栉的趋势随雄的增 加而衰减,故

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论