(信号与信息处理专业论文)基于隐含语义分析的语种识别.pdf_第1页
(信号与信息处理专业论文)基于隐含语义分析的语种识别.pdf_第2页
(信号与信息处理专业论文)基于隐含语义分析的语种识别.pdf_第3页
(信号与信息处理专业论文)基于隐含语义分析的语种识别.pdf_第4页
(信号与信息处理专业论文)基于隐含语义分析的语种识别.pdf_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 摘要 语种识别是利用计算机对一定k 度的语音材料进行处理,判别其所属语言种类的过程, 是语音识别的一个重要研究方向。随着经济全球化的1 i 断深入,语种识别存日常生活、幽防 军事和公共安全等领域都有着极为广泛的应用前景。 一般来说,每一种语言都具有各自相对独立的音素集、韵律、词j 1 :和句法、语法,这訾 差异为语种识别的实现提供了可能。根据建模思路的不同,主流的语种识别方法可以分为两 大类:基于声学模型的方法和基于语言模型的方法。其中,基于语言模型的方法首先使用语 音识别技术将语音信号符号化为音索序列,然后利用不同语种中音素的搭配呈现不同的规律 进行语种的识别。这种方法的优点是性能稳定,扩展性好,颇受国内外研究人员的推崇。 本文即围绕语言模型方法,在基于音素搭配关系的框架下,对语种识别方法进行了较为 系统的研究,首先搭建了从音素识别器到统计语言模型的完整系统,然后着眼于降低算法复 杂度、提高系统识别性能等方面。同时,借鉴信息检索中词袋( b a go fw o r d s ) 的思想,引 入特征选择和隐含语义分析等方法,挖掘不同语种统计语言模型中的区分性特征和隐含语义 结构,并取得了一定的进展。具体的研究工作包括以下几个方面: 第一,比较了在音素识别前端相同条件卜用不同解码方式对语种识别系统性能的影响, 通过实验表明了用词图的输出结构比最优序列能够得到更为丰富的音素识别信息,同时构造 了新的核函数,较大程度地提高了语种识别的准确率。 第二,在音素识别结合支持向量机的语种识别系统中,针对特征矢量高维、稀疏的特点, 对表征每个语占段的特征欠量采用关键词选择的方法筛选特征,降低计算复杂度,减少特征 的冗余度,进一步改善了语种识别系统的性能。 第三,分别引入两种隐含语义分析的方法隐含语义分析方法和概率隐含语义分析方 法,选取更加鲁棒和具有代表性的隐含语义特征,缓解了高维和稀疏的问题,降低了算法复 杂度,提高了基丁音素识别结合支持向量机方泫的语种识别准确率。 关键词:语种识别词图n 元文法支持向量机关键词选择隐含语义分析 概率隐含语义分析 a b s t r a c t a b s t r a c t l a n g u a g ei d e n t i f i c a t i o ni st h ep r o c e s so fd e t e r m i n i n gt h el a n g u a g ei do fag i v e nu t t e r a n c e a u t o m a t i c a l l yb yac o m p u t e r , w h i c hi sa ni m p o r t a n tr e s e a r c hd i r e c t i o ni ns p e e c hr e c o g n i t i o n w i t h t h ed e e p e n i n go f e c o n o m i cg l o b a l i z a t i o n ,i th a sq u i t eaw i d ea p p l i c a t i o ni nm a n yf i e l d ss u c ha sd a i l y l i f e ,n a t i o n a ld e f e n s e ,m i l i t a r ya f f a i r sa n dp u b l i cs e c u r i t y g e n e r a l l ys p e a k i n g ,e a c hl a n g u a g eh a si t so w nr e l a t i v e l yi n d e p e n d e n tp h o n es e t ,p r o s o d y , v o c a b u l a r y , s y n t a xa n dg r a m m a r t h e s ed i f f e r e n c e sb e t w e e nl a n g u a g e sm a k ei tp o s s i b l et oa c h i e v e l a n g u a g ei d e n t i f i c a t i o n a c c o r d i n gt ot h ei d e a so fm o d e l i n go nt h es p e e c hu t t e r a n c e ,t h e r ea r et w o m a i n s t r e a mc a t e g o r i e so fl a n g u a g ei d e n t i f i c a t i o n :a c o u s t i cm o d e l i n gb a s e dl a n g u a g ei d e n t i f i c a t i o n a n dl a n g u a g em o d e l i n gb a s e dl a n g u a g ei d e n t i f i c a t i o n t h em e t h o db a s e do nl a n g u a g em o d e l l i n g t r a n s f o r m st h eg i v e ns p e e c hi n t oap h o n es e q u e n c eu s i n gs p e e c hr e c o g n i t i o nt e c h n o l o g yf i r s t ,a n d t h e ni m p l e m e n t sl a n g u a g ei d e n t i f i c a t i o nb yd i s c r i m i n a t i n gt h ed i f f e r e n tr u l e so fp h o n o t a c t i c si n d i f f e r e n tl a n g u a g e s ,w h i c hh a st h ea d v a n t a g eo f r o b u s tp e r f o r m a n c ea n dg o o de x p a n s i b i l i t y t h i sp a p e rc o n c e n t r a t e so nas y s t e m a t i cs t u d yo fl a n g u a g ei d e n t i f i c a t i o nu n d e rt h ep h o n o t a c t i c f r a m e w o r kb a s e do nl a n g u a g em o d e l a tf i r s t ,w eb u i l dac o m p l e t el a n g u a g ei d e n t i f i c a t i o ns y s t e m f r o mt h ep h o n er e c o g n i z e rt ol a n g u a g em o d e l i n g ;t h e n ,w em a k ep r o g r e s so nr e d u c i n gt h e c o m p u t a t i o n a lc o m p l e x i t ya n di m p r o v i n gt h es y s t e mp e r f o r m a n c e b a s e do nt h ei d e ao fb a go f w o r d si ni n f o r m a t i o nr e t r i e v a l ,w es u c c e s s f u l l yi n t r o d u c et h ef e a t u r es e l e c t i o na n dl a t e n ts e m a n t i c a n a l y s i sm e t h o d st h a tm i n et h ed i s c r i m i n a t i v ef e a t u r e sa n dl a t e n ts e m a n t i cs t r u c t u r e s i nd i f f e r e n t s t a t i s t i c a ll a n g u a g em o d e l s t h ed e t a i l e dw o r k sa r ea sf o l l o w s : f i r s t l y ,w ec o m p a r e st h eo u t p u ts t r u c t u r e so fl a t t i c ea n d1 - b e s ts t r i n gi np h o n er e c o g n i t i o na n d p r o v e st h a t l a t t i c es t r u c t u r em a yi n c l u d em o r ed e t a i l e dr e s u l t s m e a n w h i l e ,w ec o n s t r u c tan e w k e r n e lf u n c t i o n ,w h i c hg r e a t l yi m p r o v e st h ea c c u r a c yo fl a n g u a g ei d e n t i f i c a t i o n s e c o n d l y ,i nt h ep h o n er e c o g n i t i o nf o l l o w e db ys u p p o r tv e c t o rm a c h i n es y s t e m ,w ec a r r i e so u t t w ok e y w o r ds e l e c t i o nm e t h o d st os e l e c tm o r ed i s c r i m i n a t i v ec h a r a c t e r i s t i c sf r o mt h ef e a t u r e v e c t o r so fe a c hg i v e nu t t e r a n c et or e d u c et h ec o m p u t a t i o n a lc o m p l e x i t ya n dt h er e d u n d a n c yo ft h e f e a t u r ev e c t o r sw h i c ha l s og e ta ne f f e c t i v ep e r f o r m a n c ei m p r o v e m e n tf o rl a n g u a g ei d e n t i f i c a t i o n t h i r d l y , w ei n t r o d u c et w ol a t e n ts e m a n t i ca n a l y s i s m e t h o d st ol a n g u a g em o d e l i n g ,a n d g e n e r a t en e wr o b u s ta n dr e p r e s e n t a t i v el a t e n t s e m a n t i cf e a t u r e sf o rt r a i n i n gm o r ed i s c r i m i n a t i v e l a n g u a g em o d e l s ,w h i c hg r e a t l ya l l e v i a t e t h eh i g h - d i m e n s i o n a lq u e s t i o na n ds h o wap r o m i s i n g p e r f o r m a n c e i i a b s t r a c t k e yw o r d s :l a n g u a g ei d e n t i f i c a t i o n ,l a t t i c e ,n g r a m ,s u p p o av e c t o rm a c h i n e ,k e y w o r d s e l e c t i o n ,l a t e n ts e m a n t i ca n a l y s i s ,p r o b a b i li s t i cl a t e n ts e m a n t i ca n a l y s i s 中国科学技术大学学位论文原创性声明 本人声明所呈交的学位论文,是本人在导师指导卜进行研究工作所取得的成果。除已特别 加以标注和致调 的地方外,论文中不包含任何他人已经发表或撰写过的研究成果。与我一同 工作的同志对本研究所做的贡献均已在论文r l - f 作了明确的说明。 作者签名:垒! 瞳签字r 期:迎f ! :鱼 中国科学技术大学学位论文授权使用声明 作为申请学位的条件之一,学位沦文著作权拥有者授权中国科学技术大学拥有学位论文 的部分使用权,即:学校有权按有关规定向国家有关部门或机构送交论文的复印件和电子版, 允许论文被查阅和借阅,可以将学位论文编入有关数据库进行检索,可以采用影e | j 、缩印或 扫描等复制手段保存、汇编学位论文。本人提交的电子文档的内容和纸质论文的内容相致。 保密的学位论文在解密后也遵守此规定。 口公开口保密( 年) 作者签名:垒! 垒 签字日期: 塑f 旦:暨 导师签名:趣j广饥荔 7 , 签字日期: 塑f ! :! :f 第1 章绪论 第1 章绪论 1 1 语种识别的定义和研究意义 语种识别( l a n g u a g ei d e n t i f i c a t i o n ,l i d ) 也称语言辨识,是利用计算机对一定长度的语 音材料进行处理,判别其所属语言种类的过程( z i s s m a n 和b e r k l i n g2 0 0 1 ) ,是语占信号自动 信息提取的手段之一,也是语音识别的个研究方向。它在实际情况| f i 有着广泛的用途,而 且随着经济全球化的日渐深入,语种识别的前景将越来越广阔。特别是伴随着2 0 0 8 年北京奥 运会的顺利举办和时下正如火如荼举行的2 0 1 0 年上海世界博览会,我国与世界其他国家之间 的国际交流日渐频繁,语种识别的应用将有利于国际交流与合作的蓬勃开展。 语种识别技术主要应用在机器系统或听话人的预处理方而。例如,在国际机场和国际宾 馆酒店,语种识别系统可以为多浯种的声控信息查询提供便捷服务。当用户无法向系统提供 除了语音之外的其他能表明身份的信息时,语种识别作为语音识别系统的前端,可以很快选 取相应语种的语音识别模型进行语音的识别和命令的执行等。而在听话人方而,语种识别系 统口j 以用于电话转接系统中,例如在公安消防部门的紧急电话处理中,一个好的晤种识别系 统可以快速地找到合适的翻译而大大减少因查询延误造成的损害。 相比其他语音信号处理技术,语种识别的研究虽然可以上溯到_ = 十世纪七十年代,但是 直到近些年,真正意义上的语种识别才成为研究的热点。原冈主要在于两个方面:是语言 学上的用难。根据德国出版的语言学及语言交际工具问题手册一书,目前世界上已查明 的有5 6 5 1 种语言( 不包括方言) ,使用人数超过5 0 0 0 万的语言有1 4 种( 汉语、英语、印度 语、俄语、西班牙语、德语、日语、法语、印度尼西弧语、葡萄牙语、孟加拉语、韩语、意 大利语和阿拉伯语) 。对这么多语种展开研究需要庞大的语言学专业知识的支撑,仅搜集和整 理各语种的语音材料这一项工作已极为困难,需要国际研究机构之间的交流与合作。二是统 计学上的困难。对于纷繁复杂的各语种的语音,以什么样的特征来描述建模,既能够保证不 l 列语种之问的区分性,又能够使| 一一语种的语音材料不受语音内容的限制,此外还需抵御信 道j :扰、背景噪声、传输损大等多方面的影响。口j + 以说,语种识别技术的发展是浯言学、模 式识别、机器学习、人工智能等多学科的发展推动的,得益十语音识别技术和自然语言处理 技术等相关技术手段的创新。 1 2 背景综述 语种识别的任务有很多种,根据识别对象可以分为特定说话人和不依赖于说话人的,根 l 第l 章绪论 据识别内容又可以分为文本相关和文本无关的等等。早期的语种识别只是要求说话人说一些 简短的指定内容,例如数字或者日常用语等,这样的识别相对很简单,往往针对特定的说话 人,而且针对一些从语言学角度挑出的易于区分不同语种的孤立词,这不是本文研究的重点。 我们的最终目的是对卜依赖丁说话人目1 i 限定说话内容的大规模连续语音进行语种的识别, 并且适应任何条件卜的任何通信信道,这显然给语种识别带来了极大的困难,需要考虑所有 因素在各种情况下对识别过程的影响。从建模的方法来看,语种识别发展至今主要有两个基 本思路,分别是从声学模型( a c o u s t i cm o d e l ) 角度和语言模型( l a n g u a g em o d e l ) 角度开展 ( g l e a s o ne ta l2 0 0 3 ) 。如。卜- 图1 所示,这是一个语种识别系统的基本结构框图。 声学模型 i 语音输入 刮端点检测 = 刮特征提取 = 令 彳、 = 刮识别结果 3 ( 语言模型 图1 1 语种识别系统基本结构樵图 从上图中,我们可以看到,输入的语音首先要经过端点检测( v o i c ea c t i v i t yd e t e c t i o n , v a d ) ,以去除背景噪声等无关语音,并将较长的语音段切分成较短的语音段降低识别的计算 复杂度,接着进行特征提取得到表征该语音段的特征参数,最后将经过以上前端处理得到的 训练语音训练声学模型或语言模型。在识别的时候,把经过同样前端处理的测试语音通过由 声学模型或语言模型构成的识别网络进行识别,得到最终的语种识别结果( z i s s m a n1 9 9 6 ) 。 语种识别系统中常采用的特征一般是美尔频率倒谱系数( m e i f r e q u e n c yc e p s t m lc o e f f i c i e n t s , m f c c ) ,较少使用感知线性预测系数( p e r c e p t u a ll i n e a rp r e d i c t i o n ,p l p ) ,其他的频谱特征 往往都是由这两种特征衍生得到的。此外,还可附加采用一些诸如音高( p i t c h ) 、共振峰 ( f o r m a n t ) 等辅助特征以提高系统性能或应用于特殊的语种识别用途。 1 2 1 声学模型方法 人的听域频率一般是2 0 h z - 2 0 k h z 范围,在电话信道中语音信号的频率范围仅为 3 0 0 h z 一3 4 0 0 h z ,并且听觉在3 k h z 一4 k h z 的范围相对来说要比两头的范围更敏感。由于语酱 信号是短时平稳信号,所以常常提取语音信号的频域上的声学特征进行识别,因为通常语音 信号的声学特征相对比较稳定,易于建模,也便于进行区分性训练。通过观察,我们可以发 现,不同的语利- - i i 不同的发音甲元( 称为音素) 在声学特征上具有显著的不同,而且即便是 在不同语种中发音相似的音素之问,在声学特征上也存在较为明显的差异。例如,汉语中的 “r ”在日语中没有对应的发音,而在英语中有类似的发音却并不完伞相同。因此通过对语音 信号的短时谱特征进行建模,可以实现语种的识别。主要采用的建模方法有高斯混合模型 2 第l 章绪论 ( g a u s s i a nm i x t u r em o d e l ,g m m ) 和支持向量机( s u p p o r tv e c t o rm a c h i n e ,s v m ) 。基于声 学模型的语种识别方法不需要对语音进行识别,也不需要语音的标注,算法复杂度较小,在 实际中已得剑了广泛的应用。它的缺点是不便于从语言学的角度玄解释语种识别的问题,缺 乏可扩展性。 1 2 2 语言模型方法 在语音识别中,句法( s y n t a x ) 的加入可以极大地提高识别的准确率。通过语言模型对 音素搭配的限定,克服了音素与音素之间在现实中并不存在的搭配关系,提亩了语音识别的 准确率。冈此,在语种识别系统l 一也利刖较高层的特征( 例如词、词组等) 进行句法或其他 语言模型的构建。因为语言学上的网难,我们不可能为所有待识别语种建立一个对应的音素 识别器( p h o n er e c o g n i z e r ,p r ) 进行语音识别,所以往往采用某一识别性能比较好的音素识 别器将训练集的语音信号符号化为用该语种音素表示的符号序列,然后对音素级别的符号序 列根据上下文搭配关系构建相应的语言模型。测试的时候把测试语音用同样的音素识别器符 号化为音素序列,再根据语言模型计算该音素序列属于该语言模型的似然度,根据似然度的 高低判决测试语音的语剩,归属。基于语言模型的语种识别方法运算量比基于声学模型的方法 要大很多,但是在不同的信道环境下性能都很稳定,并且便于从语言学的角度去定性地解释, 扩展性良好,因此越来越受国内外研究者的重视。本文即在此基础上展开相关研究。 1 3 语料描述 本文实验中的训练和测试数据均来自于美国国家标准局( n a t i o n a li n s t i t u t eo fs t a n d a r d s a n d t e c h n o l o g y ,n i s t ) 举办的国际语种识别评测比赛( l a n g u a g er e c o g n i t i o ne v a l u a t i o n ,l r e ) 。 该机构从1 9 9 6 年开始,先后于2 0 0 3 年、2 0 0 5 年、2 0 0 7 年和2 0 0 9 年组织了五届比赛,基本 上每两年举办一次。该比赛的目的是旨在通过比赛评估现有的各语种识别技术的性能,开展 未来研究方向的探讨和国际各研究机构之问的交流,鼓励技术创新。我们讯飞语音实验室 ( 1 f l y t e ks p e e c hl a b ) 连续参加了2 0 0 7 年和2 0 0 9 年的l r e 比赛。 1 3 1数据介绍 1 9 9 6 年l r e 比赛提供的数据还只足初步的尝试,从2 0 0 3 年开始每一届的比赛数据都有 较为严格的规范和明确的侧重方向。 2 0 0 3 年的l r e 比赛( n i s t2 0 0 3 ) 是针对电话信道下的对话语音,采用的是美国语言数 据联盟( l i n g u i s t i cd a t ac o n s o r t i u m ,l d c ) 发布的c a l l f r i e n d 数据库的长途电话对话录音数 据,数据格式均为8 k 采样率8 比特u 律存储的双声道电话录音。目标语种包括美式英语 3 第1 章绪论 ( a m e r i c a ne n g l i s h ) 、埃及阿拉伯语( e g y p t i a na r a b i c ) 、波斯语( f a r s i ) 、加拿人法语( c a n a d i a n f r e n c h ) 、汉语( m a n d a r i n ) 、德语( g e r m a n ) 、印地语( h i n d i ) 、日语( j a p a n e s e ) 、拉荚西班 牙语( l a t i na m e r i c a ns p a n i s h ) 、韩语( k o r e a n ) 、泰米尔语( t a m i l ) 和越南语( v i e t n a m e s e ) 存内的1 2 个语种,其中美式英语包含南部( s o u t h e r n ) 和= e 南部( n o n s o u t h e r n ) 两种方言, 汉语包含大陆( m a i n l a n d ) 和台湾( t a i w a n ) 两种方言,拉美西班牙语包含加勒比地区 ( c a r i b b e a n ) 和非加勒比地区( n o n c a r i b b e a n ) 两种方言。训练集中每个语种均给定若l :段 彳i 少丁一定时长的完整对话供训练模犁用,测试数据分别是3 秒、l o 秒和3 0 秒三种f i 同时长 的若干语音片段。测试语句可能来源于其他的数据库中,另外还会包含些训练集1 2 个语种 之外的其他语种数据进行测试,但数据格式均相同。 2 0 0 5 年的l r e 比赛( n i s t2 0 0 5 ) 侧重丁对方言的识别,专门增加了方言识别的评测。 目标语种减少为七个大类:英语( e n g l i s h ) 、印地语( h i n d i ) 、口语( j a p a n e s e ) 、韩语( k o r e a n ) 、 汉语( m a n d a r i n ) 、墨西哥西班牙语( m e x i c a ns p a n i s h ) 和泰米尔浯( t a m i l ) ,其中英语包含 美式英语( a m e r i c a ne n g l i s h ) 和印度英语( i n d i a ne n g l i s h ) 两种方言,汉语包含大陆( m a i n l a n d ) 和台湾( t a i w a n ) 两种方言。数据主要来自o h s u ( o r e g o nh e a l t h & s c i e n c eu n i v e r s i t y ) 数据 库,对话更加自然,同时存在不同电话信道的差异,但数据格式不变。 2 0 0 7 年的l r e 比赛( n i s t2 0 0 7 ) 除了采用c a l i f r i e n d 和o h s u 两个数据库的语音数据 外,n i s t 还专门提供了调试模型参数的开发数据集。语种数达剑1 4 个,共计2 1 种方言,包 括:阿拉伯语( a r a b i c ) 、孟加拉语( b e n g a l i ) 、汉语( m a n d a r i n ) 、英语( e n g l i s h ) 、印度斯 坦语( h i n d u s t a n i ) 、西班牙语( s p a n i s h ) 、波斯语( f a r s i ) 、德语( g e r m a n ) 、日语( j a p a n e s e ) 、 韩语( k o r e a n ) 、俄语( r u s s i a n ) 、泰米尔语( t a m i l ) 、泰语( t h a i ) 和越南语( v i e t n a m e s e ) , 其1 1 1 汉语包含广东话( c a n t o n e s e ) 、大陆汉语( m a i n l a n dm a n d a r i n ) 、台湾汉语( t a i w a n m a n d a r i n ) 、闽南语( m i n ) 、吴语( w u ) 五种方言,英语包含美式英语( a m e r i c a ne n g l i s h ) 和印度英语( i n d i a ne n g l i s h ) 两种方言,印度斯坦语包含印地浯( h i n d i ) 和乌尔都语( u r d u ) 两种方言,西班牙语包含加勒比地区( c a r i b b e a n ) 和非加勒比地区( n o n c a r i b b e a n ) 两种方 言。数据量进一步增大,存在不同电话信道的差异,但数据格式不变。 最近一届的2 0 0 9n i s tl r e 比赛( n i s t2 0 0 9 ) 最大的变化是在以往的连续电话信道的 语音数据( c o n t i n u o u st e l e p h o n es p e e c h ,c t s ) 外还增加了窄带广播信道的语音数据来 自美国之音( v o i c eo f a m e r i c a ,v o a ) 的广播录音,其中也包含一些电台主持人与听众互动 的对话录音。不但信道变得更加复杂,而且专门开展了针对易混淆方言对的评测,即将方言 作为一个目标语种来进行识别。目标语种也更多,共计2 3 个h 。言语种,包括:阿姆哈托语 ( a m h a r i c ) 、波斯尼亚语( b o s n i a n ) 、广东话( c a n t o n e s e ) 、海地克里奥尔语( h a i t i a nc r e o l e ) 、 克罗地亚语( c r o a t i a n ) 、达利语( d a r i ) 、美式英语( a m e r i c a ne n g l i s h ) 、印度英语( i n d i a n e n g l i s h ) 、波斯语( f a r s i ) 、法语( f r e n c h ) 、格鲁吉业语( g e o r g i a n ) 、豪斯语( h a u s a ) 、印地 语( h i n d i ) 、韩语( k o r e a n ) 、汉语( m a n d a r i n ) 、普什图语( p a s h t o ) 、葡萄牙语( p o r t u g u e s e ) 、 俄语( r u s s i a n ) 、西班牙语( s p a n i s h ) 、土耳其语( t u r k i s h ) 、乌克兰语( u k r a i n i a n ) 、乌尔都 4 第l 章绪论 语( u r d u ) 和越南语( v i e t n a m e s e ) 。易混淆方言对有广东话和汉语、葡萄牙语和西班牙语、 克里奥尔语和法语、俄语和乌克兰语、印地语和乌尔都语、波斯语和达利语、波斯尼亚语和 克罗地亚语、美式英语和印度英语。本次比赛的数据格式仍然与前而的历次比赛相同,但是 数据量却是1 9 9 6 年以来最大的,大大提高了比赛的难度。 本文实验中的训练集以l r e2 0 0 3 2 0 0 5 2 0 0 7 三届比赛提供的约2 0 0 小时的训练数据为 主,通过语音信号端点检测技术切分为2 3 5 4 9 句语占段,每段时长大约3 0 秒。并且以l r e2 0 0 7 的闭集测试集进行测试。闭集( c l o s e ds e t ) 测试即测试语句只可能属丁训练语句所属语种中 的一种,不可能柬白于其他没有训练语料的语种:反之开集( o p e ns e t ) 测试为测试语句可能 来自于训练语句所属的浯种,也口j 能来自于其他未知语种,其难度将更大。闭集测试语句共 计包括3 秒、1 0 秒、3 0 秒语音片段各2 1 5 8 句。测试只针对1 4 个语种大类进行,为便丁验i i f 所提方法的有效性,暂时不考虑方言的差别。 1 3 2 评测指标 鉴于语种识别可以理解为一个模式分类的问题,下面简要介绍常用的评价指标。 表征语种识别性能的最重要的两个参数:个是漏警概率( m i s sa l a r mp r o b a b i l i t y ) ,也 称为错误拒绝率( f a l s er e j e c t i o nr a t e ) ,表示将目标语种判决为非月标语种造成的错误率, 漏警概率越低,说明将目标语种识别成非目标语种造成的损失越小,性能越好;另一个足虚 警概率( f a l s ea l a r mp r o b a b i l i t y ) 或错误接受率( f a l s ea c c e p t a t i o nr a t e ) ,表示将非口标语利l 判决为目标语种造成的错误率,虚警概率越低,说明非目标语种误识为目标语种的概率也越 低,系统件能越好。漏警概率。和虚警概率e 触分别表示为: 邑。= 盐坠 ( 1 1 ) 啊a 艰鲋 e 触= :丝l ( 1 2 ) h n f 盹e | , t 妻e o 一哪。,是所有属于目标语种的样本个数,”。胁是_ 。酬中被判为非目标语种的样本个 数:川哪。,是所有非口标语种的样本个数;刀向触是一,哪。,i j 被判为口标语干l i 的个数。假设 某个语种识别系统具有m 个语种模型,测试语句中每个语种都有个样本,则有 伤a r g 。,= m x n ,啊。一,a f g 一= ( m 1 ) x 。 虽然漏警概率和虚警概率可以较好地描述系统的性能,但是根据匹配得分和系统阈值判 决当前测试语音和语种模型的匹配程度,计算机在判别的时候采用的阅值往往不同,对于同 一个阈值这两个指标的值是不同的,而且存在着此消彼长的关系。一般情况下,漏警概率随 着阈值的增大而减小,虚警概率随着闽值的增大而增大。从某种程度上说,漏警概率和虚警 概率都是判决阂值的函数。因此,为综合考虑两种指标,可以采用等错误率( e q u a le r r o rr a t e , 5 第l 幸绪论 e e r ) 将漏警概率和虚警概率统一为一个参数来衡量系统的整体件能。等错误率足通过寻找 漏警概率和虚警概率相等情况下的闽值作为判决门限得到的错误概率,即e e r = 已,。= e 触。 也就是说,漏警概率和虚警概率两个函数曲线在值域上相交的点,一般可以通过检测错误权 衡曲线( d e t e c t i o ne r r o rt r a d e o f f sc u r v e ,d e tc u r v e ) 来反映这两个错误概率之间的犬系, 从中不难看出不同系统的整体性能差异:曲线越接近于原点,说明系统的识别性能就越好。 不过这个指标只能在判决阈值口j 调的情况下才能使用。 在n i s t 评测中,常用的性能指标还有检测代价函数( d e t e c t i o nc o s tf u n c t i o n ,d c f ) , 它不像等错误率那样通过遍历所有闽值来获得漏警概率和虚警概率相等时的判决fj 限,而是 考虑实际应用中的情况。因为不同的应用背景,漏警概率和虚警概率带来的代价是不同的, 例如有时漏判一个样本所带来的影响远大丁将一个j f 目标样本误判为目标样本,此时应当放 宽虚警概率的门限,减少漏警概率,即对漏警概率和虚警概率定义不同的权重( 也称为代价 或惩罚系数) ,并用最小d c f 来表示系统能够取得的最优性能,这样更具有直接意义。d c f 的定义如下: c w f 2 c m 嘶e m 黜xp l 岫e | + c ? 哑e 妇x 已。例阻e | i 鬻悃 融别 厶 结 理 口 果 一音素:别器l 音素序列! 一鬻卜网 图2 2 基于p p r l m 的语种识别系统结构框图 2 3p r s v m 语种识别系统 建立较高性能的p p r l m 语种识别系统所需的训练数据必须足大量丰富的语音材料,在 实际中是不易获得的。并且在p r l m 语种识别系统中,越是适应性强的模型越复杂,训练需 要的语料也越多,对语料的要求也越苛刻,因而限制了p r l m 和p p r l m 这类方法的应用。 从统计学习理论的角度,我们可以发现传统的模型基本上都是采用经验风险最小化的原则, 因此这样的产生性模型只有拥有相当丰富的i j i i 练样本时,才能取得较为实际的模型。现有的 研究表明,结构化风险最小化准则为我们提供了一种不同于经验风险最小化的更为科学的机 器学习准则,它有利十在样木数较少的情况下得到更为合理的结果。支持向量机就是一种较 好的基丁结构化风险最小化准则的方法。它不考虑训练样本的具体分布情况,| 大| 此可以采用 规模较小的较为简单的特征参数进行训练。因为关注的是样本间的区分性,所以在有限样本 的情况下也能够获得比较好的分类效果。 音素识别结合支持向量机的方法是借鉴了信息检索( i n f o r m a t i o nr e t r i e v a l ) 中的b a go f w o r d s 思想,并引入支持向量机埘不同语种间的差异进行建模,从而实现语种识别的目的。在 信息柃索中,b a go f w o r d s 思想假定对于一个文本,忽略其浏序、句法和语法,仅将它看作是 一个词的集合,每个词都有其统计频数,并且词与词之i 日j 都是相互独立的,也就是说每个词 的出现并不依赖于其他词是否出现。事实上,假设文本作者在任意一个位置选择一个词汇都 不受前文的影响而独立选择,这虽然对自然语言进行了简化以便于模型化,却是不合理的。 例如,对于“中国科学技术大学”这样的词条,如果采用b a go fw o r d s 的方法处王单,则只可 能检索到“中国”、“科学”、“技术”、“大学”等相关信息,这显然足不准确的。为此,解决 的方法就是采用高阶( 2 阶及以上) 的统计语言模型,即b a go f nw o r d s 的方法,这样可以在 一定程度上缓解这种问题带来的影响。 在实际的语种识别中,我们采用b a go f n g r a m s 的思想,对识别得到的音素序列统计得 到n g r a m 语言模型,然后将每个语音段中各个n g r a m 搭配的统计频数或共生概率构造表示 该语音段的特征矢量,作为s v m 的特征矢量,进行s v m 模型的训练和识别。 第2 章系统描述 在基于单音素识别器的p r s v m 语种识别系统( 如图2 3 所示) 中,输入语音通过预处 理之后得到该语音的特征参数,同样通过音素识别器转化为音素序列,接着通过统计n g r a m 搭配建立n g r a m 语言模型,得到进行s v m 训练所需的特征矢量。在训练过程中,由于是多 类( 例如m 个语种,即m 类) 分类问题,我们采用一对多( 1v so t h e r s ) 的策略,对每一个 语种训练它与其他语种区分的支持向量机。测试的时候,测试语音对应的n g r a m 特征矢量 通过不同语种对应的支持向量机计算各自的似然得分,最后通过比较这m 个得分的大小判定 该测试语音属于哪一个语种。 他语种的支l- l 似然得分 持向量机il 音 语种b 对其 似然得分 预素 持向量机 = 刮识别结果i 语音输入 处识 他语种的支 理别 器 图2 3 基丁p r s v m 的语种谚 别系统结构框图 p p r s v m 的系统结构与p p r l m 系统类似,将刀个音素以别器分别对预处理过后的语音 进行识别,得到胛串用各个音素识别器对应的音素集表示的音素序列,并对每一个音素序列 建立各个语种( 假设m 个语种) 的支持f 句量机模型,此时共有m x n 个支持向量机模型,每个 语种都有甩个模型。测试的时候,测试语句经过预处理之后分别用各个音素识别器转化为对 应的音素序列,对各个语种的支持向量机模型计算相应的似然得分,共计胛组m 刀个得分, 最后进行得分的融合和分析比较以及综合决策,从而得到最后的语种识别结果。如图2 4 所 示: 1 2 第2 章系统描述 图2 4 基于p p r s v m 的语种识别系统结构框图 在2 0 0 7n i s tl r e 比赛中,捷克b r n o 大学存提交的系统描述中对p r l m 和p r s v m 两种系 统在相同条件下进行了比较,得到以下结论:对长时( 3 0 秒) 的测试语句,p r s v m 方法的 识别性能优于p r l m 方法;而对短时( 1 0 秒和3 秒) 的测试语句,p r s v m 方法的性能则不 如p r l m 方法,同时两种方法之问具有互补性,两者的融合可进一步提高识别性能。也就是 说,p r s v m 语种识别方法更适用十k 时语音,向- p r l m 方法则更适用于短时语音。本文旨 在通过对p r s v m 语种识别方法的分析,进一步改进p r s v m 语种识别系统的性能。 2 4实验 在本文实验中,我们都采用b r n o 大学的匈牙利语音素识别器进行音素识别( 除非特别说 明) ,以2 0 0 7n i s tl r e 比赛的闭集语种识别任务为基本实验内容。为避免其他因素十扰, 这里我们仅对归一化后的似然得分计算e e r ,并且都4 i 经过高斯后端( g a u s s i a nb a c k e n d ) 进 行得分规整( n o r m a l i z a t i o n ) 等后端处理。实验结果如下: 实验2 1 :相同配置条件下p r l m 和p r s v m 语种识别系统的性能比较 在实验中,我们采用最优解码( 1 b e s t ) 方式识别得到音素序列,然后分别进行统计语言 模犁的构建。采用二又决策树语言模型对语种进行建模,构建p r l m 语种识别系统;又选用 常用的s v m 工具- r c h 进行s v m 模型的训练和分类,构建了p r s v m 语种识别系统。 最终的语种识别结果如下表所示: 表2 1p r l m 和p r s v m 语种识别系统的e e r 比较 3 0 秒 l o 秒 3 秒 p r l m7 5 l 1 2 8 4 2 3 5 0 p r s v m6 6 7 1 4 7 82 7 2 9 由表2 1 可知,对于3 0 秒时长的测试语句,p r s v m 系统的识别性能优于p r l m 系统; 而对1 0 秒和3 秒的测试语句,p r s v m 系统的性能则不如p r l m 系统,从而验证了结论的正 1 3 第2 幸系统描述 确。后续实验我们主要在p r s v m 系统上开展,力求降低汁算的复杂度,提高p r s v m 语种 识别系统的性能。 2 5小结 本章介绍了基于音素搭配关系的语种识别方法。首先介绍了依靠音素搭配关系进行语种 识别的理论依据,并结合经验和理论做了可行性分析,说明以某个音素识别器识别所有语种 的语音,建市统汁语言模犁,最终实现语种识别,这种方法是完全可行的。接着分别描述了 该方法的两个方向:基于音素识别结合语言模型的方法和基于音素识别结合支持向量机的方 法,论述了两种方法各自的优缺

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论