已阅读5页,还剩49页未读, 继续免费阅读
(计算机应用技术专业论文)视频中的说话人信息分析及其应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
视频中的说话人信息分析及其应用 y :7 7 0 0 9 1 摘要 近年来,随着多媒体、i n t e r n e t 、大容量存储等技术的不断发展,越来越多的 数字化视频开始进入人们的日常生活。如何对视频进行有效地浏览和检索已成为 近年来多媒体处理、信息检索及数据管理领域的研究热点之一。 在基于内容和语义的视频检索中,寻找特定说话人是最常见的查询目标之一。 与此同时,说话人的信息还可以用于检测视频的语义切换、提取独自等和说话人 有关的高层语义特征、新闻视频中的主持人查找等不同的视频处理任务。因此, 研究如何在视频中有效地提取说话人信息以及如何将其应用于其它视频处理任 务具有重要的理论意义和实用价值。 本文主要从说话人的切分和说话人的聚类两个方面讨论了视频中的说话人信 息处理。 在说话人切分方面,本文详细讨论了说话人切分的三个基本问题:候选切换 点豹选择、说话人特征提取以及语音段相似性的度量;提出了一种基于混合高斯 模型的近似k l 差异的说话人切分算法,该算法可以有效地检测说话人的切换点, 性能也明显优于g l r 等其他相似性度量方法。 在说话人聚类方面,本文提出并尝试了四种非监督的说话人聚类算法:序贯 聚类、全局聚类、自底向上的层次聚类和基于i n f o r m a t i o n b o t t l e n e c k 的a i b 聚类, 并通过实验比较了这四种算法在性能上的差别。 除了上述两个主要方面外,本文还介绍了说话人信息在t r e c v i d 评测中的 应用,包括将说话人的切换信息用于新闻故事分割,以及独白检测和性别检测等 高层语义特征提取任务。 关键词:说话人信息分析说话人切分近似k l 差异说话人聚类 视频中的说话人信息分析及其戍用 a b s t r a c t r e c e n t l nw i t hr a p i da d v a n c e so nt e c h n o l o g yo f m u l t i m e d i a ,i n t e r n e t ,m a s ss t o r a g e , m o t ea n dm o r ed i g i t a l i z e dv i d e og o e si n t oh u m a n sd a i l yl i f e t h e r e f o r e ,v i d e o p r o c e s s i n ga n dr e t r i e v a lh a v eb e e naf o c u si nt h er e s e a r c ho fm u l t i m e d i ap r o c e s s i n g , i n f o r m a t i o nr e t r i e v a la n dd a t am a n a g e m e n t s e a r c h i n gas p e c i f i cp e r s o ni so n eo ft h em o s ti m p o r t a n tt a s k so fc o n t e n t b a s e d v i d e or e t r i e v a l ,m e a n w h i l e ,s p e a k e ri n f o r m a t i o nc a na l s ob eu s e di ns e m a n t i cv i d e o s e g m e n t a t i o n ,h i g h - l e v e lv i d e of e a t u r e se x t r a c t i o n ,a n c h o r p e r s o nd e t e c t i o na n de t c t h e r e f o r e ,i ti si m p o r t a n ta n dm e a n i n g f u lt od or e s e a r c ho ns p e a k e ri n f o r m a t i o n a n a l y s i s t h i sp a p e rd i s c u s s e st w ok e yt e c h n i q u e so fs p e a k e ri n f o r m a t i o na n a l y s i si nv i d e o f r o mt w ok e yt e c h n i q u e s :s p e a k e rs e g m e n t a t i o na n ds p e a k e rc l u s t e r i n g i ns p e a k e rs e g m e n t a t i o n ,t h e r ea r et h r e ek e yi s s u e s :s e l e c t i n gc a n d i d a t es p e a k e r c h a n g ep o i n t s ,e x t r a c t i n g e f f i c i e n t s p e a k e rf e a t u r e s ,a n dm e a s u r i n gt h es i m i l a r i t y b e t w e e nt w os p e e c hs e g m e n t s t h i sp a p e rd i s c u s s e st h e s et h r e ei s s u e si nd e t a i la n d p r o p o s e san e ws p e a k e rs e g m e n t a t i o na l g o r i t h mb a s e do na p p r o x i m a t ek ld i v e r g e n c e b e t w e e ng m m s i ns p e a k e rc l u s t e r i n g ,t h i sp a p e ri n t r o d u c e sf o u rc l u s t e r i n ga l g o r i t h m s :s e q u e n t i a l c l u s t e r i n g ,g l o b a lc l u s t e r i n g ,b o t t o m u ph i e r a r c h i c a lc l u s t e r i n ga n da i bc l u s t e r i n g b a s e do ni n f o r m a t i o nb o t t l e n e c kp r i n c i p l e w ea l s oc o m p a r et h ep e r f o r m a n c e so f t h e mf r o ms d e p r o p o s e db yn i s t i na d d i t i o nt ot w ok e yt e c h n i q u e sa b o v e ,t h i sp a p e ra l s oi n t r o d u c e st h ea p p l i c a t i o n o fs p e a k e ri n f o r m a t i o na n a l y s i si nt r e c v l de v a l u a t i o n ,i n c l u d i n ga p p l y i n gs p e a k e r c h a n g e st on e w ss t o r ys e g m e n t a t i o na n dh i g h - l e v e ls e m a n t i cf e a t u r ee x t r a c t i o ns u c h a sm o n o l o g u ed e t e c t i o na n dg e n d e rd e t e c t i o n k e y w o r d s :s p e a k e r i n f o r m a t i o na n a l y s i s ,s p e a k e rs e g m e n t a t i o n ,a p p r o x i m a t ek l d i v e r g e n c e ,s p e a k e rc l u s t e r i n g 视频中的说话人信息分析及其应用 第一章引言 近年来,随着多媒体、i n t e r n e t 、大容量存储等技术的不断发展,越来越多的 数字化多媒体信息开始进入人们的日常生活。在这些多媒体信息中,数字视频结 合了视觉和听觉,有效地向人们提供了大量的信息,具有重要的应用和研究价值。 人们通常所接触到的视频是由视频的制作者事先加工完成的,要从中寻找人 们所感兴趣的视频片断是比较困难的。这是因为: 视频是一个完整和连续的信息流,而这个信息流本身并不包含明确的结构 信息。 视频的低层特征和视频语义之间存在巨大的语义鸿沟。 视频本身对应的数据量非常巨大,如果没有一个有效的组织方式,很难对 这些海量数据进行管理和检索。 因此,如何对视频进行有效地浏览和检索已成为近年来多媒体处理、信息检 索及数据管理领域的研究热点之一。 对用户来说,基于视频内容和语义的视频浏览和检索更贴近实际的需要。经 过近些年的研究,越来越多的研究者发现从图像中提取和分析视频的语义是比较 困难的。而与此同时,由于语音的存在,音频流所包含的语义信息往往比图像流 丰富,提取语义信息也更加直观方便。从这个意义上讲,研究音频信息在基于内 容的视频处理和检索中的应用是很有价值的。 视频中可以利用的音频信息包括音频类型、说话人信息、特殊音频事件、语 音对应的文本等。在这些信息中,说话人信息是最重要的一种。这是因为在基于 内容的视频检索中,寻找特定说话人是最常见的查询目标之一。与此同时,说话 人的信息还可以用于检测视频的语义切换、提取独白等和说话人有关的高层语义 特征、新闻视频中的主持人查找等不同的视频处理任务。因此,研究如何在视频 中有效地提取说话人信息以及如何将其应用于其它视频处理任务具有重要的理 论意义和实用价值。 在这一章里,首先介绍说话人信息分析的主要任务;其次分析在视频处理中 提取说话人信息所需要解决的问题;最后介绍论文的整体组织。 1 1 说话人信息分析的主要任务 说话人信息分析包括三个主要任务:首先,将视频中的语音按照不同的说话 人进行分割,也就是检测不同说话人之间的切换点以确定语音段的边界:然后, 对分割得到的若干语音段进行说话人的聚类;最后,根据视频中的其他信息对每 视频中的说话人信息分析及菇应用 一个说话人的姓名、性别等身份特征进行标识。上述三个主要任务分别称为说话 人的切分、说话人的聚类和说话人的标识。 1 1 1 说话人切分 传统的说话人切分一般分为有监督和无监督两种。有监督的说话人切分是指 在已知说话人的身份或者说话人的个数的前提下进行的切换点检测,这类检测比 较简单,通常使用模板匹配的方法就会得到很好的效果;无监督的说话人切分则 是在说话人的身份和个数都未知的情况下进行的切换点检测,这类检测一般需要 衡量语音段的相似性,将不相似的语音段分离开来。在视频中,绝大多数的应用 场景都不可能事先提供说话人的身份信息或者说话人的个数,因此,视频中的说 话人切分需要采用无监督的方法。 说话人切分有以下两个基本问题: 1 如何选取能够有效地表征说话人特点的语音特征,也就是特征提取问题; 2 如何定义语音段相似性的度量方式,使相似性的计算既简单又可靠。 说话人切分的关键就在于寻找说话人信息的有效表示,使得同一个说话人语 音段的类内距离最小,不同说话人语音段的类间距离最大。这些表示或特征可以 用来计算不同语音段之间的差异,找出切换点的位置并帮助把相似的语音段聚成 一类。 语音段相似性的度量一般有两种方式:基于特征和基于模型。基于特征的度 量算法直接计算相邻语音段特征向量的欧式距离或者曼哈顿距离,相邻语音段越 相似,两段特征向量的距离就越小,再用这个距离和事先设定的阈值比较,判定 两段是否来自同一说话人。由于在提取特征向量时可能引入一定的误差比如背景 声音的信息,直接计算特征向量的相似度过于简单,我们需要更加紧凑而有效的 表示。基于模型的度量算法首先对语音段的特征向量建立模型,然后计算模型的 差异,与基于特征的算法相比,这种方法考虑了说话人在语音上的统计信息,同 时排除了无关信息的干扰。 1 1 2 说话人聚类 视频检索中关于说话人的查询通常都是寻找某个特定的说话人,只是找到不 同说话人的切换点不能为这样的需求提供太大的帮助。在说话人切分的基础上, 我们还需要把相似的语音段聚成一类,使得同一类别的语音段的类内相似度最 大,不同类别语音段的类间相似度最小。聚类得到的每一个类包含同一个说话人 的不同语音段落。 传统的况话人聚类大多是在已知说话人数目或说话人具体信息的前提下进行 的。如上文所述,视频中通常不能提供说话人的先验信息,因此需要对语音段进 行无监督的聚类。 视频中的说话人信息分析及其应用 1 1 3 说话人标识 在得到不同说话人的语音段聚类后,我们还需要对每段语音所对应的说话人 的其他信息进行分析,比如判断说话人的性别、提取说话人的姓名、职务等身份 信息。这些说话人的身份信息用来对说话人进行标识,对查询特定人的视频检索 很有帮助。 提取和标识说话人的身份,通常需要结合视频中的其他信息。比如说话人的 姓名和职务可能会在说话人出现时图像上显示的字幕或者说话人出现前后的语 音中给出。 本文的工作主要集中于解决说话人信息分析的前两个任务:说话人切分和说 话人聚类。 1 2 需要解决的问题 在完成上述说话人信息分析的三个主要任务时,通常还需要解决以下几个问 题。 1 - 2 1 复杂语音的预处理 相对于传统的音频处理应用,视频中的语音比较复杂,包含了很多除说话人 声音之外的其他音频类型,如音乐、噪音等。这些非语音的音频对说话人切分和 聚类有很大的影响。比如候选切换点前后两段的音频类型发生切换,无论是否包 含语音这两段的相似性都可能会很小,因而该候选切换点就会被误判为真正的 切换点。为了避免这些非语音音频类型对说话人信息分析的干扰,必须首先进行 音频类型的检测,以便跳过音乐、嗓音等音频段。 1 2 2 音频特征的选择 音频特征的选择和提取是应用音频信息对视频进行分析的基础。利用传统音 频处理研究的成果,大部分的音频特征都已经有了比较规范的特征提取算法。因 此,如何选择有效的音频特征就成为视频处理和检索中应用音频信息所要解决的 主要问题。这不仅需要考虑哪些特征对当前要解决的问题有帮助,而且还要考虑 特征提取所需要的时间和空间代价。 特征的选择可以通过两种方法完成。一种方式是根据要解决的问题,对不同 的音频特征进行分析,人工选取有效的特征。另一种方式是通过一些学习算法在 众多的音频特征中自动选取有效的特征。这两种方式各有利弊,在本文中,主要 是根据说话人的特点人工选择特征。 视频中的说话人信息分析故其应用 1 3 本文组织 本文主要讨论视频中的说话人信息分析以及说话人信息在基于内容的视频检 索中的若干应用。 第二章主要讨论说话人的切分。我们首先分析用于表征说话人的常用特征的 特点,然后提出了一种新的基于高斯混合模型的近似k l 差异的说话人切分算法, 并根据实验的结果对这种算法的性能进行了分析。实验表明,该算法的性能比其 他算法有很大的改进。 在第三章里,我们描述了四种非监督的说话人聚类算法,并给出了这四种方 法的实验结果。通过比较发现,自底向上的层次聚类算法对于说话人聚类的性能 最好。 在第四章里,我们介绍了说话人信息在t r e c v i d 评测中的应用。主要讨论 了蜕话人信息对新闻故事分割以及高层语义特征提取的作用。 最后的第五章对全文进行总结,并对未来可能的研究方向进行了展望。 4 视频中的说话人信息分析及其应用 第二章说话人的切分 在传统的语音处理研究中,有很多工作是关于说话人识别的。说话人识别 ( s p e a k e rr e c o g n i t i o n ) 包括说话人辨识( s p e a k e ri d e n t i f i c a t i o n ) 和说话人确认 ( s p e a k e r v e r i f i c a t i o n ) ,它们的共同点是都有关于说话人的先验知识。 在绝大多数的视频应用中,我们事先并不知道说话人的身份信息以及属于某 个说话人语音段的边界。即使对那些时间结构很清晰的视频,我们仍然无法得知 说话人是不是自始至终只有一个。因此,要对说话人信息进行分析,首先需要把 不同说话人的语音段分离开,而且说话人切分的结果直接影响说话人聚类和标识 的效果。 说话人的切分在新闻故事分割中可以发挥相当重要的作用,说话人的切换常 常被用来表示视频内容的转折。比如说,新闻中播放外景采访时,就会出现从演 播室主持人声音到外景地主持人或被采访人声音的转换。这样的说话人切换对新 闻故事检测和分类具有重要的参考价值。另外,在基于内容的视频检索中,说话 人的切换也常常是高层语义特征提取的对象之一。 说话人切分就是要检测视频中不同说话人之间的切换点,一般包括三个步 骤:第一步是过滤音频流中除语音之外的其他音频类型;第二步是将第一步得到 的语音流划分成若干个候选切换点;第三步是通过比较候选切换点两侧的相邻语 音段的相似程度来找到真正的切换点。 本章的第1 节首先介绍说话人切分的主要研究方向和进展; 第2 节介绍视频中音频流的预处理,即音频类型过滤; 第3 节给出了候选切换点的几种选择方法: 第4 节分析了用于表征说话人特点的常用音频特征; 第5 节主要讨论语音段相似性的度量,并着重介绍了一种新的基于高斯混合 模型的近似k l 差异的说话人切分算法: 第6 节结合实验对第3 、4 、5 节所描述的候选切换点选择方法、说话人特征 选取、语音段相似性度量以及新的说话人切分算法的性能进行了分析和比较。 2 1 主要研究方向和进展 在说话人切分的研究中,有三个关键的问题:选择合适的特征来表征说话人 的特点、选择合适的模型来描述不同说话人在特征空间中的分布、选择合适的相 似度计算方法来衡量两段语音在说话人方面的一致性。目前,世界各地的许多研 究者为这三个问题给出了很多有效的解决方案。 在特征选择方面,一般采用以下音频特征来表征说话人的特点: 视频中的说话人信息分析及其应用 l p c 倒谱系数 g i s he ta 1 1 9 9 l ,j i ne ta 1 1 9 9 7 d e l a c o u r ta n dw e l l e j k e n s 1 9 9 9 ,m o r ia n dn a k a g a w a2 0 0 1 m f c c 系数 s i e g l e re ta 1 1 9 9 7 ,b e i g ia n dm a e s1 9 9 8 ,c h e na n d g o p a l a k r i s h n a n1 9 9 8 ,c o u v r e u ra n db o i t e1 9 9 9 ,d e l a c o u r ta n dw e l l e j k e n s1 9 9 9 , l ue ta 1 2 0 0 2 b 】 线谱对( l i n e a rs p e c t r u mp a i r ,l s p ) l ue ta 1 2 0 0 2 b 基音频率 d e l a c o u r ta n dw e l l e j k e n s1 9 9 9 1 需要特别提出的是,l u 在 l ue ta 1 2 0 0 2 b 中尝试用贝叶斯融合方法综合考虑 各种不同的特征,在特征融合和选择方面进行了初步探索。 在说话人模型选择方面,几乎所有的研究者都使用了以下几种在语音识别和 说话人识别中常用的模型:向量量化模型( v e c t o rq u a n t i z a t i o n ,v q ) 、高斯模型 ( g a u s s i a nd i s t r i b u t i o n ) 、混合高斯模型( g a n s s i a nm i x t u r em o d e l ,g m m ) 和隐 含马尔科夫模型( h i d d e n m a r k o v m o d e l ,h m m ) 。这四种模型具有不同的说话人 表征能力。与此同时,在建立这些模型时,所需要的训练数据量也有所差异。相 比较而言: 说话人表征能力:h m m g m m g a u s s i a n v q 建立模型所需要的数据:h m m g m m g a u s s i a n v q 在相似度计算方面,主要有以下四种方法: 基于特征向量的方法:直接比较语音特征向量之间的差别 基于k l 差异的方法:用k l 差异来衡量两个模型之间的差异。在目前的 研究中,k l 差异一般都应用在高斯模型上 基于似然率( g e n e r a l i z e dl i k e l i h o o dr a t i o ,g l r ) 的方法:用g l r 来判断 两段语音属于同一个说话人的可能性 基于贝叶斯信息准则( b a y e s i a ni n f o r m a t i o nc r i t e r i a ,b i c ) 的方法 表2 1 从说话人模型选择和相似度计算方法两个方面对说话人切分研究领域 的代表性工作进行了比较。由于这些工作中采用的测试数据集各有不同,我们在 这里没有列出它们的性能。 表2i 说话人分割和聚类的相关工作 文章 模型相似性度量 g i s he ta 1 1 9 9 1 g a u s s i a ng l r s u g i y a m ae ta 1 1 9 9 3 】v q h m m 【w i l c o xe ta 1 1 9 9 4 】 g a u s s i a n h m mg l r 视频中的说话人信息分析及其应用 【j i ne ta l1 9 9 7 g a u s s i a ng l r 【s i e g l e re ta l 19 9 7 g a u s s i a nk l b e i g ia n dm a e s1 9 9 8 g a u s s i a na c o u s t i cd i s t a n c e c h e na a dg o p a l a k f i s h n m a1 9 9 8 g m mb i c 【c o u v r e u ra n db o i t e1 9 9 9 】 g a u s s i a n a c o u s t i cd i s t a n c e g l r k l b i c d e l a c o u r ta n dw e l l e j k e n s1 9 9 9 g a u s s i a n a e o u s t i cd i s t m a c e s o n m e ze ta 1 1 9 9 9 】h m m b o n a s w ee ta 1 2 0 0 0 】 g m mg l r f m o r ia n dn a k a g a w a2 0 0 1 】v q g l r f l ua n dz h a n g2 0 0 2 g a u s s i a ng l r b i c l ue ta 1 2 0 0 2 b 1 【卢2 0 0 2 g a u s s i a ng l r b i c a j m e r aa n dw o o t e r s2 0 0 3 】 h m mb i c 2 2 音频流的预处理 与传统的语音分割不同,在视频中包含了除语音之外的很多不同的音频类 型,如音乐、噪音等。这些非语音的音频对视频说话人分割有很大的影响。可以 想象,在发生音频类型切换的时候,前后两段音频在音频本身的特征上会发生很 大的变化,同样也会使该切换点前后的音频段之间的相似度很小。这样,音频类 型的切换点就会被误认为是说话人的切换点。因此,对视频中的说话人进行分割, 必须首先对视频段的音频类型进行检测。 在本文所介绍的系统中,我们使用了基于最大熵模型的音频类型检测算法 f f e n ge t a l 2 0 0 3 1 ,该算法可以在复杂的音频环境下,对音频类型进行检测。实 验表明,该算法对语音段的检测正确率大约为9 4 。在音频类型检测之后,我们 只对标记为语音的音频段做进一步的分析。 2 3 候选切换点的选择 说话人切分首先要在上一节得到的语音流上选择候选切换点。 我们可以简单的把语音流按照一定的长度分成若干相等长度的小段,但这样 有很大的缺点。比如说,如果每个语音小段的长度是5 秒钟,那么至少2 5 秒钟 内的语音段都可能是说话人的切换点,而如果在这段时间内存在更多的说话人切 换,那么两个切换点中间的说话人信息将被丢失。 视频中的说话人信息分析及其应用 镜头是视频的基本组成单元,不同的两个镜头在地点、时间或拍摄方法上都 存在着很大的差异,一般来说,说话人的切换点可能会发生在镜头切换点,因此 我们可以把用镜头分割后的镜头切换点来做为候选切换点。这样做既有优点也有 缺点,优点是这样找出来的切换点比较准确,位置信息误差小;缺点也是显而易 见的,如果一个镜头内发生了多次说话人切换,这些信息就会丢失。 为了尽量不丢失说话人切换信息,我们可以使用滑动窗口。从图2 1 中可以 看出,在没有使用滑动窗口的方案中,说话人s 1 与s 2 之间的重叠( 图b 中阴 影) 部分比使用滑动窗口方案( 图c ) 的重叠部分要大很多,因此引入的错误数 据( 即另一个说话人的语音) 更多。图b ) 方案引入的错误数据是由等分的语音段 长度决定,滑动窗口引入的错误数据则是由滑动窗口的长度决定,而滑动窗口的 长度一般远远小于固定语音段。由于用于统计的语音段长度不能过短,因此使用 滑动窗口将大大降低说话人切分的错误率。 s 1s 2 a ) 有一个说话人切换点的语音流 b ) 相等氏度但没有重叠的语音段 一 i s 1 ;iiii国ll l c ) 有滑动窗口的语音段 图2 1 语音流的切分 图2 2 详细描述了用滑动窗口选择候选时间点的过程。 对滑动窗口来说,需要选择窗口的长度和滑动的步长。如果窗口的长度选择 得太小,就缺乏足够的数据进行统计;如果滑动的步长选择得过大,可能会错过 实际的切换点。在我们的方法中,窗口的长度为5 秒,从语音处理的角度考虑, 5 秒左右的数据基本可以刻画语音的特点。滑动的步长选择1 秒,可以比较好地 平衡检测的精度和时间代价。 视频中的说话人信息分析及其应用 a i f f ( t ja i f f ( t f + l jc l i f f ( t g + 2 j 图2 2 用滑动窗口选择候选切换点 2 4 说话人信息分析的常用特征 在视频中对说话人信息进行分析,最根本的问题是区分不同的说话人的语音 特点,也就是说要寻找能够表征说话人特点的基本特征。 在语音处理的研究领域,对说话人识别问题已经做了非常深入地探讨。一般 认为,在理想的情况下,表征说话人的语音特征应该满足以下几个原则: 能够有效地区分不同的说话人 在语音背景发生变化的情况下,相对保持稳定 能够从语音信号中提取 不容易被模仿 以上四条原则中的前三条对视频中的说话人信息分析同样适用。与语音处理 中的说话人识别问题所不同的是,视频中对说话人的识别一般不需要考虑某个说 话人被恶意攻击者模仿的问题。 从近些年的研究结果看,找到满足上述原则的语音特征是非常困难的。我们 可以从两个角度来分析造成这种困难的原因: 从人类发声的角度来看,不同说话人之间的差异由先天因素引起,同时受到 后天因素的影响。人的发声器官的基本构造是相同的,但是由于人的多样性,不 同的人发声器官的生理尺寸会有所差别。比如成年男性说话人的声带比较宽厚, 语音的基音频率就比较低,大致分布在6 0 - - 一2 0 0 h z :而女性说话人和小孩的声带 较窄,语音的基音频率就比较高,大致分布在2 0 0 , 一4 5 0 h z 。除了先天的发声器官 的差异之外,后天的环境因素也会影响说话人。由于社会环境、人生经历、性格 等一些外在因素因人而异,不同的人在说话时会有不同的习惯和风格,即使在发 同样的音时,发声器官的动作也会有所差异。同时,人在说话时的场景和心理状 视频中的说话人信息分析及其应用 态也会影响实际的发音。 从人类语音感知的角度来看,人往往不是从声音本身的差别来分辨不同说话 人的。诸如说话的习惯和风格等一些间接的高层次的说话人特点对人区分不同说 话人起到了很关键的作用。过去也有些研究者尝试把这些比较抽象的特点用一 些特征来定量化,但是效果都不太理想。 尽管物理上的一些音频特征并非人类分辨说话人的全部依据。但是通过近些 年的研究,还是找到了一些具有一定说话人表征能力的物理特征。这些特征虽然 并不完全符合上述理想状况下的三条原则,但是仍然可以在大多数的应用场合起 到分辨说话人的作用。目前公认比较有效的用于刻画说话人信息的物理特征主要 有三个:线性预测系数( l i n e a rp r e d i c t i v ec o e f f i c i e n t s ) 、m e l 频率倒谱系数 ( m e l f r e q u e n c yc e p s t r u mc o e m c i e n t s ) 和基音频率( p i t c h ) 。 以下将简单介绍上述三个音频特征的计算方法。 2 4 1 语音特征提取的基本步骤 语音特征提取是通过短时频谱分析技术从语音信号中计算某种特征向量的过 程。对语音的每一帧( 比如2 0 m s ) ,特征提取的过程就是输出一个能够描述这一 帧的声音特性的特征向量。 特征参数的选取有许多种方法,一般来说有效的特征参数应该能使不相似的 音频特征向量在特征空间里彼此尽可能的分离,同时相似的音频特征向量彼此尽 可能的靠近。用模式识别的术语来描述,就是特征向量的类间差异应尽可能的大 而类内差异应尽可能的小,这样才能保证识别的正确率。 如上所述,特征提取就是计算能表征一段给定的语音信号s 俐的特征向量。 在提取某个语音特征前,通常需要采取以下步骤: 2 4 1 1 预滤波 预滤波用于抑制输入语音信号中的两种干扰:一种是语音信号中各频域分量 超过采样频率的1 2 时产生的混叠干扰;另一种是频率低于5 0 h z 的电源干扰。 我们用一个带通滤波器对语音信号进行预滤波。由于我们使用了1 6 k h z 的采 样率,所以带通滤波器的上、下截频率分别为7 5 0 0 h z 和6 0 h z 。 2 4 1 2 分帧 语音信号具有短时性,即只有在一个比较短的时间间隔内语音信号才可以保 持相对稳定一致的特征 杨1 9 9 5 ,p a g e4 】。因此,离散语音信号分析大多基于短 时频谱分析技术。通常,用于提取短时语音特征的这些短的时间间隔内的语音信 号称为帧,一帧的长度一般在1 0 4 0 m s 之间。相邻两帧有一定时间的帧移,一 般是1 0 m s 。分帧后的这些长度很短的“子信号”将依次存入一个数据区,在进 行处理时,按帧从此数据区中取出数据,处理完成后再取下一帧。语音特征的提 视频中的说话人信息分析及其应用 取都是以帧为单位来进行的。 2 4 1 3 加窗 在进行频谱分析之前,一帧语音s 俐要经过加窗处理,就是用一定的窗函数 w 来乘s 例,从而形成加窗语音s w :s w = s w 例。 最简单的窗函数是矩形窗,不过由于采用矩形窗会带来不利于频谱分析的 g i b b s 效应,因此一般采用能使频谱更加光滑的窗函数,在这里我们选择信号处 理中常用的哈明窗以克服矩形窗带来的频谱边缘的畸变。哈明窗的表达式如下 ( 其中为每帧里的信号样值个数,即采样点个数) : 吣,:0 5 4 + 0 4 6 c o s i c 高h 删州- 1 , 0 ,n = 其他值 2 4 1 4 解卷 在时域中,语音信号s 倒是陔系统的单位取样响应v 例和激励信号p 俐的卷 积,s 例= v 俐+ e 川,频域中写成研叫= 啊叫e r c 。在语音信号数字处理中,常常 需要根据s 俐来求得v 俐和口一,这种由卷积信号求得参与卷积的各个信号就叫 做解卷。 解卷算法可以分为两大类,第一类算法首先为线性系统w 刁建立一个模型, 然后对模型的参数按照某种最佳准则进行估计,称为“参数解卷”,线性预测编 码l p c 是最著名的参数解卷算法,另外还有m f c c ,这两种算法将在下面详细 介绍。参数解卷的结果是生成一系列系数,比如l p c 中的预测系数和m f c c 中 的倒谱系数。以倒谱系数 c 。,c ,c 。 为例,m 是倒谱系数的个数。系数c o 代 表一帧的短时能量,因此不包括任何关于说话人的信息。通常c 0 被丢弃。第二 类算法并不需要为线性系统建立模型,称为“非参数解卷”,用同态信号处理完 成解卷任务就是其中的种。 2 4 2 线性预测编码 线性预测系数( l i n e a rp r e d i c t i v ec o e f f i c i e n t s ) 是通过线性预测编码算法计算 得到的系数,它在一定程度上反映了说话人声道的差异 r a b i n e ra n dj u a n g1 9 9 3 。 2 4 2 1 线性预测编码的基本概念 语音信号根据发声方式的不同,可以分成浊音和清音。对浊音来说,声门的 周期性开合使胸腔内的气流按照一定的频率周期性地送入声道,通过共振而发出 声音,可以把周期性送出的气流看成一个周期性脉冲序列;对清音来说,它是利 用了口腔及声道内残存的空气而发出的,具有高斯白噪声的特点,可以把产生清 音的气流看作是一个高斯白噪声序列。 如果把声道看作是一个未知的系统,那么语音的产生过程就可以看作是由周 视频中的说话人信息分析及其应用 期性脉冲序列或者高斯自噪声序列激励声道这个未知系统的过程。抽象地说,语 音信号序列s r ,砂是由未知序列p 例激励一个未知系统所产生。假设此未知系统是 一个线性非移变因果稳定系统,且可以用一个线性差分方程描述,那么其特性可 以用传输函数习来表示: 0 y ( z ) = g ( z ) a ( z ) g ( z ) = g ,z , 1 = o 爿( z ) = :。口,z ,g ,及q 皆为实数,b a 。= 1 , 这样,参数解卷问题就归结为计算模型的参数占,及盯。,如果能有一种算法, 可以根据已知的s 例正确的估计出这些参数,那么未知的系统吖刁便可求得,由 于冈w 刁= 研矽,根据w 刁和s f 矽便立即可以求得e 亿j ,从而全部解决了解卷 的问题。 现在对这个模型加上一个限制以便于得到种高效的求解算法。令嘲的分 子多项式g 固= l ,这样v ( z ) = l l a 围。由于系统模型中只包含极点而不含零点( z _ o 处的零点除外) ,所以这种模型称为“全极点模型”。做了这个限制后,就可以将 参数解卷问题归结为正确估计模型: 叱卜南2 毒 箭 也就是估计4 矽的阶数p 和它的各个系数a a 。 2 , 4 2 2 线性预测编码算法 如果得到了一个语音序列j 俐,而且知道它是由一个序列激励个全极点模 型所产生的,线性预测算法能按照“最小均方误差”的准则估计此模型的参数( p 以及n 、d ,o 进一步来说,在序列j 中任取一个时刻n ,假设n 以前的p 个 样点上的语音样本值s ( n 一1 ) ,s ( n 一2 ) ,s ( n p ) 为已知,而时刻, 的语音样本值 j 尚未知道。线性预测编码的思想是第, 个时刻的样本可以由前p 个时刻的样 本来预测【m a r k e la n dg r a y1 9 7 6 ,即: ;( m ) = 一乏:a i s ( n i ) 百 其中各系数a ,皆为实数,称为预测系数。预测值i 0 ) 与真值s ( n ) 之间的误差 称为预测误差,用6 ( n ) 表示。e ( n ) 可用下式计算: 6 ( n ) = 5 ( h ) 一i ( n ) = j ( n ) + y :( t i s ( n i ) 由于占( 一) 是一个随机序列,可以用( n ) 的均方值t 2 = 研占2 ( 一) 来衡量线性预 测的质量。一越接近于零,预测的准确度在均方误差最小的意义上为最佳。对 于一个特定的语音序列,2 取决于p 和各个系数n 。如果能找到一个特定的阶 数p 和一组预测系数,使盯:达到最小值,那么这组系数成为最佳预测系数。可 视频中的说话人信息分析及其应用 以证明,线性预测算法能够求出最佳预测系数a ,i = l p ,使盯;达到最小。 以上的讨论都是基于s 俐是由理想全极点模型所产生的。事实上,实际的语 音序列s 俐以及许多其它实际序列都不完全符合这个理想模型。当5 俐由非理想 模型产生,而用一个全极点模型来估计其参数时,只能说是用此理想模型来逼近 实际的模型。在此情况下提高模型的阶数p 可以改善逼近效果,但在实际运算 中,p 值增加到一定程度以后,口:的降 氐就很微弱了,进一步增大p 值不但大 大增加运算量,而且由于有限字长的影响,参数估计效果反而变坏。在语音信号 处理领域中,模型阶数p 一般选在8 1 2 之间。 对l p c 系数进行变换,可以得到其他些特征。如l p c c ( l p cc e p s t r u m ) 、 线谱对( l s p , l i n e a rs p e c t r u mp a i r ) 等。 2 4 3 m e l 频率倒谱系数 在语音信号的倒谱中包含有声道和激励源的特性。它可以用来反映说话人生 理上的差别。为了更好地体现人的听觉感知特点,般采用m e l 频率上的倒谱 系数 r a b i n e ra n dj u a n g19 9 3 。 图2 , 3 给出了m e t 频率倒谱系数的计算过程。用离散傅立叶变换得到的频谱 需要通过一系列三角形滤波器来变换到m e l 频率域,这是因为人对音调的感觉 和声音的频率并不成正比关系。m e l 频率和频率之间的对应关系可用下式近似表 示: ,、r,、 m e l u ) = 2 5 9 5 1 0 9 l o il + 焘l m e is p e c t r u mm e lc e 口s t r u m 图2 3m e l 频率倒谱系数的计算 2 。4 4基音频率 和倒谱系数类似,基音频率( p i t c h ) 也反映了说话人生理上的差别。另外, 不同性别的说话人在基音频率上也会产生较大的差别。从时域上,可以用短时自 相关系数或短时平均幅度差函数来获得 杨1 9 9 5 ,p a g e 2 9 3 3 ;从频域上可以 通过分析频谱的周期性来获得 p f e i f f e re ta 1 1 9 9 6 。但由于基音频率不够稳定, 视频中的说话人信息分析及其应用 般只作为辅助特征与其他特征一起使用。 2 5 说话人建模和语音段相似性的度量 在衡量两段语音的相似性时,一般可以采取两类方法。一类是直接根据两段 语音的特征计算相似度。另外一类则是对两段语音建立统计模型,然后比较两个 模型之间的相似度。由于第二类方法考虑了说话人特征在两段语音上的统计特 性,因此可以更加准确地对说话人的特点进行刻画。在我们的系统中,采用第二 类方法来比较两段语音的相似性。 在第2 5 1 节中,我们提出了一种新的基于混合高斯模型的近似k l 差异的说 话人切分算法,该算法用滑动窗口选择候选切换点,以m f c c 为特征,对候选 切换点前后的语音段建立混合高斯模型,通过计算两个相邻语音段所对应的混合 高斯模型的近似k l 差异来判断是否发生了说话人的切换。 作为对比,我们在第2 5 2 节中简单介绍了v q 模型及其相似度度量方式。 2 5 1混合高斯模型 设特征向量集合为x = “,x 。,h ) ,d 是向量的维数,由于这些向量的分布 未知,因此需要通过混合高斯密度函数来建立模型。混合高斯密度函数的公式如 下: 三 p ( z ,i 五) = p f n ( x ,c f ) 其中p 。,i = 1 ,c ,是混合权重,( z ,2 ,c 。) ,f = 1 ,c ,是单个变量的高 斯密度函数,公式如下( 2 是均值向量,e 是协方差矩阵) : f11 e x p 一云( 一一1 ) c i l ( 一j ) m 一一g 卜j 矛丽矿j 五是混合高斯模型的参数,兄= ( p 。,c i ) ,i = 1 ,c ,这些参数在训练混合高斯 模型的过程中被估值,m l ( m a x i m u ml i k e l i h o o d ) 是使用最多的估值算法。 对一个特征向量序列来说,g m m 的相似度表示为:p ( x l 丑) = 1 7 p ( x ,l 五) m l 算法的任务是找到一个新的参数模型丑使得p ( x l 五) p ( x i a ) 。为了最 大化p ( x l a ) ,使用一个辅助函数q : q ( 五,万) = p ( 小, ) 1 0 9 e - ( t ,万,虿) j , 其中,p ( i 旧,丑) 是一个后验概率,满足 视频中的说话人信息分析及其应用 p ( i l 如a ) :? 丛型! 占l p 。n ( x ,以,c 。) 函数q 的最大化通过e m 算法实现。每次最大化后,我们用下面的公式对参数 模型中的参数重新估值: p 。= p ( ih 兄) 一y , p ( ix t , z ) x , “= 上 一 p ( i x t ) r = 】 一p ( i h ,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 酒店地下停车场火灾应急预案演练脚本
- 2025年一建市政真题及答案解析
- 内科护理副高职称答辩题库及答案
- 酒店食物中毒应急预案演练脚本
- 一年级秋季开学中秋传统文化课
- 一年级秋季开学励志成长课
- 2026年初中道德与法治七年级上册试卷专项
- 《美丽的颜色》教学设计(2026-2027学年统编八上)
- 2026年纺织、服装、鞋帽批发服务行业发展行业新材料创新报告及未来五至十年行业发展趋势分析报告
- 心理丰富性:一种新的幸福感形式
- 幼教考试推理题目及答案
- 卫生院缺药登记制度
- 操作平台施工方案
- 卫生监督协管员培训考试题及答案
- 干簧管液位计课件
- 床轮椅转移课件
- 煤矿综采工作面设计说明书
- 2025-2030智慧林业行业市场深度调研及发展趋势与投资战略研究报告
- 联排别墅模板施工方案
- 专升本《西方经济学》模拟试题和答案
- 水利水电工程危险源辨识与风险评价导则(2025版)
评论
0/150
提交评论