版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于内容的多媒体检索摘要对基于内容的多媒体检索的有关概念、特点进行介绍,基于内容的分析方法的提出,在压缩域上直接对MPEG音频信号进行分析,达到多媒体实时分析检索目的。算法分为三步:首先利用压缩域特征对音频信号进行分割,然后应用分层方法把分割出来的音频片段粗分成音乐、语音和其它三个基本类别:由于话者身份是语音信号中的重要检索线索,最后利用隐马尔可夫链实现关键词音频检索概念多媒体基于内容的检索压缩域隐马尔可夫链话者识别多媒体检索引言随着计算机应用技术的发展与互联网速度的提高,用户可以访问到的文本、音频和视频等多媒体信息不断增加。这样,计算机用户在处理信息时所面临的主要问题已经从早期的信息匮乏转变为从海量信于是,从90年代初开始,基于内容的图像(视频)检索成为多媒体领域研究的热点之一[1][2]。在基于内容的图像(视频)检索中,颜色、纹理、形状和运动等视觉特征被提取出来表征图像(视频)内容所蕴涵的语义,从而实现图像(视频)数据的查询与管理。基于内容的多媒体检索原理与特点多媒体检索是一种基下内容特征的检索(CBR:content-basedretrieval)体对象的内容及上下文语义环境进行检索,如图像中的颜色、纹理、形状,视频中的镜头、场景、镜头的运动,声音中的音调、响度、音色等。基于内容的检索突破了传统的基于文本检索技术的局限,直接对图像、视频、音频内容进行分析,抽取特征和语义,利用这些内容特征建立索引并进行检索。在这一检索过程中,它主要以图像处理、模式识别、计算机视觉、图像理解等学科中的一些方法为部分基础技(1)相似性检索:CBR采用一种近似匹配(或局部匹配)的方法和技术逐步求精来获得查询和检索结果,摒弃了传统的精确匹配技术,避免了因采用传统检索方法所带来的不确定性。(2)直接从内容中提取信息线索:CBR直接对文本、图像、视频、音频进行分析,从中抽取内容特(3)满足用户多层次的检索要求:CBR检索系统通常由媒体库、特征库和知识库组成。媒体库包含多媒体数据,如文本、图像、音频、视频等;特征库包含用户输入的特征和预处理自动提取的内容特征;知识库包含领域知识和通用知识,其中的知识表达可以更换,以适应各种不同领域的应用要求。基于内容分析方法的提出我们知道视频、音频都是按时间顺序来组织的,传统方法查找其中某个片断都是通过快进或快到等顺序来浏览内容查找,这种方法不仅要求用户注意力高度集中,而且特别浪费时间。由于视频、音频内容包含复杂丰富的信息数据,对视频、音频检索已成为实际应用中·个难题,而基于内容分析方法是目前视频.音频检索主要发展趋势。如何解决多媒体信息内容描述问题,目前主要是采用基于内容分析视频处理与检索方法,这种方法是近年来随着多媒体数据处理技术发展而提出的。基于内容分析的方法是从另一个角度来认识多媒体信息,从早期基本颜色检索,到综合利用多种多媒体特征进行检索。如:颜色、纹理、形状、场景、镜头、帧等特征信息。目前该技术已经发展到实用阶段,其中多媒体内容描述接口MPEG-7是日前被广泛MPEG序列媒体标准是目前最为广泛应用的视/音频媒体标准,目前广泛应用的主要有MPEG-1、MPEG-I、MPEG-4等,它们都是对数字运动图像及伴音编码进行压缩的一种国际标准,其中MPEG-4采用按照具有一定时间关系和空间关系的对象来进行视、音频编码的处理方式。而MPEG-7是在MPEG-4基础上发展起来,MPEG-7重点是对视音频信息内容进行不同程度描述与定义,而与多媒体信息的编码要思想是通过提取音频流中的时域(频域)特征来描述音频内容。由于多媒体本质是由文本,视频和音但是,无论是基于内容的图像(视频)检索或是基于内容的音频检索,目前还是基于视觉或听觉感知特征相似度比较的检索,而我们对多媒体内容的描述是基于其所蕴涵的语义信息的。因此,将多媒体语义,这种语义是不同时间和空间几个多媒体事件高度抽象概念化的结果,如它需要探讨人脑的思维机制;二是中级语义,这种语义是高级语义中所涉及的人或事件的分别描述,不涉及几个事件的交叉,如“某个主持人某类新闻报导”或“某场足球比赛”;最后是低级语义,它是利用义标注实现了多媒体从无结构到结构化的过程,可以有效组织多媒体数据流,方便检另外,随着网络技术的普及,对多媒体数据(特别是音频数据)进行实时分析也成为了需要[6]。传统多存储的优点而成为多媒体数据压缩通用标准[7须先解码,才能提取特征和对特征分析,造成运算量无谓增大,不能保证实时效果。同时,MPEG对音频部分的编码结合了听觉心理学,编码时就考虑了人的听觉感知特性,所以直接在MPEG压缩域上提取特征,可以使这些感知特性不会丢失,保证对音频信息的正确理解。在音频数据流中,说话人是非常重要的语义信息,如不同的节日主持人会报导不同内容的新闻节日(体育,天气预报和时事等)。通过对讲话人语音的分析,自动确认出话者身份,既可以用话者身份对音频进行中级语义标注,也可以对其相应的视频信息流进行分类,实现不同媒质之间的索引。频两部分,然后对压缩域音频流进行分割与粗分,并且对识别出来的语音片最后用确认出来的话者身份对相应的语音音频和视频进行标注(如图一)。索引识别其恤特征音颜图一压缩域特征多媒体检索分类流程所谓音频特征就是用来表征原始音频信息的数据。根据特征空间的不同,音频特征可以分为时域、频域和时频三类:时域特征包括短时能量、过零率和线性预测系数等;频域特征包括线性预测(LPC)倒谱系数和MFCC等;时频特征包括短时傅立叶变换和小波系数等。近年来,为了更真实反映原始音频数据流首先被耳蜗处理,然后才在大脑处形成“音频场景”的事实[10],仿照人的听觉感知模型[11],一些特征被提取出来。于是,根据是否使用感知模型,音频特征可以分为物理和感知两类。物理特征包括短时能量、过零率、基本频率等,它来源于音频信号本身;感知特征包括音调和音高等,它依赖于人的听觉模型。要指出的是,有些时频特征也属于感知特征,如小波变换每层分解相当于一个恒Q滤波器,符合人耳听觉感知特性。MPEG音频压缩利用了“心理声学模型(psychoacousticsmodel)”,在MPEG压缩领域上直接提取特征,可以保留这些感知特性,更好象人的听觉感知系统一样,实现对音频语义内容的理解。首先把MPEG数据流分解成视频和音频两部分。其中音频流数据是MPEG-2LayerIIl,采样频率为22050Hz。按照传统语音处理中对信号处理分成短时“帧”的要求,音频数据被分割成大约为20毫秒的帧序列(每一帧有576个采样值)。对于每一帧,首先求出每一个子带矢量值的均方根,其中是32维的子带矢量,也是一个32维的矢量。一个矢量的平衡点,质心反映了在压缩域上音频信号的基本频率带;(2)衰减截止频率(Rolloff):,指音频信号能量衰减3分贝时的截止频率。由于人耳对音频信号强弱变化相当敏感,衰减截止频率其实就是自适应的听觉阈值,它体现了心理声学中的听觉掩饰特性;(3)频谱流量(SpectralFlux):指相邻两帧的矢量正规化后以2为模的差分,频谱流量体现了音频,用来衡量这一帧音频信号强度。音频场景的切换通常伴随着音量变化,因此在分割中是十分重要的一个指标。由于音频信号的非平稳特性,为了更好表征音频的时序变化,上述四个特征的统计信息也被提取出来作为音频特征:实验中,使用40帧为一个窗口(大约1秒),对每一帧,计算其前一个窗口中所有帧的质心,衰减截止频率和频谱流量的均值和方差,并且计算均方根低于某一阈值的比例,得到七个具有统计意义的特征。这样,对于每一帧,总共提取了11个特征。每个音频数据流的前40帧统计特征值是这个音频流所有对应统计特征的平均值。信号的描述算子,被用来进行音频的分割、粗分和识别。音频信号分割与粗分研究表明,虽然音频信号特征随时间变化剧烈,但是对于同一音频类而言,其特征之间的距离变化大致有一定规律的,通过选取好的窗口距离可以体现出这种规律性来[12][13]。利用前面提取的11个特征,实验中实现了如下的音频分割算法:(1)读入MPEG音频流,对每一帧求出特征矢量,是11维,表示时间(帧数);(2)求出前后相邻特征向量和之间的对数化欧氏距离,其中表示第帧中的第个特征;(3)对于得到的序列,求出时刻前后窗口长度为的均值的差:这个过程叫窗口化(4)如果在某一时刻值大于阈值,则判定在该时刻特征矢量发生了跃变,因此发生了音频信号的转换,于是音频流从此处分割。识别出来低级语义的基础上,才能逐步形成中级和高级语义。为了对分割出来的音频片段标注低级语义,去识别语音片段中的话者身份信息。它)特征提取取性中图三话者识别标注对于MPEG编码的音频数据,针对语音固有的特点,对前文所提取的质心、衰减截止频率、频谱流量和均方根等压缩域特征做了改进,得到的数据作为话者识别特征。由于人的语音信号频率集中在200kHz到4.5kHz之间,对于采样频率为22050Hz的音频信号,人的话语主要集中在32个子带中前8个子带上。因此,只要考虑前8个子带的特征向量,就可以取得了较好的识别效果,并节省计算量。提取的特征如下:(1)子带质心:(2)子带衰减截止频率::(3)子带频谱流量;(4)子带均方根:识别模型话者识别的模型主要包括矢量量化(VQ)[17],隐马尔可夫链(HMM)和神经网络(NN)[18]。利用矢量量化技术进行话者识别涉及大量的计算,而且对计算的精度较敏感,给识别带来了较大的困难:神经网络在语音识别上表现出了较大的应用前景,它具有自学习、自完善、白适应的特点,但基于神经网络的说话人识别技术还有待进一步的完善。由于隐马尔可夫统计模型被广泛应用于语音识别领域,本起源于60年代末的隐马尔可夫模型[19],由于其坚实的数学基础,被广泛用于信号处理领域。通常用五元组(5-Tuple)λ=(N,M,A,B,π)来表示一个隐马尔可夫链随机模型。表示中的状态总数:为中每个状态所含有的不同观测事件总数;表示的是二中状态空间概率转b,(k)=PE,=v₁|q₁=j](1≤k≤M),表示当前状态为j时,所对应的观测事件o,(在模式识别中,观测事件就是t时刻提取出来的特征向量o)取v,的概率,不同状态的不同观测事件能够取到的概率构成了N×M矩阵B。π={π,},其中,π₁=PYq₁=i](1≤i≤N),表示在一个随机过程序列中,首状态取状态i的概率。所有的π,构成了一个1×N矩阵π。对于语音等表现为时间连续的随机信号,每个状态对应的观测事件的概率估计,采用D维E元混合,其中,通过前向算法求得的最大P(clip|Sid,)值所对应的话者模型Sid,,就是clip应该属于的话者模型。然后把这个语音音频和其对应的视频数据标注上这个话者身份信息,达到检索目的(见图三)。同时设置一个最小阈值,如果对任意Sid,,P(clip|Sid,)都小于该阈值,则认为该clip不属于任何一种已知本文提出了在MPEG压缩域上提取特征,实现对音频信号流分割与粗分,并对
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 基于机器学习垃圾邮件分类器应用课程设计
- 1100亩葛根标准化种植技改项目可行性研究报告
- 铁路轨道减振装置维保更换可行性研究报告
- 宠物医院管理课程设计
- WebGL粒子动画制作技巧课程设计
- 无人机自主测绘算法课程设计
- 2026年统计师考试《统计基础知识与统计实务》模拟试卷(附答案)
- 卫星数据洪涝灾害监测标准课程设计
- 粒子特效案例课程设计
- 2027年事业单位《法律知识》案例分析培训试卷(含答案)
- 医疗机构皮肤科建设与管理标准(2025版)
- 膏方室工作制度
- 2026年审计数据分析岗遴选试题及答案
- 英语高考词汇600个必背清单
- 追光庞众望励志启新程-向榜样学习主题班会课件
- 2026临床医学概论考试真题试卷含答案
- 安徽干部教育在线党章知识测试题及答案(百分)
- 生物教学植株生长教案与课堂设计
- 手术室护理数据统计
- 2025年云南律协面试题库及答案
- 澳门博士延期入学申请书
评论
0/150
提交评论