第二章-音频信息的获取与处理课件_第1页
第二章-音频信息的获取与处理课件_第2页
第二章-音频信息的获取与处理课件_第3页
第二章-音频信息的获取与处理课件_第4页
第二章-音频信息的获取与处理课件_第5页
已阅读5页,还剩201页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第二章

音频信息的获取与处理§21多媒体技术基础及应用第二章

音频信息的获取与处理§21多媒体技术基础及应用本章学习要点音频信号的特点;模拟音频与数字音频;音频采样与量化以及数字音频文件格式。音频卡的功能、分类及其基本工作原理。音频编码基本原理及标准。音乐合成及MIDI规范。语音识别与合成原理及分类。§22多媒体技术基础及应用本章学习要点音频信号的特点;模拟音频与数字音频;音频采样与量学习要求熟练掌握:音频卡的工作原理及应用开发。掌握:音频编码基础及标准;音乐合成及MIDI。了解:本章其他内容。§23多媒体技术基础及应用学习要求熟练掌握:音频卡的工作原理及应用开发。§23多媒体技2.1数字音频基础§24多媒体技术基础及应用2.1数字音频基础§24多媒体技术基础及应用

声音是一种由机械振动引起并在弹性介质中传播的连续的波。声音的强弱体现在声波压力的大小上。声音的高低体现在声波的频率上。可将声波转换为电信号。代表声波的电信号在时间和幅度上都是连续的,即模拟信号。声音的产生§2.1数字音频基础5多媒体技术基础及应用声音是一种由机械振动引起并在弹性介质中声音信号a声音信号由许多不同频率的信号组成,称为复合信号。单一频率的信号称为分量信号。带宽是声音信号的一个重要参数,它描述复合信号的频率范围。§2.1数字音频基础6多媒体技术基础及应用声音信号a声音信号由许多不同频率的信号组成,称为复合信号。§声音信号b人耳的听觉范围是20Hz~20KHz,称为音频(Audio)信号。人说话的频率范围是300~3000Hz,称为话音(speech)信号。§2.1数字音频基础7多媒体技术基础及应用声音信号b人耳的听觉范围是20Hz~20KHz,称为音频(A声音的听觉特性——

声音三要素声音三要素即音调音强音色音色是由混入基音中的泛音所决定的。§2.1数字音频基础8多媒体技术基础及应用声音的听觉特性——

声音三要素声音三要素即§2.1数字音

声音是一种弹性波,可分为周期性和非周期性信号。周期信号是单一频率的信号,是线性谱。非周期信号包含一定连续频带的所有频率分量,是连续谱。完全的连续谱(如平滑噪声)完全无调。自然界的声音大多是线性谱中混有一段段较弱的连续谱,听来既有调又饱满、生动。声音的听觉特性——

声音中的连续谱§2.1数字音频基础9多媒体技术基础及应用声音是一种弹性波,可分为周期性和非周期声音的听觉特性——

声音的方向性

人能分辨出声音到达左右两耳的时差和强度差异,即能辨别声源方向。由于声波在空间来回反射,能产生空间效果。§2.1数字音频基础10多媒体技术基础及应用声音的听觉特性——

声音的方向性人能分声音的听觉特性——

声音是时基类媒体声音是时间连续的,人耳能感觉到25毫秒的延迟。没有时间就无法表现声音。声音是连续型时基媒体。§2.1数字音频基础11多媒体技术基础及应用声音的听觉特性——

声音是时基类媒体声音是时间连续的,人耳能声音的质量评判声音的质量与其频率范围(即频带)有关。一般,频带越宽,音质越好。对语音常用可懂度、清晰度和自然度衡量。对音乐,保真度、空间感和音响效果是重要指标。平均主观打分(MOS)是最简单的评判法。§2.1数字音频基础12多媒体技术基础及应用声音的质量评判声音的质量与其频率范围(即频带)有关。一般,频模拟声音的录制与播放模拟声音信号的录制一般是先将声波信号通过机电转换获得电信号,之后再通过电磁转换等方式记录到适当的介质上。模拟声音的播放即使把记录在介质上的信号通过电磁转换、机电转换等手段还原为声音信号。§2.1数字音频基础13多媒体技术基础及应用模拟声音的录制与播放模拟声音信号的录制一般是先将声波信号通过模拟信号的数字化在某个特定时刻对模拟信号进行测量称为采样。采样获得的信号称为离散时间信号。对幅值连续的采样信号限定取值范围,可以获得由有限个幅值组成的信号,称其为离散幅度信号。采样值在某个数值附近的一定范围内都用这个值表示,这种处理称为量化。§2.1数字音频基础14多媒体技术基础及应用模拟信号的数字化在某个特定时刻对模拟信号进行测量称为采样。§细看采样和量化均匀采样:每两次采样之间的间隔时间相等。否则为非均匀采样。采样的时间间隔称为采样周期。每秒钟采样的次数称为采样频率。线性量化:量化的幅度间隔均等。否则为非线性量化。§2.1数字音频基础15多媒体技术基础及应用细看采样和量化均匀采样:每两次采样之间的间隔时间相等。否则为数字化音频a在计算机内声音信息同其他信息一样也用一系列二进制数字表示,称其为数字音频。数字音频是对模拟声音信号进行采样和量化得到的。§2.1数字音频基础16多媒体技术基础及应用数字化音频a在计算机内声音信息同其他信息一样也用一系列二进制数字化音频b采样和量化的主要硬件是模数转换器(ADC)。数字音频的回放需先进行数模转换(DAC)得到模拟电信号,然后再放大输出。§2.1数字音频基础17多媒体技术基础及应用数字化音频b采样和量化的主要硬件是模数转换器(ADC)。§2采样定理a

采样频率的高低应根据奈奎斯特理论和声音信号本身的最高频率决定。奈氏理论指出:如果采样频率不低于信号最高频率的两倍,则由此获得的离散信号能够完全确定被采样的连续信号。§2.1数字音频基础18多媒体技术基础及应用采样定理a采样频率的高低应根据奈奎斯特理论采样定理b设被采样信号的最高频率为f,则

§2.1数字音频基础19多媒体技术基础及应用采样定理b设被采样信号的最高频率为f,则§2量化精度和量化误差a

若量化后的值用B位二进制码表示。B位二进制码可以表示2B个不同的量化电平。显然,位数越多表示的精度就越高。§2.1数字音频基础20多媒体技术基础及应用量化精度和量化误差a若量化后的值用B位二进量化精度和量化误差b存储数字音频信号的比特率为:设量化阶距(两个量化值的幅度差)为△则量化误差为:§2.1数字音频基础21多媒体技术基础及应用量化精度和量化误差b存储数字音频信号的比特率为:§2.1数字音频文件存储量计算字节数=采样频率(Hz)*量化位数*声道数*录音时间(s)/8§2.1数字音频基础22多媒体技术基础及应用数字音频文件存储量计算字节数=采样频率(Hz)*量化位数*声数字音频的文件格式多媒体技术中常见音频文件:Wav文件:Microsoft的音频文件格式。对声音波形采样、量化后进行存储,故称波形文件。Voc文件:是creative公司的波形文件格式。Mid(midi)文件:是遵循乐器数字接口(midi)规范,产生数字乐音的文件。§2.1数字音频基础23多媒体技术基础及应用数字音频的文件格式多媒体技术中常见音频文件:§2.12.2音频卡的工作原理主要完成模数转换、音频信号压缩及解压缩、数模转换、音频接口以及与微机接口五大功能§2.2音频卡的工作原理24多媒体技术基础及应用2.2音频卡的工作原理主要完成模数转换、音频信号压缩及解音频卡的功能---

录制与播放a音频录放数字化采样频率范围:8~44.1kHz量化位数:8位/16位通道数:单声道/立体声自动动态滤波§2.2音频卡的工作原理25多媒体技术基础及应用音频卡的功能---

录制与播放a音频录放§2.2音频卡的工音频卡的功能---

录制与播放b编码与压缩基本编码方法:PCM压缩编码方法:ADPCM实时硬件/软件压缩录音声源:mic,line-in,CD§2.2音频卡的工作原理26多媒体技术基础及应用音频卡的功能---

录制与播放b编码与压缩§2.2音频卡的音频卡的功能---

编辑与合成应用工具软件对数字音频进行编辑以及实现特殊效果处理,如:倒播、增加回音、静噪、淡入和淡出、往返播放、声道交换。§2.2音频卡的工作原理27多媒体技术基础及应用音频卡的功能---

编辑与合成应用工具软件对数字音频音频卡的功能---

MIDI音乐合成利用软件通过音频卡的MIDI接口对电子乐器进行操作控制,产生声音。音乐合成的性能依赖于音频卡上合成芯片的性能。合成方式:调频方式(FM)波形表方式§2.2音频卡的工作原理28多媒体技术基础及应用音频卡的功能---

MIDI音乐合成利用软件通过音频卡的音频卡的功能---

文语转换和语音识别文语转换(texttospeech)是利用声卡提供的软件将机内文本转换为声音输出。语音识别使用者通过软件利用声音控制计算机或执行一些命令。§2.2音频卡的工作原理29多媒体技术基础及应用音频卡的功能---

文语转换和语音识别文语转换(textt音频卡的工作原理—

混合信号处理器

内置数字/模拟混合器。完成对声音信号的混合处理;输入声源:MIDI信号、CD音频、线路输入、麦克风输入等;可以选择一个或多个声源进行混合。§2.2音频卡的工作原理30多媒体技术基础及应用音频卡的工作原理—

混合信号处理器内置数字/模拟混合器。完音频卡的工作原理—

功率放大器

用于对混合信号进行放大使之达到足够的功率去推动扬声器发声。§2.2音频卡的工作原理31多媒体技术基础及应用音频卡的工作原理—

功率放大器用于对混合信号进行放大使之达音频卡的工作原理—

总线和控制器a总线接口类型:早期是ISA,现在几乎都是PCI。组成:数据总线双向驱动器、总线接口控制逻辑、总线中断逻辑和DMA控制逻辑。§2.2音频卡的工作原理32多媒体技术基础及应用音频卡的工作原理—

总线和控制器a总线接口类型:早期是IS音频卡的工作原理—

总线和控制器b可以通过软件或硬跳线设定基本I/O地址、中断向量(IRQ)和直接存储器存取(DMA)通道号这三个参数,以避免与其他设备发生冲突。§2.2音频卡的工作原理33多媒体技术基础及应用音频卡的工作原理—

总线和控制器b可以通过软件或硬跳线设定音频卡的工作原理—

音频卡的安装a

自动安装:现在的音频卡产品一般都是即插即用的。安装连接好之后,开启电源,WIN9X会提示找到新硬件,照屏幕提示一步步操作,即可完成软件安装,之后重启系统就能使用了。§2.2音频卡的工作原理34多媒体技术基础及应用音频卡的工作原理—

音频卡的安装a自动安装:现在的音频卡音频卡的工作原理—

音频卡的安装b

手动安装:开始->设置->控制面板->添加新硬件驱动程序的安装需要WINDOWS系统盘。§2.2音频卡的工作原理35多媒体技术基础及应用音频卡的工作原理—

音频卡的安装b手动安装:开始->设置-声音工具请参阅《辅导与实验》之“实验一音频信号的获取与处理”§2.2音频卡的工作原理36多媒体技术基础及应用声音工具请参阅《辅导与实验》之“实验一音频信号的获取与处理2.3音频编码基础和标准本节内容:学习音频编码的基本知识学习音频编码的相关标准§2.3音频编码基础和标准37多媒体技术基础及应用2.3音频编码基础和标准本节内容:§2.3音频编码音频编码的目的音频编码的主要目的就是压缩数据,以节约存储空间和提高通信传输量。数据压缩通常会降低音频质量。数据压缩还会增大计算量。因此,音频压缩时要综合考虑数据量、声音质量和计算的复杂度。§2.3音频编码基础和标准38多媒体技术基础及应用音频编码的目的音频编码的主要目的就是压缩数据,以节约存储空间压缩编码的可能性只有当信源本身具有冗余度时才能对其进行压缩。统计分析表明,语音信号中存在多种冗余度:时域信息冗余和频域信息冗余根据人的听觉机理,语音也是可以压缩的。§2.3音频编码基础和标准39多媒体技术基础及应用压缩编码的可能性只有当信源本身具有冗余度时才能对其进行压缩。时域信息冗余1.幅度的非均匀分布1.幅度的非均匀分布统计表明,语音中的小幅度样本出现概率要高一些。又,通话中存在间歇,必然出现大量的低电平;此外,实际的讲话信号器功率电平也趋向于出现在编码范围的较低电平端。§2.3音频编码基础和标准40多媒体技术基础及应用时域信息冗余1.幅度的非均匀分布1.幅度的非均匀分布统计时域信息冗余2.样本间的相关2.样本间的相关对于音信号的分析表明,取样数据的最大相关存在于临近样本之间。当采样率为8KHz是相邻样本间相关系数大于0.85。如果采样率提高,样本见的相关性将会更高。§2.3音频编码基础和标准41多媒体技术基础及应用时域信息冗余2.样本间的相关2.样本间的相关对于音信号的时域信息冗余3.周期之间的相关3.周期之间的相关话音带宽为300~3400Hz,但在某特定瞬间,一个声音信号却往往只是该频带内的少数几个频率成分在起作用。当声音中只有少数几个频率时,就会象某些振荡波形一样,在周期和周期之间存在一定的相关性。§2.3音频编码基础和标准42多媒体技术基础及应用时域信息冗余3.周期之间的相关3.周期之间的相关话音带宽时域信息冗余4.基音之间的相关4.基音之间的相关人的说话声音可分为清音和浊音两类。浊音波形不仅表现出周期相关性,而且还具有对应于音调间隔的长期重复波形。因此,对音浊音部分的编码最有效的方法之一就是只对一个音调间隔的波形进行编码,并把它作为同样本中其它基音段的模板。§2.3音频编码基础和标准43多媒体技术基础及应用时域信息冗余4.基音之间的相关4.基音之间的相关人的说话时域信息冗余5.静止系数5.静止系数静止系数:两人在通话时,平均每人的讲话时间占总通话时间的一半,且存在字词句之间的停顿。分析表明:话音间歇使得全双工话路的典型效率约为通话时间的40%。显然话音间歇(波形静止段)本身就是一种冗余。§2.3音频编码基础和标准44多媒体技术基础及应用时域信息冗余5.静止系数5.静止系数静止系数:两人在通话时域信息冗余6.长时自相关6.长时自相关上述相关性都是在短时(20ms)间隔内作出的统计分析。如果在较长时间内进行统计就可以得到长时自相关函数。长时间统计表明,如采样频率为8kHz,则话音相邻样本间的相关系数高达0.9。§2.3音频编码基础和标准45多媒体技术基础及应用时域信息冗余6.长时自相关6.长时自相关上述相关性都是在短时频域信息冗余非均匀的长时功率谱密度

呈现强烈的非平坦性;高频能量较低;直流分量并非最大。语音特有的短时功率谱密度

存在共振峰频率,其第一、第二个共振频率决定了语音特征;整个谱密度随频率的增加而递减;整个功率谱的细节以基音的频率为基础,形成高次谐波结构。§2.3音频编码基础和标准46多媒体技术基础及应用频域信息冗余非均匀的长时功率谱密度§2.3音频编码基础和标人的听觉感知机理人的听觉具有掩蔽效应强音能掩蔽弱音,分同时掩蔽和异时掩蔽。人耳对不同频段声音的敏感度不同对低频声的敏感度高于对高频声的敏感度。人耳对语音信号的相位变化不敏感§2.3音频编码基础和标准47多媒体技术基础及应用人的听觉感知机理人的听觉具有掩蔽效应§2.3音频编码基础和音频编码的分类波形编码音源编码基于人的听觉特性进行编码利用人耳掩蔽效应,设计心理声学模型实现高效音频压缩。(图3.5)基于音频数据的统计特性,目标是使生成的波形尽可能与原始波形保持一致;音质高,数据率也很高;编译码器的复杂程度较低。它企图从声音波形中提出生成声音的声学参数,利用生成模型重构出声音;数据率低(2.4kb/s左右),自然度差,保密性好。§2.3音频编码基础和标准48多媒体技术基础及应用音频编码的分类波形编码利用人耳掩蔽效应,设计心理声学模型实现脉冲编码调制(PCM)脉冲编码调制概念上最简单、理论上最完善,最早研制成功、使用最广,但数据量也最大。PCM的原理框图如图所示。PCM的概念§2.3音频编码基础和标准49多媒体技术基础及应用脉冲编码调制(PCM)脉冲编码调制概念上最简单、理论上最完善脉冲编码调制(PCM)—

均匀量化和非均匀量化均匀量化、非均匀量化和量化误差非线性量化的基本思想在非线性量化中,采样输入信号幅度和量化输出数据之间定义了两种对应关系,这是基于对语音信号的统计分析后由CCITT建议的:m律压扩算法和A律压扩算法§2.3音频编码基础和标准50多媒体技术基础及应用脉冲编码调制(PCM)—

均匀量化和非均匀量化均匀量化、非音频编码标准G.711公布于1972年的话音编码标准。采样率8kHz;将采样样本精度为13、14或16位的输入信号,使用m律压扩编码或者使用A律压扩编码;经过PCM编码器之后每个样本的精度为8位,输出的数据率为64kb/s。§2.3音频编码基础和标准51多媒体技术基础及应用音频编码标准G.711公布于1972年的话音编码标准。§2自适应脉码调制概念APCM是根据输入信号幅度大小来改变量化阶大小的一种波形编码技术。自适应可以是:瞬时自适应音节自适应§2.3音频编码基础和标准52多媒体技术基础及应用自适应脉码调制概念APCM是根据输入信号幅度大小来改变量化阶APCM的量化阶改变量化阶大小的方法有两种:前向自适应根据未量化的样本值的均方根值来估算输入信号的电平,以此来确定量化阶的大小,并对其电平进行编码作为边信息(sideinformation)传送到接收端。后向自适应§2.3音频编码基础和标准53多媒体技术基础及应用APCM的量化阶改变量化阶大小的方法有两种:§2.3音频编APCM的量化阶改变量化阶大小的方法有两种:前向自适应根据未量化的样本值的均方根值来估算输入信号的电平,以此来确定量化阶的大小,并对其电平进行编码作为边信息(sideinformation)传送到接收端。后向自适应§2.3音频编码基础和标准54多媒体技术基础及应用APCM的量化阶改变量化阶大小的方法有两种:§2.3音频编差分脉码调制(DPCM)DPCM的思想:根据过去的样本去估算下一个样本信号的幅度大小(称为预测值),然后对实际信号值与预测值之差进行量化编码,从而就减少了表示每个样本信号的位数。DPCM原理示意图§2.3音频编码基础和标准55多媒体技术基础及应用差分脉码调制(DPCM)DPCM的思想:根据过去的样本去估自适应差分脉码调制ADPCM的核心思想:自适应量化:利用自适应的思想改变量化阶的大小;自适应预测:使用过去的样本值估算下一个输入样本的预测值,使实际样本值和预测值之间的差值总是最小。ADPCM框图。§2.3音频编码基础和标准56多媒体技术基础及应用自适应差分脉码调制ADPCM的核心思想:§2.3音频编码基G.721ADPCM编译码器CCITT制定的G.721推荐标准叫做32kb/s自适应差分脉冲编码调制。在此基础上还制定了G.721的扩充推荐标准G.723,使用该标准的编码器其数据率可降低到40kb/s和24kb/s。§2.3音频编码基础和标准57多媒体技术基础及应用G.721ADPCM编译码器CCITT制定的G.721G.721ADPCM编译码器CCITT推荐的G.721ADPCM标准是一个代码转换系统。它使用ADPCM转换技术,实现64kb/sA律或μ律PCM速率和32kb/s速率之间的相互转换。

ADPCM编码器框图ADPCM解码器框图§2.3音频编码基础和标准58多媒体技术基础及应用G.721ADPCM编译码器CCITT推荐的G.721G.721ADPCM编译码器G.721ADPCM编译码器的输入是G.711PCM代码(8位),其采样率8kHz,数据率是64kb/s。G.721的输出是:4位差分信号,采样率仍然是8kHz,数据率32kb/s。数据率从64kb/s变换为32kb/s,压缩率2:1。§2.3音频编码基础和标准59多媒体技术基础及应用G.721ADPCM编译码器G.721ADPCM编译G.722SB-ADPCM编译码器G.722推荐标准(“数据率为64kb/s的7kHz声音信号编码”),把话质提高到了AM广播质量,而其数据率仍保持为64kb/s(16kHz采样)。G.722采用高低两个子带(子带的划分以4KHz为界),然后再对每个子带采用类似G.721建议的ADPCM。§2.3音频编码基础和标准60多媒体技术基础及应用G.722SB-ADPCM编译码器G.722推荐标准(“子带编码(SBC)子带编码的基本思想:使用一组带通滤波器(band-passfilter,BPF)把输入音频信号的频带分成若干个连续的频段,每个频段称为子带。对每个子带中的音频信号采用单独的编码方案去编码。在信道上传送时,将每个子带的代码复合起来。在接收端译码时,将每个子带的代码单独译码,然后把它们组合起来,还原成原来的音频信号。子带编码的方块图如图3-17所示,图中的编码/译码器,可以采用ADPCM,APCM,PCM等。§2.3音频编码基础和标准61多媒体技术基础及应用子带编码(SBC)子带编码的基本思想:§2.3音频编码基础G.728低延时-码激励

线性预测编码是以美国AT&T公司贝尔实验室提出的LD_CELP(低延时码激励线性预测)算法为基础,它充分考虑了听觉特性。其基本思想如下:§2.3音频编码基础和标准62多媒体技术基础及应用G.728低延时-码激励

线性预测编码是以美国AT&T公DL_CELP编码思想(a)1.语音输入每帧5个取样值,并附上10bit的描述激励信号波形与增益的信息;2.编码时用事先准备好的激励矢量的所有组合去合成语音;§2.3音频编码基础和标准63多媒体技术基础及应用DL_CELP编码思想(a)1.语音输入每帧5个取样值,并DL_CELP编码思想(b)3.将合成结果与输入信号相比较,选出听觉加权后距离最小的码元作为信息传输;4.解码端将发送端制定的激励矢量、3bit增益码以及自身已经合成过的语音波形一起合成为语音。§2.3音频编码基础和标准64多媒体技术基础及应用DL_CELP编码思想(b)3.将合成结果与输入信号相比较MPEG-1中的音频概况:Mpeg标准是由ISO/IEC的运动图像专家组(WG11)制定的。该系列已推出Mpeg-1、Mpeg-2、Mpeg-4、Mpeg-7,目前正在研究讨论Mpeg-21。§2.3音频编码基础和标准65多媒体技术基础及应用MPEG-1中的音频概况:Mpeg标准是由ISO/IECMPEG-1的音频标准ISO/IEC11172-3(Mpeg音频标准)编码器的输入和解码器的输出与PCM标准兼容MPEG-1的数据率:由参数控制§2.3音频编码基础和标准66多媒体技术基础及应用MPEG-1的音频标准ISO/IEC11172-3(MpegMPEG中的音频编码Mpeg中的音频采用子带编码(SBC).子带编码的根据:听觉系统的隐蔽特性;重构的声音与编码前的信号不同,但对听觉来讲是“无损压缩”有四种编码模式。§2.3音频编码基础和标准67多媒体技术基础及应用MPEG中的音频编码Mpeg中的音频采用子带编码(SBC).MPEG中的音频

编码器§2.3音频编码基础和标准68多媒体技术基础及应用MPEG中的音频

编码器§2.3音频编码基础和标准68多媒MPEG中的音频编码层次MPEG声音标准提供三个独立的压缩层次:层1、层2和层3后继层次的压缩比更高,编码解码器也更复杂每层都自含SBC编码器,高层的SBC可以使用低层SBC的声音数据§2.3音频编码基础和标准69多媒体技术基础及应用MPEG中的音频编码层次MPEG声音标准提供三个独立的压缩MPEG中的音频编码层次1层1包括将数字音频变成32个子带的基本映射。将数据格式化成块的固定分段。决定自适应位分配的心理声学模型。利用块压扩合格石化的量化器。编码/解码理论延时最小为19ms,数据传输率384kb/s。§2.3音频编码基础和标准70多媒体技术基础及应用MPEG中的音频编码层次1层1包括将数字音频变成32个子带MPEG中的音频编码层次2层2提供了位分配,缩放因子和抽样的附加编码。使用了不同的帧格式。理论上最小编解码延时35ms,数据传输率256kb/s~192kb/s。用于数字广播、CD-I、VCD等。§2.3音频编码基础和标准71多媒体技术基础及应用MPEG中的音频编码层次2层2提供了位分配,缩放因子和抽样MPEG中的音频编码层次3层3采用混合带通滤波器以提高频率分辨率。增加了差值量化、自适应分段和量化值的熵编码。理论上最小编解码延时59ms,数据传输率64kb/s。用于ISDN上的声音传播。§2.3音频编码基础和标准72多媒体技术基础及应用MPEG中的音频编码层次3层3采用混合带通滤波器以提高频率MPEG的声音压缩率128~112(kbps)10:1~12:13256~192(kbps)6:1~8:12384(kbps)4:11立体声信号所对应的位率压缩率层次§2.3音频编码基础和标准73多媒体技术基础及应用MPEG的声音压缩率128~112(kbps)10:1~1MPEG中的音频解码解码器按编码器定义的语法接受压缩的音频数据流,按解码部分的方法解出数据元素,按滤波器的规定用这些数据产生数字音频输出。§2.3音频编码基础和标准74多媒体技术基础及应用MPEG中的音频解码解码器按编码器定义的语法接受压缩的音频MPEG音频解码结构框图§2.3音频编码基础和标准75多媒体技术基础及应用MPEG音频解码结构框图§2.3音频编码基础和标准75多DOLBYAC-3编码和解码由美国DOLBY实验室开发提供5.1声道从20Hz~20KHz的平滑带宽(图)将六个声道压缩成一个通道数据率320Kbps§2.3音频编码基础和标准76多媒体技术基础及应用DOLBYAC-3编码和解码由美国DOLBY实验室开发§AC-3的应用范围制作影碟、CD、VHS录像带数字广播、有线电视直播卫星美国的HDTV音频标准§2.3音频编码基础和标准77多媒体技术基础及应用AC-3的应用范围制作影碟、CD、VHS录像带§2.3音AC-3的技术特色充分利用心理声学特性实现噪声掩蔽可用某一声道的声压掩蔽其他声道的噪声§2.3音频编码基础和标准78多媒体技术基础及应用AC-3的技术特色充分利用心理声学特性实现噪声掩蔽§2.3AC-3同步帧的构成(1)同步信息(SI)同步字:标志帧的开始检验码(CRC1):循环冗余校验采样频率:说明PCM码流的采样率(48,44.1、32KHz)帧长度代码:§2.3音频编码基础和标准79多媒体技术基础及应用AC-3同步帧的构成(1)同步信息(SI)§2.3音频编AC-3同步帧的构成(2)比特流标识(BSI)包括版本、编码模式等信息音频数据块包含音频数据以及相关的解码控制信息§2.3音频编码基础和标准80多媒体技术基础及应用AC-3同步帧的构成(2)比特流标识(BSI)§2.3音AC-3同步帧的构成(3)附加信息用于保留用户自己定义的信息错误校验码包含错误校验字§2.3音频编码基础和标准81多媒体技术基础及应用AC-3同步帧的构成(3)附加信息§2.3音频编码基础和AC-3的解码分析码流的正确性(CRC)根据头部信息解出声道指数分析指数并解出尾数指数、尾数合成频域参数反变换、输出时域PCM码流§2.3音频编码基础和标准82多媒体技术基础及应用AC-3的解码分析码流的正确性(CRC)§2.3音频编码再见!§283多媒体技术基础及应用再见!§283多媒体技术基础及应用几种声源的频率带宽10Hz—20KHz数字光盘20Hz—20KHz宽频带音响20Hz—15KHz调频广播(FM)50Hz—7kHz调频广播(AM)200Hz—3.4KHz电话频率带宽声源§2.1数字音频基础84多媒体技术基础及应用几种声源的频率带宽10Hz—20KHz数字光盘20Hz—图示:音调、音色和音强§285多媒体技术基础及应用图示:音调、音色和音强§285多媒体技术基础及应用采样信号的形成§286多媒体技术基础及应用采样信号的形成§286多媒体技术基础及应用图示:均匀采样和非均匀采样§287多媒体技术基础及应用图示:均匀采样和非均匀采样§287多媒体技术基础及应用声音采样和量化§288多媒体技术基础及应用声音采样和量化§288多媒体技术基础及应用MIDI音乐合成----

调频方式数字式频率调制合成法(digitalfrequencymodulationsynthesis),简称为FM合成器。是把几种乐音的波形用数字来表达,并且用数字计算机把它们组合起来,通过数模转换器(digitaltoanalogconvertor,DAC)来生成乐音。§2.2音频卡的工作原理89多媒体技术基础及应用MIDI音乐合成----

调频方式数字式频率调制合成MIDI音乐合成----

调频方式§290多媒体技术基础及应用MIDI音乐合成----

调频方式§290多媒体技术基础及应MIDI音乐合成----

调频方式改变参数,可以生成不同的乐音如:改变数字载波频率、幅度改变波形的类型快速改变调制波形的频率改变反馈量选择的算法不同§291多媒体技术基础及应用MIDI音乐合成----

调频方式改变参数,可以生成不同的乐MIDI音乐合成----

波形表方式

这种方法是把真实乐器发出的声音以数字的形式记录下来,播放时改变播放速度,从而改变音调周期,生成各种音阶的音符。§292多媒体技术基础及应用MIDI音乐合成----

波形表方式这种方MIDI音乐合成----

波形表方式§293多媒体技术基础及应用MIDI音乐合成----

波形表方式§293多媒体技术基础及数字化音频:信号变化过程图示模拟信号采样信号数字信号§294多媒体技术基础及应用数字化音频:信号变化过程图示模拟信号采样信号数字信号§294数字化音频:离散时间信号图示§295多媒体技术基础及应用数字化音频:离散时间信号图示§295多媒体技术基础及应用数字化音频:离散幅度信号图示§296多媒体技术基础及应用数字化音频:离散幅度信号图示§296多媒体技术基础及应用PCM示意图§297多媒体技术基础及应用PCM示意图§297多媒体技术基础及应用均匀量化和非均匀量化如果采用相等的量化间隔对采样所得信号作量化,则这种量化称为均匀量化或线性量化。若量化间隔不相等则为非均匀量化。量化后的样本值Y和原始值X的差E=Y-X称为量化误差或量化噪声。§2.3音频编码基础和标准98多媒体技术基础及应用均匀量化和非均匀量化如果采用相等的量化间隔对采样所得信号作量非线性量化的基本思想量化时,大的输入信号采用大的量化间隔,小信号采用小的量化间隔。声音数据还原时,采用相同的规则。目的是在满足精度要求的情况下使用较少的位数。§2.3音频编码基础和标准99多媒体技术基础及应用非线性量化的基本思想量化时,大的输入信号采用大的量化间隔,小APCM示意图插入林图3-13APCM方块图§2.3音频编码基础和标准100多媒体技术基础及应用APCM示意图插入林图3-13APCM方块图§2.3音频编DPCM示意图插入林图3-14DPCM方块图§2.3音频编码基础和标准101多媒体技术基础及应用DPCM示意图插入林图3-14DPCM方块图§2.3音频编ADPCM示意图插入林图3-15ADPCM方块图§2.3音频编码基础和标准102多媒体技术基础及应用ADPCM示意图插入林图3-15ADPCM方块图§2.3音ADPCM解码器示意图插入林图3-16b.ADPCM解码器§2.3音频编码基础和标准103多媒体技术基础及应用ADPCM解码器示意图插入林图3-16b.ADPCM解码器§5.1声道示意图§2.3音频编码基础和标准104多媒体技术基础及应用5.1声道示意图§2.3音频编码基础和标准104多媒体技第二章

音频信息的获取与处理§2105多媒体技术基础及应用第二章

音频信息的获取与处理§21多媒体技术基础及应用本章学习要点音频信号的特点;模拟音频与数字音频;音频采样与量化以及数字音频文件格式。音频卡的功能、分类及其基本工作原理。音频编码基本原理及标准。音乐合成及MIDI规范。语音识别与合成原理及分类。§2106多媒体技术基础及应用本章学习要点音频信号的特点;模拟音频与数字音频;音频采样与量学习要求熟练掌握:音频卡的工作原理及应用开发。掌握:音频编码基础及标准;音乐合成及MIDI。了解:本章其他内容。§2107多媒体技术基础及应用学习要求熟练掌握:音频卡的工作原理及应用开发。§23多媒体技2.1数字音频基础§2108多媒体技术基础及应用2.1数字音频基础§24多媒体技术基础及应用

声音是一种由机械振动引起并在弹性介质中传播的连续的波。声音的强弱体现在声波压力的大小上。声音的高低体现在声波的频率上。可将声波转换为电信号。代表声波的电信号在时间和幅度上都是连续的,即模拟信号。声音的产生§2.1数字音频基础109多媒体技术基础及应用声音是一种由机械振动引起并在弹性介质中声音信号a声音信号由许多不同频率的信号组成,称为复合信号。单一频率的信号称为分量信号。带宽是声音信号的一个重要参数,它描述复合信号的频率范围。§2.1数字音频基础110多媒体技术基础及应用声音信号a声音信号由许多不同频率的信号组成,称为复合信号。§声音信号b人耳的听觉范围是20Hz~20KHz,称为音频(Audio)信号。人说话的频率范围是300~3000Hz,称为话音(speech)信号。§2.1数字音频基础111多媒体技术基础及应用声音信号b人耳的听觉范围是20Hz~20KHz,称为音频(A声音的听觉特性——

声音三要素声音三要素即音调音强音色音色是由混入基音中的泛音所决定的。§2.1数字音频基础112多媒体技术基础及应用声音的听觉特性——

声音三要素声音三要素即§2.1数字音

声音是一种弹性波,可分为周期性和非周期性信号。周期信号是单一频率的信号,是线性谱。非周期信号包含一定连续频带的所有频率分量,是连续谱。完全的连续谱(如平滑噪声)完全无调。自然界的声音大多是线性谱中混有一段段较弱的连续谱,听来既有调又饱满、生动。声音的听觉特性——

声音中的连续谱§2.1数字音频基础113多媒体技术基础及应用声音是一种弹性波,可分为周期性和非周期声音的听觉特性——

声音的方向性

人能分辨出声音到达左右两耳的时差和强度差异,即能辨别声源方向。由于声波在空间来回反射,能产生空间效果。§2.1数字音频基础114多媒体技术基础及应用声音的听觉特性——

声音的方向性人能分声音的听觉特性——

声音是时基类媒体声音是时间连续的,人耳能感觉到25毫秒的延迟。没有时间就无法表现声音。声音是连续型时基媒体。§2.1数字音频基础115多媒体技术基础及应用声音的听觉特性——

声音是时基类媒体声音是时间连续的,人耳能声音的质量评判声音的质量与其频率范围(即频带)有关。一般,频带越宽,音质越好。对语音常用可懂度、清晰度和自然度衡量。对音乐,保真度、空间感和音响效果是重要指标。平均主观打分(MOS)是最简单的评判法。§2.1数字音频基础116多媒体技术基础及应用声音的质量评判声音的质量与其频率范围(即频带)有关。一般,频模拟声音的录制与播放模拟声音信号的录制一般是先将声波信号通过机电转换获得电信号,之后再通过电磁转换等方式记录到适当的介质上。模拟声音的播放即使把记录在介质上的信号通过电磁转换、机电转换等手段还原为声音信号。§2.1数字音频基础117多媒体技术基础及应用模拟声音的录制与播放模拟声音信号的录制一般是先将声波信号通过模拟信号的数字化在某个特定时刻对模拟信号进行测量称为采样。采样获得的信号称为离散时间信号。对幅值连续的采样信号限定取值范围,可以获得由有限个幅值组成的信号,称其为离散幅度信号。采样值在某个数值附近的一定范围内都用这个值表示,这种处理称为量化。§2.1数字音频基础118多媒体技术基础及应用模拟信号的数字化在某个特定时刻对模拟信号进行测量称为采样。§细看采样和量化均匀采样:每两次采样之间的间隔时间相等。否则为非均匀采样。采样的时间间隔称为采样周期。每秒钟采样的次数称为采样频率。线性量化:量化的幅度间隔均等。否则为非线性量化。§2.1数字音频基础119多媒体技术基础及应用细看采样和量化均匀采样:每两次采样之间的间隔时间相等。否则为数字化音频a在计算机内声音信息同其他信息一样也用一系列二进制数字表示,称其为数字音频。数字音频是对模拟声音信号进行采样和量化得到的。§2.1数字音频基础120多媒体技术基础及应用数字化音频a在计算机内声音信息同其他信息一样也用一系列二进制数字化音频b采样和量化的主要硬件是模数转换器(ADC)。数字音频的回放需先进行数模转换(DAC)得到模拟电信号,然后再放大输出。§2.1数字音频基础121多媒体技术基础及应用数字化音频b采样和量化的主要硬件是模数转换器(ADC)。§2采样定理a

采样频率的高低应根据奈奎斯特理论和声音信号本身的最高频率决定。奈氏理论指出:如果采样频率不低于信号最高频率的两倍,则由此获得的离散信号能够完全确定被采样的连续信号。§2.1数字音频基础122多媒体技术基础及应用采样定理a采样频率的高低应根据奈奎斯特理论采样定理b设被采样信号的最高频率为f,则

§2.1数字音频基础123多媒体技术基础及应用采样定理b设被采样信号的最高频率为f,则§2量化精度和量化误差a

若量化后的值用B位二进制码表示。B位二进制码可以表示2B个不同的量化电平。显然,位数越多表示的精度就越高。§2.1数字音频基础124多媒体技术基础及应用量化精度和量化误差a若量化后的值用B位二进量化精度和量化误差b存储数字音频信号的比特率为:设量化阶距(两个量化值的幅度差)为△则量化误差为:§2.1数字音频基础125多媒体技术基础及应用量化精度和量化误差b存储数字音频信号的比特率为:§2.1数字音频文件存储量计算字节数=采样频率(Hz)*量化位数*声道数*录音时间(s)/8§2.1数字音频基础126多媒体技术基础及应用数字音频文件存储量计算字节数=采样频率(Hz)*量化位数*声数字音频的文件格式多媒体技术中常见音频文件:Wav文件:Microsoft的音频文件格式。对声音波形采样、量化后进行存储,故称波形文件。Voc文件:是creative公司的波形文件格式。Mid(midi)文件:是遵循乐器数字接口(midi)规范,产生数字乐音的文件。§2.1数字音频基础127多媒体技术基础及应用数字音频的文件格式多媒体技术中常见音频文件:§2.12.2音频卡的工作原理主要完成模数转换、音频信号压缩及解压缩、数模转换、音频接口以及与微机接口五大功能§2.2音频卡的工作原理128多媒体技术基础及应用2.2音频卡的工作原理主要完成模数转换、音频信号压缩及解音频卡的功能---

录制与播放a音频录放数字化采样频率范围:8~44.1kHz量化位数:8位/16位通道数:单声道/立体声自动动态滤波§2.2音频卡的工作原理129多媒体技术基础及应用音频卡的功能---

录制与播放a音频录放§2.2音频卡的工音频卡的功能---

录制与播放b编码与压缩基本编码方法:PCM压缩编码方法:ADPCM实时硬件/软件压缩录音声源:mic,line-in,CD§2.2音频卡的工作原理130多媒体技术基础及应用音频卡的功能---

录制与播放b编码与压缩§2.2音频卡的音频卡的功能---

编辑与合成应用工具软件对数字音频进行编辑以及实现特殊效果处理,如:倒播、增加回音、静噪、淡入和淡出、往返播放、声道交换。§2.2音频卡的工作原理131多媒体技术基础及应用音频卡的功能---

编辑与合成应用工具软件对数字音频音频卡的功能---

MIDI音乐合成利用软件通过音频卡的MIDI接口对电子乐器进行操作控制,产生声音。音乐合成的性能依赖于音频卡上合成芯片的性能。合成方式:调频方式(FM)波形表方式§2.2音频卡的工作原理132多媒体技术基础及应用音频卡的功能---

MIDI音乐合成利用软件通过音频卡的音频卡的功能---

文语转换和语音识别文语转换(texttospeech)是利用声卡提供的软件将机内文本转换为声音输出。语音识别使用者通过软件利用声音控制计算机或执行一些命令。§2.2音频卡的工作原理133多媒体技术基础及应用音频卡的功能---

文语转换和语音识别文语转换(textt音频卡的工作原理—

混合信号处理器

内置数字/模拟混合器。完成对声音信号的混合处理;输入声源:MIDI信号、CD音频、线路输入、麦克风输入等;可以选择一个或多个声源进行混合。§2.2音频卡的工作原理134多媒体技术基础及应用音频卡的工作原理—

混合信号处理器内置数字/模拟混合器。完音频卡的工作原理—

功率放大器

用于对混合信号进行放大使之达到足够的功率去推动扬声器发声。§2.2音频卡的工作原理135多媒体技术基础及应用音频卡的工作原理—

功率放大器用于对混合信号进行放大使之达音频卡的工作原理—

总线和控制器a总线接口类型:早期是ISA,现在几乎都是PCI。组成:数据总线双向驱动器、总线接口控制逻辑、总线中断逻辑和DMA控制逻辑。§2.2音频卡的工作原理136多媒体技术基础及应用音频卡的工作原理—

总线和控制器a总线接口类型:早期是IS音频卡的工作原理—

总线和控制器b可以通过软件或硬跳线设定基本I/O地址、中断向量(IRQ)和直接存储器存取(DMA)通道号这三个参数,以避免与其他设备发生冲突。§2.2音频卡的工作原理137多媒体技术基础及应用音频卡的工作原理—

总线和控制器b可以通过软件或硬跳线设定音频卡的工作原理—

音频卡的安装a

自动安装:现在的音频卡产品一般都是即插即用的。安装连接好之后,开启电源,WIN9X会提示找到新硬件,照屏幕提示一步步操作,即可完成软件安装,之后重启系统就能使用了。§2.2音频卡的工作原理138多媒体技术基础及应用音频卡的工作原理—

音频卡的安装a自动安装:现在的音频卡音频卡的工作原理—

音频卡的安装b

手动安装:开始->设置->控制面板->添加新硬件驱动程序的安装需要WINDOWS系统盘。§2.2音频卡的工作原理139多媒体技术基础及应用音频卡的工作原理—

音频卡的安装b手动安装:开始->设置-声音工具请参阅《辅导与实验》之“实验一音频信号的获取与处理”§2.2音频卡的工作原理140多媒体技术基础及应用声音工具请参阅《辅导与实验》之“实验一音频信号的获取与处理2.3音频编码基础和标准本节内容:学习音频编码的基本知识学习音频编码的相关标准§2.3音频编码基础和标准141多媒体技术基础及应用2.3音频编码基础和标准本节内容:§2.3音频编码音频编码的目的音频编码的主要目的就是压缩数据,以节约存储空间和提高通信传输量。数据压缩通常会降低音频质量。数据压缩还会增大计算量。因此,音频压缩时要综合考虑数据量、声音质量和计算的复杂度。§2.3音频编码基础和标准142多媒体技术基础及应用音频编码的目的音频编码的主要目的就是压缩数据,以节约存储空间压缩编码的可能性只有当信源本身具有冗余度时才能对其进行压缩。统计分析表明,语音信号中存在多种冗余度:时域信息冗余和频域信息冗余根据人的听觉机理,语音也是可以压缩的。§2.3音频编码基础和标准143多媒体技术基础及应用压缩编码的可能性只有当信源本身具有冗余度时才能对其进行压缩。时域信息冗余1.幅度的非均匀分布1.幅度的非均匀分布统计表明,语音中的小幅度样本出现概率要高一些。又,通话中存在间歇,必然出现大量的低电平;此外,实际的讲话信号器功率电平也趋向于出现在编码范围的较低电平端。§2.3音频编码基础和标准144多媒体技术基础及应用时域信息冗余1.幅度的非均匀分布1.幅度的非均匀分布统计时域信息冗余2.样本间的相关2.样本间的相关对于音信号的分析表明,取样数据的最大相关存在于临近样本之间。当采样率为8KHz是相邻样本间相关系数大于0.85。如果采样率提高,样本见的相关性将会更高。§2.3音频编码基础和标准145多媒体技术基础及应用时域信息冗余2.样本间的相关2.样本间的相关对于音信号的时域信息冗余3.周期之间的相关3.周期之间的相关话音带宽为300~3400Hz,但在某特定瞬间,一个声音信号却往往只是该频带内的少数几个频率成分在起作用。当声音中只有少数几个频率时,就会象某些振荡波形一样,在周期和周期之间存在一定的相关性。§2.3音频编码基础和标准146多媒体技术基础及应用时域信息冗余3.周期之间的相关3.周期之间的相关话音带宽时域信息冗余4.基音之间的相关4.基音之间的相关人的说话声音可分为清音和浊音两类。浊音波形不仅表现出周期相关性,而且还具有对应于音调间隔的长期重复波形。因此,对音浊音部分的编码最有效的方法之一就是只对一个音调间隔的波形进行编码,并把它作为同样本中其它基音段的模板。§2.3音频编码基础和标准147多媒体技术基础及应用时域信息冗余4.基音之间的相关4.基音之间的相关人的说话时域信息冗余5.静止系数5.静止系数静止系数:两人在通话时,平均每人的讲话时间占总通话时间的一半,且存在字词句之间的停顿。分析表明:话音间歇使得全双工话路的典型效率约为通话时间的40%。显然话音间歇(波形静止段)本身就是一种冗余。§2.3音频编码基础和标准148多媒体技术基础及应用时域信息冗余5.静止系数5.静止系数静止系数:两人在通话时域信息冗余6.长时自相关6.长时自相关上述相关性都是在短时(20ms)间隔内作出的统计分析。如果在较长时间内进行统计就可以得到长时自相关函数。长时间统计表明,如采样频率为8kHz,则话音相邻样本间的相关系数高达0.9。§2.3音频编码基础和标准149多媒体技术基础及应用时域信息冗余6.长时自相关6.长时自相关上述相关性都是在短时频域信息冗余非均匀的长时功率谱密度

呈现强烈的非平坦性;高频能量较低;直流分量并非最大。语音特有的短时功率谱密度

存在共振峰频率,其第一、第二个共振频率决定了语音特征;整个谱密度随频率的增加而递减;整个功率谱的细节以基音的频率为基础,形成高次谐波结构。§2.3音频编码基础和标准150多媒体技术基础及应用频域信息冗余非均匀的长时功率谱密度§2.3音频编码基础和标人的听觉感知机理人的听觉具有掩蔽效应强音能掩蔽弱音,分同时掩蔽和异时掩蔽。人耳对不同频段声音的敏感度不同对低频声的敏感度高于对高频声的敏感度。人耳对语音信号的相位变化不敏感§2.3音频编码基础和标准151多媒体技术基础及应用人的听觉感知机理人的听觉具有掩蔽效应§2.3音频编码基础和音频编码的分类波形编码音源编码基于人的听觉特性进行编码利用人耳掩蔽效应,设计心理声学模型实现高效音频压缩。(图3.5)基于音频数据的统计特性,目标是使生成的波形尽可能与原始波形保持一致;音质高,数据率也很高;编译码器的复杂程度较低。它企图从声音波形中提出生成声音的声学参数,利用生成模型重构出声音;数据率低(2.4kb/s左右),自然度差,保密性好。§2.3音频编码基础和标准152多媒体技术基础及应用音频编码的分类波形编码利用人耳掩蔽效应,设计心理声学模型实现脉冲编码调制(PCM)脉冲编码调制概念上最简单、理论上最完善,最早研制成功、使用最广,但数据量也最大。PCM的原理框图如图所示。PCM的概念§2.3音频编码基础和标准153多媒体技术基础及应用脉冲编码调制(PCM)脉冲编码调制概念上最简单、理论上最完善脉冲编码调制(PCM)—

均匀量化和非均匀量化均匀量化、非均匀量化和量化误差非线性量化的基本思想在非线性量化中,采样输入信号幅度和量化输出数据之间定义了两种对应关系,这是基于对语音信号的统计分析后由CCITT建议的:m律压扩算法和A律压扩算法§2.3音频编码基础和标准154多媒体技术基础及应用脉冲编码调制(PCM)—

均匀量化和非均匀量化均匀量化、非音频编码标准G.711公布于1972年的话音编码标准。采样率8kHz;将采样样本精度为13、14或16位的输入信号,使用m律压扩编码或者使用A律压扩编码;经过PCM编码器之后每个样本的精度为8位,输出的数据率为64kb/s。§2.3音频编码基础和标准155多媒体技术基础及应用音频编码标准G.711公布于1972年的话音编码标准。§2自适应脉码调制概念APCM是根据输入信号幅度大小来改变量化阶大小的一种波形编码技术。自适应可以是:瞬时自适应音节自适应§2.3音频编码基础和标准156多媒体技术基础及应用自适应脉码调制概念APCM是根据输入信号幅度大小来改变量化阶APCM的量化阶改变量化阶大小的方法有两种:前向自适应根据未量化的样本值的均方根值来估算输入信号的电平,以此来确定量化阶的大小,并对其电平进行编码作为边信息(sideinformation)传送到接收端。后向自适应§2.3音频编码基础和标准157多媒体技术基础及应用APCM的量化阶改变量化阶大小的方法有两种:§2.3音频编APCM的量化阶改变量化阶大小的方法有两种:前向自适应根据未量化的样本值的均方根值来估算输入信号的电平,以此来确定量化阶的大小,并对其电平进行编码作为边信息(sideinformation)传送到接收端。后向自适应§2.3音频编码基础和标准158多媒体技术基础及应用APCM的量化阶改变量化阶大小的方法有两种:§2.3音频编差分脉码调制(DPCM)DPCM的思想:根据过去的样本去估算下一个样本信号的幅度大小(称为预测值),然后对实际信号值与预测值之差进行量化编码,从而就减少了表示每个样本信号的位数。DPCM原理示意图§2.3音频编码基础和标准159多媒体技术基础及应用差分脉码调制(DPCM)DPCM的思想:根据过去的样本去估自适应差分脉码调制ADPCM的核心思想:自适应量化:利用自适应的思想改变量化阶的大小;自适应预测:使用过去的样本值估算下一个输入样本的预测值,使实际样本值和预测值之间的差值总是最小。ADPCM框图。§2.3音频编码基础和标准160多媒体技术基础及应用自适应差分脉码调制ADPCM的核心思想:§2.3音频编码基G.721ADPCM编译码器CCITT制定的G.721推荐标准叫做32kb/s自适应差分脉冲编码调制。在此基础上还制定了G.721的扩充推荐标准G.723,使用该标准的编码器其数据率可降低到40kb/s和24kb/s。§2.3音频编码基础和标准161多媒体技术基础及应用G.721ADPCM编译码器CCITT制定的G.721G.721ADPCM编译码器CCITT推荐的G.721ADPCM标准是一个代码转换系统。它使用ADPCM转换技术,实现64kb/sA律或μ律PCM速率和32kb/s速率之间的相互转换。

ADPCM编码器框图ADPCM解码器框图§2.3音频编码基础和标准162多媒体技术基础及应用G.721ADPCM编译码器CCITT推荐的G.721G.721ADPCM编译码器G.721ADPCM编译码器的输入是G.711PCM代码(8位),其采样率8kHz,数据率是64kb/s。G.721的输出是:4位差分信号,采样率仍然是8kHz,数据率32kb/s。数据率从64kb/s变换为32kb/s,压缩率2:1。§2.3音频编码基础和标准163多媒体技术基础及应用G.721ADPCM编译码器G.721ADPCM编译G.722SB-ADPCM编译码器G.722推荐标准(“数据率为64kb/s的7kHz声音信号编码”),把话质提高到了AM广播质量,而其数据率仍保持为64kb/s(16kHz采样)。G.722采用高低两个子带(子带的划分以4KHz为界),然后再对每个子带采用类似G.721建议的ADPCM。§2.3音频编码基础和标准164多媒体技术基础及应用G.722SB-ADPCM编译码器G.722推荐标准(“子带编码(SBC)子带编码的基本思想:使用一组带通滤波器(band-passfilter,BPF)把输入音频信号的频带分成若干个连续的频段,每个频段称为子带。对每个子带中的音频信号采用单独的编码方案去编码。在信道上传送时,将每个子带的代码复合起来。在接收端译码时,将每个子带的代码单独译码,然后把它们组合起来,还原成原来的音频信号。子带编码的方块图如图3-17所示,图中的编码/译码器,可以采用ADPCM,APCM,PCM等。§2.3音频编码基础和标准165多媒体技术基础及应用子带编码(SBC)子带编码的基本思想:§2.3音频编码基础G.728低延时-码激励

线性预测编码是以美国AT&T公司贝尔实验室提出的LD_CELP(低延时码激励线性预测)算法为基础,它充分考虑了听觉特性。其基本思想如下:§2.3音频编码基础和标准166多媒体技术基础及应用G.728低延时-码激励

线性预测编码是以美国AT&T公DL_CELP编码思想(a)1.语音输入每帧5个取样值,并附上10bit的描述激励信号波形与增益的信息;2.编码时用事先准备好的激励矢量的所有组合去合成语音;§2.3音频编码基础和标准167多媒体技术基础及应用DL_CELP编码思想(a)1.语音输入每帧5个取样值,并DL_CELP编码思想(b)3.将合成结果与输入信号相比较,选出听觉加权后距离最小的码元作为信息传输;4.解码端将发送端制定的激励矢量、3bit增益码以及自身已经合成过的语音波形一起合成为语音。§2.3音频编码基础和标准168多媒体技术基础及应用DL_CELP编码思想(b)3.将合成结果与输入信号相比较MPEG-1中的音频概况:Mpeg标准是由ISO/IEC的运动图像专家组(WG11)制定的。该系列已推出Mpeg-1、Mpeg-2、Mpeg-4、Mpeg-7,目前正在研究讨论Mpeg-21。§2.3音频编码基础和标准169多媒体技术基础及应用MPEG-1中的音频概况:Mpeg标准是由ISO/IECMPEG-1的音频标准ISO/IEC11172-3(Mpeg音频标准)编码器的输入和解码器的输出与PCM标准兼容MPEG-1的数据率:由参数控制§2.3音频编码基础和标准170多媒体技术基础及应用MPEG-1的音频标准ISO/IEC11172-3(MpegMPEG中的音频编码Mpeg中的音频采用子带编码(SBC).子带编码的根据:听觉系统的隐蔽特性;重构的声音与编码前的信号不同,但对听觉来讲是“无损压缩”有四种编码模式。§2.3音频编码基础和标准171多媒体技术基础及应用MPEG中的音频编码Mpeg中的音频采用子带编码(SBC).MPEG中的音频

编码器§2.3音频编码基础和标准172多媒体技术基础及应用MPEG中的音频

编码器§2.3音频编码基础和标准68多媒MPEG中的音频编码层次MPEG声音标准提供三个独立的压缩层次:层1、层2和层3后继层次的压缩比更高,编码解码器也更复杂每层都自含SBC编码器,高层的SBC可以使用低层SBC的声音数据§2.3音频编码基础和标准173多媒体技术基础及应用MPEG中的音频编码层次MPEG声音标准提供三个独立的压缩MPEG中的音频编码层次1层1包括将数字音频变成32个子带的基本映射。将数据格式化成块的固定分段。决定自适应位分配的心理声学模型。利用块压扩合格石化的量化器。编码/解码理论延时最小为19ms,数据传输率384kb/s。§2.3音频编码基础和标准174多媒体技术基础及应用MPEG中的音频编码层次1层1包括将数字音频变成32个子带MPEG中的音频编码层次2层2提供了位分配,缩放因子和抽样的附加编码。使用了不同的帧格式。理论上最小编解码延时35ms,数据传输率256kb/s~192kb/s。用于数字广播、CD-I、VCD等。§2.3音频编码基础和标准175多媒体技术基础及应用MPEG中的音频编码层次2层2提供了位分配,缩放因子和抽样MPEG中的音频编码层次3层3采用混合带通滤波器以提高频率分辨率。增加了差值量化、自适应分段和量化值的熵编码。理论上最小编解码延时59ms,数据传输率64kb/s。用于ISDN上的声音传播。§2.3音频编码基础和标准176多媒体技术基础及应用MPEG中的音频编码层次3层3采用混合带通滤波器以提高频率MPEG的声音压缩率128~112(kbps)10:1~12:13256~192(kbps)6:1~8:12384(kbps)4:11立体声信号所对应的位率压缩率层次§2.3音频编码基础和标准177多媒体技术基础及应用MPEG的声音压缩率128~112(kbps)10:1~1MPEG中的音频解码解码器按编码器定义的语法接受压缩的音频数据流,按解码部分的方法解出数据元素,按滤波器的规定用这些数据产生数字音频输出。§2.3音频编码基础和标准178多媒体技术基础及应用MPEG中的音频解码解码器按编码器定义的语法接受压缩的音频MPEG音频解码结构框图§2.3音频编码基础和标准179多媒体技术基础及应用MPEG音频解码结构框图§2.3音频编码基础和标准75多DOLBYAC-3编码和解码由美国DOLBY实验室开发提供5.1声道从20Hz~20KHz的平滑带宽(图)将

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论