多媒体课程讲学_第1页
多媒体课程讲学_第2页
多媒体课程讲学_第3页
多媒体课程讲学_第4页
多媒体课程讲学_第5页
已阅读5页,还剩36页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

多媒体课程讲学第一页,共四十一页,2022年,8月28日音源编译码器——话音产生的数字模型周期脉冲序列发生器伪随机噪声产生器周期时变数字滤波器音量控制声道参数语音输出浊/清选择第二页,共四十一页,2022年,8月28日

一般来说,波形编译码器的话音质量高,但数据率也很高;音源编译码器的数据率很低,产生的合成话音的音质有待提高;混合编译码器使用音源编译码技术和波形编译码技术,数据率和音质介于它们之间。语音编码技术比较第三页,共四十一页,2022年,8月28日行程编码语音编码技术分类第四页,共四十一页,2022年,8月28日●概念它仅仅是对输入信号进行采样和量化。

在这个编码框图中,它的输入是模拟声音信号,它的输出是PCM样本。图中的“防失真滤波器”是一个低通滤波器,用来滤除声音频带以外的信号;“波形编码器”可暂时理解为“采样器”,“量化器”可理解为“量化阶大小(step-size)”生成器或者称为“量化间隔”生成器。脉冲编码调制(PCM)第五页,共四十一页,2022年,8月28日●PCM编码的两个步骤:第一步是采样,就是每隔一段时间间隔读一次声音的幅度;第二步是量化,就是把采样得到的声音信号幅度转换成数字值。●量化归纳成两类:均匀量化非均匀量化●采用的量化方法不同,量化后的数据量也就不同。因此,可以说量化也是一种压缩数据的方法。PCM编码步骤第六页,共四十一页,2022年,8月28日如果采用相等的量化间隔对采样得到的信号作量化,那么这种量化称为均匀量化。均匀量化就是采用相同的“等分尺”来度量采样得到的幅度,也称为线性量化,如图所示。量化后的样本值Y和原始值X的差E=Y-X称为量化误差或量化噪声。均匀量化第七页,共四十一页,2022年,8月28日无论对大的输入信号还是小的输入信号一律都采用相同的量化间隔。但是,对话音信号来说,大信号出现的机会并不多,增加的样本位数就没有充分利用。为了克服这个不足,就出现了非均匀量化的方法,这种方法也叫做非线性量化。非线性量化的基本想法是,对输入信号进行量化时,大的输入信号采用大的量化间隔,小的输入信号采用小的量化间隔采样输入信号幅度和量化输出数据之间定义了两种对应关系:μ律压扩(companding)算法,A律压扩算法。非均匀量化第八页,共四十一页,2022年,8月28日式中:x为输入信号幅度,规格化成;-1≤x≤1sgn(x)为x的极性;μ律(μ-Law)压扩(G.711)主要用在北美和日本等地区的数字电话通信中μ率压扩第九页,共四十一页,2022年,8月28日μ率压扩曲线第十页,共四十一页,2022年,8月28日式中:x为输入信号幅度,规格化成-1≤x≤1;sgn(x)为x的极性;A为确定压缩量的参数,它反映最大量化间隔和最小量化间隔之比。A律压扩的前一部分是线性的,其余部分与μ律压扩相同。A律(A-Law)压扩(G.711)主要用在欧洲和中国大陆等地区的数字电话通信中

0≤|x|≤1/A

1/A≤|x|≤1

A率压扩第十一页,共四十一页,2022年,8月28日A率压扩曲线第十二页,共四十一页,2022年,8月28日DPCM:利用样本与样本之间存在的信息冗余度来进行编码的一种数据压缩技术。主要思想:根据过去的样本去估算(estimate)下一个样本信号的幅度大小,这个值称为预测值,然后对实际信号值与预测值之差进行量化编码,从而就减少了表示每个样本信号的位数。与脉冲编码调制(PCM)不同:PCM是直接对采样信号进行量化编码,而DPCM是对实际信号值与预测值之差进行量化编码,存储或者传送的是差值而不是幅度绝对值,这就降低了传送或存储的数据量。此外,它还能适应大范围变化的输入信号。差分脉冲编码调制第十三页,共四十一页,2022年,8月28日①利用自适应的思想改变量化阶的大小,即使用小的量化阶(step-size)去编码小的差值,使用大的量化阶去编码大的差值;②使用过去的样本值估算下一个输入样本的预测值,使实际样本值和预测值之间的差值总是最小。

核心思想:ADPCM:采用自适应技术和差分编码技术相结合。将64kb/s的PCM信号压缩为32kb/s的脉冲编码信号,广泛应用于电话通信网。自适应差分脉冲编码调制第十四页,共四十一页,2022年,8月28日LPC是通过分析话音波形来产生声道激励和转移函数的参数,对声音波形的编码实际就转化为对这些参数的编码,这就使声音的数据量大大减少。在接收端使用LPC分析得到的参数,通过话音合成器重构话音。合成器实际上是一个离散的随时间变化的时变线性滤波器,它代表人的话音生成系统模型。周期脉冲序列发生器伪随机噪声产生器周期时变数字滤波器音量控制声道参数语音输出浊/清选择线性预测编码(LPC)第十五页,共四十一页,2022年,8月28日=线性预测器是使用过去的P个样本值来预测现时刻的采样值x(n),预测值可以用过去P个样本值的线性组合来表示:

残差误差(residualerror)即线性预测误差为

=线性预测器第十六页,共四十一页,2022年,8月28日在给定的时间范围里,如

,使

的平方和即

为最小

通过求解偏微分方程,可找到系数ai的值。如果把发音器官等效成滤波器,这些系数值就可以理解成滤波器的系数。这些参数不再是声音波形本身的值,而是发音器官的激励参数。

线性预测编码(LPC)第十七页,共四十一页,2022年,8月28日

ITU-T音频压缩标准用于电话质量的语音压缩标准G.711,G.721,G.723,G.728用于调幅广播质量的音频压缩标准G.722音频压缩标准第十八页,共四十一页,2022年,8月28日电话质量的语音信号频率范围为300hz~3.4khz。G.711:1972年CCITT制定,用标准的PCM,采样频率8khz,量化精度8b,对应的速率64kb/s)。主要用于公用电话网中。G.721:将64kb/s比特流转换成32kb/s比特流,基于ADPCM。G.723:5.3kb/s或6.3kb/s数据流,可用于可视电话和IP电话等系统中。G.728:1992年,16kb/s比特流,采用短时延码本激励线性预测编码(LD-CELP)算法。主要用于公用电话网中。ITU-TG电话质量语音压缩标准第十九页,共四十一页,2022年,8月28日用于调幅广播的质量的音频信号频率范围为50hz~7khz。G.722:16kHz,14b量化1988年,子带编码及ADPCM编码,能将224kb/s的此类信号压缩为64kb/s,主要用于视听多媒体和会议电视等。ITU-T调幅广播质量语音压缩标准第二十页,共四十一页,2022年,8月28日ISO11172-3:MPEG-1音频标准(MP1、MP2、MP3)(高保真音频压缩标准:音频信号50hz~20khz)ISO13818-3:MPEG-2音频标准(DolbyAC-3):5+1声道、低比特率和后向兼容性ISO13818-7:MPEG-2AAC音频标准支持采样频率从8kHz到96kHz,可支持48个主声道、16个配声道和16个数据流。ISO14496-3:MPEG-4音频标准集成从话音到高质量的多通道声音,从自然声音到合成声音MPEG音频压缩标准第二十一页,共四十一页,2022年,8月28日提供3个独立的压缩层次,用户可在复杂性和压缩质量之间权衡选择。层1最简单,使用比特率384kbps,主要用于数字盒式磁带DCC;层2的复杂度中等,使用比特率192kbps左右,主要应用于数字广播的音频编码、CD-ROM上的音频信号以及CD-I和VCD。层3最为复杂,使用比特率64kbps,尤其适用于ISDN上的音频传输,有损压缩但音质保持逼真效果。MP3音乐是利用MPEGAudioLayer3的技术,声音采用1:10甚至1:12的压缩率MPEG-1音频

第二十二页,共四十一页,2022年,8月28日MP3

层3使用比较好的临界频带滤波器,把声音频带分成非等带宽的子带,心理声学模型除了使用频域掩蔽特性和时间掩蔽特性之外,还考虑了立体声数据的冗余,并且使用了霍夫曼(Huffman)编码器。第二十三页,共四十一页,2022年,8月28日声音合成与MIDI系统MIDI(MusicalInstrumentDigitalInterface):可译成“电子乐器数字接口”。用于在音乐合成器(musicsynthesizers)、乐器(musicalinstruments)和计算机之间交换音乐信息的一种标准协议从20世纪80年代初期开始,MIDI已经逐步被音乐家和作曲家广泛接受和使用。MIDI消息:乐谱的数字描述,即一套指令(即命令的约定),它指示乐器即MIDI设备要做什么,怎么做,如演奏音符、加大音量、生成音响效果等。MIDI不是声音信号,在MIDI电缆上传送的不是声音,而是发给MIDI设备或其它装置让它产生声音或执行某个动作的指令。第二十四页,共四十一页,2022年,8月28日MIDI系统音乐合成器:解释MIDI消息并产生音乐。含有键盘、音色和音序器。音乐合成方法:频率调制合成法(frequencymodulation,FM)和乐音样本合成法(波形表(Wavetable)合成法)音序器:用来记录、编辑和播放MIDI文件的设备。软件音序器Cakewalk音源:产生声音的设备,提供很多不同音色的样本波形采样器:开放式音源,对声音进行采样,合成音色来供电脑音乐系统使用。其他设备:录音设备、监听设备、音响功放第二十五页,共四十一页,2022年,8月28日一个简单的MIDI系统上图表示的是一个简单的MIDI系统,它由一个MIDI键盘控制器和一个MIDI声音模块组成。许多MIDI键盘乐器在其内部既包含键盘控制器,又包含MIDI声音模块功能。在这些单元中,键盘控制器和声音模块之间已经有内部链接,这个链接可以通过该设备中的控制功能(localcontrol)对链接打开(ON)或者关闭(OFF)。第二十六页,共四十一页,2022年,8月28日它由5个基本模块组成:数字载波器、调制器、声音包络发生器、数字运算器和模数转换器。声音包络发生器用来调制声音的电平,这个过程也称为幅度调制(amplitudemodulation),并且作为数字式音量控制旋钮,它的4个参数写成ADSR,这条包络线也称为音量升降维持静音包络线(Attack,decay,sustain,release,ADSR)。频率调制(FM)合成法的原理第二十七页,共四十一页,2022年,8月28日在乐音合成器中,数字载波波形和调制波形有很多种,不同型号的FM合成器所选用的波形也不同。下图是YamahaOPL-III数字式FM合成器采用的波形。各种不同乐音的产生是通过组合各种波形和各种波形参数并采用各种不同的方法实现的。用什么样的波形作为数字载波波形、用什么样的波形作为调制波形、用什么样的波形参数去组合才能产生所希望的乐音,这就是FM合成器的算法。频率调制(FM)合成法的原理第二十八页,共四十一页,2022年,8月28日这种方法就是把真实乐器发出的声音以数字的形式记录下来,播放时改变播放速度,从而改变音调周期,生成各种音阶的音符。乐音样本的采集相对比较直观。音乐家在真实乐器上演奏不同的音符,选择44.1kHz的采样频率、16位的乐音样本,这相当于CD-DA的质量,把不同音符的真实声音记录下来,这就完成了乐音样本的采集。乐音样本通常放在ROM芯片上。乐音样本合成器所需要的输入控制参数比较少,可控的数字音效也不多,大多数采用这种合成方法的声音设备都可以控制声音包络的ADSR参数,产生的声音质量比FM合成方法产生的声音质量要高。

乐音样本合成声音第二十九页,共四十一页,2022年,8月28日MIDI规范与接口MIDI规范:1988年MIDI制造商协会正式公布MIDI技术规范第一版(MIDI1.0),作为数字式音乐的国际标准。MIDI是由软件和硬件两部分共同组成的系统规范,它定义了电子合成器、定序器、节拍器、个人计算机和其他电子乐器的相互连接性和通信协议。相互连接性:定义了使这些不同的MIDI仪器能够相互连接的接线方式、连接器类型,和输入输出线路。通信协议定义了能够控制乐器声音和消息(包括:发出反应,发出状态,及发出系统独有)的标准多字节消息。补充规范:“MIDI1.0详解”、“MIDI1.0规定的补充说明”、“通用MIDI(GM)规范”第三十页,共四十一页,2022年,8月28日MIDI接口MIDIIn:接受从其他MIDI装置传来的信息MIDIOut:发送某装置生成的原始MIDI消息,向其他设备发送MIDI消息MIDIThru:传送从输入口接收的消息到其他MIDI装置,向其他设备发送MIDI消息。第三十一页,共四十一页,2022年,8月28日MIDI工作过程第三十二页,共四十一页,2022年,8月28日.wav●WAVE(WaveformAudio)波形音频文件

多媒体系统、音乐光盘制作,记录物理波形,数据量大.cda●CDA(CDAudio)激光音频文件

准确记录声波,数据量大,经过采样,生成wav和mp3音频文件.mid●MIDI(MusicalInstrumentDigitalInterface)乐器接口文件

用于合成、游戏,记录音符时值、频率、音色特征,数据量小.mp3●mp3(MPEG音频压缩标准)压缩音频文件

必须经过解压缩,数据量小声音文件的存储格式及编辑转换工具第三十三页,共四十一页,2022年,8月28日用.wav为扩展名的文件格式称为波形文件格式(WAVEFileFormat),它在多媒体编程接口和数据规范1.0(MultimediaProgrammingInterfaceandDataSpecifications1.0)文档中有详细的描述。该文档是由IBM和微软公司于1991年8月联合开发的,它是一种为交换多媒体资源而开发的资源交换文件格式(ResourceInterchangeFileFormat,RIFF)。波形文件格式支持存储各种采样频率和样本精度的声音数据,并支持声音数据的压缩。.WAV声音文件第三十四页,共四十一页,2022年,8月28日主要音频处理软件录音软件:Windows录音机编辑与转换软件Windows录音机CoolEditGoldWaveCakeWalk第三十五页,共四十一页,2022年,8月28日●

设备间的信号连接SPEAKERMICLINEIN1mV500mV声卡机箱后背插头:φ3.5mm/stereo●

使用“录音机”获取声音(1)选择“程序/附件/娱乐/录音机”菜单,启动录音机(2)单击[录音]按钮,开始录音

(录音时间为60秒)教学进程录音软件第三十六页,共四十一页,2022年,8月28日(1)鼠标左键双击任务栏右侧图标(2)检查“波形”是否被选择—[√](4)选择“录音”选项(5)检查:

录音控制线路输入麦克风应有[√](3)选择“选项/属性”(6)单击[确定]按钮录音失败的处理●[操作步骤]教学进程第三十七页,共四十一页,2022年,8月28日(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”(3)选择需转换的音频文件(4)单击[打开]按钮(6)单击[开始转换]按钮(7)选择属性(采样频率)(3)选择“文件/另存为”菜单,保存文件(5)选择“文件/属性”(8)单击[确定]按钮1.Windows录音机(9)如不满意,可从步骤(2)重新开始编辑与转换软件(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(4)单击[打开]按钮(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(5)选择“文件/属性”(4)单击[打开]按钮(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(6)单击[开始转换]按钮(5)选择“文件/属性”(4)单击[打开]按钮(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(7)选择属性(采样频率)(6)单击[开始转换]按钮(5)选择“文件/属性”(4)单击[打开]按钮(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(8)单击[确定]按钮(7)选择属性(采样频率)(6)单击[开始转换]按钮(5)选择“文件/属性”(4)单击[打开]按钮(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(9)如不满意,可从步骤(2)重新开始(8)单击[确定]按钮(7)选择属性(采样频率)(5)选择“文件/属性”(4)单击[打开]按钮(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(3)选择“文件/另存为”菜单,保存文件(9)如不满意,可从步骤(2)重新开始(8)单击[确定]按钮(5)选择“文件/属性”(4)单击[打开]按钮(3)选择需转换的音频文件(2)选择“文件/打开”(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(5)选择“文件/属性”(3)选择需转换的音频文件(1)选择“程序/附件/娱乐/录音机”1.Windows录音机(1)选择“程序/附件/娱乐/录音机”(8)单击[确定]按钮1.Windows录音机(1)选择“程序/附件/娱乐/录音机”(9)如不满意,可从步骤(2)重新开始(8)单击[确定]按钮1.Windows录音机(1)选择“程序/附件/

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论