版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第一章多媒体技术概论信息时代的主流技术:计算机网络与通信,数据库与数据挖掘;面向对象方法,软件体系结构;多媒体,人工智能多媒体技术:20世纪80年代初兴起,
90年代以来成为IT研究热点;
21世纪的主要发展方向之一
1.1多媒体技术的基本概念
1.1.1多媒体技术的研究范畴多媒体技术=计算机技术+通信技术+视听信息处理技术
+数学方法+领域知识
1.多媒体分类
CCITT关于五种类型的多媒体定义:
(1)感觉媒体:直接作用于人的感官,使人产生信息效应的媒体如声音,文字,图形,图像,动画,视频
(2)表示媒体:对感觉媒体的标识与中间处理手段,如媒体编码
(3)表现媒体:电信号与感觉媒体之间实现信号转换所用的实体包括输入显示媒体,如键盘,鼠标,扫描仪,摄像机输出显示媒体,如显示器,打印机,扬声器
(4)存储媒体:媒体信息的存储表示与存放实体,如硬盘,软盘
(5)传输媒体:表示媒体从一点传输到另一点的物理实体,包括各种导线,电缆,光缆,无线电波和红外线等
表示:人为构造的各种媒体对象描述方式如语言编码,数值编码,图像编码;程序编码;对象标识;侧重形式化∕代码化的信息表达
表现:媒体信息处理与信号转换方式如摄像机、键盘等输入方式,显示和打印等输出方式;侧重可视化I∕O信号转换与用户交互界面2.多媒体定义概要描述:多媒体是采用计算机和各种媒体信息处理设备,对传统的计算媒体(如文本,图形,静止图像,动画)和视听媒体(如音频,视频)进行数字化与综合处理的技术,是使多种媒体之间建立逻辑联系和交互方式的方法,是融多种技术、方法、设备和媒体为一体的集成化计算机系统
多媒体定义的模型描述:多媒体=多种媒体信息+媒体信息处理技术+媒体信息处理设备+人机界面与系统集成机制1.1.2多媒体技术的研究对象研究对象:通过视觉和听觉,进行信息交流的多种媒体元素及其表示与表现形式
(1)文本(Text):在计算机系统中,文本包括文字、数字和符号等,用二进制编码表示
(2)图像(Image):两种不同表示方式的可视元素。即位图,简称图像;矢量图,简称图形图像分类:静止图像,运动图像运动图像:动画
—
慢动图像(1-15帧∕秒);
视频
—
活动影像(25∕30帧∕秒)视频:电视视频(模拟视频);计算机视频(数字视频)电视视频+数字视频
→
高清晰度电视HDTV
(3)声音(Sound):是音频的同义词,包括语音和音乐音频信号的频率范围大约在15HZ~20KHZ
(4)超文本(Hypertext):由表达信息块的“节点”和表达节点之间连接关系的“链”所组成的电子文档信息“网络”,是一种电子文献形式的信息管理即数据库技术
(5)超媒体(Hypermedia):基于超文本支持的多媒体,即超文本(结构)加多媒体(信息),亦即多媒体超文本。目前超媒体与超文本两词几乎成为同义概念
(6)交互多媒体(InteractiveMultimedia):多媒体的别称;其内核是超媒体,超媒体的内核是超文本,超文本的内核是文本、图像和声音等基本媒体元素1.1.3多媒体技术特征主体特征:多维性,交互性,集成性,数字化其它特征:实时性,同步性,分布性
(1)多维性:衡量信息处理范围的扩展与放大能力,包括多媒体信息处理的空间维、时间维和特征维等
(2)交互性:利用键盘、鼠标、触摸屏等多种交互工具,提供接近自然的信息交互方式,使人工可以干预多媒体节目的播放内容和次序
(3)集成性:一是多种媒体设备的集成,即视频、音响、存储设备与计算机系统的集成;二是多种媒体信息的集成,即文本、图形、静图、动画、视频和声音的有机组合
(4)数字化:采用计算机对多种可视听信息进行数字化处理全数字化是多媒体技术发展的核心所在
(5)实时性:在多媒体播放过程中,语音和音乐需要保持连续性,视频图像需要以固定速率进行显示和更新,因而多媒体系统对实时处理要求较高
(6)同步性:对文本、图像和声音等信息进行混合处理,需要解决多信号的空间组合与时间同步问题;包括音频∕视频同步,数字信号∕模拟信号同步
(7)分布性:多媒体信息的多样性和异构性,使得多专业人员协同工作所需的原始数据,往往分布在不同的空间和时间里
多媒体的关键技术:①数据压缩技术:数据压缩编码标准;压缩算法;数据压缩比的控制;数据重现精度的控制②专用芯片技术:包括固定功能芯片,如图像数据压缩卡;带处理器的可编程芯片,如声音卡和视频卡③大容量外存技术:CD_ROM驱动器;CD光盘驱动器光盘技术是衡量计算机多媒体能力的一个重要标志④多媒体核心软件技术:音频/视频子系统,多媒体操作系统内核程序⑤多媒体网络通信技术:宽带高速网;协议支持
多媒体技术需要进一步解决的问题:压缩,集成,交互,实时,同步1.2多媒体技术的应用状况
(1)基于产品研究方向的应用分类①计算机电视(Compuvision)
CPU+CD-ROM+显/声/视三卡+多窗口系统
——
以计算机为基础的多媒体化②电视计算机(Teleputer)电视/声像设备+CPU+TV编程与控制技术
——
以电视/声像设备为基础的数字化
发展趋势:Compuvision+Teleputer→HDTV
(多功能结合,标准化,实用化)
(2)基于领域特征功能的应用分类①视频会议系统:可视电话(面向家庭用户);桌面会议系统(领导—专家—企业家的交流);高中档视频会议系统(用于跨地区的大中型会议)②计算机支持的协同工作平台CSCW:可视化通信;共享信息系统;共享工作空间系统;群体活动系统③点播电视技术VOD:视频服务器;编码器∕路由器;用户请求计算机和记帐计算机;机顶盒④虚拟现实技术:三维视觉∕立体听觉∕质感化的逼真实体;
VR对话;基于3D传感设备的交互1.3多媒体技术标准技术标准的作用:软硬件产品化/产业化的关键技术依据,开放系统和系统集成的参照依据
1.3.1广播视频标准
(1)NTSC制(NationalTelevisionStandardCommittee):正交平衡调幅制
1953年由美国制订,广泛用于美国和日本等国家采用YIQ彩色空间
(2)PAL制(PhaseAlternatingLine):相位逐行匀变制
1962年由联邦德国制定,广泛用于中国、英国和大部分西欧国家;现已成为国际标准采用YUV彩色空间
(3)SECAM制(SequentialColorandMemory)顺序彩色与存储制用于法国、俄罗斯和几个东欧国家基本技术指标与PAL制相同,但采用调频制式,传播方式也不同
(4)HDTV制(HighDefinitionTelevision)高清晰度电视制.面向21世纪由Philips/Sony和IBM、Apple等共同制订包括模拟和数字两种格式采用国际标准压缩编码算法MPEGⅡ;采用打包数据结构(可动态分配),采用不同优先级的双层传输技术1.3.2数据压缩标准
(1)JPEG标准(JointPhotographicExpertsGroup)由联合图像专家组制订的静止图像压缩标准;也适用于电视图像的帧内图像压缩编码
(2)MPEG标准(MovingPictureExpertsGroup)由运动图像专家组制订的活动图像压缩标准包括三个标准集:数字视频压缩数字音频压缩视频与音频压缩数据流的复合和同步(系统标准)
MPEG标准系列的实质区别:支持的数据传输速率不同
MPEG1:位率为0.9~1.5Mbps
(适用:CD_ROM,VCD;低档消费产品)
MPEG2:位率为4~10Mbps
(适用:高品质高带宽的广播视频,与HDTV兼容)
MPEG4:位率为5~64Kbps超低位率(适用:移动通信信道编码,PSTN视频压缩)位率为2Mbps
(适用:电视/电影信号压缩,基于内容的交互)
Audio位率:
384Kbps:适用于数字录音带
192Kbps:适用于数字广播音频,光盘音频
64Kbps:适用于数字化网络的音频实时传输
(3)H.261标准由CCITT制订的视频/音频双向传输编码压缩标准;亦称P×64标准
P为参数,取值1~30
可视电话:P=1~2
视频会议:P≧61.3.3光驱和光盘接口标准
(1)光驱接口标准:定义光驱与主机的连接接口类型①IDE接口(IntegratedDriveElectronics):基于集成电子技术驱动的硬盘控制接口
IDE接口卡提供2个硬驱插口,可直接插入PC机扩展槽②SCSI接口(SmallComputerStandardInterface):提供8个外设控制器③专用接口:通过专用控制卡或并行口与计算机连接(如外置式CD_ROM)
CD_ROM驱动器接口形式:内接(IDE,EIDE;SCSI)外接(并行口;SCSI)
(2)光盘接口标准①红皮书:1982年公布,适用于激光唱盘CD_DA
达标标志:DigitalAudio②黄皮书:1985年公布,适用于CD_ROM;
1988年,CD_ROM/XA
达标标志:DataStorage③蓝皮书:1986年公布,适用于CD_V④绿皮书:1987年公布,适用于CD_I⑤橙皮书:1991年公布,适用于CD_R,PhotoCD⑥白皮书:1994年公布,适用于VCD
CD_ROM驱动器一般都支持:AudioCD,CD_ROM,CD_R
但不一定支持:PhotoCD,CD_I,VideoCD
2.1音频处理技术基本内容:音频数字化处理,MIDI音乐合成,多媒体声音卡,音频文件格式
2.1.1音频数字化处理
1.声音的基本描述①波形声音:基于振动波(信号化)描述的声音;可形成数字波形文件②语音:人的声道发出的声音—
语义化描述的语言形式③音乐:通过乐谱规范表达的乐曲—
符号化描述的声音;可形成数字音乐文件
(1)声音的模拟信号表示方法
Sound=Bline+A×f(t)①基线Bline:提供一个测量模拟信号的基准点②周期T:两个相邻信号的波峰(或波谷)之间的时间间隔,用于表示信号的快慢即声音发生的频率f;f=1/T(Hz)③振幅A:波形峰点(或谷点)与基线之间的距离用于表示信号的强弱即声音的响度
(2)声音的质量特性
SQuality=(Tone,Volume,TQuality)①音调(Tone):声音频度与音域宽窄程度,与频率f有关.音调可按频率分为:
·
次声(f<20Hz)
·
可听声(20Hz≦f≦20KHz)
·
超声(f>20KHz)②音量(Volume):声音响度亦或音强,与振幅A成正比.③音质(ToneQuality):声音在听觉上的优美程度,亦称音色;是振幅与频率的优化组合(基音+谐音)
声音的质量通常以音频信号的带宽来衡量音频(Audio):声音的同义词频率范围为:20Hz~20KHz
人的声带一般为:50~500Hz
常见的音频带宽:①电话音频:200Hz~3.4KHz②无线电广播调幅(AM)声:50Hz~7KHz③无线电广播调频(FM)声:20Hz~15KHz④高保真(HiFi)立体声:20Hz~20KHz
2.音频信号的数字化过程
①放大:使信号幅度达到可采集与变换要求;并滤除高频干扰和噪声②采样:模拟信号离散化以固定的采样周期T对波形Xa(t)的幅值进行抽样,得到一个离散的序列X(n).采样值:
X(n)=Xa(nT);
N=1,2,3,……(离散点的个数),
T=1/f,f为采样频率
③量化:离散信号数字化把每个采样值(模拟量)转换成数字量,并用n个二进制数表示;n越大,量化精度越高量化值:量化误差:注意点:a.实现量化的过程称A/D变换
b.均匀量化后的信号称脉冲编码调制(PCM)信号
c.A/D变换一般是均匀量化;因而称PCM量化④编码:数字信号格式化把每个量化值表示成二进制存储位形式的字长
8位字长≡8bit(1个Byte)若要进行数据压缩编码时,需采用相关算法及数据格式表示
3.数字音频的主要技术指标
(1)采样频率fc:单位时间间隔(采样周期)内所采集的样本数
fc越高,数字化后的信号质量就越高;但存储量也越大
(2)量化字长:用采样周期分割样本波形的振幅空间的等分数,表示为采样值的二进制位数;因而称采样精度或样本字长.量化字长(位数)与采样值的精度成正比.关系:
4bit16级(n=16),8bit256级,16bit65536级.
(3)声道数:一次采样所记录的声音波形个数单声道—
产生一个声音波形;双声道—
产生两个声音波形(立体声)声道数增加,将使存储容量及开销成倍增加.计算公式:存储量=(采样频率×量化字长×声道数)/8(Byte/s)
采样定理:若fc≧2fsmax(fsmax为最大信号频率),则可保证量化后的信号具有还原为模拟信号的能力.例:人耳听觉的上限频率为20KHz;则fc≧40KHz
2.1.2MIDI音乐合成
音乐设备数字接口MIDI的作用:定义电子音乐设备连入计算机的电缆和端口标准;
定义计算机与MIDI设备之间进行信息交换的一整套规则,包括电子乐器之间传送数据的通信协议
1988年,MIDI正式成为数字式音乐的一个国际标准
1.数字音乐的生成方法
·
波形声音数字化方法生成数字波形文件
·MIDI方法(电子音乐合成方法)生成数字音乐文件
(乐谱的数字式描述—MIDI消息)2.MIDI音频处理过程
①MIDI键盘:用于声音数据采集(演奏——不发声,记录)和创建MIDI消息②MIDI接口:用于MIDI文件(消息)管理,包括接收、发送和转发
MIDIIn端口:接收来自各种MIDI设备的MIDI消息
MIDIOut端口:发送本设备完成的MIDI信息到其它设备
MIDIThru端口:转发In端口信息到另一台MIDI设备上
③音序器(Sequencer):用于记录(捕获)、编辑、存储和播放MIDI文件;包括硬件和软件两种形式,目前多以软件取代硬件通过播放产生声音,可送回原设备直接播放;也可送合成器④合成器:用于把数字式声音转换成原来的模拟声音;并可对MIDI文件解释执行、产生原声效,或供扬声器播放合成器一般是硬件,装配在声卡上.常用合成器类型:基础合成器:支持3种乐器和6音符复调扩展合成器:支持9种乐器和16音符复调*.MIDI合成器声道划分:1—10声道:用于扩展合成器
11—12声道:未定义
13—16声道:用于基本合成器
3.MIDI技术的主要优点
(1)大大节省存储空间:MIDI文件—
乐符/程序指令集(数字波形文件—
二进制代码集)
(2)有利于语音与音乐的合成:解说词+配乐+音乐同时播放(波形声音文件:无法同时播放与合成)
(3)有利于数据文件的编辑与修改(比波形声音文件的修改方便、灵活)2.1.3多媒体声音卡
声音卡:具有录音、播音和声音合成功能的计算机硬件插卡,集成了各种音频电路,使计算机具有良好的声音处理能力和音响效果
1.声音卡组成原理(1)音频输入端口:录制话音和音乐,以对各种声源进行采集
(2)音频信号处理:①A/D转换器:完成对波形声音的采样、量化和编码功能,把原始模拟音频转换成数字音频;以供计算机存储和传输②D/A转换器:把经计算机处理的数字音频转换成模拟音频;以供扬声器、耳机或立体声音箱等设备播出③MIDI合成器:执行MIDI文件,把数字音频转换成模拟音频;支持多种电子乐器的音乐合成和演奏④数字信号处理器:是一种具有可编程能力的独立芯片;用于声音合成处理和数据压缩与解压
(3)音频输出端口:通过混合放大器完成各路信号的合成,并提供选择(开关)输出,供扬声器等设备播放
2.声音卡的选择
①音质好:采样频率44.1KHz,量化字长16位,双声道等②功能强:数据位(8,12,16,32,64),具有DSP,PnP③家用附件齐全:CD_ROM接口,MIDI接口,立体声音箱等④网络通信功能:配Modem,可接Fax,自动应答电话⑤携带开发工具:如SoundBlasterWindowsDLL⑥软件功能配量齐全⑦产品兼容性强/可升级换代⑧产品性能/价格比高声卡产品:
·SoundBlaster16Pro/16SEPnP
·SoundBlaster32SEPnP/AWE32
·SoundBlasterAWE64/AWE64黄金版2.1.4音频文件格式音频文件可分为数字波形文件和数字音乐文件两大类数字波形文件:Microsoft的WAV文件,Creative的VOC文件;
UNIX平台的语音文件AUDIO(AU)数字音乐文件:MIDI(MID)文件,
RMID文件(资源交换文件RIFF格式的MIDI)
(1)VOC文件格式:由文件头和数据块组成
VOC文件的文件头存储格式:
VOC文件的数据块:分为9种类型的数据子块①
块类型0(终址标志块):终止整个数据块声音输出一个字节(00)②块类型1(声音数据块):包括块类型标识,块长度BLKLEN,时间常数TC或采用频率SR,块数据压缩方式PACK,声音数据(数据长度=块长度-2)
PACK的内容与含义:08位原码(未压缩)
14位压缩(2:1压缩)
22.6位压缩(3:1压缩)
32位压缩(4:1压缩)
③块类型2(声音持续块):表示上一个声音数据块的继续④块类型3(静音数据块):定义声音数据中的一段静音,静止时间长度以采样周期为单位,其中应静止时间Period的值总比静止时间小1
⑤块类型4(特殊标记块):定义声音数据中的一个标记,该标记Marker可用声音卡的应用程序插入到声音数据中,主要用于实现与声音输出过程的同步其中,MARKER值的范围为1~0FFFEH⑥块类型5(ASCII文件块):定义以NULL结束的ASCII字符串该块仅在需要有关声音的信息时被定义,一般可忽略⑦块类型6(声音重复块):确定数据块重复循环的开始,循环次数Count(范围1~0FFFEH),实际重复Count+1次⑧块类型7(重复结束标志块):与类型6配合使用,BLKLEN=0⑨块类型8(功能扩展块):用于立体声或高速语音的属性描述,必须位于块类型1之前.压缩方式PACK一般为0;声道方式:单声道(Mode=0);双声道(Mode=1)2.2图像处理技术
图像分类:按信源(产生性质)及处理方式区分①模拟图像:图像函数f(x,y)的
空间和亮度(或颜色)的变化均连续例如,电视图像∷=f(信号频率,幅值)②数字图像:f(x,y)的空间和亮度(颜色)均经离散处理,并用数字量(0,1)表示
——
计算机图像(多媒体图像处理的基本对象)按图像类型的物理表示:位图(Bitmap)矢量图(Vector_drawn)2.2.1数字图像的基本描述
1.数字图像处理内容
(1)图像的数字化:采样,量化
(2)压缩编码:用数据编码算法简化图像表示,以利存储和传输
(3)图像增强与恢复:点处理,邻域处理,大域处理①增强有用信息,消除干扰和噪声,以利识别和分析②使退化和模糊的图像复原,以尽可能与原图像保持一致
(4)图像重建:采用卷积和投影等算法,用计算机系统重建
(5)图像分析:识别和抽取图像的主要特征,进行应用分析①测量分析:如粒子分析,立体组织分析②统计分析:不规则形体的特征值和参数及其关系分析③纹理分析:物体质地分析,以便模拟其自然属性2.数字图像表示方法
(1)图像的物理表示①物理图像:以像素级表示的图像,即点阵或光栅图像位图:数据点(位)与图像像素(格)相对应;用计算机内存位(bit)定义像素点的亮度和颜色位图的存储表示及其数据容量的计算方法为:数据容量=图像宽度×图像高度×每个像素的位数/8②物理属性:客观存在的能用视觉区分的性质;与领域无关亮度,颜色;纹理(粗糙性);轮廓(形状,大小)
矢量图:用线型表示的图形其属性和参数可用一个指令集来描述如直线,矩形,圆;曲线的形状、大小、位置和维数;颜色位图与矢量图的比较:存储空间占用量:位图比矢量图大得多;文件存储格式:两者不同,但可互换矢量图位图,较易位图矢量图,较难
(2)图像的逻辑表示内涵:图像的层次结构、组成对象及其属性抽象表示逻辑属性:一幅图像中包含的对象数,对象间的空间关系,扫描方式;每个对象的最小边界矩形,对象的空间位置,投影关系空间关系:直接相连,相邻,覆盖,包含等
(3)图像的数学表示
图像点的强度I:表示一幅图像在空间各坐标点上强度的集合
I=f(Space,Characteristic,Time)空间维S:表示像素点的空间坐标(x,y);特征维C:表示待处理的特征值,如亮度B,可变波长λ等;时间维T:表示动态的时间序列tK(K=1,2,…,n)
数字化位图:可表示成M×N个像素点组成的二维数组
f(Xi,Yj)=(Xi,Yj)点处像素的亮度或颜色值
i=1,2,……,M;j=1,2,……,N
或者:两维图像f(x,y)可以表示成M个N维矢量(数组)
Ai=(a1,a2,…,an);i=1,2,……,m
常见数字图像类型描述:
①二值图像:f(x,y)=(0,1);每个像素只有黑白两个灰度值原始图像如,文字,报文,线条图,工程图纸,指纹②黑白图像:0≦f(x,y)≦2N-1;N为量化字长(N=1,二值图像;N≠1,灰度级图像)灰度:图像点阵由深浅不同的多层次的连续黑白点构成③彩色图像:{fi(x,y)};i=R,G,B(三基色)即:颜色空间由红、绿、蓝三基色按不同比例调和而成;图像点阵中的每个像素由三基色各自的亮度值构成④活动图像:{ft(x,y)};t=tK(K=1,2,……,n)
即:由时间序列画面组成;画面按时间先后连续播放如动画,视频图像
(4)分辨率表示
分辨率:影响图像处理质量的重要因素.需要区别三个概念:①屏幕分辨率:在某种显示方式下,以像素点表示的计算机屏幕的最大显示区域(水平,垂直)可用于确定显示目标的大小例:VGA显示模式的屏幕分辨率为640×480(Pixel)②图像分辨率:以水平和垂直像素点表示的数字化图像大小;可用于确定图像播放目标(帧画面)的大小例:在640×480显示屏上,可显示320×240个像素;即图像大小是屏幕分辨率的1/4③像素分辨率:表示一个像素的宽/长比,亦称像素长度比;可用于确定图像显示格式和文件交换格式
(5)图像深度表示图像深度:位图中每个象素所占的颜色位数(bit/Pixel);用于确定位图中出现的最大颜色数(或颜色位)深度级D:D=(1,4,8,16,24)表明每个像素具有D个颜色位自然界中的彩色图像一般至少要256种颜色表示(8个颜色位);全真彩色图像可含1677万种颜色,需要24个颜色位表示
(6)颜色模型的三基色表示
三基色原理:一幅图像中的任何色彩,都可用红绿蓝(RGB)三种颜色光按不同比例配置而成;或者,绝大多数颜色可分解成红、绿、蓝三种基色光三基色混合配置方法:①相加混色:由发光体发出的颜色光合成而产生各种彩色;其三基色是三种加型色彩(R、G、B),形成RGB彩色模型红色+绿色=黄色(Y)红色+蓝色=品红(M)绿色+蓝色=青色(C)红色+绿色+蓝色=白色(W)称黄、紫、青为二次色,分别是蓝、绿、红的三补色
②相减混色:从白色光中吸收某些成分而得到各种彩色;其三基色是三种减型色彩(C,M,Y),形成CMYK彩色模型白色-红色=青色(C)白色-绿色=紫色(M)白色-蓝色=黄色(Y)白色-蓝色-绿色-红色=黑色(K)单色光的亮度:白光—
绿光—
红光—
蓝光(递减序)
三基色的选择与适用场合:与特定应用有关
RGB模型:计算机显示器,彩色电视,摄像/显像
CMYK模型:印刷品,打印,幻灯片,彩色电影,绘画颜料画家绘画的三基色:黄,蓝,红2.2.2图像的数字化方法
图像数字化:对模拟图像f(x,y)的空间和亮度进行采样和量化
1.采样处理采样:将(x,y)上模拟图像f(x,y)的连续亮度或颜色信息,转化为有限序列的离散数值(样本点)表示
——
二维空间连续坐标(x,y)的离散化具体作法:对于连续图像f(x,y)的画面空间(x,y),沿x方向以等间隔Δx进行垂直分割,获得的采样点数为N;沿y方向以等间隔Δy进行水平分割,获取的采样点数为M;得到由M×N个微小区域组成的离散样本阵列[f(xi,yj)],从而把整幅图像表示成M×N个像素构成的离散点的集合
M×N个像素—
图像分辨率
采样定理:若采样频率f(Δx,Δy)≥2fΔ(x,y)时,可保证由离散图像数据无失真地重建原图像;
典型采样值:①汉字的点阵:16×16~256×256②电视图像点阵:(500~700)×480
采样方法:目前存在两种方法①一维采样:用等距离的行来分割一幅图像;再用逐行扫描方式把二维图像转化为一维随时间变化的信号逐行扫描:一行分成若干点,以完成水平方向上的采样;一幅图像分成若干行,以完成垂直方向的采样②二维采样:光电转换功能+采样功能
a.用M×N个光敏元件构成的摄像器来完成M×N个样本点的采样
b.用时钟脉冲模拟扫描顺序,逐一从光敏元件中取出采样信号
2.量化处理
量化:将亮度(或颜色)的取值空间划分成若干个子区间,同一子区间的不同亮度值用某一确定值代替;
使得取值空间离散化为有限个数值
——f(x,y)亮度B(灰度G,颜色C)的离散化
B=2n;n为量化级(离散子区间个数)例:对于灰度图像,灰度级G=2n;n≤8
对于彩色图像,彩色级C=2n;n≥8
量化字长:亮度值所取的二进制位数;决定量化级数和精度
小结:①采样/离散后的信号称脉冲幅度调制(PAM)信号②均匀量化后的信号称脉冲编码调制(PCM)信号③恰当选取采样间隔以限制量化误差,减小重现失真2.2.3常用图像处理方法
主要算法:点处理,区域处理,帧处理,几何变换算法
1.点处理算法基本思想:用逐点扫描方式,生成各像素的变换处理;不改变空间关系原像素点(值,位置)
变换规则
新像素点(值,位置)主要功能:适用于由像素值直接表示图像亮度值的应用①亮度分布统计:采用直方图表示图像总亮度和对比度,以及像素值的动态范围;作为调整对比度的依据②亮度调整:用像素亮度B及调节系数b的变换式来实现
B=B+b若b>0,则亮度增强;若b<0,则亮度减弱③亮度反置:使亮部变暗,暗部变亮.即B=Bmax-B
2.区处理算法
基本思想:对成组的一块像素(称邻域)采用某种变换算法或设备进行变换处理,以得到所处理像素点的新值
取待处理像素点为中心的邻域
新像素点值主要算法:①卷积(∑邻域内像素值×卷积系数→邻域中心像素新值)②低通滤波(保留图像的低频成分,减少高频成分)③高通滤波(增强图像的高频成分,不改变低频成分)④中值滤波(消除图像中的随机噪声)⑤边缘增强(拉普拉斯法,平移和差分法,梯度方向法)⑥模糊处理(去除高频噪声,使图像更平滑)
3.帧处理算法
基本思想:由两幅(或多幅)输入图像及其合成函数,生成一幅新图像——
对整幅图像(帧)进行处理生成算法:①与运算(用于屏蔽图像的部分区域)②或运算(用于图象套叠)③异或运算(用于检测特定的像素值)④叠加/相减合成运算(两图像对应像素值的加/减)⑤乘/除合成运算(对遥感图像进行处理,以获得特殊效果)⑥覆盖合成运算(将输入图像复制到目的图像上)⑦最大值/最小值合成运算(输出图像的像素赋值)⑧平均运算(将两图像对应像素值取平均后赋给输出图像)4.几何变换处理
基本思想:通过各种几何变换算法,改变源图像与目的图像的像素之间的空间映射关系基本算法:三维空间中,点变换的齐次变换矩阵的一般形式为讨论:①块Ⅰ的作用:放大,缩小,反射,剪切,旋转②块II的作用:平移变换
③块III的作用:投影变换④块IV的作用:比例变换.[s]为变换的比例系数;三阶行列式对角元a、e、i相当于比例因子Sx,Sy,Sz2.2.4图像文件格式
1.常用图像文件类型
图像文件的主要信息:尺寸,颜色,结构,压缩编码方式8种常用图像文件格式:①BMP文件:WindowsBitmap图像的标准格式②DIB文件:Windows中通用的设备无关位图文件格式③PCX文件:Zsoft公司的PCPaintbrush文件格式④TIF文件:Windows中通用的标记图像文件格式⑤GIF文件:CompuServe公司的图形交换格式文件⑥TGA文件:TrueVision公司的TARGA视频卡文件格式⑦EPS文件:压缩式邮件脚本的打印文件⑧JPG文件:JPEG文件交换格式,适用于图像压缩2.3视频处理技术
视频(video):亦称活动图像.其构成原理可描述为视频=帧画面+伴音+交插/同步/播放技术视频分类:①模拟视频:电视视频②数字视频:计算机视频(视频卡:数字化,压缩编码)
2.3.1数字视频处理方法
1.视频数字化内涵:将模拟视频信号经A/D转换和彩色空间变换,转化为计算机可处理的数字信号;以供编辑、存储、传输和播放
——
通过视频卡和视频I/O设备完成
(1)视频信号的获取方法
视频信号源通过视频输入设备产生①模拟视频输入
a.摄像机;输入活动图像
b.录像机:输入各种制式的电视视频信号
c.数字化仪:把电视信号数字化后存放在视频卡中②数字视频输入
a.数字扫描仪:输入静止图像
b.数字摄像机:输入活动图像
c.视盘机:输入VCD等视频文件视频源:a.内源视频—
由视频卡生成
b.外源视频—
可通过摄像机接入(2)视频采样/量化过程
需采用专用的视频输入卡.视频输入卡的分类与作用:①捕获模拟视频输入信号,进行采样/量化处理(捕获卡)②对不同视频源信号进行叠加处理和制式变换(叠加卡)③对视频图像进行帧缓存控制,以改变时间特性④提供视频显示输出及同步控制功能⑤提供实时动态捕获、编辑和数据压缩功能(压缩卡)
采样策略:对应于三种采样功能级别①单帧采样:从视频源获取一幅幅静图;再用软件压缩和存储②连续帧采样:从视频源动态获取连续图像;生成可存储文件③连续帧采压:动态捕获视频源,进行采样、叠加和压缩处理然后生成AVI文件,存入硬盘
视频数字化实现原理:视频源——A/D转换(视频输入卡)——
视频显示
2.视频压缩与解压
压缩编码:将数字化视频经过压缩编码变成电视信号,以录制到光盘中或在电视上播放压缩/解压实现方法:①硬件压缩:将压缩算法集成在视频I/O卡上
a.视频输入卡:包括捕获卡、叠加卡和压缩卡
b.视频输出卡:包括数字电视卡和视频解压卡数字电视卡:可使计算机成为全频道全制式的数字电视视频解压卡:核心是MPEG卡,支持MPEG1和MPEG2标准
作用区间:视频显示—D/A转换(输出卡)—
视频播放②软件压缩:对视频采样得到的样本,用软件压缩算法实现常用压缩软件如:VideoforWindows的MicrosoftVideo12.3.2视频彩色空间变换
1.彩色空间表示
①RGB彩色空间:基于红、绿、蓝三基色的颜色模型②HSI彩色空间:基于亮度、色调和饱和度描述的光谱模型
⑴HSI模型的基本概念①色调H:光波呈现的颜色种类;如红、绿、蓝、青、紫、黄②饱和度S:颜色的深浅程度(浓度、纯度);如深蓝、淡绿③光强I:亦称亮度;人的视觉所感受到的色彩明暗程度④色度:色调与饱和度的通称;表示光颜色的类别与深浅程度⑤色差:色度信号在通频带上分解表示的一对相减信号
HSI彩色模型的三个特征参量:色调,饱和度,亮度
⑵电视视频的彩色空间表示
采用亮度和色度来分解信号;并将其能量分布在通频带上为了能用单一频率的幅载波传送色度信号,通常将色度分解成两个垂直的色差信号;并与亮度形成矢量变换关系依据亮度与色差的信号叠加与合成关系,可以定义:
·NTSC制彩色空间(YIQ彩色空间)
·PAL制彩色空间(YUV彩色空间)
2.YIQ彩色空间
设:y为亮度;I与Q为一对色差,且采用蓝(B)与红(R)作为色差信号.则:色度C可表示为其中:ω为幅载波的角频率,θ为色差变角即相位角,
C为色度幅值
根据NTSC制式的电视信号同步检波器,检测出两个信号值
B-y和R-y,可建立亮度y与R、G、B三基色的关系;并推得常用的亮度公式:
y=0.299R+0.587G+0.114B
上述比例系数称“可见度系数”,其和为1
三个色差信号(B–y,R–y,G-y)中有两个是独立的,最后一个可用亮度方程和两个色差信号通过运算得到计算表达式为:
y=0.3R+0.59G+0.11BB–y=-0.3R-0.59G+0.89BR–y=0.7R-0.59G-0.11B
然后,对B–y和R–y的幅度按比例压缩,以使彩色与黑白兼容;缩小后的两个色差信号分别称I和Q.则
3.YUV彩色空间
PAL彩电制式中,为了克服NTSC制的相位敏感性缺点,采用了相序倒换方法,以通过平均抵消两信号间的误差设:y为亮度,U和V为色差则,YUV模型与YIQ模型的关系是两者的区别是:色度矢量图中的位置不同;(Q,I)为互相正交的坐标轴,它与(U,V)正交轴之间有33°夹角
据此,可推出YUV与RGB的转换关系:
YUV彩色空间的优点:①亮度信号解决了彩色与黑白电视机的兼容问题;可传送细节信息②色度信号可用于大面积着色
4.HSI与RGB彩色空间的转换
彩色图像可从RGB彩色空间转换到HSI彩色空间.计算公式:
5.彩色空间的带宽和采样格式⑴带宽表示①NTSC制:亮度Y的带宽为4.43MHz
色差I的带宽为1.3~1.5MHz
Q的带宽为0.5MHz②PAL制:亮度Y的带宽为4.43MHz;色度C的带宽为1.3MHz
⑵视频采样格式(亮度:色度)
①(Y:U:V)=(4:1:1)格式:亮度Y的每个像素采样一次,色差分量(U,V)由4个像素平均因此,每输入4个像素就有4个亮度,一个U和V,共6个值②(Y:U:V)=(4:2:2)格式:用于PAL制每4个像素有4个亮度,2个U和V,共8个值这种格式,色度采样信号增强了一倍,即加大了彩色宽度,从而使数字化后的色彩、清晰度及稳定性明显改善③(Y:U:V)=(2:1:1)格式:最省内存的格式每2个像素一个亮度,每4个像素一个色差(U,V各一个)④(X:Y:Z)=(4:4:4)格式:用于(R:G:B)或(Y:U:V)模式每个像素采样一次,4个像素需12个值,且每个分量带宽一样2.3.3视频卡分析
1.视频卡工作原理(三大模块,见图)⑴视频输入与制式转换数据流①视频源信号选择(Video0,Video1,Video2)②输入控制(信号冻结/解冻,视频剪裁,信号缩放)③YUV数字信息⑵视窗控制及帧缓存数据流①基地址;②捕获地质;③视频信息⑶视频显示输出数据流①显示信号混合(视频/VGA输入;窗口剪辑,彩色调配)②显示控制(摇移,变焦,缩放)③彩色控制(亮度,色度,对比度)
2.视频卡主要功能(VideoBlaster产品)
•
支持NTSC、PAL、S_VHS和RGB视频格式标准
•
支持PCX、TIFF、BMP、MMP、GIF、JPEG和TGA等文件格式
•
支持Microsoft的数字化Video软件
•
提供三路视频信号采集和混叠(Overlay)功能
•
提供输入图像的缩放与裁剪功能
•
提供显示剪辑和显示摇移支持功能
•
提供亮度、色度和对比度控制功能
•
提供端口地址和IRQ选择
•
提供系统内存之外的帧缓存器VRAM
•
提供音响混频与伴音演播控制
•
提供JPEG和MPEG的压缩/解压功能第三章
数据压缩技术
多媒体应用普及的难题:巨量数据的存储和传输解决途径:①大容量的光盘存储技术(如:CD-ROM)②高速CPU/Cache/图形加速器—
芯片集成③宽带高速网络通信技术④
数据压缩技术(软件算法,专用芯片)
3.1数据压缩的基本原理压缩目的:①减少存储量,以节省存储开销②降低实时传输量,以提高数据传输效率③提取结构数据特征,以供模式识别与特征分析3.1.1数据压缩的可行性
1.数据压缩的必要性
①视频数据量:根据采样定理,对NTSC彩电信号进行数字化
Idate=(4+1.5+0.5)MHz×2×8bit/s=96Mbit/s②音频数据量:由实验得出,语音带宽为4KHz.数字化后
Adate=4KHz×2×8bit/s=64Kbit/s
可见,数字图像是数字音频数据量的1000倍以上③光盘存储能力:一张CD_ROM光盘的标准容量是650MB;由于每字节含2位校验位,即附加数据占25%,故光盘的视频存放量=650×8/(96×(1+0.25))=43sec
结论:即使拥有大容量的光盘存储设备和高速CPU的计算机,仍需采用数据压缩技术,使PC机能适应运动图像处理要求
2.数据的可压缩性
数据压缩的可能性:各种媒体数据内部存在冗余及相关性;可采用不同编码与解码算法以减弱相关性,达到压缩目的数据冗余类型:是有效采用各种压缩算法的基本依据
⑴空间冗余
①图像灰度或颜色等特性基本相同的视觉区域②编码符号序列中的码字冗余,称信息熵冗余例:像素点P(x,y)具有邻域强相关性—
空间冗余
⑵时间冗余
①相邻图幅间(帧间)或相邻音域间的重复与渐变部分②人眼视觉暂留特性导致感受与实际之间存在瞬间差异例:F1和F2间时域相关—
具有时间冗余
⑶其他冗余:结构冗余;知识冗余
小结:数据可压缩性可用数据D所携带的信息量I及其冗余特征来表示,即
I=D-du
其中,D为数据量,du为D中的数据冗余量3.1.2压缩模型的构成原理
1.数据压缩的基本思想
针对特定的数据冗余类型,采用合适的压缩编码方法;对压缩对象的样本空间合理进行样本点划分,建立以少代多或以局部代全体的数据变换关系;从而以最少的数码表示信源或信道信号,减少数据的按位贮存空间和位传输率⑴空间压缩:把相同视觉区(集合块)当作一个整体,以极少的信息量来表示⑵时间压缩:把连续帧间的重复部分或渐变过程中的相似部分当作一个整体,用极少的信息量(样本值)表示
2.压缩过程的框架构成
⑴编码过程:原始数据符号化;体现压缩算法及正变换(有内容信息→无内容的信号序列)①信源编码器:完成大多数压缩任务;可充当信号分析器
·
把输入数据量压缩到与存储器容量相适应的水平
·
把数据传输速率降低到传输介质所能支持的水平②信道编码器:侧重解决码制可靠性问题(传输可靠性)
·
把压缩的位流转译成既适应存储又适合传输的信号
·
降低信号调制/解调过程中的误码率⑵解码过程:码元恢复与信号合成;体现解压算法及逆变换(无内容的编码数据→有内容的还原数据)⑶对称/非对称压缩:压/解实时;压缩非实时,解压实时3.2数据压缩方法分类
3.2.1图像压缩编码分类
⑴信息熵编码:Huffman编码,行程编码,算术编码,LZW编码⑵预测编码:差分线性预测DPCM,自适应线性预测ADPCM,运动补偿帧间线性预测;非线性预测⑶变换编码:最优正交变换(KLT),离散傅立叶变换(DFT)离散余弦变换(DCT),WHT变换,wavelet变换⑷矢量量化编码:多段式,分离式,全搜索式⑸子带编码:分频带法,块切割法⑹模型编码(参数编码):结构编码,基于知识的编码,分析/识别合成编码,分形(Fractal)编码⑺混合编码:JPEG编码,MPEG编码,P×64编码3.3常用压缩编码方法
第一代编码技术:主要利用数据的统计冗余来达到压缩目的常用方法:信息熵编码,预测编码,变换编码;矢量量化编码
3.3.1信息熵编码
1.熵编码的基本原理信息熵:信源数据所携带的平均信息量设:信源X的符号集为Xi(i=1,2,…N),Xi出现的概率为P(Xi);等概率值的单位信息量为[-logP(X)].故信源X的熵定义为
这就是熵编码原理的数学依据:信源符号集的平均码长→S(X)
按熵值来定义信源符号集的最小平均码长,可得到理想编码方案
熵编码的基本思想:
根据信源符号出现的概率分布特性,用短码字表示出现概率大的信息,用长码字表示出现概率小的信息;从而减少符号序列中的冗余度,提高符号的平均信息量,达到数据压缩的目的
—
可变字长的统计编码方法
数据压缩标准中常用的熵编码方法:
·Huffman编码
·
算术编码
·
行程编码
2.Huffman编码方法
哈夫曼编码:无失真编码的优选算法;已用于JPEG标准的基本系统
⑴Huffman算法设计过程①统计信源符号出现的概率,以建立Huffman码表②把信源符号按概率递减排列,以建立Huffman树③沿H树自顶向下对每个符号节点的路径赋予二进制值,以生成符号编码④计算信源符号集的平均码长,以验证编码方案的合理性
⑵算法实现实例例:设有一组待编码符号{Xi|i=1,2,…8},其出现频度的统计值为
{15,10,8,6,6,2,2,1},试用Huffman算法进行编码
讨论:①求出信源符号集{Xi}中每个符号出现的概率P(Xi),
以建立初始Huffman码表.其中:
②根据P(Xi)计算值,按概率递减序把符号集{Xi}排列成一棵二叉树
a.设置各符号Xi的叶节点位置;自底向上计算两个最小概率项之和,作为新的复合项,且以中间节点表示其中,底层叶节点的概率值为左大右小
b.沿二叉树逐次计算两个最小概率项之和,并逐次归并成一个复合项,以作为中间节点;直至最后一项到达顶层的根节点
c.可以验证:根节点的概率值必为1;即
ΣP(Xi)=1
③沿Huffman树自顶向下生成码字
a.从根节点开始遍历树,按从左到右顺序依次给每个节点的路径赋予二进制代码(1,0)值
b.取出从根节点到每个叶节点的路径上的代码组合,得到该叶节点的码字;这就是信源符号Xi的编码结果
c.各信源符号的码字及码长Li可填列在Huffman码表中④计算信源符号集{Xi}的平均码长La,并以{Xi}的最小码长比较最小平均码长:比较验证:
⑶Huffman算法小结①适用场合:可用于非均匀概率分布的信源编码只要码表的信源概率以大量统计数据为基础,就能获得足够好的压缩效果注意点:对于均匀概率的信源,编码会产生定长码—
失效②实际Huffman树及编码不是唯一的,与信源初始条件和左右节点赋值{(0,1),(1,0)}的选择有关;
但任意策略的平均码长应相等,故压缩效率相同③在构建Huffman树时,若节点不能逐次依概率降序排列,则码字位长会过于参差不齐,致使硬件实现很不方便;同时,平均码长会增大,因而压缩率降低
3.行程编码方法
行程编码:适用于二值图像压缩,是传真编码的标准压缩方法用于灰度图像时,可作混合编码的一部分在JPEG编码中,用于处理DCT交流系数行程:具有相同灰度值的连续符号位串长度;或图像帧内相邻像素之间的相对距离
编码格式:沿某一特定方向进行扫描时,对含有连续多个相同值的像元序列,用一个代表值和一个连续位串长度值来代替.即(相同值的代表值N,连续位串的长度L)图像灰度行程可描述为:(像素的相同灰度值,像素元素的个数)
实例:把一幅两维图像划分成许多8×8子块时,每个子块B(i,j)便含有64个像元之间的灰度值分布情况;水平扫描后得到的行程为
编码结果:用13对(N,L)数值取代了64个像元的灰度值
以少代多思想:编码后,只要存储或传输两个数值(N,L),就可取代L个像元的相同灰度值N;从而代替大量邻域冗余
4.算术编码方法
算术编码:在JPEG扩展系统中,取代Huffman编码.优点:①可在不知信源概率情况下找到合适的编码算法—自适应模式②用在信源概率分布较均匀的场合;与Huffman编码形成互补③数据压缩效率高出Huffman编码约5%
⑴算术编码的基本原理基本思想:基于递归概率区间划分的二进制编码.具体过程:①把信源符号序列{Xi|i=1,2,…,n}发生的概率用实数区间[0,1]上的间隔(Xi的取值范围)来表示;②按符号概率大小来
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2027年婚前共同购车合同二篇
- 2027年煤矿工程承包合同二篇
- 合规转利润:降本增效全指南(2026)《GBT 36231.1-2018矿山机械 图形符号 第1部分:矿物开采设备》
- 缩聚磷酸盐生产工安全专项评优考核试卷含答案
- 制胚剖片工安全生产能力知识考核试卷含答案
- 硝酸铵中和工岗前环保竞赛考核试卷含答案
- 熔析炉工岗前安全素养考核试卷含答案
- 异丙醇装置操作工创新方法能力考核试卷含答案
- 钽铌压制成型工岗前实战考核试卷含答案
- 白酒制曲工岗中实操模拟考核试卷含答案
- 《中华传统文化民俗民风》 课件 -第1、2章-民俗、民凤
- DL∕T 651-2017 氢冷发电机氢气湿度技术要求
- 建筑中级职称《给水排水工程》历年考试真题题库(含答案)
- 工程量清单及招标控制价编制工作方案
- 2024年全国初中数学联赛试题及答案(修正版)
- 美容基础(美容美体专业)全套教学课件
- 跨境电商税务合规解决方案
- 电子元件焊接技术课件
- 《先进制造技术》课件(全套)
- 电子警察系统施工方案
- 西方园林史智慧树知到答案章节测试2023年内蒙古农业大学
评论
0/150
提交评论