版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第二章多媒体数据压缩技术第一页,共216页。2.1前言(数据压缩概述)数字化数据压缩数据压缩的途径数据压缩方法第二页,共216页。2.1.1数字化在多媒体技术中,绝大多数数字媒体是对模拟媒体进行适当处理而得到的,即所谓“数字化”数字化的好处A)数字化后处理更方便B)易于存储和远距离传输C)没有累积失真第三页,共216页。数字化过程数字化过程:连续信号离散信号,采样(时空)数字化过程包括三步骤采样量化编码第四页,共216页。数字化过程模拟信号采样量化00111001101数字信号(编码)第五页,共216页。采样采样(sampling)
通过某种频率的采样脉冲将模拟信息的值取出,变连续的模拟信号为离散信号采样定理:采样频率>=原始信号频率的2倍时,
采样信号才可以保真地恢复为原始信号(奈奎斯特理论,Nyquisttheory)第六页,共216页。不同采样点数对图像质量的影响(a)原始图像(256×256);(b)采样图像1(128×128);(c)采样图像2(64×64);(d)采样图像3(32×32);(e)采样图像4(16×16);(f)采样图像5(8×8)
第七页,共216页。量化量化(Quantization)
将采样样本的幅度按照量化级别决定其取值的过程。目的是将采样样本的幅度值离散化。
量化之前需要规定量化级,比如8级,16级等第八页,共216页。不同量化级别对图像质量的影响(a)原始图像(256色);(b)量化图像1(64色);(c)量化图像2(32色);(d)量化图像3(16色);(e)量化图像4(4色);(f)量化图像5(2色)
第九页,共216页。编码编码用相应位数的二进制代码表示量化后的采样样本的量级如果有N个量化级,那么对应的二进制位数就为log2N。当N=16,二进制需要4位经过编码之后,每个样本都表示为相应的二进制代码脉冲编码调制(PCM,PulseCodeModulation),完成模拟信号的数字化第十页,共216页。00010010001101000101011001111000100110101011第十一页,共216页。[0,1.5]分成15个区间,间隔长度0.1,形成16个量化级第十二页,共216页。数字化带来的问题——数据量巨大文本图像音频视频分辨率为1024×768,字符大小为8×8点阵,每个字符占用两个字节,则满屏字符的数据存储量为:(1024/8)×(768/8)×2Byte=24576Byte=24KB一幅1024×768分辨率的真彩色图像为例,其数据存储量为:1024×768×8×3bit=18874368bit=2.25MB。
高质量的音频(如CD音质),1分钟这样的声音数据的存储量为:44.1K×2Byte(16bit采样精度)×2(双声道)×60(秒)≈10.34MB1s的电视信号的数据量为:(4.2+1.5+0.5)M×2×8bit=12.4MB第十三页,共216页。多媒体数据数据量电话(20~3400Hz)8000样本数/秒×12比特/样本=96kbps宽带语音(50~7000Hz)16000样本数/秒×14比特/样本=224kbps宽带音频(20~20000Hz)44100样本数/秒×16比特/样本×2信道=1.412Mbps图像512×512像素色彩图像×24比特/像素=6.3M比特/图像视频640×480像素色彩图像×24比特/像素×30帧/秒=221Mbps高清晰度电视(HDTV)1280×720像素色彩图像×24比特/像素×60帧/秒=1.3Gbps第十四页,共216页。2.1.2数据压缩大容量存储问题实时传输问题数据压缩从目前计算机的软硬件发展水平及发展趋势来看,在将来很长的一段时间内,数字化的媒体数据以压缩形式存储和传输仍将是唯一的选择第十五页,共216页。数据压缩数据压缩“历史悠久”,已经发展了60多年,但直到20世纪80年代以后才不断涌现出适合各种应用场合的编码和压缩算法数据能够进行压缩的原因:1)数据中存在大量的冗余(相关性),如空间冗余、时间冗余、结构冗余、知识冗余及纹理统计冗余2)对于图像、音频和视频等,人的感知可容忍某些细节信息的丢失(失真)。(感知冗余)第十六页,共216页。数据压缩的条件统计冗余空间冗余和时间冗余反应了信号的统计特性,有时把这两种冗余称为统计冗余。它们也是多媒体数据处理中两种最主要的数据冗余重复数据可忽略数据第十七页,共216页。数据压缩的条件人类敏感度人类不敏感因素(颜色、亮度、细节等)颜色不敏感因素224颜色(16,777,216色)28颜色(256色)■44.1kHz/Stereo1.3MB■22.0kHz/Mono0.3MB■Stop音频不敏感因素(试听)第十八页,共216页。2.1.3数据压缩的途径数据压缩途径——消除冗余数据冗余的类型主要有空间冗余时间冗余结构冗余信息熵冗余视觉冗余听觉冗余知识冗余第十九页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余第二十页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余第二十一页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余第二十二页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余第二十三页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余10110001110010110001110001011010101010111100010111111010第二十四页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余224色28色第二十五页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余第二十六页,共216页。[1]空间冗余——规则物体的物理相关性[2]时间冗余——视频与动画画面间的相关性[3]统计冗余——具有空间冗余和时间冗余[6]视觉冗余——视觉、听觉敏感度和非线性感觉[7]知识冗余——凭借经验识别[4]结构冗余——规则纹理、相互重叠的结构表面[5]信息熵冗余——编码冗余,数据与携带的信息[8]其他冗余——上述7种以外的冗余声音频率文字组句色彩渐变主观意识::第二十七页,共216页。2.1.4数据压缩的方法数据压缩就是去掉信号数据的冗余性1948年Oliver提出脉冲编码调制(PCM)编码理论(PCM=PulseCodeModulation)根据解码后数据与原始数据是否完全一致,数据压缩方法划分为两类可逆编码(无失真编码,无损压缩)
解码数据与原始数据严格相同,压缩比大约在2:1到5:1之间,如Huffman编码、算术编码、行程长度编码等不可逆编码(有失真编码,有损压缩)
还原数据与原始数据存在一定的误差,但(视觉/听觉)效果一般可以接受,压缩比可以从几倍到上百倍来调节,如变换编码和预测编码等第二十八页,共216页。2.2常用数据压缩技术压缩和解压缩过程数据压缩分类预测编码变换编码信息熵编码第二十九页,共216页。2.2.1压缩和解压缩过程
数据压缩就是去掉信号数据的冗余性。数据压缩常常又称为数据信源编码,或简称为数据编码与此对应,数据压缩的逆过程称为数据解压缩,也称为数据信源解码,或简称为数据解码数据压缩的典型操作包括预准备、处理、量化和编码等过程第三十页,共216页。压缩和解压缩过程解压缩是压缩的逆过程具体的编码器和解码器以不同的方法构成在对称应用中(如对话应用),编码和解码代价应基本相同在非对称应用中(如DVD等视频应用),解码过程比编码过程耗费的代价要小,这种技术用于以下情形压缩的过程仅一次,采样的时间不限解压缩经常用到并需要迅速完成输入数据编码器(压缩)存储或网络传输解码器(解压缩)输出数据第三十一页,共216页。数据压缩系统组成第三十二页,共216页。2.2.2数据压缩分类预测编码利用空间中相邻数据的相关性来预测未来点的数据。如差分脉冲编码调制和自适应差分脉冲编码调制变换编码将图像时域信号变换到频域空间上处理。时域空间有强相关的信号,反映在频域上是某些特定的区域内能量常被集中在一起,从而实现压缩。如正交变换、离散余弦变换、离散付立叶变换和Walsh-Hadamard变换量化和矢量量化编码为了使整体量化失真最小,就必须依照统计的概率分布设计最优的量化器第三十三页,共216页。信息熵编码根据信息熵原理,让出现概率大的用短的码字表达,反之用长的码字表示。最常见的方法有Huffman编码、Shannon编码以及算术编码子带编码使用带通滤波器组将信号频带分割成若干个子频带,然后分别处理模型编码编码时首先将图像中边界、轮廓、纹理等结构特征找出来,保存这些参数信息。解码时根据结构和参数信息进行合成,恢复出原图像。具体方法有轮廓编码、域分割编码、分析合成编码、识别合成编码、基于知识的编码、分形编码等第三十四页,共216页。常用压缩编码方法分类
第三十五页,共216页。压缩算法的衡量标准衡量压缩算法的三个主要指标压缩比大算法简单,压缩/解压缩速度快,以满足实时性要求压缩损失少,失真小,即解压恢复的效果要好当三者不能兼得时,要综合考虑第三十六页,共216页。2.2.3预测编码线性预测-DPCM(差分脉冲编码调制)主要用于图像处理基本原理是基于图像中相邻像素之间具有较强的相关性。每个像素可根据已知的前几个像素来作预测。因此在预测编码中,编码和传输的并不是像素采样值本身,而是这个采样值的预测值与其实际值之间的差值非线性预测(不讨论)第三十七页,共216页。DPCM系统原理框图
预测器
量化器编码器解码器
预测器信道接收端输出XN’+++XNe’NXNeNe’NXN’++输入^XN^发送端+-第三十八页,共216页。2.2.4变换编码有损压缩编码,用于对统计冗余(图像数据)的压缩首先对时域上的信号进行函数运算,并变换到频域上,然后在频域上对变换后的信号进行编码。在频域上,信息是按照频谱的能量和频率分布进行排列的输入图像G经正交变换U变换到频域空间,像素之间相关性下降,能量集中在变换域中少数变换系数上,已经达到了数据压缩的效果第三十九页,共216页。变换编码对变换系数A中那些幅度大元素予以保留,其他数量多的幅度小的变换系数,全部当作零不予编码,再辅以非线性量化,进一步压缩图像数据由于量化器存在,量化后变换系数A′和A间必然存在量化误差,从而引起输入图像G和输出图像G′间存在误差。下页图中U′是U的逆变换
实际应用中采用一些准最佳变换如DCT,DFT和WHT等第四十页,共216页。变换编码原理框图变换量化编码器解码器逆变换信道输入发送端接收端输出GG’U’UA’A第四十一页,共216页。2.2.5信息熵编码又称为统计编码,它是根据信源符号出现概率的分布特性而进行的压缩编码基本思想:在信源符号和码字之间建立明确的一一对应关系,以便在恢复时能准确地再现原信号,同时要使平均码长或码率尽量小如Huffman编码、算术编码第四十二页,共216页。Huffman编码Huffman定理
在变长编码中,对出现概率大的信源符号赋于短码字,而对于出现概率小的信源符号赋于长码字。如果码字长度严格按照所对应符号出现概率大小逆序排列,则编码结果平均码字长度一定小于任何其他排列方式Huffman定理是Huffman编码的理论基础
第四十三页,共216页。Huffman编码步骤①初始化,根据符号概率的大小,按由大到小顺序对符号进行排序②把概率最小的两个符号组成一个新符号(节点),即新符号的概率等于这两个符号概率之和③重复第2步,直到形成一个符号为止,其概率等于1④从编码树的根开始回溯到原始的符号,从上到下标上“0”或“1”。通常左分支标为0,右分支标为1⑤从根节点开始顺着树枝到每个叶子写出每个符号的代码第四十四页,共216页。Huffman编码举例信源A的符号及其概率Aa1a2a3a4a5a6a7a8P(A)0.200.190.180.170.150.100.0050.005编码过程:a10.20a20.19a30.18a40.17a50.15a60.10a70.005a80.005100.01100.11100.26100.35100.39100.61101编码结果:010011111010110011000110000第四十五页,共216页。Huffman编码举例55433322码长w8=10000w7=10001w6=1001w5=101w4=110w3=111w2=00w1=01码字(Wi)a8a7a6a5a4a3a2a1符号编码结果:平均码长:第四十六页,共216页。Huffman编码举例如果上表中,首次对缩减信源最后两个概率最小的符号用码符号标记为0,1时,也可反过来标记为1,0,则可得到另一组霍夫曼码:w7w801w60101w5w3w40101w1w20101注意:上述过程的等价编码树第四十七页,共216页。算术编码编码步骤①编码器在开始时将“当前间隔”设置为[0,1)②根据信源符号的概率,将“当前间隔”分为子间隔,每个符号一个子间隔,子间隔大小为信源符号的概率③根据信源符号序列,编码器选择子间隔对应于下一个符号,并使它成为新的“当前间隔”,编码将“当前间隔”分为子间隔,子间隔的大小与下一个符号的概率成比例④重复步骤③,直到符号序列的最后一位,消息的编码输出可以是最后一个间隔中的任意数第四十八页,共216页。算术编码编码举例信源符号,概率和初始编码间隔符号ABCD概率0.10.40.20.3初始编码间隔[0,0.1)[0.1,0.5)[0.5,0.7)[0.7,1]如果二进制消息序列的输入为CADACDB,则编码过程为:信源符号111001000.5C输入01A0.70.520.5D0.520.514A0.51460.514C0.514420.5143D0.514420.5143840.5144020.5143876B输出为期间任意数第四十九页,共216页。算术编码编码过程说明步骤输入符号编码间隔编码判决1C[0.5,0.7]符号的间隔范围[0.5,0.7]2A[0.5,0.52][0.5,0.7]间隔的第1个1/103D[0.514,0.52][0.5,0.52]间隔的最后3个1/104A[0.514,0.5146][0.514,0.52]间隔的第1个1/105C[0.5143,0.51442][0.514,0.5146]间隔从第5个1/10开始的2个1/106D[0.514384,0.51442][0.5143,0.51442]间隔的最后3个1/107B[0.5143876,0.514402][0.514384,0.51442]间隔从第1个1/10开始的4个1/108从[0.5143876,0.514402]中选择一个数作为输出:0.5143876第五十页,共216页。算术编码解码过程步骤间隔译码符号译码判决1[0.5,0.7]C0.51439在间隔[0.5,0.7)2[0.5,0.52]A0.51439在间隔[0.5,0.7)的第1个1/103[0.514,0.52]D0.51439在间隔[0.5,0.52)的第7个1/104[0.514,0.5146]A0.51439在间隔[0.514,0.52]的第1个1/105[0.5143,0.51442]C0.51439在间隔[0.514,0.5146]的第5个1/106[0.514384,0.51442]D0.51439在间隔[0.5143,0.51442]的第7个1/107[0.51439,0.5143948]B0.51439在间隔[0.51439,0.5143948]的第1个1/108译码的消息:CADACDB第五十一页,共216页。2.3数字图像编码技术颜色空间及其变换数字图像文件格式多媒体数据的转换第五十二页,共216页。2.3.1彩色空间及其变换颜色——视觉系统对可见光的感知结果人的视网膜有对红、绿、蓝颜色敏感程度不一样的三种锥体细胞自然界中任何一种颜色都可以由RGB这3种颜色值之和来确定,构成一个三维的RGB矢量空间,由此形成一个RGB彩色空间。彩色模型(颜色模式,彩色空间)
——用简单方法描述所有颜色的一套规则和定义第五十三页,共216页。电磁波谱
可见光谱
第五十四页,共216页。彩色模型常见模型:
RGB彩色模型HIS彩色模型YUV彩色模型YIQ彩色模型CMYK彩色模型第五十五页,共216页。RGB颜色模型颜色模型用来描述人们能感知的和处理的颜色RGB颜色模型是颜色最基本的表示模型,也是计算机系统彩色显示器采用的颜色模型。其中,R,G,B分别代表红(Red)、绿(Green)、蓝(Blue)三色。RGB颜色模型通常用单位立方体来表示第五十六页,共216页。RGB颜色模型RGB模型也称为加色模型,各种颜色由不同比例红、绿、蓝3种基本色的叠加而成。任意颜色F的配色方程为:F=r[R]+g[G]+b[G]式子中r[R]、g[G]、b[G]为F色的三色分量如果r[R]、g[G]、b[G]三个分量各占一个字节(8位),这样共可表示224=16777216种颜色第五十七页,共216页。RGB颜色模型RGB三基色叠加效果第五十八页,共216页。HSI颜色模型用H(Hue,色调)、S(Saturation,饱和度)、I(Intensity,光强度)表示一种颜色一种直观的颜色模型,更适合人的视觉特性HSI(HSL)RGB第五十九页,共216页。
在饱和的彩色光中增加白光的成分,相当于增加光能,因而变得更亮,但是它的饱和度却降低了。若增加黑色光的成分,相当于降低光能,因而变得更暗,其饱和度也降低了照射的光越强,反射光也越强,看起来越亮。显然,如果彩色光的强度降到使人看不到了,在亮度标尺上它应与黑色对应。同样,如果其强度变得很大,那么亮度等级应与白色对应。亮度是非彩色属性,彩色图像中的亮度对应于黑白图像中的灰度
同一物体因受光不同会产生亮度上的变化
第六十页,共216页。YUV颜色模型由广播电视需求的推动而开发的彩色空间,主要目的是为了压缩色度信息以便有效的播送彩色电视图像Y为亮度信号,U、V是色差信号(B-Y,R-Y)
U和V构成彩色的两个分量PAL模拟彩色电视采用的彩色空间优点是亮度和色差信号分离,容易使彩色电视系统与黑白电视信号兼容第六十一页,共216页。变换公式Y=0.299*R+0.587*G+0.114*BU=-0.169*R-0.332*G+0.500*BV=0.500*R+0.419*G-0.081*B第六十二页,共216页。YIQ颜色模型NTSC制式的模拟彩色电视采用的彩色空间Y是亮度,I和Q是两个彩色分量,共同描述图像的色调和饱和度亮度与色差分离,可以更有效的压缩图像的数据量变换公式(YIQ<--->RGB)
Y=0.299*R+0.587*G+0.114*BI=0.211*R-0.523*G+0.312*BQ=0.596*R-0.275*G-0.322*B第六十三页,共216页。CMYK颜色模型CMYK模型以打印在纸上的油墨的光线吸收特性为基础当白光照射到半透明油墨上时,色谱中的一部分被吸收,而另一部分被反射回眼睛。哪些光波反射到眼睛中,决定了人们能感知的颜色第六十四页,共216页。红光显红色是因为...第六十五页,共216页。绿光显绿色是因为…第六十六页,共216页。CMYK颜色模型CMYK模型中也定义了颜料的三种基本颜色——青色(Cyan)、品红(Magenta)和黄色(Yellow)。理论上,任何一种颜色都可以用这三种基本颜料按一定比例混合得到由于所有打印油墨都包含一些杂质,因此这三种油墨实际生成土灰色,必须与黑色(K)油墨合成才能生成真正的黑色第六十七页,共216页。CMYK颜色模型用于印刷分色胶片印版印辊成品印纸第六十八页,共216页。CMYK颜色模型与RGB模型相对,CMYK模型被称为减色模型理论上,在相减混色中等量黄色(Y)和品红(M)相减而青色(C)为0时,得到红色(R)等量青色(C)和品红(M)相减而黄色(Y)为0时,得到蓝色(B)等量黄色(Y)和青色(C)相减而品红(M)为0时,得到绿色(G)100%的三种基本颜料合成将吸收所有颜色而生成黑色第六十九页,共216页。相加色和相减色之间成对出现,称为互补色相加混色相减混色生成的颜色RGBCMY000111黑001110蓝010101绿011100青100011红101010品红110001黄111000白第七十页,共216页。2.3.2数字图像文件格式图像文件——存放图像数据常见的图像文件格式有BMPTIFPCXGIFJPEGPNGTGA…….
./Dev/Format/第七十一页,共216页。PCX格式文件头图像数据调色板数据在MS-DOS环境中常见的图像文件格式由Zsoft公司开发使用行程编码的方法进行压缩占用少量存储空间,以牺牲时间为代价第七十二页,共216页。BMP格式文件头(文件头和信息头)色彩表(反向排列)图像数据由Microsoft公司为Windows开发能应付高速度的操作要求与设备无关可以是2色、16色、256色或16777216色第七十三页,共216页。TIFF格式文件头标志信息区图像数据支持的色彩数最高可达16M种存储的图像质量高,占用的存储空间大细微层次信息多,利原稿阶调与色彩复制独立于操作平台和软件常用于印刷第七十四页,共216页。GIF格式文件头逻辑屏幕描述调色板信息图像数据结束标志具有87a和89a两种格式87a——描述单一(静止)图像89a——描述多帧图像采用LZW压缩算法最多处理256种色彩,不能存储真彩色图像支持65535×65535分辨率第七十五页,共216页。GIF格式第七十六页,共216页。JPEG格式经压缩的图像数据各类压缩算法可以达到30:1的压缩比属于有损压缩支持全彩(24位、色)图像第七十七页,共216页。PNG格式文件头数据块采用lz77压缩算法可以是灰阶的、彩色的或8位的索引色显示速度快,只需要下载1/64的图像信息就可以显示出低分辨率的预览图像不支持动画常用于网络(预览)第七十八页,共216页。TGA格式文件头调色板信息图像数据数据补充区由美国Truevision公司开发结构比较简单计算机生成图像向电视转换的首选格式常用于专业动画影视第七十九页,共216页。A4幅面(横)24bit彩色300dpi分辨率.JPG883KB损失15%色重复保存,损失加剧.GIF4,501KB256色格式转换容易失真.BMP25,481KB真彩色●
数据量大.TGA25,481KB真彩色●
数据量大.PCD25,481KB真彩色●
数据量大.TIF25,697KB真彩色●
数据量大数据对比第八十页,共216页。2.3多媒体数据转换为了交流不同类型媒体信息需要进行转换媒体之间的转换是人们关心的内容之一有些媒体之间的转换是非常困难的事情,需要研究人类本身对各种媒体理解原理和解释过程有些媒体之间的转换则相对容易,几乎不用做什么工作第八十一页,共216页。部分媒体的转换关系转换位图图像图形语音音乐文本视频数值位图图像-*映射??*映射*冻结?图形***轮廓或理解-*波形*乐谱**矢量化?*可视化语音??-*波形**语音合成?*合成音乐??***识别-*音乐合成??文本***文字识别**识别**语音识别*转换-?*符号化视频**序列化**序列化???-?数值?**计算***识别?*转换?-第八十二页,共216页。我的芯片能闻味:西门子微型芯片气味传感器.2004年09月18日
16:31驱动之家
近日,西门子的科研工作者们成功研制出一种
全新构造的微型芯片传感器,它可以辨别气体与其味道。据称,此种微型芯片将被应用与多种领域,例如检测空气中臭氧含量,监测火灾以及气体泄漏。一个非常实用的应用便是作为旅行者的一种便携预警设备,即便在睡袋中也能知晓外界风云动向。
此款芯片拥有体积小,成本低以及超低功耗等诸多优点,可以在100毫瓦至1毫瓦功率下保持运作。相信不久以后,此款芯片将嵌入多种便携设备为我们提供周到保护。
当然,至于它是否能够辨别出红烧肉和北京烤鸭的独特香气,则不得而知了。第八十三页,共216页。2.4静态图像压缩标准JPEGJPEG算法概要基于DCT的无失真编码基于DCT的有失真编码基于DCT的累进操作方式编码基于DCT的分层操作编码JPEG2000简介第八十四页,共216页。2.4.1JPEG标准概要JPEG(JointPhotographicExpertsGroup)ISO/IEC10918号标准“多灰度连续色调静态图像压缩编码”,即JPEG标准(国际标准)一个适用范围很广的静态图像数据压缩标准,既可用于灰度图像又可用于彩色图像JPEG算法与彩色空间无关,处理的彩色图像是单独的彩色分量图像JPEG有两种基本的压缩算法以DCT为基础的有损压缩算法(DCT方式)以二维空间DPCM为基础的无损压缩算法(空间方式)第八十五页,共216页。顺序DCT(基线)无损渐进DCT分层(1)基于DCT的顺序模式(SequentialDCT-based)(2)基于DCT的渐进模式(ProgressiveDCT-based)(3)无损(Lossless)模式(4)分层(Hierarchical)模式JPEG标准的四种工作模式第八十六页,共216页。2.4.2基于DPCM的无失真编码基于DPCM的无失真编码优点是硬件易实现,重建图像质量好缺点是压缩比太低,大约为2:1预测器
图像数据
熵编码器
码表说明
解码器
压缩图像数据
无失真编码器还原图像数据
第八十七页,共216页。2.4.3基于DCT的有失真压缩编码DCT先将整体图像分成N×N像素块,然后对N×N像素块逐一进行DCT变换由于大多数图像的高频分量较小,相应于图像高频成分的系数经常为零,加上人眼对高频成分的失真不太敏感,所以可用更粗的量化第八十八页,共216页。基于DCT的有失真压缩编码基本系统
顺序工作方式,采用Huffman编码,只存储两套码表增强系统
含累进工作方式和分层工作方式,可选Huffman或算术编码编码过程使用正向离散余弦变换(forwarddiscretecosinetransform,FDCT)把空间域表示的图变换成频率域表示的图使用加权函数对DCT系数进行量化,这个加权函数对于人的视觉系统是最佳的使用Huffman或算术编码对量化系数进行熵编码第八十九页,共216页。FDCT熵编码器量化表有失真编码器源图像数据压缩图像数据量化器编码表88块熵解码器IDCT编码表解码器逆量化器量化表88块压缩图像数据恢复的图像数据JPEG编解码框图第九十页,共216页。主要计算步骤1.正向离散余弦变换(FDCT)
用较少的比特数得到较好品质的恢复图像2.量化(quantization)
YUV模型,Y细分,适当降低U、V数据量3.Z字形编码(zigzagscan)4.使用差分脉冲编码调制(DPCM)对直流系数
(DC)进行编码5.使用行程长度编码(RLE)对交流系数(AC)进行编码6.熵编码(entropycoding)
哈夫曼编码或算术编码最后,把各种标记代码和编码后的图像数据按照一定的格式组成JPEG位流(JPEGbitstream)第九十一页,共216页。量化——YUV模型第九十二页,共216页。Z形扫描第九十三页,共216页。行程编码第九十四页,共216页。第九十五页,共216页。举例彩色图像像素645×600在计算机中存储为3个矩阵每个矩阵为645×600各存储R、G、B的3个分量信息第九十六页,共216页。保留低频部分和重构的图原图高频部分舍弃后重构图变换图第九十七页,共216页。增大高频部分的舍弃范围(1)只保留部分258×240
(258×240)数据量是原图的16%
重构后的图像第九十八页,共216页。只保留部分130×120数据量是原图的4%(130×120)重构后的图像增大高频部分的舍弃范围(2)第九十九页,共216页。只保留部分65×60
数据量是原图的1%(65×60)重构后的图像
增大高频部分的舍弃范围(3)第一百页,共216页。将矩阵A的前15行和列置为0重构后的图像
对低频部分的细小修改都会对图像有很大的影响去掉少量低频部分对图像的影响第一百零一页,共216页。JPEG压缩效果评价压缩效果(比特/像素)质量0.25~0.50中~好0.50~0.75好~很好0.75~1.5极好1.2~2.0与原始图像分不出来(原始图像每像素8位)第一百零二页,共216页。2.4.4基于DCT的渐进操作方式编码顺序方式每个图像分量的编码一次扫描完成渐进方式图像分量编码要经过多次扫描才完成第一次扫描只进行一次粗糙的压缩,以相对于总的传输时间快得多的时间传输粗糙图像,并重建一帧质量较低的可识别图像;在随后的扫描中再对图像作较细的压缩,这时只传递增加的信息,可重建一幅质量提高一些的图像。这样不断累进,直到满意的图像为止第一百零三页,共216页。(A)顺序显示(B)渐进显示顺序和渐进显示比较第一百零四页,共216页。2.4.5基于DCT的分层操作方式分层方式是对一幅原始图像的空间分辨率进行变换,水平和垂直分辨率以2倍因子下降,分层后再编码(1)把原始图像空间分辨率降低(2)对已降低分辨率的图像采用任一种JPEG编码方法进行编码(3)对低分辨率的图像解码,然后插值恢复图像的水平和垂直分辨率(4)把分辨率已升高的图像作为原始图像的预测值,对它们的差值采用基于DCT的编码(5)重复(3)、(4)直到图像达到完整的分辨率编码第一百零五页,共216页。JPG分层方式第一百零六页,共216页。2.4.6JPEG2000简介2000年12月公布JPEG2000标准(ISO15444),其目标是在高压缩率的情况下,如何保证图像传输的质量JPEG2000与JPEG的区别采用了以小波变换为主的多分辨率编码方式统一了面向静态图像和二值图像的编码方式既支持低比率压缩又支持高比率压缩第一百零七页,共216页。JPEG2000的主要特点
高压缩率
和JPEG相比,压缩率相同时,信噪比将提高30%左右无损压缩(集成了)渐进传输(渐现特性)感兴趣区域压缩纠错能力强可以指定最后文件的大小……第一百零八页,共216页。JPEG与JPEG2000的性能比较标准JPEGJPEG2000主要编码技术离散余弦变换(DCT)
知觉量化
Zigzag扫描
霍夫曼编码
算术编码离散小波变化(DWT)
EBCOT核心算法
ROI编码
空间可扩展编码
质量可扩展编码
面向对象编码
位图形状编码
容错编码、TCQ、零数扫描压缩比2~302~50算法效率30:1以上急剧下降100:1以上急剧衰减速率失真特性比JPEG提高30%应用场合Internet
数字照相
图像视频编辑Internet
数字照相
数字图书馆
电子商务
打印、扫描、传真、遥感第一百零九页,共216页。2.5运动图像压缩编码标准MPEGMPEG简介MPEG-1标准介绍MPEG-2标准介绍MPEG-4标准介绍第一百一十页,共216页。2.5.1MPEG简介MPEG(MovingPictureExpertGroup)是在1988年由国际标准化组织(InternationalOrganizationforStandardization,ISO)和国际电工委员会(InternationalElectrotechnicalCommission,IEC)联合成立的专家组开发电视图像数据和声音数据的编码、解码和它们的同步等标准开发的标准称为MPEG标准第一百一十一页,共216页。MPEG标准第一百一十二页,共216页。MPEG标准MPEG标准是一个面向运动图像压缩的标准系列,到目前为止,已经开发和正在开发的有:MPEG-1:数字电视标准,1992年正式发布MPEG-2:数字电视标准,1994年成为国际标准草案MPEG-3:已于1992年7月合并到高清晰度电视(High-DefinitionTV,HDTV)工作组MPEG-4:多媒体应用标准(1999年)MPEG-7:多媒体内容描述接口标准(2001年)MPEG-21:有关(网络)多媒体框架的概念(2001年9月通过技术报告)MPEG-A:多媒体应用格式标准(正在研究)第一百一十三页,共216页。MPEG标准MPEG-1和-2典型的编码参数第一百一十四页,共216页。2.5.2MPEG-1压缩标准名称:用于大约高达1.5Mbps速率的数字存储媒体的运动图像及其伴音编码(Codingofmovingpicturesandassociatedaudiofordigitalstoragemediaatuptoabout1.5Mbit/s)
简称MPEG-1,作为ISO/IEC11172号建议于1992年通过使用MPEG-1的压缩算法,可将一部120分钟长的电影压缩到1.2GB左右。广泛地应用于VCD制作第一百一十五页,共216页。MPEG-1编解码器原型第一百一十六页,共216页。MPEG-1音频压缩算法MPEG-1音频压缩算法是第一个高保真音频数据压缩标准,可以完全独立应用音频信号采样率:32KHz、44.1KHz或48KHz压缩后的比特流可以按4种模式之一支持单声道、双声道或联合立体声第一百一十七页,共216页。MPEG-1音频压缩算法MPEG-1音频标准提供3个独立的压缩层次,用户可在复杂性和压缩质量之间权衡选择层1最简单,编码速率384Kbps,主要用于DCC(数字盒式磁带)层2的复杂度中等,编码速率192Kbps左右,主要应用于数字广播、CD-ROM以及CD-I和VCD层3最为复杂,使用的比特率为64Kbps,尤其适用于ISDN上的音频传输MP3音乐是利用MPEGAudioLayer3的技术,声音采用1:10甚至1:12的压缩率第一百一十八页,共216页。MPEG-1音频的层次与压缩比Layer1(相当于384kbps立体声信号)4:1Layer2(相当于192~256kbps立体声信号)6:1~8:1Layer3(相当于112~154kbps立体声信号)10:1~12:1第一百一十九页,共216页。MPEG视频数据流的结构运动图像序列图片组图片图片切片宏块块8像素8像素MPEG-1数据体系结构(分层的结构)第一百二十页,共216页。MPEG视频数据流的结构运动序列(sequence)
定义图像大小,图像速率,希望的缓冲区大小和其他一些静态参数
图片组(GOP,GroupOfPictures)
传送序列中的一个连续的图像集,用来辅助随机存取图像(Picture)
图像头部定义图像类型(I,B或P图像)和图像的向量范围
片(Slice)通道有错时中断解压缩过程后的重新同步单元,由惟一的重新同步模式(开始代码)跟一组宏块组成第一百二十一页,共216页。Slice代码slice(){
slice-start-code32bslbf
quantizer-scale5uimsbf
while(nextbits()=='1'{
extra-bit-slice1"1"
extra_information_slice8
}
extra-bit-slice1"0"
do{
macroblock()
}while(nextbits()!='00000000000000000000000')
next-start-code()}第一百二十二页,共216页。MPEG视频数据流的结构宏块(Microblock)图像结构数据运动补偿单元,由一个16×16亮度区域和相应的两个8×8色度区域组成块(Block)基本数据变换单元,一个8×8的像素集合YUV8X88X8123456宏块的组成第一百二十三页,共216页。视频的表示MPEG要处理的视频由一系列亮度和色度的域或帧组成每帧有三个表示像素的矩形矩阵。一个为亮度(Y,黑和白),另两个为色度(Cr(U)和Cb(V),颜色的差异)第一百二十四页,共216页。MPEG-1视频压缩技术第一百二十五页,共216页。MPEG-1视频压缩技术主要问题:一方面帧内编码无法达到很高的压缩比,另一方面用单一的静止帧内编码方法能最好地满足随机存取的要求解决方法:对这两个方面做了折衷考虑。即采用运动补偿技术减少时间上的冗余
采用DCT技术减少空间上的冗余
(涉及到两个方面:帧间压缩和帧内压缩)第一百二十六页,共216页。在MPEG中将图像分为3种类型I图像
利用图像自身的相关性压缩,提供压缩数据流中的随机存取的点P图像
用最近的前一个I图像(或P图像)预测编码得到图像(前向预测)B图像
B图像在预测时,既可使用了前一个图像(I或P)作参照,也可使用下一个图像做参照或同时使用前后两个图像作为参照图像(双向预测)I=IntraPicture,P=PredictedPicture,B=BidirectionalPicture第一百二十七页,共216页。四种预测技术帧内编码前向预测后向预测双向预测第一百二十八页,共216页。图像帧间预测1I2B3B4B5P6B7B8B1I前向预测双向预测第一百二十九页,共216页。1秒参照帧间有2个B图像
每0.5秒1帧I图像123456789101112131415161718192021222324252627282930IBBPBBPBBPBBPBBIBBPBBPBBPBBPBB第一百三十页,共216页。+第一百三十一页,共216页。MPEG编码器需对上述图像重新排序,以便解码器高效工作,因为参照图像P必须先于B图像恢复之前恢复。上述1~7帧图像重排后图像组次序为:4213756IPBBPBB第一百三十二页,共216页。运动补偿技术运动补偿技术主要用于消除P图像和B图像在时间上的冗余性以提高压缩效率MPEG用的运动模型为块状平移,为简单起见,块取固定的大小16*16像素的亮度部分因为色度采样典型值为4:2:0,每个亮度部分包括一个与16*16图像亮度相关联的同一空间区域内8*8像素块亮度区域的16*16块和两个相应的色度区域8*8的块合称一个宏块第一百三十三页,共216页。运动补偿技术运动补偿包括从当前图像取一个宏块长,算出参考图像之间的空间差异,形成当前宏块的一个较好预测,差值称作运动向量运动补偿的机制就是用运动向量从参考图像解码出待预测的块,减去运动向量,差值作进一步压缩为宏块作预测的向量可直接应用于亮度预测器,但应用于色度预测器前,两个方向上要减半(依照采样的大小)第一百三十四页,共216页。运动补偿技术在MPEG方案中,运动补偿技术工作在宏块一级I图像没有预测B图像宏块有4种类型帧内宏块,简称I块前向预测宏块,简称F块后向预测宏块,简称B块平均宏块,简称A块对于P图像,其宏块只有I块和F块两种第一百三十五页,共216页。I块处理技术与I图像的一致,即DCT技术F块、B块和A块都采用基于块的运动补偿技术:F块预测时其参照为前一个I图像或P图像B块预测时其参照为后一个I图像或P图像对于A块预测其参照为前后两个I图像或P图像基于块的运动补偿技术,就是在其参照帧中寻找符合一定条件且与当前被预测块匹配最佳的块找到匹配块后,有两种处理方法:一是在恢复被预测块时,用匹配块代替二是对预测的误差采用DCT技术编码,在恢复被预测块时,用匹配块加上预测误差运动补偿技术第一百三十六页,共216页。第一百三十七页,共216页。MPEG-1视频系统第一百三十八页,共216页。2.5.3MPEG-2标准MPEG-2标准从1990年开始研究,1994发布标准编号:ISO/IEC13818标准名称:运动图像及其伴音信息的通用编码(Genericcodingofmovingpicturesandassociatedaudioinformation)整个标准包括10个部分,是一个直接与数字电视广播有关的高质量图像和声音编码标准MPEG-2可以说是MPEG-1的扩充,它们的基本编码算法都相同。但MPEG-2增加了许多MPEG-1所没有的功能第一百三十九页,共216页。MPEG-2标准MPEG-2利用网络提供的3~100Mbps的数据传输率,支持具有更高分辨率图像的压缩和更高的图像质量MPEG-2可支持交迭图像序列(每帧图像由两个场组成),支持可调节性编码,多种运动估计方式,提供一个较广的范围改变压缩比可以适应不同画面质量、存储容量和带宽的要求,为此不同的功能档次(profile),每个档次又分为不同的等级(level)第一百四十页,共216页。MPEG-2的5个档次简单型(Simple)基本型(Main)信噪比可调型(SNRScalable)空间可调型(SpatialScalable)增强型(High)第一百四十一页,共216页。MPEG-2的4个等级低级(Low)35228830,面向VCR并与MPEG-1兼容基本级(Main)72046030或72057625,面向视频广播信号高1440级(High-1440)1440108030或1440115225,面向HDTV高级(High)1920108030或1920115225,面向HDTV第一百四十二页,共216页。11种规范(为了向下兼容,满足各种需求)高级的基本型MP@HL高级的增强型HP@HL高-1440级的基本型MP@H1440高-1440级的空间可调型SSP@H1440高-1440级的的增强型HP@H1440基本级的简单型SP@ML基本级基本型MP@ML基本级的信噪比可调型SNP@ML基本级的增强型HP@ML低级的基本型MP@LL低级的信噪比可调型SNP@LL第一百四十三页,共216页。MPEG-2音频基本特性之一是向后与MPEG-1音频兼容。相同的编码器,层1、2、3的结构也相同做了扩充增加了采样频率,16k、22.05k、24k扩展了输出速率范围,8-640kbps增加了声道数,5.1和7.1通道环绕立体声支持线性PCM和DolbyAC-3编码定义了不兼容的MPEG-2AAC,非常灵活的声音感知编码第一百四十四页,共216页。MPEG-2音频5.1通道和7.1通道的环绕立体声5.1也称为“3/2-立体声加LFE”,其含义是播音现场前面可有3个喇叭通道(左、中、右),后面可有2个环绕声喇叭通道。LFE是低频音效的加强通道7.1通道环绕立体声与5.1类似,它另有中左、中右2个喇叭通道第一百四十五页,共216页。5.1通道和7.1通道环绕立体声第一百四十六页,共216页。MPEG-2采样第一百四十七页,共216页。MPEG-2编码方法MPEG-2的编码方法和MPEG-1主要区别:隔行扫描制式
DCT变换可在帧内,也可在场内。用户可自行选择,亦可自适应选择对细节多、运动部分少的图像在帧内进行DCT,而细节少、运动分量多的图像在场内进行DCTMPEG-2采用可调型和非可调型两种编码结构。还可以使用一个基本层加上多个增强型的多层编码结构,这由用户按质量和压缩比要求选择使用电视隔行、电脑显示器逐行WAY?第一百四十八页,共216页。MPEG-2亮度宏块结构以帧方式组织的数据从16x16块映射成8x8块以场方式组织的数据从16x16块映射成8x8块第一百四十九页,共216页。空间可调型MPEG-2编码器原理框图第一百五十页,共216页。MPEGMPEG编解码过程是一种非镜像对称算法解码无运动补偿MPEG-1和MPEG-2只规定了解码方案数字广播、DVD、收费电视、VOD、交互电视等都采用了MPEG-2MPEG-2可以将一部120分钟长的电影压缩到4~8GB(DVD质量),其音频编码可提供左中右及两个环绕声道、一个加重低音声道和多达7个伴音声道第一百五十一页,共216页。2.5.4MPEG-4标准MPEG-4标准名称为“甚低速率视听编码”(very-lowbitrateaudio-visualcoding)1998年11月公布第一版,1999年12月公布了第二版,共分为6个部分目标是低速率下(<64kbps)的视频、音频编码,更加注重多媒体系统的交互性和灵活性第一百五十二页,共216页。MPEG-4标准MPEG-4引入了视听对象(Audio-VisualObjects,AVO),使得更多的交互操作成为可能AVO可以是孤立的人,也可是这个人的语音或一段背景音乐等MPEG-4视频标准允许自然(基于像素)图像和视频与合成(计算机生成的)场景的混合编码例如,允许视频会议参加者的虚拟到场第一百五十三页,共216页。MPEG-4标准AVO具有高效编码、高效存储、高效传播以及可互操作的特性MPEG-4对AVO的操作主要有采用AVO来表示听觉、视觉或者视听组合内容组合已有AVO来生成复合的AVO,并生成视听场景对AVO的数据灵活地多路合成与同步,以便选择合适的网络来传输这些AVO数据允许接收端用户在视听场景中对AV对象进行交互操作等第一百五十四页,共216页。MPEG-4标准主要构成部分1)传输多媒体集成框架(DMIF)
一个会话协议,用来管理多媒体数据流,主要解决交互网络中、广播环境下以及光盘应用中多媒体应用的操作问题2)场景描述
描述场景中声音、视频对象间的关系,体现在两个层次:BIFS描述场景中对象的空间时间安排,观察者可以有与这些对象交互的可能性;在较低的层次上,对象描述子(OD)定义每个对象的基本流的关系,并提供访问基本流需要的URL地址、译码器的特性、知识产权等信息第一百五十五页,共216页。MPEG-4标准主要构成部分3)音频编码
MPEG-4将音频的合成编码和自然声音的编码相结合,支持音频的对象特征。支持MIDI和TTS4)视频编码
MPEG-4支持对自然和合成的视觉对象的编码。合成的视觉对象包括2D、3D动画和人面部表情动画等5)缓冲区管理和实时解码
MPEG-4定义了一个系统解码模式(SDM),该解码模式要求特殊的缓冲区和实时模式。通过有效地管理,可以更好地利用有限的缓冲区空间第一百五十六页,共216页。MPEG-4视频编码技术对每个视频对象的形状、运动和纹理信息编码,形成单独的视频对象如果只包括标准的矩形图像,则无需形状编码使用视频对象区(VideoObjectPlane,VOP)的概念。某一时刻某一画面中的VO构成一个VOPVOP编码的压缩算法是在MPEG-1和MPEG-2的基础上开发的定义了帧内VOP编码、帧间预测VOP编码、双向预测VOP编码第一百五十七页,共216页。MPEG-4视频编码器的算法方框图第一百五十八页,共216页。第一百五十九页,共216页。MPEG-4扩充了编码的数据类型,由自然数据对象扩展到计算机生成的合成数据对象,采用合成对象/自然对象混合编码算法;在实现交互功能和重用对象中引入了组合、合成和编排等重要概念第一百六十页,共216页。MPEG-4的应用与MPEG-1和2相比,MPEG-4更适于交互视听服务以及远程监控。其设计目标使它具有更广的适应性和可扩展性:MPEG-4传输速率可在4.8-64kbps之间,分辨率为176×144,可以利用很窄的带宽通过帧重建技术压缩和传输数据,以最少的数据量获得最佳的图像质量应用领域:数字电视、动态图像、互联网、实时多媒体监控、移动多媒体通信、Internet/Intranet上的视频流与可视游戏、DVD上的交互多媒体等方面第一百六十一页,共216页。MPEG-4的应用MPEG-4能以很低的速率基本实现DVD的质量:ASF(AdvancedStreamingFormat)可以将120分钟的电影压缩为300MB左右的视频流DIVX编码技术可以将120分钟的电影压缩600MB左右,还可以将一部DVD影片压缩到2张CD-ROM上MPEG-4属于一种高比率有损压缩算法,其图像质量始终无法和DVD的MPEG-2相比,毕竟DVD的存储容量较大有一种分析:DIVX技术对DVD形成挑战!第一百六十二页,共216页。MPEG-4应用实例背景全景图+视频对象(VO)=合成图像
第一百六十三页,共216页。MPEG-4与MPEG-1、MPEG-2比较MPEG-1和MPEG-2的重点在于编码效率MPEG-4的目标是提出一种新的方式来传输、访问和操作数字视听数据MPEG-1和MPEG-2是基于帧的规范MPEG-4是基于对象的规范第一百六十四页,共216页。2.5.5MPEG-7标准MPEG-7标准被称为“多媒体内容描述接口”,为各类多媒体信息提供一种标准化的描述,这种描述将与内容本身有关,允许快速和有效的查询用户感兴趣的资料。它将扩展现有内容识别专用解决方案的有限的能力,特别是它还包括了更多的数据类型换而言之,MPEG-7规定一个用于描述各种不同类型多媒体信息的描述符的标准集合该标准于1998年10月提出第一百六十五页,共216页。MPEG-7MPEG-7标准可以看作是一种元数据标准MPEG-7标准由八个部分组成MPEG-7系统MPEG-7数据描述语言XML方案结构化语言组件XML方案数据类型语言组件MPEG–7的特殊扩展第一百六十六页,共216页。MPEG-7MPEG-7视频和音频部分色彩描述符:描述颜色分布、空间输出和色彩结构文本描述符:描述可视化模式,如均匀性、混色和饱和度图形描述符:描述可视化对象的形状(基于区域和轮廓描述符)运动描述符:描绘视频对象中的运动,如镜头移动和对象移动表面描述符:描述应用的具体表面特征,如人脸识别MPEG-7多媒体描述方案工具MPEG-7参考工具和关系第一百六十七页,共216页。MPEG-7Overview
第一百六十八页,共216页。MPEG-7的目标支持多种音频和视觉的描述,包括自由文本、N维时空结构、统计信息、客观属性、主观属性、生产属性和组合信息。对于视觉信息,描述将包括颜色、视觉对象、纹理、草图、形状、体积、空间关系、运动及变形等根据信息的抽象层次,提供一种描述多媒体材料的方法以便表示不同层次上的用户对信息的需求。以视觉内容为例,较低抽象层将包括形状、尺寸、纹理、颜色、运动(轨道)和位置的描述。对于音频的较低抽象层包括音调、调式、音速、音速变化、音响空间位置。MPEG-7还允许依据视觉描述的查询去检索声音数据,反之也一样支持数据管理的灵活性、数据资源的全球化和互操作性第一百六十九页,共216页。MPEG-7MultimediaIndexingandSearching第一百七十页,共216页。MPEG-7支持广泛的应用(1)音视数据库的存储和检索(2)广播媒体的选择(广播、电视节目)(3)因特网上的个性化新闻服务(4)智能多媒体、多媒体编辑(5)教育领域的应用(如数字多媒体图书馆等)(6)远程购物(7)社会和文化服务(历史博物馆、艺术走廊等)(8)调查服务(人的特征的识别、辩论等)(9)遥感(10)监视(交通控制、地面交通等)(11)生物医学应用(12)建筑、不动产及内部设计(13)多媒体目录服务(黄页、旅游信息、地理信息系统等)(14)家庭娱乐(个人的多媒体收集管理系统等)第一百七十一页,共216页。MPEG-7应用原则上,任何类型的AV(Audio-Video)材料都可以通过任何类型的查询材料来检索,例如,AV材料可以通过视频、音乐、语言等来查询,通过搜索引擎来匹配查询数据和MPEG-7的音视频描述第一百七十二页,共216页。MPEG-7几个查询例子音乐:在键盘上弹几个音符就能得到包含(或近似)要求曲调的音乐作品列表,或以某种方式匹配音符的图像,例如,从情感方面图形:在屏幕上画几条线就能得到类似图形、标识、表意文字(符号)等的一组图像运动:对一组给定的物体,描述在物体之间的运动和关系,就会得到实现所描述的时空关系的动画列表电影拍摄剧本(剧情说明):对给定的内容,描述出动作就会得到发生类似动作的电影拍摄剧本(剧情说明)列表第一百七十三页,共216页。2.6
视听通信编码解码标准H.26XH.261标准H.263标准H.264标准第一百七十四页,共216页。2.6.1H.261方案ITU推荐的H.261方案标题“64Kbps视声服务用视像编码方式”,又称为P×64Kbps视频编码标准动力:ISDN(综合业务数字网),需要实时进行编码和解码的视频电话和视频会议系统应用等P取值范围为1~30。P=1或2时,仅能支持QCIF(176×144)分辨率格式,每秒帧数较低的可视电话;当P≥6时,则可支持图像分辨率格式为CIF(352×288)的电视会议该标准于1990年12月完成并予以通过,成为正式的视频图像压缩国际标准H.261框架是后来开发的所有视频编码标准(包括MPEG-1、H.263等)的基础第一百七十五页,共216页。该标准主要用于视频电话和电视会议,因此,标准中建议的视频编码算法,必须以最小的延迟来实现实时操作CIF=CommonIntermediateFormat,公用中间格式,352×288QCIF=QuarterCIF,172×144第一百七十六页,共216页。2.6.2P×64Kbps视频压缩编码算法P×64Kbps压缩算法采用混合编码方法:
源编码帧内编码DCT
帧间编码DPCM
熵编码P×64Kbps标准的压缩算法与MPEG-1标准有许多共同之处,只是传输速率P×64Kbps覆盖较宽的信道频带,而MPEG-1是基于较窄的频带传输第一百七十七页,共216页。H.261标准编码器结构图第一百七十八页,共216页。2.6.3视频层次数据结构P×64Kbps标准采用层次块的视频数据结构形式,以此实现高压缩的视频编码重要任务:定义一个视频数据结构,保证无二义的正确解码层次数据结构:
(1)图像层
(2)块组层
(3)宏块层
(4)块层第一百七十九页,共216页。图像头QCIF帧图块组1块组2块组3块组1头宏块1宏块2宏块33宏块1头亮度块1亮度块4色度块1色度块2DCT系数……DCT系数块结束…视频数据结构图
第一百八十页,共216页。图像数据层次结构123456789101112135帧QCIF123456789101112131415161718192021222324252627282930313233块组123456宏块88CIF块第一百八十一页,共216页。H.261的小结克服了传统编码方案压缩率不大、电视制式和PCM标准不兼容的问题采用统一的图像格式CIF让用户自己决定视频图像的质量和传输速率位率覆盖范围大,能适应各种视频应用但是位率不同(P不同)运动效果和图像质量都不同第一百八十二页,共216页。2.6.4H.263和H.264H.263在H.261基础上开发,1996年发布。吸收了MPEG的若干概念和思想,是一个替换H.261的ITU-T标准H.264正式名称是高级视频编码(AVC,AdvancedVideoCoding),旧的工作名称是H.26LH.264规定两种类型的熵编码基于上下文的自适应二进制算术编码(CABAC,Context-basedAdaptiveBinaryArithmeticCoding)变长编码(VLC,Variable-LengthCoding)第一百八十三页,共216页。2.7声音压缩技术声音编码音频编码语音编码语音编码标准第一百八十四页,共216页。2.7.1声音人类从外部世界获取的信息中10%以上是听觉通过声音获得的声音是携带信息的极其重要的媒体,是多媒体技术研究中的一个重要内容英语“Speech”的波形图和谱图
第一百八十五页,共216页。声音声音是通过物体振动产生的声音是通过介质(空气或固体、液体)传播并能被人或动物听觉器官所感知的波动现象声音总可以被分解为不同频率(f)不同强度正弦波的叠加要素响度:声音的强弱,由“振幅”和人离声源的距离决定
音调:声音的高低,由频率决定音色:声音的特质,由声音波形的谐波频谱和包络(波峰间连线)决定第一百八十六页,共216页。人主要用耳朵接受声音。声音首先接触外耳或耳廊,然后经过耳道到达鼓膜。振动取决于刺激的频率,刺激毛细胞。毛细胞与
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 急性传染病诊疗与防控考核试题及答案
- 机械加工磨床操作规范
- 食堂岗位出勤考勤考核办法
- 高校用电事故原因分析及整改措施
- 经开区项目冬季装修施工方案
- 工程进度计划及保证措施
- 人力资源师考试试题及答案
- 冬至节包饺子活动方案
- 2026人力资源管理师试题及答案
- 国开人力资源管理试题及答案(2025年)
- 2026中国公证协会招5人模拟试卷附答案详解(综合题)
- 2025年云南省地矿测绘院有限公司招聘笔试真题
- 宣传岗笔试题库及答案
- 安全印艺与数字智联:票据印刷产业转型蓝皮书(年)
- 电梯维保方案完整版
- 工程造价专业教学资源库申报书-专业教学资源库备选项目材料
- 《骨关节炎的康复》课件
- HGT4134-2022 工业聚乙二醇PEG
- 跨境电子商务英语全套教学课件
- 人教版高中地理必修二 同步练习册电子版
- 灵宝市开源矿业有限责任公司柏树岭金矿矿产资源开采与生态修复方案
评论
0/150
提交评论