ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第1页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第2页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第3页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第4页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

信息技术沉浸式媒体的编码表示第5部分:基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告StandardizationDevelopmentReport:InformationTechnology—CodedRepresentationofImmersiveMedia—Part5:VisualVolumetricVideo-BasedCoding(V3C)andVideo-BasedPointCloudCompression(V-PCC)摘要随着虚拟现实(VR)、增强现实(AR)及混合现实(MR)等沉浸式技术的迅猛发展,三维点云和体积视频作为高保真三维场景的核心表示形式,日益成为新一代多媒体应用的关键数据形态。然而,此类数据体量巨大,对存储、传输和处理提出了严峻挑战。在此背景下,国际标准化组织(ISO)与国际电工委员会(IEC)联合成立的动态图像专家组(MPEG)于2023年11月正式发布了ISO/IEC23090-5:2023标准,该标准系统定义了基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)技术框架。本报告全面梳理了该标准的立项背景、技术原理、编制过程、核心内容及主要参与单位,分析了标准废止的原因及其技术遗产,并探讨了其对下一代沉浸式媒体编码标准(如MPEGImmersiveVideo)的深远影响。报告指出,尽管该标准已在2025年因技术演进和版本迭代被废止,但其确立的基于深度/属性分层投影的压缩范式以及将三维数据映射到传统二维视频编码框架的设计理念,为后续标准奠定了不可替代的技术基础,并在自动驾驶、工业检测、数字文化遗产保护等泛在领域持续发挥指导作用。关键词:沉浸式媒体;点云压缩;体积视频;V3C;V-PCC;MPEG;ISO/IEC23090Keywords:ImmersiveMedia;PointCloudCompression;VolumetricVideo;V3C;V-PCC;MPEG;ISO/IEC230901.引言1.1研究背景近年来,沉浸式媒体技术经历了从概念验证到产业落地的深刻变革。根据中国信息通信研究院发布的《全球数字经济白皮书(2023年)》,全球虚拟现实产业规模已突破3500亿元人民币,年复合增长率超过30%。在这一浪潮中,三维点云(PointCloud)和体积视频(VolumumetricVideo)凭借其能够真实再现三维空间几何结构与表面属性的能力,成为构建沉浸式体验的核心数据形式。点云数据由海量三维空间坐标点构成,每个点除位置信息外,通常还携带颜色、反射率、法向量等属性信息。以高精度LiDAR扫描为例,单帧点云的点数可达数百万乃至上亿,未压缩的原始数据量动辄数GB。这种数据特征使得点云的高效压缩成为制约沉浸式媒体规模化应用的关键瓶颈。1.2标准立项的必要性在ISO/IEC23090-5:2023标准立项之前,点云压缩领域已存在多种探索性方案。早期方法主要基于八叉树(Octree)结构进行几何信息编码,如MPEG的测试模型C(TMC3),但这类方法在压缩效率和并行处理能力方面存在明显局限。与此同时,业界亟需一种能够在现有视频编码基础设施上高效运行的统一方案,以降低实现成本和部署门槛。在此背景下,MPEG于2017年正式启动点云压缩标准化工作,经过系统评估多种候选技术方案后,确立了两条并行推进的技术路线:基于几何的压缩(G-PCC)和基于视频的压缩(V-PCC)。其中,V-PCC的核心创新在于将三维点云通过分层投影映射为若干二维图像序列(包括几何图集、属性图集和占用图),从而复用高性能视频编码标准(如H.265/HEVC)进行高效压缩。2.标准概述2.1基本信息-标准编号:ISO/IEC23090-5:2023-标准全称:信息技术沉浸式媒体的编码表示第5部分:基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)-英文名称:Informationtechnology—Codedrepresentationofimmersivemedia—Part5:Visualvolumetricvideo-basedcoding(V3C)andvideo-basedpointcloudcompression(V-PCC)-发布机构:国际标准化组织(ISO)/国际电工委员会(IEC)-发布日期:2023年11月10日-标准状态:废止(2025年)-适用范围:适用于动态或静态点云数据的压缩编码、传输和解码,涵盖几何信息和属性信息的完整处理链条2.2标准架构该标准属于ISO/IEC23090系列(即MPEG-I标准族)的第5部分。MPEG-I系列标准旨在为沉浸式媒体应用提供完整的编码表示体系,涵盖视口渲染、深度估计、几何建模等多个维度。本部分(V3C)是整个系列中的核心技术组件,为其他相关部分(如第2部分的沉浸式视频、第3部分的点云编码)提供基础编码工具。值得注意的是,ISO/IEC23090-5:2023是在此前版本(2021年版和2022年修订版)基础上的进一步扩展,整合了V3C与V-PCC的统一框架,使得标准的适用性和可扩展性显著增强。3.标准的核心技术内容3.1V3C编码框架V3C(VisualVolumetricVideo-basedCoding)是一个通用化编码框架,其核心思想是将任意体积媒体内容(包括点云、动态网格、全息图等)转化为若干二维图像序列进行编码。该框架由以下关键技术模块组成:(1)投影与映射模块系统将以三维坐标表示的点云数据投射到六面体包围盒表面,生成对应的几何图集和属性图集。该过程涉及投影方向的优化选择、图集布局的自动化排列以及同质区域合并等算法。具体而言,点云数据首先被分解为若干三维补丁(Patch),每个补丁对应一个具有相似法向量方向的点云子集;随后,每个补丁被独立投影到包围盒的一个平面,形成对应的二维块;最后,所有补丁投影结果按照一定策略排列组合成完整的二维图像帧,即图集。(2)占用图生成模块占用图(OccupancyMap)用于标识图集图像中各像素位置是否有效,即是否对应原始点云数据中的实际点。该信息在解码端起着关键的辅助作用:它不仅用于引导点云的重建,还可优化后续视频编码过程中的失真分配策略。在编码效率方面,占用图的编码通常采用行程编码等轻量级方法,因其所占码流比例较小(通常在3%~5%之间),但对重建质量的优化贡献显著。(3)图像/视频编码模块该模块利用高性能视频编码器(主要是H.265/HEVC)分别对几何图集、属性图集和占用图进行压缩编码。几何图集通常采用较高比特率以保证重建精度,而属性图集可依据分辨率需求灵活调整编码参数。在标准规范中,编码器在参考软件中对几何图集和属性图集采用不同量化参数进行编码,其中几何信息的量化步长通常为属性信息的数分之一,以体现几何精度对整体重建质量的优先影响。(4)辅助信息编码模块辅助信息包括投影参数、补丁布局信息、映射模式等元数据,用于指导解码器正确重建点云。该信息以高效二进制语法元素进行编码,冗余度极低(通常不到总码流的1%),但其准确性直接影响解码端的重建效果。辅助信息采用独立的熵编码器进行压缩,并具备显著的容错机制——考虑到地图信息在传输过程中可能出现的误码,V3C设计了一系列奇偶校验机制和默认参数约定,确保在部分辅助信息缺失时解码端仍能完成基本重建。3.2V-PCC压缩机制V-PCC(Video-basedPointCloudCompression)是V3C框架在点云数据上的具体实例化。它以V3C的通用语法为基础,针对点云数据的特点进行了针对性优化。其压缩流程如下:(1)预处理阶段点云数据经过坐标量化、颜色空间转换(RGB至YCbCr)、法向量估计及法向量一致性方向翻转等预处理操作后,由全局语义信息提取、坐标系变换和体素化处理环节获得规则化表示,进而通过法向量分析与K均值聚类将点云划分为若干帧内补丁。(2)补丁生成与打包阶段利用法向量等几何特征将点云划分为多个补丁,每个补丁代表一个具有相似几何特征的点云子集。随后将补丁投影至二维平面并按照优化策略排列打包成图集序列。补丁的生成质量直接影响后续编码效率,因此标准规定了详细的补丁划分准则和优化目标函数。(3)编码与传输阶段几何图集、属性图集和占用图分别送入视频编码器进行压缩,同时整合辅助信息形成完整的比特流。在传输过程中,系统支持按需加载不同空间区域和不同细节层次的点云数据,实现渐进式传输和视口自适应的数据调度。(4)解码与重建阶段解码器从比特流中解析出各图集序列和辅助信息,通过逆向投影映射将二维数据还原为三维点云。重建过程中的深度图细化(DepthMapRefinement)、填充(Padding)和滤波(Filtering)等后处理操作可有效提升重建质量。其中深度图细化通过分析深度不连续区域进行分组处理,并利用占用图辅助信息优化深度精度,研究表明该操作可显著提升重建点云的几何精度(减少均方根误差约15%以上)。3.3V3C与V-PCC之间的关系V3C是广义的体积媒体编码框架,而V-PCC是其点云编码的具体实现。两者共享相同的语法结构和编码流程,V3C提供了更广泛的适用性,V-PCC则有助于针对点云数据进行高效优化。这一设计使得在后续标准演进中,新开发的技术工具能够快速整合进统一框架中。4.国际标准化研制过程4.1标准研制历程与版本演进ISO/IEC23090-5标准的研制经历了多轮深入讨论和技术验证。本报告所关注的2023年版并非初版,而是历经多次迭代后的重要整合版本。该版本在结构上将V3C与V-PCC整合到一个文档中,形成了统一的编码框架。这一整合工作有效地解决了此前各版本间交叉引用复杂、实现路径不一致的问题,显著提升了标准的可用性。从技术演进的角度看,2023年版相比之前的版本在以下方面有了明显提升:(1)编码效率的提升:通过优化补丁生成算法和引入更先进的预测编码工具,在相同重建质量下平均降低了约10%~15%的码率;(2)并行处理能力的增强:标准新增了对多个独立图集流(MultipleTileStreams)的支持,能够在解码端实现空间区域的并行解码,降低了高分辨率点云实时解码的时延;(3)扩展功能的丰富:增加了对部分遮挡点云(部分可见性)和区域点云(Patch-wisePointCloud)等新应用场景的支持。4.2标准废止原因分析ISO/IEC23090-5:2023于2025年被废止,其直接原因在于该版本被后续版本(ISO/IEC23090-5:2025)所替代。在国际标准化实践中,标准的"废止"并非贬义,而是标准生命周期管理中的正常环节——当旧版本被新版本取代后,旧版本即被标记为废止状态,以确保用户始终采用最新版本。值得注意的是,MPEG标准的一个既定原则是——新版本并不自动保证与旧版本的完全向后兼容,但在实际应用中,标准实现者通常会持续支持多个版本的解码能力以保障生态系统的平滑过渡。从技术演进逻辑来看,V3C/V-PCC后续版本的更新主要集中于以下方向:(1)与MPEGImmersiveVideo(MIV)标准的深度集成;(2)对机器学习增强编码工具的支持;(3)面向6DoF(六自由度)应用的扩展。4.3标准与国内标准的协调ISO/IEC23090-5作为国际标准,与我国国内标准体系保持了良好的协调关系。我国全国信息技术标准化技术委员会多媒体分技术委员会(SAC/TC28/SC29)持续跟踪该标准的研制进展,并组织国内优势单位参与标准制定工作。在国家标准层面,我国GB/T33475系列标准(信息技术高效多媒体编码)与MPEG-I系列标准保持技术对齐,为国内外多媒体产业的互联互通奠定了基础。5.主要参与单位和标准化组织5.1MPEG组织结构ISO/IEC23090-5:2023由ISO/IECJTC1/SC29(编码音频、图像、多媒体和超媒体信息分技术委员会)下属的MPEG(MovingPictureExpertsGroup,动态图像专家组)负责制定。MPEG成立于1988年,是国际标准化领域最富盛名的专家组之一。在V3C/V-PCC标准的制定过程中,MPEG下属的"基于几何的压缩"特别工作组和"基于视觉体积视频的编码"特别工作组分别承担了相关技术方案的评估和整合工作。MPEG的工作模式具有鲜明的开放性和协作性:各成员国通过国家体提交技术提案,由专家组进行统一评估和交叉测试(CoreExperiment),最终通过共识机制确定技术方案。在V-PCC标准研制周期内,共有来自全球超过30家机构和企业的上百名专家参与了提案提交和技术评审工作,提交的各类技术提案累计超过200份。5.2主要参与企事业单位介绍在ISO/IEC23090-5:2023标准的制定过程中,来自多个国家的企业和研究机构发挥了重要作用,其中包括华为技术有限公司、三星电子、高通、腾讯、Intel、FraunhoferHHI、北京大学、清华大学等。以下以华为技术有限公司为典型案例进行详细介绍。华为技术有限公司华为技术有限公司(HuaweiTechnologiesCo.,Ltd.,以下简称"华为")是全球领先的信息与通信技术(ICT)解决方案提供商,总部位于中国深圳。华为在多媒体技术领域深耕多年,是MPEG组织的重要参与者之一。在V3C/V-PCC标准制定过程中,华为凭借其在视频编码、点云处理和人工智能领域的深厚积累,提出了多项核心技术创新方案。具体而言,华为在以下方面为该标准的制定做出了突出贡献:(1)补丁生成与布局优化技术:华为提出的基于率失真优化的补丁生成算法,在保证重建质量的条件下显著降低了图集的空间占用率,有效提升了编码效率。该方案在交叉测试中较基准配置平均节省约8%~12%的码率。(2)点云属性编码优化:华为研发的基于区域自适应滤波的属性压缩方法,针对不同区域纹理特性动态调整滤波参数,有效抑制了压缩带来的边缘模糊效应,显著提升了重建点云的视觉质量。(3)低延迟编解码架构:华为结合其在实时通信领域的技术积累,提出了适用于低延迟场景的编解码优化方案,为V-PCC在实时交互应用(如远程沉浸式会议、云VR等)中的部署提供了技术保障。除了技术贡献外,华为还深度参与了标准文本的撰写和编辑工作,多位华为专家担任了标准编辑人(Editor)和核心技术实验的负责人(Chair),在标准研制的组织协调和进度推进中发挥了关键作用。华为在标准制定中的积极参与,不仅提升了中国企业在国际标准制定中的话语权和影响力,也促进了我国在沉浸式媒体技术领域的整体竞争力提升。6.标准的技术比较与应用分析6.1与同类标准的比较在当前点云压缩技术领域,ISO/IEC23090-5(V-PCC/V3C)与ISO/IEC23090-9(G-PCC,基于几何的点云压缩)共同构成了两大主流技术路线:|对比维度|V-PCC(视频路线)|G-PCC(几何路线)||---------|------------------|------------------||核心原理|三维数据到二维图集的投影映射|基于八叉树的几何结构编码||编码工具|利用成熟视频编码器(HEVC)|专用熵编码与算术编码||优势场景|高密度点云、动

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论