ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第1页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第2页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第3页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第4页
ISOIEC 23090-52023 信息技术沉浸式媒体的编码表示第5部分基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

信息技术沉浸式媒体的编码表示第5部分:基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)标准立项发展报告StandardizationDevelopmentReport:InformationTechnology—CodedRepresentationofImmersiveMedia—Part5:VisualVolumetricVideo-BasedCoding(V3C)andVideo-BasedPointCloudCompression(V-PCC)摘要随着虚拟现实(VR)、增强现实(AR)、混合现实(MR)以及自由视点视频等沉浸式媒体应用的迅猛发展,传统的二维视频编码标准已难以满足三维场景数据高效压缩与传输的需求。点云作为高精度三维场景的主流表示形式,其数据量巨大,给存储、传输与实时渲染带来了严峻挑战。为应对上述技术瓶颈,国际标准化组织(ISO/IEC)下属的运动图像专家组(MPEG)启动了沉浸式媒体编码系列标准的制定工作,其中ISO/IEC23090-5:2023《信息技术沉浸式媒体的编码表示第5部分:基于视觉体积视频的编码(V3C)和基于视频的点云压缩(V-PCC)》应运而生。本报告系统梳理了该标准的立项背景、技术架构、关键创新点、应用前景及修订历程,深入分析了V3C与V-PCC在统一编码框架下对点云、全息视频、动态网格等多种体积媒体数据的通用表示能力,并详细介绍了主要参与单位在标准制定过程中的技术贡献。报告指出,该标准虽已废止,但其确立的技术范式——即将三维体积数据转换为二维视频进行高效压缩的"体积视频+传统视频编码"融合思路——为后续MPEG-I第二阶段标准(如ISO/IEC23090-24)的演进奠定了坚实基础,对推动沉浸式媒体产业的标准化进程具有里程碑意义。本报告旨在为行业技术人员、标准化工作者及产业决策者提供全面、专业的技术参考。关键词:沉浸式媒体;体积视频;V3C;V-PCC;点云压缩;MPEG-I;ISO/IEC23090Keywords:ImmersiveMedia;VolumetricVideo;V3C;V-PCC;PointCloudCompression;MPEG-I;ISO/IEC23090一、引言1.1研究背景近年来,沉浸式媒体技术在全球范围内呈现爆发式增长态势。据国际数据公司(IDC)预测,到2025年全球AR/VR市场支出将达到近570亿美元,2020-2025年复合年增长率约为35%。然而,沉浸式内容的生成与传输面临诸多技术挑战,其中三维数据的高效压缩是核心瓶颈之一。点云作为三维扫描设备(如LiDAR、深度相机)和多视图重建算法输出的主流数据格式,可精确描述物体和场景的表面几何信息与属性信息(如颜色、反射率、法向量等)。单个高精度点云帧往往包含数百万个点,以每秒30帧的速率传输时,原始数据量可达数Gbps,远超当前网络带宽承载能力。传统的视频编码标准(如H.264/AVC、H.265/HEVC)针对二维规则网格像素设计,无法直接高效处理非结构化、稀疏分布的点云数据。为此,MPEG于2017年正式启动点云压缩标准化工作,经过广泛的需求调研和技术征集,形成了三条技术路线:基于几何的编码(G-PCC,Geometry-basedPointCloudCompression)和基于视频的编码(V-PCC,Video-basedPointCloudCompression)。其中V-PCC通过将三维点云投影为二维深度图和属性图,巧妙地复用了高效视频编码(HEVC)等成熟编码工具,在当时显著降低了实现复杂度和编码开销。1.2标准立项意义ISO/IEC23090-5:2023的发布标志着MPEG在沉浸式媒体编码领域迈出了关键一步。该标准不仅定义了点云压缩的具体技术方案,更重要的是提出了"基于视觉体积视频的编码"(V3C)这一通用框架。V3C将点云、动态网格、全息视频等多种体积媒体数据类型统一映射为"几何视频+属性视频+占用图"的组合表示,从而实现了对多种沉浸式媒体数据的统一编码处理。这种抽象化设计理念突破了以往"一种数据类型一套编码方案"的碎片化发展模式,为未来更具通用性的沉浸式媒体编码标准奠定了方法论基础。本报告将围绕ISO/IEC23090-5:2023标准的立项基础、核心技术、参与单位贡献、应用价值及历史影响等方面展开系统论述,以期为相关领域的研究人员和从业人员提供参考。二、标准项目立项基础与演进历程2.1需求驱动与前期探索MPEG对三维数据压缩的研究可追溯至21世纪初。早期工作主要集中于多视点视频编码(MVC)和深度图编码,但这些技术方案本质上仍以二维图像平面为处理单元,无法真正实现自由视点渲染所需的六自由度(6DoF)沉浸体验。2013年前后,随着消费级深度相机(如Kinect)的普及和光场采集设备的出现,学术界和工业界对点云压缩的研究热情急剧升温。2017年1月,MPEG在日内瓦召开的第119次会议正式发布"点云压缩需求"文件(N16731),明确提出了点云压缩标准的应用场景(如自主驾驶、文化遗产保护、沉浸式通信、工业检测等)及技术需求(包括无损/有损压缩、支持动态/静态点云、可接受的复杂度范围等)。同年7月,MPEG发布"点云压缩征集提案书"(CFP),在全球范围内公开征集技术方案。最终收到包括华为、高通、苹果、三星、诺基亚等国际知名企业以及北京大学、清华大学、浙江大学等高校在内的多份提案。2.2技术路线确立与标准制定时间线经过多轮主观质量测试和客观指标评估,MPEG于2018年正式确立了两条互补的技术路线:-G-PCC(基于几何的编码):直接对三维空间中的点坐标和属性进行压缩,适用于稀疏分布的点云(如LiDAR扫描数据),主打无损和近无损压缩。-V-PCC(基于视频的编码):将点云数据块投影至二维平面生成补丁(patch),再通过传统视频编码器进行压缩,特别适用于密集点云(如8i、Microsoft等公司提供的VoxelizedPointCloud数据集)。在V-PCC的技术演进过程中,MPEG专家发现该方案的核心理念——"将体积数据转换为二维视频"——具有更广泛的适用性。基于此认知,MPEG于2020年启动V3C框架的标准化工作,旨在将V-PCC的投影-编码-重建流程抽象为一个通用框架,并推广至除点云外的其他体积媒体数据类型。V3C作为ISO/IEC23090系列标准的第5部分,于2023年11月正式发布。三、标准核心技术内容分析3.1V3C通用编码框架ISO/IEC23090-5:2023所定义的V3C框架由三个核心组成部分构成:1.补丁生成(PatchGeneration):将三维体积数据(如点云帧)划分为若干互不交叠的子区域,每个子区域被投影至一个或多个二维平面,形成"补丁"。补丁的生成策略直接影响后续编码效率和重建质量。V3C标准中定义了基于法向量分析和连通域检测的自动补丁生成算法,并允许编码端灵活选择投影方向(正交投影或透视投影)。2.视频序列构建(VideoSequenceConstruction):将所有补丁打包排列至有限的二维画布中,形成三类视频信号:-几何视频(GeometryVideo):存储每个像素对应的深度值(或视差值),以灰度图表示。-属性视频(AttributeVideo):存储每个像素对应的颜色、反射率等属性信息。-占用图(OccupancyMap):以二值图形式标注画布上哪些像素属于有效几何信息,用于解码端的像素级有效性判定。上述三类视频信号被编码为独立的视频比特流,每个比特流可选用不同的视频编码标准(如HEVC、AVC或未来的VVC),从而在率失真性能与复杂度之间获得灵活折中。3.辅助信息编码(AuxiliaryInformationCoding):包括补丁的映射关系、投影参数、画布布局信息等元数据,这些辅助信息经过熵编码后与视频比特流复用,构成完整的V3C比特流语法。3.2V-PCC与V3C的关系辨析V-PCC是V3C框架在点云数据类型上的具体实例化。在ISO/IEC23090-5:2023发布之前,V-PCC曾作为单独的标准化项目(ISO/IEC23090-5:2021版本)存在。2023年版本将V-PCC技术整合至V3C框架中,并进行了语法和工具层面的统一优化。具体而言:-早期V-PCC标准的编码工具集包含点云专用的"点云补丁细分"和"点云帧间预测"等高级工具,这些工具在V3C框架中得以保留,并增加了对动态网格、全息视频等其他数据类型的扩展接口。-V3C版本定义了一个与数据格式无关的底层编码管道,而上层的"数据格式适配层"(如点云适配层)则负责将特定类型的三维数据映射为V3C输入。这种分层架构显著增强了标准的可扩展性和复用性。3.3关键编码工具与性能表现V3C/V-PCC编码方案的核心技术亮点包括:-基于块的三维到二维映射:采用自适应的块尺寸划分(如16×16或32×32像素),根据局部几何复杂度动态调整补丁尺寸,有效平衡编码效率和重建精度。-占用图优化:占用图本身也通过视频编码器压缩,但其精度要求较高(通常在0-255范围内以多级灰度表示),以支持解码端的平滑几何重建。-基于深度/视差的几何重建:解码端从几何视频中恢复深度信息,结合占用图和辅助信息完成三维点的坐标重建和属性映射。-帧间编码增强:利用V3C视频序列的时域相关性,通过运动估计和补偿技术实现动态点云的高效压缩。实验表明,V-PCC在感知质量相近的条件下,较G-PCC可实现20%-40%的码率节省(针对密集动态点云场景)。四、主要参与单位介绍4.1标准工作组织架构ISO/IEC23090-5:2023由国际标准化组织/国际电工委员会第一联合技术委员会(ISO/IECJTC1)下属的"视听及多媒体系统"分技术委员会(SC29)负责制定,具体工作由MPEG的"3D图形编码"特设组(AdHocGroupon3DGraphicsCoding)承担。该特设组汇聚了数十家全球领先的ICT企业和研究机构。4.2重点参与单位——华为技术有限公司单位概况华为技术有限公司(HuaweiTechnologiesCo.,Ltd.)是全球领先的ICT(信息与通信)基础设施和智能终端提供商,总部位于中国深圳。在视频编码和多媒体压缩领域,华为拥有深厚的技术积累——其自研的H.265/HEVC编解码方案已在海思芯片和华为云上广泛应用。在V3C/V-PCC标准制定中的贡献1.核心技术提案:华为在V-PCC标准化阶段提出了多项关键提案,包括"基于多方向投影的补丁生成优化方案"和"基于率失真优化的占用图编码方法"。其中,多方向投影方案可在几何复杂度较高的局部区域动态选择最优投影方向,显著降低投影误差。该方案被采纳为V-PCC参考软件TMC2的重要组成部分。2.测试与验证:华为深度参与了标准的主观质量验证测试。其提供的测试序列(涵盖高精度室内场景、动态人体扫描等典型应用场景)被纳入MPEG官方测试集。华为还开发了端到端的实时点云编解码原型系统,为标准的工程可行性提供了验证支撑。3.交叉技术融合:华为推动将V3C框架与自身在神经网络压缩领域的研究成果相结合,探索了基于深度学习的几何视频超分辨率重建技术,为后续MPEG-IPhase2标准的AI工具引入奠定了基础。4.国际协作与影响力:华为公司多名专家长期担任MPEG点云压缩工作组的联席主席和编辑(Editor)职务,在标准文本撰写、技术讨论组织、跨区域利益协调等方面发挥了重要作用。4.3其他主要参与机构除华为外,以下机构也做出了突出贡献:-高通公司:在低复杂度解码器设计方面提出多项建议,确保V3C解码器可在移动平台上实时运行。-苹果公司:主导了V-PCC中颜色属性编码优化的相关工作,提出了基于色彩空间转换的改进方案。-FraunhoferHHI:在占用图编码优化方面提供了关键算法支持。-北京大学、浙江大学:在补丁生成算法优化和率失真模型构建方面贡献了重要研究成果。五、标准应用价值与产业影响5.1典型应用场景ISO/IEC23090-5:2023所定义的V3C/V-PCC编码技术可广泛应用于以下领域:-沉浸式通信与社交:如3D视频通话、全息会议,用户可获得具有真实感的立体视觉体验。-自由视点体育直播:通过部署多相机阵列采集赛场三维点云数据,观赛者可自由切换任意视角,甚至进入赛场内部漫游。-文化遗址数字化:对文物、古建筑进行高精度三维扫描和数据压缩,实现数字化存档和远程虚拟展览。欧洲的"CyArk"项目已采用点云压缩技术对全球多处文化遗产进行数字化保护。-自动驾驶环境感知:车用LiDAR点云的实时压缩可有效降低车辆之间、车辆与基础设施之间的数据传输压力。5.2产业生态与标准化协同V3C标准的确立推动了沉浸式媒体产业链的清晰化:采集端(三维扫描、光场相机)、处理端(点云生成与增强)、压缩端(V3C编码器)、传输端(网络适配与流媒体协议)以及渲染端(VR/AR设备)之间的接口和数据格式有了统一依据。流媒体巨头如YouTube和Meta已开展点云沉浸式视频的试播服务,其底层技术方案均参考了V-PCC框架。5.3对后续标准演进的影响值得注意的是,ISO/IEC23090-5:2023标准当前状态已被标记为"废止"。这一状态调整并非因为技术方案失败,而是因为该标准的内容已被后续发布的ISO/IEC23090-24(沉浸式媒体的体积视频编码基础架构)等技术文件所部分取代或细化。V3C框架作为一种通用的体积媒体编码方法论,其核心理念被继承并扩展至更多数据类型和应用场景。这一演进路径体现了标准化工作的动态性和持续迭代性——旧标准在完成历史使命后退出舞台,其技术遗产则在新标准中得以延续和发展。六、参与标准修订的企事业单位/标委会介绍6.1中国国家标准化管理委员会(SAC)及全国信息技术标准化技术委员会中国国家标准化管理委员会(StandardizationAdministrationofChina,SAC)是国务院授权的统一管理全国标准化工作的主管机构。在下设的全国信息技术标准化技术委员会(TC28)中,专门设有"多媒体"分技术委员会(SC29)对口跟踪ISO/IECJTC1/SC29的标准化工作。在ISO/IEC23090-5:2023制定期间,SAC积极组织国内产学研用各方力量(包括华为、中兴、腾讯、阿里、北京大学、清华大学、浙江大学等)成立国内对口工作组,建立了"国内提案预审-国际会议参会-联合提案形成"的工作机制。国内工作组定期召开技术研讨会,对V3C框架中的补丁生成算法、占用图优化等议题进行集中攻关,并将研究成果以联合提案或独立提案形式提交至MPEG会议。6.2主要参与单位——浙江大学CAD&CG国家重点实验室单位概况浙江大学CAD&CG国家重点实验室是我国计算机图形学和多媒体领域的重点研究基地,长期从事三维视觉、点云处理、视频编码等方面的基础理论研究和关键技术攻关。实验室拥有完善的实验平台和国际化的科研团队。在标准制定中的具体贡献1.补丁生成算法优化:实验室团队提出了一种基于局部曲面拟合的补丁生成方法,在保证投影精度的前提下大幅降低了补丁数量,从而减少了辅助信息的编码开销。该算法被纳入V-PCC参考软件TMC2的备选方案中。2.几何视频预处理技术:针对几何视频中深度值的非均匀分布特性,实验室提出了自适应深度值映射方法,有

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论