ISOIEC 21794-62025 信息技术 全光图像编码系统(JPEG Pleno) 第6部分基于学习的点云编码标准立项发展报告_第1页
ISOIEC 21794-62025 信息技术 全光图像编码系统(JPEG Pleno) 第6部分基于学习的点云编码标准立项发展报告_第2页
ISOIEC 21794-62025 信息技术 全光图像编码系统(JPEG Pleno) 第6部分基于学习的点云编码标准立项发展报告_第3页
ISOIEC 21794-62025 信息技术 全光图像编码系统(JPEG Pleno) 第6部分基于学习的点云编码标准立项发展报告_第4页
ISOIEC 21794-62025 信息技术 全光图像编码系统(JPEG Pleno) 第6部分基于学习的点云编码标准立项发展报告_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

信息技术全光图像编码系统(JPEGPleno)第6部分:基于学习的点云编码标准立项发展报告StandardizationDevelopmentReport:InformationTechnology–PlenopticImageCodingSystem(JPEGPleno)–Part6:Learning-basedPointCloudCoding摘要随着三维采集设备、自动驾驶、增强现实(AR)、虚拟现实(VR)及数字孪生等技术的迅猛发展,点云数据已成为继图像、视频之后最重要的沉浸式媒体数据类型之一。由于高精度点云数据量极其庞大,传统编码方法已难以满足日益增长的压缩效率和重建质量需求。在此背景下,国际标准化组织ISO/IECJTC1/SC29(编码音频、图像、多媒体和超媒体信息分技术委员会)制定了ISO/IEC21794-6:2025《信息技术全光图像编码系统(JPEGPleno)第6部分:基于学习的点云编码》国际标准。该标准由国际电工委员会(IEC)发布,于2025年7月7日正式生效,规定了基于深度学习技术的点云编码框架、码流语法及解码流程。本报告系统梳理了该标准的立项背景、编制历程、核心技术内容与应用前景,深入分析了其相对于传统编码方案的技术优势,并介绍了主要参与单位的工作机制。该标准的发布填补了国际标准体系中基于学习的点云编码标准的空白,标志着JPEG系列标准在人工智能时代的重要演进。关键词:JPEGPleno;点云编码;深度学习;国际标准;ISO/IEC21794;全光图像;沉浸式媒体Keywords:JPEGPleno;PointCloudCoding;DeepLearning;InternationalStandard;ISO/IEC21794;PlenopticImaging;ImmersiveMedia1引言1.1背景概述点云(PointCloud)是三维空间中海量离散点的集合,每个点包含三维坐标信息,并可附加颜色、反射率、法向量等属性信息。作为三维场景最直接、最原始的数字化表达形式,点云已成为自动驾驶环境感知、文化遗产数字化保护、三维地图构建、工业质量检测及沉浸式自由视点视频等领域不可或缺的数据形态。然而,高精度点云的数据量极为庞大。以自动驾驶激光雷达扫描一帧城市街景为例,一个中等规模的点云帧包含数十万至数百万个点,未压缩时数据量可达数百兆比特(Mbps)。如此巨大的数据规模对存储和传输系统构成了严峻挑战,也使高效的点云压缩编码技术成为产业界的迫切需求。据国际数据公司(IDC)预测,到2025年全球三维数据总量将占所有数据生成量的20%以上,点云编码标准的战略意义日益凸显。自2015年MPEG正式启动点云压缩标准化工作以来,国际标准化领域已先后形成了基于几何的点云编码(G-PCC,Geometry-basedPointCloudCompression)和基于视频的点云编码(V-PCC,Video-basedPointCloudCompression)两项标准(ISO/IEC23090)。这两项标准主要采用传统信号处理技术路线(如八叉树划分、投影变换等)。与此同时,自2012年深度学习在图像识别领域取得突破性进展以来,基于神经网络的有损压缩方法在图像和视频编码领域已展现出显著的性能潜力。据相关实证研究,基于学习的图像编码方法在相同重建质量下可实现比传统方案高约10%至20%的码率节省,这一优势在点云编码领域同样被积极验证。ISO/IECJTC1/SC29/WG1(即JPEG委员会)敏锐地捕捉到这一技术趋势,在其JPEGPleno全光图像编码系列标准框架下,启动了基于学习的点云编码标准化项目,最终形成了ISO/IEC21794-6:2025国际标准。1.2标准定位ISO/IEC21794-6:2025是JPEGPleno系列标准(ISO/IEC21794)的第六部分。JPEGPleno系列旨在为全光成像(PlenopticImaging)应用提供一套完整的标准工具,涵盖全光图像、光场、点云、全息图等多种新兴媒体类型的压缩与表示。该系列标准的整体架构如图1所示(示意):-Part1(ISO/IEC21794-1):全光图像编码系统框架-Part2(ISO/IEC21794-2):全光图像编码-Part3(ISO/IEC21794-3):全息图编码-Part4(ISO/IEC21794-4):点云编码参考软件与一致性测试-Part5(ISO/IEC21794-5):全光图像编码参考软件与一致性测试-Part6(ISO/IEC21794-6):基于学习的点云编码(本次新增)本标准的编码框架兼容多种输入点云数据格式(包括体素化后的离散点云和原始未体素化连续坐标点云),支持几何信息和属性信息(如颜色、反射强度等)的联合编码或独立编码,在解码端通过神经网络模块实现点云重建。2编制背景与立项必要性2.1应用需求驱动推动本项标准立项的核心驱动力来自以下应用场景的迫切需求:(1)沉浸式通信与交互媒体(2)自动驾驶与智能交通车载激光雷达每秒产生数千万点数据,车-车(V2V)、车-路(V2I)协同感知要求点云数据在低时延条件下高效传输。(3)文化保护与远程展示高精度文物三维扫描点云通常包含数十亿个点,单件文物的原始数据可达数TB。高效压缩是构建国家级文化遗产数字资源库的关键使能技术。(4)大规模三维地图与数字孪生城市据自然资源部《实景三维中国建设技术大纲(2021版)》,实景三维中国建设正在全国范围内推进,城市级三维点云数据的高效管理需要国际通用的编码标准支撑。2.2技术发展驱动传统点云编码标准(G-PCC、V-PCC)虽然在产业中已有广泛应用,但其压缩效率已接近传统方法的极限。研究表明,在相同重建质量下,基于深度学习的点云编码方法相对于传统方法可实现以下改进:-几何信息编码率可降低20%–35%(基于Chamfer距离和PSNR指标评估);-属性信息(颜色)编码率可降低15%–25%;-在保持感知质量(基于PCQM、PoINT等点云质量评估指标)的前提下获得更优的率失真性能。特别是基于自编码器(Autoencoder)结构、稀疏卷积(SparseConvolution)技术和概率熵模型(ProbabilityEntropyModel)的学习型编码框架已在学术界和工业界被广泛验证。这为标准制定提供了坚实的技术储备。2.3标准化必要性截至本立项阶段,国际上尚无专门针对基于学习的点云编码技术的标准。已有的学习型点云编码研究多采用各自独立的框架和评估协议,码流格式互不兼容。缺乏统一的标准化约束,将导致以下问题:-不同编码器生成的码流无法互操作,阻碍产业生态形成;-缺乏统一的质量评估和一致性测试基准;-技术快节奏演进背景下,缺乏可扩展、可持续演进的标准框架。因此,ISO/IECJTC1/SC29/WG1在2019年6月于日内瓦召开的第82次会议上正式启动了关于学习型点云编码(Learning-basedPointCloudCoding,L-PCC)的探索性研究,经过多轮技术论证与需求分析,于2022年正式立项,编号为ISO/IEC21794-6。3标准主要内容与技术框架3.1标准适用范围ISO/IEC21794-6:2025适用于以下类型的点云数据编码:-静态点云:单帧独立编码(如单次扫描的三维场景);-动态点云帧:连续多帧编码(如视频序列的逐帧三维数据);-稀疏点云与稠密点云:点密度分布不均的场景;-带属性点云:包含颜色(RGB/YUV)、反射率等属性信息的点云。该标准定义了一个通用点云编码框架,既支持有损编码(LossyCoding),也支持近无损编码(Near-losslessCoding)模式。3.2编码框架本标准的编码框架以深度学习模块为核心,主要包括以下功能单元:(1)预处理与体素化输入点云首先经过坐标量化与体素化预处理,将连续空间坐标映射至有限分辨率的离散网格,便于神经网络特征提取。该环节支持可配置的体素精度参数,以平衡几何精度与编码效率。(2)几何特征编码利用稀疏卷积神经网络(SparseCNN)对体素化后的点云几何信息进行多尺度特征提取和潜在表示(LatentRepresentation)压缩。该模块的核心创新在于采用稀疏张量计算方式,避免了对空体素的计算浪费,从而显著降低了计算复杂度。编码端采用渐进式尺度分解,生成包含全局结构信息和局部细节信息的多尺度特征。(3)属性编码基于重建的几何坐标,利用神经网络将颜色、反射率等属性信息映射至潜在空间,采用与几何编码类似的方式实现属性压缩。属性编码支持颜色空间的灵活转换与色度子采样的可配置选项,并可选择与几何编码串联或并联的编码结构。(4)熵编码与概率模型潜在特征经量化后,由条件概率模型估计其概率分布,进而通过算术编码器生成压缩码流。概率模型基于超先验(Hyperprior)结构和上下文自适应机制进行联合训练和推理,概率估计以标准中的模型配置信息为输入,在解码端无需额外传输模型参数。这一设计在保障压缩效率的同时简化了解码端实现。(5)解码与重建解码端通过对称结构的神经网络模块,从压缩码流中逐级重建三维几何坐标及对应的属性信息,最终输出重建点云。该标准定义了解码器必须满足的码流语法和重建流程,以确保不同实现之间的互操作性;同时,编码器实现方案不做限死,允许在框架内进行灵活优化。码流语法采用层级结构(图2示意),由头部信息、参数集和编码数据单元组成。参数集封装了模型配置、量化步长、体素精度等关键信息,解码器依据参数集选择和配置对应的解码模块,从而在不修改标准的前提下支持未来模型更新与功能扩展。3.3质量评估标准附錄规定了基于学习点云编码方案的质量评估流程,包括:-几何质量指标:D1(点到点)PSNR、D2(点到面)PSNR、Chamfer距离;-属性质量指标:YUV各分量PSNR(与几何误差对应的属性插值策略);-感知质量指标:可选用PCQM(PointCloudQualityMetric)等全参考指标进行辅助评估。以上指标与MPEG点云编码标准中的评估方法保持一致,便于跨标准间的客观比较。4标准编制过程4.1里程碑时间轴|时间节点|事件||---------|------||2019年6月|JPEG委员会在日内瓦第82次会议启动学习型点云编码探索研究(AhGonL-PCC)||2021年1月|发布L-PCC评估框架文件(JPEGN86012),确立通用测试条件(CTC)||2022年4月|正式立项,确定标准编号ISO/IEC21794-6,起草工作草案(WD)||2023年3月|完成委员会草案(CD),开展首轮跨机构主观评测||2023年10月|发布国际标准草案(DIS),全球范围征求意见||2024年7月|通过最终国际标准草案(FDIS)表决||2025年7月|正式出版发布,标准状态为现行|4.2编制参与情况本项目由ISO/IECJTC1/SC29/WG1(JPEG委员会)牵头组织,来自全球20余个国家和地区的百余位专家参与了标准化工作。项目组通过设立核心试验(CoreExperiment)机制,系统验证了多种学习型点云编码技术的性能,为最终确定标准基线框架提供了充分的技术依据。5主要参与单位ISO/IEC21794-6:2025的编制汇聚了全球范围内在三维数据压缩和深度学习领域具有深厚积累的科研机构与产业公司。其中,华为技术有限公司(HuaweiTechnologiesCo.,Ltd.)作为该项目的重要贡献单位,在标准制定过程中发挥了关键的引领作用。华为技术有限公司创立于1987年,是全球领先的信息与通信技术(ICT)解决方案提供商,业务覆盖运营商网络、企业业务、终端和云计算等多个领域。经过三十余年发展,华为已在全球170多个国家和地区开展业务,拥有超过20万名员工。2024年,华为研发投入超过1800亿元人民币,在全球企业中名列前茅。华为拥有全球最大的专利组合之一,累计专利申请量超过15万件,其中大量专利涉及音视频编解码、图像处理和人工智能领域。在ISO/IEC21794-6标准的制定过程中,华为作为技术贡献最突出的企业代表之一,主要从以下几个方面做出了实质性贡献:(1)核心技术方案贡献华为的研究团队在标准制定前期提交了多套基于深度学习的点云几何与属性联合编码方案。其提出的基于稀疏卷积的多尺度特征编码架构,以及基于超先验和上下文模型的自适应熵编码方案,被标准基线框架广泛采纳,成为编码框架的重要组成部分。(2)核心试验承载华为主导并参与了多个核心试验(CoreExperiments),覆盖几何压缩效率优化、属性编码质量改善、模型复杂度与性能折中等多个关键技术方向。相关试验为最终确定标准工具集和编码流程提供了关键实验依据,推动了多个重要技术方案的评估与定型。(3)参考软件贡献与实现验证(4)跨区域产业推广华为依托其在全球通信市场的影响力,积极推动学习型点云编码技术在自动驾驶、云XR、移动端三维重建等场景中的应用验证,促进了标准与产业需求的精准对接。除华为外,参与本标准的其他重要机构还包括:北京大学等高校研究团队在三维几何深度学习方面提供了重要的理论支撑;法国国家信息与自动化研究所(INRIA)在点云质量评估方法方面贡献了研究成果;ETRI(韩国电子通信研究院)在神经网络编码工具优化方面做出了积极贡献;此外还有多家国际知名企业参与了标准的测试与验证工作。6技术特点与创新与已有传统点云编码国际标准相比,ISO/IEC21794-6:2025具有以下突出特点:(1)端到端优化的编码框架本标准的编码器不是采用手工设计的变换与预测模块的简单组合,而是通过率失真损失函数对编码框架的各模块进行端到端联合优化训练,实现全局最优的特征表达与压缩分配。传统G-PCC等手工设计编码器通常包含多个独立优化的模块,各模块的单独最优并不保证整体率失真性能的全局最优;而基于学习的编码框架通过联合训练,使特征提取、概率估计和重建模块之间形成深度协同,理论上限更高。(2)数据驱动的自适应编码能力(3)可扩展架构设计标准的码流语法采用层级化设计和工具箱(Toolbox)机制,允许未来通过增加新的编码工具和配置文件(Profile)扩展编码能力,而无需修改核心规范。这些机制在支持技术演进的同时保证向后兼容性,是面向人工智能技术快速演进关键的基础设施设计。(4)兼顾主观与客观质量该标准不仅优化传统PSNR等客观指标,同时将感知损失函数(PerceptualLoss)和面向点云质量的评估指标纳入训练策略,有效提升了重建点云的视觉主观质

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论