ISOIEC 23090-142023 信息技术.沉浸式媒体的编码表示.第14部分场景描述标准立项发展报告_第1页
ISOIEC 23090-142023 信息技术.沉浸式媒体的编码表示.第14部分场景描述标准立项发展报告_第2页
ISOIEC 23090-142023 信息技术.沉浸式媒体的编码表示.第14部分场景描述标准立项发展报告_第3页
ISOIEC 23090-142023 信息技术.沉浸式媒体的编码表示.第14部分场景描述标准立项发展报告_第4页
ISOIEC 23090-142023 信息技术.沉浸式媒体的编码表示.第14部分场景描述标准立项发展报告_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

信息技术沉浸式媒体的编码表示第14部分:场景描述标准立项发展报告StandardizationDevelopmentReport:Informationtechnology—Codedrepresentationofimmersivemedia—Part14:Scenedescription摘要本报告围绕国际标准ISO/IEC23090-14:2023《信息技术沉浸式媒体的编码表示第14部分:场景描述》的立项与发展历程进行深入分析。随着元宇宙、扩展现实(XR)等沉浸式技术的快速发展,对三维场景的高效编码与交互式描述提出了前所未有的挑战。该标准作为MPEG-I(ISO/IEC23090)系列标准的关键组成部分,旨在定义一种通用的、可扩展的场景描述格式,以支持沉浸式媒体内容的创建、分发、渲染和交互。报告首先阐述了该标准制定的技术背景与产业需求,指出当前异构平台间因缺乏统一场景描述格式而导致的兼容性瓶颈。随后,报告详细解析了标准的核心技术框架,包括其基于节点的场景图结构、动画与交互逻辑的编码表示,以及与视频、音频等其他媒体类型的同步机制。报告重点介绍了主要参与单位——法国电信在标准制定过程中的技术贡献与推动作用。最后,报告对标准的废止状态进行了客观分析,并展望了未来沉浸式媒体标准化的发展方向。结论指出,尽管该标准因更新迭代已废止,但其确立的技术理念与框架为后续沉浸式场景描述标准的演进奠定了坚实基础,对推动整个XR产业链的互联互通具有里程碑式的意义。关键词:沉浸式媒体;场景描述;MPEG-I;ISO/IEC23090;扩展现实;标准化;编码表示Keywords:ImmersiveMedia;SceneDescription;MPEG-I;ISO/IEC23090;ExtendedReality;Standardization;CodedRepresentation正文1.引言:沉浸式媒体时代的标准化呼唤随着第五代移动通信技术(5G)、云计算、人工智能(AI)以及高性能图形处理单元的迅猛发展,人们对于视觉体验的追求已从传统二维平面视频转向更具沉浸感、交互性的虚拟现实(VR)、增强现实(AR)与混合现实(MR)等扩展现实(XR)技术。这些技术共同构成了“元宇宙”的入口,其核心在于构建一个能够与现实世界实时交互的、逼真的三维数字场景。然而,在早期行业实践中,各大厂商与平台(如Apple的USDZ、Khronos的glTF、Omniverse的USD、WebXR等)各自推出了私有的或半开源的场景描述格式。这种碎片化的局面带来了严重的兼容性问题:一个由A平台创建的沉浸式内容,往往无法直接在B平台上完整、高效地呈现,导致内容创作成本高昂、分发渠道受限、用户体验割裂。因此,国际标准化组织(ISO/IEC)敏锐地捕捉到这一产业痛点,启动了针对沉浸式媒体编码表示的系列标准——MPEG-I(MovingPictureExpertsGroup-Immersive),旨在建立一套完整、统一、高效的沉浸式媒体技术体系。ISO/IEC23090-14:2023《信息技术沉浸式媒体的编码表示第14部分:场景描述》正是该体系中最为核心的组成部分之一。2.标准背景与技术挑战2.1沉浸式媒体的演变与分类沉浸式媒体不仅仅指360度全景视频,它涵盖了更广泛的范围,包括自由视点视频(FVV)、三维点云、网格模型、体积视频等。这些媒体类型具有截然不同的数据结构:视频是像素化的时间-空间信号,点云是无序的离散点集,而网格模型则由顶点、边和面构成。如何将这些异构的媒体类型高效地编码,并有机地整合在一个统一的场景描述框架内,是标准制定的首要难题。2.2场景描述的核心挑战在MPEG-I框架下,场景描述不是简单地指定“有一个物体在那里”,而是需要支持以下关键挑战:1.几何与外观表示:定义如何表示三维物体的形状(网格、参数曲面、点云等)和外观(纹理、材质、光照模型)。标准需要支持基于物理的渲染(PBR)材质,以确保逼真的视觉效果。2.时空关系与布局:描述各个媒体元素在三维空间中的位置、旋转和缩放(即变换矩阵),以及它们是如何随时间变化的(动画)。3.交互逻辑:定义用户如何与场景进行交互,例如,点击触发器(Trigger)播放一段视频、接近某个物体触发事件、拾取/操纵虚拟物体等。4.媒体同步:确保视频、音频、字幕、触觉反馈等不同感官信息流在时间轴上精确对齐,实现“音画同步”和“视触同步”。6.可扩展性与互操作性:标准必须定义一种通用的语法和语义,使得不同厂商的设备(头显、控制器、开发工具)都能理解和解析同一份场景描述文件。3.标准核心内容解析ISO/IEC23090-14:2023提供了一种用于描述沉浸式场景的标准化方法。其核心设计理念是基于一种层次化的、节点式的数据结构,通常被称为“场景图”(SceneGraph)。3.1基于节点的场景图结构标准定义了一个丰富的节点类型库,包括但不限于:-TransformNode(变换节点):定义了子节点的空间位置、旋转和缩放。-ShapeNode(形状节点):用于承载具体的几何实例(IndexedFaceSet,TriangleStripMesh等)及其对应的材质。-MaterialNode(材质节点):定义了表面的外观,如漫反射、镜面反射、法线贴图、自发光等属性。-LightNode(光源节点):用于定义点光源、方向光、聚光灯等,实现场景照明。-CameraNode(相机节点):定义了虚拟相机的位置和投影参数,与用户的视点对应。-AnimationNode(动画节点):通过对其他节点属性(如位置、旋转、透明度)进行时间插值,实现物体运动或变形。-InteractionNode(交互节点):定义了传感器(Sensor)、事件(Event)和脚本(Script),用于实现用户交互逻辑。这种树形结构通过“父-子”关系组织和复用场景元素,极大地提高了描述效率和灵活性。3.2与ISO/IEC23090系列其他标准的协同场景描述标准并非孤立存在,它与MPEG-I系列中的其他标准紧密耦合。-与ISO/IEC23090-2(OmnidirectionalMediaFormat-OMAF):场景描述可以作为“容器”,在其中嵌入多个OMAF360度视频流,实现从单一视点到全向视场的沉浸。-与ISO/IEC23090-5(PointCloudCompression-V-PCC)&-9(Geometry-basedPointCloudCompression-G-PCC):场景描述中的节点可以直接引用经过V-PCC或G-PCC压缩的点云码流,实现大规模点云数据的高效场景集成。-与ISO/IEC23090-12(Video-basedPointCloudCompression-V-PCCforVideo):类似地,也支持引用基于视频的点云压缩数据。-与ISO/IEC23090-16(Profile/Level):场景描述的定义需要符合特定的配置文件和级别(Profile/Level),以确保在特定硬件和带宽约束下的互操作性。3.3数据流与网络架构支持标准考虑了沉浸式内容分发的两种主要模式:下载与流传输。对于流传输场景,它定义了如何将场景描述的更新(例如,用户移动后,需要动态加载远处新出现的物体)打包成增量数据包,通过实时传输协议(如基于HTTP的动态自适应流-DASH)发送给客户端。这要求场景描述具有“可装配”的特性,即在播放过程中能够实时添加、修改或删除场景节点。4.主要参与单位介绍法国电信(OrangeS.A.)作为ISO/IEC23090-14:2023标准制定的主要贡献者之一,法国电信(OrangeS.A.)在标准框架的构建、关键技术的提出以及互操作性测试方面发挥了至关重要的作用。单位概况:法国电信是全球领先的电信运营商和数字服务提供商,总部位于法国巴黎。其研发部门(OrangeLabs)是全球通信与多媒体领域重要的研究机构之一,拥有数百名从事标准化工作的工程师和科学家。在MPEG(动态图像专家组)中,法国电信一直是长期活跃的核心成员。技术贡献:1.分层场景管理架构:法国电信的研究人员提出了基于“锚节点”和“动态更新图”的概念,解决了大规模静态场景与动态交互内容如何高效共存的问题。这一思想被融入到标准的场景图更新机制中,允许在服务器端管理一个庞大的“全量场景图”,而客户端仅维护一个“已激活”的子图,并根据用户位置和交互意图进行动态切换。2.网络感知的场景描述:利用其在移动通信网络领域的深厚积累,法国电信推动了场景描述对网络状况的自适应能力。标准中包含了描述媒体资产(如纹理、几何体)所需带宽和延迟要求的信息,使得内容分发服务器可以据此动态调整传输策略,避免网络拥塞导致体验下降。3.低时延交互逻辑的编码:针对VR/AR应用中常见的实时反馈需求(如用户伸手抓取物体),法国电信提出了一系列对“触发射频”和“响应动作”进行高效编码的优化方案。例如,将一段复杂的动画序列预计算并打包,使得交互事件发生后,客户端无需实时计算即可立即播放,显著降低了从用户操作到视觉反馈的端到端延迟。4.互操作性测试:法国电信主导并参与了多次MPEG-I互操作性测试活动,协调了来自索尼、三星、华为、高通等不同厂商的设备,验证了ISO/IEC23090-14标准描述的KPI(关键性能指标)能否在实际硬件上实现。影响与地位:由于其在标准制定中的卓越贡献,法国电信的专家多次担任MPEG-I工作组的重要职务,确保了标准在技术上的可行性和产业界的广泛接受度。其推动的“网络与场景深度融合”的理念,也成为后续标准化工作(如MPEG-IPhase2)的重要基础。5.标准现状分析与未来发展展望5.1标准废止的原因分析-技术演进:MPEG-I系列标准本身就是一个不断发展的体系。第一版(Phase1)侧重于基础场景描述,而后续的Phase2开始引入更高级的功能,如动态网格压缩、六自由度(6DoF)的普适性支持等。既然有更全面、更优化的新版本(如ISO/IEC23090-14的后续修订版或Part14的下一代标准)发布,旧版本自然会被废止,以引导产业界向新技术迁移。-产业反馈:在Phase1标准的试用过程中,产业界可能发现了一些不足之处,例如对复杂交互逻辑的描述不够灵活、在低端设备上的解析效率不高、或与某些主流商业引擎(如Unity,UnrealEngine)的导入导出流程不够顺畅。这些反馈促使标准化组织不得不放弃老版本,转而推出能够解决这些问题的演进版本(Amendment,Corrigendum,或新的Edition)。-与新兴标准的竞争与融合:同时期,工业界还涌现出如Khronos的glTF2.0、Pixar的开源USD等强势标准。MPEG作为国际标准组织,需要保持其标准的竞争力和兼容性。可能为了与这些主流格式更好地桥接或对齐,必须对底层的数据模型和存储结构进行重大调整,从而导致旧标准被废止。5.2未来发展方向1.向更高级的6DoF与全息表示演进:未来的场景描述将不再局限于“观看”,而是支持用户在场景中的完全自由移动(6DoF)。这意味着场景描述需要描述更大范围的、无限延伸的世界模型,并支持对几何、反射、光照进行动态、基于物理的实时计算,最终实现如“体积视频会议”、“全息通信”等下一代应用。2.集成AI驱动的场景生成与理解:AI的快速发展正深刻改变内容生产范式。未来的标准可能需要定义如何描述由AI生成或辅助生成的3D内容,例如,描述一个NeRF(神经辐射场)的输入参数、描述一个扩散模型的提示词(Prompt)与输出三维模型的映射关系。同时,场景描述也可以用于为AI提供关于场景语义的标注信息,辅助AI进行场景理解。3.强化对空间计算和感知交互的支持:随着AppleVisionPro、MetaQuest3等空间计算设备的兴起,场景描述需要更好地理解用户的物理环境。未来的标准可能会包含对“空间锚点”(将虚拟物体固定在现实世界的特定位置)、“遮挡网格”(让虚拟物体在现实物体后面)以及手部/眼动追踪交互的标准化描述。4.更高效的编码与流式传输:面对日益复杂的场景(例如整个数字孪生城市),如何对场景进行极致压缩和智能分块(如基于视觉显著性)进行自适应传输,是持续的研究热点。未来的场景描述标准将更深度地与网络协议(如QUIC、HTTP/3)和边缘计算相结合,实现毫秒级的场景加载和更新。结论ISO/IEC23090-14:2023《信息技术沉浸式媒体的编码表示第14部分:场景描述》标准的立项与废止,典型地反映了前沿技术标准化工作的动态性、挑战性与引领性。该标准虽然在技术迭代的洪流中完成了其阶段性使命,已因更先进的版本发布而被废

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论