版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
信息技术视听对象编码第15部分:ISO基本媒体文件格式的网络抽象层(NAL)单元结构化视频的承载修改件1:支持神经网络后滤波补充增强信息和其他改进标准立项发展报告EnglishTitle:StandardizationDevelopmentReport:Informationtechnology—Codingofaudio-visualobjects—Part15:Carriageofnetworkabstractionlayer(NAL)unitstructuredvideointheISObasemediafileformat—Amendment1:Supportforneural-networkpost-filtersupplementalenhancementinformationandotherimprovements摘要本报告旨在全面阐述国际标准ISO/IEC14496-15:2024/Amd1:2025的立项背景、核心技术内容及其对视频编码与媒体传输领域的重要意义。该标准修改件针对日益增长的高效视频压缩与智能处理需求,旨在扩展ISO基本媒体文件格式(ISOBMFF)对神经网络后滤波(NNPF)补充增强信息(SEI)的承载能力,并对现有视频编码封装机制进行其他关键性改进。报告首先回顾了视频编码标准的发展历程,特别是从H.264/AVC到H.266/VVC演进中,ISOBMFF作为通用媒体容器格式的核心地位及其面临的挑战。随后,详细解析了NNPF技术的原理及其在提升视频主观与客观质量方面的潜力,并阐述了将其SEI消息无缝集成到ISOBMFF中的技术路径,包括信号指示、参数集配置和兼容性设计。此外,报告还介绍了修改件中涉及的其他改进,例如对多视角视频编码(MVC)、可分级视频编码(SVC)等扩展格式的封装优化,以及对现有数据的时序同步和随机访问能力的增强。本报告的核心结论是:ISO/IEC14496-15:2024/Amd1:2025标准的立项与发布,是应对人工智能与视频处理深度融合趋势的及时响应,它不仅为神经网络后处理滤波器提供了标准化的部署接口,更通过一系列精妙设计,确保了视频内容在编码、传输、解码和渲染全链路中的高效性与互操作性,对推动超高清视频、流媒体、视频会议及虚拟现实等应用的智能化发展具有里程碑意义。关键词:ISO/IEC14496-15;MPEG-4;ISO基本媒体文件格式;网络抽象层;神经网络后滤波;补充增强信息;视频编码;标准修订Keywords:ISO/IEC14496-15;MPEG-4;ISOBaseMediaFileFormat;NetworkAbstractionLayer;Neural-NetworkPost-Filter;SupplementalEnhancementInformation;VideoCoding;StandardAmendment正文1.引言:背景与需求随着视频消费的爆炸式增长和显示技术的不断进步,视频编码标准也从早期的MPEG-2、H.264/AVC发展到如今的H.265/HEVC和H.266/VVC,其压缩效率已接近信息论的理论极限。然而,在追求极致压缩的同时,编码过程不可避免地引入了各种失真。传统的环路滤波技术,如去块滤波(DBF)、样本自适应偏移(SAO)和自适应环路滤波(ALF),在改善解码图像质量方面发挥了重要作用,但其性能受限于固定的数学模型。现有的ISO基本媒体文件格式(ISOBMFF,定义于ISO/IEC14496-12和本标准的第15部分)作为多媒体内容的通用容器,广泛应用于MP4、QuickTime、DASH等场景。然而,它缺乏对NNPF这种结构化神经网络模型及其关联元数据的原生支持。因此,ISO/IEC14496-15:2024/Amd1:2025标准的立项,核心目标就是填补这一空白,为AI赋能的下一代视频应用提供标准的承载和交换接口。2.核心技术内容解析本修改件主要围绕以下几个方面展开:2.1神经网络后滤波(NNPF)SEI消息的承载这是本次修改的核心。其主要内容包括:-新的样本条目(SampleEntry)类型:定义了新的描述符,用于标识媒体轨道中包含了NNPFSEI消息。这允许解码器在解析文件时,即可识别出需要或可以使用NNPF处理的流。-神经网络模型样本(NeuralNetworkModelSamples):定义了如何将训练好的神经网络模型(包括其结构、权重、偏置等参数)打包成ISOBMFF中的样本。这些样本可以携带在专用的元数据轨道中,或者作为视频轨道本身的辅助数据。模型可以被序列化为通用的交换格式(如ONNX、OpenVINO的中间表示),或采用MPEG定义的具体语法。-参数集存储:NNPFSEI消息通常需要多个参数,包括模型标识符、输入/输出格式(如色彩空间、位深、分辨率)、推理过程的控制参数等。本修改件明确了这些参数集在文件中的存储位置(如“SampleDescriptionBox”或“SampleGroupBox”),确保解码器能正确加载并实例化神经网络模型。-时间同步与实例管理:规定了NNPFSEI消息与对应的解码图像样本之间的时间关联方式。可以是一个SEI消息应用于单帧、一组连续帧,或作为一个长期生效的配置。这通过ISOBMFF中的“SampleGroup”机制或“TrackReference”机制实现,保证了AI推理的时间维度的正确性。-兼容性与回退机制:强调标准文件格式的兼容性。支持NNPF的解码器可以按需调用模型进行后处理;不支持NNPF的解码器则可以直接忽略相关SEI消息,正常解码显示基础视频流,不会影响基本播放功能和图像质量。2.2对其他改进的支持-增强的SEI消息承载:除了NNPF,本次修改还优化了对其他新型SEI消息的通用承载能力,特别是那些在H.266/VVC等新标准中引入、与工具集相关的SEI消息。这确保了格式的前瞻性。-基于NAL单元的媒体数据组织的优化:对NAL单元的结构化存储进行了微调,以更好地支持高性能的解析和零拷贝操作。例如,明确了在文件存储和解码过程中,如何高效处理VCLNAL单元和非VCLNAL单元(如参数集、SEI)的混合访问。-对子样本(Sub-Sample)信息和抽吸(Extraction)信息的精炼:针对可伸缩视频编码(SVC)、多视角视频编码(MVC)以及H.266/VVC中的多层编码,改进了子样本的描述,使得解码器可以更精确地定位和抽取某一路增强层或视角的数据,这对于支持自适应码率流媒体和沉浸式媒体体验至关重要。-时间元数据对齐:改进了其他时间相关元数据(如落雨时间、场景变更信息)与视频帧的精确对齐方式,提升了编辑和后期制作的精确度。3.标准制定参与单位介绍:Fraunhofer海因里希·赫兹研究所(FraunhoferHHI)本标准的制定汇聚了全球顶尖的研究机构与产业力量,其中德国弗劳恩霍夫应用研究促进协会旗下的海因里希·赫兹研究所(FraunhoferHeinrichHertzInstitute,FraunhoferHHI)扮演了至关重要的角色。机构概览:FraunhoferHHI位于德国柏林,是世界领先的通信技术、媒体技术和光子学研究中心。其视频编码与分析部门在视频压缩、传输和处理领域拥有超过30年的深厚积淀,是众多国际视频编码标准(包括H.264/AVC、H.265/HEVC、H.266/VVC等)的核心贡献者,被誉为“视频编码技术的心脏”。该研究所深度参与了MPEG(MovingPictureExpertsGroup)几乎所有重要标准的制定工作。在本标准中的贡献:针对ISO/IEC14496-15:2024/Amd1:2025,FraunhoferHHI的贡献主要集中在以下几个方面:1.核心技术提案:HHI的研究人员最早提出了将神经网络后滤波(NNPF)作为标准化的SEI消息集成到媒体文件格式中,并提出了具体的语法和语义提案。他们不仅提供了技术方案,还搭建了演示系统,通过大量的实验数据证明了该方案的可行性与显著性能增益,有力地说服了MPEG专家组采纳该技术方向。2.模型序列化与部署框架设计:HHI参与了神经网络模型如何在ISOBMFF中高效、安全地存储和传输的框架设计。他们提出的概念借鉴了其在机器学习模型压缩和部署方面的研究成果,确保了模型可以被不同平台(CPU、GPU、NPU)的解码器正确解析和加载,避免了因模型不一致导致的互操作性问题。3.互操作性与测试:作为技术标准的积极推动者,HHI开发了参考软件和符合性测试用例。这些测试用例覆盖了从简单的单帧NNPF应用到复杂的多层视频流处理场景,确保了不同厂商实现的解码器和播放器能够在遵循本标准的前提下,正确地处理NNPFSEI消息和其他新增特性,有效避免了市场上可能出现的兼容性混乱。4.撰写标准文本:HHI的专家直接参与了标准文本的撰写和编辑工作,特别是在描述样本条目类型、轨道间参考关系、模型参数集存储格式等关键技术点的章节,其严谨的语言和清晰的逻辑结构对于标准能够顺利通过ISO/ITU-T的批准起到了关键作用。影响力与贡献:FraunhoferHHI的深度参与,不仅仅是贡献了几个技术方案,更重要的是为整个标准注入了学术界的前沿性和产业界的实用性。他们深知,一个成功的标准不仅要解决当下的技术难题,更要为未来十年甚至更久的演化留出空间。因此,在设计NNPF的承载框架时,他们刻意保持了足够的灵活性,使得未来的新型神经网络架构(如Transformer-based模型、扩散模型)也能在不修改核心文件格式的前提下被接入。这种前瞻性设计,正是像FraunhoferHHI这样的顶级研究机构的独特价值所在。4.标准的影响与价值-推动视频产业的AI化转型:本修改件提供了标准化的“插槽”,让后端的AI增强能力能够以标准插件的形式无缝接入现有的视频工作流。流媒体服务商、视频会议软件开发商、安防监控系统集成商等均可依此标准,为其用户提供“一键开启AI画质增强”的全新体验,而无需担心兼容性问题。-降低AI部署门槛:对于设备制造商(如电视、机顶盒、手机)而言,标准化的NNPFSEI消息意味着他们可以根据硬件能力,灵活地选择是否支持该功能。支持者可以直接解码并执行标准定义的神经网络模型,无需与内容提供商进行复杂的私有协议对接,从而加速AI画质增强技术的落地普及。-促进编码技术的融合创新:当NNPF成为一种标准的、可选的工具后,未来的视频编码器可以更积极地探索“非对称”压缩策略,即在前端编码时可采用更激进的量化参数以节省码率,而后端的NNPF则负责修复由此带来的失真。这种编码与后处理的协同优化,将有望突破传统编码理论的限制,进一步逼近率失真曲线的理论边界。5.结论与展望ISO/IEC14496-15:2024/Amd1:2025《信息技术视听对象编码第15部分:ISO基本媒体文件格式的网络抽象层(NAL)单元结构化视频的承载修改件1:支持神经网络后滤波补充增强信息和其他改进》的发布,是国际视频编码标准化进程中一个里程碑式的节点。它不仅是对现有媒体容器格式的一次重要技术升级,更是标准体系主动拥抱人工智能浪潮的战略性举措。通过对NNPF这一关键AI能力的标准化封装,该标准解决了神经网络模型在媒体文件中“如何存放、如何寻址、如何加载、如何关联”等根本性问题,为智能视频生态的构建铺设了坚实的数字地基。展望未来,我们可以预见这一标准将产生深远影响:1.标准的持续迭代:随着神经网络架构的快速演进(例如,从卷积神经网络到注意力机制和Transformer),标准的内容也会随之更新,以支持更复杂的模型结构和更高效的推理部署。未来的修改件可能会涉及模型微调、增量
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 医护人员职业道德教育测试题及答案
- 学校心理学试题及答案
- 新保险法竞赛考试题及答案
- 小学音乐教师专业水平试题及答案
- 小学数学教师新课标考试试题(含答案)
- 2026年秋季开学第一课:校园安全记心间
- 2026 年秋季开学小学生食品安全健康课
- 2026 年职业健康与安全生产同步推进课堂
- 2026 年基层安全生产管理人员能力培训
- 消防设施操作员(中级)考试题库及答案
- 定向钻施工合同协议书
- 巨人通力电梯NOVA GKE调试说明书故障代码GPN15 GVN15-GKE - 51668093D01-2022
- 2025数学步步高大一轮复习讲义人教A版复习讲义含答案
- 简约劳务合同范本
- JT-T-776.3-2010公路工程玄武岩纤维及其制品第3部分:玄武岩纤维土工隔栅
- GB/T 25849-2024移动式升降工作平台设计、计算、安全要求和试验方法
- DCS系统检修工作文件包
- 会计从业培训讲义
- 玻璃钢化炉的操作技巧
- 本溪市事业单位考试历年真题
- 人教版六年级数学上册分数乘除法应用题专项练习题
评论
0/150
提交评论