CN119452649A 图像编码和解码的方法和装置 (华为技术有限公司)_第1页
CN119452649A 图像编码和解码的方法和装置 (华为技术有限公司)_第2页
CN119452649A 图像编码和解码的方法和装置 (华为技术有限公司)_第3页
CN119452649A 图像编码和解码的方法和装置 (华为技术有限公司)_第4页
CN119452649A 图像编码和解码的方法和装置 (华为技术有限公司)_第5页
已阅读5页,还剩100页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2024.12.30PCT/RU2022/0002092022.06.30WO2024/005660EN2024.01.04本发明涉及用于使用神经网络的系统的图的,然后所述目标增益矢量被用于编码所述图2获得用于所述图像的第一译码参数,其中,所述第一译码参数的基于所述第一译码参数、所述预设最小值和对应于所述预设最小值的第一增益矢量,5.根据权利要求2至4中任一项所述的方法,其基于所述第一译码参数、所述预设最大值和对应于所述预设最大值的第二增益矢量,9.根据权利要求6至8中任一项所述的方法,其特征在34解析所述码流以获得第一译码参数,所述第一译码参数的值小于基于所述第一译码参数、所述预设最小值和对应于所述预设最小值的第一增益矢量,基于所述第一译码参数、所述预设最大值和对应于所述预设最大值的第二增益矢量,5使用熵解码解析所述码流以获得所述图像的36.根据权利要求34或35所述的方法,其特征在于,所述第一潜在表示是形状为wxhx6述一个或多个处理器执行根据权利要求1至38中任一42.一种存储介质,其特征在于,所述存储介质存储通过使用根处理器,耦合到所述存储器,所述处理器用于实现所述指令以使所述处理器,耦合到所述存储器,所述处理器用于实现所述指令以使所述发送单元,耦合到所述接收单元,所述发送单元用于向存储器,耦合到所述接收单元或所述发送单元中的至少一个,执行根据权利要求1至20中任一项和根据权利要求21至38中78些实施例涉及用于使用多个处理层编码和解码来自码流的图像和频压缩标准(如高效视频编码(high_efficiencyvideocoding,HEVC)、通用视频编码[0003]最近,神经网络架构已应用于图像和/或视频译码。通常,这些基于神经网络在设备与云之间或在不同设备之间)划分的神经网[0008]本发明提供了提高经预训练的图像或视频译码模型的灵活性的方法和装置。因9[0015]在一种可能的实现方式中,当所述第一译码参数的所述值小于所述预设最小值[0024]在一种可能的实现方式中,当所述第一译码参数的所述值大于所述预设最大值[0033]在一种可能的实现方式中,当所述第一译码参数的所述值小于所述预设最小值[0035]在一种可能的实现方式中,当所述第一译码参数的所述值大于所述预设最大值[0037]在一种可能的实现方式中,所述基于所述第一译码[0038]这种方法可以通过使用更多的经预训练的β值及其对应的增益矢量来提供更高的[0042]在一种可能的实现方式中,当所述第一特征图是所述图像的亮度样本的特征图[0043]在一种可能的实现方式中,当所述第一特征图是所述图像的色度样本的特征图[0044]在一种可能的实现方式中,所述方法还包括获得用于所述图[0046]在一种可能的实现方式中,所述第一译码参数编码在所述码流的图像参数集译码参数的值中的至少一个值小于预设最小值或大于预[0053]在一种可能的实现方式中,当所述第一译码参数的所述值小于所述预设最小值[0063]这种方法能够解码通过使用译码参数的两个最接近的预设值及其对应的增益矢[0074]在一种可能的实现方式中,所述基于所述第一译码参数获得目标逆增益矢量包[0080]在一种可能的实现方式中,所述方法还包括解析所述码流以的装置可以参考与根据第二方面所述的用于解码的方法相同的有利效果。此处不再赘述。的装置可以参考与根据第一方面所述的用于编码的方法相同的有利效果。此处不再赘述。据本发明第一方面所述的方法的其它特征和实现方式对应于根据本发明第四方面所述的据本发明第二方面所述的方法的其它特征和实现方式对应于根据本发明第三方面所述的述第一方面或第二方面或所述第一方面或第二方面的任一可能的实施计算机中执行时执行根据所述第一方面或第二方面或所述第一方面或第二方面的任一可据第一方面或第二方面或所述第一方面或第二方面的任一可通过执行根据本发明第二方面或第二方面的任一可能的实施例所述的方备、根据本发明第四方面或第六方面所述的编码设备或本发明第十四方面所述的译码装可互换的,这仅仅是在本申请的实施例中描述具有相同属性的对象时使用的一种区分方[0130]人工神经网络(artificialneuralnetwork,ANN)或连接论系统是一种计算系[0131]ANN是基于被称为人工神经元的连接单元或节点的集合,这些连接单元或节点对输出层以及多个隐藏层组成。输入层是提供输入(积层的感受野。其它函数也用于增加非线性,例如饱和双曲正切函数和sigmoid函数或[0144]在几个卷积层和最大池化层之后,神经网络中的高级推理是通过全连接层完成的偏差,并且通常是神经网络的最后一层。可以使用适合于不同任务的各种损失函数。两个连接的层之间同步,例如当前层的输入通道的数量应等于前一层的输出通道的数量。对于处理输入数据(例如图像)的第一层,输入通道的数量通常等于数据表示的通道的数量的概率分布通常比标准自动编码器更接近训练数据的概率分布。VAE的目标具有以下形离散正弦变换(discretesinetransform,DST),以及低频不可分离手动优化变换(low[0166]潜在空间可以理解为压缩数据的表示,其中类似的数据点在潜在空间中更接(arithmeticcoding,AE)将超先验3的经量化潜在表示和边信息包括到码流2中(二值二值化数字串被包括在码流中,码流可以包括对应于经编码图像或其它边信息的其它部的经量化边信息2被变换(107)为经解码边信息j'。y'表示的统计特性(例如的样本的平是提取码流1的互相关信息。由第二子网提供的统计信息可以由算术编码器(arithmetic12x和14x表示的编码器和解码器的组件在其功能上可以对应于上面在图3A中提到的并用编码过程效率或负责将经压缩输出y转换为一系的图像密度建模(DensityModelingofImagesUsingaGeneralizedNormalization中神经元模型启发的广义除法归一化(generalizeddivisivenormalization,GDN)联合作为边信息发送。然后,编码器使用量化矢量来估计用于获得算术编码(arithmetic图像表示(或潜在表示)。解码器首先从经压缩信号中恢复2然后,解码器使用hs获取,这此外,量化操作和作为组件413或415的一部分的对应量化单元不一定存在和/或可以被另层411与410之间提供另一个层420,该层被实现为卷积层,但不对接收到的输入提供上采[0195]机器视频编码(videocodingformachine,VCM)是当今流行的另一个计算机科以认为计算节点是属于同一神经网络且相互通信以在神经网络内/为神经网络传送经译码[0197]一些作品通过编码深度特征然后从这些特征中重建输入图像来呈现语义图像压[0198]如今,视频内容对互联网流量的贡献超过80预计这一比例将进一步上升。因[0200]基于DNN的图像压缩方法可以利用大规模端到端训练和高度非线性变换,而这些化残差和运动信息的基于率失真的目标来构建基于DNN的视频压缩系统。率失真优化“DVC:端到端深度视频压缩框架(DVC:AnEnd_to_endDeepVideoCompressionFramework)”,IEEE/CVF国际计算机视觉与模式识别大会(CVPR)会议记录,2019年,第[0208]机器视频编码(videocodingformachine,VCM)是当今流行的另一个计算机科[0211]使用流行的YOLOv2网络进行目标检测任务的方法解决了协同智能的深度特征压编码设备(编码设备执行方法700对图像进行编码s)和预设最大神经网络模型的模型权重。在模型训练阶段获得经预训练的β的可能值集合和对应的增益0β………………βN-1[0231]表2是亮度样本的经预训练β和对应增益矢量的示例性表。表3是色度样本的经预β…………βN1-1β…………βN2-1[0247]在一个可能的实施例中,使用β的最接近的两个经预训练值及其对应的增益矢量mtv的下一个最接近的经预训练值(在图8中表示为βr)及其对应的增益矢量mr用可能实现是:[0249]其中,K是超参数,用于控制mv与其下一个最接近的经预训练增益矢量之间的关何实施例及其任何可能的设计或可能的实现入图像x(即图像)映射到潜在表示(由y表示)中。函数f()是将输入信号x转换为更可压缩j=Q()将潜在表示变换为具有(离散)值的经量码流1中。熵编码过程可以由图10中所示的算术编码器(arithmeticencoder,AE)1005执本的目标增益矢量,可以执行步骤703两次,并且基于它们对应的目标增益矢量使用方法900独立编码亮度样本和色度样本。经编码的亮度样本和色度样本可以打包到码流中以存一种可能的实现方式中,第一译码参数在码流的图像参数集(pictureparameterset,PPS)中编码或指示。在一种可能的实现方式中,第一译码参数在码流的序列参数集法700基于第一译码参数编码色度样本时,使用方法700基于第二译码参数编码亮度样本。compression_quality_level_luma)。第二译码参数的指示方式与第一译码参数的指示方数的值中的至少一个值小于预设最小值或大于预设[0286]根据图7的实施例可以用于提供通过参考图11描述的解码方法容易解码的输出。图7的方法700将被描述为由位于一个或多个位置的一个或多个计算机的神经网络系统执计中,第一标志是第一译码参数的以2为底的对数形式(如log2_compression_quality_质量的第一译码参数(表示为βY)相关时,第二标志(例如compression_quality_level_chroma)与指定图像的色度样本的压缩质量的第二译码参数(表示为βUV)相关。当第一标志(例如compression_quality_level_chroma)与指定图像的色度样本的压缩质量的第一译示为βY)相关,第二分量与指定图像的色度样本的图8描述的方法获得目标增益矢量mv。然后,基于目标增益矢量可以获得目标逆增益矢量v[0297]在一种可能的设计中,在训练阶段获得经预训练的β的可能值集合和对应的逆增一潜在表示;步骤1202,基于第一潜在表示和目标逆增益矢量获得第二潜在表示;步骤[0300]在步骤1201中,执行熵解码过程以将二值化数字转换回样本值(即,第一潜在表的逆增益单元1013执行。增益单元1013的输入(用表示)是AD1006的输出。逆增益单元益矢量的每个元素都可以映射到的特征图通道。在一种可能的实现方式中,逆增益单元益单元1014用于处理图10中AD1[0310]基于图10所示的框架,提供了一个简单的示例来说明所提供的方法的技术效图。视频译码系统10中的视频编码器20(或简称为编码器20)和视频解码器30(或简称为解处理单元)18(例如图像预处理器18)和通信接口或通信单[0324]图像源16可以包括或者可以是任何类型的用于捕获真实世界图像的摄像机等图像捕获设备,和/或任何类型的用于生成计算机动画图像的计算机图形处理器等图像生成容、虚拟现实(virtualreality,VR)图像)和/或其任意组合(例如增强现实(augmentedreality,AR)图像)的其它设备。图像源可以是任何类型的存储任一上述图像的存储器处理图像19或经预处理图像数据19。预处理器18执行的预处理可以包括修剪(trimming)、[0330]目的地设备14中的通信接口28用于直接从源设备12或从存储设备(例如经编码图[0331]通信接口22和通信接口28可以用于通过源设备12和目的地设备14之间的直接通[0332]例如,通信接口22可以用于将经编码图像数据21封装成合适的格式(例如数据的对应传输解码或处理方式和/或解封装方式对传输数据进行处理,以获取经编码图像数[0334]通信接口22和通信接口28均可配置为图15中从源设备12指向目的地设备14的通输)相关的任何其它信息等。解码器30用于接收经编码图像数据21并提供经解码图像数据[0335]目的地设备14中的后处理器32用于对经解码图像数据31(也称为重建图像数据)(例如经解码图像31)进行后处理,以获取经后处理的图像数据33(例如经后处理的图像如集成或外部显示器或显示屏。例如,显示器可以包括液晶显示器(liquidcrystal还可以包括两种设备或两种功能,即源设备12或对应功能以及目的地设备14或对应功能。硬件和/或软件或通过单独的硬件和/或软件或其任意组合[0338]根据描述,图15所示的源设备12和/或目的地设备14中具有和(准确)划分的不同解码器30两者均可通过处理电路实现,例如一个或多个微处理器、数字信号处理器(digitalsignalprocessor,DSP)、专用集成电路(application_specificintegrated地在软件中实现,则设备可以将软件指令存储在合适的非瞬时性计算机可读存储介质中,设备可以对数据进行编码并且将数据存储到存储器中,和/或视频解码设备可以从存储器编码到存储器和/或从存储器检索数据并对数据进行解码的[0343]视频译码设备8000包括用于接收数据的入端口8010(或输入端口8010)和接收单元(Rx)8020;用于处理数据的处理器、逻辑单元或中央处理单元(centralprocessing单元8040和出端口8050耦合的光电(optical_to_electrical,OE)组件和电光由处理器8030执行的指令来实现基于神经网络的编解码器8数据。例如,存储器8060可以是易失性和/或非易失性的,并且可以是只读存储器(read_(ternarycontent_addressablememory,TCAM)和/或静态随机存取存储器(static[0348]在一种实现方式中,装置9000中的存储器9004可以是只读存储器(readonly器9018可以是将显示器与触敏元件组合的触敏显示器,该触敏元件能够用于感测触摸输且可以包括单个集成单元(例如一个存储卡)或多个单元(例如多个存储卡)。因此,装置至少一个备份可以存储在与存储原始码流的存储介质不

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论