CN115499657B 视频码率自适应网络的训练方法、应用方法、装置及设备 (深圳市腾讯计算机系统有限公司)_第1页
CN115499657B 视频码率自适应网络的训练方法、应用方法、装置及设备 (深圳市腾讯计算机系统有限公司)_第2页
CN115499657B 视频码率自适应网络的训练方法、应用方法、装置及设备 (深圳市腾讯计算机系统有限公司)_第3页
CN115499657B 视频码率自适应网络的训练方法、应用方法、装置及设备 (深圳市腾讯计算机系统有限公司)_第4页
CN115499657B 视频码率自适应网络的训练方法、应用方法、装置及设备 (深圳市腾讯计算机系统有限公司)_第5页
已阅读5页,还剩96页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

视频码率自适应网络的训练方法、应用方本申请实施例公开了一种视频码率自适应调整视频码率自适应网络的网络参数进行内循2基于每个所述第一网络输出的决策码率与所述第一网络环境个观测量以及K个决策码率输入至所述第一网络的第一决策网络,通过所述第一决策网络个观测量和K个决策码率输入至所述第一网络的第一评价网络,通过所述第一评价网络输率对应的K个第一奖励值;基于所述当前时刻的K个决策码率对应的K个第一奖励值对所述重新采样所述N个元学习任务对应的N个不同类的第二网络状态组,并将N个不同类的状态组用于模拟每个经过所述内循环更新的第一网络的基于每个经过所述内循环更新的第一网络输出的决策码率与所述第每个所述第二网络环境包括K个不同时间长度的第二带宽轨迹;针对于每个经过所述内循新决策码率分别与所述第二网络环境中的当前时刻的K个第二带宽轨迹进行交互,得到当前时刻的K个新观测量;基于所述当前时刻的K个新观测量计算得到所述当前时刻的K个新决策码率对应的K个第二奖励值;基于N个元学习任务的所述当前时刻的K个新决策码率对视频码率自适应网络的初始化网络参数进行外循所述N个元学习任务的奖励值满足收敛条件,所述初始化视频码率自适应网络更新得到待获取目标视频传输过程中对应的当前类别的网络状态组,状态组用于模拟所述待调整视频码率自适应网络的当基于所述待调整视频码率自适应网络输出的决策码率与所述当前类别3获取第一历史网络轨迹,其中,所述第一历史网络轨迹包基于时间维度,对所述第一历史网络轨迹进行带宽估计以及过基于时间维度,对第二历史网络轨迹进行所述带宽估计以及过基于每个所述时间窗口对应的单位时间带宽,对所述第二历史在所述目标视频传输过程中,对目标时间段内的网络轨迹若所述交叉熵大于交叉阈值,则基于所述当前概率密度函数重基于每个所述时间窗口对应的单位时间带宽,映射得到所述第4对所述网络状态散点图进行散点的密度计算以及线性插值处理,得计算当前类别的网络状态组与目标视频传输过程中上一时间的网络状态组之间的均若所述均值差值、所述标准差的差值或所述波动差的差值中若所述均值差值、所述标准差的差值以及所述波动差的差值基于所述当前类别的网络状态组模拟所述当前类别网络获取目标视频传输过程中对应的当前观测量将所述当前观测量以及当前决策码率输入至所述待调整视频码率自适应网络的待调将所述下一时刻的决策码率分别与所述当前类别网络环境中的下一时刻的K个当前带将所述下一时刻的K个观测量和所述下一时刻的决策码率输入至所述待调整视频码率基于所述下一时刻的K个观测量以及所述下一时刻的决策码率计算得到下一时刻的K基于所述下一时刻的K个奖励值对所述待调整决策网络以及所述待调整评价网络的网5将所述当前类别的网络状态组对应的当前丢包率以及当前往返时延获取目标视频传输过程中对应的当前网络状态组、当前观测量以若所述当前网络状态组的类别未发生变化,则将所述当前观目标决策码率输入至权利要求1至9中任一项所述的目标视频码率自适应网络中的目标决基于所述下一时刻的目标决策码率调节发送速率以基于调节后的发送速率以及视频编辑码率对所述目标若所述当前网络状态组的类别发生变化,则基于当前类别基于所述待调整视频码率自适应网络输出的决策码率与所述将所述当前观测量以及所述当前时刻的目标决策码率输入至所述新目标视频码率自基于所述下一时刻的目标决策码率调节发送速率以基于调节后的发送速率以及视频编辑码率对所述目标获取单元,用于基于每个所述第一网络输出的决策码率与所述述每个决策码率对应的第一奖励值,以对所述第一网络的初始化网络参数进行内循环更述第一网络环境中的当前时刻的K个第一带宽轨迹进行交互,得到当前时刻的K个观测量;述第一评价网络输出下一时刻的评价值;基于所述当前时刻的K个观测量计算得到所述当6所述处理单元,还用于重新采样所述N个元学习任务对应的N个不同所述获取单元,还用于基于每个经过所述内循环更新的第一网络输出将所述当前时刻的K个新决策码率分别与所述第二网络环境中的当前时刻的K个第二带宽所述当前时刻的K个新决策码率对应的K个第二奖励值;基于N个元学习任务的所述当前时刻的K个新决策码率对应的K个第二奖励值进行加和取平均,得到当前时刻的奖励平均值;基于所述当前时刻的奖励平均值对所述初始化视频码率自适应网络的初始化网络参数进至所述内循环更新后的所述N个元学习任务的奖励值满足收敛条件,所述初始化视频码率所述当前类别的网络状态组用于模拟所述待调整视频码率自适应网络的当前类别网络环所述获取单元,还用于基于所述待调整视频码率自适应网络输出的决所述处理单元,还用于基于时间维度,对所述第一历史网络轨迹进7基于时间维度,对第二历史网络轨迹进行所述带宽估计以及过基于每个所述时间窗口对应的单位时间带宽,对所述第二历史所述获取单元,还用于若所述交叉熵大于交叉阈值,则基于所述当基于每个所述时间窗口对应的单位时间带宽,映射得到所述第对所述网络状态散点图进行散点的密度计算以及线性插值处理,得计算当前类别的网络状态组与目标视频传输过程中上一时间的网络状态组之间的均若所述均值差值、所述标准差的差值或所述波动差的差值中若所述均值差值、所述标准差的差值以及所述波动差的差值8基于所述当前类别的网络状态组模拟所述当前类别网络获取目标视频传输过程中对应的当前观测量将所述当前观测量以及当前决策码率输入至所述待调整视频码率自适应网络的待调将所述下一时刻的决策码率分别与所述当前类别网络环境中的下一时刻的K个当前带将所述下一时刻的K个观测量和所述下一时刻的决策码率输入至所述待调整视频码率基于所述下一时刻的K个观测量以及所述下一时刻的决策码率计算得到下一时刻的K基于所述下一时刻的K个奖励值对所述待调整决策网络以及所述待调整评价网络的网将所述当前类别的网络状态组对应的当前丢包率以及当前往返时延获取单元,用于获取目标视频传输过程中对应的当前网络状态组处理单元,用于若所述当前网络状态组的类别未发生变化,则将所述所述当前时刻的目标决策码率输入至权利要求1至9中任一项所述的目标视频码率自适应所述处理单元,还用于基于调节后的发送速率以及视频编辑码率对所述获取单元,还用于基于所述待调整视频码率自适应网络输出的决所述处理单元,还用于将所述当前观测量以及所述当前时刻的目标决所述确定单元,还用于基于所述下一时刻的目标决策码率调节发送速9所述处理单元,还用于基于调节后的发送速率以及视频编辑码率对所述总线系统用于连接所述存储器以及所述处理器,以使所述存储杂化的通信环境(如移动性、室内/外、人员分布密集度等)以及其他影响因素(如喜好等频码率自适应网络对多样化高速波动网络环境的适[0008]重新采样N个元学习任务对应的N个不同类的第二网络状态组,并将N个不同类的状态组用于模拟待调整视频码率自适应网络的当[0021]处理单元,还用于重新采样N个元学习任务对应的N个不网络状态组用于模拟每个经过内循环更新的第一化视频码率自适应网络的初始化网络参数的更新,以获取新的待调整视频码率自适应网[0046]将当前时刻的K个决策码率分别与第一网络环境中的当前时刻的K个第一带宽轨[0048]基于当前时刻的K个观测量计算得到当前时刻的K个决策码率对应的K个第一奖励[0049]基于当前时刻的K个决策码率对应的K个第一奖励值对第一决策网络以及第一评策码率输入至经过内循环更新的第一网络的第一决策网络,输出当前时刻的K个新决策码[0056]将当前时刻的K个新决策码率分别与第二网络环境中的当前时刻的K个第二带宽[0057]基于当前时刻的K个新观测量计算得到当前时刻的K个新决策码率对应的K个第二[0058]基于N个元学习任务的当前时刻的K个新决策码率对应的K个第二奖励值进行加和[0059]基于当前时刻的奖励平均值对初始化视频码率自适应网络的初始化网络参数进码率自适应网络输出的决策码率与当前类别网络环境,获取每个决策码率对应的奖励值,以对待调整视频码率自适应网络的网络参数进行内循环更新,直至奖励值满足收敛条件,态组对应的目标视频码率自适应网络作为当前类别对应的目标视频码[0067]将当前观测量以及当前决策码率输入至待调整视频码率自适应网络的待调整决[0068]将下一时刻的决策码率分别与当前类别网络环境中的下一时刻的K个当前带宽轨[0069]将下一时刻的K个观测量和下一时刻的决策码率输入至待调整视频码率自适应网[0071]基于下一时刻的K个奖励值对待调整决策网络以及待调整评价网络的网络参数进[0073]处理单元,还用于将当前类别的网络状态组对应的当前丢包率以及当前往返时[0074]处理单元,还用于当该当前丢包率大于丢包阈值或当前往返时延大于时延阈值[0079]处理单元,还用于基于调节后的发送速率以及视频编辑码率对目标视频进行传[0084]确定单元,还用于基于下一时刻的目标决策码率调节发送速率以及视频编辑码[0085]处理单元,还用于基于调节后的发送速率以及视频编辑码率对目标视频进行传视频码率自适应网络具有能够快速学习并快速生成适配网络状态组的最佳视频码率的能[0108]图16是本申请实施例中视频码率自适应网络的训练方法的一个元训练流程示意[0110]图18是本申请实施例中视频码率自适应网络的训练方法的一个元测试流程示意[0111]图19是本申请实施例中视频码率自适应网络的训练方法的一个预处理流程示意[0112]图20是本申请实施例中视频码率自适应网络的训练方法的一个交互视频通过视[0113]图21(a)是本申请实施例中视频码率自适应网络的训练方法的一个交互视频的界[0114]图21(b)是本申请实施例中视频码率自适应网络的训练方法的另一个交互视频的[0115]图21(c)是本申请实施例中视频码率自适应网络的训练方法的一个视频应用的界频码率自适应网络对多样化高速波动网络环境的适状态轨迹以及网络状态组等相关的数据,当本申请以上实施例运用到具体产品或技术中[0123]而云计算(cloudcomputing)是一种计算模式,它将计算任务分布在大量计算机上可以部署PaaS(PlatformasaService,平台即服务)层,PaaS层之上再部署SaaS[0127]其次,云存储(cloudstorage)是在云计算概念上延伸和发展出来的一个新的概配物理存储空间,该物理存储空间可能是某个存储设备或者某几个存储设备的磁盘组成。象的容量估量(该估量往往相对于实际要存储的对象的容量有很大余量)和独立冗余磁盘似的方式做出反应的智能机器。人工智能也就是研究各种智能机器的设计原理与实现方[0135]应理解的是,本申请提供的视频码率自适应网络的训练方法可应用于各种场景,别的网络状态组来获取奖励值,对待调整视频码率自适应网络的网络参数进行内循环更[0141]在本实施例中,为了更好地对初始化视频码率自适应网自适应网络包括决策网络和评价网络,初始化视频码率自适应网络设置有初始化网络参17所示意的决策网络中一个第一决策网络输出的上一时刻的K个决策码率,以及基于上一时刻的K个决策码率与K个不同时间长度的第一带宽轨迹交互得到的上一时刻的K个观测量和K个决策码率输入至如图17所示意的评价网络中的第一评价网络,通过第一评价网络输码率对应的K个第一奖励值,具体可以是基于预设的平滑度以及K个观测量中的每个观测量,其中,每个观测量包括的吞吐量、时延以及丢包率,采用奖励公式:奖励=+吞吐量以基于当前时刻的K个决策码率对应的K个第一奖励值对第一决策网络以及第一评价网络[0149]在步骤S103中,重新采样N个元学习任务对应的N个不同网络状态组用于模拟每个经过内循环更新的第一以基于第二网络状态组,更好地对初始化视频码率自适应网络的初始化网络参数进行更可以基于第一概率密度函数重新采样N个新元学习任务,并基于N个新元学习任务的定义,通过网络轨迹生成器(如图16所示意的网络轨迹生成器)来模拟出每个新元学习任务对应网络状态组分配至N个经过内循环更新的第一网络,来模拟每个经过内循环更新的第一网[0154]在本实施例中,在获取到的N个元学习任务对应的N不同类的第二网络状态组之频码率自适应网络的初始化网络参数进行外网络状态组之后,基于每个经过内循环更新的第一网络输出的决策码率与第二网络环境,拟经过内循环更新的第一网络的第二网络环境,以模拟得到K个不同时间长度的第二带宽中经过内循环更新的一个第一决策网络输出的上一时刻的K个决策码率,以及基于上一时刻的K个决策码率与K个不同时间长度的第二带宽轨迹交互得到的上一时刻的K个观测量观测量和K个新决策码率输入至如图17所示意的当前时刻经过内循环更新后的评价网络中第二奖励值,具体可以是基于预设的平滑度以及K个新观测量中的每个新观测量包括的吞N个新元学习任务的当前时刻的K个新决策码率对应的K个第二奖励值进行加和取平均,以视频码率自适应网络更新得到待调整视频码前类别的网络状态组用于模拟待调整视频码率自适应网[0164]在本实施例中,在获取目标视频传输过程中对应的当前以每个决策码率对应的奖励值对待调整视频码率自适应网络的网络参数进行内循环更新,视频传输过程中上一时间的网络状态组之间的均值差值、标准差的差值以及波动差的差[0166]进一步地,将下一时刻的决策码率分别与当前类别网络环境中的下一时刻的K个组对应的目标视频码率自适应网络作为当前类别对应的目标视义阶段,本实施例可以先将元学习任务ri定义为视频(如交互式视频等)传输码率自适应位时间(可以取1s)内丢包率Loss大于5或平均往返时延RTT大于传播延时(即没有排队时间(可以取1s)内丢包率Loss小于等于5以及平均往返时延RTT小于等于传播延时proppropprop丢包率Loss大于5或平均往返时延RTT大于传播延时RTT(即没有排队延)+10的条件,propprop以取1s)内丢包率Loss大于5或平均往返时延RTT大于传播延时RTT(即没有排队延)+propprop[0182]其中,丢包率Loss=5%的阈值表示非拥塞性的数据包丢失(例如无线链路损失、路由器端口翻转等),而RTT阈值RTTprop的计算方法为RTTprop=min(RTTt'),t'∈[max(t-传输过程中(如视频通话)时长较短,可以在线下收集通话长度大于WRTT的视频并对其各自prop的RTTprop小于该初始值则更新当前链路的传播延时。即上述RTTprop的估计方法如上述带宽估计与过滤算法即公式(2)至公式(5),估计每个时间窗口内每个单位时间的带获取在最小化这些阈值的情况下有一定数量(如90%或90%以上)的点满足实时Δm'>Δm、wi,Δmi<Δm',Δdi<Δd',Δwi<Δw'>对应的网络状态组类别i,从而使得网络状态组分类需要对具备更大区间的类进行快速学习,在降低神经网络的激进性(更大的Δ区间表示包准差区间阈值和波动差区间阈值等Δ区间阈值的设计也保障了在大部分时间段内视频码一网络状态组分配至N个初始化视频码率自适应网络,来模拟每个初始化视频码率自适应wi,Δmi,Δdi,Δwi>,i=1,2,...,N。组区间阶段,具体可以是根据采样得到的网络状态组类别i的定义生成该类别网络状态组机采样,并利用Beta分布生成L个(即元训练时的第一历史网络轨迹的网络轨迹长度)来满些随机值连成的轨迹在每个滑动窗口WR时间内符合波动差区间、均值区间和标准差在区概率密度函数与上一次元训练时的第一概率密度函数之间的交叉熵大于一定阈值(即交叉网络状态组类别分布的概率密度函数,即第一概率密度函数f<应的第一网络环境,并基于该第一网络环境获取当前码率自适应策略下的观测量与奖励励公式,基于当前时刻的K个观测量计算得到当前时刻的K个决策码率对应的K个第一奖励一决策网络,并通过第一决策网络输出当前时刻的K(如5)个决策码率,如0.1Mbps、以及K个决策码率输入至经过内循环更新的第一网络的第一决策网络输出当前时刻的K个[0234]在步骤S903中,将当前时刻的K个新决策码率分别与第二网络环境中的当前时刻[0236]在步骤S905中,基于N个元学习任务的当前时刻的K个新决策码率对应的K个第二化网络参数进行更新,以对初始化视频码率自适应网络的初始化网络参数进行外循环更学习任务利用网络轨迹生成器生成K条相应新带宽轨迹,得到每个类别对应的第二网络状络的第一决策网络,即经过当前时刻的K个观测量以及K个决策码率更新后的第一决策网也是一段时间长度的轨迹,则可以将当前时刻的K个新决策码率分别与第二网络环境中的上述奖励公式,基于当前时刻的K个新观测量计算得到当前时刻的K个新决策码率对应的K对初始化视频码率自适应网络的初始化网络参数进行外[0241]在步骤S1001中,计算当前类别的网络状态组与目标视频传输过程中上一时间的组对应的目标视频码率自适应网络作为当前类别对应的目进入到如图18所示意的元测试激励条件设计阶段,本实施例可以设置元测试启动条件为:间的网络状态组对应的目标视频码率自适应网络作为当前类别对应的目标视频码率自适[0249]在步骤S1103中,将当前观测量以及当前决策码率输入至待调整视频码率自适应[0250]在步骤S1104中,将下一时刻的决策码率分别与当前类别网络环境中的下一时刻[0252]在步骤S1106中,基于下一时刻的K个观测量以及下一时刻的K个决策码率计算得一时刻的决策码率,并将下一时刻的决策码率分别与当前类别网络环境中的下一时刻的K基于下一时刻的K个观测量以及下一时刻的K个决策码率计算得到下一时刻的K个奖励值,[0258]在本实施例中,在获取到目标视频传输过程中对应的当前类别的网络状态组之以及时延阈值进行比对,如果该当前丢包率大于丢包阈值或当前往返时延大于时延阈值时延阈值)时,说明当前基于元强化学习的待调整视频码率自适应网络的视频码率自适应请实施例中视频码率自适应网络的应用方法[0266]在本实施例中,在基于元学习的元测试阶段获取到目标视频码率自适应网络之前观测量以及当前时刻的目标决策码率输入至目标视频码率自适应网络中的目标决策网送速率以及视频编辑码率更好更快地对目标视频进标视频码率自适应网络中的决策网络得到的目标码率结果,发送端(如图20所示意的服务使得发送端可以基于下一时刻的目标决策码率,通过编码器和pacer调节至相应视频编辑[0271]在步骤S1402中,基于待调整视频码率自适应网络输出的决策码率与当前网络环[0272]在步骤S1403中,将当前观测量以及当前时刻的目标决策码率输入至新目标视频[0277]下面对本申请中的视频码率自适应网络的训练装置进行详[0280]处理单元201,还用于重新采样N个元学习任务对应的N个不同类的第二网络状态二网络状态组用于模拟每个经过内循环更新的第一[0281]获取单元202,还用于基于每个经过内循环更新的第一网络输出的决策码率与第[0284]获取单元202,还用于基于待调整视频码率自适应网络输出的决策码率与当前类[0305]将当前时刻的K个决策码率分别与第一网络环境中的当前时刻的K个第一带宽轨[0307]基于当前时刻的K个观测量计算得到当前时刻的K个决策码率对应的K个第一奖励[0308]基于当前时刻的K个决策码率对应的K个第一奖励值对第一决策网络以及第一评策码率输入至经过内循环更新的第一网络的第一决策网络,输出当前时刻的K个新决策码[0315]将当前时刻的K个新决策码率分别与第二网络环境中的当前时刻的K个第二带宽[0316]基于当前时刻的K个新观测量计算得到当前时刻的K个新决策码率对应的K个第二[0317]基于N个元学习任务的当前时刻的K个新决策码率对应的K个第二奖励值进行加和[0318]基于当前时刻的奖励平均值对初始化视频码率自适应网络的初始化网络参数进[0320]处理单元201,还用于计算当前类别的网络状态组与目标视频传输过程中上一时频码率自适应网络输出的决策码率与当前类别网络环境,获取每个决策码率对应的奖励状态组对应的目标视频码率自适应网络作为当前类别对应的目标视[0326]将当前观测量以及当前决策码率输入至待调整视频码率自适应网络的待调整决[0327]将下一时刻的决策码率分别与当前类别网络环境中的下一时刻的K个当前带宽轨[0328]将下一时刻的K个观测量和下一时刻的决策码率输入至待调整视频码率自适应网[0329]基于下一时刻的K个观测量以及下一时刻的决策码率计算得到下一时刻的K个奖[0330]基于下一时刻的K个奖励值对待调整决策网络以及待调整评价网络的网络参数进[0332]处理单元201,还用于将当前类别的网络状态组对应的当前丢包率以及当前往返[0333]处理单元201,还用于当该当前丢包率大于丢包阈值或当前往返时延大于时延阈[0334]下面对本申请中的视频码率自适应网络的应用装置进行详[0337]确定单元303,用于基于下一时刻的目标决策码率调节发送速率以及视频编辑码[0338]处理单元302,还用于基于调节后的发送速率以及视频编辑码率对目标视频进行[0341]获取单元301,还用于基于待调整视频码率自适应网络输出的决策码率与当前网[0342]处理单元302,还用于将当前观测量以及当前时刻的目标决策码率输入至新目标

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论