CN119396498A 任务卸载方法及计算机设备 (杭州海康威视数字技术股份有限公司)_第1页
CN119396498A 任务卸载方法及计算机设备 (杭州海康威视数字技术股份有限公司)_第2页
CN119396498A 任务卸载方法及计算机设备 (杭州海康威视数字技术股份有限公司)_第3页
CN119396498A 任务卸载方法及计算机设备 (杭州海康威视数字技术股份有限公司)_第4页
CN119396498A 任务卸载方法及计算机设备 (杭州海康威视数字技术股份有限公司)_第5页
已阅读5页,还剩45页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

司本申请公开了一种任务卸载方法及计算机将当前时刻的状态信息输入多目标强化学习模于每一个终端设备的当前子任务所对应的任务卸载策略中的任务卸载率,终端设备和/或服务请能够提供终端设备的有向无环图任务的任务2针对每一个终端设备的当前子任务,获取所述边缘计基于每一个终端设备的当前子任务所对应的任务卸载策略中的任务设备和/或所述服务器对所述当前子任务执行相应的将以有向无环图任务的时延和终端设备总能耗为目标的优化模型转换为马尔可夫决将所述当前时刻的状态信息和当前时刻的目标权重向量输入所述多目标强化学习模针对每一个终端设备的有向无环图任务,基于所述边述有向无环图任务的时延和终端设备总能耗为目标的基于所述优化模型建立马尔可夫决策过程,设置马尔可夫决策过将所述当前时刻的状态信息和当前时刻的目标权重向量输入所述多目标强化学习模3针对所述有向无环图任务中的每一个子任务,基于香农定理针对所述有向无环图任务中的每一个子任务,基于该子任的数据大小以及终端设备分配给该子任务的资源确定该子任务在终端设备侧的第一任务针对所述有向无环图任务中的每一个子任务,基于该子任务将当前时刻的状态信息和当前时刻的目标权重向量输入所述演员网络中的离散组件基于交互结果得到下一时刻的状态信息,以及基于所述奖励函所述两个Q网络分别基于所述演员网络输出的动作进行评价输出相应的输出的实际Q之中的最小值作为所述评论家网络输出的最小实际Q值,以所述最小实际Q值所述两个目标Q网络分别基于所述演员网络输出的下一个时刻输出的动作进行评价输6.如权利要求5所述的任务卸载方法,其特征4以离散动作的权重系数和输出离散动作的概率以及所述评论家网络输出的最小实际Q以连续动作的权重系数和输出连续动作的概率以及所述评论家网络输出的最小实际Q以所述离散动作损失函数和连续动作损失函数确定所述演员网络的第一目标损失函基于所述第一目标损失函数进行模型训练,对所述第一目标损失以离散动作的权重系数和输出离散动作的概率以及所述评论家网络输出的最小实际Q;以连续动作的权重系数和输出连续动作的概率以及所述评论家网络输出的最小实际Q;以所述离散动作损失函数Ja(y,w)和连续动作损失函数J.(y,w)确定所述演员网络的第一目标损失函数Jn(y,w)为:基于所述第一目标损失函数进行模型训练,对所述第一目标损失所述联合熵更新所述评论家网络的评价函数以最小实际Q值和最小目标Q值之间的均方误差确定所述评论家网络的第二目标损失基于所述第二目标损失函数进行模型训练,对所述第二目标损失5以所述演员网络输出离散动作的概率和输出连续动作的概率确定策略的联合熵;;基于所述联合熵更新所述评论家网络Q函数的贝;以最小实际Q值和最小目标Q值之间的均方误差确定所述评论家网络的第二目标损失;基于所述第二目标损失函数进行模型训练,对所述第二目标损失对所述经验回放缓冲区中的经验样本基于时间差分误差的优先级序列进基于排序后的经验样本中选择λb个经验样本作为第一经验样本集;基于相邻经验样本之间的状态误差和权重误差,计算得到相邻经验样本之间的相似基于时间因子确定所述第一经验样本集中每一个经验样本的基于每一个经验样本的相似度和时间相关性确定每一个经验基于新的优先级对所述第一经验样本集进行降序排列,从排序后的6于,所述处理器执行所述计算机程序时实现权利要求1至10任一项所述的任务卸载方法的7获取每一个终端设备的有向无环图任务,基于有向无环图任务确定当前子任务,设备和/或服务器对当前子任务执行相应的将以有向无环图任务的时延和终端设备总能耗为目标的优化模型转换为马尔可8数据大小以及终端设备分配该子任务的资源确定该子任务在终端设备侧的第一任务执行员网络包括离散组件和连续组件,评论家网络包括两个Q网络和两个目标Q网络,Q网将当前时刻的状态信息和当前时刻的目标权重向量输入演员网络中的离散组件9的实际Q之中的最小值作为评论家网络输出的最小实际Q值,以最小实际Q值更新演员网络两个目标Q网络分别基于演员网络输出的下一个时刻输出的动作进行评价输出相以离散动作的权重系数和输出离散动作的概率以及评论家网络输出的最小实际Q以连续动作的权重系数和输出连续动作的概率以及评论家网络输出的最小实际Q基于第一目标损失函数进行模型训练,对第一目标损失函数进行梯度下降处理,以离散动作的权重系数和输出离散动作的概率以及评论家网络输出的最小实际Q;以连续动作的权重系数和输出连续动作的概率以及评论家网络输出的最小实际Q;以离散动作损失函数Ja(y,w)和连续动作损失函数J.(y,w)确定演员网络的第一目Jn(y,w)=Ja(y,w)+J。(y,w);基于第一目标损失函数进行模型训练,对第一目标损失函数进行梯度下降处理,以最小实际Q值和最小目标Q值的均方误差确定所述评论家网络的第二目标损失以演员网络输出离散动作的概率和输出连续动作的概率确定策略的联合熵;m(alls,w)log(m(a'IS,a',w)表示在状态s和离散动作下演员网络输出连续动作的概基于联合熵更新所述评论家网络Q函数的贝;其中,R(,a)表示在做状态s下执行动作a所获取的即时奖励,v表示折扣因子,nin_u.ZQO(s',a",a",w)表示从两个Q网络中选取最小的Q值,s'表示下一时刻的状态,以最小实际Q值和最小目标Q值之间的均方误差确定所述评论家网络的第二目标;基于第二目标损失函数进行模型训练,对第二目标损失函数进行梯度下降处理,对经验回放缓冲区中的经验样本基于时间差分误差的优先级序列进基于排序后的经验样本中选择λb个经验样本作为第一经验样本集;基于每一个经验样本的相似度和时间相关性确定每一个经验化学习模型确定每一个终端设备的当前子任务的任务卸载策略,充分考虑任务之间的联境下终端设备与边缘服务器之间的任务卸载场景,其中展示了终端设备5的有向无环图任化学习算法确定每一个终端设备的当前子任务的任务卸载策略,各个终端设备和/或各个[0030]在一些实施例中,如图3所示,将当前时刻的状态信息输入多目标强化学习模型数值时,当前子任务的一部分卸载至目标服务器且当前子任务的另一部分卸载至终端设时,将当前子任务的一部分卸载至目标服务器且当前子任务的另一部分卸载至终端设备,[0042]将状态空间中当前时刻的状态信息以及从偏好空间随机选取的当前时刻的目标;服务器m将任务结果传回到终端设备n的第二;;;;数据大小以及终端设备分配子任务的资源确定该子任务在终端设备侧的第一任务执行时;子任务在服务器侧的第二任务执行时间,表示终端设备n分配子任务的计算资源,每个时间步会做一次卸载,用时间步记录任务的完成时间,因此传输时间为:;;;最后一个子任务的FT即整个有向无环图任务完。;。[0057]根据时延模型和总能耗模型以时延和能耗为优化目标的优化模型表示为;;[0060]奖励函数是指在每个时间步基于所执行动作状态获得相应的奖励。奖励函数包;;;络和目标Q网络的结构相同,采用分布执行与集中训练相结合的方式对多目标强化学习模将当前时刻的状态信息和当前时刻的目标权重向量输入演员网络中的离散组件本输入评论家网络;两个Q网络分别基于演员网络输出的动作进行评价输出相应的实际Q新所述演员网络的参数;两个目标Q网络分别基于演员网络输出的下一个时刻输出的动作网络包括离散组件和连续组件。经验回放缓冲区记录终端设备与环境交互生成的经验样确定任务卸载的任务卸载率以及目标服务器分配给任务的计网络输出两个实际Q值,两个实际Q值选择最小的实际Q值输出至演员网络,以更新演员网;以连续动作的权重系数和输出连续动作的概率以及评论家网络输出的最小实际Q;m(alIS,w)log(m(afIS,a',w)表示在状态s和离散动作下演员网络输出连续动作的概率,以离散动作损失函数Ja(y,w)和连续动作损失函数J.(y,w)确定演员网络的第一目基于第一目标损失函数进行模型训练,对第一目标损失函数进行梯度下降处理,步骤S801,以演员网络输出离散动作的概率和连续动作的概率确定策略的联合[0073]SAC算法结合了最大熵强化学习的原则,旨在优化一个考虑了奖励机制和策略熵;;[0,1],用于衡量未来奖励对当前决策的影响,越接近1,意味着更重视未来的回报;以最小实际Q值和最小目标Q值之间的均方误差确定评论家网络的第二目标损失;对经验回放缓冲区中的经验样本基于时间差分误差的优先级序列进基于排序后的经验样本中选择λb个经验样本作为第一经验样本集;基于每一个经验样本的相似度和时间相关性确定每一个经验下面所提供的任务卸载装置实施例中的具体限定可以参见上文中对于任务卸载的方法的任务执行模块903,用于基于每一个终端设备的当前子任务所对应的任务卸载策[0079]本实施方式基于多目标强化学习模型确定每一个终端设备的当前子任务的任务卸载策略,从而能够边缘计算系统中的各个终端设备和各个服务器执行影响的任务卸载,充分考虑任务之间的联系,能够更全面的评估终端设备和边缘服务器的环境的交互状态、例如随机存取存储器(randomaccessmemory,RAM)、只读存储器(readonlymemory,存储器1003)中存储的计算机程序(例如计算机程序)来执行特定步骤和/或操作的处理器,通用处理器在执行所述步骤和/或操作的过程中可能用到存储在存储器(例如存储器1003中的数据)。通用处理器可以是,例如但不限于中央处理器(centra

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论