CN119396192A 基于ppo算法多无人机协同避障控制方法、装置和设备 (中国人民解放军国防科技大学)_第1页
CN119396192A 基于ppo算法多无人机协同避障控制方法、装置和设备 (中国人民解放军国防科技大学)_第2页
CN119396192A 基于ppo算法多无人机协同避障控制方法、装置和设备 (中国人民解放军国防科技大学)_第3页
CN119396192A 基于ppo算法多无人机协同避障控制方法、装置和设备 (中国人民解放军国防科技大学)_第4页
CN119396192A 基于ppo算法多无人机协同避障控制方法、装置和设备 (中国人民解放军国防科技大学)_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于PPO算法多无人机协同避障控制方法、本申请涉及一种基于PPO算法多无人机协同体包括策略网络和价值网络;采用链式PPO训练中的每架无人机执行各自的路径规划和避障任估动作量,在有启发式信息和奖励函数的指导2采用链式PPO训练框架对编队中的无人机进行多轮训练,得到每架无人机的路径规划编队中的每架无人机执行各自的路径规划和避障任务;其中,为启发式速度,l为一较小正系数,cur-posei为当前训练无人机此时位置,tar.pos;为当前训练无人机目标点位置,cur-pose为无人机群此时位置向量组合起来一轮训练时采用人工势场法模拟编队中非当前训练的无人3.根据权利要求1所述的基于PPO算法的多无用链式PPO训练框架对编队中的无人机进行多轮训练,得到每架无人机的路径规划和避障策略网络输出动作值到训练环境中对状态进行更新,价值网络输出Q值对当前状态进行评将当前训练的无人机的局部观测状态作为当前训练的无人机的策略将当前训练的无人机的局部观测状态输入到当前训练的无人机的价值网络中,输出Q值对当前状态进行评估;计算每个样本在不同状态下采取不同动作的最小值函数估计值,编队中非当前训练的无人机基于各自的局部观测状态和固定策略输出各自动作量到3其中,num_epsiode为单步沿途采样点数量;RSS为总碰撞惩罚,UAVS为同组其他无人机;和R%分别表示第i个采样时刻当前无人机与静态障碍物和动态障碍物的v,v)分别为当前无人机4路径规划和避障任务的最优策略确定模块,用于采用链式PPO训练框架对编队中的无各自的局部观测状态采用固定性策略分别输出各自动作量到训练环境中对状态进行更新;多无人机协同避障控制模块,用于编队中的每架无人其中,路径规划和避障任务的最优策略确定模块,还用;其中,%为启发式速度,l为一较小正系数,cur-posei为当前训练无人机此时位置,tar.pos;为当前训练无人机目标点位置,cur.pose为无人机群此时位置向量组合起来的矩6.一种计算机设备,包括存储器和处理器,所述存储器存于,所述处理器执行所述计算机程序时实现权利要求1至4中任一项所述的基于PPO算法的5[0001]本申请涉及多飞行器协同控制技术领域,特别是涉及一种基于PPO算法多无人机[0007]采用链式PPO训练框架对编队中的无人机进行多轮训练,得到每架无人机的路径;6输出Q值对当前状态进行评估;编队中非当前训练的无人机基于各自的局部观测状态采用[0012]将当前训练的无人机的局部观测状态作为当前训练的无出Q值对当前状态进行评估;计算每个样本在不同状态下采取不同动作的最小值函数估计[0014]编队中非当前训练的无人机基于各自的局部观测状态和固定策略输出各自动作;;7;;其他无人机;和R%分别表示第i个采样时刻当前无人机与静态障碍物和动态障碍;v,v)分别为当前无;;[0022]路径规划和避障任务的最优策略确定模块,用于采用链式PPO训练框架对编队中各自的局部观测状态采用固定性策略分别输出各自动作量到训练环境中对状态进行更新;8;回放缓冲区采集一批数据,计算每个样本在不同状态下采取不同动作的最小值函数估计9为[state_dim,256,256,action_dim],state_dim为状态空间维度,action_dim为动作空间维度;价值网络结构为[state_dim,256,256,1],state_dim为状态空间维度,价值网络一般;训练有效解决连续三维多机环境训练不稳定的情况。采用了三维连续空间作为任务环境,包括随机选择一系列动作并观察环境的反馈。这些动作的选择是基于值函数(Value中的每架无人机执行各自的路径规划和避障任务的最优策略,实现多无人机协同避障控中非当前训练的无人机基于各自的局部观测状态和固定策略输出各自动作量到训练环境的其他无人机基于各自状态采用已有策略分别输出各自动作量到环境中包括随机选择一系列动作并观察环境的反馈。这些动作的选择是基于值函数(Value;;;碰撞惩罚(总碰撞惩罚为所有采样点碰撞惩罚之和UAVS为同组其他无人机;RS和;action(vx,v,v⃞)分别为当前无;;可以包括多个子步骤或者多个阶段,这些子步骤或者阶段并不必然是在同一时刻执行完是可以与其它步骤或者其它步骤的子步骤或者阶段的至少一部分轮流或者交[0063]在一个验证性实施例中,仿真实验的快且奖励不易振荡,在近似路径代价的条件下基于PPO的强化学习算法相较于传统的人工[0065]路径规划和避障任务的最优策略确定模块,用于采用链式PPO训练框架对编队中各自的局部观测状态采用固定性策略分别输出各自动作量到训练环境中对状态进行更新;采用人工势场法模拟编队中非当前训练的无人机避[0071]关于基于PPO算法的多无人机协同避障控制装置的具体限定可以参见上文中对于实现一种基于PPO算法的多无人机协同避障控制方法。该计算机设备的显示屏可以是液晶

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论