CN115509251B 基于mappo算法的多无人机多目标协同跟踪控制方法 (华南理工大学)_第1页
CN115509251B 基于mappo算法的多无人机多目标协同跟踪控制方法 (华南理工大学)_第2页
CN115509251B 基于mappo算法的多无人机多目标协同跟踪控制方法 (华南理工大学)_第3页
CN115509251B 基于mappo算法的多无人机多目标协同跟踪控制方法 (华南理工大学)_第4页
CN115509251B 基于mappo算法的多无人机多目标协同跟踪控制方法 (华南理工大学)_第5页
已阅读5页,还剩30页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于MAPPO算法的多无人机多目标协同跟踪本发明提出基于MAPPO算法的多无人机多目人机的局部观测状态输入所述多无人机多目标协同跟踪控制器,得到各无人机的动作控制2动目标恒定转弯率和速度模型和分布式部分可观各无人机的无人机局部状态量输出无人机动作控制量价值网络用于根据输入的多无人机全局状态量Sk输出当前无人机状态量对应的价值步骤6:基于MAPPO算法的多无人机多目标协同跟踪训xy所构建的奖励回报函数表示无人机i∈{1,…,N}在k∈{1,…,t}时刻获得的奖励回报值其中分别表示无人机i在k时刻的追32.根据权利要求1所述的基于MAPPO算法的多假设无人机为对称刚体,且忽略空气阻力的影响,无人机在空间的运理坐标的位置为姿态角为无人机质心相对于地面坐标的位置运动方程为无人机绕质心转动的运动方程为XY3.根据权利要求1所述的基于MAPPO算法的针对无人机目标跟踪,无人机本身与被跟踪目标相对于整个动4.根据权利要求1所述的基于MAPPO算法的多无人机多目多无人机多目标协同跟踪控制过程是个完全合作式的多无人机部分可观察马尔可夫c(s,u)=⃞1ri:sxu→T,Τ表示奖励总和集合;对于无人机i接收的是一个独立的部分45.根据权利要求1所述的基于MAPPO算法的6.根据权利要求1所述的基于MAPPO算法的多无人7.根据权利要求1所述的基于MAPPO算法的人机动作控制量均值loc和方差scale的隐藏层,输出为一个多元高斯分布的采样值8.根据权利要求1所述的基于MAPPO算法的多无5[0001]本发明属于无人机控制技术领域,尤其涉及一种基于深度强化学习MAPPO算法的略模型的结构或参数。此类算法将系统中的每架无人机看作拥有独立性和自主性的智能可表示为:(1)智能体与环境交互时刻进行,并通过深度学习方法感知和观察高维度目标,6Actor_Critic架构,不同之处在于是一种中心式训练分散式执行(Centralizedtraininganddecentralizedexecution,CTDE)框架的算法,此时Critic网络学习的是一个中心价观测状态通过自己的Actor网络生成的动作策略函数来产生最优动作,最终组合成多智能化学习MAPPO算法的多无人机多目标协同跟踪控制方法,能够进行多无人机多目标协同跟[0007]为了实现本发明目的,本发明提供的基于MAPPO算法的多无人机多目标协同跟踪[0008]步骤1:对多无人机目标跟踪过程进行建模,包括建立无人机六自由度运动学模于根据输入的各无人机的无人机状态量输出各无人机动作控制量价值网络用于根7在地理坐标的位置为姿态角为无人机质心相对于地面坐标的位置运动XY[0018]针对无人机目标跟踪,无人机本身与被跟踪目标相对于[0020]多无人机多目标协同跟踪控制过程是个完全合作式的多智能体部分可观察马尔8[0028]步骤3.5:效益矩阵M3中所有未被直线覆盖的元素减去未被覆盖元素中最小的元t}时刻状态空间为其中j∈xyrrr分别表示智能体i在k时刻9[0034]进一步地,步骤5中的价值网络的输入量为归一化处理后的多无人机全局状态量[0041]1.本发明采用MAPPO算法训练[0042]2.本发明提出的方法训练得到的多无人机多目标协同跟踪器与传统的多无人机的计算量要远远低于传统的多无人机多目标跟踪方法中需要使用优化算法规划多无人机[0049]图5是本发明实施例的5架无人机跟踪3个随机运动目标单次训练时的平均回合总[0051]图7是本发明实施例中5架无人机跟踪3个随机运动目标单次仿真试验距离差变化[0052]图8是本发明实施例中5架无人机跟踪3个随机运动目标单次仿真试验偏航角度差[0055]在本发明的其中一些实施例中,假定当前的任务是有5架通过自身携带的传感器设备可以实时获取目标当前位置信息的四旋翼无人机,要求在其可侦察范围内跟踪3个随[0056]步骤1:对多无人机目标跟踪过程进行建模,包括建立无人机六自由度运动学模人机质心相对于地面坐标的位置运动方程并依据无人机相对地面空间坐Yxy[0061]针对无人机目标跟踪,将无人机本身与被跟踪目标相对于整个动态环境视为质以及高度变化视为噪声,构建运动目标恒定转弯率和速度模型其中,坐标(xm,[0063]分布式研究如何把一个需要非常巨大的计算能力才能解决的问题分成许多小的[0064]多无人机多目标协同跟踪控制过程是个完全合作式的多智能体部分可观察马尔马尔可夫决策模型(multi_UAVPOMDP或Dec_POMDP)。用一个元组G表示为G=<S,U,P,T,Z,表示联合动作的集合,再将这个联合动作给到环境中去进行状态转移P(s,|s,u):S×U→奖励ri,所有的无人机智能体得到的奖励总和r(s,u)=1ri:sxu→T,T表示奖励总和[0067]将多无人机展开多目标协同跟踪任务的环境界限定义在总面积为a2的正方形区准指派问题多无人机(N≥2)跟踪多目标(m≥2)的情况下,为确保每个目标至少被1架无人各无人机距离各目标初始位置距离,计算最小的所有无人机跟踪各目标的欧式距离代价[0078]步骤3.5:效益矩阵M3中所有未被直线覆盖的元素减去未被覆盖元素中最小的元针对多无人机多目标协同跟踪问题,设计的状态价值函数表示智能体i∈{1,…,N}在k∈智能体i∈{1,…,N}在k∈{1,…,t}(t为训练的最大步数)时刻获得的奖励回报值其中分别表示智能体i在k时刻的追踪[0090]rarr=-Bx在k时刻的距离差,llyaw⃞-tarymwpl表示无人机i与其目标之间在k时刻的偏航角度差,Hmaxminmin分别代表无人机允许飞行的最大高度、最小高度和无人机之间最小的安全距离,分别代表无人机i在k时刻的飞行高度和与其他最近无人机在k时刻的最小空间第六层之间加入Elu激活函数,第六层为计算无人机动作控制量均值loc和方差scale的隐包含其他无人机和目标)进行信息交互,即模拟多无人机在环境中对多目标进行一次协同均回合总奖励回报函数τ(s,u)收敛至稳定状态或总汇报奖励值接近设定跟踪成功时的奖[0105]5架四旋翼无人机在多无人机多目标协同跟踪控制器的作用下跟踪3个随

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论