CN119443202A 一种基于强化学习的多无人机协同对抗学习方法 (南京大学)_第1页
CN119443202A 一种基于强化学习的多无人机协同对抗学习方法 (南京大学)_第2页
CN119443202A 一种基于强化学习的多无人机协同对抗学习方法 (南京大学)_第3页
CN119443202A 一种基于强化学习的多无人机协同对抗学习方法 (南京大学)_第4页
CN119443202A 一种基于强化学习的多无人机协同对抗学习方法 (南京大学)_第5页
已阅读5页,还剩23页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于强化学习的多无人机协同对抗学本发明公开一种基于强化学习的多无人机机制并结合长短期记忆网络的特征聚合提取模化多样化的多智能体博弈训练模块提升了作战2步骤10,如果当前为上层决策模块训练任务,更新基于过均值池化方式聚合多台无人机的观测结果,并添加是否利用了友方观测信息的标识位;初步的通信聚合操作后,该模块进一步通过策略网络对聚合后的观测信息进行特征提取;3R=200(dvel/400+dpitch/90+dyaw/360)_0.01proll_0.1pturn+50xrreachvelroll表示滚转角连续5个时间步变化过大的惩罚,pturn则是在与目标航向角相距大于对于基于宏动作与技能的底层控制,策略网络输出离散动作的410.一种实现如权利要求1_9任意一项所述方法的基于强化学习的多无人机协同对抗训练上层作战决策模块,通过输出无人机控制参数并结合底层机动控制模块控制无人机,56模块,种群演化多样化的多智能体博弈训练模块用来提升上层作战决策模块的实战效果。是一个或多个智能体在环境中按照时间顺序执行一系列动作后产生的状态和奖励的序列。7[0018]步骤9,根据当前训练任务,使用底层机动控制模块的优化方式进行强化学习训vel8[0026]上层作战决策模块:通过多智能体强化学习算法生成无针对不同的底层控制方法构建了对应的上层作战策略网络。使用PSCN处理高纬输入特征,对于基于强化学习训练得到的底层机动控制,上层作战策略网络输出一个三维高斯分布,解决稀疏奖励导致的训练效率低下问题,设计了包含个体奖赏和团队奖赏的复杂奖励函rwr和能量奖励rwe9励策略在探索新的行为策略时保持一定的稳定性;critic网络参数的优化目标为:,其中是critic网络对状态值的估计,是累积折扣回定义为:其中为策略输出的动作概率分布,了高效的协同作战。能体博弈训练模块提升上层作战决策模块实形式的修改均落于本申请所附权利要求所限是一个或多个智能体在环境中按照时间顺序执行一系列动作后产生的状态和奖励的序列。[0045]步骤9,根据当前训练任务,使用底层机动控制模块的优化方式进行强化学习训vel在复杂的空中对抗环境中表现出较强的适应性与灵[0054]上层作战决策模块:通过多智能体强化学习算法生成无针对不同的底层控制方法构建了对应的上层作战策略网络。使用PSCN处理高纬输入特征,rir励策略在探索新的行为策略时保持一定的稳定性;critic网络参数的优化目标为:,其中是critic网络对状态值的估计,是累积折扣回了高效的协同作战。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论