CN116243727B 一种渐进式深度强化学习的无人载具对抗与避障方法 (厦门大学)_第1页
CN116243727B 一种渐进式深度强化学习的无人载具对抗与避障方法 (厦门大学)_第2页
CN116243727B 一种渐进式深度强化学习的无人载具对抗与避障方法 (厦门大学)_第3页
CN116243727B 一种渐进式深度强化学习的无人载具对抗与避障方法 (厦门大学)_第4页
CN116243727B 一种渐进式深度强化学习的无人载具对抗与避障方法 (厦门大学)_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种渐进式深度强化学习的无人载具对抗本发明涉及一种渐进式深度强化学习的无弈SAC算法的批判者神经网络和执行者神经网络所述渐进式自博弈SAC算法自调节所述训练课程2标准gym环境类,根据真实情况将无人载具自身状态和环境观测的状态数据作为必要的要S2,通过计算机模拟多台无人载具系统的自主决策计随训练过程递增的课程学习机制以及对抗对手的策略类型和强度,得到渐进式自博弈针对无人载具的真实运动情况构建执行者神经网络的φ回放池最新数据并更新所述批判者神经网络和执行者神经网络的参数,完成一次学习课完成训练的执行者神经网络用于生成无人载具2.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特3.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特4.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特3将增大策略熵系数α以增大探索能力,训练后期随着自博弈优化的进行以及策略的稳定收5.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特所述运动学自行车模型基于无人车系统的运动学,所述运动学6.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特训练后期采用迭代对抗训练策略,当通过渐进式自博弈SAC框架优化策略至一定阶段7.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特8.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特9.根据权利要求1所述的一种渐进式深度强化学习的无人载具对抗与避障方法,其特4[0004]在无人载具的自主决策研究领域,无人机的自主机动和对抗决策问题广受关5中超参数众多,而且训练容易陷入局部最优,原始SAC算法作为一种更先进的强化学习算[0005]针对上述的现有技术存在的问题设计一种渐进式深度强化学习的无人载具对抗下的标准gym环境类,根据真实情况将无人载具自身状态和环境观测的状态数据作为必要[0011]S3,设计并优化渐进式自博弈SAC算法的批判者神经网络和执行者神经网络的形得到完成训练的执行者神经网络用于生成无人载具对[0015]进一步地,设计并优化渐进式自博弈SAC算法的批判者神经网络和执行者神经网6[0022]进一步地,针对无人载具的真实运动情况构建策略熵系数的目标损失函数包[0029]训练后期采用迭代对抗训练策略,当通过渐进式自博弈SAC框架优化策略至一定7[0040]本发明通过在训练后期采用了迭代对抗的方式训练策略,保证策略的深度优[0046]图4为本发明的其中一个实施例提供的渐进式自博弈SAC算法的自主决策框架示8[0047]图5为本发明的其中一个实施例提供的多课程阶段无人车自主决策学习框架示意[0051]为了便于本领域技术人员理解,现将实施例结合附图对本发明作进一步详细描环境下的标准gym环境类,根据真实情况将无人载具自身状态和环境观测的状态数据作为性,且可以根据状态反馈信息做出实时决策。原始SAC算法是PieterAbbeel和SergeyLevine团队提出的一种基于Actor_Critic框架的强化学习算法,参考文献为《Soft9[0069]从上述原始SAC算法的核心公式可以看出:原始SAC算法在最大化累计奖赏的同[0071]S3,设计并优化渐进式自博弈SAC算法的批判者神经网络和执行者神经网络的形得到完成训练的执行者神经网络用于生成无人载具对[0075]进一步地,设计并优化渐进式自博弈SAC算法的批判者神经网络和执行者神经网[0082]进一步地,针对无人载具的真实运动情况构建策略熵系数的目标损失函数包[0089]训练后期采用迭代对抗训练策略,当通过渐进式自博弈SAC框架优化策略至一定[0098]在S1中,为了建立运动学自行车模型,首先建立一个包括ax轴和oy轴的[0099]i=v;[0102]i=a;[0105]然后,本发明建立了2辆小车在有障碍二维环境下跟踪对抗与避障的自主决策过和避障策略,设计的目标是使得车在运动过程中避免与障碍物发生危险碰撞的前提下,车的速度矢量。e表示在A车速度方向上距离最近障碍物的位置,d,(p,n)表示A车在x轴和y轴可以移动的最小坐标边界值分别表示车辆运动过程中沿着x轴和y轴[0122]基于策略熵机制提供的优秀探索能力,设计平衡探索能力和策略优化的损失函[0128]设计难度递增的训练课程,若直接采用原始SAC算法来求解小车自主对抗和避障[0132]当车尚未学会基本的避障策略时,就对其同时进行高难度的避障和对抗训[0140]本申请采用的渐进式自博弈SAC算法在训练过程中能够反复进行对现有策略的量[0142]本实施例中,模仿人类从简入繁的学习方式,本发明设计了渐进式自博弈SAC算练目的是通过不断的策略迭代来不断优化A车的机动策略Tat-,直到获得满意的自主课程渐进训练方案(渐进式自博弈SAC算法上侧曲线)的累计奖赏随训练回合的变化曲表明本文所提出的渐进式自博弈SAC算法不仅能够获得更快的训练效率,同时还能保证获无障碍物和有较大圆柱体障碍物时时,车基于第之前课程训练结果所获得的对抗结果,[0158]这些计算机程序指令也可存储在能引导计算机或其他可编程数据处理设备以特领域的技术人员可以将本说明书中描述的不同实施例或示例以及

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论