CN119440070A 一种多无人机的协同决策控制方法、装置、设备及介质 (中国电子信息产业集团有限公司第六研究所)_第1页
CN119440070A 一种多无人机的协同决策控制方法、装置、设备及介质 (中国电子信息产业集团有限公司第六研究所)_第2页
CN119440070A 一种多无人机的协同决策控制方法、装置、设备及介质 (中国电子信息产业集团有限公司第六研究所)_第3页
CN119440070A 一种多无人机的协同决策控制方法、装置、设备及介质 (中国电子信息产业集团有限公司第六研究所)_第4页
CN119440070A 一种多无人机的协同决策控制方法、装置、设备及介质 (中国电子信息产业集团有限公司第六研究所)_第5页
已阅读5页,还剩42页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种多无人机的协同决策控制方法、装置、本申请提供了一种多无人机的协同决策控深度强化学习模型之中的多个Actor网络对多个无人机的任务信息进行信息交互处理预测出每以及姿态控制器对每个无人机的下一时刻决策机的当前姿态信息进行调整确定出调整后的信中继续预测出每个无人机在未来时刻的动作信2基于无人机任务场景确定出多个无人机的任务信息;其中,将多个所述无人机的任务信息输入至预先训练好的深度强化学深度强化学习模型之中的多个Actor网络的门控循环单元、软注意力机制以及图神经网络基于位置控制器以及姿态控制器对每个所述无人在基于每个所述无人机的下一时刻控制命令对控制电机所述深度强化学习模型之中继续预测出每个所述无人机在未来时务信息,所述将多个所述无人机的任务信息输入至预先训练好的深度强化学习模型之中,基于所述深度强化学习模型之中的多个Actor网络的门控循环单元、软注意力机制以及图将所述无人机的任务信息输入至所述Actor网络的门控循环单元之中,对所述无人机基于软注意力机制对该无人机的当前时刻的隐藏状态特征向量与其他无人机的当前所述图神经网络基于该无人机与其他无人机之间的注意力权重对其他无人机的当前将聚合后的隐藏状态特征向量和该无人机的当前时刻隐藏状态特征向量进行向量拼对所述下一时刻决策信息中的加速度信息进行积分处理,确定出下一所述位置控制器基于所述无人机的当前位置信息、当前速度3所述姿态控制器基于所述无人机的当前姿态信息、当前角速度信将样本无人机任务场景的多个样本无人机的样本任务信息以及奖励函数输入至初始深度强化学习模型之中,基于多个Actor网络对多个样本无人机的样本任务信息之中的样基于奖励函数确定出每个所述样本无人机的下一时刻动作信息所将每个所述样本无人机的下一时刻动作信息以及所述样本无人机执行下一时刻动作基于所述状态动作价值以及所述奖励值之间的损失值对相对应的所述Critic网络的止对所述Actor网络以及所述Critic网络的网络参数的更新,确定出所述深度强化学习模的下一时刻动作信息以及所述样本无人机执行下一时刻动作信息时所对应新的状态信息对所述样本无人机的下一时刻动作信息以及新的状态信息进行特征编时刻动作信息所对应的动作特征以及新的状对特征编码后的下一时刻动作特征以及新的状态特征进行多头注意力感知器对多头注意力处理后的所述特征编码后的下一时刻动作特征以及新的状态特征进为阻力。决策模块,用于将多个所述无人机的任务信息输入至预先训控制模块,用于基于位置控制器以及姿态控制器对每个所述4无人机环境平台,用于在基于每个所述无人机的下一时刻控制命令对述阻力以及所述地面效应力对所述无人机的当前姿态信息进行调整确定出调整后的信息,将调整后的信息反馈至所述深度强化学习模型之中继续预测出每个所述无人机在未来时5[0001]本申请涉及无人机控制技术领域,尤其是涉及一种多无人机的协同决策控制方所述深度强化学习模型之中的多个Actor网络的门控循环单元、软注意力机制以及图神经基于位置控制器以及姿态控制器对每个所述无人机的下一时刻决策信息进行处在基于每个所述无人机的下一时刻控制命令对控制电机的速度和方向调整过程反馈至所述深度强化学习模型之中继续预测出每个所述无人机在未来时6模型之中的多个Actor网络的门控循环单元、软注意力机制以及图神经网络捕捉多个无人将所述无人机的任务信息输入至所述Actor网络的门控循环单元之中,对所述无基于软注意力机制对该无人机的当前时刻的隐藏状态特征向量与其他无人机的所述图神经网络基于该无人机与其他无人机之间的注意力权重对其他无人机的将聚合后的隐藏状态特征向量和该无人机的当前时刻隐藏状态特征向量进行向[0006]在一种可能的实施方式之中,所述对下一时刻的所述动作信息进行信息转换处对所述目标速度信息进行积分处理,确定出下一时刻决策信息中的目标位置信将样本无人机任务场景的多个样本无人机的样本任务信息以及奖励函数输入至初始深度强化学习模型之中,基于多个Actor网络对多个样本无人机的样本任务信息之中将每个所述样本无人机的下一时刻动作信息以及所述样本无人机执行下一时刻7基于所述状态动作价值以及所述奖励值之间的损失值对相对应的所述Critic网时停止对所述Actor网络以及所述Critic网络的网络参数的更新,确定出所述深度强化学及所述样本无人机执行下一时刻动作信息时所对应新的状态信息输入至Critic网络之中,下一时刻动作信息所对应的动作特征以及新的状多层感知器对多头注意力处理后的所述特征编码后的下一时刻动作特征以及新的状态特为阻于所述阻力以及所述地面效应力对所述无人机的当前姿态信息进行调整确定出调整后的8预先训练好的深度强化学习模型之中,基于所述深度强化学习模型之中的多个Actor网络的门控循环单元、软注意力机制以及图神经网络捕捉多个无人机之间任务信息的交互信自主化水平,并且利用位置控制器以及姿态控制器来根据决策信息生成具体的控制命令,图5为本申请实施例所提供的一种多无人机的协同决策控制装置的结构示意图之图6为本申请实施例所提供的一种多无人机的协同决策控制装置的结构示意图之9准确地实现多无人机的协同决策控制成为了不容小策自主化水平,并且利用位置控制器以及姿态控制器来根据决策信息生成具体的控制命S102:将多个所述无人机的任务信息输入至预先训练好的深度强化学习模型之[0026]该步骤中,将多个无人机的任务信息输入至预先训练好的深度强化学习模型之模型之中的多个Actor网络的门控循环单元、软注意力机制以及图神经网络捕捉多个无人"[0032]B:基于软注意力机制对该无人机的当前时刻的隐藏状态特征向量与其他无人机的当前时刻隐藏状态特征向量进行处理,确定出该无人机与其他无人机之间的注意力权藏状态特征与所有其它无人机的当前隐藏状态特征的相似度生成该无人机与其他权重"s表示智能体i对智能体的关注度。[0035]C:所述图神经网络基于该无人机与其他无人机之间的注意力权重对其他无人机[0037]其中,通过计算无人机i对所有其它无人机j的注意力权重以可加的方式聚合邻[0038]D:将聚合后的隐藏状态特征向量和该无人机的当前时刻隐藏状态特征向量进行[0043]在一种可能的实施方式之中,所述对下一时刻的所述动作信息进行信息转换处而言,当前时间步的速度v(t)是由前一个时间步的速度v(ta)加上当前时间步v(t)乘以时间步长At加至前一个时间步的之间的时序依赖关系,生成当前状态的隐藏层表示。其次使用软注意力机制(Soft_a:将样本无人机任务场景的多个样本无人机的样本任务信息以及奖励函数输入至初始深度强化学习模型之中,基于多个Actor网络对多个样本无人机的样本任务信息之入至初始深度强化学习模型之中,根据多个Actor网络对多个样本无人机的样本任务信息[0049]b:基于奖励函数确定出每个所述样本无人机的下一时刻动作信息所对应的奖励[0050]这里,根据奖励函数确定出每个样本无人机的下一时刻动作信息所对应的奖励励多无人机尽快探索到目标并向目标趋近,表示到达目标集结的目标点附近,则给一个大奖励,鼓励无人机可以到达目标点后在目标点停留徘徊。Ratam部分处理无人机与障碍物的碰撞情况。如果无人机避免碰撞,这部分奖励为零或正行为。[0052]c:将每个所述样本无人机的下一时刻动作信息以及所述样本无人机执行下一时[0054]这里,Critic网络根据Actor网络生成的动作和当前状态,评估其价值并提供反及所述样本无人机执行下一时刻动作信息时所对应新的状态信息输入至Critic网络之中,[0057]II:对特征编码后的下一时刻动作特征以及新的状态特基于多层感知器对多头注意力处理后的所述特征编码后的下一时刻动作特征以及新的状[0058]这里,对特征编码后的下一时刻动作特征以及新的状态特征进行多头注意力处特征编码降维,然后在使用多头注意力机制模块捕捉输入状态和动作数据中的重要特征,通过多个注意力头并行处理输入特征,增强模型对状态和动作信息的敏感度和捕捉能力。[0060]d:基于所述状态动作价值以及所述奖励值之间的损失值对相对应的所述Critic数时停止对所述Actor网络以及所述Critic网络的网络参数的更新,确定出所述深度强化'更新策略网络对每个无人机i,使用策略梯度更新策略网络参数o'策略梯度更新,使用软更新参数更新目标网络。深度强化学习模型可以针对于不同的场景任务进行决策人机所对应的当前时刻的隐藏状态特征hf,将无人机所对应的当前时刻的隐藏状态特征与其他无人机的当前时刻的隐藏状态特征输入至软注意力机制之中,得到当前时刻t下人机的隐藏状态特征进行聚合处理得到聚合后的隐藏状态特征gf,将隐藏状态特征gf和进行处理得到无人机下一时刻的动作信息af,将动作信息af和定的位置和姿态目标。位置控制器接收目标位置parget、目标速度和目标偏航角的输入,并结合当前的位置par和速度,计算出目标姿态信DUS和目标推力信息反馈至所述深度强化学习模型之中继续预测出每个所述无人机在未来时刻的动作信学习模型之中继续预测出每个无人机在未来时动态环境中进行自适应任务分配和路径规划。理的奖励函数设定是这一步骤的核心。第二,决策模块的构建主要依赖于改进的基于Actor_Critic(AC)框架的多无人机协同深度强化学习算法Multi_AgentCombination算法会决定每架无人机在三个空间维度上的加速度。观测空间包括无人机自身的速度vs人机斜上方4s一周的8个传感器信号、无人机斜下方4s一周的8个传感器信号[0083]Rwe部分与目标地标与最近的无人机之间的欧式距离成反比,其中无人机当前强化学习模型之中,基于所述深度强化学习模型之中的多个Actor网络对多个所述无人机整后的信息反馈至所述深度强化学习模型之中继续预测出每个所述无人机在未来时刻的的结构示意图之一;图6为本申请实施例所提供的一种多无人机的协同决策控制装置的结决策模块520,用于将多个所述无人机的任务信息输入至预先训练好的深度强化控制模块530,用于基于位置控制器以及姿态控制器对每个所述无人机的下一时无人机环境平台540,用于在基于每个所述无人机的下一时刻控制命令对控制电机的速度和方向调整过程中,计算出每个所述无人机的螺旋桨产生的阻力以及地面效应模型之中的多个Actor网络的门控循环单元、软注意力机制以及图神经网络捕捉多个无人将所述无人机的任务信息输入至所述Actor网络的门控循环单元之中,对所述无基于软注意力机制对该无人机的当前时刻的隐藏状态特征向量与其他无人机的所述图神经网络基于该无人机与其他无人机之间的注意力权重对其他无人机的将聚合后的隐藏状态特征向量和该无人机的当前时刻隐藏状态特征向量进行向[0094]进一步的,决策模块520在用于所述对下一时刻的所述动作信息进行信息转换处对所述目标速度信息进行积分处理,确定出下一时刻决策信息中的目标位置信模块550用于通过以下步骤对所述深度强化将样本无人机任务场景的多个样本无人机的样本任务信息以及奖励函数输入至初始深度强化学习模型之中,基于多个Actor网络对多个样本无人机的样本任务信息之中将每个所述样本无人机的下一时刻动作信息以及所述样本无人机执行下一时刻基于所述状态动作价值以及所述奖励值之间的损失值对相对应的所述Critic网时停止对所述Actor网络以及所述Critic网络的网络参数的更新,确定出所述深度强化学[0097]进一步的,模型训练模块550在用于所述将每个所述样本无人机的下一时刻动作信息以及所述样本无人机执行下一时刻动作信息时所对应新的状态信息输入至Critic网下一时刻动作信息所对应的动作特征以及新的状多层感知器对多头注意力处理后的所述特征编码后的下一时刻动作特征以及新的状态特[0098]进一步的,无人机环境平台540通过以下公式确定出所述无人机的螺旋桨产生的中的多个Actor网络的门控循环单元、软注意力机制以及图神经网络捕捉多个无人机之间[0102]所述存储器720存储有所述处理器710可执行

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论