CN114942633B 基于数字孪生和强化学习的多智能体协同避碰采摘方法 (华南农业大学)_第1页
CN114942633B 基于数字孪生和强化学习的多智能体协同避碰采摘方法 (华南农业大学)_第2页
CN114942633B 基于数字孪生和强化学习的多智能体协同避碰采摘方法 (华南农业大学)_第3页
CN114942633B 基于数字孪生和强化学习的多智能体协同避碰采摘方法 (华南农业大学)_第4页
CN114942633B 基于数字孪生和强化学习的多智能体协同避碰采摘方法 (华南农业大学)_第5页
已阅读5页,还剩23页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于数字孪生和强化学习的多智能体协同本发明公开了一种基于数字孪生和深度强可夫决策过程框架对虚拟机器人自主避碰采摘真实机器人在错综复杂的环境下完成自动避碰2器与采摘点的相对位置pc、机器人各个转动末端执行器与采摘点的距离Djoa、机器人各个转动轴的中心点与障碍物的距离DO,机器其中表示为智能体即采摘机器人个数;所述动作空间包括各个机器人各个关节轴的转动所述奖励函数包括:采摘点引导函数Rguiae、障碍物避碰函数ROSS、机器人之间的碰撞惩罚函数Rarm以及时间惩罚函数Rrime;系统累积奖励值R计算方法如下式所示:i=1.2.3..n为智能体个数,并取得在状态t时刻的最小距离Dmin;当逐渐减小时给其中,障碍物避碰函数Rbs的计算方法是计算各个机器人旋转轴的横向距离与障碍物3其中,机器人之间的碰撞惩罚函数Rarm的计算方法是判断机器人的空间集合orm与其中,时间惩罚函数Rtime计算方法是根据各个智能体在初始状态下到目标采摘点的;MADPPO学习模型进行多智能体采摘避传输到仿真环境中并采用智能仿真调度算法驱动虚拟平台各模型构建4str1:为t+1时刻智能体所处的状态。5建一个多智能体协同避碰采摘路径规划系统具有十分[0005]一种基于数字孪生和深度强化学习的多智能体协同避碰采摘方法,包括下述步[0006](1)数据采集系统实时采集真实果园环境信息并传输到云服务器,结合数据分析[0007](2)建立云服务器与虚拟仿真平台之间的数据通信,利用云服务器的实时数据驱[0008](3)基于马尔可夫决策过程框架对虚拟机器人自主避碰采摘策略问题进行环境建[0009](4)基于人工势场法设计奖励函数,结合多智能体分布式近端策略优化算法建立6[0011](6)设置训练方法,包括终止条件设置、训练参数配置、训练过程设置以及使用APF-MADPPO学习模型进行多智能体采摘避[0012](7)基于迁移学习的方法将训练结果模型迁移到动态、非结构化环境下进行采摘[0013](8)以所述最优采摘路径为参考,通过控制指令驱动真实机器人在错综复杂的环机制将实时数据传输到仿真环境中并采用智能仿真调度算法驱动虚拟平台各模型构建孪[0016]步骤(3)中,是对复杂动态的野外环境下多智能体协同避碰采摘策略问题进行环t[0021]步骤(4)中,所述APF-MADPPO学习模型,包括状态空间、动作空间和奖励函数设计;所述状态空间包括机器人末端执行器空间位置paa.采摘点空间位置Pgoal、障碍物中心点与障碍物的相对位置机器人末端执行器与采摘点的距离机器人各个转动轴的中心点与障碍物的距离Dio,机器人之间各个转动轴的距离Din记为其中i表示为智能体(即采摘机器人)7[0028]其中,障碍物避碰函数Robs的计算方法是计算各个机器人旋转轴的横向距离与障碍物位置之间的距离Djoar:当大于旋转轴横向距离L与障碍物警示区域半径R时,惩罚函数不起作用;当大于障碍物半径r与横向距离L之和并且小于横向距离L与障Djoar,小于障碍物半径r与横向距离L之和时,给予最大惩罚k4并结束本回合;具体如下式所示:8维模型构建孪生果园场景仿真环境;同时用于接收实时训练过程控制效果进行可视化展[0039]所述训练学习模块是指使用ML-Agents插件建立深度强化学习与仿真环境之间的[0040]所述推理学习模块是指基于迁移学习方法将训练结果模型迁移到动态多变的环境下进行采摘机器人避碰路径规划。[0044](2)本发明基于马尔科夫决策过程框架建立虚拟采摘机器人自主避碰策略环境模9[0046](4)本发明根据仿真实验获取最优采摘路径作为参考依据,然后通过控制指令驱[0047]图1为本发明的基于数字孪生和深度强化学习的多智能体协同避碰采摘方法的框数据和农艺知识,构建数字果园的知识库和数据库,利用3DMax建模软件构建虚拟场景模在Unity仿真平台搭建实时数据驱动架构,利用C#高级编程语言建立云服务器与仿真平台[0065]其中采摘点引导奖赏函数Rguide计算方法是通过计算各个机械臂末端执行器法中只需要考虑旋转轴的横向距离与障碍物位置之间的距离即可。设障碍物半径为3表示为低[0071]其中机器人之间的碰撞惩罚函数Rarm计算方法是判断机器人的空间集合与[0073]其中时间惩罚函数Rtime计算方法是根据各个智能体在初始状态下到目标采摘点全局网络从共享梯度区获得梯度信息进行统一更新Actor和Critic参数并反馈给各个局部特征信息提取效率。利用ML-Agents插件通过Socket通信机制建立仿真环境与PythonAPI学习的策略集成一个基于TensorFlow的网络模型并自动保证在[0082]以上所述仅为本发明的实施例,但本发明的实施方式并

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论