CN119417169A 电子组件车间agv复合作业模式下的改进ppo调度方法、系统、介质及设备 (北京信息科技大学)_第1页
CN119417169A 电子组件车间agv复合作业模式下的改进ppo调度方法、系统、介质及设备 (北京信息科技大学)_第2页
CN119417169A 电子组件车间agv复合作业模式下的改进ppo调度方法、系统、介质及设备 (北京信息科技大学)_第3页
CN119417169A 电子组件车间agv复合作业模式下的改进ppo调度方法、系统、介质及设备 (北京信息科技大学)_第4页
CN119417169A 电子组件车间agv复合作业模式下的改进ppo调度方法、系统、介质及设备 (北京信息科技大学)_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

电子组件车间AGV复合作业模式下的改进本发明涉及电子组件车间AGV物流调度领域,公开了一种电子组件车间AGV复合作业模式通过多个任务订单使AGV在栅格地图进行A*搜索AGV完成路径规划和调度任务。本发明能快速学习获得电子组件车间AGV调度策略,学习效率显2利用栅格建模对电子组件车间环境地图进行栅格化,通过多个任务订单使AGV在栅格在线生成实时任务订单,通过前两个阶段训练好的决策网络模型指导AGV完成路径规2.如权利要求1所述电子组件车间AGV复合作业模式下的改进PPO调度方法,其特征在利用A*算法指导AGV在栅格地图中连续完成批次任务,保存每次任务动作轨迹节点信3.如权利要求1所述电子组件车间AGV复合作业模式下的改进PPO调度方法,其特征在4.如权利要求1所述电子组件车间AGV复合作业模式下的改进PPO调度方法,其特征在根据连续的交互步数来存储当前观测状态st、相应的动作at、批量的动作概率分布TO.a(acls)和批量的奖励值rt+1;和Critic网络的损失函数L(Φ),利用梯度下降法更新Actor网络和Critic网络的模型参5.如权利要求4所述电子组件车间AGV复合作业模式下的改进PPO调度方法,其特征在3tt6.如权利要求4所述电子组件车间AGV复合作业模式下的改进PPO调度方法,其特征在范围内;策略比率ratios是新策略在状态st下选择动作at的概率与旧策略在状态st下选择7.如权利要求1所述电子组件车间AGV复合作业模式下的改进PPO调度方法,其特征在实时调度模块,在线生成实时任务订单,通过前两个阶9.一种存储一个或多个程序的计算机可读存个或多个程序包括用于执行如权利要求1至7所述方法中的任一4[0001]本发明涉及一种电子组件车间AGV物流调度技术领域,特别是关于一种电子组件[0002]在电子组件制造中,由于制造环境的要求,需要保持洁净空间,AGV(Automated[0003]传统的AGV路径规划和任务调度算法可大致分为启发式算法和智能优化算法,比[0004]近年来随着人工智能技术的发展,为了克服启发式搜索算法在复杂环境下的多AGV调度的局限性,强化学习(ReinforcementLearnin的AGVDP问题仅考虑生产周期的规划并没有考虑车辆路径过程中的障碍和冲突问题。无论[0005]针对上述问题,本发明的目的是提供一种电子组件车间AGV复合作业模式下的改5[0008]利用A*算法指导AGV在栅格地图中连续完成批次任务,保存每次任务动作轨迹节[0009]抽取N个样本数据传入Actor网络,网络输出结果是多个样本动作空间的概率分概率分布Toa(arls)和批量的奖励值rt+1;[0024]预训练结束后采用PPO算法进行训练,当智能体能够连续稳定获得最大累计奖励6[0031]图1是本发明实施例中电子组件车间AGV复合作业模式下的改进PPO调度方法整体[0035]图5是本发明实施例中不同数量AGV在改进前后PPO算法中平均完成任务时间对比[0036]自动导引运输车(AGV)的调度效率在电子组件车间智能制造物流运作中起着至关7式算法解决调度问题效果不满足需求的问题,本发明提出一种电子组件车间AGV复合作业[0041]1)利用栅格建模对车间环境地图进行栅格化,通过多个任务订单使AGV在栅格地[0043]3)在线生成实时任务订单,通过前两个阶段训练好的决策网络模型指导AGV完成励值结构和处理观测空间的卷积神经网路结构进行设计,以适应复杂环境的制造车间的[0046]根据A*算法可以获取执行每次任务时AGV和环境交互成功到达目标点的动作轨迹8[0049]1.1)利用A*算法指导AGV在栅ttttt)是t时[0062](3)计算策略比率ratios,即新策略在状态st下选择动作at的概9[0074]其中,批量的动作概率分布TO.a(arls)是指策略π指t时刻观测状态下执行动作a[0075]2.2.2)根据st和at计算的新策略πθ(at|st)和旧策略TO.a(arlst)计算比率ratios,[0083]预训练结束后采用PPO算法进行训练,当智能体能够连续稳定获得最大累计奖励[0089]利用A*算法指导AGV在栅格地图中连续完成批次任务,保存每次任务动作轨迹节[0090]抽取N个样本数据传入ActorNet,网络输出结果是多个样本动作空间的概率分动作概率分布和批量的奖励值[0099]预训练结束后采用PPO算法进行训练,当智能体能够连续稳定获得最大累计奖励[0101]如图3所示是改进前后PPO算法的训练损失曲线对比,图4是A*算法预训练+PPO算法的奖励值收敛曲线,说明了改进后的PPO算法在收敛速度和损失值稳定性上具有显著优[0103]综上,自动导引运输车(AGV)的调度效率在智能工厂物流运作中起着至关重要的的技术方案本质上或者说对现有技术做出贡献的部分或者该技术方案的部分可以以软件现在流程图一个流程或多个流程和/或方框图一个方框或多个方框中指定[0110]这些计算机程序指令也可存储在能引导计算机或其他可编程数据处理设备以特令装置的制造品,该指令装置实现在流程图一个流程或多个流程和/或方框图一个方框或其他可编程设备上执行的指令提供用于实现在流程图一个流程或多个流程和/或方框图一以对前述各实施例

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论