CN118735200B 一种基于嵌入式强化学习的调度与维护优化方法及系统 (东华大学)_第1页
CN118735200B 一种基于嵌入式强化学习的调度与维护优化方法及系统 (东华大学)_第2页
CN118735200B 一种基于嵌入式强化学习的调度与维护优化方法及系统 (东华大学)_第3页
CN118735200B 一种基于嵌入式强化学习的调度与维护优化方法及系统 (东华大学)_第4页
CN118735200B 一种基于嵌入式强化学习的调度与维护优化方法及系统 (东华大学)_第5页
已阅读5页,还剩31页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

号一种基于嵌入式强化学习的调度与维护优本发明涉及一种基于嵌入式强化学习的调护智能体与调度与维护Markov决策过程交互并并执行特征选择智能体和调度与维护智能体进行调度与维护优化。系统包括调度与维护控制生产中订单动态到达环境下难以精准表征动态2与维护Markov决策过程;构建特征选择Markov决策过程;特征选择智能体与特征选择Markov决策过程交互并学习最优状态特征选择策略;调度与维护智能体与调度与维护其中,调度与维护智能体包含策略网络和目标网络特征选择智能体,包含actor网络和critic网络;actor网络和cr定义调度与维护的状态空间:是触发特征选择智能体对调度与维护M行监测后输出的调度与维护Markov决策过程定义调度与维护的动作空间:包含选择当前待加工任务或机器维A2=[1,2,…,n,n+1]定义调度与维护奖励函数:是对调度与维护智能体从调度与维护动作空间A2中选择的rc3cstsstrt…时的即时奖在决策时刻t2时,调度与维护智能体选择继续生产当前批次并在后续生产过程中机器在决策时刻t3时,调度与维护智能体选择继续生产当前批次并在后续生产过程中机器定义特征选择动作空间,包括对所有生产运行过程与机器维护数4定义特征选择奖励函数,是通过将选择后的生产运行过程与机步骤S5:特征选择智能体与特征选择Markov决策过程交互并学习最优状态特征选择策作后获得的关键特征训练调度与维护智能体以获得最优的特征选择策略,是特征选择智能体与特征选择MarkovQ络在参数为θ和状态为s1,t时选择动作a1,t时的预测值,y为目标值,Erama:Bruu分别表示式中,r为特征选择智能体actor网络在参数为θ和状态为s1,t时选择动作a1,t时的奖励自身策略TP选择的概率最大的动作a1,t+式中,Jn(v)表示critic网络参数为θ时critic网络的目标函数,a,r~T,(IS1,r)表示特征选择智能体critic网络在状态为s1,t时根据自身策略TP选择的概率最大的动作步骤S6:调度与维护智能体与调度与维护Markov决策过程交互并学习最优调度与维护5交互是调度与维护智能体通过根据特征选择智能体输出的关键特征对当前生产运行过程与机器维护数据进行观测得到状态s2,t、通过自身策略结合自适应动作选择机制选择最优调度与维护策略,是调度与维护智能体和调度与维护Ma通过判断当前可选动作确定可选动作集合以生成动作掩码矩阵,随后将训练好的特征选择智能体和调度与维护智能体部署至生产车间器运行过程数据的实时监测以自动触发特征选择智能体选择动态环境的关键状态特征并利用调度与维护智能体输出当前状态下最优的调骤S2中任一所述的基于嵌入式强化学习的调度与维护优化方法,系统包括调度与维护控制器、6调度与维护控制器,通过实时监测调度与维护过程号并将信号传递给调度与维护智能体以触发调度调度与维护智能体,在接受调度与维护控制器的状态习最优的调度与维护策略以选择并执行最优特征选择智能体在接受调度与维护智能体传递的触发信号之后通过检测调度与维护7到达的生产订单进行合理的调度优化并考虑设备的维护活动实现设备可靠度和生产成本前摄性调度以牺牲调度性能为前提将不确定性进行量化并在制定调度方案时进行考虑以扰动之后进行重新调度优化的响应时间随着问题规模的增大而递增并且重新生成调度方行动态变化且具有不规则到达时间的多种类产品订单动态到达也增加了环境变化的动态8[0006]针对生产调度与维护联合优化方法中存在订单动态到达环境下难以精准表征动生产效能以及企业竞争力具有重要的理论意义和过程与机器维护历史数据;构建调度与维护智能体和特征选择智能体;构建调度与维护程进行监测后输出的调度与维护Markov决策9n+1]+...…时的即时+...;[0052]步骤S5:特征选择智能体与特征选择Markov决策过程交互并学习最优状态特征有动作后获得的关键特征训练调度与维护智能体通过自模仿学习引导的Actor_Critic算法更新特征选择智能体中深度神解决特征选择智能体面临的稀疏奖励问题并加速特征选择智能体的学习和收敛分别表示使用较优、差轨迹所包含的交互数据所计算的均方误差的期望值;[0065]式中,pi、pir1分别为更新前后的特征选择智能体critic网络的参数,[0066]表示特征选择智能体critic网络在状态为s1,t时根据自身策略选择[0069]交互是调度与维护智能体通过根据特征选择智能体输出的关键特征对当前生产互以累积经验数据并通过DoubleDQN算法训练作集合以生成动作掩码矩阵,随后调度与维护智能体根据动作掩码矩阵结合ε一贪心策略)//2[0080]式中,D。LOSS表示调度与维护智能体中策略网络在参数ω下误差Loss的梯和机器运行过程数据的实时监测以自动触发特征选择智能体选择动态环境的关键状态特征并利用调度与维护智能体输出当前状态下最优的调度发信号并将信号传递给调度与维护智能体以触发调[0088]特征选择智能体在接受调度与维护智能体传递的触发信号之后通过检测调度与[0090]1.针对订单动态到达的调度与柔性维护问题,本发明提出了一种基于嵌入式DoubleDQN(双重深度Q网络)算法的调度与柔性维护优[0091]2.针对调度与维护智能体中预定义状态空间难以精准表征动态环境而降低算法性能的问题,本发明提供了一种基于改进Actor_Critic算法(演员_评论家算法)的状态特明提供了一种自适应动作选择机制以提升调度与维护智能体对解空间的全局探索能力并模仿学习算法引导特征选择智能体通过对自身探索的优秀经验轨迹进行模仿学习以加速[0094]图1为本发明提供的一种基于嵌入式强化学习的调度与维护优化方法实施步骤示[0095]图2为本发明提供的一种基于嵌入式强化学习的调度与维护优化方法逻辑示意[0096]图3为本发明提供的一种基于嵌入式强化学习的调度与维护优化系统架构示意过程与机器维护历史数据;构建调度与维护智能体和特征选择智能体;构建调度与维护程进行监测后输出的调度与维护Markov决策n+1]+...…时的即时有动作后获得的关键特征训练调度与维护智能体通过自模仿学习引导的Actor_Critic算法更新特征选择智能体中深度神解决特征选择智能体面临的稀疏奖励问题并加速特征选择智能体的学习和收敛分别表示使用较优、差轨迹所包含的交互数据所计算的均方误差的期望值。[0157]式中,pi、pir1分别为更新前后的特征选择智能体critic网络的参数,表示特征选择智能体critic网络在状态为s1,t时根据自身策略T,选择[0161]交互是调度与维护智能体通过根据特征选择智能体输出的关键特征对当前生产互以累积经验数据并通过DoubleDQN算法训练)//2[0172]式中,D。LOSS表示调度与维护智能体中策略网络在参数ω下误差Loss的梯和机器运行过程数据的实时监测以

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论