版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
一种基于合作竞争博弈的列车运行实时调本发明涉及一种基于合作竞争博弈的列车建立训练目标网络过程中的即时奖励函数和延点站时基于竞争博弈策略和列车自身的延误时基于合作博弈策略和所有列车总的延误时间获2S10、获取指定线路的线路静态数据和与指定线路关联的所有列车初始时刻的动态数所述即时奖励函数是在各列车未到达终点站时基于竞争博弈策略和列车自身的延误所述延时奖励函数是各列车到达终点站后基于合作博弈策略和所有列车总的延误时在损失函数和奖励函数满足收敛条件时,获得训练后的策3d.,2a,+G、(1.9)i,n相邻列车i'在车站n的到达和出发的最小时l.(1.13)action*t,i表示列车i的纳什均衡策略,action*t,_i表示除列车i之4假设actiont_1,i=0并且满足出发条件,则当随机数rand>ò时根据策略网络Q(St,i,表示强化学习环境中帮助策略网络更新设置的目标网络,目标初始时刻的动态数据包括:列车初始时刻运行位置为始获取单元,用于获取指定线路的线路静态数据和与指定线路关联的所所述即时奖励函数是在各列车未到达终点站时基于竞争博弈策略和列车自身的延误所述延时奖励函数是各列车到达终点站后基于合作博弈策略和所有列车总的延误时策略网络训练单元,用于所有列车未到达终点站时,基于列车5在损失函数和奖励函数满足收敛条件时,获得训练后的策)O(ai6i,n相邻列车i'在车站n的到达和出发的最小时l(1.13)action*t,i表示列车i的纳什均衡策略,action*t,_i表示除列车i之假设actiont_1,i=0并且满足出发条件,则当随机数rand>ò时根据策略网络Q(St,i,7表表示强化学习环境中帮助策略网络更新设置的目标网络,目标程序,所述处理器执行所述计算机程序以实现如权利要求1_2任一所述的基于合作竞争博8[0009]第一方面,本发明实施例提供一种基于合作竞争博弈的[0010]S10、获取指定线路的线路静态数据和与指定线路关联的所有列车初始时刻的动9[0012]所述即时奖励函数是在各列车未到达终点站时基于竞争博弈策略和列车自身的[0013]所述延时奖励函数是各列车到达终点站后基于合作博弈策略和所有列车总的延mes,.(1.1)d,2a,,+7(1.9)车i和相邻列车i'在车站n的到达和出发的最小时间间隔,da_hn表示同一车站n的列车i和sl.(1.13)间t时列车i在始发站nt,i=0设置为出发时间d.减去计划出发时间dr;ai,n、u,分别表[0048]可选地,所述第一条件为:Rt,i(action*t,i,action*t,_i)≥Rt,i(actiont,i,[0054]假设actiont-1,i=0并且满足出发条件,则当随机数rand>ò时根据策略网络Q(St,i,actiont,i,θ)选择动作act[0063]表示强化学习环境中帮助策略网络更新设置的目标网络,[0064]第二方面,本发明实施例还提供一种基于合作竞争博弈的列车运行实时调整装建立训练策略网络过程中的即时奖励函数和[0067]所述即时奖励函数是在各列车未到达终点站时基于竞争博弈策略和列车自身的[0068]所述延时奖励函数是各列车到达终点站后基于合作博弈策略和所有列车总的延[0077]将学习到的列车运行图调整策略即列车在车站的到发顺序的非线性关系保存到[0078]图1为本发明实施例提供的基于合作竞争博弈的列车速度曲线优化与运行图调整[0085]图8为本发明实施例提供的一种基于合作竞争博弈的列车运行实时调整方法的流[0092]S10、获取指定线路的线路静态数据和与指定线路关联的所有列车初始时刻的动[0094]列车运行动态数据包括初始时刻的列车运行动态数据和其他时刻与强化学习环[0097]所述即时奖励函数是在各列车未到达终点站时基于竞争博弈策略和列车自身的[0098]所述延时奖励函数是各列车到达终点站后基于合作博弈策略和所有列车总的延2,...,t1},t0和t1分别表示运行图调整时间区间的起始时间和最终时间,当前时间t∈[0109]步骤1:获取指定线路的线路静态数据和指定线路关联的所有列车初始时刻的动[0114]所述即时奖励函数是在各列车未到达终点站时基于竞争博弈策略和列车自身的[0115]所述延时奖励函数是各列车到达终点站后基于合作博弈策略和列车总的延误时[0122]③相邻列车间隔限制:a_hn和d_hn分别为列车i和相邻列车i'SH_dis_end,(1.11)1.9);满足列车间发车间隔约束(公式1.4);满足列车之间的出发‑到达间隔约束(公式[0139]步骤2_2:设置各智能体状态(即列车状态)为当前列车在当前时刻在前方车站的[0140]列车状态设置为当前列车i[0148]列车未到达终点站时使用竞争博弈策略,以各列车i自身的延误时间设置即时奖时列车i在始发站nt,i=0设置为出发时间dm,减去计划出发时间dr;在中间车站nt,i=1,...,N_1设置为出发延误时间(出发时间dm,减去计划出发时间)加上到达延误时间[0163]假设actiont_1,i=0并且满足出发条件,则当随机数rand>ò时根据策略网络Q(St,i,actiont,i,θ)选择动作act[0167]动作actiont,i选择完后,列车i采取选择好的动作actiont,i,会获得奖励函数[0170]每个回合的奖励函数取所有与环境交互得到的奖励函数RT,i的平均值;而[0175]将学习到的列车运行图调整策略即列车在车站的到发顺序的非线性关系保存到建立训练策略网络过程中的即时奖励函数和[0182]所述即时奖励函数是在各列车未到达终点站时基于竞争博弈策略和列车自身的[0183]所述延时奖励函数是各列车到达终点站后基于合作博弈策略和所有列车总的延上述术语的示意性表述
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 家禽养殖合作协议
- 外耳道炎预防与对症护理
- 审计专业技术资格(高级)案例分析专项突破(含答案)
- 精算师考试精算师考试常考题(带详解)
- 统编版(2024)新教材小学二年级道德与法制下册第二单元第5课《亲近大自然》(教学课件)
- 导游证中级真题卷
- 精算师考试核心知识点梳理(完整版)
- 人工智能在保险精算领域的应用
- 统计软件Minitab应用考核试卷
- 2026 年山洪地质灾害群测群防科普课堂
- GB/T 6109.11-2025漆包圆绕组线第11部分:155级聚酰胺复合直焊聚氨酯漆包铜圆线
- 2025-2026学年部编版一年级语文上册(全册)教学设计
- 光伏居间合同(标准版)
- (正式版)DB2327∕T 068-2023 《大兴安岭苍术栽培技术规范》
- 制造业生产线租赁合同
- 《工业企业数字化水平评估规范》
- 高速公路建设科技创新与品质示范
- DB6501T 036-2022 乌鲁木齐市海绵城市建设设计导则
- 行政人员绩效考核表公共部门管理工具
- GB/T 45953-2025供应链安全管理体系规范
- 养蜂管理办法试行
评论
0/150
提交评论