版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
一种基于深度强化学习的综合能源系统模本发明公开了一种基于深度强化学习的综内对预测时域内各时刻的系统各设备输出状态2S2、基于最小全天用能成本目标函数,利用分布式S3、利用状态预测模型在日内对预测时域内各时刻的系统各设备输出状态进行预测,2.根据权利要求1所述的一种基于深度强化学习的综合能源系统模型预测控制方法,3.根据权利要求2所述的一种基于深度强化学习的综合能源系统模型预测控制方法,4.根据权利要求3所述的一种基于深度强化学习的综合能源系统模型预测控制方法,f(ζ)表示分布函数P下的概率密度函数;dζ表示对ξ进行积分。5.根据权利要求4所述的一种基于深度强化学习的综合能源系统模型预测控制方法,36.根据权利要求5所述的一种基于深度强化学习的综合能源系统模型预测控制方法,S232、利用分布式优化算法对鲁棒优化框架进行7.根据权利要求6所述的一种基于深度强化学习的综合能源系统模型预测控制方法,t表示t时刻园区综合能源设备中各机组的8.根据权利要求7所述的一种基于深度强化学习的综合能源系统模型预测控制方法,4S31、利用状态预测模型预测日内园区综合能源设备中各机组在预测时域内的输出状9.根据权利要求8所述的一种基于深度强化学习的综合能源系统模型预测控制方法,S313、基于预测值和日前计划中的偏差建立滚动优10.根据权利要求9所述的一种基于深度强化学习的综合能源系统模型预测控制方法,11.根据权利要求1所述的一种基于深度强化学习的综合能源系统模型预测控制方法,512.根据权利要求11所述的一种基于深度强化学习的综合能源系统模型预测控制方定状态空间和动作空间的维度构建智能体的评论家与行动者神经网S411、使用历史数据和模型评估指标对状态预13.根据权利要求12所述的一种基于深度强化学习的综合能源系统模型预测控制方14.根据权利要求13所述的一种基于深度强化学习的综合能源系统模型预测控制方15.根据权利要求14所述的一种基于深度强化学习的综合能源系统模型预测控制方表示计算在当前状态下,给定行动者网络生成的动作a时的值函数Q的梯67[0002]传统的能源系统通常采用分散的调度方式,各个能源子系统之间缺乏协同和优[0003]模型预测控制算法(ModelPredictiveControl,MPC)以其在综合能源系统中的和模型预测控制算法相结合实现调度是一个很8最关键挑战是它们缺乏约束强制保证;尽管一些安全的强化学习算法已经解决了这个问源微电网优化运行方法中利用强化学习Q_learning算法可以对MPC滚动优化目标函数权重[0010](3)学习参数有限,Q_learning算法难以同时学习多个参数,而当系统规模增加9[0027]S221、设定KL散度的限值γ,并利用K)表示参考分布P0下的概率密度函数;[0060]S31、利用状态预测模型预测日内园区综合能源设备中各机组在预测时域内的输[0081]S42、利用双延迟深度确定性策略梯度算法初始化智能体的评论家与行动者神经状态空间和动作空间的维度构建智能体的评论家与行动者神经网络包[0106]图1是根据本发明实施例的一种基于深度强化学习的综合能源系统模型预测控制[0107]图2是根据本发明实施例的一种基于深度强化学习的综合能源系统模型预测控制[0108]图3是根据本发明实施例的一种基于深度强化学习的综合能源系统模型预测控制t时分别表示t时刻CHP产热、电锅炉产热、燃气锅炉产热;[0163]S221、设定KL散度的限值γ,并利用K)表示参考分布P0下的概率密度函数;ppCostbat表[0198]以全天用能成本Costdayahead为目标函数,采用前述;PGBAC;时刻控制动作u(k)和扰动量r(k)预测出来的下一时刻ppp;p;,EBpp表示预测时域程度。[0236]S31、利用状态预测模型预测日内园区综合能源设备中各机组在预测时域内的输内的状态向量在权重系数Q的约束下尽可能接近日前参考值;第二项为保障电网的稳定性[0257]S42、利用双延迟深度确定性策略梯度算法初始化智能体的评论家与行动者神经状态空间和动作空间的维度构建智能体的评论家与行动者神经网络包[0292]2)当经验池D累计了足够的智能体与环境交互的数据后,从回放记忆单元中随机φ=π/φ(s/)+ε2,ε2表示策略噪声,用于策略平滑,然后利用目标评论家网络计算目标值[0297]5)当评论家网络更新一定步数之后,双延迟更新行动者网络π和目标行动者φφ网络的参数。表示评论家网络输出的关于动作a的梯度,计算在当前状态的交互过程中学习到最优的权重系数参数传递给模型预测控制模型进行调度控[0306]强化学习模块采用双延迟深度确定性策略梯度(TwinDelayedDeepTarget网络是ActorG网络的延迟更新网络副本,主要是为了稳定行动者网络的学[0309]和criQr是基于值的评论家网络,用于评估行动者网络生成动作的价值,并更新Actor"。Target和Target是目标评论家网络,用于评估Target网络生成动作的价值,计算目标值,用于更新CCQ4和Target网络结构是为了稳定学习过程并防止过拟合,在计算Q值的时候选取两个目标评论家网络[0310]基于深度强化学习算法,针对MPC外生控制参数建立可动态自适应寻优的闭环控网络会根据MPC执行结果和目标函数及奖励进行学习,通过对大量的历史数据进行学习训应用范围不仅局限于综合能源系统优化运行,也可进一步扩展至时域系统的滚动优化问
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 交通安全知识讲座
- 《高血压的诊疗》课件
- 《食品微生物》课件
- 事业单位负债的核算
- 医院操作相关性感染
- 个写在脸上的健康密码
- 培训钢筋机械连接技术规程JGJ
- 企业安全生产“四个责任”与履职尽责
- 历史上册第9课新文化运动
- 华保险“祥和万家”两全保险
- 2027届高考语文一轮复习:正确理解运用实词虚词
- 2026年陕西日报社及陕西日报传媒集团招聘(46人)笔试参考题库及答案详解
- 2026秋季学期小学人教版数学四年级上册(新教材)教学进度安排表(安排5课时)
- 2026 年秋季开学大学军训网络文明行为教育课件
- 某机械厂采购管理办法
- 2026年高考数学全国二卷真题深入解读课件
- 2026-2030中国暖宫带市场销售格局与前景需求潜力研究研究报告
- (2026年)检验检测机构资质认定“一单一库”的学习与解读(2026年实施)课件
- 2026年公立医院财务科招聘考试试题(附答案)
- 机修钳工(高级)证考试题及答案
- 2025年注册结构工程师考试一级专业考试真题及答案解析
评论
0/150
提交评论