CN119417078A 一种可解释强化学习的社区综合能源优化调度方法及系统 (安徽大学)_第1页
CN119417078A 一种可解释强化学习的社区综合能源优化调度方法及系统 (安徽大学)_第2页
CN119417078A 一种可解释强化学习的社区综合能源优化调度方法及系统 (安徽大学)_第3页
CN119417078A 一种可解释强化学习的社区综合能源优化调度方法及系统 (安徽大学)_第4页
CN119417078A 一种可解释强化学习的社区综合能源优化调度方法及系统 (安徽大学)_第5页
已阅读5页,还剩57页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种可解释强化学习的社区综合能源优化一种可解释强化学习的社区综合能源优化工智能框架来提取算法的训练决策规则和影响的实时监测和分析,准确把握社区能源供需情2S2、使用协作式强化学习算法对社区综合能源系统S3、创建一个可解释的人工智能框架提取协作式强决策树模型和分析影响决策的重要环境特征的欠采样深度沙S4、将提取的决策规则和影响决策的重要环境特征作为协作式强化学习算法的新经S5、判断更新决策规则后决策树的精度是否2.根据权利要求1所述的一种可解释强化学习的社区综合能源优化调度方法,其特征3柴油发电机的输出功率,pgesd为t时刻储能系统的放电功率,为t时刻社区内建筑3.根据权利要求1所述的一种可解释强化学习的社区综合能源优化调度方法,其特征S21、创建自定义的多智能体社区综合能源系统作为S22、在环境E下设计一种渐进式任务上下文的多θ4.根据权利要求1所述的一种可解释强化学习的社区综合能源优化调度方法,其特征4决策树模型,指导智能体将原始的环境特征数据转化为更有利于学习和决策的状态表示,S321、基于决策树所选择的具有信息量的特征S331、使用训练好的社区综合能源系统的能源管理模S333、选择最高纯度的故障环境状态样本和下公式计算每个环境状态下最优特征的平均SHAP值来表示不同环境状态下的环境特征对55.根据权利要求2所述的一种可解释强化学习的社区综合能源优化调度方法,其特征所述社区综合能源系统的能源管理模型的目标函数中住宅区、商业2时刻,ure为t时刻可移载负荷权重6所述模型构建模块用于根据社区综合能源系统的模型架构,基于马尔科夫决策过程,所述模型训练模块用于使用协作式强化学习算法对社区综合能源系统的能源管理模所述智能框架创建模块用于创建一个可解释的人工智能框架提取协作式强化学习算包括提取算法决策规则的决策树模型和分析影响决策的重要环境特征的欠采样深度沙普所述决策更新模块用于将提取的决策规则和影响决策的重要环境特征作为协作式强所述循环判断模块用于判断更新决策规则后决策树的精度是否达到设7.根据权利要求6所述的一种可解释强化学习的社区综合能源优化调度系统,其特征所述目标函数构建单元用于构建如下社区综合能源系统的能源管理模型总的目标函7所述约束条件构建单元用于构建如下社区综合能源系统的能源管理模型的约柴油发电机的输出功率,pgesd为t时刻储能系统的放电功率,为t时刻社区内建筑的用电负荷,为t时刻储能系统的充电功率,8.根据权利要求6所述的一种可解释强化学习的社区综合能源优化调度系统,其特征所述环境创建单元用于创建自定义的多智能体社区综合能源系统作为环境E,所述智所述策略训练单元用于在环境E下设计一种渐进式任务上下文的多智能体强化学习算所述模型提取器构建子单元用于将环境E下的任务抽象为上下文信息,构建一个模型8θ所述特征提取器设计子单元用于设计一个可以任务知识共享的特征提9.根据权利要求6所述的一种可解释强化学习的社区综合能源优化调度系统,其特征所述数据收集单元用于创建一个缓冲区,收集智能体使用协作式所述决策树构建单元用于基于智能体使用协作式强化学习算法在环境中执行任务时所述关键特征输出子单元用于基于决策树所选择的具有信息量的特征行为数据进行所述状态向量构建子单元用于根据决策树输出的关键特征向量的取9所述重要特征分析单元用于设计一种基于欠采样的深度沙普所述环境数据收集子单元用于使用训练好的社区综合能源系统的能源管理模型执行所述样本识别子单元用于通过最小化欠采样目标函数来平衡故障环境状态样本和正所述平均SHAP值计算子单元用于选择最高纯度的故障环境状态样本和正常环境状态所述社区综合能源系统的能源管理模型的目标函数中住宅区、商业ar着城市化进程的推进而增加,电力和能源部门的进步推动了电网向能源互联网的方向发[0003]应用分布式协调控制来实现社区可再生能源系统的协调优化成为一种可行的途则的决策树模型和分析影响决策的重要环境隙,t为时间间隙中的t时刻,I为住宅区、商业区或工业区,i为各区内的第i座建筑,时刻柴油发电机的输出功率,es"为t时刻储能系统的放电意策略在任务中的轨迹τ=(s0,…,sN)为输入,sN为策略N的轨迹,提取出的高斯分布[0029]上式中,m*i为最相关的策略头,M为N个策略中设计的策略头数,K为轨迹数,为策略头m中所有样本特征提取值的均值。[0039]S332、通过最小化欠采样目标函数来平衡故障环境状态样本和正常环境状态样用以下公式计算每个环境状态下最优特征的平均SHAP值来表示不同环境状态下的环境特相对于数据集中第k个样本数据的第i个特征值的梯度,为第k个样本数据的第i个特减载前的可减载功率,为减载后的可减载功率;χshift为单位可移载荷的补偿成本,ar[0056]所述模型训练模块用于使用协作式强化学习算法对社区综合能源系统的能源管[0057]所述智能框架创建模块用于创建一个可解释的人工智能框架提取协作式强化学框架包括提取算法决策规则的决策树模型和分析影响决策的重要环境特征的欠采样深度[0058]所述决策更新模块用于将提取的决策规则和影响决策的重要环境特征作为协作[0061]所述目标函数构建单元用于构建如下社区综合能源系统的能源管理模型总的目隙,t为时间间隙中的t时刻,I为住宅区、商业区或工业区,i为各区内的第i座建筑,[0065]所述约束条件构建单元用于构建如下社区综合能源系统的能源管理模型的约束时刻柴油发电机的输出功率,pgesd为t时刻储能系统的[0070]所述环境创建单元用于创建自定义的多智能体社区综合能源系统作为环境E,所[0071]所述策略训练单元用于在环境E下设计一种渐进式任务上下文的多智能体强化学[0072]所述模型提取器构建子单元用于将环境E下的任务抽象为上下文信息,构建一个[0078]上式中,m*i为最相关的策略头,M为N个策略中设计的策略头数,K为轨迹数,为策略头m中所有样本特征提取值的均值。[0081]所述决策树构建单元用于基于智能体使用协作式强化学习算法在环境中执行任[0082]所述关键特征输出子单元用于基于决策树所选择的具有信息量的特征行为数据[0087]所述环境数据收集子单元用于使用训练好的社区综合能源系统的能源管理模型执行一系列决策任务,收集模型在当前最优策略执行时的状态动作数据作为环境数据集,[0088]所述样本识别子单元用于通过最小化欠采样目标函数来平衡故障环境状态样本[0092]所述平均SHAP值计算子单元用于选择最高纯度的故障环境状态样本和正常环境相对于数据集中第k个样本数据的第i个特征值的梯度,为第k个样本数据的第i个特为I区可削减负荷的总补偿成本,为I区可移载荷的总补偿费用,为移负荷的总补偿费用;χcut为单位减载的补偿成本,为t时刻可减负荷权重因子,个特定时间的开始,tr+为某个特定时间的结束,为t时刻可转移负荷权重因子,Lrans为t时刻传递的功率;能源管理模型,使用协作式强化学习算法对社区综合能源系统的能源管理模型进行训练,隙,t为时间间隙中的t时刻,I为住宅区、商业区或工业区,i为各区内的第i座建筑,为电网购电成本,为暖通空调的工作能量成本,c.e"()[0121]社区综合能源系统能源管理过程中各能量器件满足以下能量供应和需求的平衡减载前的可减载功率,为减载后的可减载功率;χshift为单位可移载荷的补偿成本,un为t时刻可移载负[0139]创建以电力系统为中心的自定义多智能体社区综合能源系统异构多代理环境作[0146]上式中,m*i为最相关的策略头,M为N个策略中设计的策略头数,K为轨迹数,为策略头m中所有样本特征提取值的均值;[0147]通过基于渐进式任务上下文的多智能体强化学习算法对社区中连续出现的任务决策树模型,提取协作式强化学习算法的决策规则来解释如何影响强化学习中的决策过输出模型结构化的关键特征向量,所述关键特征向量中包含了关于当前环境的丰富信息,公式计算每个环境状态下最优特征的平均SHAP值来表示不同环境状态下的环境特征对决相对于数据集中第k个样本数据的第i个特征值的梯度,为第k个样本数据的第i个特释方法得到的平均SHAP值较大的环境特征数据)作为协作式强化学习算法的新经验,再次的环境特征,从而可以将这些重要的环境特征整合到协作式强化学习算法的状态表示中,[0172]更新后的影响决策的重要环境特征之间的相关性,使用皮尔逊相关系数计算得[0178]所述模型训练模块用于使用协作式强化学习算法对社区综合能源系统的能源管[0179]所述智能框架创建模块用于创建一个可解释的人工智能框架提取协作式强化学框架包括提取算法决策规则的决策树模型和分析影响决策的重要环境特征的欠采样深度[0180]所述决策更新模块用于将提取的决策规则和影响决策的重要环境特征作为协作[0183]所述目标函数构建单元用于构建如下社区综合能源系统的能源管理模型总的目隙,t为时间间隙中的t时刻,I为住宅区、商业区或工业区,i为各区内的第i座建筑,[0187]所述约束条件构建单元用于构建如下社区综合能源系统的能源管理模型的约束时刻柴油发电机的输出功率,pgesd为t时刻储能系统的放电功率,为t时刻社区内建筑的用电负荷,为t时刻储能系统的充电功率,为t时刻ar[0199]所述环境创建单元用于创建自定义的多智能体社区综合能源系统作为环境E,所[0200]所述策略训练单元用于在环境E下设计一种渐进式任务上下文的多智能体强化学[0201]所述模型提取器构建子单元用于将环境E下的任务抽象为上下文信息,构建一个[0207]上式中,m*i为最相关的策略头,M为n个策略中设计的策略头数,K为轨迹数,为策略头m中所有样本特征提取值的均值。[0210]所述决策树构建单元用于基于智能体使用协作式强化学习算法在环境中执行任[0211]所述关键特征输出子单元用于基于决策树所选择的具有信息量的特征行为数据

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论