CN116468107B 一种基于集成的合作多智能体深度强化学习方法 (桂林电子科技大学)_第1页
CN116468107B 一种基于集成的合作多智能体深度强化学习方法 (桂林电子科技大学)_第2页
CN116468107B 一种基于集成的合作多智能体深度强化学习方法 (桂林电子科技大学)_第3页
CN116468107B 一种基于集成的合作多智能体深度强化学习方法 (桂林电子科技大学)_第4页
CN116468107B 一种基于集成的合作多智能体深度强化学习方法 (桂林电子科技大学)_第5页
已阅读5页,还剩27页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于集成的合作多智能体深度强化学本发明公开了一种基于集成的合作多智能能多个策略网络或者动作值网络集成的输出进集成的多个策略网络或者动作值网络使用不同2其中,每个智能体的内部都集成了多个策略网络或值网络,集成,得到集成的动作概率分布或动作值,智能体依据该集成结果进行动作采样或ε一每个智能体集成的多个策略网络或值网络使用同一个经验缓冲池中的转移样本进行ACW集成方法使用每个策略网络或者值网络的动作置信度作为其权重,通过将乘以权3考虑对应最多的策略网络或者值网络的此外,当某个状态下所有集成的策略网络或者值网络的最优动作都不相同时,OAV集成方法使用累加所有策略网络或者值网络的输出4[0002]基于深度强化学习的合作多智能体技术在处理序列决策任务方面具有很大的潜[0003]基于深度强化学习的合作多智能体主要可分为基于演员评论家的方法和基于值势在于容易陷入次优策略,且存在高方差问题。基于值函数分解的方法(如VDN、QMIX、是基于值函数分解的方法,都无法避免合作智能体系统中智能体决策的鲁棒性不足的问[0005]本发明的目的是针对目前基于深度强化学习的合作多智能体中智能体决策的鲁5[0007]一种基于集成的多智能体深度强化学习方法(Ensemble_basedDecision略网络或者值网络的输出集成为一个总体的动作概i32个转移样本用于训练;由于每次训练时,m个策略网络或者值网络都独立的从经验池的于最优动作投票的集成方法(EnsembleMethodBasedonOptimalActionVoting,简称6习中,动作置信度的含义是智能体依据动作概率分布或者[0019]ACW集成方法使用每个策略网络或者值网络的动作置信度作为其权重,通过将乘以权重的动作概率分布或者动作值累加得到集成的动作概率分布PACW(o|·)或者动作值络或者值网络的最优动作都是同一个动作则认为选择该动作能为智能体带来最大的策略网络或者值网络的最优动作都不相同时,OAV集成方法使用累加所有策略网络或者值7成方法将m个策略网络或者动作值网络的输出集成为一个总体的动作概率分布或者动作值,智能体依据总体的动作概率分布进行动作采样或者依据动作值进行ε_greedy动作选[0037]1、本技术方案通过为合作多智能体系统中的每个智能体集成多个策略网络或者8略网络或者值网络的输出集成为一个总体的动作概i32个转移样本用于训练;由于每次训练时,m个策略网络或者值网络都独立的从经验池的9[0061]ACW集成方法使用每个策略网络或者值网络的动作置信度作为其权重,通过将乘以权重的动作概率分布或者动作值累加得到集成的动作概率分布PACW(o|·)或者动作值[0065]下面通过一个具体的例子来演示ACW集成方法:假设智能体i集成了3个动作值网23[0067]若根据智能体i根据ε_greedy进行动作选择,则智能体i络或者值网络的最优动作都是同一个动作则认为选择该动作能为智能体带来最大的个时,只考虑对应最多的策略网络或者值网络的例如智能体i集成了7个策略网的策略网络或者值网络的最优动作都不相同时,OAV集成方法使用累加所有策略网络或者成方法将m个策略网络或者动作值网络的输出集成为一个总体的动作概率分布或者动作值,智能体依据总体的动作概率分布进行动作采样或者依据动作值进行ε_greedy动作选[0081]下面介绍将EDO应用到两种代表性算法(MADDPG和QMIX)上的实验表现。图2和图3家的方法的基础框架上结合EDO方法并分别采用ACW和OAV集成方法,ACW_QMIX和OAV_QMIX表示在基于值函数分解的方法的基础框架上结合EDO方法并分别采用ACW和OAV集成方法。从星际争霸多智能体挑战实验环境(SMAC)和多智能体粒子实验环境(MPE)中选取了总共3个实验环境进行测试,包括:corridor、物理欺骗(Physicaldeception)和捕食者_猎物体系统的目标是通过训练来提升智能体的微操和合作行为,以在具有挑战性的战斗场景分散执行的限制下合作多智能体系统学习合作行[0083]corridor是星际争霸多智能体挑战实验环境中的一种难度被定义为超级困难智能体独立控制,敌方是由星际争霸II内置脚本AI集中控制的24个跳虫单位(Zergling)。[0084]多智能体粒子任务是一类将智能体以及环境中的一些物体简化为粒子的模拟任物任务中,有N个移动速度较慢的合作智能体需要在环境中追逐M个移动速度较快的猎物,猎物将受到惩罚。智能体能观察其他智能体以及猎物的相对位置和速度以及路障的位置。能体,它们根据任意智能体到目标地标的最小距中,结合了EDO方法的OAV_MADDPG和ACW_MADDPG算法都取得了高于基础的MADDPG算法的奖性较强,在两类主流的合作多智能体深度强化

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论