CN118444887B 一种基于深度强化学习的游戏智能体设计方法及系统 (吉林动画学院)_第1页
CN118444887B 一种基于深度强化学习的游戏智能体设计方法及系统 (吉林动画学院)_第2页
CN118444887B 一种基于深度强化学习的游戏智能体设计方法及系统 (吉林动画学院)_第3页
CN118444887B 一种基于深度强化学习的游戏智能体设计方法及系统 (吉林动画学院)_第4页
CN118444887B 一种基于深度强化学习的游戏智能体设计方法及系统 (吉林动画学院)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

109.一种基于深度强化学习的游戏智能体设计一种基于深度强化学习的游戏智能体设计决现有的智能体博弈中使用蒙特卡洛树搜索算2使用策略迭代实现深度强化学习训练包括策略评估和策略3S63、若使用策略梯度方法进行策略更新,优化策略价值网络直接输出动作的概率分构建策略价值网络模块,用于初始化游戏环境和任务评估状态价值函数模块,用于通过与定义模块所述游戏环境的交互,游戏智融合蒙特卡洛树搜索模块,用于融合蒙特卡洛树搜索方法,执行模块,用于基于蒙特卡洛树搜索的结果和策略价值网优化策略和价值函数的预测模块,用于游戏智能输出模块,用于重复评估状态价值函数模至优化策略和价值函数的预选择最优动作,结合深度神经网络提供的策略输出调整选择策略,深述计算机程序被处理器执行时实现权利要求1至6任一项所述的方4目标并不是学习输入和输出之间的映射关系,而是学习如何在一个环境中做出最优的决[0006]本发明针对现有技术中存在智能体博弈中使用蒙特卡洛树搜索算法的搜索效率5[0018]S21、在策略评估阶段,确定当前策略下的状态价值函数或者状态和动作价值函6计算机程序被处理器执行时实现方案一中任一能力使智能体在面对复杂决策环境时能够表现出更高的适应[0047]图1为实施方式一所述的一种基于深度强化学习的游戏智能体设计方法的流程[0048]图2为实施方式十一所述的一种基于深度强化学习的游戏智能体设计方法中游戏7[0063]S21、在策略评估阶段,确定当前策略下的状态价值函数或者状态和动作价值函89[0089]实施方式十一、本实施方式提出的实施例用于解释上述实施方式一至实施方式戏智能体中表示游戏状态。这通常涉及到将游戏状态转换为智能体能够处理的数据格式,[0101]深度神经网络被训练以输出在给定状态下采取不同动作的概率分布及状态价[0104]其中v(s)是在策略m下状态s的价值;n(als)是在状态s下选择动作a的概率;[0111]游戏智能体在与游戏环境互动过程中,通过执行动作并观察其结果来收集数[0129]V(s)-v(s)+a[r+yv(s')-v(s)][0134]S64、游戏智能体使用经验回放机制来提高学习效率和稳定性,每一步经验[0137]图1中所述的流程图中或在此以其他方式描述的任何过程或方法描述可以被理解为,表示包括一个或更N个用于实现定制逻辑功能或过程的步骤的可执行指令的代码的模描述的逻辑和/或步骤,图示了按照本公开各种实施例的装置、方法的可能实现的体系架是用于实现逻辑功能的可执行指令的定序列表,可以具体实现在任何计算机可读介质中,以其他合适方式进行处理来以电子方式获得所述程序,然后将其存储在计算机存储器中。中,N个步骤或方法可以用存储在存储器中且由合适的指令执行系统执行的软件或固件来一项或他们的组合来实现:具有用于对数据信号实现逻辑功能的逻辑门电路[0139]本领域技术人员可以理解,本

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论