版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、学习Agent 一个学习Agent可以被认为既包含决定采取什么动作的执行元件执行元件,又包含修改执行元件使其能制定更好决策的学习元件学习元件。一个学习元件的设计受到下列三个主要因素的影响:w将要学习的是执行元件的哪个组成部分;w对学习这些组成部分而言,可得到什么反馈;w组成部分是如何表示的。学习中可用的反馈类型学习中可用的反馈类型通常是决定智能体所面临的学习问题本质的最重要因素。一般分为三种类型:w有监督的从它的输入和输出的实例中学习一个函数。对于完全可观察的环境,智能体总能够观察到它的行动所带来的影响,因此可以采用有监督学习的方法来学习预测它们,对于部分可观察的环境,会困难一些。w无监督的在
2、未提供明确的输出值的情况下,学习输入的模式。w强化学习从强化事物中进行学习,而不是根据教师所说的应该做什么进行学习。学习系统设计的影响因素:如何表示学习到的知识;先验知识的可用性。归纳学习(1)确定性的有监督的学习纯归纳推理:给定f的实例集合,返回近似于f的函数h函数h被称为假设,一个好的假设应该是一般化的,也就是说能够正确地预测未见过的实例。例子(见板书):使一个单变量函数能拟合某些数据点假设空间H:选择最高次数为k的多项式集合一致假设:和所有的实例数据一致。如何在多个一致假设之间进行选择?奥卡姆剃刀(Ockhams razor)原则:优先选择与数据一致的最简单的假设。在假设的复杂度和数据拟
3、合度之间进行折中是不可避免的。找到一个简单的一致假设的可能性或不可能性很强地依赖于对假设空间的选择。归纳学习(2)确定性的有监督的学习找到一个简单的一致假设的可能性或不可能性很强地依赖于对假设空间的选择。(假设空间的重要性)如果假设空间包含真实的函数,那么学习的问题就是可实现的,否则就是不可实现的。不幸的是,这是的函数是未知的,我们不能总是说出一个给定的学习问题是否可实现,一种避开这个障碍的方法是使用先验知识得到一个假设空间,我们可以确定一个真实的函数一定在该假设空间中,另外一种做法是采用最大可能的假设空间。学习决策树w决策树归纳是最简单的但是最成功的学习算法形式之一。w作为执行元件的决策树一
4、棵决策树将用属性集合描述的事物或情景作为输入,并返回一个“决策”。输入的属性或输出值可以是离散的,也可以是连续的,学习一个离散值函数称为分类,学习一个连续函数称为回归。实例说明:决定是否要等座位的决策树w从实例中归纳决策树课堂讨论针对下述问题画出其决策树:当十字路口的信号灯变为绿色时,判断是否向前走。遗传算法w遗传算法的基本理论是借鉴自然界生物从简单到复杂、低级到高级的优胜劣汰、适者生存的进化机制,其本质是一种求解优化问题的高效并行全局搜索方法 。w遗传算法的主要计算过程是:从随机产生的一个初始种群开始,通过一些算子(选择、交叉、变异)的作用,产生下一代种群,再以新产生的种群为出发点,重复上述
5、过程,直到满足结束准则为止。w遗传算法(GA)把问题的解表示成“染色体”,在算法中也即是以二进制编码的串。并且,在执行遗传算法之前,给出一群“染色体”,也即是假设解。然后,把这些假设解置于问题的“环境”中,并按适者生存的原则,从中选择出较适应环境的“染色体”进行复制,再通过交叉,变异过程产生更适应环境的新一代“染色体”群。这样,一代一代地进化,最后就会收敛到最适应环境的一个“染色体”上,它就是问题的最优解。 遗传算法流程(3)依据适应度选择再生个体,适应度高的个体被选中的概率高,适应度低的个体可能被淘汰;(4)按照一定的交叉概率和交叉方法,生成新的个体;(5)按照一定的变异概率和变异方法,生成
6、新的个体;(6)由交叉和变异产生新一代的种群,返回第2步。(1)随机产生初始种群,个体数目一定,每个个体表示为染色体的基因编码;(2)计算个体的适应度,并判断是否符合优化准则,若符合,输出最佳个体及其代表的最优解,并结束计算;否则转向第3步;交叉算子和变异算子单点交叉:交叉掩码以连续的n个1开始,后面跟随必要个数的0直至结束。两点交叉:交叉掩码以n0个0开始,后面跟随n1个1,再跟随必要数量的0结束。均匀交叉:产生一个随机的位串,每一位的选区都是随机的并且独立于其他位。点变异:某一点取反强化学习 所谓强化学习是指从环境状态到动作映射的学习,以使动作从环境中获得的累积奖赏值最大。该方法不同于监督
7、学习技术那样通过正例、反例来告知采取何种行动,而是通过试错(trial-and-error)来发现最优行为策略。 从20世纪80年代末开始,随着对强化学习的数学基础研究取得突破性进展后,对强化学习的研究和应用日益开展起来,成为目前机器学习领域的研究重点之一。 强化学习的框架结构Agent由状态感知器I、学习器L和动作选择器P三模块组成。w状态感知器I把环境状态s映射成Agent内部感知i;w动作选择器P根据当前策略选择动作a作用于环境W;w学习器L根据环境状态的奖赏值r以及内部感知i,更新Agent的策略知识。W在动作a的作用下将导致环境状态变迁到s。强化学习技术的基本原理是:如果Agent的
8、某个动作导致环境正的奖赏(强化信号),那么Agent以后产生这个动作的趋势便会加强,反之Agent产生这个动作的趋势渐弱。Q-学习wQ-学习是由Watkins提出的一种模型无关的强化学习算法,又称为离策略TD学习(off-policy TD)。 w由于在一定条件Q-学习只需采用贪婪策略即可保证收敛,因此Q-学习是目前最有效的模型无关强化学习算法。 Q-学习算法流程对每个 初始化 为0),(asQas ,观察当前状态s一直重复做:(1)选择一个动作 并执行它(2)接收到立即回报(3)观察新状态(4) 按照下式更新表项: ar s ss ) , (max),(asQrasQa(5)Q-学习(例子) 悬崖步行是由Sutton提出的一个Agent仿真试验环境,如图所示。智能体的任务是从起始点S移动到目标点G。S、G之间的阴影方格为悬崖,智能体移动到这
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- DB3201-T 1237-2025 生态环境监测 检测实验室信息管理系统数据字典规范
- 设备采购款确认通知书7篇范本
- 2026年互联网企业用户服务改进措施确认函(5篇范文)
- 关于催办合同签署流程的确认函(5篇)
- 数码相机配件商Q2功能扩展通知(5篇)
- 不合格食品召回处理通知(6篇)范文
- 品牌全案策划服务合同
- 关于2026年新签订合同编号分配规则优化请示函5篇
- 2026中国数字经济市场投资前景及其发展策略深度研究报告
- DB32/T 5408-2026小微企业职业健康帮扶指南
- 海阔天空混声四部合唱谱
- 川大拔尖计划试题及答案
- 人力资源共享服务中心操作手册
- 加油站防雷培训
- 关于会计培训
- 燃气储罐安全拆除应急预案
- 带教老师遴选制度
- 保险学(第五版)课件全套 魏华林 第0-18章 绪论、风险与保险- 保险市场监管、附章:社会保险
- 《淬火应力变形开裂》课件
- 水泥砂浆砌石体单元工程施工质量评定表填表说明
- 中国籍贯的集合数据库(身份证号前六位籍贯对照表)
评论
0/150
提交评论