人工基础智能 4_第1页
人工基础智能 4_第2页
人工基础智能 4_第3页
人工基础智能 4_第4页
人工基础智能 4_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

课堂设计一、基本信息课次第8讲课次学时数2学时主题强化学习二、设计方案课堂目标(一)知识目标能讲清强化学习和监督学习、非监督学习之间的区别;能简述强化学习解决问题的一般流程;能描述Q学习算法的基本过程。(二)能力目标能识别强化学习算法适用的问题;能针对给定的强化学习问题,定义状态、动作、奖励等关键要素。(三)素质目标能通过学习强化学习的“探索-利用”思想,培养科学探索精神、创新意识和军事应用的使命感和责任感。教学重难点(一)教学重点强化学习解决问题的一般流程,Q学习算法的基本原理。(二)教学难点Q学习算法的基本原理。教学设计思路(一)教学内容组织1.强化学习概述2.多臂老虎机问题3.强化学习解决问题的一般流程。4.Q学习算法(二)教学方法策略结合案例分析法和问题驱动法,分别以解决“多臂老虎机”和“简单迷宫”两个问题为目标,由简单至困难地解决强化学习问题;通过“如何定义动作”、“如何度量动作”和“如何构建策略”三个问题,一步步引导学生逐步进行深入思考,逐步引入马尔可夫决策过程,贝尔曼方程、贝尔曼最优方程、ε贪婪策略课程思政设计通过多臂老虎机突出军事案例挖掘、探索与利用权衡的人生决策、国产机器人技术发展等元素融入,培育学生人工智能思维,培养对个人和组织负责的意识,以及军事智能应用使命感等。智慧化教学方法运用突出雨课堂在课堂教学中的应用,通过引入习题及时掌握学员的学习情况,并有针对性地进行讲解。教学资源1.头歌(EduCoder)平台在线资源2.《人工智能技术及其军事应用》在线课程审签新上课教员£上新课教员£

内容备注课堂导入同学们,如今科技发展日新月异,相信大家都听说过AlphaGo击败世界围棋冠军的新闻吧,这可是人工智能领域的高光时刻。在那之前,我们接触的机器学习方法,像监督学习,给大量有标记的数据让模型学习规律,就如同老师手把手教学生认识各种物体;还有无监督学习,自己从无标签数据里挖掘隐藏信息,类似在杂乱的物品中找相似性归类。但今天,咱们要踏入一片全新的天地——强化学习。大家想想,AlphaGo面对千变万化的围棋棋局,没有一个固定的老师告诉它每步棋该怎么走,也不是单纯地自己摸索总结,它是在不断与对手对弈过程中,依据赢棋、输棋这些反馈,逐渐掌握绝妙棋艺。这背后的强化学习究竟藏着怎样的奥秘呢?现在,就让我们一起揭开它神秘的面纱。理论讲授一、强化学习的概念(一)基本概念强化学习(ReinforcementLearning,RL),是机器学习的一个重要分支之一,用于描述和解决智能体(agent)在与环境的交互过程中通过学习策略以达成回报最大化或实现特定目标的问题。在强化学习中,有一个重要的概念—序贯决策(SequentialDecisionMaking)。它是指决策者序贯地做出一个个决策,并接续看到新的观测,直到最终任务结束。想象一下你正在学习骑自行车,这其实就是一个强化学习的过程。你就是那个智能体,而周围的道路、交通状况以及自行车本身的状态就是环境。当你刚开始骑车时,每一次尝试蹬踏板、转动把手(这些就是你的行动),环境都会立刻给你反馈。要是你平稳地前进了一小段,没有摔倒,这就如同获得了一个正向奖励,内心会有点小成就感;但要是不小心失去平衡摔倒了,那就是负向奖励,身体也会实实在在感受到疼痛,告诫你这个动作不太对。你的目标很清晰,通过不断在这条路上骑行,反复试验不同的速度、方向调整(不断试错),积累经验,从而找到最适合自己的骑车策略,比如在转弯时怎么控制角度、遇到下坡如何刹车,让自己能安全又高效地抵达目的地,拿到骑行的“高分”。(二)数学模型在强化学习中,涉及到几个关键的概念,主要包括环境、智能体、状态、行动、奖励等等。一般来说,强化学习需要训练的对象被称为智能体,与其进行交互的其他部分被称为环境。在某一个时间t中:智能体获得状态St、奖励Rt,并执行动作At,此时,环境接收到智能体的动作At,然后将状态变化为St+1,并根据智能体的动作给出新的奖励St+1。想象一下,一支特种部队正在执行夜间突袭任务,此时的状态(State)包含了诸多关键信息。比如士兵们当下所处的地理位置,是在山谷、丛林,还是靠近敌军营地边缘;自身装备情况,弹药剩余量、武器是否正常运行;还有敌方的动态信息,附近有没有敌军巡逻队、敌军火力点分布等,这些状态要素整合起来,清晰勾勒出部队当前面临的作战局势。行动(Action)就是士兵们能够采取的战术动作,像是前进、后退、隐蔽潜伏、发动突袭、呼叫支援等。每一个行动都有可能改变当下的作战局面。奖励(Reward),如果部队成功避开敌军巡逻队,未被发现,顺利推进到预定地点,那就相当于获得了正向奖励,意味着这次行动决策正确,提升了作战成功的概率;反之,要是不小心触发敌军警报,引发敌方火力反击,那就收到了负向奖励,不仅任务受阻,还可能面临伤亡风险。从数学层面看,奖励就是量化行动效果的数值。强化学习的目标是找到一个好的策略Π(s)二、多臂老虎机问题(一)问题概述同学们,在了解了强化学习基本数学模型后,我们来看看一个经典问题——多臂老虎机问题。想象你走进了一家神秘的房间,里面有一排老虎机,每个老虎机都有不同的中奖概率,但是你事先并不知道这些概率是多少。你的目标很简单,就是在有限的游戏次数内,通过不断尝试去拉动不同的老虎机拉杆(这就是你的行动),来获得尽可能多的奖励(中奖得到奖金,未中奖则没有奖励,奖励有正有负,取决于输赢结果)。这里的每一次拉杆选择,就如同智能体在强化学习环境中的一次决策。每台老虎机当下的状态,虽然你不能直接看见中奖概率,但它客观存在,影响着你每次拉杆后的收益情况。(二)问题建模多臂老虎机问题的关键,是如何选择合适的老虎机,获得最多的金币。这里智能体就是玩家,环境就是老虎机。重点是解决、状态、动作和奖励。首先是状态,在这个赌场场景下,每台老虎机的状态看似隐秘,实则关键。虽然我们无法直接知晓每台老虎机确切的中奖概率这一内部状态,但可以通过过往的拉杆结果来间接感知。比如说,某台老虎机你拉了几次,大部分时候都没中奖,那它此刻对你呈现出的“状态”可能就是低中奖率;反之,若有一台老虎机时不时给你带来奖金,那它的“状态”就偏向高中奖率。每台老虎机自身隐藏的中奖机制以及你与它们交互后的历史信息,共同构成了它们各自的状态表征。接着看动作,非常明确,就是你选择拉动哪一台老虎机的拉杆。这是你在这个环境中唯一能采取的主动行为,每一次拉杆的抉择都如同智能体在面对复杂环境时做出的关键决策,不同的拉杆选择会引发不同的后续结果。再谈谈奖励,奖励的规则很直观,当你拉动老虎机拉杆后,如果中奖,你会获得一笔奖金,这就是正向奖励,意味着你这次的动作决策带来了好的收益;要是没中奖,自然就没有奖金入账,相当于零奖励,而要是因为玩老虎机投入成本却未中奖,从收益角度看甚至可以视为负向奖励。奖励直接反映了你所采取动作在对应状态下的好坏程度,并且会影响你后续的拉杆策略,促使你去追寻更多的正向奖励。那么,在这个过程中,应该如何考虑合适的奖励呢?(三)求解思路这个问题的核心在于,如何判断哪个老虎机更好?【讨论】:什么样的老虎机更好引导学生分组讨论,什么样的老虎机更好,得出获得金币期望值更高的老虎机更好的结论。1.假定老虎机获得金币的概率是已知的假定对于两台已知的老虎机(假定为老虎机1和老虎机2),其获得不同金币的概率如下表所示。那么,如何判断老虎机获得金币的期望呢?此时,对于老虎机1,其期望为0*0.7+1*0.15+5*0.12+10*0.03=1.05,对于老虎机2,其期望为0*0.5+1*0.4+5*0.09+10*0.01=0.95。总结一下:状态St可以有多种表示方法(例如可以用每一种金币获得次数来表示),例如:SRt代表当前时刻获得的金币数量,即:R由于拥有先验知识:ERER那么,此时的选择可以与状态StΠ2.如果老虎机获得金币的概率是未知的此时,是否能够估计出期望值更高的老虎机?此时:Q1Q2=E如果用QnK表示执行了n次动作QnK=Qn但是,在实际使用中,还存在一个问题,当我们处于某一个状态的时候,我们是根据最优解来选择一个较好的动作,还是去更精确地估计动作的价值?(四)𝜀贪婪策略ε贪婪策略:以ε的概率进行探索,以1-ε在实际的使用过程中,可以同时进行探索和利用,用代码进行表示,则可以表示为:我们可以看一个实例,对于10台单臂老虎机,每次只能返回0个或1个金币,以0.1的概率执行𝜀贪婪策略,程序共运行1000步。【讨论】大家能够从这个图像中发现什么?探索与利用权衡,体现了人生决策中的智慧,在现实生活中我们也常常需要做出决策,既要勇于尝试新事物(探索),又要善于利用已有知识(利用),找到平衡点,实现个人成长和社会价值的最大化。三、强化学习解决问题的一般流程强化学习可以分为基于价值的方法和基于策略的方法,对于小规模问题,一般采用基于价值的方法,也称为表格型方法。基于价值的方法的核心在于:估计每一个状态的价值。(一)基本流程基于价值的方法处理强化学习的基本流程为:1.对问题进行建模;2.对各个状态的价值进行估计,得到状态s对应的价值;3.在每一个状态下,选择能够使得下一个状态价值更大的动作,从而形成对应的策略。(二)问题建模为了使得问题表示更加准确,我们可以将贯序决策问题表示成一个马尔可夫决策过程。它提供了一套为在结果部分随机、部分在决策者的控制下的决策过程建模的数学框架,在这个过程中,最重要的是要符合马尔可夫性质,即当前状态只与前一个状态相关,即:P[在马尔可夫决策过程中,围绕状态、奖励和动作,重点表示四个内容,分别是状态如何变化、奖励如何获得、智能体如何行动和根据什么样的目标来选择策略。1.状态如何变化状态的变化使用状态迁移概率来表示,它是关于状态和动作的一个函数,表示在当前状态和动作下,下一个状态是什么。P当然,在当前状态和动作都确定的情况下,下一个状态可以是确定的,也可以是随机的,对于我们要解决的迷宫问题,状态转移是确定的。2.奖励如何获得奖励如何获得使用奖励函数来表示,它是一个关于状态、动作和下一个状态的函数。在迷宫问题中,因为状态转移是确定时,所以它只与当前状态和动作相关。R3.智能体如何行动使用策略来表示智能体如何行动,策略可以是确定性的,也可以是非确定性的。如果是确定性策略,则:A如果是非确定性策略,则可以表示成:π(A在后面可以看到,确定性策略和非确定性策略都可以用Q表来表示。4.优化目标优化目标也就是根据什么样的目标来选择策略,在强化学习中,一般使用长期累积折扣奖励来表示使用一个策略来行动是,智能体能够获得到的长期奖励,它可以表示为:G可以看到在长期累积折扣奖励,由于折扣因子γ的存在,使得越虚幻的奖励越不重要,这也提醒我们需要平衡好当前的奖励和长远的奖励,脚踏实地而不是好高骛远。总结一下,在马尔可夫决策过程常常被表示成一个五元组(S,

AS是A是动作的集合Psaγ是R:S强化学习的目标就是在给定五元组(S,

A,Psa,γ,R)时(三)价值估计以简单迷宫为例:可以计算以某点(C或D)为起点,在某个策略下,长期累积折扣奖励的平均值,并将其作为该点的价值;当可以预见的,C点的价值一定会大于D点;当所有点的价值计算完毕,就可以找到从A到B的一条路径。形式化表示成为贝尔曼方程:对于一个状态来说,如果每个动作的Q值都知道了,就可以通过选择Q值最大的动作,实现最优的策略,那么怎么计算每个动作的Q值呢?可以发现,每个动作的Q值,实际上可以用其他动作的Q值来表示,即:q=E(Rt+1

=s'=s'贝尔曼方程对于任意策略Π都成立q∗s,a四、Q学习算法(一)任务目标强化学习的目标就是在给定五元组(S,

A,Psa,γ,R)(二)解决思路模仿解决多臂老虎机问题的方法,可以用Q函数来度量每一个动作的优劣,由于动作的优劣与状态相关,那么所有“状态-动作”对的Q值构成一张二维表,这张表称为“Q值表”。表中的每一个数据项,都是对应动作的一个q值,代表该动作的好坏。(三)基本流程在学习过贝尔曼方程后,即可利用其解决迷宫问题。此时,可以仿照在多臂老虎机中运用过的价值估计方法,即可对所有动作价值进行估计,即:q's,a=qs,a再结合ε贪婪策略,即可形成Q学习算法(Q-Learning1.初始化Q表:创建一个Q表,通常初始化为零或其他小的随机值。2.选择动作:在每个时间步骤中,智能体根据当前状态和Q表选择一个动作。这通常涉及到探索和利用的权衡,以确保在学习过程中不断探索新的动作策略。3.执行动作:智能体执行所选择的动作,并观察环境的响应,包括获得的奖励信号和新的状态。4.更新Q值:根据观察到的奖励信号和新的状态,智能体更新Q值。这涉及到使用Q-Learning的更新规则,如贝尔曼方程。5.重复迭代:智能体不断地执行上述步骤,与环境互动,学习和改进Q值函数,直到达到停止条件。【展示实际迷宫视频,使学生具有感性认识】(四)存在不足Q学习算法存在两个比较重要的问题,一是需要存储一个离散的Q值表,适用的状态和动作空间较小的问题;二是算法需要对每一个Q值进行独立计算,缺乏对应的泛化能力,所以一个很自然的想法是通过神经网络对Q值表进行拟合,从而产生了深度Q学习算法。其基本过程为:将每一帧图像看做一个状态,然后通过神经网络来拟合动作值函数;通过平方差误差来度量动作值函数的逼近程度;通过随机梯度下降算法来寻找最优解,即估计出每一个状态下动作对应的值函数;根据对应的值函数来判断每个状态下所需要选择的动作。(五)展望Q学习算法之后,还有很多新的算法,如深度Q学习(DeepQ-learningNetwork)等,在机器人行业有着很多创新的应用。如在2025年蛇年春晚,一场名为《秧BOT》的节目点燃了观众对人形机器人的热情——16台身着花袄的宇树H1机器人手持红手帕,以整齐划一的队列、灵活多变的动作完成了转手绢、亮手绢等高难度舞蹈动作,甚至能根据音乐节奏实时调整步伐。宇树科技相关负责人透露,这场表演背后是近3个月的AI强化学习训练。通过深度学习算法,机器人不仅能自主跳舞,还能在复杂舞台环境中精准定位和协同动作。小结同学们,咱们来小结下强化学习重点。强化学习中,智能体与环境交互,依奖励调策略找最优解,像学技能般试错进步。多臂老虎机问题助我们平衡探索与利用,精准估价值,为算法优化奠基。马尔可夫决策过程用状态、行动、奖励、转移概率构建数学模型,军事例子能加深理解。Q学习算法靠Q表与特定策略、更新公式,让智能体如迷宫寻路般学会最优抉择。这几部分环环相扣,要吃透。【实例引入】通过一个骑自行车的案例,使得学生能够直观地感受到什么是强化学习【重点】抽象的概念,逐步引

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论