版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能通识2025第5章强化学习:智能决策的探索之旅2025年.XX月想象你正在训练一只小狗学习新技能,你不会直接告诉它每个动作该怎么做,而是在它做出你期望的行为时给予奖励,比如给它爱吃的零食;要是它做错了,就给予小小的惩罚,比如短时间内不搭理它。小狗通过不断尝试不同行为,感受这些行为带来的奖惩反馈,慢慢学会在特定情境下做出最佳动作,这其实就和强化学习的理念很相似——通过试错不断优化决策。强化学习基础理论2.1.强化学习概述强化学习的经典算法3.强化学习的应用案例4.Catalogue目录Part强化学习概述01人工智能通识20255.1强化学习概述在人工智能的广阔天地中,强化学习犹如一位智慧的探险者,不断探索未知的环境,通过试错学习来寻找最优的行动策略。它不仅赋予了机器自主决策的能力,还在机器人控制、游戏智能体开发、资源管理等领域展现出巨大的潜力。强化学习通过智能体在环境中不断尝试动作,根据奖励信号调整策略,实现长期收益最大化,如小狗学习新技能,强化学习的基本原理也类似于人类和动物通过经验积累实现目标的过程——智能体在环境中不断尝试不同动作,根据环境反馈的奖励信号(如成功时的正向激励或失败时的惩罚)调整策略,最终找到长期收益最大化的行为模式。试错学习机制5.1.1强化学习定义试错学习智能体不会预先知晓什么是最优策略,而是在不断尝试各种行动中,逐渐找到表现更好的策略。就像我们刚开始学习骑自行车,要经过多次歪歪扭扭地尝试,摔倒了再起来,慢慢才能掌握平衡骑行的技巧。奖励驱动智能体的学习过程围绕着如何最大化累积奖励展开。奖励就如同指南针,引导智能体朝着对自身最有利的方向发展。在工业生产中,智能机器人在操作过程中,每完成一个正确高效的生产步骤,就会得到奖励,促使它不断优化操作流程以获取更多奖励。环境影响这要求智能体具备一定的鲁棒性和泛化能力。例如自动驾驶汽车行驶在真实道路上,路况复杂多变,天气状况、其他车辆的随机行为等都是不确定因素,自动驾驶系统作为智能体,需要在这样的环境中学习可靠的驾驶策略,以应对各种可能情况。注重长期规划智能体不能只看眼前的即时奖励,还要考虑到当前行动对未来状态和奖励的影响,学会进行长远的决策。具有自适应性当环境发生变化或者获取到新的数据时,智能体能够自动调整自身策略,以适应新的情况。在电商推荐系统中,随着用户购物习惯和商品种类的动态变化,推荐算法(智能体)能不断调整推荐策略,为用户提供更贴合需求的商品推荐。特点与优势强化学习的思想可追溯至19世纪的试错学习理论,如桑代克的“猫箱实验”验证了效果定律,为强化学习奠定了原始理论基础。早期理论基础20世纪50年代,贝尔曼提出动态规划理论和马尔可夫决策过程,为强化学习提供了数学框架,推动了最优控制理论与机器学习的融合。数学理论突破1988年提出时间差分学习算法,1989年提出Q-learning算法,2013年DeepMind开发出深度Q网络,这些算法推动了强化学习的发展。关键算法诞生5.1.2强化学习发展历史强化学习的起源与理论奠基
试错学习的萌芽19世纪50年代,亚历山大・贝恩提出“摸索与实验”是学习的基础机制,随后康威・劳埃德・摩根将其提炼为“试错学习”,用于解释动物行为的适应性。
效果定律的诞生爱德华・桑代克通过猫箱实验验证了“效果定律”,即成功行为随奖励增加,奠定了强化学习的原始理论基石。
动态规划与马尔可夫决策过程20世纪50年代,理查德・贝尔曼提出动态规划理论,并扩展至随机环境,定义了“状态—动作—奖励”的三元组模型,成为强化学习的核心范式。关键算法的突破与跨学科融合
时间差分学习的提出1988年,理查德・萨顿和安德鲁・巴托提出时间差分学习算法,解决了“信用分配”难题,并应用于经典的“杆平衡”控制问题。
Q-learning的革命性贡献克里斯・沃特金斯在1989年提出Q-learning算法,首次将时序差分与最优控制理论整合,使智能体能在未知环境中自主探索最优策略。
深度Q网络的崛起2013年,DeepMind团队结合Q-learning与卷积神经网络开发深度Q网络,在49款经典游戏中超越人类水平,展示了强化学习的强大潜力。深度强化学习的爆发式发展彻底改变了AI的边界。2016年,DeepMind的AlphaGo通过“监督学习+强化学习+蒙特卡洛树搜索”的组合拳,以4:1击败围棋世界冠军李世石。其核心创新在于“自我对弈”机制:AI通过与自己下棋生成数百万局数据,不断优化策略网络和价值网络。这种“从经验中学习”的模式,使AlphaGo在围棋这一拥有10^170种可能局面的领域实现了人类千年未有的突破。2017年,升级版AlphaZero更进一步,仅用三天时间通过纯自我对弈超越人类棋谱,在围棋、国际象棋和日本将棋三大棋类中均达到顶尖水平。深度强化学习强化学习现代发展2020年,OpenAI开发的GPT-3通过1750亿参数的语言模型生成连贯文本,但直接使用时可能产生有害或不准确的内容。为解决这一问题,研究人员引入“人类反馈强化学习”(ReinforcementLearningfromHumanFeedback,RLHF):首先让人类标注者对模型输出进行评分,然后训练奖励模型预测这些评分,最后通过强化学习优化语言模型以最大化奖励。这一技术使ChatGPT在2022年横空出世,如图5-5所示,其对话流畅度和内容合规性达到前所未有的高度。例如,当用户询问敏感话题时,ChatGPT会基于RLHF学习到的安全策略,给出既符合伦理又有信息量的回答。与自然语言处理结合强化学习现代发展智能的本质在于通过环境交互实现适应性优化。这一规律不仅推动了机器人控制、金融投资、医疗决策等领域的革命,更引发了对“智能”定义的哲学思考。未来,随着离线强化学习、元学习等技术的突破,AI或将在更复杂的社会系统中自主演化,开启人机协同的新篇章。未来趋势强化学习现代发展01该方法通过构建环境的动态模型(如状态转移概率、奖励函数)进行决策。例如,航天工程中卫星轨道调整策略的优化,需基于牛顿力学方程建立太空环境的精确模型,结合动态规划算法求解最优控制序列。其优势在于数据效率高,适用于样本稀缺的场景(如医疗手术机器人的训练),但对模型精度要求严格。当环境存在未建模干扰(如太空碎片)时,策略可能失效。基于模型的强化学习5.1.3强化学习的分类1.基于环境建模的分类02直接通过与环境交互积累经验,无需预先构建模型。DeepMind的DQN算法在Atari游戏中仅依赖屏幕像素和得分反馈,通过试错学习实现《太空侵略者》等游戏的超人表现。该方法在复杂环境中表现出更强的适应性,但需要数百万次尝试才能收敛,计算资源消耗较大。无模型强化学习5.1.3强化学习的分类1.基于环境建模的分类2.基于策略优化的分类01基于价值的方法通过评估每个动作的长期收益指导决策。例如Q-learning算法在仓库机器人分拣任务中,为每个货架位置和货物类型维护“状态—动作值”表格(Q表),记录不同抓取角度的预期得分,最终通过查表实现动作选择。此类方法适用于离散动作空间,但在连续控制问题中需结合函数近似(如深度神经网络)。2.基于策略优化的分类02基于策略的方法直接生成动作,无需显式评估价值函数。例如,使用PPO算法在训练机器人行走时,通过策略网络直接输出关节角度调整指令,即使摔倒也能快速恢复平衡。该方法适用于连续动作空间,但策略更新可能导致训练不稳定。2.基于策略优化的分类03演员—评论家方法融合价值与策略方法的优势。该架构通过分离策略优化与价值评估,提升了训练效率和稳定性。01离线强化学习利用已有的行为数据训练模型,避免与真实环境交互,适用于数据稀缺或环境危险的场景,但数据分布偏差可能影响模型性能。离线强化学习02在线强化学习实时与环境交互并更新策略,能适应动态环境变化,但需要大量计算资源,且可能面临环境风险。在线强化学习03离线强化学习和在线强化学习各有应用场景,现代强化学习系统常根据任务需求选择合适的学习范式或融合多种范式。分类总结3.基于学习范式的分类Part强化学习基础理论02人工智能通识20255.2.1强化学习核心要素强化学习是智能体与环境交互学习最优策略的方法,智能体通过感知环境状态并做出决策,以最大化累积奖励,如机器人在迷宫中探索路径。智能体与环境交互核心要素是强化学习的主体,它负责感知环境并做出决策。智能体可以是机器人、软件程序,甚至是虚拟角色。例如,在一个迷宫探索任务中,机器人就是智能体,它需要通过不断尝试来找到通往出口的路径。是智能体所处的外部系统,它为智能体提供状态信息并接收智能体的动作。环境可以是物理世界,也可以是虚拟模拟。在迷宫探索任务中,迷宫本身及其布局就是环境。
环境(Environment)
智能体(Agent)核心要素是智能体在某一时刻对环境的感知。状态可以是环境的完整描述,也可以是部分信息。例如,在迷宫中,机器人的位置和方向就是状态。状态是智能体做出决策的依据,不同的状态可能需要不同的动作。是智能体在某一时刻对环境的干预。动作的选择会影响环境的状态,并进而影响未来的奖励。在迷宫任务中,机器人的动作可能是向前走、向左转或向右转。动作的选择是智能体策略的体现。
动作(Action)
状态(State)核心要素是智能体从环境中获得的即时反馈,用于指导智能体调整策略。奖励可以是正的(如成功找到出口获得高分),也可以是负的(如撞到墙扣分)。奖励信号是强化学习的核心驱动力,智能体的目标是最大化长期累积奖励。是智能体根据当前状态选择动作的规则。策略可以是确定性的(给定状态总是选择相同动作),也可以是随机性的(给定状态以一定概率选择不同动作)。策略的好坏直接影响智能体的表现。
策略(Policy)
奖励(Reward)核心要素用于评估某个状态或动作的价值,即从该状态或动作开始,按照当前策略所能获得的长期累积奖励的期望值。价值函数是强化学习中的重要工具,它帮助智能体判断当前决策的优劣。是智能体对环境的数学描述,包括状态转移概率和奖励函数。模型可以是已知的,也可以是通过学习得到的。有模型的强化学习方法利用模型进行规划,而无模型的方法则直接通过与环境交互来学习策略。
模型(Model)价值函数(ValueFunction)01智能体是强化学习的主体,负责感知环境并做出决策,可以是机器人、软件程序或虚拟角色,是决策的核心执行者。智能体角色02智能体通过感知环境状态,选择合适动作,根据奖励信号调整策略,以实现最优决策。智能体功能1.智能体环境是智能体所处的外部系统,为智能体提供状态信息并接收动作,可以是物理世界或虚拟模拟。环境定义环境根据智能体的动作改变状态,并给出奖励信号,引导智能体调整策略。环境作用2.环境状态含义状态是智能体在某一时刻对环境的感知,可以是环境的完整描述或部分信息,是决策的依据。状态重要性不同状态需要不同动作,状态的准确感知对智能体做出正确决策至关重要。3.状态动作定义动作是智能体对环境的干预,会影响环境状态和未来的奖励,是策略的体现。动作影响动作的选择直接决定了智能体在环境中的行为路径,影响最终的奖励结果。4.动作奖励性质奖励是智能体从环境中获得的即时反馈,可以是正的或负的,是强化学习的核心驱动力。奖励作用奖励信号用于指导智能体调整策略,帮助智能体判断当前决策的优劣。02015.奖励策略是智能体根据当前状态选择动作的规则,可以是确定性的或随机性的。策略定义策略的好坏直接影响智能体的表现,决定了智能体在环境中的行为模式。策略影响6.策略价值函数作用价值函数用于评估状态或动作的价值,即从该状态或动作开始所能获得的长期累积奖励的期望值。价值函数意义价值函数是强化学习中的重要工具,帮助智能体判断当前决策的优劣,为策略调整提供依据。7.价值函数模型定义模型是智能体对环境的数学描述,包括状态转移概率和奖励函数,可以是已知的或通过学习得到的。基于模型分类有模型的强化学习方法利用模型进行规划,无模型的方法则直接通过与环境交互来学习策略。8.模型01MDP定义强化学习的核心要素可通过马尔可夫决策过程(MarkovDecisionProcess,MDP)数学框架统一描述。MDP的核心思想是,智能体在环境中处于某个状态,根据当前状态选择一个动作,然后转移到下一个状态,并获得相应的奖励,如图5-7所示。这个过程具有马尔可夫性质,即下一个状态仅依赖于当前状态和选择的动作,而与之前的状态和动作无关。5.2.2马尔可夫决策过程02MDP特性MDP的核心特性是马尔可夫性质,即未来状态仅依赖当前状态和动作,与历史无关。这一特性使得模型能够高效地处理状态转移问题。例如,在机器人抓取任务中,机械臂的当前关节角度(状态)和抓取动作(动作)直接决定了下一步能否成功抓取物体(状态转移),而无需考虑之前的运动轨迹。这种简化不仅降低了计算复杂度,还为算法设计提供了理论基础。5.2.2马尔可夫决策过程MDP基本要素
状态空间(StateSpace):智能体可能处于的所有状态的集合。在迷宫任务中,状态空间就是迷宫的所有位置。状态转移概率(TransitionProbability):从一个状态通过某个动作转移到另一个状态的概率。例如,机器人在某个位置向右移动时,有90%的概率成功移动到右侧位置,有10%的概率留在原地。动作空间(ActionSpace):智能体在每个状态下可以采取的所有动作的集合。在迷宫任务中,动作空间可能是向左、向右、向前或向后移动。奖励函数(RewardFunction):定义智能体在某个状态下采取某个动作后获得的奖励。例如,机器人成功移动到出口位置时获得高奖励,撞到墙时获得负奖励。5.2.2马尔可夫决策过程MDP应用场景MDP的应用场景广泛,可分为离散与连续、确定性与随机等类型。离散MDP适用于状态和动作有限的场景,如棋盘游戏中的落子决策。例如,围棋AI通过MDP模型评估每个落子位置的胜率,结合蒙特卡洛树搜索选择最优策略。连续MDP则处理无限状态或动作空间,如机械臂关节角度的连续调整。5.2.2马尔可夫决策过程MDP理论价值MDP的理论价值不仅在于解决具体问题,更在于其对智能行为的普适解释。它将心理学的行为主义理论、控制理论的最优决策方法与人工智能的自主学习机制统一于数学框架中。例如,人类学习驾驶的过程可视为一个MDP:通过观察路况(状态)选择操作(动作),并根据安全到达的奖励(如避免事故、准时到达)调整行为。这种类比为理解生物学习过程提供了计算模型。5.2.2马尔可夫决策过程MDP局限性MDP的局限性在于它假设环境是完全可观测的,并且状态转移具有马尔可夫性质。在现实世界中,许多问题并不满足这些假设,例如在部分可观测的环境中,智能体可能无法完全感知环境状态。为了解决这些问题,研究者们提出了部分可观测马尔可夫决策过程等扩展模型。奖励函数和策略优化是强化学习的两个核心概念。奖励函数定义了智能体的目标,而策略优化则是实现这一目标的关键过程。通过奖励函数,智能体能够感知环境的反馈,而通过策略优化,智能体能够不断调整自己的行为以最大化长期累积奖励。5.2.3奖励函数与策略优化设计要点奖励函数作用奖励函数是强化学习的核心驱动力,定义智能体在特定状态下采取动作后的即时奖励,为智能体提供学习信号,帮助判断决策好坏,引导其调整策略以最大化长期累积奖励。设计奖励函数需考虑任务目标与环境特点,平衡短期与长期奖励,避免智能体只追求短期利益而忽略长期目标,如迷宫任务中设置不同奖励值以引导智能体行为。1.奖励函数迷宫探索任务中的奖励函数在一个迷宫探索任务中,奖励函数可以设计为:当机器人成功到达出口时获得高奖励(如+100),当撞到墙时获得负奖励(如-10),而每一步移动获得一个小的负奖励(如-1),以鼓励机器人尽快找到出口。01.优化目的策略优化则是强化学习的核心任务,其目的是找到一个最优策略,使得智能体在与环境的交互过程中获得的累积奖励最大化。策略,简单来说,就是智能体在不同状态下选择动作的规则。智能体在初始阶段,通常会采用随机策略进行探索,即随机选择行动来观察环境的反馈。随着与环境的不断交互,智能体开始逐渐学习到一些有用的信息,并基于这些信息对策略进行优化。2.策略优化02.优化方法策略优化方法多样,包括基于价值函数的方法、基于策略梯度的方法及演员—评论家方法,但过程充满挑战,首先,智能体可能陷入局部最优解,这意味着它找到的策略虽然在局部范围内表现良好,但并非全局最优。其次,智能体需要在探索新策略和利用已知策略之间找到平衡。此外,奖励误导也是一个常见问题。2.策略优化在资源管理场景中,合理奖励函数鼓励智能体高效分配资源,避免浪费和过载,智能体通过不断尝试和优化策略,满足用户需求,获得更高奖励,实现任务目标与性能提升。实际应用奖励函数为策略优化提供方向,智能体通过调整策略在给定奖励函数下获得更多累积奖励,而策略优化效果又影响奖励获取,二者相互促进,推动智能体在复杂环境中不断进化。优化方向奖励函数与策略优化的联系Part强化学习的经典算法03人工智能通识20255.3.1Q-learning提出时间与提出者Q-learning由沃特金斯博士于1989年在其博士论文中提出,是强化学习领域的重要算法。Part01算法核心概念Q-learning是一种无模型的强化学习算法,通过学习最优动作价值函数(Q函数)来找到最优策略,Q函数表示在某个状态下采取某个动作后,智能体能够获得的预期累积奖励。Part02Q-learning算法首先初始化Q表,用于存储每个状态-动作对的Q值。然后智能体感知当前状态,根据策略选择动作,执行动作后获得奖励和下一个状态,再更新当前状态-动作对的Q值,重复此过程直至满足终止条件。算法步骤概述Q-learning算法原理01Q-learning不需要环境的数学模型,所有Q值都是通过与环境交互直接学习得到,这使得它能够适应各种未知环境。无模型特性02Q-learning在更新Q值时采用贪心策略,总是选择下一个状态下的最大Q值,从而逐步逼近最优策略,同时通过ε-贪心策略平衡探索与利用。贪心策略应用Q-learning的关键特性Q-learning的设计要素高维或连续状态需转化为有限类别。例如,自动驾驶中车辆与障碍物的距离可分段为“近、中、远”,机器人关节角度可划分为离散区间,以降低计算复杂度。状态与动作离散化Q-learning的设计要素奖励需明确反映任务目标。例如,迷宫导航中“到达终点”奖励设为+100,“撞墙”惩罚-50,而“移动一步”给予-1以鼓励最短路径。在避障游戏中,奖励设计需平衡存活奖励(+1)、碰撞惩罚(-20)和移动成本(-2),避免智能体因过度规避碰撞而完全停滞。奖励函数设计Q-learning的设计要素采用ε-贪心策略,初期以高概率随机探索(如ε=0.5),后期逐渐降低随机性(如ε=0.01),优先选择Q值最高的动作。例如,游戏AI在训练早期会频繁尝试不同走位,后期则稳定执行已验证的最优路径。探索与利用的平衡0102优势无模型,适用于未知环境;算法简单,易于实现。局限在状态空间较大时,Q表的存储成本过高;若奖励信号极少,智能体缺乏足够的反馈来指导其学习过程。Q-learning算法优缺点Q-learning总结Q-learning通过“试错-反馈-更新”的机制,将复杂决策问题转化为状态-动作价值映射,成为强化学习领域的基石算法。其简洁性使其在游戏、机器人等领域广泛应用,而结合深度学习后的改进版本(如DQN)进一步拓展了其在复杂场景中的潜力。5.3.2深度Q网络DQN创新点深度Q网络(DQN)将深度学习与Q-learning相结合,用深度神经网络替代传统Q表,解决了传统Q-learning在处理高维复杂状态空间时的难题。01通过随机抽取样本进行学习,减少样本间的相关性,提高了神经网络训练的稳定性和效率。,经验回放机制02使用两个结构相同但参数更新不同步的神经网络,通过定期同步参数稳定Q值估计,避免因频繁更新导致的训练震荡。目标网络机制DQN的两个重要机制深度Q网络的应用突破游戏AI的巅峰表现在Atari游戏中,DQN通过处理图像输入学习策略,逐渐掌握游戏规则,最终在多个游戏中超越人类水平,展现其强大的学习与决策能力。机器人控制的创新实践DQN助力机器人在复杂地形中行走,通过视觉信息输入状态,输出关节动作指令,使其能在崎岖路面和台阶等环境中稳定移动。智能家居的高效调控在智能家居领域,DQN根据温度、光线、人员活动等状态,智能调节空调、灯光和窗帘,实现自动化控制,提升舒适性与能源效率。0102优势DQN在游戏AI、机器人控制、智能家居等领域表现出色。局限在复杂动态环境中泛化能力有待提升,且对计算资源需求较大。DQN算法优缺点01策略梯度算法直接对策略函数进行建模和优化,根据当前状态选择动作的概率分布,通过梯度上升实现策略优化。算法原理02策略梯度算法的优势在于能够处理连续动作空间,但学习过程中可能存在收敛速度慢、方差较大等问题。优势与挑战03策略梯度算法广泛应用于机器人控制等连续动作空间的任务,如机械臂的抓取动作优化,通过策略梯度算法学习到最佳的动作序列和参数。应用场景5.3.3策略梯度01Actor-Critic算法由Actor和Critic两个组件构成,Actor负责生成动作,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- (2026年)医师进修个人总结
- 2025年河南省南阳市油田三年级数学第二学期期中质量跟踪监视模拟试题(含答案)
- 呼衰病人的护理疑难病例讨论
- 术后切口感染的护理查房
- Agent时代腾讯开放生态战略深度解读:从WorkBuddy到Agent平台化
- 2025年沙河口区数学四下期末模拟试题含答案解析
- 中职专用《林黛玉进贾府》语文基础模块上册(高教版)B 卷(解析版)
- 中医急诊新颖试题及详细答案
- 2025年智能头盔指纹识别技术集成方案
- 家庭保洁理论试题及答案参考
- 教师节快乐感恩有你
- 流域地表水水质监测实施方案
- 2026年秋季小学道德与法治四年级上册(新教材)教学计划
- 2026小学道德与法治五年级上册第四单元创新教学设计详案
- 2026秋新版人教PEP英语六年级上册教学课件:第一单元Unit 1第5课时 B Read and write Reading time
- 2025年注册会计师考试经济法真题及答案解析
- 2025年基金从业资格考试私募股权投资基金基础知识真题及答案
- 2026年湖北省安陆市辅警招聘考试试题题库及参考答案【新】
- 2026-2027学年数学人教版七上第一章 有理数重难点检测卷(提高卷)
- 2026秋季开学典礼校长致辞
- 2026年6月英语六级真题第3套(附答案)
评论
0/150
提交评论