人工入门智能基础 4_第1页
人工入门智能基础 4_第2页
人工入门智能基础 4_第3页
人工入门智能基础 4_第4页
人工入门智能基础 4_第5页
已阅读5页,还剩23页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第7章强化学习

目录01强化学习概述02经典强化学习算法03深度强化学习04强化学习的应用1强化学习概述01强化学习概述02经典强化学习算法03深度强化学习04强化学习的应用概览PART01/核心议程强化学习基础什么是强化学习?它的核心思想是什么?构建对智能决策的基本认知。经典算法解析深入理解MDP、Q-Learning、策略梯度等核心算法的数学原理与推导。深度强化学习探索DQN、PPO等前沿算法如何利用神经网络突破传统方法的维度灾难。应用与展望领略强化学习在机器人控制、自动驾驶、游戏AI等复杂领域的强大力量。PART02/学习目标理解核心概念掌握智能体、环境、状态、动作、奖励、策略等强化学习的基本构成要素。熟悉经典算法了解不同算法的适用场景、优缺点,建立对算法选择的直觉判断。洞察前沿技术把握深度强化学习的发展脉络,理解关键技术演进背后的逻辑与动机。展望应用前景认识强化学习在解决复杂决策优化问题中的巨大潜力,激发探索兴趣。什么是强化学习?▍核心定义让智能体(Agent)通过与环境(Env)交互试错,学习决策序列以最大化长期累积奖励。💡一句话概括:像训练宠物一样,“从奖励中学习”。▍学习范式对比监督学习

依赖标签数据映射无监督学习

挖掘数据内在结构强化学习

依赖延迟奖励信号▍六大关键要素智能体/环境/状态Agent/Env/State动作/奖励/策略Action/Reward/Policy核心闭环:感知(State)→决策(Action)→反馈(Reward)1强化学习概述核心思想闭环交互与反馈驱动感知(Perceive)

智能体主动获取当前环境状态决策(Decide)

基于当前策略网络选择最优动作执行与反馈

动作改变环境,环境返回奖励信号策略更新

利用奖励梯度反向优化策略网络策略优化与长期收益目标:长期累积奖励最大化

MaximizeCumulativeFutureReward拒绝“短视”

不仅关注单步的即时反馈,更看重整个序列的最终回报。典型案例:围棋

牺牲局部棋子以换取全局胜利,体现了对长期收益的追求。探索与利用的权衡利用(Exploitation)

选择当前已知的最优动作,获取确定的收益。探索(Exploration)

尝试未探索的新动作,以期发现更优策略。动态平衡策略

如ε-greedy算法,兼顾短期利益与长期发展。1强化学习概述发展历程理论奠基期(1950s-1970s)1953-57:贝尔曼提出动态规划(DP)与马尔可夫决策过程(MDP)1960:霍华德提出策略迭代方法,奠定核心框架。方法论突破期(1970s-1980s)1972:Klopf结合试错学习与时间差分(TD)思想。1978-80s:Sutton和Barto完善TD体系,提出TD(λ)核心算法。算法成熟期(1980s-1990s)1989:Watkins提出Q-Learning,成为发展史上的关键转折点。1992:TD-Gammon程序在西洋双陆棋达到人类顶尖水平。技术爆发期(2010s-至今)2013:DeepMind提出深度Q网络(DQN),Atari游戏表现优异。2016:AlphaGo击败李世石,AI发展里程碑事件。1强化学习概述强化学习的地位与作用▍在人工智能领域的核心地位机器学习的三大支柱之一与监督学习、无监督学习并列,共同构成了现代机器学习的完整理论与技术体系。实现“决策智能”的关键钥匙让AI具备在动态、不确定的复杂环境中,通过试错与反馈进行自主决策的核心能力。连接“感知”与“决策”的技术桥梁承接CV、NLP带来的环境“感知”信息,并将其转化为具体的行动策略与执行决策。▍关键作用与广泛应用场景工业自动化优化生产流程,提升机器人路径规划与任务协作效率。医疗健康辅助疾病诊断,生成并优化个性化的精准治疗方案。智能交通支撑自动驾驶技术,优化交通信号控制与物流路径配送。游戏娱乐训练超人类水平的AI对手,创造更具挑战性的NPC。金融量化投资构建动态自适应的交易策略,在复杂市场中实现风险控制与投资收益最大化。1强化学习概述2经典强化学习算法01强化学习概述02经典强化学习算法03深度强化学习04强化学习的应用2经典强化学习算法算法类别核心思想模型依赖动作空间适配核心优势主要局限典型应用场景马尔科夫决策过程(MDP)以“状态-动作-奖励”闭环建模决策问题依赖环境模型离散/连续均可提供统一理论框架,支撑后续算法研发假设状态满足马尔可夫性质,现实中易失效所有强化学习问题的基础建模(如路径规划)Q-Learning构建Q表,通过贝尔曼方程更新价值无模型离散(传统)非策略特性,可独立优化价值与采样策略状态/动作空间扩大时Q表爆炸(维度灾难)迷宫寻宝、简单机器人控制策略梯度算法直接优化策略参数,最大化累积奖励无模型连续/离散均可天然适配连续动作,支持随机策略梯度估计方差大,收敛稳定性差机器人平衡控制、自动驾驶Actor-Critic“决策者-评估者”双网络协同优化无模型连续/离散均可收敛速度快,兼顾策略灵活性与评估准确性Actor与Critic相互依赖,训练稳定性差四足机器人行走、金融交易系统马尔可夫决策过程(MDP)01/算法概述:理论基石MDP是强化学习的理论核心,它构建了一个智能体与环境持续交互的数学框架。将复杂的序贯决策问题,抽象为“状态感知→动作执行→环境反馈”的动态循环过程。02/核心思想:马尔科夫性质核心假设:“未来只取决于现在,与过去无关”。预测下一状态只需当前状态信息,无需历史轨迹,极大简化了决策复杂度。03/关键组成五要素状态空间(S):所有可能状态的集合

动作空间(A):状态下可选动作集合

转移概率(P):s执行a到s'的概率奖励函数(R):转移时的即时收益

折扣因子(γ):对未来奖励的重视度智能体与环境的交互闭环

通过不断优化策略,最大化长期累积奖励2经典强化学习算法Q-Learning方法▍算法概述Q-Learning是一种无模型、非策略的强化学习算法。核心是学习一个Q表,用于记录在每个状态s下,执行每个动作a所能获得的长期累积奖励(Q值)。▍核心思想:贝尔曼方程更新Q(s,a)=Q(s,a)+α[r+γ·max(Q(s',a'))-Q(s,a)]✨核心优势简单直观,无需环境模型,理论上能收敛到全局最优策略。⚠️主要局限存在“维度灾难”,当状态/动作空间巨大时,Q表无法存储。Q-Learning算法迭代流程图2经典强化学习算法Q-Learning实例分析:迷宫寻宝场景设定|ScenarioSetup环境Environment构建一个结构化的网格迷宫,包含起点、路径、墙壁与终点。智能体Agent作为学习者的机器人,具备感知环境状态和执行动作的能力。状态&动作State&Action状态为机器人的坐标(x,y);动作集为上下左右四个方向移动。奖励机制Reward寻得宝藏(+100)|撞到墙壁(-50)|每步探索(-1)。学习过程|LearningProcess01.初始探索阶段Q表初始化为全0,机器人缺乏先验知识,以随机策略进行探索,像“没头苍蝇”一样在迷宫中尝试。02.Q表迭代更新阶段根据获得的即时奖励与环境反馈,利用Bellman方程不断更新Q表。降低导致惩罚的动作值,强化获得奖励的动作值。03.策略收敛成熟阶段Q表数值趋于稳定收敛,机器人依据Q表中的最大值选择动作,能够避开死胡同,规划并走出迷宫的最优路径。2经典强化学习算法策略梯度算法(PolicyGradient)▍算法核心概述策略梯度是一类直接优化策略的算法。它摒弃了对价值函数的显式学习,转而直接训练策略函数π(a|s),该函数的输出代表智能体在状态s下执行动作a的概率分布。▍核心思想:随机决策器策略通常由神经网络表示,输入为环境状态s,输出为动作概率。这种机制使其天然适配连续动作空间(如机器人关节控制、无人机姿态调整),具有很强的工程实用性。▍算法优劣势对比优势:适配连续空间,支持随机策略探索。局限:梯度估计方差较大,训练过程不稳定。2经典强化学习算法策略梯度实例分析:机器人平衡控制▍场景设定:双足机器人平衡核心任务目标控制双足机器人在平面上保持长时间的动态平衡状态,不发生倾倒。环境观测状态包含机器人各关节的角度、角速度,以及身体的实时倾斜度与加速度。动作空间&奖励机制动作:输出腿部关节的连续扭矩值,精细控制姿态。

奖励:平衡(+5)/倾斜(-2)/摔倒(-50),引导策略学习。▍学习过程:策略迭代优化建立策略网络(PolicyNetwork)以机器人的实时状态为输入,输出腿部关节的扭矩控制量,作为行动依据。环境交互与试错探索机器人执行策略动作,初期会频繁摔倒,但会记录下每一次尝试的完整轨迹数据。策略梯度反向优化算法评估轨迹的奖励值,计算梯度并更新网络参数,使策略逐渐倾向于输出能获得高奖励的平衡动作。2经典强化学习算法Actor-Critic算法▍算法概述结合策略梯度与值函数优点的进阶算法,包含两个核心网络:•Actor(演员):策略网络,负责生成具体动作。•Critic(评论家):价值网络,负责评估动作的优劣。▍核心思想:“决策-评估”双人舞1.决策:Actor根据当前环境状态,输出具体的动作策略。2.评估:Critic基于值函数计算TD误差,反馈动作的好坏。3.迭代:Actor依据Critic的评价梯度更新策略,共同进化。▍核心优劣势分析✅优点:兼具策略梯度处理连续动作能力与值函数的高效收敛性。⚠️缺点:双网络强耦合,训练过程中易出现参数震荡,稳定性较差。图示:Actor(决策者)与Critic(评估者)的交互过程2经典强化学习算法3深度强化学习01强化学习概述02经典强化学习算法03深度强化学习04强化学习的应用从传统到深度:为何需要深度强化学习?传统瓶颈:维度灾难•传统方法(如Q-Learning)严重依赖表格来存储状态的价值函数。•面对游戏画面等百万像素级的高维输入时,状态数量呈指数级爆炸,表格存储完全失效。核心方案:深度神经网络•函数近似:使用深度神经网络代替传统表格,直接拟合值函数或策略函数。•自动特征提取:网络能从原始的、非结构化的高维数据(如图像)中自动学习并抽象出有效特征。训练稳定:关键支撑技术•经验回放:存储智能体交互经验,训练时随机采样,打破数据相关性,稳定梯度下降。•目标网络:使用独立的、延迟更新的目标网络计算目标Q值,避免参数剧烈震荡。3深度强化学习深度Q网络(DQN)DQN网络结构与环境交互可视化示意📖算法核心概述DQN是深度学习与强化学习结合的里程碑。它利用深度卷积神经网络(CNN)来近似Q函数,输入为游戏画面的原始像素,输出为每个动作对应的Q值,实现端到端的决策。💡两大关键技术创新经验回放(ReplayBuffer)存储交互经验,随机抽取训练,打破样本时间关联性。目标网络(TargetNetwork)双网络结构分离参数,提供稳定的学习目标,降低波动。📊算法核心优劣势核心优势解决高维状态空间问题,通用性极强。主要局限仅支持离散动作,存在Q值过估计问题。3深度强化学习DQN实例分析:Atari游戏▲Atari2600游戏运行画面实验应用场景DeepMind团队将DQN算法部署在经典的Atari2600游戏平台上,针对多款不同类型的雅达利游戏开展了大规模的深度强化学习性能测试。算法核心:输入与输出输入:游戏屏幕的原始RGB像素矩阵(210×160×3)。

输出:游戏手柄18个潜在操作动作对应的Q值预测。里程碑式的技术突破无需任何游戏规则先验知识,仅通过与环境交互试错,在多款游戏中达到人类职业玩家水平,验证了深度RL具备从原始感知中学习复杂行为的能力。3深度强化学习近端策略优化(PPO)算法概述PPO是目前最流行的策略梯度算法之一。它属于Actor-Critic架构,在学术界和工业界广泛应用,以优异的稳定性和高样本效率著称。💡一句话总结:

对策略梯度算法的改进与实用化落地。核心:限制更新幅度为防止策略更新“步子过大”导致性能崩溃,PPO引入了“近端策略优化”目标函数。核心机制是Clipping(裁剪),强行限制新旧策略的差异,确保每一步更新都在安全范围内。🎯目标:

在探索新策略与保持稳定性之间找平衡。优劣对比分析👍核心优势训练稳定不崩溃;样本利用率高;实现逻辑相对简单;通用性极强。👎潜在不足对超参数(如裁剪阈值ε)有一定敏感性;在某些特定任务上性能可能略逊于TRPO。3深度强化学习其他重要的深度强化学习算法A3C(异步优势演员-评论家)核心:采用多线程并行架构,多个智能体在独立环境副本中异步探索并更新全局网络,打破了数据相关性。优势:训练速度显著提升,数据多样性丰富,适合单机多线程训练场景。DDPG(深度确定性策略梯度)核心:结合DQN的经验回放与Actor-Critic框架,专为连续动作空间设计,Actor网络输出确定性的最优动作。优势:有效解决连续动作控制难题,在机器人运动、自动驾驶等领域应用广泛。SAC(柔性演员评论家)核心:基于最大熵强化学习原理,在追求高回报的同时最大化策略熵,鼓励智能体进行探索。

优势:探索效率高,鲁棒性强,具有极佳的样本利用效率。DDPG的Actor-Critic核心架构示意

Actor负责生成动作,Critic负责评估动作价值,两者协同进化3深度强化学习深度强化学习算法对比DQN(DeepQ-Network)核心思想:用神经网络近似替代传统Q表,拟合Q值函数。动作空间:仅支持离散动作空间。核心优势:突破维度灾难,支持高维视觉输入。主要局限:易高估Q值,训练不稳定。PPO(ProximalPolicy)核心思想:通过截断限制策略更新幅度,平衡稳定性与收益。动作空间:离散/连续动作空间均适用。核心优势:训练极稳定,样本效率高,通用性强。主要局限:超参数选择敏感,需细致调优。A3C(AsynchronousAdvantage)核心思想:多线程并行环境探索,异步更新全局网络参数。动作空间:离散/连续动作空间均适用。核心优势:训练速度极快,计算资源利用率高。主要局限:线程同步复杂,效果受线程数影响。DDPG(DeepDeterministicPolicyGradient)核心思想:确定性策略梯度,输出具体连续动作值。动作空间:专为连续动作控制设计,天然适配。核心优势:样本效率高,解决连续动作维度爆炸问题。主要局限:探索能力弱,高度依赖动作噪声的人工设计。SAC(SoftActor-Critic)核心思想:最大熵框架,在最大化奖励同时最大化熵。动作空间:连续动作空间为主,具备一定通用性。核心优势:自适应探索,无需手动调噪声,鲁棒性极强。主要局限:双Q网络结构复杂,计算开销与内存占用大。3深度强化学习4强化学习的应用01强化学习概述02经典强化学习算法03深度强化学习04强化学习的应用应用领域一:智能机器人核心技术挑战•复杂动作生成:需精准控制后空翻、精细抓取等高难度动作。•动态环境适应:在非结构化场景中实现毫秒级实时决策。•任务泛化能力:将已有技能快速迁移至未知的新任务中。关键技术方案•连续动作控制:采用DDPG、SAC等深度强化学习算法,解决连续空间的控制难题。•端到端感知决策:融合CNN视觉感知与RL,直接

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论