版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第六章
强化学习:揭秘AI自主进化的核心驱动逻辑问题与导读:AI怎么实现“自学成才”?当AlphaGo在棋盘上落下神之一手,当自动驾驶汽车在复杂路况中自如穿梭,当AI在电子游戏中从新手成长为“大神”,它们背后共同的秘密武器是什么?核心思想:强化学习(ReinforcementLearning,RL)一种模拟人类“尝试-反馈-学习”模式的人工智能技术。它让AI无需预设答案,仅凭与环境的互动和奖励信号,自主探索最优策略。博弈决策·AlphaGo从零开始,通过自我对弈超越人类顶尖棋手复杂控制·自动驾驶在城市路况中自主感知、规划与决策,安全通行策略探索·游戏AI从随机操作到掌握游戏机制,成为通关“大神”AI的“试错学习课堂”Trial&Error模拟人类最自然的
自主成长与决策机制你是否想过,AI是如何像人一样学会应对复杂世界的?AlphaGo落子、自动驾驶避险、游戏AI通关...它们共享同一种核心技术——强化学习(ReinforcementLearning)。不断尝试像学骑车一样
探索不同的动作奖惩反馈从失败与成功中
获取关键经验迭代调整优化决策模型
最终掌握平衡基础交互机制拆解智能体与环境的表扬与批评系统具备长远眼光学习如何让AI具备延迟满足的决策智慧高效协同训练探索“演员-评论家”双网络协同工作的奥秘真实世界落地看懂AI从仿真环境走向真实世界的挑战方案本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读6.1强化学习基本原理监督学习vs强化学习核心概念定义智能体(Agent):学习主体,输入环境观测,输出决策动作。环境(Environment):外部世界,接收动作,反馈新观测与奖励信号。感知:环境提供「观测(Observation)」,作为智能体的输入依据决策:智能体执行「动作(Action)」,直接对环境产生影响与改变持续动态循环非单次决策,而是不断迭代的交互过程累积奖励最大化学习策略π(s)→a,优化长期收益6.1强化学习基本原理:智能体与环境的互动循环6.1强化学习基本原理:三大领域的“试错”实践电子游戏·太空侵略者场景:高维像素输入,离散动作交互奖励:击中+5/通关+1000/碰撞-10核心:即时奖励反馈,动作关联性强棋类博弈·AlphaGo场景:19×19棋盘状态,离散落子动作奖励:极度稀疏,仅终局胜负(+1/-1)核心:长周期延迟反馈,需具备大局观6.1强化学习基本原理:三大领域的“试错”实践自动驾驶·复杂路况场景:多模态融合输入,连续控制动作奖励:多目标动态平衡(安全/舒适/效率)核心:应对现实环境的复杂性与不可预测6.1强化学习基本原理:三大领域的“试错”实践本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读6.2强化学习框架、评价机制与参数优化01/建模构建环境与智能体交互的数学模型,定义状态空间与动作空间。02/评价设计奖励函数与价值网络,量化智能体策略在环境中的表现。03/优化基于梯度下降更新策略网络参数,持续迭代以逼近最优解。强化学习的“三步走”▍核心机制与原理Softmax输出:将网络原始分数转化为概率分布,确保动作的可解释性随机探索机制:按概率采样动作,避免陷入局部最优,实现策略探索6.2强化学习框架--构建智能体模型策略网络:AI的“决策大脑”6.2强化学习框架--制定评价机制
电子游戏中的奖励▍评价标准的演进6.2强化学习框架--制定评价机制
智能体与环境交互轨迹回报R是轨迹τ中所有即时奖励的累加
延迟满足高额回报轨迹(Trajectory,τ)为状态-动作对分配回报权重系数
策略梯度(PolicyGradient)算法6.2强化学习框架--参数优化6.2强化学习框架--参数优化
权重系数定义为状态-动作对分配回报权重系数本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读
6.3评价动作标准的四代演进6.3评价动作标准的四代演进1即时奖励
核心问题短视性:仅关注当前步收益,忽略长期累积回报。解决方案将从当前时刻开始的所有后续奖励求和,衡量动作对长期收益的贡献累积奖励
核心问题高估远期:此计算会高估早期动作的远期价值解决方案引入折扣因子γ,衰减远期收益权重3折扣累积
核心问题高方差:所有历史动作权重均为正,奖励信号波动剧烈,难以收敛解决方案引入状态基线b(s),降低评价方差优势函数
核心问题基准确立后问题基本解决,评价体系趋于稳健核心价值相对优势:直观判断动作优劣(>0优/<0劣)12346.3评价动作的标准-即时奖励评价即时奖励评价方式
即时奖励评价6.3评价动作的标准-即时奖励评价
累积奖励评价方式累积奖励评价6.3评价动作的标准-折扣累积奖励评价
折扣累积奖励评价方式折扣累积奖励评价6.3评价动作的标准-折扣累积奖励评价
折扣因子γ调节了智能体的“远见”程度(1)当γ取值趋近于0时,智能体更关注即时奖励。当γ=0时,公式退化为版本1的即时奖励评价策略。(2)当γ取值趋近于1时,智能体更关注长期回报。当γ=1时,公式退化为版本2的无折扣累积奖励评价策略。折扣累积奖励评价
6.3评价动作的标准-带基线的折扣累积奖励评价带基线的折扣累积奖励评价带基线的折扣累积奖励评价本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读6.4策略梯度训练流程以带基线的折扣累积奖励作为动作评价标准与环境交互、评价动作优势、更新模型参数策略梯度算法流程老手车·优动作(A>0)规划穿小巷→避开主干道拥堵省5分钟,高效完成配送,获得正向收益。同一行为在不同策略决策下,收益结果迥异解决方案:异策略学习(Off-Policy)行为策略(β):负责“数据采集”基于“旧策略(新手车)”与真实环境交互,持续收集海量原始交互数据。目标策略(π):负责“学习优化”基于“新策略(老手车)”进行模型训练,从历史数据中迭代学习最优决策路径。核心优势:1批数据⇒N次更新打破数据时效性限制,大幅提升样本利用率与训练效率。新手车·劣动作(A<0)执意穿小巷→误入死胡同迷路,导致配送延误,产生明显的负面收益。核心故事:外卖智能车“抄近道”6.4策略梯度算法--数据局限引入随机性,让智能体主动尝试未知动作的技巧熵正则化EntropyRegularization通过增大动作分布的熵H(π),迫使策略分布更均匀,鼓励智能体尝试更多样化的动作。参数噪声ParameterNoise直接在神经网络的权重中加入随机噪声,让智能体在面对同一状态时,产生不同的动作输出。ε-贪心策略ε-GreedyPolicy以ε的小概率进行随机探索,以1-ε的大概率利用当前已知的最优策略,平衡探索与利用。WithoutExploration(无探索)智能体只会机械执行“已知最优”动作,陷入局部最优陷阱,永远无法发现“开火”比“右移”更好的策略。解决之道:需要强制智能体进行“冒险”,在探索未知与利用已知之间寻找平衡。探索(exploration)6.4策略梯度算法--强化学习探索Actor·策略执行者
Critic·价值评论员
Actor-Critic(演员-评论员)架构6.4策略梯度算法--Actor-Critic双网络架构
Actor-Critic(演员-评论员)架构6.4策略梯度算法--Actor-Critic双网络架构
蒙特卡洛法
蒙特卡洛法(MC法)6.4策略梯度算法--蒙特卡洛法(MC法)时序差分法
每走一步就能训练,效率高,且分数更稳定6.4策略梯度算法--时序差分法(TD法)时序差分法(TD法)对比维度蒙特卡洛(MC)法时序差分(TD)法打分依据一局游戏的完整折扣累积奖励训练时机必须等一局结束后走一步就能训练打分准确性准(基于真实游戏结果)可能不准(依赖Critic之前的水平)分数稳定性不稳定(不同局结果差异大)稳定(参考之前的打分)效率低(等一局才能练)高(每步都能练)6.4策略梯度算法--MC法
vs
TD
法MC与TD优劣对比核心:定义并迭代更新动作价值函数(Action-ValueFunction),记为Q(s,a)量化了“在状态s做动作a”的长期价值——Q值越高,说明该状态-动作对越有可能导向最终的高回报。价值迭代通过与环境交互,不断修正Q(s,a)的估计值,使其逐步逼近真实的动作价值策略推导基于更新后的Q(s,a),采用“贪心策略”生成最优策略,无需单独设计策略网络。Q-Learning6.4策略梯度算法--Q-Learning对比维度Q-LearningActor-Critic核心学习对象动作价值函数Q(s,a)策略生成方式策略网络采样(离散动作输出概率,连续动作输出分布参数)学习范式纯价值学习策略学习+价值学习数据利用效率单步更新(每交互一步即可更新Q值)单步更新(Critic与Actor同步单步优化)动作空间适配性支持连续动作(策略网络可输出连续分布)异策略特性天然异策略(更新Q值时无需依赖当前策略的动作分布)可设计为异策略(如结合重要性采样),也可同策略Q-Learning与Actor-Critic
的对比6.4策略梯度算法--QL与AC策略对比本章目录6.1强化学习基本原理与应用6.2强化学习框架6.3评价动作的标准6.4策略梯度与Actor-Critic算法6.5章节总结与延伸阅读💡核心主线:强化学习的所有演进始终围绕一个核心目标——最大化长期回报(MaximizeLong-termReward)基础交互原理建立Agent与Environment的闭环交互流,通过感知与动作持续循环。多维评价体系
核心训练挑战解决样本时效性差、数据分布非平稳问题,平衡探索与利用(ExplorationvsExploitation)。经典高效架构掌握Q-Learning(价值法)与Actor-Critic(演员-评论家)主流算法框架的设计逻辑。✨启示:强化学习是一门“实践驱动”的科学,其核心力量在于让智能体在与真实世界的持续“对话”中,自主进化出超越人类经验边界的智慧。6.5本章总结与延伸阅读《ReinforcementLearning:AnIntroduction
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026水利工程质量检测员考试(量测)历年参考题库含答案详解
- 2026教师职称-湖南-湖南教师职称(基础知识、综合素质、高中语文)历年参考题库含答案详解3套试卷
- 2026教师职称-江苏-江苏教师职称(基础知识、综合素质、小学英语)历年参考题库含答案详解3套试卷
- 基于机器视觉的尺寸测量系统在编程技巧课程设计
- 茶艺课程设计范文图片
- 茶叶罐盖冲压模课程设计
- 电动自行车动力系统设计电池技术课程设计
- 平台用户行为建模方法课程设计
- 超声波报警系统课程设计课程设计
- 容器逃逸检测工具比较课程设计
- 普华永道:2026年全球AI就业晴雨表-AI时代就业的两种未来图景(2026年-中文版)
- 2026秋小学西师大版音乐二年级上册(新教材)教学计划含教学进度表
- 《物流成本管理》全套教学课件
- 2026年秋季六年级数学上册教学计划(人教版)
- GB/T 32741-2025肥料、土壤调理剂和有益物质分类
- 谜语知识讲解(优秀教学课件)-人教版
- CFG桩复合地基施工方案
- GB/T 22717-2008电机磁极线圈及磁场绕组匝间绝缘试验规范
- GB/T 18400.7-2010加工中心检验条件第7部分:精加工试件精度检验
- 教育科学研究的步骤与方法-课件
- 当代西方社会思潮研究
评论
0/150
提交评论