计算机科学与技术专业大三《强化学习》复习课教学设计_第1页
计算机科学与技术专业大三《强化学习》复习课教学设计_第2页
计算机科学与技术专业大三《强化学习》复习课教学设计_第3页
计算机科学与技术专业大三《强化学习》复习课教学设计_第4页
计算机科学与技术专业大三《强化学习》复习课教学设计_第5页
已阅读5页,还剩7页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

计算机科学与技术专业大三《强化学习》复习课教学设计

一、课程定位与复习目标体系

(一)学科与学段定位

本设计面向大学三年级计算机科学与技术专业本科生,对应课程为人工智能方向核心必修课《强化学习》。学生已系统学习概率论、线性代数、Python编程及机器学习基础,正处于从经典监督学习范式向序贯决策范式跨越的关键阶段。复习课定位于认知重构与能力迁移,旨在帮助学生在期末备考与项目实践中完成从碎片化知识点到结构化认知网络的跃迁。

(二)总复习目标

依据布鲁姆认知目标新分类与工程教育认证产出导向理念,确立三层级目标。知识维度:精准复述马尔可夫决策过程的五元组构成、贝尔曼方程的数学本质、主流无模型算法的更新规则,达成零盲区覆盖。能力维度:在给定网格世界、黑杰克或连续控制环境中,独立完成从MDP形式化建模到算法选型、代码调试与性能调优的全流程推演。素养维度:建立探索与利用悖论的工程哲学观,能够辩证分析样本效率与渐进最优性之间的权衡,形成对深度强化学习稳定性问题的批判性思维。

(三)课时与课型

共计4学时,每学时50分钟,分两次课实施。第一次课聚焦表格型方法及其数学内核,第二次课攻克深度强化学习与策略梯度家族。课型为专题整合式复习,采用大概念统摄、问题链驱动、真题变式嵌入的高密度讲练结合模式。

二、复习内容全景图谱与重要度标记

(一)强化学习问题形式化模块

马尔可夫决策过程五元组核心要素。【基础】状态空间、动作空间、状态转移概率、即时奖励、折扣因子。部分可观测马尔可夫决策过程与完全可观测的辨析边界。【重要】回报与折扣累积回报的计算通式。轨迹、回合与连续任务的区别。【基础】强化学习与监督学习、无监督学习的根本分野:延迟奖励与主动探索。环境的模型已知与未知对算法分类的根本性影响。【非常重要】

(二)最优准则与贝尔曼理论模块

策略、确定性策略与随机性策略的数学表示。【基础】状态值函数与动作值函数的定义、二者互换关系、贝尔曼期望方程与贝尔曼最优方程的推导与不动点含义。【非常重要】【高频考点】最优值函数与最优策略的等价性定理。策略改进定理与策略提升的单调性保证。【重要】动态规划视角下的全宽备份与异步备份思想。

(三)经典表格算法模块

动态规划在模型已知时的应用:策略迭代的双层循环结构、值迭代的收缩映射视角。【重要】蒙特卡洛方法的回合更新机制、首次访问与每次访问的异同、增量式计算均值技巧。【基础】时序差分学习的核心理念:利用未来估计修正当前估计。SARSA算法的同轨特性与Q学习算法的离轨革命。【非常重要】【高频考点】期望SARSA与DoubleQ学习对偏差方差的改良。【热点】探索策略:ε-贪婪、上置信界、汤普森采样的思想脉络。【难点】

(四)值函数近似与深度强化学习模块

函数逼近的引入原因:大规模状态空间的维度灾难。【重要】深度Q网络的三大支柱:经验回放打破数据相关性、目标网络稳定训练目标、卷积神经网络自动提取视觉特征。【非常重要】【高频考点】DQN的变体演进:DoubleDQN对过估计的抑制、DuelingDQN对优势函数与价值函数的分流建模、优先级经验回放对样本效率的提升。【热点】深度强化学习的顽疾:过估计、样本效率低下、训练不稳定、奖励稀疏。【难点】

(五)策略优化与基于模型强化学习模块

策略梯度定理的数学形式与REINFORCE算法的蒙特卡洛实现。【非常重要】Actor-Critic架构的必然性:降低方差同时引入偏差。优势函数估计:广义优势估计。【重要】自然策略梯度、信任区域策略优化与近端策略优化裁剪目标的动机。【热点】【难点】基于模型的强化学习的双刃剑:学习环境模型带来的样本效率收益与复合误差放大风险。集成学习在模型不确定性问题上的应用。【基础】

三、教学实施过程的深度展开

(一)第一学时:破冰重构与MDP建模复盘

1.认知冲突导入阶段

教师展示三段短视频:AlphaGo自我对弈落子、自动驾驶车辆在模拟器中完成无保护左转、机械臂通过试错学会抓取不同形状积木。提出问题:这三个问题表面差异巨大,但能否用同一套数学语言描述其决策共性?要求学生以学习小组为单位,在3分钟内提炼出至少三个共性要素。学生必然提出目标、动作、反馈、环境等关键词。教师顺势点明:这正是序贯决策中马尔可夫决策过程所抽象的四类实体。此时不直接给出定义,而是以板书形式将学生答案映射至MDP五元组符号,完成从具象经验到形式符号的第一次抽象跃迁。【非常重要】

2.核心概念网状互锁

教师以网格世界为贯穿性载体,呈现一个4×4网格,左上角为起点,右下角为终点,中间设有惩罚性禁区。要求学生现场为这一网格世界完整填写五元组内容。状态空间为16个格子;动作空间为上下左右;转移概率在确定性环境中为1.0;奖励函数设计为到达终点+1,踏入禁区-1,其余步长-0.01以鼓励最短路径;折扣因子设为0.99。此环节采用学生口述、教师板书的交互方式,刻意暴露学生在转移概率与奖励函数区分上的认知模糊。教师以班杜拉社会学习理论为支撑,邀请一位正确建模的学生讲解其思考路径,实现同伴示范。【基础】

3.值函数概念的多元表征融合

教师出示两种值函数可视化形式:第一种是网格世界热力图,每个格子标注数值,代表该状态的价值;第二种是状态动作对的三维柱状图。要求学生用自然语言描述热力图中高亮区域为什么价值更高,并反推出可能的最优路径。随后教师提出贝尔曼方程,不直接写出公式,而是以递推关系式呈现:当前状态价值等于即时奖励加上未来状态价值的折扣平均。学生分组在网格世界中验证贝尔曼期望方程是否成立。教师提供部分计算数据,学生进行数值验算,最终由学生代表归纳出方程结构。【重要】此环节关键点在于让学生意识到贝尔曼方程是自洽性条件,而非求解方法,为后续动态规划埋下伏笔。

4.即时诊断与反馈

教师呈现五个短选择题,覆盖状态转移概率计算、折扣因子对远期奖励影响、确定性策略与随机性策略图示辨析等。采用答题器或手势投票实时获取正确率。对于正确率低于60%的题目,立即进行变式再练,不进入下一进度。【高频考点】

(二)第二学时:动态规划与蒙特卡洛的方法论对比

5.思维可视化策略迭代

教师不在屏幕上直接展示伪代码,而是让学生扮演策略评估与策略改进两个角色。教室左侧为评估组,右侧为改进组。给定一个初始随机策略,评估组通过贝尔曼方程迭代计算当前策略下的值函数;改进组根据新的值函数贪婪地更新策略。两轮迭代后,学生直观感受到策略如何在交互中单调提升至最优。教师此时才形式化写出策略迭代的收敛性定理,并指出其本质是使用贝尔曼期望方程作为计算内核。【重要】随后抛出关键问题:如果状态空间爆炸,无法进行全宽备份,人类如何进行高效学习?引导学生关注试错经验的价值。

6.蒙特卡洛方法的经验主义转向

教师播放蒙特卡洛树搜索在围棋对局中的落子选择动画。类比人类通过多次完整对局积累胜负经验。教师设计一个迷你二十一点简化版游戏,现场生成少量回合数据。要求学生仅基于这些回合数据,计算某状态或状态动作对的平均回报值。学生自然采用增量平均公式。教师此时点明这就是蒙特卡洛方法的核心。进一步追问:首次访问与每次访问在有限样本下会得出不同估计,哪个偏差更低?学生通过计算具体数值发现,首次访问是无偏估计,每次访问在有因状态重复进入时引入偏差但方差更小。此辨析为【难点】且是近年考研高频命题点。【高频考点】

7.时序差分学习的认知革命

教师设计认知冲突:蒙特卡洛方法必须等到回合结束才能学习,这对没有终止的持续任务是致命缺陷。如何在不完整轨迹上更新?教师用倒车入库作类比:不必等到完全停稳才判断是否成功,在倒车过程中偏离中线就应实时修正。由此引出时序差分学习用后续估计替代真实回报的思想。教师展示SARSA算法更新公式,强调五元组名称来源,并让学生在网格世界中执行一步人工更新。【非常重要】紧接着对比Q学习,通过悬崖行走问题情境,展示Q学习直接选取最大下一动作值,可能导致路径贴近悬崖边;SARSA因考虑实际选择动作,路径更保守安全。这一对比揭示了离轨策略与同轨策略的根本差异,是期末试卷大题的经典素材。【高频考点】

8.算法家族树构建

教师引导学生共同绘制表格型强化学习算法分类树:根节点分为基于模型与无模型;无模型下分基于回合与基于步进;基于步进下分同轨与离轨。每个算法旁标注更新公式的异同。学生绘制过程中自然完成知识结构化,教师抽查并纠正常见错误,如将Q学习归入同轨策略。【非常重要】

(三)第三学时:深度强化学习的工程智慧

9.从表格到泛化的必然跃迁

教师呈现围棋棋盘、Atari游戏原始像素输入,提问:若将每个像素排列组合视为状态,状态空间数量级是多少?学生估算后惊叹宇宙原子总数也难以比拟。教师点明神经网络的归纳偏置正是解决维度灾难的钥匙。但神经网络在强化学习中的首次尝试为何一度失败?教师复现经典实验:线性网络在悬崖行走中甚至无法收敛。引导学生分析原因:相邻样本高度相关、非平稳目标不断移动。学生分组讨论,每组提出一种可能的补救思路,教师将学生方案写在副板书上,与DQN三项突破逐一比对,学生对深度强化学习设计者的洞察力产生高度敬意。【非常重要】

10.DQN三模块拆解与变体演进

教师以CartPole平衡杆为仿真环境,现场运行DQN训练代码,可视化损失曲线与平均奖励曲线。在训练中断点展示经验池中存储的转移样本,让学生直观感受打破相关性的必要性。接着展示目标网络更新前后值函数预测的变化,理解固定目标对稳定性的关键作用。【重要】随后呈现DoubleDQN与DuelingDQN的结构图。教师不直接讲解论文结论,而是让学生根据过估计现象自主推导改进方向。在教师引导下,学生发现若用两个网络解耦选择和评估,即可抑制过估计。进而将Dueling结构拆分为优势流与价值流,学生通过反向传播图理解为何这种分叉能学到状态价值而不必学习每个动作的绝对价值。【热点】【难点】

11.连续动作空间的策略直译

教师提出困境:DQN输出层是softmax对应离散动作概率,若动作是方向盘转角连续值怎么办?学生陷入沉思。教师引出策略梯度家族,强调其根本思想是参数化策略而非值函数。以REINFORCE算法为例,现场推导策略梯度定理:目标函数梯度等于轨迹总回报乘以策略对数概率梯度。教师手推核心推导步骤,强调此处的期望是通过采样估计的。【非常重要】学生通过计算图理解为什么高回报轨迹被强化、低回报轨迹被抑制。随后引入Actor-Critic,解释用值函数作为基线降低方差的思想。学生此时能认识到:这实质上是融合了基于值函数与基于策略两类方法的优势。

12.PPO的工程美学

教师呈现TRPO的复杂约束优化形式,再展示PPO的裁剪替代目标,并提问:为何业界普遍弃TRPO而从PPO?学生阅读教师提供的简短伪代码,发现PPO仅需几行修改即可在现有策略梯度代码中实现,且超参数鲁棒。教师组织微型辩论:一方支持理论严谨性,一方拥护工程简洁性。辩论中学生深化了对强化学习研究范式的理解:在样本效率与实现复杂度之间寻求帕累托前沿。此环节将学术史与工程思维融为一体,属于高阶素养目标。【热点】

(四)第四学时:综合实战与应试冲刺

13.真题剖解与变式链训练

教师从近五年全国顶尖高校强化学习考题及CCFCSP认证强化学习专项中抽取三道代表性试题,按难度阶梯排列。第一题为MDP建模与值迭代计算,要求学生手工迭代至收敛。教师展示评分标准,强调步骤分的关键得分点。第二题为Q学习更新过程推导,给定初始Q表与一条交互序列,要求学生写出每一步更新后的Q值,并分析探索策略参数对收敛的影响。学生独立完成后组内互评,教师展示常见错误:将学习率遗忘、对下一状态最大动作值误判等。【高频考点】第三题为策略梯度证明题,给出简化环境,要求学生推导梯度表达式并解释为何加入基线不影响梯度期望。教师将证明过程拆分为三段填空式,逐步搭建脚手架,最终由学生独立完成完整证明。【难点】

14.综合项目微仿写

教师发布一个未曾谋面的新环境:货物调度MDP,状态为各仓库库存,动作为调拨数量,奖励为满足订单收益减运输成本。要求学生在40分钟内完成四项子任务:形式化MDP五元组、选择合适算法并阐述理由、写出核心更新伪代码、预测算法在稀疏奖励下的可能失败模式并给出改进方向。学生以个人为单位进行限时设计,教师巡回指导。此环节高度模拟开卷考试中设计题场景,同时锻炼工程落地前的推演能力。【非常重要】

15.知识盲区洗牌与互测

实施同伴教学法:每名学生将自己在复习过程中始终困惑的一个问题写在卡片上,小组内洗牌后随机抽取,当场作答。教师收集共性困惑,如策略梯度的对数技巧为何能转化概率梯度、目标网络更新频率的调参经验等,进行全班集中答疑。此环节不仅扫清盲点,更培养学生提出问题、界定问题的元认知能力。【基础】

四、复习策略指导与资源支架

(一)分层备考建议

针对基础薄弱学生,要求必须掌握MDP建模、贝尔曼方程默写、Q学习与SARSA伪代码辨析,并完成教材课后基础计算题,此为保底工程。针对学有余力者,推荐精读SpinningUp中PPO、SAC的代码实现,并尝试在GYM环境中复现并调试,同时鼓励阅读近年顶级会议中关于离线强化学习、多智能体强化学习的综述,形成对前沿热点的宏观感知。【重要】

(二)易错点汇编与警示

教师整理历届学生在期末考试中失分最集中的知识点。错误一:混淆状态值函数与状态动作值函数在贝尔曼方程中的右侧项。错误二:误认为Q学习是学习状态值函数。错误三:在策略梯度中混淆目标函数对策略参数求导与对值函数参数求导。错误四:将DQN中的经验回放等同于基于模型的强化学习。教师以警示案例形式印发,并附上诊断性自测小题。【高频考点】

(三)学科思想升华

强化学习的本质是试错学习与延迟奖励的数学化。复习收尾阶段,教师以苏格拉底式提问收束:若将整个人生视为一个MDP,状态是当前能力与资源,动作是每一次选择,奖励是阶段性成就感,折扣因子是你对未来收益的重视程度,那么你的策略是什么?是选择贪婪地即时享乐,还是长远规划但面临不确定性?学生沉默思考。教师点明:强化学习不仅是算法工具,更是决策哲学。最优策略并不总是最高累计奖励,还需纳入伦理约束与风险偏好。此环节超越应试,直指立德树人与工程伦理,是课程思政的自然渗透。

五、形成性评价与教学反馈机制

(一)课堂即时反馈系统

每一知识模块后嵌入微测,使用在线表单工具收集作答数据。教师重点分析错误选项分布,若超过三成学生落入同一干扰项,立即中断预设流程,对该误区进行针对性辨析。例如在Q学习更新公式测试中,若大量学生将学习率乘以当前Q值而非时序差分误差,教师需重新拆解更新律的物理含义,并以动量法类比。【重要】

(二)课后复习效能追踪

布置分层复习任务。必做任务包括绘制全章概念图谱并上传至课程论坛互评、完成题库中三十道分类习题。选做任务为参与Kaggle经典强化学习竞赛项目的复盘,撰写技术报告。教师从概念图谱的连通性、层级结构、跨模块连边数量三个维度进行质性评价,优秀作品在班级展示,形成示范辐射。

(三)教学反思与迭代方向

复习课后,教师根据学生概念图谱中普遍缺失的连边,识别出基于模型的强化学习在整个认知网络中的边缘化现象。在下轮教学中,计划提前引入世界模型与想象回放,在初期就与

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论