版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
研究生人工智能专业《深度强化学习》试题精析与应试策略教案
一、教学背景分析
(一)学科定位与课程属性
本教案面向研究生人工智能专业核心进阶课程《深度强化学习》,授课对象为硕士研究生一年级第二学期或博士研究生一年级选修及学位考备考群体。课程在学科体系中处于“智能决策理论”顶石位置,前驱知识涵盖概率图模型、凸优化、深度神经网络架构。本课时定位于“高阶试题解析与学术思维建模”,非基础扫盲课,旨在通过顶尖院校博士入学试题与资格考试真题的沉浸式拆解,帮助学生在理论严谨性、算法改进直觉、实验设计规范性三个维度实现从“使用者”到“创造者”的跃迁。
(二)学情精准画像
学生已完成《机器学习》《深度学习》《强化学习导论》等前置课程,能够熟练调用PyTorch/TensorFlow实现DQN、PPO等经典算法,但在面对开放式研究型试题时呈现三方面典型困境:第一,数学推导随意,符号系统混乱,例如混淆策略梯度定理中对数导数与简单梯度,忽略期望下标对无偏性的影响;第二,算法改进思路停留在“调参”而非“改架构”,对于过估计、非平稳性、样本效率等本质缺陷缺乏归因能力;第三,实验设计缺乏控制变量意识,回答“如何证明算法有效性”类问题时往往只描述最终结果,遗漏基线选取、消融实验、显著性检验等关键要素。上述痛点亦是研究生入学考试【高频考点】【难点】。
(三)试题资源库构成
舍弃市面通行的题库汇编,直接选用近五年清华大学、北京大学、中国科学院大学、卡内基梅隆大学、斯坦福大学人工智能方向博士生资格考试真题,以及DeepMind、OpenAI暑期学校选拔试题,共精选16道具有“理论拐点”价值的代表性题目。每道题均配置母题与三道变式,形成“一点多练”的认知锚定网络。
(四)学时分配进阶
本专题共计4学时,每学时55分钟。第一学时:基于值函数的深度Q网络系列——高估偏差与架构解耦;第二学时:策略梯度与信任域方法——无偏性与保守更新;第三学时:连续控制与最大熵——探索机理与自适应调节;第四学时:多智能体与基于模型——非平稳性与规划偏差。各学时均采用“真题呈现—归因诊断—多维拆解—变式迁移—策略固化”五阶闭环结构。
二、教学目标设计
(一)知识建构目标【基础】
1.精准复现十六个核心公式的完整推导链:贝尔曼最优方程、策略梯度定理、REINFORCE无偏性证明、广义优势估计GAEλ形式、重要性采样权重约束条件、SAC软贝尔曼方程、确定性策略梯度DPG链式法则、MADDPG集中式Critic梯度流、基于模型的集成不确定性度量。
2.系统梳理九大算法演进脉络:DQN→DoubleDQN→DuelingDQN→PER→Rainbow;PG→REINFORCE→AC→A3C→PPO;DDPG→TD3→SAC;Q-learning→CQL(离线)。
3.掌握五类实验设计模板:对比实验、消融实验、敏感性分析、泛化性测试、计算效率基准测试。
(二)能力发展目标【重要】
4.符号化推理能力:能够在一道25分推导题中,从头至尾使用统一符号体系(如∇θ,E
{s∼ρ^π},A^{π}),不跳过中间矩阵维度推导。
5.算法批判能力:给定一道算法改进型试题,能在5分钟内定位基线算法的根本缺陷(例如DDPG的Q值过估计、PPO在稀疏奖励下的熵坍塌),并给出至少两个非调参的架构级解决方案。
6.学术写作迁移能力:将试题答案中的“实验设计”部分直接转化为学术论文方法论章节的提纲,掌握“基线—干预—度量—统计”四要素。
(三)高阶思维目标【非常重要】
破除“强化学习是调参工程”的学科偏见,建立“理论驱动创新”的研究价值观。通过真题中原始论文推导手稿与试题答案的对比分析,让学生亲历Sutton、Silver、Levine等学者当年提出核心定理时的思维拐点,理解抽象数学工具(如压缩映射、对偶优化、测度论)如何转化为改变整个领域的算法突破。
三、教学重难点定位
(一)核心理论瓶颈【难点】【非常重要】
1.策略梯度定理中“对数导数技巧”为何能绕过对状态分布梯度的直接计算?该定理的证明中隐含了什么样的轨迹分布假设?此为几乎所有策略优化试题的理论基石。
2.确定性策略梯度DPG中,为何动作是状态的确定性函数时,策略梯度依然存在且形式与随机策略高度对称?链式法则在这里扮演的角色与重参数化技巧的异同辨析。
3.多智能体环境非平稳性的数学根源:从转移概率P(s'|s,a_1,...,a_n)对智能体i策略π_i的显式依赖性出发,证明在纳什均衡附近非平稳性问题并未消失,仅振荡幅度收敛。
(二)高频命题切口【高频考点】【热点】
4.过估计问题与DoubleDQN、AveragedDQN、MaxminDQN的数学联系。
5.重要性采样在off-policy评估中的三个致命缺陷:权重爆炸、有效样本量衰减、分布偏移不敏感。
6.PPO的clip机制与TRPO的KL散度约束在数学上的等价性近似条件。
7.SAC中温度系数α自适应的拉格朗日对偶推导。
8.离线强化学习中的分布外动作泛化危机与悲观估计(CQL)的惩罚项设计原理。
四、教学准备与资源
(一)智慧教学环境
教室内配备双屏交互系统:左屏投射教师白板实时笔迹(支持手写公式无限回滚),右屏运行RL-Zoo3预训练模型库,可实时可视化不同算法在经典环境中的价值函数地形图与策略熵曲线。学生终端预装JupyterLabServer,已配置包含PyTorch2.0、RayRLlib2.0及自定义试题解析模块的虚拟环境。
(二)认知脚手架
1.推导留白学案:每道真题的解析学案刻意留白关键推导步骤,仅给出起点与终点,逼迫学生填充中间变换逻辑。
2.错误库回溯系统:基于近三年本院研究生在同类试题中的典型错误,构建“红牌错误—黄牌疏漏—蓝牌细节”三级警示标签,随真题解析进程实时弹窗预警。
3.学术原典节选:复印并封装Sutton2018年《ReinforcementLearning:AnIntroduction》中对策略梯度定理的原始脚注、Silver2014年DPG论文中关于确定性梯度存在的测度论解释段落,作为课间传阅材料。
五、教学实施过程(核心环节,全文占比超85%)
(一)第一学时:值函数深度网络的认知重构——从DQN到Dueling架构
1.真题启动:清华大学2023年博士生入学试题第一题(15分)
【题目重述】考虑一个连续状态空间、离散动作空间的确定性环境。深度Q网络采用经验回放与目标网络机制。问题1:写出使用随机梯度下降更新Q网络参数的完整规则,并精确区分该更新与有监督学习反向传播在梯度计算图上的差异。问题2:若人为将环境奖励函数恒设置为零,且使用ε-贪婪策略,分析深度Q网络的Q值是否会发散,从贝尔曼方程不动点理论给出解释。【非常重要】【高频考点】
2.归因诊断(3分钟)
教师揭示命题意图:问题1考擦“TD误差梯度”与“分类任务交叉熵梯度”的本质差异——前者包含对下一时刻Q值的依赖,形成自举循环;后者是静态目标。学生常见错误是将max操作符直接对参数求导,忽略目标网络参数θ⁻的停止梯度属性。问题2考擦对压缩映射定理在函数逼近场景下失效条件的理解,多数学生直觉上认为r=0则Q必收敛至0,却忽视神经网络拟合能力过强与max操作在离散动作空间的偏置效应。
3.多维拆解(18分钟)
(1)梯度计算图精绘:教师在白板左侧绘制DQN损失函数L(θ)=E[(r+γmax_{a'}Q(s',a';θ⁻)-Q(s,a;θ))²]。使用红色粉笔勾勒出目标网络θ⁻构成的静态计算子图,并用蓝色箭头标示仅通过在线网络θ回传的梯度路径。逐项展开∂L/∂θ=E[(r+γmaxQ(s',a';θ⁻)-Q(s,a;θ))·(-∂Q(s,a;θ)/∂θ)]。特别强调:max函数在选择动作a'时依赖θ⁻,但该选择结果一旦确定,在梯度计算中被视为常数,不再对θ求导——此为学生推导中【重要】失分点。
(2)与监督学习对比:右屏同时显示ImageNet分类任务中交叉熵损失的梯度计算图。教师引导学生观察关键差异:监督学习的损失函数中,目标值y是数据集给定的常数标签;而强化学习中TDtarget本身是Q网络输出的函数(即使使用目标网络),形成“预测值依赖预测值”的循环,这是自举偏差的理论根源。
(3)零奖励发散性分析:从解析解切入——若Qˆ为真实值函数的神经网络近似,在r≡0时贝尔曼方程退化为Q=γP^πQ。教师板书不动点迭代格式Q_{k+1}=γT^πQ_k。当γ<1且T^π是收缩算子时,迭代收敛至Q=0。但引入神经网络函数逼近与max操作后,实际迭代式为Q_{k+1}=Π(γT^*Q_k),其中Π是投影到函数空间的操作。若Π是扩张映射(神经网络过参数化导致),则整个系统可能不再收缩,Q值出现发散振荡。此处教师引入“投影偏差”概念,并顺势引出DoubleDQN的设计动机。【难点】
4.变式迁移与即时演算(12分钟)
教师给出变式:将原题中的max操作替换为softmax,即使用Boltzmann策略的期望Sarsa形式。要求学生现场推导此时的TD更新规则,并分析在r=0条件下Q值的收敛性。学生个人演算,教师巡视。3分钟后随机抽取一名学生的平板投屏,发现该生错误地将softmax权重中的Q值也视为可导变量。教师立即介入,在投影上修正:Boltzmann策略的动作概率依赖于Q值,但若是在off-policy学习中使用行为策略采样,目标策略的softmax权重不应参与目标Q值的梯度计算——此处是【高频考点】“离策略学习中的梯度截断”雏形。
5.策略固化卡:第一学时核心思维杠杆(5分钟)
学生整理笔记,归纳三条元认知策略:
1.见到“Q网络参数更新推导”立即在脑中激活“目标网络参数θ⁻不计算梯度”警戒线。
2.见到“零奖励/稀疏奖励发散”立即定位“投影映射的非收缩性”与“max操作的高估偏置”。
3.见到“公式中带有max”立即思考是否可替换为log-sum-exp或平均算子以换取理论平滑性。
(二)第一学时后半段:双网络与优势分解——DoubleDueling架构精析
1.真题递进:北京大学2024年博士生资格考题(20分)
【题干】DoubleDQN被提出用以缓解过估计。问题1:请用数学表达式严格定义DoubleDQN的Q-target计算方式,并与原生DQN对比,证明在相同假设下DoubleDQN的期望估计值不大于原生DQN的期望估计值。问题2:DuelingDQN将Q值分解为V与A之和,并引入强制优势函数零均值的技巧。请设计一个简洁实验,证明该架构在面对“存在多个等价最优动作”的环境时,相比原生DQN具有更鲁棒的策略学习能力。【热点】【非常重要】
2.解构与重组(18分钟)
(1)DoubleDQN数学机理论证:教师板书DoubleDQN的TD目标Y_t^Double=r+γQ(s',argmax_{a}Q(s',a;θ_t);θ_t⁻)。与原生DQN的Y_t^DQN=r+γmax_{a}Q(s',a;θ_t⁻)对比,核心差异在于动作选择与动作评估的解耦。证明期望过估计量差值时,教师采用逐状态分析:对于任意状态s',设a*=argmaxQ(s',a;θ),则原生DQN使用Q(s',a;θ⁻),DoubleDQN使用Q(s',a
;θ⁻)但此时a由在线网络θ而非目标网络θ⁻选出。证明关键:由于在线网络θ在训练中会高估部分动作的价值,其选出的a
往往是过估计最严重的动作,但该动作在目标网络θ⁻中的对应值通常低于其在在线网络中的值,且低于或等于原生DQN中max_{a}Q(s',a;θ⁻)。教师使用标量示意图展示三个值的大小关系,不追求测度论严谨,但建立直觉。【重要】
(2)DuelingDQN架构精讲:教师绘制Dueling网络分流结构——特征提取卷积层后分两路,一路经全连接输出标量V(s),另一路输出|A|维向量A(s,a)。聚合层公式Q(s,a)=V(s)+(A(s,a)-mean_{a'}A(s,a'))。重点阐释强制零均值化的必要性:若不减均值,对于给定Q值,V和A存在无穷多种分解(恒等变换),导致网络训练不稳定。此强制操作相当于在优势函数空间施加零和约束,与经济学中效用函数的基数性质异曲同工,实现跨学科迁移。【基础】
(3)实验设计框架建模:教师给出实验报告“标准四段式”模板——环境选取:需包含视觉上相似但动作语义冗余的场景,推荐Atari游戏中的“拳击”或“冰球”,因存在多个等效方向可达到相同位移效果。评价指标:除累计奖励外,必须报告Q值的均值与最大值曲线,以展示Dueling架构是否抑制了Q值冗余振荡。对比基线:原生DQN与DoubleDQN形成2×2对比矩阵。消融条件:分别移除均值操作、替换为减去最大值等变体。此处强调“可复现性”细节:随机种子数、评估周期、帧堆叠等必须注明。【高频考点】
3.策略对抗辩论(10分钟)
设置命题:“在科研经费有限、算力紧张的背景下,优先尝试DoubleDQN还是DuelingDQN?”学生分左右阵营。左派(Double优先)指出:过估计是理论硬伤,必须先解决偏差才能谈方差。右派(Dueling优先)反驳:动作冗余是工程常态,且Dueling几乎不增加参数量,性价比更高。教师总结时引入帕累托最优概念:两者改进正交,Rainbow算法将二者与优先级回放等并行集成,引导学生在答题时使用“互补非互斥”的分析框架。
(三)第二学时:策略梯度圣杯——无偏性、方差与信任域
4.真题引爆:CMU2022年博士生资格考试原题(25分)
【题干】考虑策略梯度方法。问题1:从目标函数J(θ)=E_{τ∼π_θ}[R(τ)]出发,完整推导策略梯度定理,并指出证明中哪一步使用了“对数导数技巧”。问题2:写出REINFORCE算法的更新规则,并证明该更新是真实策略梯度的无偏估计。问题3:引入一个Critic网络估计状态价值V(s),推导基于优势函数A(s,a)=Q(s,a)-V(s)的Actor-Critic更新式,并详细分析Critic引入后,梯度估计的偏置与方差分别如何变化。【非常重要】【高频考点】【难点】
5.全程推演与无偏性证明(22分钟)
(1)策略梯度定理推导:教师从轨迹概率P_θ(τ)=μ(s_0)Ππ_θ(a_t|s_t)P(s_{t+1}|s_t,a_t)出发。推导至∇J(θ)=∫∇P_θ(τ)R(τ)dτ时,学生普遍卡在“对概率积分求导”环节。教师使用黑板大面积推演,关键步骤:∇P_θ(τ)=P_θ(τ)∇logP_θ(τ),其中logP_θ(τ)=logμ(s_0)+Σlogπ_θ(a_t|s_t)+ΣlogP(s_{t+1}|s_t,a_t)。因环境动态项与θ无关,导数仅保留Σ∇logπ_θ(a_t|s_t)。最终得∇J(θ)=E[Σ∇logπ_θ(a_t|s_t)·R(τ)]。此处教师用红圈标记“对数导数技巧”,即∇P/P=∇logP,将梯度计算从对概率直接求导转化为对对数概率的期望。【基础】
(2)REINFORCE无偏性证明:教师将累积回报R(τ)拆解为各时刻G_t。证明核心:E[∇logπ_θ(a_t|s_t)G_t]=E[∇logπ_θ(a_t|s_t)Q_π(s_t,a_t)]。关键论点:G_t是Q_π(s_t,a_t)的蒙特卡洛样本,期望相等,故无偏。但教师立即指出代价:G_t的方差极大,因为单一轨迹回报受随机性影响剧烈。此环节播放预录制的CartPole训练动画,对比REINFORCE与带基线的REINFORCE-with-baseline的累计奖励曲线,肉眼可见前者剧烈振荡。【重要】
(3)Actor-Critic偏置-方差权衡:引入Critic估计V̂(s)后,优势函数Â=r+γV̂(s')-V̂(s)。若V̂(s)≠V_π(s),则E[Â]≠A_π,梯度估计产生偏置。教师推导偏置项Δ=E[(Q_π-V_π)-(r+γV̂(s')-V̂(s))]=E[γ(V_π(s')-V̂(s'))-(V_π(s)-V̂(s))]。该式显示偏置源于价值估计误差的时间差分。但Critic聚合了历史数据,方差远低于蒙特卡洛回报。教师在坐标系中画出偏置与方差随函数逼近能力变化的U型曲线,标注“无免费午餐”定理。【难点】
6.角色扮演学术辩论(10分钟)
将全班分为五组,每组扮演一个学术会议审稿人角色,针对一份虚拟投稿中声称“我们使用简单单步TD误差作为优势,在连续控制任务上取得超越GAE的效果”进行质疑。各组依次提出尖锐问题:是否与控制环境步长有关?是否测试过稀疏奖励场景?是否比较过收敛速度?教师汇总所有质疑,形成一份“审稿意见结构化模板”,直接内化为学生应答试题中“方法局限性分析”的语料库。
7.笔头固化:GAEλ公式闭卷默写与解构(8分钟)
教师要求学生不借助任何资料,写出广义优势估计Â_t=Σ_{l=0}^∞(γλ)^lδ_{t+l},其中δ_t=r_t+γV(s_{t+1})-V(s_t)。默写后随机抽取三名学生投影展示,发现常见错误:将λ乘在γ上写为(γλ)^l,误为γ(λ^l);δ_t下标错误。教师强化记忆:λ是方差缩减系数,λ=0时Â_t=δ_t(高偏置低方差),λ=1时Â_t=Σγ^lδ_{t+l}=G_t-V(s_t)(无偏置高方差)。此公式为【高频考点】,近三年五校试题累计出现11次。
(四)第二学时后半段:PPO与稳健策略优化
8.真题呈现:上海交通大学2023年研究生期末考试压轴题(20分)
【题干】近端策略优化PPO算法通过截断替代目标函数实现保守策略更新。问题1:请写出PPO的完整目标函数,并重点解释其中min操作与clip函数如何协同防止策略更新幅度过大。问题2:超参数ε(clip范围)通常取0.1或0.2。请理论分析若ε取0.5或0.01时,训练过程可能分别出现什么问题。【热点】【非常重要】
9.机理可视化拆解(18分钟)
(1)重要性采样比率分布演示:教师右屏运行一个简易2D环境,实时展示策略更新时r_t(θ)=π_θ(a|s)/π_{θ_old}(a|s)的概率密度演化。当策略渐变时,r_t集中在1附近;激进更新时,r_t出现极大值(>2)或极小值(<0.5)。教师将PPO目标函数L^{CLIP}(θ)=E[min(r_t(θ)Â_t,clip(r_t(θ),1-ε,1+ε)Â_t)]投影至该分布图下方。用动画演示当Â_t>0时,若r_t>1+ε,则目标函数被截断为(1+ε)Â_t,阻止了过度激进地增加该动作概率;若Â_t<0且r_t<1-ε,截断为(1-ε)Â_t,阻止了过度激进地降低概率。学生直观感受到“限速带”效应。【重要】
(2)从TRPO到PPO的简化脉络:教师回顾TRPO的KL散度约束maximizeE[r_t(θ)Â_t]subjecttoE[KL(π_old||π)]≤δ。将约束拉格朗日化后,PPO的clip操作可视为对每个状态-动作对施加独立且自适应的硬边界,是全局KL约束的局部近似。教师板书泰勒展开:当r_t=1+δ时,忽略高阶项,clip等价于将策略比限制在指数屏障内。【难点】
(3)ε敏感性深度分析:教师展示预训练的HalfCheetah-v4学习曲线。ε=0.01时回报曲线平稳但爬升极慢,100万步未收敛;ε=0.2时经典快速上升;ε=0.5时初期爬升更快,但约50万步后出现剧烈振荡,甚至崩溃。教师引导学生从“更新步长”与“信任区域”视角解释:ε过大使得信任区域名存实亡,每次更新迈大步,积累误差易导致策略坍塌。【高频考点】
10.伪代码重构竞赛(12分钟)
学生限时12分钟手写PPO完整伪代码,要求必须包含:优势估计、mini-batch轮数、clip判断、策略损失与价值损失加权、总损失函数。教师巡堂发现共性问题:多数学生遗漏了重要性采样比率中分母π_old的stopgradient处理;部分学生在价值损失中仍使用TD误差而非GAE。评选出三份优秀作品,投影并由作者阐述设计思路,其他学生对照修正。
(五)第三学时:连续控制与最大熵强化学习——从DDPG到SAC
11.真题挑战:浙江大学2024年博士入学试题(25分)
【题干】软演员-评论家SAC算法将策略熵纳入优化目标。问题1:阐述最大化期望回报之外同时最大化策略熵的数学动机与工程收益。问题2:推导SAC中温度系数α的自适应更新公式,并解释其如何与目标熵H_bar联动。【热点】【非常重要】【难点】
12.理论根源刨析(22分钟)
(1)熵的正则化视角:教师从统计力学中玻尔兹曼分布引出,最大熵原则下,给定期望约束时最可能的状态分布是指数族。在强化学习中,引入熵正则项使策略在累积回报相近的动作间尽可能均匀,保留探索活力。板书软贝尔曼方程:Q(s,a)=r+γE_{s'}[V(s')],其中V(s)=E_{a∼π}[Q(s,a)-αlogπ(a|s)]。该方程将熵直接嵌入值函数。【基础】
(2)软策略迭代收敛性直观解释:教师类比Q学习中的贝尔曼算子收缩性,指出软贝尔曼算子也是γ-收缩的,证明需要用到熵的正则项使值函数有界,超出研究生试题要求,但结论必须记忆——软策略迭代收敛至最优最大熵策略。【重要】
(3)自适应α推导(核心攻坚):教师将带熵约束的强化学习建模为约束优化问题:maxπE[Σr]s.t.E[-logπ(a|s)]≥H_barperstate。拉格朗日函数L=J(π)+α(E[-logπ]-H_bar)。通过对偶变量α的梯度上升求解。板书α损失函数:J(α)=E_{a∼π}[-αlogπ(a|s)-αH_bar]。梯度∇α=E[-logπ(a|s)]-H_bar。此处教师反复强调:α是可学习参数,在SAC中与策略网络交替更新。并指出该自适应机制使算法无需人工调温,极大提升鲁棒性。【非常重要】
13.案例对抗推演(15分钟)
教师给出两个工业级场景:高精度机器人装配(接触力控制,误差容忍度极低)与开放式探索游戏(稀疏奖励,需广泛试探)。要求学生分组讨论应优先采用DDPG/TD3还是SAC,并列出决策树。最终各组共识:装配任务需稳定且低方差,TD3的平滑正则可能优于SAC的熵探索;而稀疏奖励场景SAC因主动熵探索占据绝对优势。此环节训练学生在试题中回答“算法选型依据”时的结构化表达能力。【高频考点】
14.即时测验与错题收割(8分钟)
投影简答题:“若将SAC应用于离散动作空间,其软贝尔曼方程中logπ(a|s)部分应如何修改?策略输出层应做何种调整?”学生现场作答,教师发现约40%学生误以为需将高斯分布直接替换为分类分布,却忽略连续空间概率密度与离散空间概率质量在量纲上的差异,导致软状态价值V(s)的期望计算方式错误。教师当即补充离散SAC的标准做法:策略输出softmax概率,Q值对离散动作取期望时使用求和而非积分。
(六)第三学时后半段:多智能体系统——非平稳性破局
15.真题攻坚:南京大学2023年研究生人工智能竞赛理论题(20分)
【题干】在多智能体强化学习中,非平稳性问题是核心挑战。问题1:请从环境转移概率角度严格定义非平稳性,并解释为何独立Q学习在该场景下通常失效。问题2:MADDPG算法如何通过中心化训练去中心化执行范式缓解非平稳性?请给出该算法中Critic与Actor网络输入输出维度的详细设计。【难点】【热点】
16.非平稳性根源解构(15分钟)
(1)数学定义:教师定义智能体i视角下的环境动力学P_i(s'|s,a_i,π_{-i})=Σ_{a_{-i}}P(s'|s,a_i,a_{-i})Π_{j≠i}π_j(a_j|o_j)。由于π_{-i}随训练不断变化,P_i是非平稳的。板书对比单智能体MDP中P(s'|s,a)是时不变函数。篮球战术类比:对手防守策略由盯人变为联防,等同于环境规则改变。【非常重要】
(2)独立Q学习失效机制:若每个智能体独立执行Q学习,将其他智能体视为环境一部分,则其Q函数估计的目标是随时间变化的值,经验回放池中的旧经验不再符合当前转移分布,导致严重的灾难性干扰。【基础】
17.MADDPG范式精析(18分钟)
(1)架构可视化:教师绘制集中式Critic输入层——拼接全局状态S(若不可观则拼接所有智能体观测)与所有智能体动作A_1...A_n,输出联合Q值Q_tot。每个Actor仅基于局部观测O_i输出动作A_i。梯度通过Critic回传至Actor:∇{θ_i}J=E[∇
{θ_i}π_i(a_i|o_i)∇_{a_i}Q_tot(s,a_1,...,a_n)]。强调此梯度计算要求Q_tot对a_i可微,因此动作必须连续或使用Gumbel-Softmax。【重要】
(2)维度设计硬核推导:假设观测维度|O|,动作维度|A|,智能体数量n。Critic输入维度为n|O|+n
|A|(若使用全局状态则为|S|+n*|A|)。输出为标量。测试时Critic被抛弃,各Actor独立运行。教师特别辨析:MADDPG并未解决非平稳性,而是通过中心化Critic在训练时看到全局及他人动作,使梯度信号相对平稳;但多智能体环境本质仍是博弈,不存在完全平稳化的可能。【高频考点】
18.前沿窗口:价值分解与QMIX(7分钟)
教师简述VDN将联合Q值加性分解Q_tot=ΣQ_i(o_i,a_i),QMIX利用超网络生成权重将Q_i非线性单调组合。指出这是当前多智能体协作任务的主流基线,并布置课后研究型作业:对比MADDPG与QMIX在“物流机器人协作”与“双人对抗”两类任务中的适用边界。
(七)第四学时:基于模型与逆向强化学习——前沿试题视野
19.真题启示:北京大学2024年“通用人工智能”交叉学科试题(20分)
【题干】基于模型的强化学习中,环境动力学模型的不准确性会导致规划偏差,使策略在真实环境中表现劣化。请提出两种缓解该偏差的算法级方法,并从理论上分析各自的有效性边界与限制。【热点】【难点】
20.偏差缓解策略全景构建(20分钟)
(1)集成模型不确定性估计:训练K个动力学模型{f_φ^k},集成输出均值与方差。规划时使用悲观准则,对高方差区域施以惩罚。教师推导:若真实动力学位于集成模型span内,且集成多样性充足,模型偏差的期望可降低至1/K。引用LQR背景下的后验采样思想。【重要】
(2)模型预测控制与截短:不使用模型进行全轨迹开环优化,而是每步执行MPC,仅用模型展开短视距(如H=5步),执行第一步动作,然后与真实环境交互重置。教师绘制MPC流程图,对比开环规划(误差随轨迹长度平方累积)与闭环重置(误差仅限单步)的本质差异。【高频考点】
(3)对抗鲁棒规划:将环境模型视作对抗者,求解最小最大博弈max_πmin_φE[R]。引出RARL算法,并指出该视角下模型偏差被建模为有界扰动,与鲁棒控制理论连通,是跨学科高阶思维。【难点】
21.逆向强化学习真题突击(15分钟)
【题干】专家轨迹集D={τ_i}已知。请写出最大边际规划MMP与最大熵逆向强化学习在目标函数上的核心差异,并解释为何最大熵方法通常学得更优奖励函数。【高频考点】
教师引导:MMP试图找到奖励权重使专家策略的Q值至少比其他策略高出边际,是硬边界约束;最大熵通过最大化轨迹分布熵在满足特征期望约束下选择最不偏倚的奖励分布,其优化目标为maxRΣlogP(τ)-λ||R||^2,对应对偶形式为最大化熵。类比GAN:判别器区分专家与生成轨迹,生成器逼近专家分布。【非常重要】
22.命题预测与押题(12分钟)
基于近五年试题热力变迁图,教师给出本年度三大潜在命题方向:
1.离线强化学习中的分布外动作泛化危机,CQL的正则项设计与理论动机。
2.图神经网络在多智能体通信协议学习中的角色,G2ANet与通信信道离散化。
3.大语言模型作为奖励模型,从自然语言指令中抽取偏好并拟合为奖励函数。
学生记录并领取三篇指定前沿文献摘要。
(八)第四学时后半段:应试策略全局凝练与仿真演练
1.解题元认知策略精讲(18分钟)
(1)审题三步解剖法:步骤一,圈定环境特征词(离散/连续/单智能体/多智能体/完全可观/部分可观),步骤二,定位算法家族词(DQN/PPO/SAC/MADDPG),步骤三,捕捉理论缺陷词(过估计/样本效率/非平稳
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 电商平台客户服务与技术支持培训手册
- 统编版六年级语文上册第18课《三黑和土地》学习任务单
- 电视台新闻采访与编辑岗位工作绩效考评表
- 小学主题班会课件--发现生活之美感悟艺术魅力
- 公共安全紧急响应预案手册
- 化妆品研发师产品创新及研发效率KPI考核表
- 新零售行业线上线下融合营销模式创新方案
- 小学主题班会课件:责任担当行为规范
- 电视台新闻记者组负责人绩效衡量表
- 零售业新零售模式创新与实施策略
- 中能回旋加速器生产医用放射性同位素项目(重新报批)环境影响报告书
- 国家电网公司施工项目部标准化管理手册
- 风电吊装安全培训课件
- 小升初语文试卷及答案人教版2025年
- 精神科伴糖尿病的护理
- 食品厂消防安全培训知识课件
- 2025云南地质工程勘察设计研究院有限公司招聘12人考试参考题库附答案解析
- 辅导员调动工作申请书范文
- 新高三家长动员会课件
- 房主同意办电增容协议书
- T/CCT 013-2023兰炭生产业二氧化碳排放核算技术规范
评论
0/150
提交评论