人工智能通识导论(理工类)第7章 习题及参考答案_第1页
人工智能通识导论(理工类)第7章 习题及参考答案_第2页
人工智能通识导论(理工类)第7章 习题及参考答案_第3页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

3-2-习题7及参考答案1.用自己的话解释强化学习与监督学习的核心区别。为什么强化学习比监督学习更接近人类从经验中学习的方式?参考答案:监督学习从人工标注好的数据集中学习输入到标准答案的映射,每个样本都有正确答案,学习时直接对照标准答案纠错。强化学习没有标准答案,智能体在与环境的交互中执行行动,只收到奖励这种事后反馈,需要在不断试错中弄清楚哪些行为能带来更大的长期累积奖励,并且当前行动还会影响之后遇到的状态,数据由智能体自己的行为产生。人类从经验中学习时,大多也没有人告知每一步的标准做法,而是先尝试,再根据结果的好坏调整后续行为,例如学骑车、学做菜都是如此。强化学习的“观察—选择—反馈—调整”循环正是这种学习方式,所以它比监督学习更接近人类从经验中学习的方式。2.强化学习的六个核心要素是什么?用本章迷宫的例子逐一说明每个要素对应的具体内容。参考答案:六个核心要素是智能体、策略、行动、环境、状态和奖励。在迷宫例子中,智能体是在迷宫中做出移动选择的角色;策略是它在每个格子决定向上、向下、向左还是向右的规则,起初可能很随机,随后根据反馈不断优化;行动是每一步实际执行的移动,所有可选的移动构成行动空间;环境是迷宫这个外部世界,包括格子、墙、宝藏、边界以及撞墙停在原地等规则;状态是角色当前所在的格子编号,全部可走的格子构成状态空间;奖励是环境给出的即时反馈,普通移动扣1分,撞墙扣1分,进入宝藏格加10分。智能体观察状态、按策略选择行动,环境返回新状态和奖励,如此循环,智能体逐步学会获得更高长期总分的走法。3.什么是马尔可夫性质?为什么这个性质对强化学习的建模至关重要?举一个不满足马尔可夫性质的例子,并说明问题出在哪里。参考答案:马尔可夫性质是指未来状态的条件概率只依赖当前状态和当前行动,而与更早的历史轨迹无关,即只要知道现在处于什么状态、采取什么行动,就足以预测下一步的状态分布。这个性质是马尔可夫决策过程成立的前提。有了它,状态转移才能只用当前状态和行动来描述,价值函数、贝尔曼方程等一整套建模与求解工具才有意义,问题复杂度被极大简化。如果状态不满足马尔可夫性质,仅凭当前状态无法判断未来会如何演化,智能体拿到的是一个信息不足的问题,学习效果会变差。例如迷宫增加一条规则,连续向右走两步就会触发陷阱回到起点。若只用当前所在格子作为状态,智能体在格子3选择向右时,无法判断下一步是到达格子4还是被弹回起点,因为结果还取决于此前是否已经向右走过一步,历史信息仍在影响未来。问题出在状态设计遗漏了“连续向右的步数”这一关键信息,把它补充进状态后马尔可夫性质才重新成立。4.在4×4迷宫中,设折扣因子γ=0.9,普通移动奖励为−1,进入宝藏G奖励为+10。智能体从起点S出发沿路线S→2→3→4→8→12→G共6步到达终点。计算这条路线的回报,写出展开步骤。参考答案:这条路线共6步,前5步为普通移动,奖励各为−1,最后一步进入宝藏G,奖励为+10。按回报的折扣累加定义展开:G=−1+0.9×(−1)+0.9²×(−1)+0.9³×(−1)+0.9⁴×(−1)+0.9⁵×(+10)=−1−0.9−0.81−0.729−0.6561+5.9049=1.8098≈1.81。5.Q学习的更新公式中,(r+γmaxQ(s′,a′)−Q(s,a))这一项衡量了什么?它为什么可以被理解为“这次体验与原来预期的差距”?参考答案:这一项是时序差分误差,衡量这次实际体验得到的结果与原有估计之间的差距。其中r+γmaxQ(s′,a′)是经历这一步后,用真实收到的即时奖励加上下一状态在最优行动下的价值估计构造出的新目标,代表现实给出的答案;Q(s,a)是更新前对当前状态和行动价值的原有估计,代表原来的预期。两者相减,若结果为正,说明这次体验比预期更好,Q值随之上调;若为负,说明比预期更差,Q值随之下调。学习率控制每次调整的幅度,使估计朝现实方向逐步修正,所以这一项正好刻画了“这次体验与原来预期的差距”。6.对比基于价值的方法和基于策略的方法各自的优缺点。策略梯度方法与Q学习在更新时机上有什么本质区别?参考答案:基于价值的方法先估计各状态和行动的价值,再据此选择价值最高的行动。它的优点是每一步交互后都能立即更新,学习信号比较稳定,更新规则简单直观;缺点是每个状态和行动组合的价值独立存储,难以处理连续动作空间,策略本身通常是确定性的,需要额外引入探索机制来平衡探索与利用。基于策略的方法直接学习决策规则,输出各行动被选中的概率分布。它的优点是天然支持随机性策略和连续动作,也更容易处理需要多样化选择的任务;缺点是回报的波动很大,直接用它更新会让训练不稳定,并且蒙特卡洛策略梯度必须等一轮结束后才能更新。在更新时机上,Q学习每执行一步,就可以利用这一步的即时奖励和下一状态的价值估计立即更新对应的价值;而蒙特卡洛策略梯度需要等一轮游戏完整结束、算出从各时刻到终点的完整回报后,才能回顾式地统一调整策略参数。7.DQN的两项关键做法,即经验回放和目标网络,分别解决了什么问题?如果没有这两项做法,训练过程可能会出现怎样的不稳定?参考答案:经验回放解决训练样本高度相关的问题。智能体连续交互产生的相邻记录在状态和奖励上强相关,直接按顺序训练会破坏神经网络对样本独立同分布的假设。把经验存入回放缓冲区并随机抽样训练,可以打破这种相关性,同时让每条经验被多次重复利用,提高数据利用效率。目标网络解决训练目标不断变化的问题。计算目标值时用到的下一状态价值估计同样来自网络本身,如果用实时更新的网络计算,目标会随着每次更新立即改变,相当于一边改答案一边改标准答案。目标网络使用一套更新较慢的参

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论