2026年秋江苏开放大学强化学习060733形考作业1-3答案_第1页
2026年秋江苏开放大学强化学习060733形考作业1-3答案_第2页
2026年秋江苏开放大学强化学习060733形考作业1-3答案_第3页
2026年秋江苏开放大学强化学习060733形考作业1-3答案_第4页
2026年秋江苏开放大学强化学习060733形考作业1-3答案_第5页
已阅读5页,还剩14页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年秋江苏开放大学强化学习060733形考作业1答案单选题题型:单选题客观题分值5分难度:简单得分:51、强化学习智能体的组成成分()。A、只有策略和模型B、只有策略和价值函数C、可能有策略、价值函数、模型中的一个或多个成分D、都包含策略、价值函数和模型学生答案:C题型:单选题客观题分值5分难度:简单得分:52、在最优控制理论中,贝尔曼方程的作用是什么?A、预测环境的变化趋势B、确定初始状态的策略C、描述动态规划中递归地求解最优值函数的方法D、计算每个状态的即时奖励学生答案:C题型:单选题客观题分值5分难度:简单得分:53、下列选项关于⻢尔可夫过程与MDP的对⽐说法错误的是()A、⻢尔可夫过程反映的是客观规律,MDP反映的是具体问题B、⻢尔可夫过程体现宏观性质,MDP体现主观操作C、⼯程中很多实际问题适合被定义为⻢尔可夫过程⽽⾮MDPD、MDP关注的是如何对⼀个具体的问题采取措施,使得获得的效果最好学生答案:C题型:单选题客观题分值5分难度:简单得分:54、以下对有模型强化学习和免模型强化学习说法正确的是()A、免模型强化学习是指对环境只进行虚拟环境建模并与虚拟环境交互来学习到最优策略。B、目前,大部分深度强化学习方法都采用了有模型强化学习。C、针对是否需要对真实环境建模,强化学习可以分为有模型强化学习和免模型强化学习。D、有模型强化学习不需要进行真实环境建模,用数据驱动学习。学生答案:C题型:单选题客观题分值5分难度:一般得分:55、下列关于动态规划思想的说法中,不正确的⼀项是()A、动态规划要将⼤的问题拆分成若⼲个⽐较⼩的问题,分别求解这些⼩问题,再⽤这些⼩问题的结果来解决⼤问题B、三连棋游戏不同的状态虽然很多,但是状态的转移其实是有⽅向性的C、动态规划将问题在时间维度上进⾏拆分,称为时间差分,即利⽤下⼀时刻状态的价值计算当前时刻状态的价值,直到计算出所有状态的价值D、对于三连棋游戏,可以按照从前往后的顺序依次找出各种状态的价值学生答案:D题型:单选题客观题分值5分难度:简单得分:56、在多臂老虎机问题中,采用ε-贪心策略时,概率ε通常表示什么?A、随机探索其他动作的概率B、选择当前估计价值最高动作的概率C、获得最大奖励的概率D、更新动作价值的学习率学生答案:A题型:单选题客观题分值5分难度:简单得分:57、马尔可夫性质强调,系统下一时刻的状态主要取决于什么?A、从初始时刻开始的全部历史状态B、智能体过去获得的全部奖励C、所有可能采取的动作D、当前状态学生答案:D题型:单选题客观题分值5分难度:简单得分:58、强化学习中的策略的含义是()A、策略把输入的状态变为价值。B、策略是智能体的动作模型,它决定了智能体的动作。C、我们不能把策略看做是一个函数。D、策略只有随机的形式。学生答案:B题型:单选题客观题分值5分难度:中等得分:59、在三连棋游戏中,位于状态s0,采⽤策略,然后有1/3的概率会达到获胜的状态,有2/3的概率到达中间状态s1;之后这个中间状态在该策略下会有3/4的概率到达获胜的状态,1/4的概率到达平局的状态,若获胜的价值为1,平局价值为0,则该策略下状态s0的价值image.png为()A、5/6B、1/2C、1/3D、2/3学生答案:A题型:单选题客观题分值5分难度:简单得分:510、下列关于epsilon-greedy策略的说法正确的是()A、每次游戏中产⽣服从0到1之间均匀分布的随机数B、每次游戏中产⽣服从0到10之间正态分布的随机数C、每次游戏中产⽣服从0到10之间均匀分布的随机数D、每次游戏中产⽣服从0到1之间正态分布的随机数学生答案:A题型:单选题客观题分值5分难度:简单得分:511、关于多臂⽼⻁机问题的描述,下列说法错误的是()A、⽬标是在有限的摇动次数中获得更多的硬币奖励B、每个摇臂的中奖概率不完全相同C、多臂⽼⻁机问题可以转化为⼀个⾮退化的MDP问题D、每个摇臂的中奖概率是未知的学生答案:C题型:单选题客观题分值5分难度:简单得分:512、对于强化学习中模型的理解是()。A、模型中的奖励函数是指我们在当前状态采取了某个动作,可以得到多大的奖励。B、马尔可夫决策过程中可以有模型,也可以没有模型。C、模型决定了下一步要采取的动作。D、它由状态、动作、状态转移概率和奖励函数几个部分组成。学生答案:A题型:单选题客观题分值5分难度:简单得分:513、价值函数可以这样理解()。A、价值函数的值是对当下及时奖励评价。B、有一种价值函数:Q函数。Q函数里面包含两个变量:状态和动作。C、价值函数就是评估动作好坏的函数。学生答案:B多选题题型:多选题客观题分值5分难度:简单得分:51、在最优控制中,动态规划算法的应用前提包括:A、可以处理无限状态空间B、奖励函数明确C、环境模型已知D、无需环境反馈E、状态空间有限且离散学生答案:B;C;E题型:多选题客观题分值5分难度:简单得分:52、马尔可夫决策过程通常包含哪些基本要素?A、奖励函数B、动作集合C、监督学习标签D、状态转移概率E、状态集合学生答案:A;B;D;E题型:多选题客观题分值5分难度:简单得分:53、基于策略和基于价值的强化学习方法的区别有()A、基于价值迭代的方法只能应用在不连续的、离散的环境下(如围棋或某些游戏领域)。B、在基于价值的强化学习方法中,智能体不需要制定显式的策略,它维护一个价值表格或价值函数,并通过这个价值表格或价值函数来选取价值最大的动作。C、基于价值的强化学习算法有Q学习(Q-learning)、Sarsa等,而基于策略的强化学习算法有策略梯度算法等。D、在基于策略的强化学习方法中,智能体会制定一套动作策略(确定在给定状态下需要采取何种动作),并根据这个策略进行操作。学生答案:A;B;C;D题型:多选题客观题分值5分难度:简单得分:54、在多臂老虎机问题中,探索与利用的权衡可以通过哪些策略实现?A、ThompsonSamplingB、Q-learningC、UpperConfidenceBound(UCB)D、ε-greedyE、Sarsa学生答案:A;C;D题型:多选题客观题分值5分难度:简单得分:55、关于探索(Exploration)与利用(Exploitation),下列说法正确的有:A、利用是选择当前估计价值较高的动作B、探索是尝试当前了解较少的动作C、探索与利用之间不需要进行权衡D、只进行利用可能错过潜在的更优动作E、只进行探索通常难以充分利用已有经验学生答案:A;B;D;E简答题题型:简答题主观题分值10分难度:简单得分:101、什么是多臂老虎机问题?为什么在解决该问题时需要平衡探索与利用?答案:多臂老虎机问题的定义多臂老虎机(Multi-ArmedBandit,MAB)是强化学习领域的经典基础决策模型,其核心场景为:智能体面前存在N个独立的“臂”(对应N个可选择的动作选项),每个臂被触发后会返回服从未知独立概率分布的随机奖励,智能体拥有有限次尝试机会,最终目标是最大化长期累计总奖励,等价于最小化“遗憾值”(即理论最优臂的总潜在奖励与实际获得总奖励的差值)。该问题是单步决策的简化强化学习场景,无需考虑复杂的环境状态转移,核心聚焦于动作价值的评估与选择策略优化,广泛应用于推荐系统冷启动、广告投放策略优化、在线A/B测试、云计算资源分配等实际场景。必须平衡探索与利用的核心原因探索指尝试当前估计奖励不高的其他臂,收集更多样本以摸清其真实奖励分布;利用指直接选择当前已观测到的平均奖励最高的臂,直接兑现已知的最优收益,二者存在天然的资源竞争关系,必须动态平衡:过度利用的弊端‌:如果完全只选择当前观测到的最优臂,会彻底放弃对其他臂的尝试,永远无法发现那些真实期望奖励更高、但前期运气差导致样本平均奖励偏低的潜在最优选项,长期会持续错过更高收益的机会,最终累计奖励远低于理论最大值。过度探索的弊端‌:如果无节制地频繁尝试所有臂,大量有限的尝试次数会被浪费在低奖励的劣质选项上,直接拉低当前阶段的累计收益,即使最终摸清了所有臂的真实价值,也已经消耗了绝大多数尝试机会,无法兑现最优收益。动态优化的本质需求‌:二者的平衡是多臂老虎机问题的核心挑战,只有通过合理分配探索和利用的比例,才能在“摸清未知选项真实价值”和“兑现已知最优收益”之间找到最优解,实现长期累计奖励的最大化,将算法的长期遗憾值控制在对数级的低水平。

2026年秋江苏开放大学强化学习060733形考作业2答案单选题题型:单选题客观题分值5分难度:简单得分:51、Bellman方程在计算Q(s,a)时,折扣因子γ的作用是什么?A它决定了未来奖励的重要性B它用来衡量当前奖励的重要性C它是奖励的直接来源D它只影响状态的转换学生答案:A题型:单选题客观题分值5分难度:一般得分:52下列关于状态价值V(s)的表达式正确的是()注:下列选项中表示策略,

表示折扣因⼦,

表示t时刻奖励,表示t时刻状态,

表示t时刻动作。ABCD学生答案:D题型:单选题客观题分值5分难度:简单得分:53在三连棋游戏中,如果玩家的第⼀步棋选择⾛中间,那么下列分析错误的是()A电脑下⼀步选择⻆或边的概率各为1/2。B若电脑选择边,则⼈类玩家有必胜策略。C若电脑选择⻆,则⼈类玩家的最佳动作是选择边,有的概率可以获胜。D可以获得的期望奖励为1*1/2+1*(1/2)*(2/3)=5/6。学生答案:C题型:单选题客观题分值5分难度:简单得分:54、Sarsa和Q-learning的主要区别是:A、Sarsa是基于策略的,而Q-learning是基于值的B、Q-learning是基于策略的,而Sarsa是基于值的C、Sarsa更新时采用当前策略的动作,而Q-learning采用最优动作D、Sarsa通过回放来更新Q值,而Q-learning不使用回放学生答案:C题型:单选题客观题分值5分难度:简单得分:55、DQN使用经验回放机制的主要目的是()。A增大智能体的动作空间B保存所有神经网络参数C降低连续样本之间的相关性,提高训练稳定性D保证每次都选择最优动作学生答案:C题型:单选题客观题分值5分难度:简单得分:56、Q-learning算法中,Q函数是A状态-动作值函数B状态函数C估值函数D奖励函数学生答案:A题型:单选题客观题分值5分难度:简单得分:57、Q表格中Q函数的意义是()A在强化学习里面,我们可以每走一步更新一次Q表格,用下一个状态的Q值来更新当前状态的Q值。B、Q表格,一般它的行数是所有动作的数量。C、最开始的时候,Q表格会全部初始化任意值。学生答案:A题型:单选题客观题分值5分难度:简单得分:58、Q表格的概念中,()A表格中每一个坐标点对应某时刻智能体的状态B以每执行若干步,就对Q表格进行更新C与时间差分法毫无关系D其表示形式是表格,其中表格的横轴为动作(智能体的动作),纵轴为环境的状态。学生答案:D题型:单选题客观题分值5分难度:简单得分:59、Sarsa算法名称中的五个字母分别对应()。A状态、动作、奖励、状态、动作B状态、奖励、动作、状态、奖励C策略、动作、奖励、策略、动作D状态、动作、回报、状态、价值学生答案:A题型:单选题客观题分值5分难度:简单得分:510动态规划的核心思想是什么?A通过分治将问题拆分为更小的子问题B通过试探和回溯来探索所有可能的解决方案C将问题拆解为子问题并通过存储子问题的解来避免重复计算D通过贪心选择每次局部最优解来得到全局最优解学生答案:C题型:单选题客观题分值5分难度:简单得分:511蒙特卡洛方法()A蒙特卡洛方法需要马尔可夫决策过程的状态转移函数和奖励函数。B蒙特卡洛方法需要更新多条轨迹的状态。C适用于环境未知的情况。D蒙特卡洛方法与动态规划是一个概念。学生答案:C题型:单选题客观题分值5分难度:简单得分:512在蒙特卡洛方法中,估计一个问题的期望值通常依赖于:A通过穷举所有可能的情况来计算期望B随机生成多个样本,并计算它们的平均值C通过公式直接计算期望D使用动态规划来避免重复计算学生答案:B多选题题型:多选题客观题分值5分难度:简单得分:51在强化学习中,以下哪些因素会影响状态-动作价值函数Q(s,a)的计算?A当前状态s和动作aB状态转移概率C即时奖励R(s,a)D折扣因子γE未来状态s’及其对应的动作a’的价值学生答案:A;B;C;D;E题型:多选题客观题分值5分难度:简单得分:52下列哪些是常见的用于强化学习实验的环境和框架?A、OpenAIGymB、TensorFlowC、PyTorchD、Scikit-learnE、UnityML-AgentsF、PandasG、Keras学生答案:A;B;C;E题型:多选题客观题分值5分难度:一般得分:53策略迭代法的核⼼步骤包括哪两个部分()A策略评估B状态价值计算C策略提升D使⽤贪心策略学生答案:A;C题型:多选题客观题分值5分难度:简单得分:54对于Gym实验环境库,使用()指令可以加载环境,使用()可以初始化环境,使用()可以执行一步环境。A、env.close()B、env=gym.make(环境名)C、env.reset()D、env.step(动作)E、env.render()学生答案:B;C;D简答题题型:简答题主观题分值10分难度:简单得分:101简述DQN的基本原理,并说明Gym环境在强化学习实验中的作用。答案:题型:简答题主观题分值10分难度:简单得分:92请描述REINFORCE算法的计算过程。答案:

2026年秋江苏开放大学强化学习060733形考作业3答案单选题题型:单选题客观题分值5分难度:简单得分:51、确定性策略梯度算法(DPG)的核心思想是什么?A、通过最大化当前状态的Q值来选择最优动作B、通过最小化策略的损失函数来更新策略C、直接通过策略梯度优化确定性策略的参数D、通过生成随机动作来更新策略学生答案:C题型:单选题客观题分值5分难度:简单得分:52、以下说法是否正确:为了保证强化学习的训练效果,需要打破训练样本数据之间的相关性。A、正确B、错误学生答案:A题型:单选题客观题分值5分难度:简单得分:53、DQN中用到的技巧有()。A、目标网络、利用、经验回放B、目标网络、探索、经验回放C、Q网络、利用、经验回放D、V网络、探索、经验回放学生答案:B题型:单选题客观题分值5分难度:简单得分:54、DDPG算法是()算法和()算法的结合。A、DPGACB、DPACC、SarsaQ-learningD、ACQ-learning学生答案:A题型:单选题客观题分值5分难度:简单得分:55、以下说法是否正确:强化学习的数据存在马尔可夫性,满足训练神经网络需样本独立同分布的假设前提。A、正确B、错误学生答案:B题型:单选题客观题分值5分难度:简单得分:56、REINFORCE算法的主要缺点是:A、它依赖于即时奖励来更新策略B、它是基于值的方法,而不是基于策略的方法C、它具有高方差,训练过程中可能不稳定D、它不能处理连续的动作空间学生答案:C题型:单选题客观题分值5分难度:简单得分:57、基于策略的方法(Policy-basedMethods)与值函数方法(Value-basedMethods)最主要的区别是:A、基于策略的方法直接优化策略,而值函数方法通过估计状态或状态-动作值来间接优化策略B、基于策略的方法依赖于奖励函数,而值函数方法不依赖于奖励函数C、基于策略的方法只在离散空间中有效,而值函数方法在连续空间中有效D、基于策略的方法只能应用于强化学习中,而值函数方法可以应用于监督学习学生答案:A题型:单选题客观题分值5分难度:简单得分:58、在REINFORCE算法中,策略更新是如何进行的?A、通过贪心选择来更新策略B、通过最大化当前状态的价值函数来更新策略C、使用策略的梯度与回报的乘积来更新策略D、使用Q值来直接更新策略参数学生答案:C题型:单选题客观题分值5分难度:简单得分:59、Actor-Critic算法中的”Actor”和”Critic”各自的作用是什么?A、Actor负责选择动作,Critic负责计算价值函数并评估Actor的策略B、Actor负责计算奖励,Critic负责选择最佳动作C、Actor负责计算值函数,Critic负责选择动作D、Actor和Critic共同负责选择最优奖励学生答案:A题型:单选题客观题分值5分难度:简单得分:510、DDPG算法一共有()个神经网络。A、1B、2C、3D、4学生答案:D多选题题型:多选题客观题分值5分难度:简单得分:51、随机策略梯度方法具有以下缺点()。A、即使学到了随即策略,在每一步动作时,还需要对得到的最优策略概率分布进行采样,才能获得具体的动作值。频繁采样非常耗费计算力。B、每一步计算策略梯度都需要在整个动作空间进行积分,耗费计算力。C、最优策略是输出确定性动作。D、最优策略只有一个。学生答案:A;B题型:多选题客观题分值5分难度:简单得分:52、DQN中的评论员采用Q函数的话,它的两种写法是()。A、输入状态和动作,输出一个标量。B、输入状态和动作,输出多个值。C、输入一个状态,输出多个值。D、输入一个状态,输出一个标量。学生答案:A;C题型:多选题客观题分值5分难度:简单得分:53、DQN算法是基于()算法,结合了价值函数近似与神经网络技术,并采用目标网络和()等方法进行网络训练。A、深度学习的SarsaB、当前网络C、深度学习的Q-learningD、经验回放学生答案:C;D题型:多选题客观题分值5分难度:简单得分:54、DQN的经验回放会构建一个回放缓冲区,每个经验的形式包括以下内容:()。A、某个状态stB、在st采取的动作atC、得到的奖励rtD、下一步采取的动作at+1E、进入的下一状态st+1学生答案:A;B;C;E题型:多选题客观题分值5分难度:简单得分:55、DQN只能处理()、()的动作空间。A、低维B、高维C、离散D、连续学生答案:A;C简答题题型:简答题主观题分值10分难度:简单得分:101、简述Actor-Critic算法的原理及其如何平衡策略优化与价值估计。答案:核心原理Actor-Critic是强化学习中融合策略梯度与价值函数方法的经典双网络架构,核心由两个独立模块协同工作:Actor模块‌:是参数化的策略网络,输入环境状态,直接输出动作的概率分布,负责生成交互动作、执行策略梯度更新,持续优化动作选择策略。Critic模块‌:是价值估计网络,输入环境状态,输出该状态下的长期预期回报估值,通过时序差分(TD)方法学习价值函数,为Actor提供可靠的动作优劣评价信号。两者的协同逻辑为:Actor与环境交互生成状态-动作-奖励样本,Critic基于样本计算TD误差作为优势估计,Actor再基于该优势估计完成策略参数更新,无需等待完整轨迹结束即可实现在线迭代优化。平衡策略优化与价值估计的核心机制双时间尺度异步更新‌:设置Critic的学习率略高于Actor,让价值估计网络先快速收敛到稳定的估值水平,再驱动Actor进行小步长的策略优化,避免价值估计未收敛时策略更新方向混乱,实现两者的迭代节奏匹配。优势函数作为中间桥梁‌:通过优势函数A(s,a)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论