2026年深度学习期末试题及答案_第1页
2026年深度学习期末试题及答案_第2页
2026年深度学习期末试题及答案_第3页
2026年深度学习期末试题及答案_第4页
2026年深度学习期末试题及答案_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026年深度学习期末试题及答案一、单项选择题(本大题共15小题,每小题2分,共30分。在每小题给出的四个选项中,只有一项是符合题目要求的)1.在感知机模型中,如果输入空间是二维的,且决策边界为++A.一个点B.一条直线C.一个平面D.一条曲线2.下列关于激活函数的叙述中,错误的是?A.ReLU激活函数可以有效缓解梯度消失问题B.Sigmoid函数的输出范围在(0,1)之间C.Tanh函数的输出范围在(0,1)之间D.LeakyReLU在输入为负数时有一个非零的梯度3.在深度学习的优化算法中,动量法的主要作用是?A.加速在相关方向上的收敛并抑制震荡B.增加学习率C.减少内存消耗D.防止过拟合4.对于卷积神经网络(CNN),假设输入图像大小为32×32,卷积核大小为A.32B.30C.29D.285.下列哪种池化层在反向传播时通常只将梯度传递给最大值所在的神经元?A.平均池化B.最大池化C.全局平均池化D.L2池化6.在循环神经网络(RNN)中,梯度消失问题主要发生在?A.输入层到隐藏层B.隐藏层到输出层C.随着时间步的反向传播过程中D.激活函数的导数计算中7.LSTM(长短期记忆网络)通过引入“门”机制来解决长距离依赖问题,其中负责决定哪些信息需要从细胞状态中丢弃的是?A.输入门B.遗忘门C.输出门D.记忆门8.在Transformer模型中,用于计算输入序列中不同位置之间相关性的核心机制是?A.卷积机制A.循环机制C.自注意力机制D.残差连接9.下列关于批归一化的描述,正确的是?A.BN通常在全连接层或卷积层的输出之后,激活函数之前使用B.BN在测试时通常使用当前batch的均值和方差C.BN可以完全消除对Dropout的需求D.BN会增加模型的训练时间10.在深度学习中,如果模型在训练集上表现很好,但在测试集上表现很差,这种现象称为?A.欠拟合B.过拟合C.梯度爆炸D.梯度消失11.下列损失函数中,最适合用于多分类问题的是?A.均方误差B.交叉熵损失C.HingeLossD.ContrastiveLoss12.在生成对抗网络(GAN)中,生成器和判别器的训练目标是?A.双方都试图最小化同一个损失函数B.双方都试图最大化同一个损失函数C.生成器试图最小化判别器的准确率,判别器试图最大化准确率D.生成器试图最大化判别器的准确率,判别器试图最小化准确率13.为了防止过拟合,下列哪种方法不属于正则化技术?A.L1正则化B.L2正则化C.DropoutD.数据标准化14.在目标检测任务中,YOLO算法将目标检测问题处理为?A.分类问题B.回归问题C.分类+回归问题D.语义分割问题15.下列关于深度学习硬件加速的描述,错误的是?A.GPU适合进行大规模的并行矩阵运算B.CPU由于核心数少,不适合深度学习训练C.张量处理器(TPU)专门为深度学习矩阵运算设计D.增加显存容量可以直接提高模型的计算速度二、多项选择题(本大题共5小题,每小题3分,共15分。在每小题给出的四个选项中,有多项是符合题目要求的。全部选对得3分,少选得1分,错选不得分)1.深度学习相比于传统的机器学习方法,主要特点包括?A.能够自动从数据中提取特征B.依赖于人工设计的特征工程C.模型通常具有更多的层数和参数D.通常需要海量的标注数据进行训练2.下列哪些是解决梯度消失问题的常用方法?A.使用ReLU等分段线性激活函数B.使用残差连接C.使用批归一化D.使用更小的学习率3.卷积神经网络中的卷积层具有哪些特性?A.局部感知B.权值共享C.平移不变性D.全连接特性4.Transformer模型中包含的主要组件有?A.多头注意力机制B.前馈神经网络C.位置编码D.遗忘门5.在训练深度神经网络时,学习率调度策略包括?A.指数衰减B.分段衰减C.余弦退火D.固定学习率三、填空题(本大题共10空,每空2分,共20分)1.在神经网络中,用于衡量模型预测值与真实值之间差异的函数称为__________。2.假设输入特征向量为x,权重为w,偏置为b,则神经元的线性组合输出为__________(用数学表达式表示)。3.在卷积操作中,当步长为2时,输出特征图的尺寸大约是输入尺寸的__________。4.ReLU激活函数的数学表达式通常写作f(x)5.在深度学习优化中,Adam算法结合了__________和动量法的优点。6.数据增强技术通过对训练数据进行变换(如旋转、裁剪、翻转等)来增加数据的多样性,从而有效抑制__________。7.在ResNet网络中,为了解决深层网络难以训练的问题,引入了__________结构,使得数据可以直接流过某些层。8.Softmax函数通常用于多分类问题的输出层,其作用是将一个实数向量转换为一个__________分布。9.在语义分割任务中,常用的基础网络架构是__________,它能够输出与输入图像大小相同的分类图。10.Attention机制中的三个核心向量分别是Query(Q)、Key(K)和__________。四、简答题(本大题共4小题,每小题10分,共40分)1.简述梯度下降法、随机梯度下降法和小批量梯度下降法的区别与联系。2.请解释卷积神经网络(CNN)中“池化层”的主要作用,并比较最大池化与平均池化的应用场景。3.什么是循环神经网络(RNN)中的“长距离依赖”问题?LSTM是如何通过其结构设计来缓解这一问题的?4.简述Transformer模型中“自注意力机制”的计算过程,并说明引入多头注意力机制的优势。五、计算题(本大题共2小题,每小题15分,共30分)1.假设有一个简单的全连接神经网络,输入层有两个神经元,,隐藏层有一个神经元h,输出层有一个神经元y。激活函数使用Sigmoid函数σ(z)=,损失函数使用均方误差网络参数如下:==当前输入样本为=1.0,=请完成以下任务:(1)计算隐藏层h的输出值。(2)计算输出层y的预测值。(3)计算当前样本的损失值L。2.给定一个二维输入矩阵(图像)I和一个卷积核K,请计算卷积输出特征图。假设不使用填充,步长为1。输入矩阵I:[12卷积核K:[10请写出具体的计算步骤及最终的特征图结果。六、综合应用题(本大题共2小题,每小题15分,共30分)1.在某图像分类任务中,你使用了一个深层卷积神经网络,但在训练过程中发现训练损失迅速下降并接近于0,而验证集的损失在训练初期下降后,随后开始上升,导致验证准确率远低于训练准确率。(1)请分析这种现象表明模型出现了什么问题?(2)请列举至少三种解决该问题的具体技术手段,并分别简要说明其原理。2.请设计一个基于Transformer架构的文本分类模型框架,用于对电影评论进行情感分析(正面/负面)。(1)画出模型的主要结构框图(用文字描述各层级及其数据流向),并说明各层的作用。(2)如果输入句子为“Themovieisfantasticandtouching”,请简述模型如何处理该输入以得到最终的情感分类结果(包括Token化、嵌入、位置编码、注意力计算、分类输出等关键步骤)。答案与解析------------------------一、单项选择题1.答案:B解析:在二维空间中,线性方程++2.答案:C解析:Tanh函数的输出范围在(-1,1)之间,而不是(0,1)。Sigmoid的输出范围是(0,1)。ReLU在正区间导数为常数,能有效缓解梯度消失。LeakyReLU给负轴赋予了一个非零斜率。3.答案:A解析:动量法通过引入动量项(历史速度),利用指数加权平均平滑梯度,从而加速在相关方向(梯度方向一致)上的收敛,并抑制在沟壑方向(梯度方向变化剧烈)上的震荡。4.答案:B解析:卷积输出尺寸计算公式为O=⌊⌋+15.答案:B解析:在最大池化中,只有被选为最大值的神经元位置对输出有正向贡献,因此在反向传播时,梯度通常只回传给前向传播中最大值所在的那个位置,其他位置梯度为0。平均池化则将梯度平均分配给窗口内的所有神经元。6.答案:C解析:RNN的训练本质上是随时间反向传播(BPTT)。当序列很长时,梯度需要经过很多个时间步的连乘。如果激活函数的导数小于1,连乘后梯度趋于0,导致梯度消失,主要发生在时间维度上。7.答案:B解析:遗忘门读取和,输出一个0到1之间的向量给细胞状态,1表示“完全保留”,0表示“完全遗忘”,从而控制信息的丢弃。8.答案:C解析:Transformer抛弃了RNN和CNN的循环与卷积结构,完全基于注意力机制。自注意力机制能够让模型在处理每个词时,直接关注输入序列中的其他所有词,从而捕捉长距离依赖。9.答案:A解析:批归一化通常用于线性变换(如全连接或卷积)之后、非线性激活函数之前。测试时使用训练集估计的全局均值和方差(滑动平均),而非当前batch的。BN不能完全替代Dropout,且通常能加速训练。10.答案:B解析:训练集表现好、测试集表现差是典型的过拟合现象,意味着模型学到了训练数据中的噪声和特有特征,泛化能力差。11.答案:B解析:均方误差常用于回归问题。交叉熵损失常用于分类问题(二分类或多分类),因为它能很好地衡量两个概率分布之间的差异。HingeLoss常用于SVM。ContrastiveLoss常用于度量学习。12.答案:C解析:GAN是一个极小极大博弈。生成器(G)试图生成逼真的样本欺骗判别器,即最小化判别器的准确率(或最大化判别器将假样本判为真的概率);判别器(D)试图区分真假样本,即最大化准确率。13.答案:D解析:L1/L2正则化通过在损失函数中加入权重惩罚项来限制模型复杂度。Dropout通过随机失活神经元来减少共适应性。数据标准化是预处理步骤,不属于正则化技术。14.答案:C解析:YOLO(YouOnlyLookOnce)将目标检测看作单个回归问题,从图像像素到边界框坐标和类别概率的端到端映射,即同时解决分类(是什么)和回归(在哪里)问题。15.答案:D解析:增加显存容量主要允许更大的BatchSize或更大的模型,但不直接提高计算速度(计算速度主要取决于GPU的算力、带宽和架构)。二、多项选择题1.答案:ACD解析:深度学习的核心优势是端到端学习,能够自动提取特征(A),通常具有深层结构(C),且数据饥渴(D)。传统机器学习更依赖人工特征工程(B错误)。2.答案:ABC解析:ReLU导数在正区间为1,缓解了Sigmoid导数小于1导致的梯度消失(A)。残差连接提供了恒等映射通路,梯度可以直接回传(B)。BatchNormalization通过归一化层输入,防止激活函数进入饱和区,保持梯度稳定(C)。更小的学习率主要影响收敛速度和稳定性,不是解决梯度消失的主要手段(D错误)。3.答案:ABC解析:CNN通过局部感受野实现局部感知(A),通过卷积核在图像上滑动实现权值共享(B),由于池化和卷积滑动,CNN对平移具有一定的不变性(C)。CNN在特征提取阶段通常是非全连接的(D错误)。4.答案:ABC解析:Transformer由编码器和解码器堆叠而成,核心组件包括多头自注意力机制(A)、位置前馈神经网络(B)和位置编码(C)。遗忘门是LSTM的组件(D错误)。5.答案:ABC解析:学习率调度通常指随着训练进行动态调整学习率。常见策略包括指数衰减、阶梯式衰减(分段)、余弦退火等。固定学习率通常不被称为“调度”策略(D错误)。三、填空题1.答案:损失函数解析:损失函数用于评估模型预测的好坏。2.答案:x+b解析:神经元先进行线性加权求和。3.答案:一半(或1/2)解析:步长为2意味着每隔2个像素采样一次,输出尺寸约为输入尺寸除以步长。4.答案:0解析:ReLU函数f(x)5.答案:自适应矩估计(或RMSProp)解析:Adam结合了动量法的一阶矩估计和RMSProp的二阶矩估计。6.答案:过拟合解析:数据增加了样本数量和多样性,提高了模型的泛化能力,抑制过拟合。7.答案:残差(或跳跃连接)解析:ResNet引入y=8.答案:概率解析:Softmax将数值归一化,使得所有输出值之和为1,符合概率分布的定义。9.答案:全卷积网络(FCN)或U-Net解析:语义分割需要像素级预测,FCN通过将全连接层转为卷积层并使用反卷积/上采样恢复空间分辨率。10.答案:Value(V)解析:注意力机制通常计算Query和Key的相关性权重,然后对Value进行加权求和。四、简答题1.答案:(1)梯度下降法:每次迭代使用所有训练样本来计算梯度,更新参数。优点是收敛稳定,方向准确;缺点是计算速度慢,无法处理海量数据。(2)随机梯度下降法(SGD):每次迭代随机选取一个样本来计算梯度并更新。优点是计算快,跳出局部最优能力强;缺点是收敛震荡,不稳定。(3)小批量梯度下降法:每次迭代选取一小批样本计算平均梯度并更新。结合了前两者的优点,既利用了矩阵加速运算,又降低了单个样本的方差,是目前最常用的方法。2.答案:作用:(1)降维/特征选择:减少参数数量和计算量。(2)不变性:引入微小的平移、旋转不变性,使模型对输入的微小扰动更具鲁棒性。(3)扩大感受野:后续层的神经元能看到更大的输入区域。比较:(1)最大池化:选取窗口内的最大值。它更关注纹理和显著特征,能更好地保留背景中的强特征,常用于提取关键特征。(2)平均池化:计算窗口内的平均值。它能保留背景信息,平滑特征,常用于提取全局纹理信息或用于需要平滑响应的场景(如某些GAN的生成器)。3.答案:长距离依赖问题:在RNN中,当序列很长时,早期的信息需要经过很多时间步才能传递到当前时刻。由于反向传播中的梯度连乘效应,如果传递过程中的雅可比矩阵小于1,梯度会指数级衰减趋于0,导致网络无法学习到早期的长距离信息,即长距离依赖。LSTM解决方案::LSTM通过引入细胞状态和三个门控单元(遗忘门、输入门、输出门)来解决这个问题。(1)细胞状态:作为一条“高速公路”,信息可以在其上几乎无损地流动,从而贯穿很长的时间序列。(2)遗忘门:决定从细胞状态中丢弃什么信息,通过学习决定何时重置记忆。(3)输入门:决定把什么新信息存入细胞状态。这种加性更新的结构(=·4.答案:计算过程:(1)输入:输入矩阵X通过线性变换得到Query(Q),Key(K),Value(V)矩阵。(2)相关性计算:计算Q和K的点积,得到注意力分数矩阵。(3)缩放:将分数除以(为向量维度),防止点积过大导致梯度消失。(4)Softmax:对缩放后的分数进行Softmax归一化,得到注意力权重。(5)加权求和:将权重矩阵与V相乘,得到最终的输出。多头注意力优势:多头注意力将Q,(1)多视角:允许模型在不同的表示子空间中关注不同的位置信息(如一个头关注语法,另一个头关注语义)。(2)表达能力增强:增强了模型捕捉复杂特征和依赖关系的能力,相比单头注意力效果更好。五、计算题1.答案:(1)计算隐藏层h的输出:首先计算净输入:==经过Sigmoid激活函数:h(2)计算输出层y的预测值:首先计算净输入:==经过Sigmoid激活函数:y(3)计算损失值L:LL2.答案:输入矩阵I大小为4×4,卷积核K大小为3×3,步长输出特征图大小计算:O=4−计算步骤:位置(0,0):对应输入左上角3×[12对应元素相乘求和:(=位置(0,1):对应输入右上角3×[23对应元素相乘求和:(=位置(1,0):对应输入左下角3×[01对应元素相乘求和:(=位置(1,1):对应输入右下角3×[12对应元素相乘求和:(=最终特征图:[96六、综合应用题1.答案:(1)问题分析:这种现象表明模型出现了过拟合。训练损失接近0说明模型有足够的能力去拟合训练数据(包括噪声),而验证损失上升说明模型在未见过的数据上泛化能力差,学到了训练集特有的非普遍特征。(2)解决技术手段及原理:1.数据增强:通过对训练图像进行旋转、平移、缩放、翻转、加噪声等操作,人为扩充训练集的大小和多样性。这相当于增加了“潜在”的样本数,使得模型难以死记硬背每一个样本的特征,从而提高泛化能力。2.Dropout(随机失活):在训练过程中,按照一定的概率随机将隐藏层神经元的输出置为0。这可以看作是训练了大量的子网络共享参数,并在推理时进行平均。它减少了神经元之间的共适应性,迫使网络学习更鲁棒的特征,防止过度依赖某些特定的神经元路径。3.正则化(L1/L2Regularization):在损失函数中增加权重的范数惩罚项(如L=4.早停法:在训练过程中监控验证集的损失。当验证损失在连续若干个Epoch内不再下降甚至上升时,停止训练,并保存验证损失最低时的模型参数。这可以避免模型在训练后期开始拟合噪声。2.答案:(1)模型结构框图及各层作用:1.输入层:接收文本字符串。2.Token嵌入层:将文本中的单词/子词转换为对应的整数ID,并映射为稠密向量。3.位置编码层:由于Transformer没有循环结构,无法感知词序。该层向每个词向量中添加位置信息向量(正弦/余弦函数或可学习向量),使模型区分词的位置。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论