人工智能导论-技术、应用及伦理 习题及答案 倪波 第5、6章 人工神经网络、深度学习_第1页
人工智能导论-技术、应用及伦理 习题及答案 倪波 第5、6章 人工神经网络、深度学习_第2页
人工智能导论-技术、应用及伦理 习题及答案 倪波 第5、6章 人工神经网络、深度学习_第3页
人工智能导论-技术、应用及伦理 习题及答案 倪波 第5、6章 人工神经网络、深度学习_第4页
人工智能导论-技术、应用及伦理 习题及答案 倪波 第5、6章 人工神经网络、深度学习_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第5章人工神经网络题库一、单项选择题(共30题)1.人工神经网络(ANN)的核心思想是?

A.人工编写所有规则

B.模仿生物大脑,从数据中自动学习特征

C.只能处理图像

D.不需要训练

2.1943年,McCulloch和Pitts提出了什么?

A.感知机

B.首个神经元数学模型(M-P模型)

C.反向传播算法

D.卷积神经网络

3.感知机(Perceptron)的提出者是?

A.McCulloch和Pitts

B.Rosenblatt

C.Hinton

D.LeCun

4.1969年,Minsky和Papert证明了单层感知机无法解决什么问题?

A.线性回归

B.线性不可分问题(如异或XOR)

C.图像识别

D.语音识别

5.反向传播算法(Backpropagation)的重新发现和推广是在哪一年?

A.1950年

B.1986年

C.2006年

D.2012年

6.以下哪个函数常用于二分类输出层的激活函数?

A.ReLU

B.Sigmoid

C.Tanh

D.Softmax

7.ReLU激活函数的优点是?

A.计算简单,缓解梯度消失

B.输出零中心

C.不会产生死神经元

D.适合输出层

8.Sigmoid激活函数的主要缺点是?

A.计算量大,容易产生梯度消失

B.不能用于神经网络

C.输出不是概率

D.只能用于隐藏层

9.前向传播是指?

A.从输入到输出的信息传递过程

B.从输出到输入的参数更新过程

C.随机初始化参数

D.数据预处理过程

10.反向传播是指?

A.从输入到输出计算预测值

B.从输出误差反向计算梯度,更新参数

C.数据增强过程

D.模型压缩过程

11.损失函数(LossFunction)的作用是?

A.增加模型复杂度

B.衡量预测值与真实值的差距

C.加快训练速度

D.减少数据量

12.梯度下降的核心思想是?

A.随机更新参数

B.沿损失函数的梯度反方向更新参数

C.固定参数不变

D.只训练一层

13.全连接层(FullyConnectedLayer)的特点是?

A.每个神经元与下一层所有神经元相连

B.只连接局部区域

C.参数最少

D.只能用于输入层

14.MLP(多层感知机)至少包含几层?

A.一层(只有输入层)

B.两层(输入层+输出层)

C.三层以上(输入层+至少一个隐藏层+输出层)

D.只能有一层

15.手写数字识别任务(MNIST)中,输入图像尺寸是?

A.32×32

B.28×28

C.64×64

D.128×128

16.将28×28图像'展平'后,输入层神经元数量是?

A.28

B.784(28×28)

C.10

D.128

17.MNIST手写数字识别的输出层神经元数量是?

A.28

B.784

C.10(对应数字0-9)

D.100

18.Softmax函数通常用于哪种任务的输出层?

A.二分类

B.多分类

C.回归

D.聚类

19.交叉熵损失(Cross-EntropyLoss)常与______激活函数配合使用。

A.ReLU

B.Softmax

C.Tanh

D.LeakyReLU

20.One-Hot编码的作用是?

A.将类别标签转化为向量,消除序数关系

B.增加数据量

C.减少模型参数

D.加快训练速度

21.批量大小(BatchSize)是指?

A.总训练样本数

B.每次参数更新使用的样本数

C.总训练轮数

D.隐藏层神经元数

22.训练轮次(Epoch)是指?

A.单次参数更新

B.模型完整遍历一次训练数据

C.测试一次模型

D.增加一层网络

23.以下哪个优化器结合了动量(Momentum)和RMSprop的优点?

A.SGD

B.Adam

C.AdaGrad

D.AdaDelta

24.权重初始化toosmall可能导致?

A.梯度消失

B.梯度爆炸

C.训练速度过快

D.模型欠拟合

25.Xavier初始化适用于哪种激活函数?

A.Sigmoid/Tanh

B.ReLU

C.Softmax

D.所有激活函数

26.He初始化适用于哪种激活函数?

A.Sigmoid

B.ReLU及其变体

C.Softmax

D.所有激活函数

27.批量归一化(BatchNormalization)的主要作用是?

A.增加模型参数

B.加速训练,缓解梯度消失

C.替代激活函数

D.减少训练数据

28.Dropout是一种______技术。

A.数据增强

B.正则化(防止过拟合)

C.激活函数

D.优化算法

29.以下哪项不是导致第一次AI寒冬(1970s)的原因?

A.明斯基证明感知机局限

B.神经网络研究经费被大幅削减

C.深度学习取得突破性进展

D.社会对AI的期望过高

30.Hinton、LeCun和Bengio因何获得2018年图灵奖?

A.发明了Transformer

B.奠定了深度学习的理论基础

C.发明了GPT

D.发明了计算机

二、多项选择题(共20题)1.人工神经网络的发展经历了哪几次重要浪潮?(多选)

A.1940s-1960s:M-P模型、感知机,第一次浪潮

B.1970s-1980s:AI寒冬,研究停滞

C.1986年反向传播重新发现,第二次浪潮

D.2012年AlexNet后深度学习爆发,第三次浪潮

2.激活函数的作用包括?(多选)

A.引入非线性,使网络能拟合复杂函数

B.常用的有ReLU、Sigmoid、Tanh等

C.没有激活函数,多层网络等价于单层线性变换

D.只能用于输出层

3.以下哪些是ReLU激活函数的特点?(多选)

A.计算简单快速

B.在正区间梯度恒为1,缓解梯度消失

C.可能导致'死神经元'(负值区梯度为0)

D.输出零中心

4.反向传播算法的核心步骤包括?(多选)

A.前向传播计算预测值

B.计算损失函数

C.反向计算梯度(链式法则)

D.更新参数(梯度下降)

5.防止神经网络过拟合的方法包括?(多选)

A.Dropout(随机丢弃神经元)

B.正则化(L1/L2)

C.早停(EarlyStopping)

D.增加更多层而不加约束

6.以下哪些优化器属于自适应学习率优化器?(多选)

A.AdaGrad

B.RMSprop

C.Adam

D.SGD(标准)

7.MLP(多层感知机)能够处理哪种类型的问题?(多选)

A.非线性分类问题

B.回归问题

C.需要手动设计特征的问题

D.任意复杂度的函数逼近(给定足够多层)

8.以下哪些是神经网络权重初始化的常用方法?(多选)

A.全零初始化

B.随机正态分布初始化

C.Xavier初始化(适合Sigmoid/Tanh)

D.He初始化(适合ReLU)

9.在ANN中,'链式法则'的作用是?(多选)

A.计算复合函数的梯度

B.实现反向传播算法

C.将输出层误差逐层向前传递

D.直接计算损失函数最小值

10.以下哪些是深度学习框架(如PyTorch、TensorFlow)的主要优势?(多选)

A.自动求导(自动计算梯度)

B.GPU加速计算

C.丰富的预构建层和模型库

D.不需要任何数学知识

11.关于梯度消失和梯度爆炸,以下说法正确的是?(多选)

A.梯度消失指梯度趋于0,参数难以更新

B.梯度爆炸指梯度极大,导致参数剧烈震荡

C.使用ReLU和BN可以缓解梯度消失

D.减少网络深度可以解决所有问题

12.Softmax函数的作用是?(多选)

A.将输出转化为概率分布(各元素和为1)

B.常用于多分类任务的输出层

C.与交叉熵损失配合使用效果最佳

D.只能用于二分类

13.在图像任务中使用MLP存在哪些问题?(多选)

A.参数爆炸(全连接导致参数量极大)

B.丢失空间结构信息(展平操作)

C.不适合处理网格结构数据

D.必须手工设计特征

14.批量归一化(BatchNormalization)的优势包括?(多选)

A.加速训练收敛

B.允许使用更大的学习率

C.具有轻微的正则化效果

D.可以完全替代激活函数

15.关于Epoch、BatchSize、Iteration的关系,以下正确的是?(多选)

A.1Epoch=完整遍历一次训练数据

B.1Iteration=处理一个Batch的样本并更新一次参数

C.BatchSize越大,每个Epoch的Iteration越少

D.Epoch数越多,模型一定越好

16.手写数字识别(MNIST)任务中,正确的数据预处理步骤包括?(多选)

A.尺寸标准化(28×28)

B.灰度归一化(将像素值映射到0-1)

C.One-Hot编码标签

D.直接输入原始像素值(0-255)而不做处理

17.Hinton(辛顿)对深度学习的主要贡献包括?(多选)

A.提出深度信念网络(DBN)和逐层预训练

B.推广反向传播算法在现代神经网络中的应用

C.提出Dropout

D.提出AlexNet

18.LeCun(杨立昆)对深度学习的主要贡献包括?(多选)

A.提出卷积神经网络(CNN)

B.将CNN应用于手写数字识别(LeNet-5)

C.提出Transformer架构

D.提出ReLU激活函数

19.Bengio(本吉奥)对深度学习的主要贡献包括?(多选)

A.在深度学习理论基础和表示学习方面的开创性工作

B.推动神经网络语言模型和序列建模研究

C.提出Word2Vec

D.提出ResNet

20.NAS(神经网络架构搜索)的目标是?(多选)

A.自动寻找最优网络架构

B.减少人工设计网络的工作量

C.提高模型性能

D.完全替代数据科学家

三、填空题(共20题)1.人工神经网络受______系统的启发,通过简单单元的连接与协同实现智能。

2.M-P模型(1943)证明了人工神经元可以执行______运算。

3.感知机由______于1957年提出,是第一个可训练的神经网络。

4.1969年,______和______的著作证明了单层感知机的局限,导致AI寒冬。

5.1986年,______、______和______重新发现并推广了反向传播算法。

6.激活函数______的输出范围是(0,1),常用于二分类输出层。

7.激活函数______的输出范围是(-1,1),是零中心的。

8.ReLU激活函数定义为f(x)=______。

9.前向传播是从______到______的信息传递过程。

10.反向传播是从______到______的梯度计算过程。

11.MLP中,______层负责接收原始数据,______层负责输出最终结果。

12.MNIST手写数字数据集中,图像尺寸为______×______像素。

13.将28×28图像展平后,输入层需要______个神经元。

14.Softmax函数将输出转化为______,所有元素之和为1。

15.交叉熵损失函数常与______激活函数配合使用。

16.One-Hot编码将一个类别转化为______向量,只有对应位置为1。

17.批量归一化(BatchNormalization)通过对每层输入进行______和______,加速训练。

18.Dropout在训练时以一定概率随机'丢弃'部分神经元,是______(防止过拟合)技术。

19.Adam优化器结合了______和______的优点,是常用的自适应优化器。

20.______初始化适用于ReLU激活函数,______初始化适用于Sigmoid/Tanh。

四、场景分析题(共10题)1.你要向一位完全没有AI基础的同学解释'人工神经元是如何工作的',请用生活类比的方式描述。

2.描述手写数字识别任务中,一个MLP的完整训练流程(从数据准备到模型评估)。

3.解释'梯度消失'问题:原因、表现、以及如何缓解。

4.比较Sigmoid、Tanh、ReLU三种激活函数的优缺点,并说明各自的适用场景。

5.你要训练一个MLP进行二分类任务,发现训练集准确率98%,测试集准确率只有70%。分析可能的原因和解决方案。

6.描述反向传播算法的数学原理(用链式法则),并说明其在神经网络训练中的作用。

7.你要为班级同学讲解'为什么需要激活函数',请用直观的方式解释。

8.分析:一个3层MLP(输入784,隐藏层256,输出10),计算其总参数数量。并说明参数量大的缺点。

9.解释'损失函数'、'优化器'和'学习率'三者的关系,以及在训练过程中如何协同工作。

10.设计一个实验,验证'ReLU相比Sigmoid更能缓解梯度消失'。描述实验设计思路和预期结果。

第5章人工神经网络参考答案与解析一、单项选择题答案1.答案:B

解析:ANN受生物神经元启发,通过数据驱动自动学习特征和规律。

2.答案:B

解析:M-P模型是第一个人工神经元数学模型,证明了神经元可执行逻辑运算。

3.答案:B

解析:Rosenblatt于1957年提出感知机,是第一个可训练的神经网络模型。

4.答案:B

解析:《Perceptrons》一书证明了单层感知机无法处理非线性可分问题,导致第一次AI寒冬。

5.答案:B

解析:Rumelhart、Hinton、Williams在1986年重新发现并系统化推广了反向传播算法。

6.答案:B

解析:Sigmoid将输出映射到(0,1),适合二分类概率输出。

7.答案:A

解析:ReLU计算简单(max(0,x)),在正区间梯度恒为1,有效缓解梯度消失。

8.答案:A

解析:Sigmoid在输入较大时梯度趋于0(梯度消失),且计算exp开销较大。

9.答案:A

解析:前向传播:输入→逐层计算→输出,是预测的前向过程。

10.答案:B

解析:反向传播:计算输出误差,反向逐层计算梯度,用梯度下降更新参数。

11.答案:B

解析:损失函数量化预测值与真实值之间的差距,指导参数更新方向。

12.答案:B

解析:梯度下降沿损失函数梯度反方向更新参数,逐步降低损失值。

13.答案:A

解析:全连接层每个神经元与下一层所有神经元相连,参数量较大。

14.答案:C

解析:MLP至少有一个隐藏层,才能处理非线性问题。

15.答案:B

解析:MNIST数据集图像尺寸为28×28像素,是深度学习入门经典数据集。

16.答案:B

解析:28×28=784,展平后每个像素对应一个输入层神经元。

17.答案:C

解析:输出层10个神经元,对应0-9共10个数字类别。

18.答案:B

解析:Softmax将输出转化为概率分布,用于多分类任务。

19.答案:B

解析:交叉熵+Softmax是分类任务的标准配置。

20.答案:A

解析:One-Hot编码将类别转化为0/1向量,避免模型误认为类别有大小关系。

21.答案:B

解析:BatchSize决定每次参数更新使用的样本数量,影响训练稳定性和速度。

22.答案:B

解析:一个Epoch=模型完整看一遍所有训练数据。

23.答案:B

解析:Adam优化器结合了动量法和RMSprop的优点,自适应调整每个参数的学习率。

24.答案:A

解析:权重初始值过小,经过多层传递后信号趋于0,导致梯度消失。

25.答案:A

解析:Xavier初始化针对Sigmoid/Tanh设计,保持输入输出方差一致。

26.答案:B

解析:He初始化针对ReLU设计,考虑了ReLU一半输出为0的特点。

27.答案:B

解析:BN通过对每层输入归一化,加速训练,允许更大学习率,缓解梯度消失。

28.答案:B

解析:Dropout在训练时随机丢弃部分神经元,是有效的正则化手段。

29.答案:C

解析:第一次AI寒冬是因为感知机局限被证明、经费削减、期望过高等;深度学习突破是2012年后的事。

30.答案:B

解析:三位因在深度学习理论基础方面的开创性贡献获得2018年图灵奖。

二、多项选择题答案1.答案:A,B,C,D

解析:ANN发展三起两落:第一次(感知机)→寒冬→第二次(BP+MLP)→第三次(深度学习)。

2.答案:A,B,C

解析:激活函数引入非线性,是深度学习成功的关键之一。

3.答案:A,B,C

解析:ReLU优点:简单、缓解梯度消失;缺点:非零中心、可能有死神经元。

4.答案:A,B,C,D

解析:反向传播四步:前向传播→计算损失→反向求梯度→更新参数。

5.答案:A,B,C

解析:防止过拟合:Dropout、正则化、早停、数据增强、降低模型复杂度。

6.答案:A,B,C

解析:AdaGrad、RMSprop、Adam能自适应调整每个参数的学习率;标准SGD不能。

7.答案:A,B,D

解析:MLP是通用函数逼近器,可处理非线性分类、回归等问题,无需手动设计特征。

8.答案:B,C,D

解析:全零初始化导致对称性问题;Xavier和He初始化是更科学的方法。

9.答案:A,B,C

解析:链式法则是反向传播的数学基础,用于计算复合函数对各层参数的梯度。

10.答案:A,B,C

解析:深度学习框架提供自动求导、GPU加速、丰富API,大幅降低开发门槛。

11.答案:A,B,C

解析:梯度消失/爆炸是深层网络训练难题,可通过ReLU、BN、残差连接等缓解。

12.答案:A,B,C

解析:Softmax+交叉熵是分类任务的标准配置,输出各类别概率。

13.答案:A,B,C

解析:MLP处理图像时参数量大且丢失空间信息,CNN更适合图像任务。

14.答案:A,B,C

解析:BN加速训练、允许更大学习率、有正则化效果,但不能替代激活函数。

15.答案:A,B,C

解析:Epoch=遍历全数据集一次;Iteration=参数更新一次;BatchSize影响Iteration数量。

16.答案:A,B,C

解析:MNIST预处理:尺寸标准化、归一化、One-Hot编码标签。

17.答案:A,B

解析:Hinton贡献:DBN、逐层预训练、推广反向传播;Dropout是Hinton学生提出,AlexNet是Krizhevsky等提出。

18.答案:A,B

解析:LeCun贡献:CNN、LeNet-5、手写数字识别应用。

19.答案:A,B

解析:Bengio在表示学习、神经网络语言模型方面有开创性贡献。

20.答案:A,B,C

解析:NAS通过自动化搜索网络架构,减少人工设计负担,提升性能。

三、填空题答案1.答案:生物神经(或大脑)

解析:ANN受生物神经系统启发。

2.答案:逻辑(或布尔)

解析:M-P模型证明神经元可实现逻辑门。

3.答案:Rosenblatt(罗森布拉特)

解析:Rosenblatt发明感知机。

4.答案:Minsky、Papert

解析:明斯基和帕普特导致第一次AI寒冬。

5.答案:Rumelhart、Hinton、Williams

解析:Rumelhart、Hinton、Williams推广反向传播。

6.答案:Sigmoid

解析:Sigmoid输出(0,1)概率值。

7.答案:Tanh

解析:Tanh输出(-1,1),零中心。

8.答案:max(0,x)(或xifx>0else0)

解析:ReLU=max(0,x)。

9.答案:输入、输出

解析:前向传播:输入→输出。

10.答案:输出、输入(或后层、前层)

解析:反向传播:输出→输入,逐层求梯度。

11.答案:输入、输出

解析:输入层接收数据,输出层输出结果。

12.答案:28、28

解析:MNIST图像28×28像素。

13.答案:784(28×28)

解析:28×28=784。

14.答案:概率分布

解析:Softmax输出概率分布。

15.答案:Softmax

解析:交叉熵+Softmax是标准配置。

16.答案:长度为类别数的、独热(或0/1)

解析:One-Hot编码:长度=类别数,只有一个1。

17.答案:归一化(或标准化)、缩放和平移

解析:BN:归一化→缩放和平移(可学习的γ和β)。

18.答案:正则化

解析:Dropout是正则化技术。

19.答案:动量(Momentum)、RMSprop

解析:Adam=Momentum+RMSprop。

20.答案:He、Xavier

解析:HeforReLU,XavierforSigmoid/Tanh。

四、场景分析题参考答案1.参考答案:

参考答案:类比:把神经元比作一个'加权投票器'。假设你要决定是否去看电影,考虑三个因素:1)天气好(权重+3);2)有作业(权重-5);3)朋友一起去(权重+2)。把三个因素乘以各自权重后加起来,如果总和>某个阈值,就决定去。这就是神经元的工作方式:输入×权重→求和→加偏置→激活函数→输出。如果输出>0.5,就'激活'(输出1),否则'不激活'(输出0)。评分要点:类比生动,涵盖加权求和、激活函数等核心概念。

2.参考答案:

参考答案:流程:1)数据准备:下载MNIST数据集,包含60,000张训练图、10,000张测试图;2)预处理:将28×28图像展平为784维向量,像素值归一化到[0,1],标签One-Hot编码;3)构建模型:输入层784个神经元,隐藏层(如256个神经元+ReLU),输出层10个神经元+Softmax;4)训练:用交叉熵损失+Adam优化器,BatchSize=64,训练10-20个Epoch;5)评估:用测试集计算准确率,目标是>95%;6)调优:调整隐藏层数、神经元数量、学习率等超参数。评分要点:流程完整,关键参数合理。

3.参考答案:

参考答案:原因:在深层网络中,反向传播时梯度被连续乘以激活函数导数(如Sigmoid导数最大0.25),经过多层后梯度趋于0。表现:前面层的权重几乎不更新,训练停滞,损失下降极慢。缓解方法:1)使用ReLU等非负饱和激活函数;2)批量归一化(BN);3)残差连接(ResNet);4)合适的权重初始化(Xavier/He);5)使用LSTM/GRU处理序列数据。评分要点:能准确解释原因、表现,并提出至少3种解决方法。

4.参考答案:

参考答案:Sigmoid:优点(输出概率解释性强);缺点(梯度消失、非零中心、计算慢)。适合:二分类输出层。Tanh:优点(零中心,收敛快于Sigmoid);缺点(仍有梯度消失、计算复杂)。适合:RNN隐藏层。ReLU:优点(计算极快、缓解梯度消失、稀疏激活);缺点(非零中心、可能有死神经元)。适合:CNN/MLP隐藏层(最常用)。评分要点:能客观比较三种函数,并匹配适用场景。

5.参考答案:

参考答案:原因:过拟合。训练集准确率远高于测试集,说明模型'死记硬背'了训练数据,泛化能力差。解决方案:1)增加训练数据;2)使用正则化(L1/L2);3)Dropout(如Dropout=0.5);4)早停(监控验证集损失,不再下降时停止);5)降低模型复杂度(减少隐藏层数或神经元数);6)数据增强。评分要点:能正确识别过拟合,并提出至少3种解决方案。

6.参考答案:

参考答案:反向传播基于链式法则,计算损失函数对各层参数的梯度。步骤:1)前向传播:计算每层输出,得到最终预测;2)计算损失:L=f(预测值,真实值);3)反向求导:∂L/∂w^(l)=∂L/∂a^(l)×∂a^(l)/∂z^(l)×∂z^(l)/∂w^(l)(链式法则);4)参数更新:w:=w-α×∂L/∂w。作用:高效计算梯度,使深层网络可训练,是深度学习的基础算法。评分要点:能描述链式法则的应用,并说明反向传播的重要性。

7.参考答案:

参考答案:解释:如果没有激活函数,多层神经网络等价于单层线性变换。证明:假设两层网络,y=W2×(W1×x+b1)+b2=(W2×W1)×x+(W2×b1+b2)=W'×x+b',这仍然是一个线性变换!所以无论叠多少层,没有激活函数的神经网络都只能解决线性问题。激活函数引入了非线性,使网络能拟合任意复杂的函数。类比:没有激活函数就像只能画直线,有了激活函数就能画任意曲线。评分要点:能说清楚'多层线性=单层线性'的核心问题。

8.参考答案:

参考答案:参数计算:1)输入层→隐藏层:784×256+256(偏置)=200,960;2)隐藏层→输出层:256×10+10=2,570;总参数=203,530。缺点:1)参数量大→内存消耗大、训练慢;2)容易过拟合(参数>>样本数时);3)推理延迟高。这也是为什么CNN更适合图像——通过局部连接和权值共享大幅减少参数。评分要点:参数计算正确,能分析参数量大的弊端。

9.参考答案:

参考答案:关系:损失函数告诉模型'离目标有多远',优化器决定'怎么调整参数',学习率控制'每次调整多大步子'。协同工作流程:1)前向传播计算损失L;2)优化器(如Adam)计算梯度∇L;3)学习率α控制参数更新幅度:w:=w-α×∇L;4)重复直到损失收敛。学习率过大→震荡不收敛;过小→收敛极慢。好的优化器(如Adam)能自适应调整每个参数的学习率。评分要点:能清晰解释三者关系和协同机制。

10.参考答案:

参考答案:实验设计:1)构建两个相同的深层MLP(如10层隐藏层);2)一个使用Sigmoid激活,一个使用ReLU激活;3)使用相同的数据集、损失函数、优化器、学习率;4)训练过程中记录:每层梯度的均值和标准差、训练损失下降曲线、测试准确率。预期结果:Sigmoid网络的前面层梯度均值趋于0(梯度消失),训练损失下降极慢;ReLU网络梯度健康,训练损失稳定下降,测试准确率更高。额外观察:Sigmoid网络可能出现训练不收敛,ReLU网络收敛明显更快。评分要点:实验设计合理,能预期正确的结果。

第6章深度学习题库一、单项选择题(共30题)1.深度学习的核心特征是?

A.网络层数很深(通常>>3层)

B.只能处理图像

C.参数非常少

D.不需要数据

2.深度学习爆发的三大驱动力是?

A.数据、算力、算法

B.理论、实验、应用

C.硬件、软件、网络

D.图片、文字、语音

3.CNN(卷积神经网络)最适合处理哪种数据?

A.序列数据(如文本)

B.网格结构数据(如图像)

C.图结构数据

D.音频波形

4.CNN中的'局部连接'是指?

A.每个神经元连接输入层所有像素

B.每个神经元只连接输入的一个局部区域

C.不需要连接

D.全连接

5.CNN中的'权值共享'是指?

A.所有神经元用同一组权重

B.同一卷积核在图像上滑动时权重不变

C.不需要权重

D.每个位置用不同权重

6.卷积层的核心部件是?

A.池化核

B.卷积核(滤波器)

C.全连接层

D.激活函数

7.池化层(PoolingLayer)的主要作用是?

A.增加参数量

B.降低分辨率,减少计算量,提取主要特征

C.增加图像尺寸

D.替代激活函数

8.最大池化(MaxPooling)是指?

A.取局部区域的平均值

B.取局部区域的最大值

C.取局部区域的最小值

D.随机取一个值

9.平均池化(AveragePooling)是指?

A.取局部区域的平均值

B.取局部区域的最大值

C.取局部区域的最小值

D.求和

10.LeNet-5是第一个成功应用于______的卷积神经网络。

A.图像分类比赛

B.银行支票手写数字识别

C.目标检测

D.图像生成

11.LeNet-5的网络结构顺序是?

A.卷积→池化→卷积→池化→全连接

B.全连接→卷积→池化

C.池化→卷积→全连接

D.卷积→全连接→池化

12.AlexNet(2012)在ImageNet竞赛中的突破主要体现在?

A.首次使用CNN

B.GPU加速训练,性能大幅提升

C.参数最少

D.不需要数据增强

13.RNN(循环神经网络)最适合处理哪种数据?

A.图像数据

B.序列数据(如文本、语音、时间序列)

C.静态表格数据

D.图结构数据

14.RNN中的'隐藏状态(HiddenState)'的作用是?

A.存储模型参数

B.记忆历史信息,捕捉时序依赖

C.存储输出结果

D.存储输入数据

15.标准RNN在训练时容易遇到什么问题?

A.梯度消失/爆炸,难以捕捉长距离依赖

B.计算速度最快

C.参数最少

D.不需要训练

16.LSTM(长短期记忆网络)通过什么机制解决RNN的长期依赖问题?

A.门控机制(遗忘门、输入门、输出门)

B.增加隐藏层数

C.使用更大的学习率

D.删除记忆单元

17.GRU(门控循环单元)与LSTM的主要区别是?

A.GRU只有两个门(重置门、更新门),结构更简单

B.GRU参数更多

C.GRU只能处理短序列

D.GRU不需要激活函数

18.Transformer架构于哪一年提出?

A.2012年

B.2015年

C.2017年(论文AttentionisAllYouNeed)

D.2020年

19.Transformer的核心机制是?

A.卷积

B.循环连接

C.自注意力(Self-Attention)

D.池化

20.自注意力机制中,Q、K、V分别代表?

A.Query(查询)、Key(键)、Value(值)

B.Quality、Key、Value

C.Query、Kernel、Value

D.Quick、Key、Value

21.多头注意力(Multi-HeadAttention)的作用是?

A.增加计算量

B.让模型同时关注不同子空间的信息

C.减少参数量

D.替代激活函数

22.Transformer中的'位置编码(PositionalEncoding)'的作用是?

A.增加模型参数

B.为序列数据引入位置信息(因为Attention本身是无序的)

C.替代词嵌入

D.加快训练速度

23.BatchNormalization和LayerNormalization的主要区别是?

A.BN对批次维度归一化,LN对特征维度归一化

B.两者完全相同

C.BN用于RNN,LN用于CNN

D.都不需要

24.ResNet(残差网络)的核心思想是?

A.增加网络深度

B.通过跳跃连接(SkipConnection)解决梯度消失

C.减少参数量

D.使用最大的卷积核

25.以下哪项是Transformer相比RNN的主要优势?

A.能并行计算,训练速度快

B.参数量更少

C.更适合图像数据

D.不需要位置编码

26.VisionTransformer(ViT)将______架构应用于图像分类任务。

A.CNN

B.Transformer

C.RNN

D.MLP

27.以下哪项是深度学习相比传统机器学习的主要优势?

A.自动学习特征,无需手工设计

B.参数更少

C.训练速度更快

D.不需要数据

28.在CNN中,感受野(ReceptiveField)是指?

A.整个输入图像

B.输出神经元对应的输入区域大小

C.卷积核尺寸

D.池化窗口大小

29.以下哪项是导致第二次AI浪潮(1986-2000)的主要原因?

A.感知机被发明

B.反向传播算法被重新发现,神经网络可训练

C.ImageNet数据集发布

D.Transformer被提出

30.Transformer模型中的Feed-ForwardNetwork(前馈网络)通常位于?

A.注意力层之前

B.注意力层之后,对每个位置独立处理

C.只在输出层

D.不需要前馈网络

二、多项选择题(共20题)1.深度学习的三大驱动力包括?(多选)

A.大数据(海量训练数据)

B.强大算力(GPU/TPU)

C.先进算法(CNN/RNN/Transformer)

D.减少模型深度

2.CNN的核心机制包括?(多选)

A.局部连接(每个神经元只关注局部区域)

B.权值共享(同一卷积核在全图共享参数)

C.池化(降低分辨率,提取主要特征)

D.全连接(每个神经元连接所有输入)

3.以下哪几项属于经典CNN架构?(多选)

A.LeNet-5

B.AlexNet

C.VGGNet

D.ResNet

4.RNN适合处理哪些任务?(多选)

A.机器翻译(序列到序列)

B.语音识别(时序数据)

C.股票价格预测(时间序列)

D.图像分类(静态图像)

5.LSTM通过哪些门控机制来解决长期依赖问题?(多选)

A.遗忘门(ForgetGate)

B.输入门(InputGate)

C.输出门(OutputGate)

D.关闭门(CloseGate)

6.Transformer架构相比RNN的主要优势包括?(多选)

A.支持并行计算,训练速度快

B.能有效捕捉长距离依赖(自注意力)

C.适合处理序列数据

D.参数量一定更少

7.自注意力机制的计算步骤包括?(多选)

A.计算Query、Key、Value矩阵

B.计算注意力分数(Q和K的点积)

C.缩放并归一化(Softmax)

D.加权求和Value

8.ResNet的核心贡献包括?(多选)

A.引入残差连接(SkipConnection)

B.支持训练极深的网络(如152层)

C.缓解梯度消失问题

D.减少模型参数量

9.以下哪几项属于注意力机制的变体?(多选)

A.自注意力(Self-Attention)

B.交叉注意力(Cross-Attention)

C.多头注意力(Multi-HeadAttention)

D.卷积注意力

10.在深度学习实践中,防止过拟合的方法包括?(多选)

A.Dropout

B.BatchNormalization(有轻微正则化效果)

C.数据增强

D.早停(EarlyStopping)

11.TransformerDecoder中包含哪几种注意力子层?(多选)

A.MaskedSelf-Attention(掩码自注意力)

B.Cross-Attention(交叉注意力,编码器-解码器)

C.Self-Attention(自注意力)

D.卷积注意力

12.CNN中,卷积核的尺寸通常是?(多选)

A.1×1(用于通道间信息融合)

B.3×3(最常用,平衡感受野和参数量)

C.5×5(感受野更大)

D.7×7(早期网络常用)

13.在序列建模任务中,以下哪些模型属于Transformer家族?(多选)

A.BERT(Encoder-only)

B.GPT(Decoder-only)

C.T5(Encoder-Decoder)

D.LSTM

14.深度学习在计算机视觉领域的典型应用包括?(多选)

A.图像分类(ImageClassification)

B.目标检测(ObjectDetection)

C.语义分割(SemanticSegmentation)

D.机器翻译

15.关于BatchNormalization,以下说法正确的是?(多选)

A.对每层输入进行归一化,加速训练

B.允许使用更大的学习率

C.具有轻微的正则化效果

D.在测试阶段使用训练集的均值和方差

16.在Transformer中,位置编码有哪些实现方式?(多选)

A.固定位置编码(正弦/余弦函数)

B.可学习位置编码(作为参数训练)

C.相对位置编码(如T5、DeBERTa)

D.不需要位置编码

17.以下哪几项属于深度学习常见的优化器?(多选)

A.SGD(随机梯度下降)

B.Adam

C.RMSprop

D.AdaGrad

18.数据增强(DataAugmentation)在深度学习中的作用是?(多选)

A.增加训练数据量

B.提升模型泛化能力

C.防止过拟合

D.减少计算量

19.在目标检测任务中,以下哪些是经典模型?(多选)

A.R-CNN系列(R-CNN、FastR-CNN、FasterR-CNN)

B.YOLO系列(YOLOv1-v8)

C.SSD(SingleShotMultiBoxDetector)

D.GPT系列

20.关于深度学习的历史,以下说法正确的是?(多选)

A.2012年AlexNet引爆深度学习革命

B.2017年Transformer论文AttentionisAllYouNeed发表

C.2020年GPT-3展示大模型强大能力

D.1998年LeNet-5成功应用于手写数字识别

三、填空题(共20题)1.深度学习的三驱动力:______、______和算法的共同进步。

2.CNN的三大核心机制:局部连接、______和池化。

3.卷积层中,______(滤波器)负责检测特定模式(如边缘、纹理)。

4.池化层常用的两种方式:______池化和______池化。

5.LeNet-5是______(作者)于______年提出的经典CNN架构。

6.AlexNet在______年ImageNet竞赛中将错误率从26%降至______%。

7.RNN的全称是______,适合处理序列数据。

8.LSTM的全称是______,通过门控机制解决长期依赖。

9.GRU的全称是______,是LSTM的简化版本。

10.Transformer架构在______年论文《AttentionisAllYouNeed》中首次提出。

11.Transformer的核心机制是______(Self-Attention)。

12.自注意力中,Q、K、V分别代表______、______和______。

13.多头注意力将Q、K、V投影到______个子空间并行计算。

14.Transformer中,______编码为序列引入位置信息。

15.ResNet的核心思想是______连接(SkipConnection)。

16.在CNN中,______指输出神经元对应的输入区域大小。

17.BatchNormalization对______维度归一化,适合CNN。

18.LayerNormalization对______维度归一化,适合Transformer。

19.VisionTransformer(ViT)将图像分割为若干______作为输入序列。

20.TransformerDecoder中使用______注意力,防止看到未来的信息。

四、场景分析题(共10题)1.你要向一位同学解释'CNN为什么适合处理图像',请用类比的方式说明局部连接和权值共享的优势。

2.描述一个CNN用于图像分类任务的完整流程(从输入到输出)。

3.解释RNN中的'梯度消失'问题,并说明LSTM是如何通过门控机制解决这个问题的。

4.比较CNN、RNN、Transformer三种架构的优缺点和适用场景。

5.你要设计一个'无人机航拍图像识别'系统,应该选用哪种深度学习架构?描述设计思路。

6.解释Transformer中的'自注意力机制':Q、K、V分别是什么,注意力分数如何计算,最终输出如何得到。

7.分析:一个基于RNN的语言模型在长文本生成任务中,容易出现'重复生成'或'逻辑混乱'的问题。分析可能的原因和解决方案。

8.描述Transformer的Encoder和Decoder结构差异,并说明在机器翻译任务中如何协同工作。

9.你要为班级同学讲解'ResNet为什么可以训练这么深',请用直观方式解释残差连接的作用。

10.设计一个实验,比较'用ImageNet预训练权重初始化'和'随机初始化'在图像分类任务上的性能差异。描述实验设计。

第6章深度学习参考答案与解析一、单项选择题答案1.答案:A

解析:深度学习的核心特征是网络深度大(多层非线性变换),能学习层次化特征表示。

2.答案:A

解析:数据(大数据)、算力(GPU)、算法(CNN/RNN/Transformer)共同推动深度学习爆发。

3.答案:B

解析:CNN通过局部连接和权值共享,天然适合处理图像等网格结构数据。

4.答案:B

解析:局部连接:每个神经元只关注输入的一小块局部区域(如3×3像素),而非全图。

5.答案:B

解析:权值共享:同一个卷积核在图像所有位置使用相同的权重参数,大幅减少参数量。

6.答案:B

解析:卷积核(滤波器)是卷积层的核心,负责检测特定模式(如边缘、纹理)。

7.答案:B

解析:池化层通过下采样降低分辨率,减少计算量,增强平移不变性。

8.答案:B

解析:最大池化取局部区域最大值,保留最显著特征。

9.答案:A

解析:平均池化取局部区域平均值,保留整体背景信息。

10.答案:B

解析:LeNet-5(1998)成功应用于银行支票手写数字识别,是CNN的里程碑。

11.答案:A

解析:LeNet-5结构:卷积→池化→卷积→池化→全连接,奠定CNN基础范式。

12.答案:B

解析:AlexNet首次用GPU训练深度CNN,在ImageNet上将错误率从26%降至15%,引发深度学习革命。

13.答案:B

解析:RNN通过循环连接维护隐藏状态,适合处理序列数据和时序依赖。

14.答案:B

解析:隐藏状态h_t编码了截至t时刻的所有历史信息,实现RNN的'记忆'功能。

15.答案:A

解析:标准RNN在长序列上容易出现梯度消失/爆炸,难以捕捉长距离依赖关系。

16.答案:A

解析:LSTM通过遗忘门、输入门、输出门三个门控机制,有效控制信息的保留和遗忘。

17.答案:A

解析:GRU是LSTM的简化版,只有重置门和更新门,参数更少,计算更快。

18.答案:C

解析:Transformer在2017年论文《AttentionisAllYouNeed》中首次提出,彻底改变了NLP领域。

19.答案:C

解析:Transformer完全基于自注意力机制,抛弃了RNN的循环结构,支持并行计算。

20.答案:A

解析:Q=Query(查询),K=Key(键),V=Value(值),通过Q和K的匹配程度加权求和V。

21.答案:B

解析:多头注意力将Q、K、V投影到多个子空间,并行计算注意力,捕捉更丰富的依赖关系。

22.答案:B

解析:Attention机制本身不包含位置信息,位置编码通过叠加到词嵌入上,让模型感知词的顺序。

23.答案:A

解析:BN在批次维度归一化(适合CNN),LN在特征维度归一化(适合Transformer/RNN)。

24.答案:B

解析:ResNet通过残差连接(x+F(x)),让梯度直接传播,支持训练极深的网络(如152层)。

25.答案:A

解析:Transformer通过自注意力实现并行计算,训练速度远超RNN;RNN必须按顺序计算。

26.答案:B

解析:ViT将Transformer架构直接应用于图像分类,将图像分割为patch序列输入Transformer。

27.答案:A

解析:深度学习的核心优势:自动学习层次化特征表示,无需手工设计特征工程。

28.答案:B

解析:感受野指输出层一个神经元'看到'的输入图像的局部区域大小,越深的层感受野越大。

29.答案:B

解析:1986年反向传播重新发现,使得多层神经网络可以有效训练,引发第二次AI浪潮。

30.答案:B

解析:Transformer每层包含:多头注意力→残差连接+LN→前馈网络→残差连接+LN。

二、多项选择题答案1.答案:A,B,C

解析:数据、算力、算法是深度学习爆发的三大引擎。

2.答案:A,B,C

解析:CNN三大核心:局部连接、权值共享、池化,使其特别适合图像处理。

3.答案:A,B,C,D

解析:经典CNN架构:LeNet-5→AlexNet→VGGNet→ResNet→DenseNet等。

4.答案:A,B,C

解析:RNN适合序列数据任务:机器翻译、语音识别、时间序列预测等。

5.答案:A,B,C

解析:LSTM三大门:遗忘门(决定丢弃什么)、输入门(决定存储什么)、输出门(决定输出什么)。

6.答案:A,B,C

解析:Transformer优势:并行计算、长距离依赖、灵活性强;但不一定参数更少。

7.答案:A,B,C,D

解析:自注意力四步:QKV计算→注意力分数→Softmax归一化→加权求和V。

8.答案:A,B,C

解析:ResNet通过残差连接让极深网络可训练,是深度学习重要突破。

9.答案:A,B,C

解析:注意力机制变体:Self-Attention、Cross-Attention、Multi-HeadAttention等。

10.答案:A,B,C,D

解析:深度学习中防止过拟合:Dropout、BN、数据增强、早停、正则化等。

11.答案:A,B,C

解析:TransformerDecoder:MaskedSelf-Attention(防止看到未来信息)+Cross-Attention(关注编码器输出)。

12.答案:A,B,C,D

解析:常用卷积核尺寸:1×1、3×3、5×5、7×7,3×3是最常用的基础尺寸。

13.答案:A,B,C

解析:BERT、GPT、T5都是基于Transformer的模型,分别使用Encoder、Decoder、Encoder-Decoder结构。

14.答案:A,B,C

解析:CV三大任务:图像分类、目标检测、语义分割;机器翻译是NLP任务。

15.答案:A,B,C,D

解析:BN加速训练、允许更大学习率、有正则化效果,测试时使用训练时统计的均值/方差。

16.答案:A,B,C

解析:位置编码:固定(原始Transformer)、可学习(BERT)、相对位置编码(先进模型)。

17.答案:A,B,C,D

解析:深度学习常见优化器:SGD、Adam、RMSprop、AdaGrad、AdaDelta等。

18.答案:A,B,C

解析:数据增强通过变换增加数据多样性,提升泛化能力,防止过拟合。

19.答案:A,B,C

解析:目标检测经典模型:R-CNN系列、YOLO系列、SSD等;GPT是语言模型。

20.答案:A,B,C,D

解析:深度学习关键里程碑:LeNet-5(1998)→AlexNet(2012)→Transformer(2017)→GPT-3(2020)。

三、填空题答案1.答案:大数据、强大算力(或GPU)

解析:数据、算力、算法共同推动深度学习发展。

2.答案:权值共享

解析:CNN的三大特性:局部连接、权值共享、池化。

3.答案:卷积核

解析:卷积核是CNN的核心部件,检测局部特征。

4.答案:最大(Max)、平均(Average)

解析:最大池化取最大值,平均池化取平均值。

5.答案:YannLeCun、1998

解析:LeCun于1998年提出LeNet-5,用于手写数字识别。

6.答案:2012、15(或16)

解析:AlexNet2012年引爆深度学习革命。

7.答案:RecurrentNeuralNetwork(循环神经网络)

解析:RNN=循环神经网络,处理序列数据。

8.答案:LongShort-TermMemory(长短期记忆网络)

解析:LSTM通过门控机制记忆长期信息。

9.答案:GatedRecurrentUnit(门控循环单元)

解析:GRU参数更少,计算更快。

10.答案:2017

解析:Transformer2017年提出,改变NLP领域。

11.答案:自注意力

解析:自注意力是Transformer的核心。

12.答案:Query(查询)、Key(键)、Value(值)

解析:QKV是自注意力的三个核心矩阵。

13.答案:多个(或h个,如8个)

解析:多头注意力并行计算多组注意力,捕捉更丰富信息。

14.答案:位置(PositionalEncoding)

解析:位置编码弥补Attention无序性的缺陷。

15.答案:残差(或跳跃)

解析:残差连接让极深网络可训练。

16.答案:感受野(ReceptiveField)

解析:感受野越大,神经元'看到'的输入区域越大。

17.答案:批次(Batch)

解析:BN在批次维度归一化。

18.答案:特征(Feature)

解析:LN在特征维度归一化,适合序列模型。

19.答案:Patch(图像块)

解析:ViT把图像分成patch,像单词一样输入Transformer。

20.答案:掩码自注意力(MaskedSelf-Attention)

解析:MaskedAttention确保解码时只能看到已生成的部分。

四、场景分析题参考答案1.参考答案:

参考答案:类比:如果要用全连接网络处理一张1000×1000的图像,输入层就有100万个神经元,假设第一个隐藏层有1000个神经元,那么仅这一层就需要10亿个参数!这就像要让一个人记住世界上所有面孔才能识别一张脸。CNN的局部连接就像'扫描仪'——每次只看一小块区域(如3×3像素),权值共享就像'模板'——同一套检测边缘的规则适用于图像的任何位置。这样参数量大幅减少,还能捕捉到'边缘'这种通用特征。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论