版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第4章机器学习题库一、单项选择题(共29题)1.机器学习的核心思想是?
A.人工编写所有规则
B.从数据中自动学习规律
C.只能处理图像数据
D.不需要任何数据
2.以下哪种学习方式是'有标签'的学习?
A.无监督学习
B.监督学习
C.强化学习
D.迁移学习
3.以下哪种学习方式是'无标签'的学习?
A.监督学习
B.无监督学习
C.半监督学习
D.强化学习
4.K-Means是一种典型的______算法。
A.分类
B.聚类(无监督学习)
C.回归
D.降维
5.决策树的核心思想是?
A.随机猜测
B.通过一系列判定规则对数据进行划分
C.只能处理连续变量
D.不需要训练
6.过拟合是指模型?
A.在训练集上表现差
B.在训练集上表现太好,泛化能力差
C.参数太少
D.训练速度太慢
7.交叉验证的主要目的是?
A.增加训练时间
B.评估模型的泛化能力
C.减少数据量
D.让模型更复杂
8.特征工程是指?
A.删除所有特征
B.对原始特征进行处理,提取更有价值的特征
C.随机生成新特征
D.不需要特征
9.线性回归适用于哪种任务?
A.分类任务
B.回归任务(连续值预测)
C.聚类任务
D.降维任务
10.逻辑回归虽然叫'回归',但实际上是一种______算法。
A.回归
B.分类
C.聚类
D.降维
11.以下哪种算法可以自然地处理多分类问题?
A.简单线性回归
B.Softmax回归
C.岭回归
D.Lasso
12.支持向量机(SVM)的核心思想是?
A.找到一条曲线分隔数据
B.找到使间隔最大的超平面
C.随机分割数据
D.只关注局部数据
13.朴素贝叶斯分类器基于______定理。
A.贝叶斯
B.泰勒
C.傅里叶
D.贝叶斯和泰勒
14.集成学习的主要思想是?
A.使用单个强模型
B.结合多个弱模型提升整体性能
C.减少数据量
D.增加模型复杂度
15.Bagging的核心思想是?
A.串行训练多个模型
B.并行训练多个独立模型并投票
C.只用一个模型
D.不需要训练
16.Boosting的核心思想是?
A.并行训练
B.串行训练,每轮关注前一轮的错误样本
C.随机删除样本
D.不需要标签
17.随机森林是______和______的结合。
A.决策树和Bagging
B.SVM和神经网络
C.K-Means和PCA
D.线性回归和逻辑回归
18.梯度下降算法中,学习率过大可能导致?
A.收敛更快
B.震荡不收敛
C.完全无影响
D.自动停止
19.梯度下降算法中,学习率过小可能导致?
A.不收敛
B.收敛极慢,计算效率低
C.自动跳出局部最优
D.无任何影响
20.批量梯度下降(BatchGD)的特点是?
A.每次更新用全部训练数据
B.每次更新用一个样本
C.每次更新用随机子集
D.不需要计算梯度
21.随机梯度下降(SGD)的特点是?
A.每次更新用全部数据
B.每次更新用一个样本
C.内存消耗最大
D.一定能找到全局最优
22.机器学习项目的标准流程是?
A.数据采集→数据预处理→特征工程→模型训练→模型评估
B.直接训练模型
C.不需要评估
D.只关注模型复杂度
23.训练集、验证集、测试集的主要区别在于?
A.数据量大小
B.用途不同:训练用、调参用、最终评估用
C.数据格式不同
D.没有区别
24.ROC曲线下的面积(AUC)用于衡量什么?
A.模型训练速度
B.二分类模型的性能
C.数据量大小
D.特征维度
25.混淆矩阵中,真正例(TP)是指?
A.负样本被预测为负
B.正样本被预测为正
C.正样本被预测为负
D.负样本被预测为正
26.召回率(Recall)的计算公式是?
A.TP/(TP+FP)
B.TP/(TP+FN)
C.TN/(TN+FP)
D.Accuracy
27.精确率(Precision)的计算公式是?
A.TP/(TP+FP)
B.TP/(TP+FN)
C.TN/(TN+FP)
D.Accuracy
28.F1分数是______和______的调和平均数。
A.精确率,召回率
B.准确率和错误率
C.真正例和假正例
D.训练集和测试集
29.机器学习中,'维度灾难'是指?
A.特征太多导致模型难以训练
B.维度低导致信息丢失
C.数据量太少
D.模型太简单
二、多项选择题(共20题)1.机器学习的主要学习方式包括?(多选)
A.监督学习
B.无监督学习
C.强化学习
D.情感学习
2.常见的监督学习任务包括?(多选)
A.分类(Classification)
B.回归(Regression)
C.聚类(Clustering)
D.降维(DimensionalityReduction)
3.常见的无监督学习任务包括?(多选)
A.聚类
B.降维
C.密度估计
D.分类
4.防止过拟合的方法包括?(多选)
A.增加训练数据
B.正则化(L1/L2)
C.交叉验证
D.减少模型复杂度
5.常见的特征处理方法包括?(多选)
A.归一化/标准化
B.特征选择
C.特征提取(如PCA)
D.随机删除特征
6.以下哪些是集成学习方法?(多选)
A.随机森林(Bagging)
B.AdaBoost(Boosting)
C.梯度提升树(GBDT)
D.K-Means
7.评估分类模型的常用指标包括?(多选)
A.准确率(Accuracy)
B.精确率(Precision)
C.召回率(Recall)
D.F1分数
8.线性回归的假设包括?(多选)
A.线性关系
B.误差项独立同分布
C.多重共线性不影响
D.误差项服从正态分布
9.决策树的优点包括?(多选)
A.可解释性强
B.对特征缩放不敏感
C.能处理非线性关系
D.训练速度最快
10.机器学习项目的标准流程步骤包括?(多选)
A.数据采集与清洗
B.特征工程
C.模型选择与训练
D.模型评估与部署
11.以下哪些算法可用于分类任务?(多选)
A.逻辑回归
B.支持向量机(SVM)
C.决策树
D.K-Means
12.梯度下降的变体包括?(多选)
A.批量梯度下降(BatchGD)
B.随机梯度下降(SGD)
C.小批量梯度下降(Mini-batchGD)
D.牛顿梯度下降
13.正则化方法包括?(多选)
A.L1正则化(Lasso)
B.L2正则化(Ridge)
C.丢弃法(Dropout)
D.数据增强
14.交叉验证的常用方法包括?(多选)
A.K折交叉验证
B.留出法(Hold-out)
C.留一交叉验证(LOOCV)
D.不做验证
15.机器学习中,常见的性能评估场景包括?(多选)
A.二分类评估(AUC-ROC)
B.多分类评估(混淆矩阵)
C.回归评估(MSE、R²)
D.聚类评估(轮廓系数)
16.以下哪些是处理类别型特征的方法?(多选)
A.独热编码(One-HotEncoding)
B.标签编码(LabelEncoding)
C.目标编码(TargetEncoding)
D.直接删除
17.神经网络中的激活函数包括?(多选)
A.Sigmoid
B.Tanh
C.ReLU
D.Softmax
18.Boosting算法家族包括?(多选)
A.AdaBoost
B.梯度提升树(GBDT)
C.XGBoost
D.LightGBM
19.机器学习中,数据预处理步骤包括?(多选)
A.缺失值处理
B.异常值处理
C.数据归一化/标准化
D.特征编码
20.以下哪些场景适合使用机器学习?(多选)
A.图像分类(如手写数字识别)
B.自然语言处理(如情感分析)
C.推荐系统(如商品推荐)
D.纯数学定理证明
三、填空题(共20题)1.机器学习三大主要学习方式:______、______和强化学习。
2.监督学习分为______任务和______任务两大类。
3.______学习使用无标签数据,发现数据内在结构。
4.过拟合是指模型在______上表现太好,在______上表现差。
5.交叉验证最常用的是______折交叉验证。
6.线性回归的loss函数通常使用______误差(MSE)。
7.逻辑回归使用______函数将线性输出映射到(0,1)概率区间。
8.决策树通过______和______两个指标进行特征选择。
9.随机森林是______和______的结合。
10.梯度下降更新参数公式:θ=θ-______×梯度。
11.批量梯度下降每次更新使用______个样本。
12.SGD每次更新使用______个样本。
13.Mini-batchGD每次更新使用______个样本。
14.L1正则化(Lasso)可以使部分权重变为______。
15.L2正则化(Ridge)使权重趋向于______,但不为0。
16.AUC-ROC的取值范围是从______到______。
17.混淆矩阵中,FP表示______样本被预测为______。
18.特征工程中的PCA是一种______方法。
19.在模型评估中,______集用于调整超参数,______集用于最终评估。
20.机器学习项目流程:数据采集→______→特征工程→模型训练→______→部署。
四、场景分析题(共10题)1.你要解决一个'根据历史数据预测房价'的任务,应该选用哪种机器学习方法?描述完整建模流程。
2.解释监督学习中的'偏差-方差困境',并说明如何通过模型选择和正则化来平衡。
3.比较KNN、决策树、SVM三种分类算法的优缺点及适用场景。
4.你要处理一个类别极不平衡的数据集(如欺诈检测,欺诈仅占1%)。描述你会采取哪些策略来提升模型性能。
5.描述如何使用交叉验证进行模型选择和超参数调优。
6.解释神经网络中的'梯度消失'问题,以及如何缓解。
7.你要向一位高中生解释'机器学习'和'传统编程'的区别,请用生活类比。
8.分析:一个垃圾邮件分类器在测试集上准确率99%,但实际使用时效果很差。可能的原因有哪些?如何解决?
9.描述如何使用逻辑回归进行二分类,包括:Sigmoid函数的作用、损失函数、梯度下降更新公式。
10.你要为班级同学讲解'为什么需要训练集、验证集、测试集三个数据集',请用通俗易懂的方式解释。
第4章机器学习参考答案与解析一、单项选择题答案1.答案:B
解析:机器学习通过算法让计算机从数据中自动学习规律,而非人工编写规则。
2.答案:B
解析:监督学习使用带标签的训练数据,学习输入到输出的映射关系。
3.答案:B
解析:无监督学习处理无标签数据,发现数据内在结构和模式。
4.答案:B
解析:K-Means是无监督学习中的经典聚类算法。
5.答案:B
解析:决策树通过递归划分特征空间,生成易解释的判定规则。
6.答案:B
解析:过拟合指模型过度记忆训练数据,导致在新数据上泛化能力差。
7.答案:B
解析:交叉验证通过多次划分训练/验证集,准确评估模型泛化能力。
8.答案:B
解析:特征工程通过预处理、选择、变换等方式,提升特征对任务的表达能力。
9.答案:B
解析:线性回归用于预测连续数值,是回归任务的基础算法。
10.答案:B
解析:逻辑回归用于二分类任务,通过Sigmoid函数输出概率值。
11.答案:B
解析:Softmax回归(多分类逻辑回归)可自然处理多分类问题。
12.答案:B
解析:SVM通过最大化分类间隔,提升模型的泛化能力和鲁棒性。
13.答案:A
解析:朴素贝叶斯基于贝叶斯定理,假设特征条件独立。
14.答案:B
解析:集成学习通过组合多个基模型,降低方差或偏差,提升泛化能力。
15.答案:B
解析:Bagging(如随机森林)并行训练多个模型,通过投票降低方差。
16.答案:B
解析:Boosting(如AdaBoost、GBDT)串行训练,每轮调整样本权重关注难样本。
17.答案:A
解析:随机森林=决策树+Bagging,通过多棵决策树的投票提升性能。
18.答案:B
解析:学习率过大导致参数更新步长太大,损失函数震荡甚至不收敛。
19.答案:B
解析:学习率过小导致收敛速度极慢,需要更多迭代次数。
20.答案:A
解析:BatchGD每次更新使用全部数据,稳定但计算开销大。
21.答案:B
解析:SGD每次使用一个样本更新,速度快但震荡较大。
22.答案:A
解析:标准流程:采集→预处理→特征工程→训练→评估→部署。
23.答案:B
解析:训练集用于学习参数,验证集用于调超参数,测试集用于最终评估。
24.答案:B
解析:AUC-ROC衡量二分类模型在不同阈值下的综合性能,AUC=1表示完美分类。
25.答案:B
解析:TP=TruePositive,实际为正且预测为正的样本数。
26.答案:B
解析:召回率=TP/(TP+FN),衡量模型找出所有正样本的能力。
27.答案:A
解析:精确率=TP/(TP+FP),衡量预测为正的样本中有多少是真正的正样本。
28.答案:A
解析:F1=2×(Precision×Recall)/(Precision+Recall),综合精确率和召回率。
29.答案:A
解析:维度灾难指特征维度过高时,数据稀疏、计算困难、过拟合风险增加。
二、多项选择题答案1.答案:A,B,C
解析:三大主要学习方式:监督学习(有标签)、无监督学习(无标签)、强化学习(奖励信号)。
2.答案:A,B
解析:监督学习主要包括分类(预测类别)和回归(预测连续值)。
3.答案:A,B,C
解析:无监督学习包括聚类、降维、密度估计等,无需标签数据。
4.答案:A,B,C,D
解析:防止过拟合:更多数据、正则化、交叉验证、简化模型、早停等。
5.答案:A,B,C
解析:特征工程包括归一化、标准化、特征选择、特征提取等方法。
6.答案:A,B,C
解析:集成学习主要方法:Bagging(随机森林)、Boosting(AdaBoost、GBDT、XGBoost)。
7.答案:A,B,C,D
解析:分类任务常用指标:准确率、精确率、召回率、F1、AUC-ROC等。
8.答案:A,B,D
解析:线性回归假设:线性关系、误差独立同分布、无多重共线性、误差正态等。
9.答案:A,B,C
解析:决策树优点:可解释、无需特征缩放、能捕捉非线性关系。
10.答案:A,B,C,D
解析:标准流程:数据采集→清洗→特征工程→模型训练→评估→部署。
11.答案:A,B,C
解析:逻辑回归、SVM、决策树可用于分类;K-Means是聚类算法。
12.答案:A,B,C
解析:三大变体:BatchGD、SGD、Mini-batchGD,平衡收敛稳定性和计算效率。
13.答案:A,B,C
解析:正则化方法:L1/L2(线性回归、逻辑回归)、Dropout(神经网络)等。
14.答案:A,B,C
解析:常用交叉验证:K折、留出法、LOOCV,评估模型泛化能力。
15.答案:A,B,C,D
解析:不同任务有不同评估指标:分类用AUC/混淆矩阵,回归用MSE/R²,聚类用轮廓系数。
16.答案:A,B,C
解析:类别特征处理:独热编码、标签编码、目标编码等,根据模型选择合适方法。
17.答案:A,B,C,D
解析:常见激活函数:Sigmoid、Tanh、ReLU、LeakyReLU、Softmax等。
18.答案:A,B,C,D
解析:Boosting家族:AdaBoost、GBDT、XGBoost、LightGBM、CatBoost等。
19.答案:A,B,C,D
解析:数据预处理:缺失值填充、异常值处理、归一化、标准化、特征编码等。
20.答案:A,B,C
解析:机器学习适合图像分类、NLP、推荐系统等数据驱动任务;定理证明更适合符号推理。
三、填空题答案1.答案:监督学习、无监督学习
解析:三大学习方式:监督、无监督、强化学习。
2.答案:分类、回归
解析:监督学习包括分类(类别预测)和回归(连续值预测)。
3.答案:无监督(或聚类)
解析:无监督学习处理无标签数据。
4.答案:训练集、测试集(或新数据)
解析:过拟合:训练集好,测试集差。
5.答案:K(或10)
解析:K折交叉验证最常用,如10折交叉验证。
6.答案:均方(或平方)
解析:线性回归常用均方误差MSE作为损失函数。
7.答案:Sigmoid
解析:逻辑回归用Sigmoid函数输出概率值。
8.答案:信息增益、基尼系数
解析:决策树用信息增益(ID3)或基尼系数(CART)选择特征。
9.答案:决策树、Bagging
解析:随机森林=决策树+Bagging集成。
10.答案:学习率(或α)
解析:梯度下降:θ_new=θ_old-α×∇J(θ)。
11.答案:全部(或所有)
解析:BatchGD使用全部训练样本更新一次参数。
12.答案:1(或一个)
解析:SGD每次使用一个样本进行参数更新。
13.答案:一小批(或若干个,如32/64/128)
解析:Mini-batchGD使用一小批样本,平衡稳定性和效率。
14.答案:零(或0)
解析:L1正则化具有稀疏性,可使部分权重变为0,实现特征选择。
15.答案:零(或接近0)
解析:L2正则化使权重接近0但不为0,防止过拟合。
16.答案:0、1
解析:AUC取值范围[0,1],AUC=1表示完美分类,AUC=0.5表示随机分类。
17.答案:负、正(或假正例)
解析:FP=FalsePositive,实际为负但预测为正。
18.答案:降维(或特征提取)
解析:PCA(主成分分析)是无监督降维方法。
19.答案:验证、测试
解析:验证集调参,测试集最终评估,两者必须分开。
20.答案:数据预处理、模型评估
解析:标准流程:采集→预处理→特征工程→训练→评估→部署。
四、场景分析题参考答案1.参考答案:
参考答案:这是回归任务,选用线性回归、岭回归、Lasso或决策树回归等算法。流程:1)数据采集:收集房屋面积、位置、房龄等特征及房价标签;2)数据预处理:处理缺失值、异常值,对类别特征编码;3)特征工程:归一化数值特征,可选特征选择或PCA;4)划分数据集:训练集/验证集/测试集;5)模型训练:用训练集训练回归模型;6)模型评估:用MSE、RMSE、R²等指标评估;7)调参优化:用验证集调超参数;8)测试集最终评估;9)模型部署预测新房价。评分要点:能正确识别回归任务,流程完整。
2.参考答案:
参考答案:偏差指模型预测与真实值的系统性误差(欠拟合),方差指模型对训练数据微小变化的敏感度(过拟合)。高偏差→模型太简单,高方差→模型太复杂。平衡方法:1)增加模型复杂度降低偏差;2)正则化(L1/L2)降低方差;3)交叉验证选择最优复杂度;4)增加训练数据;5)集成学习(Bagging降低方差,Boosting降低偏差)。评分要点:能解释偏差-方差概念,并提出平衡策略。
3.参考答案:
参考答案:KNN:优点(简单、无需训练、适合多分类);缺点(计算慢、对不平衡数据敏感)。决策树:优点(可解释、无需特征缩放);缺点(易过拟合、不稳定)。SVM:优点(高维数据表现好、泛化能力强);缺点(对参数和核函数敏感、大数据集慢)。适用场景:KNN适合小数据集,决策树适合需要可解释性的场景,SVM适合高维数据。评分要点:能客观比较三种算法。
4.参考答案:
参考答案:策略:1)数据层面:过采样(SMOTE合成少数类样本)、欠采样(减少多数类);2)算法层面:使用代价敏感学习(给少数类更高权重)、选择对不平衡数据鲁棒的算法(如XGBoost);3)评估指标:不用准确率,用精确率、召回率、F1、AUC-ROC;4)异常检测思路:将问题转化为异常检测(One-ClassSVM、孤立森林)。评分要点:能从数据、算法、评估三个层面提出策略。
5.参考答案:
参考答案:流程:1)将训练数据划分为K折(如5折或10折);2)对于每个候选超参数组合:用K-1折训练,剩余1折验证,循环K次,取平均性能;3)选择平均性能最好的超参数组合;4)用全部训练数据
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 中小学班主任基本功素质大赛情景答辩题含答案
- 初中九年级道德与法治二轮专题复习教案:低龄未成年人核准追诉案件的法治透视与价值引领
- 初中道德与法治九年级中考复习:国家利益维护的辩证逻辑与议题式教学教案
- 2026年民航职业技能鉴定考试模拟试卷附完整答案详解
- 2026年吉林省教师职称考试(初中)真题
- 小学生诚信教育的重要性小学生主题班会课件
- 2026年初中化学九年级全册同步练习合集
- 2026年初中化学计算题卷
- 广元市遴选公务员考试真题2025
- 产品联合开发合作意向书(3篇)
- 《内河电子航道图工程技术标准》
- 2025年中级香道师考试题库及答案详解
- 2022民用建筑暖通空调设计技术措施
- 【英语】江苏省苏锡常镇2025届高三下学期二模试题(解析版)
- 2025四川成都新都投资集团有限公司招聘23人笔试参考题库附带答案详解(10套)
- 病房改造及能力提升项目建设方案
- 2025新高考数学核心母题400道(教师版)
- 第六届全国农业行业职业技能大赛(农业经理人赛项)理论参考试题库-下(多选、判断题)
- DB45T 2871-2024 既有住宅加装电梯安全技术规范
- 《电力建设工程施工安全管理导则》(NB∕T 10096-2018)
- 字母认主协议书(2篇)
评论
0/150
提交评论