人工智能基础知识普及机器学习测试题及答案_第1页
人工智能基础知识普及机器学习测试题及答案_第2页
人工智能基础知识普及机器学习测试题及答案_第3页
人工智能基础知识普及机器学习测试题及答案_第4页
人工智能基础知识普及机器学习测试题及答案_第5页
已阅读5页,还剩21页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

人工智能基础知识普及机器学习测试题及答案一、单项选择题(每题2分,共20分)1.以下机器学习任务中,属于监督学习范畴的是()A.基于用户行为数据做用户分群B.构建模型预测二手房成交价格C.智能体通过与环境交互学习自动驾驶策略D.对高维特征做降维压缩减少计算量答案:B解析:监督学习的核心是具备标注好的输入输出对,模型学习输入到输出的映射关系。选项A属于无监督聚类任务、选项C属于强化学习任务、选项D属于无监督降维任务,仅选项B的房价预测为有标注的回归任务,属于监督学习。2.以下哪种情况不会导致模型出现过拟合()A.训练样本数量过少B.模型复杂度过高C.训练数据中噪声占比过高D.正则化强度设置过大答案:D解析:过拟合的本质是模型学到了训练数据中的噪声和局部随机特征,泛化能力下降,A、B、C均为过拟合的常见诱因;正则化强度过大时会抑制模型对数据规律的学习,反而会导致欠拟合。3.针对正负样本占比为1:99的不平衡二分类任务,以下哪种评估指标不适合用来衡量模型性能()A.F1值B.精确率C.准确率D.AUC-ROC答案:C解析:准确率的计算公式为(真阳性+真阴性)/总样本数,在不平衡数据集中,模型只需将所有样本预测为占比更高的负类,即可获得99%的准确率,无法真实反映模型对正样本的识别能力,因此不适用。4.以下激活函数中,能够有效缓解深层神经网络梯度消失问题的是()A.SigmoidB.TanhC.ReLUD.线性激活函数答案:C解析:Sigmoid和Tanh激活函数的导数最大值分别为0.25和1,深层网络中经过多层链式求导后梯度会逐渐衰减至0,出现梯度消失问题;ReLU激活函数在输入大于0时导数恒为1,不会出现梯度衰减,能够有效缓解梯度消失;线性激活函数无法引入非线性,多层网络与单层网络表达能力等价,无法解决复杂问题。5.以下算法中属于无监督学习算法的是()A.K-MeansB.逻辑回归C.支持向量机D.CART决策树答案:A解析:K-Means是聚类算法,无需标注数据即可学习数据的簇结构,属于无监督学习;B、C、D均为需要标注数据训练的监督学习算法。6.以下梯度下降变体中,每次迭代使用全部训练集计算梯度更新参数的是()A.随机梯度下降B.批量梯度下降C.小批量梯度下降D.Adam自适应梯度下降答案:B解析:批量梯度下降的核心是每次迭代基于全量训练数据计算损失函数的梯度,更新参数;随机梯度下降每次仅使用单个样本计算梯度,小批量梯度下降每次使用少量样本组成的批次计算梯度,Adam属于自适应学习率的优化器,不属于梯度下降的样本划分维度分类。7.L1正则化的核心特点是()A.使所有参数趋近于0但不会等于0B.会产生稀疏参数矩阵,可用于特征选择C.对大权重的惩罚力度弱于L2正则化D.仅适用于神经网络模型答案:B解析:L1正则化的惩罚项为参数的绝对值之和,导数为常数,优化过程中会使部分不重要的特征对应的参数直接变为0,因此会产生稀疏解,可用于特征选择;L2正则化会使参数趋近于0但不会归零,A选项为L2正则化的特点;L1对大权重的惩罚弱于L2,对小权重的惩罚强于L2,C选项表述片面;L1正则化适用于所有线性模型、树模型、神经网络等,D选项错误。8.以下集成学习方法中,属于并行训练范式的是()A.AdaBoostB.GBDTC.XGBoostD.随机森林答案:D解析:随机森林属于Bagging类集成学习,多个基决策树独立抽样、独立训练,可并行执行;A、B、C均属于Boosting类集成学习,下一轮基学习器的训练依赖上一轮的预测结果,只能串行训练。9.特征工程中独热编码的核心作用是()A.对连续特征做归一化消除量纲影响B.将离散分类特征转化为数值向量,适配模型输入要求C.填补特征中的缺失值D.降低特征维度答案:B解析:独热编码通过将离散特征的每个取值映射为一个二元维度,将分类变量转化为模型可处理的数值向量,不会改变特征维度(反而会升高维度),不适用于连续特征,也无法填补缺失值。10.混淆矩阵中,真阳性(TP)的定义是()A.实际为负类,模型预测为负类的样本数B.实际为负类,模型预测为正类的样本数C.实际为正类,模型预测为负类的样本数D.实际为正类,模型预测为正类的样本数答案:D解析:A为真阴性(TN)、B为假阳性(FP)、C为假阴性(FN),D为真阳性(TP)。二、多项选择题(每题3分,共24分,多选、漏选、错选均不得分)1.机器学习的三大核心范式包括()A.监督学习B.无监督学习C.深度学习D.强化学习答案:ABD解析:机器学习按照学习范式可分为监督学习、无监督学习、强化学习三类,深度学习是基于神经网络的一类实现方法,不属于独立的学习范式。2.以下哪些是导致模型欠拟合的常见原因()A.模型复杂度过低B.训练迭代次数不足C.正则化强度过大D.训练样本数量过多答案:ABC解析:欠拟合的本质是模型未能学习到数据的整体规律,训练集和测试集性能均较差,模型复杂度不足、训练不充分、正则化抑制过度均会导致欠拟合;训练样本数量过多不会导致欠拟合,反而会提升模型泛化能力。3.以下算法中属于分类算法的有()A.逻辑回归B.随机森林C.朴素贝叶斯D.线性回归答案:ABC解析:逻辑回归、随机森林、朴素贝叶斯均用于处理离散标签的分类任务,线性回归用于处理连续标签的回归任务。4.降维算法的核心作用包括()A.降低模型计算量,提升训练和推理效率B.去除高维特征中的噪声和冗余信息C.将高维特征压缩至2-3维实现数据可视化D.避免维度灾难,提升模型泛化能力答案:ABCD解析:四个选项均为降维算法(如PCA、t-SNE)的核心作用。5.强化学习的核心组成要素包括()A.智能体B.环境C.状态、动作D.奖励信号答案:ABCD解析:强化学习的核心逻辑为智能体在环境中基于当前状态选择动作,获得对应奖励,逐步学习最优策略,四个选项均为核心组成要素。6.以下关于决策树算法的描述正确的有()A.ID3算法使用信息增益作为节点划分依据B.C4.5算法使用信息增益比作为节点划分依据,解决了ID3偏向高基数特征的问题C.CART算法使用基尼系数作为分类任务的划分依据,可同时支持分类和回归任务D.决策树的可解释性优于神经网络、支持向量机等黑盒模型答案:ABCD解析:四个选项均为决策树算法的正确特性描述。7.以下哪些方法可以有效防止模型过拟合()A.加入L1或L2正则化项B.对训练数据做数据增强扩充样本量C.训练过程中监控验证集性能,执行早停D.使用集成学习方法组合多个基模型答案:ABCD解析:四个选项均为过拟合的常用解决方案,正则化抑制模型复杂度,数据增强提升样本多样性,早停避免模型过度学习训练数据,集成学习通过多个模型的组合降低方差,减少过拟合风险。8.交叉验证的核心作用包括()A.更准确地评估模型的泛化能力B.减少单次数据划分的随机性对模型评估结果的影响C.辅助超参数调优,选择最优超参数组合D.提升模型的训练速度答案:ABC解析:交叉验证需要多次划分数据集、多次训练模型,会增加训练耗时,D选项错误;A、B、C均为交叉验证的核心作用。三、判断题(每题1分,共10分)1.逻辑回归属于回归算法,仅能处理连续值预测任务。()答案:×解析:逻辑回归的输出为样本属于某一类的概率,属于分类算法,主要用于处理二分类任务。2.K-Means聚类的簇数量K需要提前人为指定,K值的选择会直接影响聚类结果。()答案:√解析:K-Means属于划分式聚类算法,需提前指定K值,可通过手肘法、轮廓系数法选择最优K值。3.支持向量机(SVM)仅能处理线性可分的分类任务,无法处理非线性分类问题。()答案:×解析:SVM通过引入核函数将低维特征映射到高维空间,可处理非线性可分的分类任务。4.ReLU激活函数在输入小于0时梯度为0,可能导致部分神经元永久性失活,出现“神经元坏死”问题。()答案:√解析:为解决该问题,可使用LeakyReLU、PReLU等变体激活函数。5.无监督学习的训练过程不需要标注数据,仅通过挖掘数据的内在结构完成任务。()答案:√6.F1值是精确率和召回率的算术平均值,能够同时兼顾模型的精确性和召回能力。()答案:×解析:F1值是精确率和召回率的调和平均值,对数值较小的指标更敏感,更适合评估不平衡分类任务的综合性能。7.Bagging类集成学习的基学习器通常选择高偏差、低方差的弱学习器(如决策树桩)。()答案:×解析:Bagging的核心作用是降低方差,因此基学习器通常选择高方差、低偏差的强学习器(如深度决策树);Boosting类集成学习的基学习器通常选择低方差、高偏差的弱学习器。8.特征缩放(归一化、标准化)对基于距离的算法(如KNN、SVM)影响较大,对树类算法几乎无影响。()答案:√解析:树类算法的节点划分基于特征的信息增益、基尼系数等指标,与特征的量纲无关,因此不需要做特征缩放;基于距离的算法会受到特征量纲的直接影响,必须做特征缩放。9.深层神经网络的梯度消失问题通常出现在靠近输出层的网络层。()答案:×解析:梯度消失是链式求导过程中梯度逐层衰减导致的,通常出现在靠近输入层的前层网络。10.朴素贝叶斯属于生成式学习模型,通过学习特征和标签的联合分布完成预测。()答案:√1.简述监督学习、无监督学习、强化学习的核心区别和适用场景。答:三者的核心区别在于学习过程中反馈信号的形式不同:(1)监督学习:训练数据包含明确的输入-标签对,模型学习输入到标签的映射关系,反馈信号是即时的、明确的标注信息。适用场景:所有具备标注数据的分类、回归任务,如垃圾邮件识别、人脸检测、房价预测、用户流失预测等。(2)无监督学习:训练数据没有任何标签,模型自主挖掘数据的内在结构和分布规律,没有明确的反馈信号。适用场景:聚类、降维、关联规则挖掘、异常检测等任务,如用户分群、高维特征压缩、商品关联推荐、金融欺诈识别等。(3)强化学习:没有预先标注的标签,智能体通过与环境交互获得延迟的奖励信号,学习最优决策策略,反馈信号存在延迟,通常需要多步决策后才能获得。适用场景:序列决策类任务,如自动驾驶、游戏AI、机器人控制、推荐系统的序列推荐、供应链调度等。2.什么是过拟合和欠拟合?分别对应的解决方案有哪些?答:(1)过拟合:模型在训练集上性能优异,但在测试集/未知数据上性能大幅下降,本质是模型学习到了训练数据中的噪声、局部随机特征,泛化能力不足。常见解决方案:①加入L1/L2正则化项,抑制模型参数的过度更新;②扩充训练数据,通过数据增强提升样本多样性;③降低模型复杂度,如减少神经网络层数、限制决策树深度;④训练过程中执行早停,当验证集性能连续下降时停止训练;⑤使用集成学习方法,通过多个模型的组合降低方差,减少过拟合风险。(2)欠拟合:模型在训练集和测试集上的性能均较差,本质是模型的表达能力不足,未能学习到数据的整体规律。常见解决方案:①提升模型复杂度,如增加神经网络层数和神经元数量、提升决策树的最大深度、使用更复杂的算法;②减少正则化强度,降低对模型的约束;③增加训练迭代次数,确保模型充分收敛;④优化特征工程,引入更多与任务相关的有效特征,挖掘特征交互信息。3.分别解释准确率、精确率、召回率、F1值的定义和适用场景。答:基于二分类混淆矩阵(TP:真阳性,FP:假阳性,TN:真阴性,FN:假阴性),四个指标的定义和适用场景如下:(1)准确率:计算公式为Acc=(TP+TN)/(TP+TN+FP+FN),代表模型预测正确的样本占总样本的比例。适用场景:仅适用于正负样本分布均衡的分类任务,不平衡数据集下无法真实反映模型性能。(2)精确率(Precision):计算公式为P=TP/(TP+FP),代表模型预测为正类的样本中,实际为正类的比例,衡量模型的“不误判”能力。适用场景:误判成本较高的场景,如医疗诊断的阳性预测、金融信贷的违约预测,避免将健康人判定为患者、将守信用户判定为违约用户。(3)召回率(Recall):计算公式为R=TP/(TP+FN),代表实际为正类的样本中,被模型正确识别的比例,衡量模型的“不漏判”能力。适用场景:漏判成本较高的场景,如传染病筛查、安全生产缺陷检测,避免漏过阳性患者、缺陷设备。(4)F1值:计算公式为F1=2*P*R/(P+R),是精确率和召回率的调和平均值,对数值较低的指标更敏感,衡量模型的综合性能。适用场景:不平衡分类任务,需要同时兼顾精确率和召回率的场景,是不平衡分类任务的核心评估指标之一。4.简述Bagging和Boosting两类集成学习的核心思想和区别。答:集成学习的核心是将多个基学习器组合,获得优于单个基学习器的泛化性能,Bagging和Boosting是两类主流的集成框架,核心思想和区别如下:(1)核心思想:①Bagging:并行训练多个独立的基学习器,每个基学习器使用有放回抽样(Bootstrap抽样)得到的子数据集训练,最终预测结果为多个基学习器的投票(分类)或平均(回归),代表算法为随机森林。②Boosting:串行训练基学习器,每一轮训练时提升上一轮预测错误样本的权重,使后续基学习器重点关注难分样本,最终预测结果为多个基学习器的加权投票或加权平均,代表算法为AdaBoost、GBDT、XGBoost、LightGBM。(2)核心区别:①训练方式:Bagging为并行训练,基学习器之间相互独立;Boosting为串行训练,下一轮基学习器的训练依赖上一轮的预测结果。②样本权重:Bagging的每个基学习器使用的样本权重相同;Boosting会逐步提升错分样本的权重。③优化目标:Bagging的核心是降低模型的方差,适合高方差、低偏差的基学习器(如深度决策树);Boosting的核心是降低模型的偏差,适合低方差、高偏差的基学习器(如浅层决策树桩)。④抗过拟合能力:Bagging能够减少过拟合风险;Boosting如果基学习器数量过多或学习率设置不当,更容易出现过拟合。五、实操分析题(每题7分,共14分)1.某电商平台需要构建用户复购预测模型,数据集包含10万条用户历史行为数据,其中复购用户(正样本)占比仅8%,特征包含用户消费频次、客单价、浏览时长、商品类目偏好等120个特征,其中30个为离散特征、90个为连续特征。请回答以下问题:(1)该任务属于什么类型的机器学习任务?(2)该数据集存在什么典型问题?应该选择哪些评估指标?(3)特征工程阶段需要做哪些核心处理?(4)可以选择哪些算法构建模型?说明理由。答:(1)该任务属于监督学习下的二分类任务,目标是学习用户特征与复购标签(复购/不复购)的映射关系,预测新用户的复购概率。(2)该数据集存在严重的类别不平衡问题,正样本占比仅8%,负样本占比92%。不能选择准确率作为评估指标,应该选择精确率、召回率、F1值、AUC-ROC、AUC-PR作为评估指标,其中AUC-PR对不平衡数据集的敏感度更高,是首选评估指标。(3)特征工程阶段的核心处理:①离散特征处理:低基数离散特征(如性别、会员等级)采用独热编码,高基数离散特征(如用户所在城市、偏好类目)采用目标编码或频次编码,避免维度爆炸;②连续特征处理:针对逻辑回归、SVM等对量纲敏感的算法,做标准化/归一化处理,树类算法可省略该步骤;③特征衍生:基于现有特征构造交叉特征,如月均消费=消费频次/注册时长、总消费额=客单价*消费频次,挖掘更多有效信息;④特征选择:通过方差过滤、互信息、树模型特征重要性等方法,去除冗余特征和无关特征,降低维度;⑤缺失值填充:离散特征用众数填充,连续特征用中位数填充,避免缺失值影响模型训练。(4)可选算法及理由:①树类集成算法(XGBoost、LightGBM、CatBoost):对特征缩放要求低,可自动处理特征交互,支持设置样本权重适配类别不平衡问题,训练速度快、泛化能力强,是该场景的首选算法;②逻辑回

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论