版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
机器学习期末常考简答题一、机器学习基础概念1.请简述什么是机器学习?它与传统编程(或称为基于规则的编程)的主要区别是什么?机器学习是人工智能的一个分支,它致力于研究如何使计算机能够通过数据学习并改进自身性能。具体而言,它让计算机系统从经验(通常以数据的形式存在)中自动提取规律或模式,并利用这些规律对新的未知数据进行预测或决策。其与传统编程的主要区别在于:*传统编程:由程序员明确编写解决特定问题的规则和逻辑(即“if-then”语句),计算机严格按照这些预设的指令执行。输入数据,经过固定的程序处理,得到输出。核心是“人定义规则”。*机器学习:程序员不直接编写解决问题的具体规则,而是设计一个学习算法,并提供大量的数据。计算机通过学习算法从数据中自动发现潜在的规则或模式,并将这些模式编码到模型中。核心是“机器从数据中学习规则”。2.什么是监督学习、无监督学习和强化学习?请分别举例说明其典型应用场景。*典型应用:垃圾邮件分类(输入:邮件内容;输出:垃圾/非垃圾)、房价预测(输入:房屋面积、地段等;输出:房价)、手写数字识别。*典型应用:客户分群(根据购买行为将客户划分为不同群体)、异常检测(发现数据中不符合预期模式的样本)、降维可视化(如PCA将高维数据降维到二维平面展示)。*强化学习:智能体(Agent)在与环境的交互过程中,通过试错来学习如何最大化累积奖励。它不依赖于带标签的数据,而是通过反馈信号(奖励或惩罚)来指导学习。3.解释过拟合和欠拟合的概念,并说明如何判断模型是否发生了过拟合或欠拟合?通常有哪些方法可以缓解过拟合?*判断方法:通常通过观察模型在训练集和验证集(或测试集)上的性能(如准确率、误差)来判断。过拟合时,训练误差很小,验证误差很大;欠拟合时,训练误差和验证误差都很大。*缓解过拟合的方法:*降低模型复杂度(如减少神经网络层数/神经元数、简化决策树)。*使用正则化技术(如L1正则化、L2正则化、Dropout)。*采用早停(EarlyStopping)策略。*使用集成学习方法(如Bagging、Boosting)。二、经典算法原理与应用4.请简述线性回归的基本原理。在线性回归中,我们通常使用什么损失函数?如何求解该损失函数以得到模型参数?线性回归旨在建立自变量(特征)与因变量(目标值)之间的线性关系模型。其基本假设是因变量可以表示为自变量的线性组合加上一个随机误差项。数学形式通常表示为:`y=w^Tx+b+ε`,其中`w`是权重向量,`b`是偏置项,`ε`是误差项。线性回归中常用的损失函数是均方误差(MeanSquaredError,MSE),定义为预测值与真实值之差的平方的平均值:`L(w,b)=(1/n)Σ(y_i-(w^Tx_i+b))^2`。求解该损失函数以得到模型参数(w和b)的常用方法是:*最小二乘法(OrdinaryLeastSquares,OLS):通过对损失函数求导并令导数为零,直接求解参数的解析解。对于简单线性回归或低维数据有效。*梯度下降法(GradientDescent):一种迭代优化算法。通过计算损失函数对参数的梯度,沿着梯度负方向不断更新参数,直至损失函数收敛到最小值。对于高维数据或无法直接求解解析解的情况更为常用。5.逻辑回归与线性回归有何异同?为什么逻辑回归能用于分类任务?相同点:*两者都属于广义线性模型的范畴。*模型形式上都涉及线性组合(`w^Tx+b`)。不同点:*任务类型:线性回归用于解决回归问题,预测连续值;逻辑回归用于解决分类问题,预测类别标签(通常是二分类)。*输出范围:线性回归的输出是整个实数域;逻辑回归通过Sigmoid函数将线性组合的结果映射到[0,1]区间,表示概率。*损失函数:线性回归使用均方误差(MSE);逻辑回归使用对数损失函数(LogLoss,或交叉熵损失)。逻辑回归能用于分类任务的原因在于其引入了Sigmoid激活函数(`σ(z)=1/(1+e^(-z))`,其中`z=w^Tx+b`)。Sigmoid函数将线性回归输出的任意实数`z`压缩到[0,1]之间,这个输出值可以被解释为样本属于正类的概率。通过设定一个阈值(通常是0.5),当预测概率大于阈值时,判定为正类,否则为负类,从而实现分类。6.什么是决策树?ID3、C4.5和CART算法在划分属性选择上有何不同?决策树是一种基于树状结构进行决策的预测模型。它由根节点、内部节点、叶节点和分支组成。每个内部节点代表对一个特征的测试,每个分支代表测试的一个结果,叶节点则代表一个类别标签(分类树)或一个预测值(回归树)。决策树的构建过程就是递归地选择最优特征对数据进行划分,使得划分后的子集更加“纯净”。ID3、C4.5和CART在划分属性选择上的核心区别在于所采用的不纯度度量(或信息增益相关指标)不同:*CART算法(ClassificationandRegressionTree):既可用于分类也可用于回归。对于分类树,它使用基尼指数(GiniIndex)来选择划分属性,基尼指数衡量的是数据集合的不确定性,基尼指数越小,数据越纯净。对于回归树,通常使用方差reduction作为划分准则。7.请简述支持向量机(SVM)的基本原理。什么是间隔最大化?核函数在SVM中起到什么作用?支持向量机(SVM)的基本原理是:在特征空间中找到一个超平面,能够将不同类别的样本尽可能好地分开,并且使得分类间隔(Margin)最大化。间隔最大化是SVM的核心思想。所谓间隔,是指分类超平面与距离它最近的两类样本点(即支持向量)之间的距离。SVM试图找到的最优超平面,就是那个使得这个最小距离(即“间隔”)达到最大的超平面。这样做的理论依据是,间隔越大,模型的泛化能力通常越强。核函数在SVM中起到了关键作用:当原始样本数据在低维空间中线性不可分(或难以用线性超平面获得良好分离效果)时,核函数能够将原始低维空间中的样本映射到一个更高维的特征空间,使得在高维空间中样本变得线性可分或更容易被线性超平面分离。核函数的巧妙之处在于,它避免了直接在高维空间中进行复杂的计算,而是通过在原始空间中计算核函数值来间接表示高维空间中的内积,从而大大降低了计算复杂度。常用的核函数有线性核、多项式核、高斯核(RBF核)等。8.朴素贝叶斯分类器的基本原理是什么?“朴素”二字的含义是什么?朴素贝叶斯分类器是基于贝叶斯定理和特征条件独立性假设的分类方法。其基本原理是:对于给定的待分类样本,计算该样本属于各个类别的后验概率,然后将后验概率最大的类别作为该样本的预测类别。具体公式为:`P(y|x)=P(y)*P(x|y)/P(x)`。由于`P(x)`对所有类别都是相同的,因此只需比较`P(y)*P(x|y)`即可。“朴素”二字的含义是指其特征条件独立性假设。即假设在给定类别`y`的条件下,样本的各个特征`x_i`之间是相互独立的,互不影响。这个假设大大简化了计算,使得`P(x|y)`可以表示为各个特征的条件概率的乘积:`P(x|y)=ΠP(x_i|y)`。尽管这个假设在现实中往往不完全成立,但朴素贝叶斯分类器在许多实际应用中(如文本分类)仍能取得较好的效果,并且具有高效、易于实现的优点。9.什么是K-means聚类算法?请简述其基本步骤,并分析其主要优缺点。K-means聚类是一种常用的无监督学习算法,用于将数据集划分成K个不同的簇(Cluster),使得同一簇内的样本相似度较高,不同簇间的样本相似度较低。基本步骤:1.初始化:随机选择K个样本作为初始的聚类中心(Centroids)。2.分配样本:计算每个样本与各个聚类中心的距离(通常是欧氏距离),将样本分配到距离最近的聚类中心所在的簇。3.更新中心:计算每个簇内所有样本的均值,将该均值作为新的聚类中心。4.重复迭代:重复步骤2和步骤3,直到聚类中心不再发生显著变化(或达到预设的迭代次数)。优点:*原理简单,易于理解和实现。*计算复杂度较低,收敛速度快,适用于大规模数据集。*聚类结果的解释性较好。缺点:*需要事先指定聚类簇数K,而K的选择往往具有挑战性。*对初始聚类中心的选择非常敏感,不同的初始中心可能导致不同的聚类结果。*容易受到离群点(Outliers)的影响。*对于非凸形状的簇、大小差异较大的簇或密度差异较大的簇,聚类效果可能不佳。三、模型评估与优化10.在模型评估中,什么是混淆矩阵(ConfusionMatrix)?请解释准确率(Accuracy)、精确率(Precision)、召回率(Recall)和F1值(F1-Score)的定义及其在什么场景下更受关注。混淆矩阵是一种用于评估分类模型性能的表格,它以矩阵形式将模型的预测结果与实际的真实标签进行对比,清晰地展示了各类别的预测正确与错误情况。对于二分类问题,混淆矩阵通常包含四个元素:真正例(TP)、假正例(FP)、真负例(TN)、假负例(FN)。*准确率(Accuracy):所有预测正确的样本占总样本数的比例。`Accuracy=(TP+TN)/(TP+TN+FP+FN)`。适用于样本类别分布较为均衡的场景。但在类别不平衡时,准确率可能会给出误导性的结果。*精确率(Precision,查准率):在所有被预测为正例的样本中,真正为正例的比例。`Precision=TP/(TP+FP)`。关注的是预测结果中“正例”的可靠性,即“预测为正的,有多少是对的”。适用于如垃圾邮件识别(希望“预测为垃圾邮件”的邮件中,真正的垃圾邮件比例高,避免误删正常邮件)。*召回率(Recall,查全率):在所有实际为正例的样本中,被成功预测为正例的比例。`Recall=TP/(TP+FN)`。关注的是对实际“正例”的捕捉能力,即“所有真正的正例,有多少被找出来了”。适用于如疾病诊断(希望尽可能多地找出所有真正患病的人,不漏诊)。*F1值(F1-Score):精确率和召回率的调和平均数。`F1=2*(Precision*Recall)/(Precision+Recall)`。它综合了Precision和Recall的信息,当两者可能存在冲突(一个高另一个低)时,F1值可以作为一个更平衡的评价指标。11.什么是过拟合?请列举至少三种防止过拟合的方法,并简述其原理。防止过拟合的方法及原理:2.降低模型复杂度:*对于决策树,可以通过剪枝(预剪枝或后剪枝)来减少树的深度和节点数量。*对于神经网络,可以减少网络层数或神经元数量。3.正则化(Regularization):在损失函数中加入正则化项,惩罚过大的模型参数,从而限制模型的复杂度。*L1正则化:在损失函数后加上参数的L1范数(绝对值之和),可能导致部分参数为零,实现特征选择。*L2正则化:在损失函数后加上参数的L2范数(平方和的开方,实际中常用平方和),使得参数值普遍较小,模型更平滑。4.交叉验证(Cross-Validation):如K折交叉验证。将数据集分成K份,轮流用K-1份做训练,1份做验证,通过多次验证来评估模型的稳定性和泛化能力,帮助选择合适的模型参数,避免过度依赖某一特定训练集。5.Dropout(针对神经网络):在训练过程中,随机丢弃一部分神经元(及其连接),使得模型不会过度依赖某些特定神经元的激活,从而提高模型的泛化能力,类似于一种集成学习的思想。12.简述交叉验证的目的,并举出至少两种常见的交叉验证方法。交叉验证的主要目的是更有效地利用有限的数据集来评估模型的泛化能力,并帮助选择最优的模型参数(如正则化系数、树的深度等)。它通过将数据进行合理分割和多次训练验证,减少了单次划分训练集和测试集可能带来的随机性和偶然性,从而得到对模型性能更可靠的估计。常见的交叉验证方法:*K折交叉验证(K-FoldCross-Validation):将数据集随机且均匀地分成K个大小相似的子集(称为“折”)。每次使用其中K-1个子集作为训练集,剩下的1个子集作为验证集。如此重复K次,每次选择不同的子集作为验证集。最终模型的性能是这K次验证结果的平均值。*
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 高中语文 第八单元 沙之书教学设计 新人教版《外国小说欣赏》
- 2026年高中政治主观题答题策略试题及真题
- 鼻出血考试题及答案
- 上海市建青实验学校2026-2027学年数学四上期末达标检测模拟试题含解析
- 湖北省武汉市洪山区2027届七上数学期末达标检测试题含解析
- 护士休班考试题及答案
- 车务干部考试题及答案
- 临时记忆考试题及答案
- 成都高中会考试题及答案
- 2026年高职工程造价(工程咨询基础)试题及答案
- 文学教育与文学类文本阅读北京大学中文系吴晓东课件
- 牛羊布病流行病学调查表
- 外科学教学课件:乳房疾病
- 塔山煤矿综合物探施工设计说明
- 2023年司法考试真题卷二答案及详解
- 2023年公务员体检表
- JJG 596-2012电子式交流电能表
- GB/T 1095-2003平键键槽的剖面尺寸
- 新生儿脐部护理技术操作考核评分标准
- 瑶药浴知识课件
- (完整版)《赤壁之战》课文讲解课件
评论
0/150
提交评论