人工智能通识导论(理工类)第5章 习题及参考答案_第1页
人工智能通识导论(理工类)第5章 习题及参考答案_第2页
人工智能通识导论(理工类)第5章 习题及参考答案_第3页
人工智能通识导论(理工类)第5章 习题及参考答案_第4页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

3-2-习题5及参考答案1.在K近邻(KNN)算法中,当K值增大时,模型的偏差和方差通常会发生怎样的变化?参考答案:在KNN算法中,K值控制着模型的复杂度:K值较小时(如K=1),模型只参考最近的极少量邻居,决策边界非常不规则,对训练数据中的噪声和个别样本极其敏感。此时方差很高(模型不稳定,训练集稍有变动结果就大幅变化),但偏差较低(拟合能力很强)。K值增大时,预测结果由更多邻居投票决定,相当于对多个样本取平均,平滑了噪声的影响,决策边界变得更平滑。此时方差逐渐降低(模型趋于稳定),但偏差逐渐增大(模型对训练数据的拟合能力下降,可能忽略数据中的真实结构)。因此,随着K值增大,方差减小、偏差增大,这是典型的“偏差—方差权衡”(Bias-VarianceTradeoff)。实践中通常通过交叉验证选择一个使总体误差最小的K值。2.在决策树的ID3算法中,选择分裂属性时使用的信息增益(InformationGain)是基于什么概念计算的?你还能列举出哪些可以帮助选择分裂属性的其它指标?参考答案:信息增益基于“信息熵”(Entropy)概念计算。信息熵由信息论创始人香农提出,用于度量数据集的混乱程度(不确定性),熵越大说明数据越混乱、类别越混杂。ID3算法先计算划分前的数据集熵,再计算按某属性划分后各子集的加权熵,两者的差值即为该属性的信息增益。信息增益越大,说明用该属性划分后数据的"纯度"提升越多,因此选择信息增益最大的属性作为分裂属性。其它可以帮助选择分裂属性的指标包括:(1)信息增益率(GainRatio):C4.5算法使用,用信息增益除以属性的固有信息(分裂信息)来纠正ID3偏向取值多的属性的缺陷;(2)基尼指数(GiniIndex):CART算法使用,度量数据集的不纯度,基尼指数越小,数据集越纯;(3)卡方检验(Chi-Square):CHAID等算法使用,通过统计检验判断属性与类别之间的相关性。其中增益率与基尼指数是目前最常用的两个替代指标。3.在支持向量机(SVM)中,软间隔(SoftMargin)的引入主要是为了应对什么样的情况?参考答案:软间隔(SoftMargin)的引入主要是为了应对训练数据不是线性可分的情况。在原始的硬间隔(HardMargin)SVM中,要求所有训练样本都必须被超平面正确分类,且满足间隔约束。但在现实中,数据往往存在以下情况:一是数据本身含有噪声和异常点(Outliers),二是数据压根就不是线性可分的。如果坚持硬间隔约束,就会导致优化问题无解,或者为了迁就个别异常点而使间隔变得极窄、模型泛化能力极差。引入软间隔后,算法允许部分样本违反间隔约束甚至被误分类,通过在目标函数中引入松弛变量(SlackVariables)和惩罚系数C来平衡“间隔最大化”与“误分类惩罚”之间的关系。C越大,对误分类的惩罚越重,模型越接近硬间隔;C越小,允许的误分类越多,间隔越宽,模型的容错性和泛化能力越强。4.判断以下说法是否正确,并简要说明理由。(1)在朴素贝叶斯分类器中,"朴素"一词指的是假设所有特征之间相互独立。(2)在K-means聚类算法中,K值的确定可以通过肘部法则(ElbowMethod)来辅助选择,肘部法则依据的是不同K值下簇内误差平方和(SSE)的变化趋势。(3)逻辑回归(LogisticRegression)是一种回归算法,用于预测连续型数值输出。参考答案:(1)正确。“朴素”(Naive)一词正是指朴素贝叶斯算法做了一个理想化的假设:假设给定类别的情况下,各个特征之间相互条件独立,即每个特征对分类结果的影响彼此无关。尽管这个假设在现实中往往不成立,但该假设极大地简化了计算,使联合概率可以分解为各特征条件概率的乘积,且实践效果往往出人意料地好。(2)正确。肘部法则的核心依据就是簇内误差平方和(SSE,SumofSquaredErrors,也称簇内平方和)随K值变化的趋势。具体做法是:让K从较小的值逐渐增大,计算每个K对应的SSE并绘制成曲线。随着K增大,SSE会不断下降;当K小于真实簇数时,SSE下降幅度很大,当K达到真实簇数后,再增加K带来的SSE下降幅度会明显趋缓。曲线上由“陡降”转为“平缓”的拐点(形似手肘的位置)所对应的K值即为较优的聚类数。(3)错误。逻辑回归虽然名字中带有“回归”,但它本质上是一种分类算法,而不是回归算法。它通过Sigmoid函数将线性组合的输出压缩到0到1之间,表示样本属于某一类别的概率,通常以0.5为阈值进行二分类。它预测的是离散的类别(或类别的概率),而不是连续型的数值输出。预测连续数值输出才是真正意义上的回归任务(如线性回归)。5.给定一组训练数据,包含3个样本,每个样本有1个特征x和对应的目标值y:样本xy112223334假设使用简单线性回归模型y=w0+w1x,请使用最小二乘法(OrdinaryLeastSquares)计算参数w0和w1的估计值。参考答案:已知数据:三个样本(x,y)分别为(1,2)、(2,3)、(3,4),模型为y=w0+w1x0。第一步:计算x和y的均值x的均值:x̄=(1+2+3)/3=2,y的均值:ȳ=(2+3+4)/3=3第二步:计算w1(斜率)最小二乘估计公式:w1=Σ(xᵢ−x̄)(yᵢ−ȳ)/Σ(xᵢ−x̄)²计算分子各项:样本1:(1−2)×(2−3)=(−1)×(−1)=1,样本2:(2−2)×(3−3)=0×0=0,样本3:(3−2)×(4−3)=1×1=1分子之和:1+0+1=2计算分母各项:(1−2)²=1,(2−2)²=0,(3−2)²=1分母之和:1+0+1=2所以:w1=2/2=1第三步:计算w0(截距)公式:w0=ȳ−w1·x̄=3−1×2=1第四步:拟合直线为y=1+x,代入三个样本:x=1:ŷ=2=y1,x=2:ŷ=3=y2,x=3:ŷ=4=y3三个样本全部被完美拟合。最终结果:w0=1,w1=1,回归方程为y=1+x。6.请简述K-means聚类算法的基本步骤,并说明该算法存在的主要局限性,并给出解决的思路。参考答案:K-means聚类算法的基本步骤包含以下步骤:(1)初始化:随机选择K个点作为初始簇中心(质心);(2)分配样本:计算每个样本到K个簇中心的距离,将每个样本划分给距离最近的簇中心,形成K个簇;(3)更新中心:重新计算每个簇内所有样本的均值,作为该簇新的簇中心;(4)迭代判断:重复"分配—更新"过程,直到簇中心不再发生明显变化(或达到最大迭代次数),即算法收敛。K-means聚类算法的主要局限性及解决思路有以下几个部分:(1)K值需要预先指定。K值选得不合适会导致聚类效果差。解决思路:使用肘部法则(依据SSE变化趋势)、轮廓系数(SilhouetteCoefficient)、Calinski-Harabasz指数等评估指标辅助选择,或采用ISODATA等能自动调整K值的算法。(2)对初始簇中心敏感。不同的初始中心可能导致不同的聚类结果,甚至收敛到局部最优。解决思路:多次随机初始化,选取SSE最小的结果;或使用K-means++算法,让初始中心彼此尽量远离,从而获得更稳定和更好的结果。(3)只能发现球状(凸形)簇。K-means基于欧氏距离和均值计算,只能发现大小相近、形状接近球形的簇,对非球形、密度不均的簇无能为力。解决思路:换用DBSCAN(基于密度)、谱聚类(基于图结构)或层次聚类等其他算法。(4)对噪声和异常点敏感。异常点会严重拉偏簇中心的计算。解决思路:聚类前进行异常值检测与剔除;或使用K-medoids(用簇内代表点代替均值,更抗噪声)。7.请解释过拟合(Overfitting)和欠拟合(Underfitting)的概念,并分别说明在决策树模型中,如何缓解过拟合问题。可以采取什么策略来实现。参考答案:过拟合(Overfitting)指的是模型在训练集上表现极好(训练误差很低),但在测试集或新数据上表现很差(泛化能力差)。其原因是模型把训练数据中的噪声和偶然规律也当作普遍规律学了进去,模型过于复杂,"死记硬背"了训练样本。欠拟合(Underfitting)的含义是模型在训练集上的表现就很差(训练误差和测试误差都很高)。原因是模型过于简单,连数据中的基本规律都未能捕捉,可以认为其“能力不足”。决策树中缓解过拟合的主要策略是剪枝(Pruning),该策略包含以下思路:预剪枝(Pre-pruning):在树生长过程中提前停止分裂。常用手段包括:设定树的最大深度;设定节点分裂所需的最小样本数(样本太少就不再分);设定分裂后纯度提升的最小阈值(增益太小就停止分裂)。预剪枝计算开销小、能防止树长得过深,但可能导致欠拟合(有些分支当前收益小、后续收益大,被过早剪掉)。后剪枝(Post-pruning):先让树充分生长,再自底向上地考察非叶节点,如果将其子树剪掉替换为叶节点后,在验证集上的泛化性能不下降甚至提升,就执行剪枝。常见方法有代价复杂度剪枝(CCP)。后剪枝通常比预剪枝保留了更多分支,欠拟合风险小,泛化性能更好,是目前更常用的策略。此外,还可以通过集成方法缓解:如随机森林(RandomForest)通过多棵树的投票消除了单棵树的不稳定性,本质上也是一种抑制过拟合的手段。8、请比较支持向量机(SVM)中的线性核(LinearKernel)与高斯核(RBFKernel,径向基核)的差异,说明为什么要引入核函数。参考答案:支持向量机(SVM)中,线性核的本质是不做任何变换,直接在原始特征空间中计算两个样本的内积。它适用于数据在原始空间中线性可分或近似线性可分的情况,模型就是一条直线(或超平面),优点是参数少、计算速度快、结果易于解释;缺点是无法处理非线性问题。而高斯核(RBF核)的形式为K(x,z)=exp(−γ‖x−z‖²),其通过指数函数衡量两个样本的相似度,样本越近输出越大。它能将数据映射到一个无穷维的特征空间,可以拟合任意复杂的非线性决策边界。适用于数据非线性分布的情况。缺点是需要调节参数γ和C,参数选择不当容易过拟合;且当特征数量远大于样本数量时,线性核往往反而更好。实际选择的过程中,需要注意当样本量小、特征维度高时用线性核;而样本量足够、数据呈非线性分布时用高斯核;此外也可通过交叉验证对比两者的效果来选择。为什么要引入核函数呢?因为SVM

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论