第10章判别分析_第1页
第10章判别分析_第2页
第10章判别分析_第3页
第10章判别分析_第4页
第10章判别分析_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Part1第10章判别分析目录10.1贝叶斯判别10.1.3朴素贝叶斯分类器10.2K近邻判别10.3判别结果评价10.4ROC曲线和AUC8.3.1Logistic模型模型的定义8.3.2Logistic模型的优化目标第10章判别分析10.1贝叶斯判别贝叶斯决策论(Bayesiandecision-theory)是概率框架下实施决策的基本方法.对分类任务来说,在所有相关概率都已知的理想情形下,贝叶斯决策论考虑如何基于这些概率和误判损失来选择最优的类别标记.下面我们以多分类任务为例来解释其基本原理。基于贝叶斯定理有

(10.1)估计类条件概率的一种常用策略是先假定其具有某种确定的概率分布形式,再基于训练样本对概率分布的参数进行估计。事实上,概率模型的训练过程就是参数估计(parameterestimation)过程对于参数估计,因此,可假定参数服从一个先验分布,然后基于观测到的数据来计算参数的后验分布.本节介绍源自频率主义学派的极大似然估计(MaximumLikelihoodEstimation,简称MLE),这是根据数据采样来估计概率分布参数的经典方法。

(10.2)第10章判别分析10.1.3朴素贝叶斯分类器

朴素贝叶斯分类器应用案例:第10章判别分析10.2K近邻判别K临近算法(K-NearestNeighbors,简称KNN)是一种经典的监督学习算法,广泛应用于分类和回归问题中。图10.1出了近邻分类器的一个示意图。显然,

是一个重要参数,当取不同值时,分类结果会有显著不同。另一方面,若采用不同的距离计算方式,则找出的“近邻”可能有显著差别,从而也会导致分类结果有显著不同。图10.1K近邻分类器示意图第10章判别分析10.2SVM支持向量机(SupportVectorMachine,简称SVM)是一种基于统计学习理论的监督学习方法,广泛应用于分类和回归领域。简单来说,SVM是一种用于二分类任务的模型,其基本形式是一个在特征空间中具有最大间隔的线性分类器。SVM的学习过程以“间隔最大化”为目标,从而提高模型的泛化能力。在二维平面上,H3是最优分类器:H1无法区分两类数据,H2间隔小易受噪声影响,H3间隔大提高泛化和准确性。

在SVM中,p维特征对应p-1维超平面,SVM选择间隔最大的超平面作为分类器。SVM最初用于线性可分数据,后发展为线性可分SVM、线性SVM和非线性SVM以适应不同需求。硬间隔SVM有一个非常重要的前提假设:训练数据是线性可分的。举个例子:假设我们有两个类别的点,红色的点和蓝色的点。所有红点都在左边,所有蓝点都在右边,并且它们之间没有重叠。此时,我们可以画一条直线将红点和蓝点完全分开,这种情况下数据是线性可分的。硬间隔SVM就是在这种情况下使用的。在前面的硬间隔(HardMargin)SVM中,我们假设数据是线性可分的,即可以找到一个超平面完全将两类数据分开。然而,在现实任务中,这种假设往往不成立。数据可能存在噪声或异常值,使得数据无法线性可分。即使数据线性可分,过于严格的硬间隔条件可能导致模型对数据的微小扰动过于敏感,容易导致过拟合。为了应对这些问题,允许SVM在少量样本上出错,即将之前的硬间隔最大化条件放宽一点,软间隔(SoftMargin)SVM应运而生,即允许少量样本不满足约束。即软间隔SVM将其放宽为:

(10.4)

上述介绍的都是线性问题,但在实际应用中,许多数据是非线性可分的,即在原始特征空间中无法用一个线性超平面将不同类别的数据分开。。因此,需要引入非线性SVM来处理更复杂的情况。非线性支持向量机是一种用于解决非线性分类问题的机器学习方法。它通过非线性映射将数据从原始空间映射到高维特征空间,在高维特征空间中寻找一个线性分类器(超平面)来实现非线性分类。非线性SVM的核心思想是利用

核方法(KernelTrick),将原始特征空间中的数据通过一个非线性映射投影到高维特征空间。在高维空间中,数据可能是线性可分的,然后在高维空间中构造线性分类器。

第10章判别分析10.3判别结果评价判别结果评价的目标是从多个维度衡量分类模型的性能,确保模型不仅在训练数据上表现良好,还能在测试数据或实际应用中具有足够的泛化能力。评价的核心目标主要为整体分类能力、鲁棒性、泛化能力以及计算效率。混淆矩阵(ConfusionMatrix)是分类问题中非常重要的工具,它可以帮助我们从多个维度分析分类模型的性能。它将模型的预测值与实际值进行比较,从而揭示模型在不同类别上的表现。混淆矩阵特别适用于二分类和多分类问题。在二分类问题中,混淆矩阵的结构如下基于混淆矩阵的评价指标,准确率(Accuracy)是最常用的指标,表示所有样本中被正确分类的比例。准确率的表示为

(10.5)实际类别/预测类别预测正类(Positive)预测负类(Negative)实际正类(Positive)真正例(TP)假负例(FN)实际负类(Negative)假正例(FP)真负例(TN)准确率简单直观,适用于类别分布均衡的场景。但在类别不平衡的情况下(例如正类样本极少),准确率可能掩盖模型的真实性能。精确率(Precision)衡量的是模型预测为正类的样本中,实际为正类的比例。精确率的表示为

(10.6)高精确率意味着模型对正类的预测更谨慎,但可能会牺牲一些召回率。召回率(Recall)衡量的是实际为正类的样本中,被模型正确识别的比例。召回率的表示为

(10.7)高召回率意味着模型更倾向于将样本预测为正类,但可能会导致更多误报。F1分数(F1Score)是精确率和召回率的调和平均,综合考虑了两者的平衡。F1分数的表示为

(10.8)当需要在精确率和召回率之间找到一个平衡点时,适合使用F1分数。特异性(Specificity)衡量的是实际为负类的样本中,被模型正确识别的比例。特异性的表示为

(10.9)

第10章判别分析10.4ROC曲线和AUCROC(ReceiverOperatingCharacteristicCurve),即“受试者工作特征曲线”。它最初来源于信号检测理论,用于评估雷达信号的检测效果,现在广泛用于分类模型的性能评估。ROC曲线用于评估模型在不同阈值下的分类能力,通过分析模型在分类任务中真阳性率(TruePositiveRate,TPR)和假阳性率(FalsePositiveRate,FPR)之间的关系,绘制出一条曲线。其中真阳性率(召回率)表示所有实际为正的样本中,被正确预测为正的比例

(10.10)假阳性率表示所有实际为负的样本中,被错误预测为正的比例

(10.11)如图所示,ROC曲线的本质是通过调整分类阈值,观察模型在真阳性率和假阳性率之间的权衡。ROC曲线以假阳性率为横轴,真阳性率纵轴,绘制出模型在不同阈值下的表现。

AUC(AreaUndertheCurve),即“曲线下的面积”。AUC的值表示ROC曲线下方的面积,范围在[0,1]之间。它可以被看作是模型整体分类能力的一个量化指标。当AUC=1时,模型为完美分类模型,ROC曲线经

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论