模式识别与数据挖掘 课件 -第4章-统计决策_第1页
模式识别与数据挖掘 课件 -第4章-统计决策_第2页
模式识别与数据挖掘 课件 -第4章-统计决策_第3页
模式识别与数据挖掘 课件 -第4章-统计决策_第4页
模式识别与数据挖掘 课件 -第4章-统计决策_第5页
已阅读5页,还剩49页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第四章

统计决策方法主讲人:某某某PatternRecognitionandDataMining模式识别与数据挖掘目录Contents贝叶斯分类概述BayesianClassification贝叶斯决策BayesianDecision参数估计方法ParameterEstimationMethods非参数估计方法Non-parametricEstimationMethods01020304引言统计决策理论是处理模式分类问题的基本理论之一,对模式分析和分类器(classifier)的设计起指导作用。统计决策的目标,是在不确定性条件下,通过利用样本的统计特性与概率模型,对未知样本做出最优的类别判断。为此,本章首先从贝叶斯分类的基本原理出发,说明如何利用先验概率、类条件概率密度以及贝叶斯公式构建最小错误率或最小风险的最优决策规则。随后,结合正态分布等常见模型,通过判别函数形式进一步阐释贝叶斯分类器的结构与决策边界的形成机制。在概率模型未知的情况下,本章还介绍了最大似然估计、贝叶斯估计及非参数估计(如Parzen窗与k近邻估计)等方法,为实际应用中概率密度函数的估计提供了可行途径。引言客观现象或事物的发生和发展,按照“可预见性”可分两类情况—确定性和随机性。随机性事物的结果无法预知,但具有统计规律。随机性事物的特征观察值是随机变量。特征的观察值总含有某种误差,其具有一定的随机性;而且同类的不同对象的某个特征的值通常也是按某种规律散布的。模式类别和判决结果的随机性用概率统计的理论和方法来解决识别问题是合理的。引言统计决策方法的要点:将模式的特征量考虑为符合某种统计规律(概率密度/分布函数)的随机量。而任一个样本是取自总体中的一个个体。需要解决三个问题:判别问题:已知若干总体分布,当给出一个个体样本时,要确定这个样本属于哪个总体?训练问题:已知一些个体样本,分别属于某些总体,要确定这些总体的分布规律(或参数)。误判率问题:研究运用上述模型所造成的误判率的计算。贝叶斯分类概述01BayesianClassification概念和名词约定样本sample:待研究对象的个体,包括性质已知或未知的个体(统计学中有不同的约定)。类别class:将所研究的样本性质离散化成有限的类别,认为同一类的样本在该性质上是不可区分的。类别用ωi(i=1,2,…,c,共c类)表示;如两个类别用ω1,ω2表示,也可用{-1,1}表示。已知样本:类别情况已知的样本。未知样本:类别情况未知的样本。样本集:若干样本的集合,分已知样本集和未知样本集。概念和名词约定特征features:样本的任何可区分的且可观测的方面(属性)。包括定量特征和定性特征,通常最后转化为定量特征。特征向量featurevectors:样本的所有特征组成的d维向量。是样本在数学上的表达,因此也称为样本。特征空间featurespace:d维特征向量的所有可能取值范围构成的d维特征空间。每一个样本(特征向量)是该空间中的一个点,一个类别是该空间中的一个区域。概念和名词约定分类器classifier:能够将每个样本都分到某个类别中去(或者拒绝)的计算机算法。是从特征空间到决策空间的映射。Decisionregion:分类器将特征空间划分为若干区域(决策域)。Decisionboundary:不同类别区域之间的边界称作分类边界、决策边界或分类面,决策面。贝叶斯定理贝叶斯定理(Bayestheorem)是概率论中的一个重要定理,它描述了在已知某些条件下事件发生的概率。贝叶斯定理的核心思想是通过已知的先验概率和条件概率来推断未知的后验概率。P(A|B)是在事件B发生的条件下事件A发生的概率。P(B|A)是在事件A发生的条件下事件B发生的概率。P(A)是事件A发生的先验概率,即在没有考虑任何其他相关证据的情况下事件A发生的概率。P(B)是事件B发生的先验概率。一个简单的例子

一个简单的例子

一个简单的例子

贝叶斯分类理论概述贝叶斯决策理论是解决模式分类问题的一种基本统计途径。对问题的要求/条件:决策问题可以用概率的形式来描述;所有有关的概率结构均已知。出发点是利用概率的不同分类决策和相应的决策代价之间的定量折中。对于同一个问题,采用不同的决策标准将得到不同意义下“最优”的决策。其中最具代表性的是:最小错误率最小风险最小错误率贝叶斯决策

似然比决策面

两类错误率及评价指标

状态决策阳性阴性阳性真阳性

(TP)假阳性

(FP)阴性假阴性

(FN)真阴性

(TN)两类错误率及评价指标

状态决策阳性阴性阳性真阳性

(TP)假阳性

(FP)阴性假阴性

(FN)真阴性

(TN)两类错误率及评价指标ROC(Receiver

OperatingCharacteristic)曲线AUC(Area

Under

ROC

curves)曲线下面积理想情况AUC=1没有分类能力AUC=0.5贝叶斯决策02BayesianDecision最小错误率贝叶斯决策

似然比决策面

最小错误率贝叶斯决策

最小风险贝叶斯决策

损失函数

正态分布时的贝叶斯决策

正态分布的性质

正态分布的性质

正态分布下的贝叶斯决策

特殊情况下的正态分布的贝叶斯决策

特殊情况下的正态分布的贝叶斯决策

特殊情况下的正态分布的贝叶斯决策

参数估计方法03ParameterEstimationMethods引言

基本概念参数估计已知概率密度函数形式,估计未知或部分未知参数非参数估计–概率密度函数形式未知几个名词统计量,样本的某种函数参数空间,未知参数全部可容许值组成的集合点估计,估计量和估计值区间估计最大似然估计

最大似然估计

最大似然估计

最大似然估计

最大似然估计

贝叶斯估计

贝叶斯估计

贝叶斯估计

贝叶斯估计

贝叶斯估计

非参数估计方法04Non-parametricEstimationMethods概率密度估计的非参数方法基本思想样本的密度函数形式未知有些情况样本的分布很难用函数形式描述直接用样本估计整个函数可以看作从所有可能的函数中进行选择概率密度估计的非参数方法

直方图方法

直方图方法

一维情况下不同样本数目估计效果Parzen窗法

Parzen窗法

Parzen窗法

Parzen窗法不同样本数和参数下的Parzen估计小结统计决策的基本原理就是根据各类特征的概率模型来估算后验概率,通过比较后验概率进行决策。借助贝叶斯公式,后验概率的比较可以转化为类条件概率密度的比较,离散情况下也是类条件概率的比较,而这种条件概率或条件密度则反映了在各类的模型下观察到的当前样本的可能性或似然度。根据面对的具体问题不同,各类特征的概率模型可能会变得非常复杂,但是基本的求解步骤和决策原理是一致的。当概率密度函数未知时,首先要对它进行估计,这就将模式识别问题转化为概率密度函

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论