第二章 贝叶斯决策理论与统计判别方法汇总_第1页
第二章 贝叶斯决策理论与统计判别方法汇总_第2页
第二章 贝叶斯决策理论与统计判别方法汇总_第3页
第二章 贝叶斯决策理论与统计判别方法汇总_第4页
第二章 贝叶斯决策理论与统计判别方法汇总_第5页
已阅读5页,还剩47页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第二章贝叶斯决策理论与统计判别方法课前思考1、机器自动识别分类,能不能避免错分类,如汉字识别能不能做到百分之百正确?怎样才能减少错误?2、错分类往往难以避免,因此就要考虑减小因错分类造成的危害损失,譬如对病理切片进行分析,有可能将正确切片误判为癌症切片,反过来也可能将癌症病人误判为正常人,这两种错误造成的损失一样吗?看来后一种错误更可怕,那么有没有可能对后一种错误严格控制?3、概率论中讲的先验概率,后验概率与概率密度函数等概念还记得吗?什么是贝叶斯公式?4、什么叫正态分布?什么叫期望值?什么叫方差?为什么说正态分布是最重要的分布之一?学习目标这一章是模式识别的重要理论基础,它用概率论的概念分析造成错分类和识别错误的根源,并说明与哪些量有关系。在这个基础上指出了什么条件下能使错误率最小。有时不同的错误分类造成的损失会不相同,因此如果错分类不可避免,那么有没有可能对危害大的错分类实行控制。对于这两方面的概念要求理解透彻。这一章会将分类与计算某种函数联系起来,并在此基础上定义了一些术语,如判别函数、决策面(分界面),决策域等,要正确掌握其含义。这一章会涉及设计一个分类器的最基本方法——设计准则函数,并使所设计的分类器达到准则函数的极值,即最优解,要理解这一最基本的做法。这一章会开始涉及一些具体的计算,公式推导、证明等,应通过学习提高这方面的理解能力,并通过习题、思考题提高自己这方面的能力。本章要点1、机器自动识别出现错分类的条件,错分类的可能性如何计算,如何实现使错分类出现可能性最小一一基于最小错误率的Bayes决策理论2、如何减小危害大的错分类情况一一基于最小错误风险的Bayes决策理论3、模式识别的基本计算框架一一制定准则函数,实现准则函数极值化的分类器设计方法4、正态分布条件下的分类器设计5、判别函数、决策面、决策方程等术语的概念6、Bayes决策理论的理论意义与在实践中所遇到的困难知识点

§2.1引言在前一章中已提到,模式识别是一种分类问题,即根据识别对象所呈现的观察值,将其分到某个类别中去。统计决策理论是处理模式分类问题的基本理论之一,对模式分析和分类器的设计起指导作用。贝叶斯决策理论是统计模式识别中的一个基本方法,我们先讨论这一决策理论,然后讨论涉及统计判别方法的一些基本问题。在描述本章所要讨论的问题之前,再提一下对于待识别的物理对象的描述问题。假设一个待识别的物理对象用其d个属性观察值描述,称之为d个特征,这组成一个d维的特征向量,而这d维待征所有可能的取值范围则组成了一个d维的特征空间。为了说明这句话,我们讨论一个具体的例子。假设苹果的直径尺寸限定在7厘米到15厘米之间,它们的重量在3两到8两之间变化。如果直径长度x用厘米为单位,重量y以两为单位。那么,由x值从7到15,y值从3到8包围的二维空间就是对苹果进行度量的特征空间。贝叶斯决策理论方法所讨论的问题是:已知总共有c类物体,也就是说待识别物体属于这c类中的一个类别,对这c类不同的物理对象,以及各类在这d维特征空间的统计分布,具体说来是各类别3i=1,2,…,c的先验概率P(3i)及类条件概率密度函数p(x|3i)已知的条件下,如何对某一样本按其特征向量分类的问题。由于属于不同类的待识别对象存在着呈现相同观察值的可能,即所观察到的某一样本的特征向量为X,而在c类中又有不止一类可能呈现这一X值,这种可能性可用P(3i|X)表示。如何作出合理的判决就是贝叶斯决策理论所要讨论的问题。下一节讨论几种常用的决策规则,接着要分析正态分布时统计决策的问题以及错误概率等问题。由于这种决策理论基于已知概率分布为前提,因此在本章还要讨论概率密度函数的估计问题。上一章提到机器实现自动分类有两大类方法:一种是模板匹配方法,而另一种就是对特征空间划分为子空间(每类的势力范围)的方法。本章是针对第二种方法的。核心问题是:样本为特征向量X时,它属于哪一类可能性有多大,如能确定属于各个类别的百分比(概率),分类决策就有了依据。例如某个样本的特征向量为X,X属于第一类样本的可能性为60%,而第二类的可能性为40%。在没有任何样本信息的情况下,则应将样本决策为第一类以使错分类可能性小(40%),这就是这一章考虑分类问题的出发点。§2.2几种常用的决策规则本节将讨论几种常用的决策规则。不同的决策规则反映了分类器设计者的不同考虑,对决策结果有不同的影响。其中最有代表性的是基于最小错误率的贝叶斯决策与基于最小风险的贝叶斯决策,下面分别加以讨论。基于最小错误率的贝叶斯决策一般说来,C类不同的物体应该具有各不相同的属性,在d维特征空间,各自有不同的分布。当某一特征向量值X只为某一类物体所特有,即flk=1对其作出决策是容易的,也不会出什么差错。问题在于出现模棱两可的情况。此时,任何决策都存在判错的可能性这一节讨论的是使错误率为最小的决策方法,称为基于最小错误率的贝叶斯决策理论。最小错误率是在统计的意义上说的,请注意其含义。在这里要弄清楚条件概率这个概念。P(*|#)是条件概率的通用符号,在T后边出现的#为条件,之前的*为某个事件,即在某条件#下出现某个事件*的概率。P(3k|X)是表示在X出现条件下,样本为3k类的概率。一个事物在某条件下出现的概率P(*|#)与该事件在不带任何条件下出现的概率(写成P(*))是不相同的。例如全世界人口有60亿。因此你见到一个人在不带任何条件下,有20%的可能性是中国人P(*)=0.2,但是如果你在中国,或香港、台湾,那么中国、香港、台湾都是指一种条件(#),这种地理条件下,你所见到的某一个人是中国人(*)的概率就要大得多,此时P(*|#)就应该大于20%,甚至更多了。下面先讨论一个例子——癌细胞的识别,以此说明解决问题的过程。假设每个要识别的细胞已作过预处理,并抽取出了d个特征描述量,用一个d维的特征向量X表示,识别的目的是要依据该X向量将细胞划分为正常细胞或者异常细胞。这里我们用表示是正常细胞,而^2则属于异常细胞。类别的状态是一个随机变量,而某种状态出现的概率是可以估计的。概率的估计包含两层含义,一是由统计资料表明,正常细胞与异常细胞在统计意义上的比例,这称为先验概率P(叫)及P(32),另一种则分别表示所检查细胞呈现出不同属性的概率密度函数P(X|叫)和P(x|32),显然在一般情况下正常细胞占比例大,即P(叫)>P(32),因此如果我们不对具体的细胞化验值作仔细观察,我们作出该细胞是正常细胞的判决,在统计的意义上来说,也就是平均意义上说,错判可能性比判为异常细胞时小。但是仅按先验概率来决策,就会把所有细胞都划归为正常细胞,并没有达到将正常细胞与异常细胞区分开的目的。这表明由先验概率所提供的信息太少。为此我们还必须利用对细胞作病理分析所观测到的信息,也就是所抽取到的d维观测向量。为简单起见,假定只用其一个特征进行分类,即d=1,并已知这两类的类条件概率密度函数分布已知,如图2.1所示,其中P(x|叫)是正常细胞的属性分布,P(x|32)是异常细胞的属性分布。那末,当观测向量为X值时,它属于各类的概率又是多少呢?为此我们可以利用贝叶斯公式,来计算这种条件概率,称之为状态的后验概率P(3jX)。Bayes(贝叶斯)公式是根据联合概率这一概念推出的,同时出现两个事件X及卩的概率为P(X,3j)。它是某个条件出现的概率(如P(3)),以及在此条件下某事件出现概率(P(xg))的乘积,在此写为:P(x,wi)=P(x|wi)P(wi)=P(wi|x)P(x)。先验概率是针对,i二12…,C,这c个事件出现的可能性而言的,不考虑其它任何条件。例如世界上有60亿人口,而中国人口12亿,因此不管其它条件,应有20%的可能是中国人。类条件概率密度函数P(x|3j)是指条件下在一个连续的函数空间出现X的概率密度,在我们这里指第类样本,他的属性X是如何分布的。(2-1)式表明,在得到一个待识别量的观测状态X后,我们可以通过先验概率P(3i)及类别条件概率密度函数P(x|3i),得到呈现状态X时,该样本分属各类别的概率,显然这个概率值可以作为我们识别对象判属的依据。上例中图2.1表示的类条件概率可用式(2-1)换算成如图2.2所示的后验概率分布。可以看出,在X值小时,细胞被判为正常是比较合理的,判断错误的可能性小。基于最小错误概率的贝叶斯决策理论就是按后验概率的大小作判决的。这个规则又可以写成如下几种等价形式:如果,则恥®(2-2)如用先验概率及类条件概率密度函数表示,则有:0.5图2.20.5图2.2P(Wi|X)P(W|X)如果呵咄⑹隹玖*叫),贝严4(2-3)以比值的方式表示,心)=昨匈>沁如果,则,否则恥巴(2-4)(4)(2-4)式还可改写成为对数形式,若则,否则恥旳(2-5)g)其中(2-4)式中的l(x)在统计学中称为似然比,而汛巴)称为似然比阈值。而式(2-5)中h(x)是似然比写成相应的负对数形式。它的好处是,与利用(2-4)式本身相比较,进行计算更为方便。面举一数值例子。例2.1。假设在某地区切片细胞中正常(叫)和异常(32)两类的先验概率分别为P(叫)=0.9,P(32)=0.1。现有一待识别细胞呈现出状态x,由其类条件概率密度分布曲线查得p(x3J=0.2,p(x|32)=0.4,试对细胞x进行分类。解:利用贝叶斯公式,分别计算出状态为x时叫与32的后验概率而^1^0=1-^1^0=0.182根据贝叶斯决策(2-2)则有P(w1|x)二0.818>P(32|x)二0.0182因此判定该细胞为正常细胞比较合理。请用公式(2-3)与(2-5)计算,检查一下结果是否一样?从这个例子可以看出,尽管类别32呈现出状态x的条件概率要高于类呈现此状态的概率,但是考虑到P(叫)远大于P(32),因此状态x属于类别叫的可能性远比属于类别32的可能性大。将该细胞判为正常在统计的意义上讲出错率要小得多。为了帮助搞清楚一些基本概念,我们还要强调一下条件概率这个概念。我们举出两对概率,一对是P(31|x)和P(32|X),另一对是P(X|叫)和P(x|W1)o从表面上看,只是条件符号两边的项对换了位置,但实质上却有很大区别。前一对是在同一条件x下,比较叫与32出现的概率,如果我们只考虑两类叫和32,则有P(3[im+PgzIxPI。而对两者进行数值上的比较,如P(3")>P(32|X)则可以下结论,在X条件下,事件叫出现的可能性大。对后一对概率来说,与第一对完全不同,因为它们是在不同条件下讨论的问题。因此比较两者没有意义,而且即使只有两类叫与叫,P(X|W1)+P(X|W2)*1o这里要特别强调一点是P(X|叫)与P(X|32)两者没有联系,都是指各自条件下出现X的可能性,不能仅因为前者比后者大,就认为X是第一类事物的可能性较大,只有考虑先验概率这一因素,才能决定X条件下,3[类还是32类的可能性比较大。另外大家可能觉得比较奇怪,为什么后验概率要利用Bayes公式从先验概率和类条件概率密度函数计算获得。这是因为计算概率都要拥有大量数据才行。在估计先验概率与类条件概率密度函数时都可搜集到大量样本,而对某一特定事件(如x)要搜集大量样本是不太容易的。因此只能借助Bayes公式来计算得到。对基于最小错误率的贝叶斯决策来说,以后验概率值的大小作判据是最基本的方法,而其它形式的作用都基本相同,但使用时更方便些。以上讨论的是在两类情况下基于最小错误概率的贝叶斯决策规则,下面需证明按这种规则进行分类确实使错误率为最小。下面仅以一维情况来证明,其结果并不难推广到多维的情况。由于统计判别方法是基于统计参数作出决策,因此错误率也只能从平均的意义上讲,表示为在观测值可能取值的整个范围内错误率的均值。在连续条件下,平均错误率,以p(e)表示,应有(2-6)(2-6)其中p(e,x)表示错误率为e观测值为x的联合概率密度,P(e|x)是观测值为x时的条件错误概率密度函数,P(x)为x值出现的概率,而积分运算则表示为在整个d维特征空间上的总和。在此一维情况下,x取从到的整个范围。在两类别问题中,按(2-2)式给出的决策规则,当P(w2|x)>p(w1|x)时决策为w2。显然这个决策意味着,对观测值x有P(w1|x)概率的错误率。例如在上例中所作的w1决策,实际上包含有P(w2|x)=0.182的错误概率。在两类别的情况下,可以将p(e|x)表示成当如果我们把作出w1决策的所有观测值区域称为R1,则在R1区内的每个x值,条件错误概率为p(w2|x)。另一个区R2中的x,条件错误概率为p(w1|x)o因此平均错误率P(e)可表示成F@)=上円>|過)芒(x)必+上円>|呵:0)必g8)由于在R1区内任一个x值都有P(w2|x)<P(w1|x),同样在R2区内任一个x值都有P(w1|x)<P(w2|x)错误率在每个x值处都取小者,因而平均错误率P(e)也必然达到最小,这就证明了按(2-2)式作出的决策,其平均错误率为最小。P(W2)P2(e)P(W2)P2(e)P(wi)Pi(e)图2.3P(x|wi)P(wi)P(X|W2)P{W2)为了形象地说明以上证明,图2.3表示了在某种概率分布下R1与R2区的分布情况,该图分别画出P(X|3l)P(3l)及p(x|32)P(32)的分布情况,由于P(e)也可以(2-8)式写成巩型=L尸⑷2|X)/?血)必+f尸(马IX)戸㈣)必(2-9)因此错误率为图中两个划线部分之和,显而易见只有这种划分才能使对应的错误率区域面积为最小。以上讨论的是两类别问题情况,在C类别情况下,很容易写成相应的最小错误率贝叶斯决策规则:尸⑷\X)=maxF(叫I乂)如果,则(2-10)也可将其写成用先验概率与类条件概率密度相联系的形式,得:如果F(乂|廻)尸⑷)=maxP(X\£D..)P(^..),则Ee迴(2-11)至于计算多类别决策过程中的错误率,需把特征空间分割成R1,R2,…,Rc个区域在每个区域Ri统计将所有其它类错误划为该区域对应的i类的概率,则每个区域共有c-1项错误率,总共有c(c-1)计算项,计算是很繁琐的。为此,可以改成计算平均正确分类概率P(c)即(2-12)由于上式中只有c项,计算要简单得多。然后通过式子P(e)=1-P(c),就可计算出平均错误率。例应用贝叶斯决策的肤色提取利用贝叶斯原理,可以建立简单的肤色模型,并用来从图像中提取手部、脸部肤色,进而得到人的身体姿势。我们使用的方法是:1.先在一副训练图象中手工描绘出肤色区域,2.然后统计每种颜色点在肤色区域中出现的次数和在区域外出现的次数的比值,作为这种颜色是肤色的概率,3.这样就得到了一张查找表,表中的每个元素是这个点是肤色的概率我们就得到了一个点是不是肤色的概率分布。4.再加上域值限制之后,认为只有概率大于一定域值的才是肤色。这样,对图中任意一点,查找表中对应的概率,就可以很快的知道它是不是肤色了。基于最小风险的贝叶斯决策上面我们讨论了使错误率最小的贝叶斯决策规则。然而当接触到实际问题时,可以发现使错误率最小并不一定是一个普遍适用的最佳选择。譬如,在上面讨论过的细胞分类的例子中,把正常细胞错分为癌细胞,或相反方向的错误,其严重性是截然不同的。把正常细胞误判为异常细胞固然会给人带来不必要的痛苦,但若将癌细胞误判为正常细胞,则会使病人因失去及早治疗的机会而遭受极大的损失。由此可见,根据不同性质的错误会引起不同程度的损失这一考虑出发,我们宁肯扩大一些总的错误率,但也要使总的损失减少。这会引进一个与损失有关联的,更为广泛的概念——风险。在作出决策时,要考虑所承担的风险。基于最小风险的贝叶斯决策规则正是为了体现这一点而产生的。在讨论基于风险的决策方法的具体内容之前,让我们首先回顾一下上一节讨论的基于最小错误概率的决策方法。从式(2-10)可以看出,在分类时所作的判决(称之为决策)单纯取决于观测值X对各类(也称自然状态)的后验概率中之最大值,因而也就无法估计作出错误决策所带来的损失。为此不妨将作出判决的依据从单纯考虑后验概率最大值,改为对该观测值X条件下各状态后验概率求加权和的方式,表示成Ri(X)=^pP^J.\X)(2-13)沖)其中表示观测样本X实属类别j,而被判为状态i时所造成的损失,R,则表示了观测值X被判为i类时损失的均值。如果我们希望尽可能避免将某状态错判为状态3卩则可将相应的值选择得大些,以表明损失的严重性。加权和Ri用来衡量观测样本X被判为状态卩所需承担的风险。而究竟将X判为何类则应依据所有%,(i=1,…,c)中的最小值,即最小风险来定。我们再从另一角度把这个问题说清楚。我们见到一个病理切片X,要确定其中有没有癌细胞(用叫表示正常,32表示异常),则P(叫IX)与P(32|X)分别表示了两种可能性的大小。如果X确实是癌细胞(32),但被判作正常(叫),则会

有损失,这种损失用冷)表示,X确实是正常(3J,却被判定为异常(32),则损失

表示成,另外为了使式子写的更方便,我们也可以定义潜与入罗是指正确判

断也可有的损失。那么把X判作叫引进的损失应该与冯以及入B都有关,哪一个占主要成分,则取决于P(叫|X)与P(32|X)。因此变成了一个加权和R1(X)=X(J)P(W1|X)+^)P(a)2|X)同样将X判为32的风险就成为B.2(X)=X(12JP(co1|X)+^)P(co2|X)此时作出哪一种决策就要看是R1(X)小还是R2(X)小了,这就是基于最小风险的贝叶斯决策的基本出发点。有关该例的数值例子在例2.2。以上讨论是为了说明这种方法的概念。下面我们给出一些确切的定义。(1)自然状态与状态空间。其中自然状态是指待识别对象的类别,而状态空间Q则是由所有自然状态所组成的空间,Q={3〔,叫,…,叫}(2)决策与决策空间。在决策论中,对分类问题所作的判决,称之为决策,由所有决策组成的空间称为决策空间。决策不仅包括根据观测值将样本划归哪一类别(状态),还可包括其它决策,如“拒绝”等,因此决策空间内决策总数a可以不等于类别数C,表示成卅)损失函数入9冋)(或写成入©凹))。这就是前面我们引用过的。它明确表示对自然状态W,作岀决策q时所造成的损失。观测值X条件下的期望损失R(aJX),班码|天)=士\缸宀)卩阿|天),i=1,2,…,a(2-14)这就是前面引用的符号Ri,也称为条件风险。与式(2-10)类似,最小风险贝叶斯决策规则可写成:|用)=nm应(问IX)如果,则a=ak(2-15)但与(2-10)式不同的是,这里计算的是最小值。与上一小节中基于最小错误概率的决策方法中所引用的平均错误率P(e)相类似,在这里引入一个期望风险R,R=fR(a(X)|X)p(X)dX(2-16)它表示对所有X取值所作的决策a(X)所带来的平均风险。与上一节证明基于最小错误概率的贝叶斯决策方法相类似,当所采取的每一个决策都使其条件风险最小,则对所有的X所作的决策,其期望风险也必然最小。对于实际问题,最小风险贝叶斯决策可按下列步骤进行:在已知P(j),P(X|3j),i=1,…,c及给岀待识别的X的情况下,根据贝叶斯公式计算岀后验概率:j=1,j=1,…,x⑵利用计算出的后验概率及决策表,按式(2-14)计算出采取q,i=1,…,a的条件风险,i=,i=1,2,…,a(3)对⑵中得到的a个条件风险值R(aJX),i=1,…,a进行比较,找出使条件风险最小的决策ak,即则ak就是最小风险贝叶斯决策。例2.2在例2.1条件的基础上,并且已知入『。,(入“表示入gg)的简写),入12=6,入21=1,入22=0,按最小风险贝叶斯决策进行分类。解:已知条件为P(叫)二0.9,P(叫2)二0-1p(X|叫)二0.2,p(X|叫2)二0.r入11二0,入12二6,入21―1,入22二0根据2.1的计算结果可知后验概率为P(叫IX)二0.818,P(叫2|X)二0.182再按式(2-14)计算出条件风险R(眄|X)=工打jF0j|X)=兀FC%|X)=1.092j-iR(吧|X)=$>#(3|X)=X21P(co2|X)=0.818j-i由于R(a1|X)>R(a2|X)即决策为312的条件风险小于决策为的条件风险,因此应采取决策行动a2,即判待识别的细胞X为312类一一异常细胞。将本例与例2.1相对比,其分类结果正好相反,这是因为影响决策结果的因素又多了一个“损失”。由于两类错误决策所造成的损失相差很悬殊,因此“损失”在这里起了主导作用。从以上讨论可以看出,正确制订损失函数值,是基于最小风险的贝叶斯决策方法在实际中使用的一个关键问题。而实际中列出合适的决策表并不是一件容易的事,需根据所研究的具体问题,分析错误决策造成损失的严重程度,与有关专家共同商讨来确定。最后我们再讨论一下上面两种决策方法之间的关系,设损失函数为汎(眄丨⑴J=1二1,j=l,2,...,C,(2-17)

式中假定对C类只有C个决策,即不考虑“拒绝”等其它情况,(2-17)表明,当作出正确决策(即i=j)时没有损失,而对于任何错误决策,其损失均为1。这样定义的损失函数称为0—1损失函数。根据(2-14)式条件风险为(2-18)(2-18)而,也恰恰是将X判为3」时的错误概率。因此基于最小风险的贝叶斯决策结果,在0—1损失函数情况下,也就是基于最小错误概率的贝叶斯决策结果。由此可见,最小错误率贝叶斯决策就是在0—1损失函数条件下的最小风险贝叶斯决策。换句话说,前者是后者的特例。实际上,因此,当最大时出区)最小。实际上,因此,当最大时出区)最小。它与基于最小错误率的贝叶斯决策的判据是一样的。如果我们只考虑两类别问题,并只有一维特征向量的情况,我们可以画出一张与图2.3类似的图2.4,用来表示最小风险贝叶斯决策方法的分类结果。与图2.3不同的是,R1与R2两个区域的分界线不再是t,而是向左移了一段距离,这是由于损失函数入12比入21大所造成(可以假设九二入22二0),在发生位移这一区域内,尽管P(X|3jP(叫)>P(X|叫»P(312),但是为了减少将叫2错判为叫所带来的严重损失,在P(X|叫2)P(312)尚不很小的情况下,使将312类样本错判为叫的可能性减小,以减小决策所承担的风险。当然平均错误率则明显增大了。(2-13)式定义了样本为X作出i决策时的期望风险,可以从两个方面理解。一种是由于样本存在分属各类的可能性,而对实属一类却决策成i类会造成程度不同的损失,因而期望损失应是风险系数心"与相乘之总和。另一种看法可以将损失看成是对后验概率的重要性作加权,兄V是对的加权系数。因此只要稍大一点,就会使风险明显增大。公式(2-17)与(2-18)说明了基于最小错误率与基于最小风险两种Bayes决策的关系,结论是基于最小错误率的决策是基于最小风险决策的一个特例。这是因为后者多了一些系数允许调整,而按(2-17)式调整就将基于最小风险决策改成基于最小错误率决策,这种设置可调整参数集的情况比限定参数集的情况有更大自由度,因此后者必定为前者的一个特定情况。2.2.4判别函数、决策面与分类器设计以上我们讨论了几种常用的决策原则,在这些原则的指导下,可以进行分类器的设计。在讨论分类器设计前,需要说明在分类器设计中使用的一些概念,这就是决策面与判别函数。在前面讨论中曾提到,分类决策实质上是在描述待识别对象的d维特征所组成的特征空间内,将其划分为c个决策域,待识别的特征向量落在哪个决策域,该样本就被判为哪一类。因此决策域的边界面就是决策面,在数学上用解析形式表示成决策面方程。用于表达决策规则的某些函数则称为判别函数。显然判别函数与决策面方程是密切相关的,并且都是由相应决策规则所确定的。例如在两类别问题中,按最小错误率作决策时,决策规则的一种形式是F仙|X)》F®2|X)=X丸],否则X已叫则相应的判别函数就是gi(X)=P(wi|X),i=1,2而决策面方程则可写成g,x)二g2(x)此时决策规则也可以写成用判别函数表示的形式如果gi(X)>gj(X)i,j=1,2且i±j则X門,否则Xw3j至于多类别情况,则对应于一种决策规则要定义一组判别函数g^X),i=1,2,…,c而决策规则可表示成gi(x)=maxg-(X)如果J,则将X归于卩类;多类别情况下的决策面方程比两类问题复杂,并且只有在特征空间中具有相邻关系的决策域的边界面才是有意义的决策面。当3i的决策域与円的决策域相邻时,以下关系决定了相应的决策面gi(X)=gj(X)

此外,决策面是一种统称,当特征空间只是一维时,一个决策面实际上只是一个点。在二维特征空间里,决策面是一条曲线。三维则是一曲面,超过三维的空间,决策面是一个超曲面。图2.5(a)表示了一个三类别问题用一维特征空间时的所有决策边界,而图2.5(b)则表示了相应的二维特征空间中的决策边界。角(x)=q(x)(决策边界)的a2.5(真印自asa编c模式识别》)在讨论了判别函数等概念后,设计分类器的任务就清楚了。分类器可以用软件或硬件实现。图2.6表示了两类别问题分类器的框图,而图2.7则表示了多类别分类器的结构框图。两者主要的不同在于多类别情况需有一个求最大值的环节,在图2.7中用MAX表示,而两类情况则可简化为正负号判别器(阈值单元)。Xi+1删计舞决策Xd图26图27(复印自辺筆棋编《模式识别加IW元Xi+1删计舞决策Xd图26图27(复印自辺筆棋编《模式识别加IW元MAX/M大直語壬器决策分类器设计除了确定结构框图外,问题主要集中在判别函数的选择,使用最小风险决策时合理的损失函数的确定。此外贝叶斯决策理论都是基于统计分布确定的情况下的计算,而统计参数的确定恰恰是最困难的问题。如果要按贝叶斯决策方法设计分类器,就必须设法获得必需的统计参数,这个问题可参看《模式识别基本教程》。前面讨论的Bayes决策理论其实是很简单的,对特征空间任一点X只要能确定落在该点的样本X属于哪一种类的可能性大,就将这点划分到这类的决策域。问题是后验概率P(3j|X)要通过先验概率和类概率密度函数计算。因为Bayes决策是一种通用方法,它只在原理上讲特征空间中符合什么条件才能作为哪一类决策域,而我们希望能把决策域用简便的方式,最好是函数形式划分出来,直接计算判别函数就方便了。显然具体的决策域划分与样本的概率分布有关。下面结合正态分布概率密度函数进行讨论,在讨论结束时我们会发现从中可以得到不少启示。§2.3正态分布时的统计决策到学习2.3节之前我们应该对前面学习的内容进行阶段性的总结。因为前面几节讲的是一些基本概念,而从2.3节开始则将这些概念具体化,在正态分布条件下具体化。前面几节主要应该掌握的是:分类器设计时使用什么原则是关键,他会影响到分类器的效果。应该掌握的是两种最基本的原则。一种是要求错分率最小即完全以减少分类错误为原则。这是一个通用原则,也应该知道基于最小风险的贝叶斯决策的原理。弄清后验概率等几个概念,为什么用后验概率大小来判断就能实现错误率最小?“风险”与“损失”的概念也很重要,通过它们把错分类造成的影响考虑进来了。应该通过下面这几个问题思考一下自己是否掌握基本内容。沖)a•风险系数是怎么定义的?(样本本属于第j类,但如果错分到第i沖)类,会造成的损失)b•为什么对某个样本作第i个决策的风险要按(2-13)或(2-14)等式计算?答案是,一个样本X被错分类时会造成损失,但实际造成的损失还要与后验概率,与的数值成正比。如果X属于的可能性不大,那么它造成的损失所占的比例就小了。c•如果比"比应大得多,那么分类器设计希望避免哪一类错分类?网大则表示这种错误造成的损失大,希望这一类错误尽可能减少。分类所用的计算式都有一个特点,是比较所计算数值谁大谁小。这种函数就称为判别函数,函数的自变量是样本X,故一般表示成gi(X),如果gi(X)=maxgj(X)则称特征空间的这一点X是第i类的决策域。由gi(X)占主导地位的区域称为第i类的决策域,我们将它表示成Ri,如果第i类决策域Ri与第j类决策域相邻,则它们之间有边界。在边界上有gi(X)=gj(X),该式是一个方程式,称为决策面方程。第2.3节主要是结合一种比较典型的概率分布来进一步基于最小错误贝叶斯决策分类器的种种情况。这一节的学习中要抓住哪些重点呢?什么叫正态分布,或高斯分布,它是哪一种概率定义说的?是先验概率P(3i),还是分布P(X|3i),还是后验概率P(3i|X)?对于高斯分布的表达式,要明白它的两个关键,一是均值,另一是协方差矩阵。要懂得如何将正态分布与基于最小错误率的贝叶斯决策结合起来。关键还是要弄清楚正态分布是指对哪一种概率。明白这点就会弄清楚用基于最小错误率决策中的哪个方程式了。由于高斯分布是指数函数,因此计算时常用对数使计算简化,这是一个具体技巧,因为如原式F区)=A(X)e-B冈,则bgF0)就会变成10gF(X)=kgA(X)-B(X),许多重要性质都包含在b(x)中,因此这样进行计算就会简单些。在讨论过程中会引进一些不同分类器的定义,如最小距离分类器、线性分类器等,这些定义也是比较重要的。节中讨论了在一般的概率统计分布情况下的统计决策理论,这一节我们要讨论最常用的正态分布情况。在模式识别及其它信息处理应用系统中,正态分布假设是对各种随机变量使用得最普遍的假设。这主要有两方面的原因:一个最重要的原因是正态分布在数学上比较简便。除了一些极其简单与不甚实用的统计分布模型外,正态分布可说是数学上最简便的一种。数学的简便性便于人们对统计识别方法进行数学分析。正态分布的一些特殊情况还会揭示统计判别方法中许多有趣的性质,有助于我们对统计判别方法加深理解。在模式识别技术的研究中,需要用设计样本集来设计分类器,还需用测试样本集来检验分类器的分类效果,并对不同的分类器设计的性能进行比较,用正态分布模型抽取设计样本集与考试样本集在数学上实现起来也比较方便。另一个很重要的原因是物理上的合理性,缺少这一条,正态分布模型也不可能得到如此广泛的应用。在许多实际应用场合,如果同一类样本在特征空间内的确较集中地分布在其类均值的附近,远离均值处分布较少,那么一般情况下以正态分布模型近似往往是比较合理的。人们也往往因数学分析复杂程度考虑而不得不采用这种模型,当然使用时应注意结果是否合理或关注其可接受的程度。下面我们先简略叙述正态模型的一些基本概念与有关的重要特性,以便后续分析。然后讨论正态分布时统计决策问题。2.3.1正态分布概率密度函数的定义与性质一、单变量正态分布单变量正态分布概率密度函数定义为(2(2-29)式中u表示随机变量X的数学期望,02为其方差,而。则称为标准差。(2-30)(2-30)(2-31)(2-29)表明单变量正态分布概率密度函数p(x)完全可由“与o2两个参数确定,常记作N(u,O2)。正态分布的样本主要集中分布在其均值附近,其分散程度可用标准差来衡量,o愈大分散程度也越大。从正态分布的总体中抽取样本,约有95%的样本都落在区间2o,u+2o)内。首先正态分布是指一个随机实数度量值在整个实数域上的分布规律。因此它属于概率密度函数类,不是我们所讨论的先验概率P(3j),也不是后验概率P(3j|X),而是p(x|3j)。式(2-29)用p(x)表示,是因为通用公式,如具体到我们的情况,可将(2-29)具体化,则p(x|(»1)=^e'^2#2兀b其中卩,oi分别是对(2-29)中3及o的具体化。二、多元正态分布多元正态分布的概率密度函数多元是指样本以多个变量来描述,或具有多个属性,在此一般用d维特征向量表示,X=[x1,…,xd]T。d维特征向量的正态分布用下式表示(2-32)(2-32)其中U是X的均值向量,也是d维,尸E{X}二[山,旳,…,Udh(2-33)为是dxd维协方差矩阵,而Z-1是》的逆矩阵,|Z|是为的行列式为二E{(X-p)(X-M)t}(2-34)为是非负矩阵,在此我们只考虑正定阵,即匡|>0。多元正态分布与单态量正态分布在形式上尽管不同,但有很多相似之处,实际上单变量正态分布只是维数为1的多元分布。当d=1时上只是一个1x1的矩阵,也就是只有1个元素的矩阵,退化成一个数,门1/2也就是标准差o,匚1也就是62,而(X-m)t(X沖)也变成(X-u)2,因此(2-32)也就演变成(2-29)。但是多元正态分布要比单变量时复杂得多,具有许多重要的特性,下面只就有关的特性加以简单叙述。多元正态分布的概率密度函数中的元就是我们前面说得特征向量的分量数,也就是维数。为了方便我们着重讨论二维向量,是一个随机向量,其中每一个分量都是随机变量,服从正态分布。但是一个二维随机向量不仅要求考虑每个分量单独的分布,还要考虑两个随机变量之间的关系。下图的例子中的两个二元正态分布的各个分量是相同的,即它们的期望(“1和p2)方差。1和02都相同,但这两个特征向量在空间的分布却不相同。从下图:对右图来说,x1和x2有很大的相关性,而对左图来说,随机变量x1与x2之间的相关性很小。这可以从两者的区别看出来。对于右图可以看出一个随机变量的x1分量较小时,另一分量x2也必然较小。而当随机变量的x1较大时,则其相应的x2分量也较大。换句话说,如果x1分量小于其均值出,则其相应的分量x2也很可能小于它的均值m2。因此当x1-M1<0时,也常伴有x2-u2<0,这说明它们之间有联系,或称相关性,用(衍一血)(衍一两)这两项相乘来看就有倾向化。对E[(瓦2一戸2)(瓦1一Ml)]:整个随机变量样本集取期望值,就会使有非零值。反过来看左图中的随机变量分布,就没有这种规律,一个随机变量X1分量小于其均值,并不对其相应分量X2与之间的关系有什么限制。在此时一个随机变量(%-山)与E[(X2一阳一Ml)]:(x2-p2)的乘积的符号就可正可负,则就可能接近于零,或等于E[(瓦2一戸2)(瓦1一Ml)]:零。因此我们可以用来衡量这种相关性,称为协方差。则前者的协方差是个正数,而后者很可能为零,协方差越大,说明两个变量的相关度越高。为了将各个分量的方差、协方差都用一个统一的方式表示,则可使用式(2-34),用符号》表示。你如果将(2-34)表示一个二维向量,你就会发现该矩阵的非对角元素正表示了两个分量之间的相关性,而主对角元素则是各分量本身的方差。(2-34)为称为协方差矩阵。(2-34)为称为协方差矩阵。那么以下是上两图特征向量分布的协方差矩阵:和L10.9和L10.90.91,请问哪个是左图,哪个是右图?(前一个是左图)如果是一个三维向量,它的协方差矩阵是几乘几的矩阵?每个元素又对应什么含义?(是个3x3矩阵「5"皿—)闪一聊)还需要指出的是,协方差矩阵并不只对正态分布有用,它是多元随机变量中一个重要的数学统计表示方法,它描述了一个随机变量样本集中各个分量之间的相关性。协方差矩阵还有一些很重要的属性,是经常用到的。其中一个特性是:它是一个对称矩阵。另一个特性是:由于它的主对角元素都是各分量的方差,因此一般情况下都是大于零的值。因此协方差矩是正定的,这一点也是十分有用的。多元正态分布的性质参数U与》对分布具有决定性。这一点与单变量时是相似的,记作p(X)~N(uQ)。等密度点分布在超椭球面上。由于(2-32)是指数函数,因此等密度点对应:

(x-m)tZ-i(x-m)二常数(2-35)在二维情况下,(2-35)的解是一个椭圆轨迹,其长短轴方向由》协方差矩阵的特征向量决定,在三维时则是一个椭球面,超过三维则是超椭球面,主轴方向由协方差矩阵的特征向量决定,各主轴的长度则与相应的特征值成正比。在数理统计中把(X-u)tZ-i(X-u)称为向量X到向量u的Mahalanobis距离的平方,即r2=(x-u)tZ-i(x-u)(2-36)按此定义多元正态分布等密度点X的轨迹是到u的Mahalanolbis距离为常数的超椭球面。(2-36)式在二维时表示一个椭圆,在三维表示椭球,在高维是表示超椭球,这是一个二次型问题,在线性代数中学过,为了复习,读者可以用二维的例子来计算。简便起见,设(2-35)例子来计算。简便起见,设(2-35)式中01试求满足此条件的曲线。I手+3(k丿,故得,为一个椭圆)可将mahalanolbis距离与欧氏距离作比较,前者是一个椭圆,而后者则是圆。请问可以用(2-43)表示欧氏距离吗?Z二?(Z=I是单位矩阵)多元正态分布的离散程度由参数|Z|i/2决定,这与单变量时由标准差o决定是对应一致的。不相关性等价于独立性。在数理统计中一般情况下,两个随机变量xi与Xj之间不相关,并不意味着它们之间一定独立。不相关只表明E[XjXj]二E[x}E[Xj],即两变量乘积的期望值等于这两变量期望值之乘积,而只有卩(知勺二p(x)p(Xj),即两变量的联合密度函数等于两者概率密度函数的乘积,这两个随机变量才是独立的。但反过来相互独立的随机变量,它们之间也是不相关的。然而对多元正态分布的任意两个分量谷与Xj而言,如果谷与Xj不相关,则它们之间也一定是独立的,也就是说正态分布中不相关性等价于独立性。边缘分布和条件分布的正态性。多元正态分布的边缘分布和条件分布仍然是正态分布。这就是说多元正态的随机向量,就其每个分量单独的分布而言,也是正态分布的。另一方面,对某个分量或若干个分量保持常数的条件下样本的分布也仍然是正态的。线性变换的正态性。这是指多元正态分布的随机向量的线性变换仍然是多元正态分布的随机向量。如果设X[X1,X2,…,Xd]T,是具有均值向量U,正定协方差矩阵为》的正态随机向量,现对X作线性变换得丫二AX,其中A是非奇异的线性变换矩阵,则丫也是正态分布的,它的均值向量为Au,而协方差矩阵为AZAto这表明经线性变换后,原正态分布的样本可变为另一参数不同的正态分布样本。同时由于协方差矩阵》是对称矩阵,因此总可以找到某个线性变换A,使变换后的协方差矩阵AZAt成为对角矩阵,这就意味着在某一个新的坐标系统中,可以做到使各分量之间是相互独立的。这一性质对解决某些模式识别问题有重要意义。线性组合的正态性。这是指多元正态分布的随机向量,在经过线性组合后得到的一维随机变量也是正态分布的。用式子表示为,若X=[x1,…,xd]t,0是与其同维的某个向量,如用a对X实行线性组合得丫二qtx,则丫的分布仍然是正态的。2.3.2正态分布概率模型下的最小错误率贝叶斯决策在正态分布条件下最小错误率贝叶斯分类器有些特殊的性质,可使判别函数及决策面方程计算得到不同程度的简化。下面我们从最简单的情况开始讨论,然后逐渐涉及较一般的情况。一、最小距离分类器情况采用(2-3)式表示的决策规则,即p(X|⑴i)F(q)=maxp(X|wJPfwJ,i,j二1,…,u如果则Xewi因此判别函数为P(Xl°i)P(Oi),其中pCX|s」是多元正态分布,可表示成P(X1s」〜N。考虑到正态分布函数是指数函数形式,判别函数采用对数形式则更为方便,因此判别函数可写成:gi(X)=-寺区-旳)丁塑(X-厲)-fin2x-iln|Si|+lnF〔q)(2-37)而相应的决策面方程为即

(2-38)(2-38)在正态分布的某一种特殊情况下,最小错误率贝叶斯分类器可演化成最小距离分类器。最小距离分类器的定义是,每个样本以它到每类样本均值的欧氏距离的最小值确定其分类,即如果IIX—5—min||X—、||豎1,冋…,C则XM(2-39)样本分布满足以下正态分布条件时,最小错误分类器与(2-39)表示的决策规则相当;S£=0EI,P(o£)=1/031=^">c其中I是dxd维单位矩阵,即TOC\o"1-5"\h\zCF2-■■0Sj=■CT2--■0■CF2以上条件表明,c类样本都以半径相等的超球面形状分布在特征空间内,且具有相等的先验概率。图2.8(a)表示一个在二维特征空间中满足上述条件的两类别问题示意图,图中两类分布为两个相同的同心园,图中山与旳为其圆心。

(2-40)由于决策是根据各判别函数之间的大小,因而在(2-40)中一些与类别无关的项可以忽略,再加上先验概率相等这个条件,判别函数可简化成(2-41)(2-41)由此可见,在这种条件下,最小欧氏距离是决定分类的准则。图2.8(a)表示了两类别情况下山与旳连线的垂直平分线是其决策面图2.8(b)则画出多类别的情况,它们分别是相邻区域的垂直平分线组合而成。图2.8

前面我们曾经提到过分类的两种基本方法中的一种——模板匹配,最小距离分类器就可看作模板匹配。每个类有一个典型样本(即均值向量),称为模板,而待分类样本X只要按欧氏距离计算与哪个模板最相似(欧氏距离最短)即可作决定。二、线性分类器决策面为超平面的分类器称为线性分类器。有不止一种正态分布概率模型,可使最小错误率贝叶斯决策的决策面具有超平面形式。这里我们讨论两种情况。》i=O2li=1,…,c这种情况与上一种情况不同之处在于并不要求各类的先验概率相等这个条件。在这种情况下,判别函数可从(2-40)简化为(2-42)(2-42)(2-42)是X的二次函数,但是由于二项XtX与类别号i无关,因此判别函数可进一步简化成(2-43)(2-44)+(2-43)(2-44)+(2-45)WjD=—kii/20E+liiP(QJ(2-45)可见判别函数为一线性函数。根据决策面方程gi(X)-gi(X)二0可有(2-46)(2-46)利用-此旳=(Mi-声扩(Mi-声j)及仏i一幻)丫血:一幻)=代入(2-46)并整理,可得Wt(X-X0)=0(2-47)其中W=Mi-pj(2-48)由(2-47)与(2-48)式可以看出,决策面为一超平面,其法线方向为(片-叩,当P(3)二P(叫时该超平面过(片+叩/2点,在二维情况下,就是过片与H连线的垂直平分线,如图2.8(a)所示。当P(3j)±P(3j)时,该超平面的位置要向远离先验概率大的方向偏,但超平面方向不变。从上面讨论的最小距离分类器与线性分类器中可以看出,这两者都是线性分类器,最小距离分类器是线性分类器的一个特例。另一点是最小距离分类器在正态分布情况下,是按超球体分布以及先验概率相等的前提下,才体现最小错误率的。最小距离分类器的思想在分类器设计中是一种较常用的方法。以上分析表明,只有在一定条件下,最小距离分类器同时又是最小错误率分类器。实际上,最小距离分类器的概念是分类器中是最常用的,因为它体现了基于最相似性的原则,即被分类事物与哪一种作为标准的事物相像,就判为该类这一原则。在这一节的分析则说明了什么条件下最小距离分类器同时实现了最小错误率。在正态分布条件下,一是正态分布的协方差矩阵为单位矩阵,因此等概率密度点轨迹对应于欧氏距离为常数;另一是先验概率要相等,这一点在解实际问题中往往加以忽略,因为先验概率难以得到。能采用线性分类器的另一种简单情况是Zi=Z,即各类的协方差矩阵都相同。从几何上看,这相当于各类样本具有同样概率密度函数的点的轨迹是同样大小和形状的超椭球面。但不同类样本的超椭球面的中心由类均值H决定。图2.9表示在二维特征空间的情况,此时超椭球面是二维空间的椭圆。在Zi=Z,i=1,…,c的条件下,由于为与类别号i无关因此判别函数可从(2-37)简化成gi(X)=—1/2(X—|J.i)'rS_l(X—|-|-£)+InP(oJ(2_49)如果c类先验概率都相等,则(2-49)可进一步简化为吕=严=徑-⑷『汩徑-毘)(2_50)(2-50)的右边正是前面提到的Mahalanobis距离的平方。因此这时的决策规则为:计算X到每类均值片的Mahalanobis距离平方r2,把它归于「2最小的类别。为了确定先验概率不等条件下的决策面方程,可以展开(2-49)并忽略与i无关的XtZ-iX项,经整理可得gi(X)(2_51)其中Wi=S_'^i(2-52)

计一扫—严叽(2-53)由(2-51)可以看出决策面方程也是线性方程,决策面是超平面。如果第i类与第j类的决策域在特征空间中相邻,则这两者之间的决策面方程为gi(X)-gj(X)二0即逾m=0(2-54)其中用=迟7(□厂、)(2-55)(2-56)(2-56)如果将(2-55)、(2-56)与(2-47)、(2-48)的两个式子相比较,可以发现这两对式子很相近,只是(2-48)中的欧氏距离||叮屮|2在(2-56)中由Mahalanobis距离的平方所取代。另一点是W在式(2-55)中多了一个Z-1因子。因此可以作出相应结论:当P(3)二P(3j)时,其相应的决策面超平面过均值向量连线的中点;但当先验概率不等时,超平面朝远离先验概率大的方向移动。与上一小节不同的是,一般情况下该超平面不与两均值向量的连线正交。图2.9画出在二维特征空间先验概率相等的情况。到此为止将上面讨论的情况总结一下,以有利于加深理解。以上几种情况都是线形分类器的情况,也就是用线形函数作为判别函数,或分界面方程是线性。在正态分布条件下,基于最小错误率贝叶斯决策只要能做到两类协方差矩阵是一样的,那么无论先验概率相等不相等,都可以用线性分界面实现。而最小欧氏距离分类器则要求正态分布协方差矩阵为单位阵,先验概率相等。反过来说,如果希望用线性分类器实现错分类少的分类,则两类用正态分布近似时,应要求

其协方差矩阵相似,先验概率相近才行。当然如果两类分布分得很开,没有什么重叠,也可做到错分率很小。与下一节讨论的情况相比,可以看到为了实现错分率小,分界面类型就要比线性函数类型复杂了,在正态分布条件下,一般是超二次曲面。三、各类协方差矩阵不相等的情况各类协方差矩阵不相等的情况是多元正态分布的一般情况,在这种情况下刍赵j,i,j=1,2,…,C。因此在(2-45)表示的判别函数一般式中只有(d/2)ln2n这一项可以被省略,判别函数可表示成(2-57)将(2-57)进一步整理得其中(2-58)(dxd矩阵)(2-59)叫£"(d维列向量)(2-6o)w迫=—(1/2孔I+lnP(®J(2-61)(2-57)将(2-57)进一步整理得其中(2-58)(dxd矩阵)(2-59)叫£"(d维列向量)(2-6o)w迫=—(1/2孔I+lnP(®J(2-61)由(2-61)可见判别函数在一般情况下为X的二次型,因而其相应的决策面方程(当两个决策域毗邻)根据gi(x)-q(x)二o有(2-62)在一情况下决策面为二次超曲面,随着乙及P(3j)的不同而呈现不同形式的超二次曲面,如超球面、超椭球面、超抛物面、超双曲面,也可能是超平面。图2.10示出在二元正态情况下决策面具有不同形式的若干例子。在图2.10所示的各种情况中,假设变量x1与x2是相互独立的,并假设先验概率相等,因而决策面形式的不同仅取决于方差项的差异。图中用圆或椭圆的尺度表征相应类别的方差。图2.10(a)是两个超球体等密度分布的情况。由于这两类分布离散度不同,决策面是一个园,而不是前面提到过的最小距离分类器的情况。图2.10(b)的情况只是(a)在x2轴方向有扩展,因而圆形分布及决策面都演变成椭圆。图2.10(c)表示决策面为抛物面的一个例子。图2.10(d)与(e)中两类分布的差别在于均值点相互关系不同,造成决策面的形式很不相同,由于2.10(e)中出现了对称性情况,双曲线退化成直线。以上对多元正态分布概率模型条件下最小错误率贝叶斯决策方面进行了讨论,分析了几种简单情况下判别函数及决策面的特点,也提到了一般性的情况。上述讨论分析了在何种正态分布条件下,最小错误率贝叶斯决策具有线性决策面。讨论中还提到最小距离分类器,这种分类器在模式识别中经常采用,但是如果从统计上错误率最小角度看,不仅各类样本需要分布在类似于超球体内,且这些分布要近乎相同,再加上先验概率相等的条件。换句话说,只有在这种条件下,最小距离分类器与统计上最小错误率决策是一致的。模式识别的主要目的是要对观察到的现象与事物,通过度量确定事物的类型。在人工智能各领域,图像处理、计算机视觉、语音处理等都有大量分类与模式识别的任务。例如在第一章中讨论的车牌识别中,就包含了车牌识别,数字、字母区别划分,数字与字母识别等多个模式识别任务。对事物进行分类需要知道正确分类的可能性有多大,因此错误识别率是评价一种分类方法与一个分类器性能的最主要指标。基于最小错误率的贝叶斯决策理论方法在原则上讨论了在何种条件下错误率最小,并给出了计算错误率的原则性公式。本章小节回顾这一章的学习,我们主要学到了一些什么主要的知识呢?第一使用什么样的决策原则我们可以做到错误率最小呢?这个条件是要知道一个样本X分属不同类别的可能性,表示成P(3j|X),然后根据后验概率最大的类来分类。后验概率要通过Bayes公式从先验概率与类分布函数来计算。但是Bayes决策太原则了,使用的前提是知道特征空间中样本各个值的后验概率。但是我们在实际设计分类器算法只能依据一个训练样本集提供的数据。第二错分类最小并不一定是一个识别系统最重要的指标,对语音识别、文

字识别来说可能这是最重要的指标,但对医疗诊断、地震、天气预报等还要考虑错分类的不同后果,因此引入了风险,损失这些概念,以便在决策时兼顾不同后果的影响。

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论