版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、统计模式识别导论,金鑫0937009武曲0937028张巧玲0937036赵险峰0937041,一个关于统计的笑话:有一个统计员从来不照顾孩子,因为他的妻子外出时不情愿地答应照顾三个年幼活泼的孩子。妻子回家时,他递过来一张纸条,上面写着:“擦11次眼泪;把你的鞋带系15次;给每个孩子吹5次玩具气球,总共15次;每个气球的平均寿命是10秒;警告儿童不要过马路26次;这孩子坚持过马路26次;这个星期六我得做0次。”。统计真的这么死板吗?只有收集数据,整理分析,积累平均,统计理论才能从数据中做出一些推论,为解决随机观测事件的决策过程提供理论依据。公共关系中的分类问题是根据观察值将对象分类到相应的类别
2、中。统计决策理论是模式分类的主要理论和工具之一。接下来,我们介绍统计模式识别和几种最常用和最基本的统计决策方法。统计模式识别,统计模式识别的方法是在已知研究对象的统计模型或已知判别函数类的情况下,通过学习算法将三维特征空间划分为C个区域,每个区域对应一个类。属于同一类别的模式之间的差异部分是由环境噪声和传感器的特性造成的,部分是由于模式本身的随机特性造成的。前者,如纸张质量、油墨和污渍对书写文字的影响;后者表明,当同一个人书写相同的字符时,虽然形状相似,但不可能完全相同。因此,当这些形状略有不同的字符由特征向量表示时,特征空间中对应于这些特征向量的点是不同的,但是分布在特征空间的某个区域中。这
3、个区域可以用来表示随机向量实现的集合。如果在特征空间中指定了距离度量,直观地说,两点之间的距离越小,它们对应的模式就越相似。在理想情况下,不同类别的两个图案之间的距离大于同一类别的两个图案之间的距离,并且对应于同一类别的两个点之间的连线上的每个点的图案应该属于同一类别。对应于几乎没有失真的图案的点应该接近于对应于没有失真的图案的点。在这些条件下,特征空间可以被精确地划分为对应于每个类别的区域。当不满足上述条件时,可以估计每个特征向量属于某一类的概率,将概率值最大的类作为该点所属的类。当模式识别系统工作时,它只能通过判断被识别对象属于哪个区域来确定它属于哪个类别。由噪声和传感器引起的可变性可以通
4、过预处理部分消除。模式的固有可变性可以通过特征提取和特征选择来控制,从而模式在特征空间中的分布可以尽可能地满足上述理想条件。因此,统计模式识别系统应该包括预处理、特征提取和分类器(见图)。统计模式识别模型,主要包括:训练和分类两种操作模型,其中训练主要利用已有的样本来完成决策边界的划分,并采用一定的学习机制来保证基于样本的划分是最优的;分类主要是利用输入模式的特征和训练得到的决策函数,将输入模式分类到相应的模式类中。统计模式识别的基本原理是相似样本在模式空间中相互接近,形成一个“群体”,即“物以类聚”。根据模式所测量的特征向量Xi=(xi1,xi2,xid)T(i=1,2,N),给定的模式被分
5、类为c类1,2和c,然后根据模式之间的距离函数来判断分类。其中t代表换位;n是样本点数;d是样本特征号。统计模式识别的方法有贝叶斯决策(1)最小误差概率的贝叶斯判别准则(2)最小风险的贝叶斯判别(3)尼曼皮尔逊判别准则判别函数法(1)线性可分几何分类(2)非线性可分几何分类, 监督参数统计方法(1)KNN方法(K近邻法)(2)Fisher判别分析非监督参数统计方法(1)基于概率密度函数估计的直接方法(2)基于样本空间相似性度量的间接聚类方法(1)基于最近邻规范的启发式方法(2)最大最小距离法、主方法、贝叶斯决策方法、线性判别函数近邻法分类(KNN)最小贝叶斯决策是一种统计模式识别决策方法,它具
6、有以下基本假设:1 . 每个类别人口的概率分布是已知的;2.有待决定的类别数量是确定的;3.被识别的物体或物体具有多个特征观察。当识别出的物体由N个随机向量X和2表示时。我们知道分类先验概率的条件概率密度函数,可以根据贝叶斯公式求解后验概率,并根据后验概率的大小来判断分类。这是贝叶斯决策。引入以下三个准则:(1)最小误差概率贝叶斯准则(2)最小风险贝叶斯准则(3)尼曼-皮尔逊准则,(1)最小误差概率贝叶斯准则,其具有R个样本,分别为W1、W2和WR,并且每个类别的先验概率已知为P(wi),其中I=1、2和R。对于要识别的随机向量X,已知每个类别的条件概率密度为P(X|wi), 根据贝叶斯公式有
7、一个后验概率:P(wi | X)=(P(X | wi)* P(wi)/(P(xwi)* P(wi)(1)根据计算的后验概率,取最高的一个。如果表示为:P(wi|X)P(wj|X),那么X属于wi,其中I,j=1,2,r,ji存在,这就是贝叶斯准则。 根据统计学理论,如果“似然比”定义为:l(X)=P(X| wi)/P(x| wi),阈值为ji=P(wj)/P(wi),则贝叶斯准则的似然比表达式为:l(X) P(wj)/P(wi),则贝叶斯准则简单表示为:如果P(w1|X)P(w2|X),则X属于w1;如果P(w2|X)P(w1|X),那么X属于w2。贝叶斯准则本质上是一种误差概率最小的贝叶斯准
8、则。在实际工作中,有时只考虑最小错误率是不够的。有必要引入比错误率更广泛的风险和损失概念。如果每次决策时的条件风险最小,那么在为所有的x做出决策时,平均(预期风险)也是最小的。贝叶斯决策称为最小风险。在决策理论中,所做的决定被称为决策或行动。每一个决定或行动都会带来一定的损失。损失用表示,它与应属于wi的决策J所造成的损失有关。损失函数定义为(j | wi)=ij (I,j=1,2,r)。样本X属于wi,其被贝叶斯公式称为P(wi|X),几何分类(判别函数方法),并且模式在一些数学变换之后被映射到特征向量,该特征向量被表示为特征空间中的点。同一个类的点构成一个点集,它代表一个类I。不同种类的点
9、集(I,i=1,2,n)总是以不同的程度相互分离。如果我们能通过几何方法找到一个独立于条件概率密度的分离函数,并将特征空间划分为对应不同类别的子空间,就能实现模式分类。因此,这种分类方法称为几何分类,这种分离函数称为判别函数。因此,几何分类也通常称为判别函数法。判别函数可以是线性的或非线性的。利用已知类的训练集,通过统计方法得到判别函数的具体形式和参数,进而用来判别未知样本属于哪一类。虽然该方法是一种统计分类方法,但它不依赖于条件分布密度的知识,因此在某些情况下比基于贝叶斯公式的概率分类方法简单。线性判别函数。基于线性判别函数的模式分类器称为线性分类器。设计线性分类器的主要步骤如下:首先,已知
10、一组带类的训练集。其次,选择一个标准函数,它不仅与样本集x和w有函数关系,而且能反映分类器的性能。第三,利用最优化技术得到线性判别函数的最优解。监督参数统计、KNN (k最近邻法)、Fisher判别分析、k最近邻法、KNN法,也称为k最近邻法,是模式识别的标准算法之一。其基本原理是将分类后的训练样本点“记录”到多维空间中,然后将待分类的未知样本记录到该空间中。研究了未知样本的k个邻居。如果某类样本的邻居最多,未知样本也可以判断为该类。在多维空间中,点之间的距离通常被定义为欧氏空间距离。KNN方法的优点是它对数据结构没有具体要求,只是用每个未知点的邻居属性类来判断;KNN方法也不需要训练过程。K
11、NN方法的一个缺点是不压缩训练点的信息,所以每次判断一个新的未知点时,都必须计算到已知点的所有距离,计算量很大。一种简化的算法称为类重心法,它计算训练中每类样本点的重心,然后判别未知样本点与每类样本点的重心之间的距离;无监督的参数统计方法,基于概率密度函数估计的直接方法,基于样本空间相似性度量的间接聚类方法,聚类分析方法,在没有训练集的情况下,自动对一批没有类别的已识别样本进行分类,这些样本应该根据样本之间的相似性进行分类,也就是俗话所说的“物以类聚,人以群分”,这种分类方法称为聚类分析,它是无监督的,没有教师指导。如何评价聚类质量需要确定一个聚类准则。有两种方法可以确定聚类标准。一种是根据经
12、验和分类问题选择一个标准(例如,使用距离函数作为相似性度量),并不断修改阈值以实现某个最优分类。另一种方法是确定一个函数。当函数取最小值时,它仍然没有达到最佳分类。最近邻函数法,基于最近邻规范的启发式最大最小距离法,基于最近邻规范的启发式方法,有n个样本:X1,X2,Xn。如果你取任何样本(例如,X1)作为聚类中心Z1,那么X1=Z1。选择一个非负阈值T1。然后计算从X2到Z1的距离D21,距离函数可以选择上面的任何一个,通常是欧几里德距离。计算距离结果,如果D21T1,建立新的聚类中心Z2,并且X2=Z2。接下来,取第三个样本X3,根据距离函数计算从X3到Z1和Z2的距离D31和D32。如果
13、D31T1和D32T1,X3不同于X1和X2。应建立第三个集群中心Z3=X3。使用上述方法,计算所有样本的距离,比较阈值,并确定聚类。这种方法计算简单。当你有一些模式分布的先验知识来指导阈值和初始点的选择时,你可以很快得到结果。最大-最小距离法以欧氏距离为度量,首先选取两个相距最远的点作为中心,分别计算距离Di1和Di2,i=1,2,n。取每个I点的两个距离Di1和Di2中的最小距离min (Di1,Di2),并检测所有min(Di1,Di2)的最大值是否大于|Z1-Z2|/2以判断聚类。因此,它被称为最大和最小距离法。以下图中的十点为例。具体步骤如下:步骤1:以X1为第一个聚类中心,即X1Z
14、1。步骤2:确定离X1最远的样品,制作X6Z2。步骤3:逐一计算x1、x2、xn和Z1、Z2之间的距离Di1和Di2。在Di1X iZ1和di2X iZ2中,如果最大最小值(Di1,Di2)存在,I=1,2和nZ 1Z2/2,让X iZ3(X 7Z3)到t最后一步:根据最小距离将所有样本分离到最近的聚类中心。在这种情况下,有三个中心,分类结果如下:X1X3X4为第一类,z1x2x6为第二类,z2x6x7x8x9x10为第三类,Z 3X 7,模式识别统计研究进展,类条件概率分布估计,贝叶斯分类器误差界的线性判别方法,类条件概率分布估计,考虑将待识别样本识别为C个不同类1、2和C中的一个。根据贝叶
15、斯定理,应判断X为后验概率最大的一个。由于类条件概率分布未知,通常假设分布是一个带参数的模型,如多维正态分布(当多维正态分布中的均值向量和协方差矩阵已知时,从分布中得到的二次判别函数是最优的),代表分布的参数由训练样本估计。当训练样本不足时,分布参数中包含的估计误差会影响识别精度。为了提高分类精度,Ujiie H等人提出了这样一种方法。首先,对给定数据进行变换(指数函数变换),使变换后的数据更接近正态分布,而不考虑原始数据的分布,并在理论上找到最优变换;然后,为了处理这些变换后的数据,对传统的二次判别函数进行了改进。最后,提出了变换的一些性质,并通过实验证明了该方法的有效性。为了避免分类精度的
16、下降,通过研究特征值的估计误差,提出了各种方法,但对特征向量的估计误差考虑不多。经过研究,Iwamura M等人发现特征向量的估计误差是导致分类精度下降的另一个因素,因此他们提出了一种通过修改特征值来补偿特征向量估计误差的方法。20世纪90年代中期,统计学习理论和支持向量机算法的成功引起了研究者的关注。支持向量机(SVM)算法具有坚实的理论基础和良好的泛化能力,在手写体数字识别、文本分类等领域取得了良好的效果。其显著特点是在不知道非线性变换具体形式的情况下,利用满足Mercer条件的核函数设计非线性分类器。Fisher判别法和主成分分析法是传统的线性方法,已广泛应用于模式分类和特征提取。近年来
17、出现的基于核函数1112的Fisher判别法和基于核函数13的主成分分析法是它们的线性扩展。它们具有更好的性能、更广的应用范围和更高的灵活性,值得关注。考虑到两类问题且每类训练样本的数量大于样本的维数,参考文献14提出了两种基于训练样本划分多维空间的方法,这是对Fisher线性判别法的两种改进。第一种方法是一维参数搜索;第二种方法是递归Fisher方法。与标准的Fisher判别方法相比,这两种方法在模式检测上有更好的训练效果。利用Mercer核,这两种方法可以推广到非线性决策曲面。贝叶斯分类器,模式识别的目的是将一个对象(由其特征表示)区分为某一类。考虑两种情况。当使用贝叶斯分类器时,根据最大后验概率对对象进行分类,这是通过判别函数来实现的。在大多数情况下,判别函数是线性的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 降钙素原进阶试题及答案指南
- 220kv输变电线路项目可行性研究报告
- GCP考试之研究者与伦理委员会沟通职责题库及答案详解
- 2026年中国湖南旅游行业现状调研及发展前景分析报告
- 2026年中国单反数码相机现状研究及发展趋势预测
- 2026年中国夹套型磁性翻板浮子式液位计行业市场规模及投资前景预测分析报告
- 2026年商务英语沟通模拟试题及答案详解
- 2026年山西扫黑除恶模拟试题及答案详解
- 2026年陕西会计从业模拟试题及答案详解
- 2026年中国煤层气开发现状调研及市场前景预测
- 2022年全国新高考语文真题2卷《东观汉记之吴汉》详细注解及译文
- 脑卒中偏瘫患者良肢位摆放
- 幼儿消毒知识培训课件
- 自然流产指南解读
- 鼻内镜下鼻息肉摘除术的手术配合
- CJ/T 256-2016分体先导式减压稳压阀
- 电话卡出售协议合同
- 2024-2025学年高一下学期《重温红色故事 铭记长征精神》主题班会课件
- 《石油工程技术职业素养》课件-钻井八大系统
- 游乐场项目策划方案
- 学校办公室主任年度考核个人述职报告(四篇合集)
评论
0/150
提交评论