密度估计新版_第1页
密度估计新版_第2页
密度估计新版_第3页
密度估计新版_第4页
密度估计新版_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2026/9/14第2章概率密度函数的预计2.1引言2.2参数预计的基本概念2.3最大似然预计与正态分布的参数预计2.4Bayes预计与正态分布参数的预计2.5总体分布的非参数预计2.6分类器错误率的预计问题参数化预计:Bayesian预计。假设概率密度形式已知。实际中概率密度形式往往未知。实际中概率密度往往是多模的,即有多个局部极大值。实际中样本维数较高,且有关高维密度函数能够表达成某些低维密度函数乘积的假设普通也不成立。本节介绍非参数预计办法:能解决任意的概率分布,而不必假设密度函数的形式已知。2.5.1总体密度函数的非参数预计非参数预计:直接用已知类别的样本去预计总体密度分布。办法有:①

用学习样本直接去预计类概率密度p(x|ωi)以此来设计分类器。如Parzen窗法②

用学习样本直接预计后验概率p(ωi|x)作为分类准则来设计分类器。如k近邻法.2.5.1总体密度函数的非参数预计思路:从样本集X预计样本空间任何一点x的概率密度P(x)如果样本集X全部来自于某一类别wi,则预计的是类条件概率密度函数P(x|wi).如果样本集X全部来自于c个类别而又无法分清哪个样原来自哪个类别(mixturemodels),则预计的是混合概率密度函数P(x):总体概率密度函数.出发点:随机变量x

落入某一区域

的概率P2.5.1总体密度函数的非参数预计其中Р是样本x落入内的概率。如果有N个样本x1,x2,…,xN是从密度为p(x)的总体中独立抽取出来的,则N个样本中有个k落入区域 中的概率值

Рk是二项分布的.抽取的N个样本中,k个样本落入区域中的概率.为:假如:区域足够小

2)p(x)连续由拟定的概率密度函数可看作总体密度函数p(x)在区域上的预计值.当时,估计是非常精确的则有:xp(x)R2.5.1总体密度函数的非参数预计x点的概率密度函数的预计值与样本数N,包含x的区域的体积V及落入V中的样本数k有关.结论:此办法的有效性取决于样本数量的多少,以及区域体积选择的适宜。问题:V和K如何选择呢?2.5.1总体密度函数的非参数预计讨论:①当V固定的时候N增加,k也增加,当时

只反映了p(x)的空间平均预计,而反映不出空间的变化②N固定,体积变小当时,

k=0时

因此起伏比较大,噪声比较大,需要对V进行改善.理论上假设样本总数是无限的,可以利用极限的方法来研究密度函数的估计。设:R1,R2,…,RN,…是一串包含x的区域序列对R1采用一个样本估计,对R2采用二个样本估计,对RN采用N个样本估计,…VN是RN的体积,kN是落入RN中的样本数,

若满足下列三个条件:区域随样本数目N的缩小平滑的缩小落入区域中的样本数逐步增多区域内的样本数和总样本数相比仍可无视2026/9/14Parzen窗法:体积不变,落入其中的样本数可变kN近邻预计:体积可变,落入其中的样本数不变2.5.1总体密度函数的非参数预计2.5.2

Parzen-windowapproach(Ref.1)

设:区域R是一种d维超立方体,hN是该超立方体的棱长

d=1,窗口为一线段d=2,窗口为一平面

d=3,窗口为一立方体d>3,窗口为一超立方体超立方体体积为:可定义窗函数φ(u)(以原点为中心,棱长为1的超立方体)φ(u)=

1,|uj|≤1/2,j=1,2,…,d0,其它1-0.50.51Parzen窗预计的概念当xi落入以x为中心,体积为VN的超立方体内时,我们有:

否则,φ(u)=0进去了=1没进去=0因此,落入该超立方体内的样本数为:xxixihNParzen窗法预计的基本公式2026/9/143窗函数的选择基本原则:窗函数必须满足两个基本条件惯用的窗函数有:(1)方窗函数(2)正态窗函数(3)指数窗函数uφ(u)-½½00uuφ(u)=

1,|uj|≤1/2,j=1,2,…,d0,其它窗函数的选择:方窗函数正态窗函数:指数窗函数:其中:N个以为xi中心的δ函数的叠加取平均.的幅值为窗宽hN对的影响前面推出:令:则:hN大,δN(x)的幅值就小,就是N个宽度较大,函数值变化缓慢的δ函数的叠加.

hN小,δN(x)的幅值就大,就是以N个样本xi为中心的δ尖峰函数的叠加.xx1x2x3xx1x2x3对于一种实际问题,预计成果的好坏取决于窗函数的类型及参数(窗宽)例1:对于一种二类(ω1,ω2)识别问题,随机抽取ω1类的6个样本X=(x1,x2,….x6)ω1=(x1,x2,….x6)=(x1=3.2,x2=3.6,x3=3,x4=6,x5=2.5,x6=1.1)预计P(x|ω1)即PN(x)0123456x6x5x3x1x2x4x解:选正态窗函数∵x是一维的上式用图形表达是6个分别以3.2,3.6,3,6,2.5,1.1为中心的丘形曲线(正态曲线),而PN(x)则是这些曲线之和。由图看出,每个样本对预计的奉献与样本间的距离有关,样本越多,PN(x)越精确。2026/9/14例2:有两组样本集分别为(1)原则正态分布的密度函数N(0,1)(2)两个均匀分布的混合密度2026/9/14实验1,2:窗函数为正态窗函数窗宽为其中h1是能够调节的参数(使用者能够选用)考察预计量与样本数N、可调参数h1的关系2026/9/14N=∞N=256N=16N=1窗函数逼近真实密度趋于平坦讨论:由图看出,PN(x)随N,h1的变化状况①当N=1时,PN(x)是一种以第一种样本为中心的正态形状的小丘,与窗函数差不多。②当N=16及N=256时h1=0.25曲线起伏很大,噪声大h1=1起伏减小h1=4曲线平坦③当N→∞时,PN(x)收敛于一平滑的正态曲线,预计曲线较好。2026/9/14N=∞N=256N=16N=1逼近真实密度趋于平坦(2)两个均匀分布的混合密度当N=1、16、256、∞时的PN(x)预计如图所示①当N=1时,PN(x)实际是窗函数。②当N=16及N=256时h1=0.25曲线起伏大h1=1曲线起伏减小h1=4曲线平坦③当N→∞时,曲线较好。讨论:Parzen窗预计优点由前面的例子能够看出,Parzen窗预计的优点是应用的普遍性。对规则分布,非规则分布,单锋或多峰分布都可用此法进行密度预计。能够获得较为光滑且分辨率较高的密度预计,实现了光滑性和分辨率之间的一种较好平衡。缺点规定样本足够多,才干有较好的预计。因此使计算量,存储量增大。窗宽在整个样本空间固定不变,难以获得区域自适应的密度预计。识别办法保存每个类别全部的训练样本;选择窗函数的形式,根据训练样本数n选择窗函数的h宽度;识别时,运用每个类别的训练样本计算待识别样本x的类条件概率密度:采用Bayes鉴别准则进行分类。Parzen窗口法问题:若hN选太小,则大部分体积将是空的(即不包含样本),从而使PN(x)预计不稳定。若hN选太大,则PN(x)预计较平坦,反映不出总体分布的变化而KN近邻法的思想是以x为中心建立空胞,使v↑,直到捕获到KN个样本为止。∴称KN-近邻预计

v的改善,样本密度大,VN↓;样本密度小,VN↑;

∴P(x)的预计为:KNnearest-neighbourhoodapproach在x点周边选择一种体积VN让VN不停增加直至捕获kN个样本为止(这些样本为x的kN个近邻)注意事项:kN不要增加太快,以使随N的增加捕获kN个样本的体积VN不致于缩小到0k1的选用要使kN≥1kN近邻法的基本预计公式:基本思想:让kN为N的函数(例如:,k1为不不大于0的常数)使PN(x)收敛于P(x)的充足必要条件:①,N与KN同向变化②,KN的变化远不大于N的变化

V1为N=1时的VN值∴KN近邻预计对KN和VN都作了限制

N个样本中有KN个落入VN内,KN个样本内有Ki个样本属于ωi类KN近邻法作后验概率的预计由KN近邻预计知:“N个已知类别样本中有KN个落入VN内”的概率密度预计为:则联合概率密度:根据Bayes公式可求出后验概率:∴

∵类别为ωi的后验概率就是落在VN内属于ωi的样本ki与VN内总样本数KN的比值K近邻分类准则:对于待分样本x,找出它的k个近邻,检查它的类别,把x归于样本最多的那个类别。K近邻分类的错误率随

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论