(概率论与数理统计专业论文)统计深度函数及其应用.pdf_第1页
(概率论与数理统计专业论文)统计深度函数及其应用.pdf_第2页
(概率论与数理统计专业论文)统计深度函数及其应用.pdf_第3页
(概率论与数理统计专业论文)统计深度函数及其应用.pdf_第4页
(概率论与数理统计专业论文)统计深度函数及其应用.pdf_第5页
已阅读5页,还剩26页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 在维的数据分析中。基于排序的统计量已经扮演了很重要的角色然而在高 维数据分析中,一直以来都没有类似的统计量统计深度函数对于高维数据排序是 一个有效的工具利用统计深度函数,可以将中位数的概念推广到高维情形现在 数据维数都很大。所以深度函数有着广阔的应用前景深度函数主要的思想是提供 一种从最深点向外的排序方法深度函数不仅可以用来排序,还可以应用到多元数 据的分析以及诊断中 w u k e y 在1 9 7 5 年首先给出了一种深度的定义,即半空间深度给出了在高维 空间中任何一个点关于一个数据集的深度后人又给出了各种深度的定义,如l i u ( 1 9 9 0 ) 提出单形深度,z u o a n ds e t t l i n g ( 2 0 0 0 ) 讨论了投影深度深度函数试图提 取出数据集中的所有信息,已经被证明是一种很有效的方法 在考虑位置参数时,按照某个深度函数定义每一个数据点的深度,并且将深度 最深的那一点作为位置参数的估计这样得到的估计具有稳健性,也就是说奇异点 对估计的影响不大在实际应用中,数据常会因为各种原因被污染,采用稳健估计 可以消除这些奇异数据的影响,从而做出正确的判断因为目前有很多深度函数的 定义方法。我们在做估计的时候就要选择一种合适的定义z u oa n ds e t t l i n g ( 2 0 0 0 ) 比较了各种基于不同深度定义的估计。发现基于投影深度的估计最稳健也更有效 在我的论文中,主要采用投影深度这种定义 本文在第一章和第二章中对常用的深度函数定义做了介绍,并且给出了基于深 度函数的位置参数定义然后对这些估计的算法,以及在回归和判别分析中的应用 做了较详细的研究,得到了一些有意义的结果,主要包括: 1 像别的稳继估计一样。当样本维数和样本数很大时,基于深度的参数估计的 计算非常繁琐如果不解决好计算问题。那么稳健估计的实用性将受到很大 限制所以当样本维数大于2 的时候,我们希望找到有效的近似算法,目前计 算投影深度还没有成熟的算法,本文第一章第四节采用构造多元均匀抽样的 方法来找出一个投影空间在这个投影空间中计算深度,因为具有均匀性, 所以期望在此空间上得到更多的信息 2 在本文第二章第二节给出了求投影深度最深点的近似算法,给出了该算法的 复杂度,通过模拟可以看出该算法精确度较高,所需时间很短 3 在回归情形中,一样可以定义深度的概念对于线性回归模型,考虑回归系 数这个向量的深度 r o u s s e e u wa n dh u b e r t ( 1 9 9 9 ) 首先提出了回归深度的 概念,并将深度最深的那个系数向量作为模型的参数估计如果深度最深的 向量不唯一,取这些系数向量的平均作为系数估计这在某些情况下会产生 不合适的估计本文第三章提出了基于位置深度的回归方法,并且证明了该 方法的稳健性优于直线深度方法,还通过模拟比较了两种方法的效果 4 我们希望采用深度的概念来解决一些判别问题,并与现有方法做比较为 此,在第四章用基于投影深度的稳健估计代替经典判别分析中的样本均值和 方差,得到改进的判别分析该方法是一种稳健的判别分析方法,并详细讨 论了它的稳健性和判别效果 关键词:半空间深度,投影深度,单形深度,回归深度,最大偏差,崩溃值,判 别分析 i i a b s t r a c t o n e - d i m e n s i o n a ls t a t i s t i c sb a s e do i lo r d e r i n gp l a ya l li m p o r t a n tr o l ei no n e - d i m e n s i o n a ld a t aa n a l y s i s t h e i ra n a l o g u e sa r en o tf o u n di nm u l t i v a r i a t ea n a l y s i s s t a t i s t i c a ld e p t hf u n c t i o n sa r ep r o v e dt ob eap r o m i s i n gt o o lf o rm u l t i - d i m e n s i o n a l o r d e r i n g w e c a ne x t e n dm e d i a nt om n i t i - d i m e n s i o n a lc a $ e su s i n gd e p t hf u n c t i o n s b e c a u s ed i m e n s i o no ft h ed a t as e ti sv e r yh i g hn o w ,d e p t hf u n c t i o n sh a v ew i d e f o r e g r o u n di na p p l i c a t i o n s t h em a i n i d e ao f d e p t h f u n c t i o n si st op r o v i d eac e n t e r - o u t w a r do r d e r i n gf r o mt h ed e e p e s tp o i n t h o w e v e ro r d e r i n gi sn o tt h eo n l ya p - p l i c a t i o no fd e p t hf u n c t i o n s d e p t hf u n c t i o n sb r i n gu sn e wp e r s p e c t i v e st o w a r d s m u l t i - d i m e n s i o n a ld a t aa n a l y s i sa n di n f e r e n c e t u k e yp u tf o r w a r d ad e f i n i t i o no f d e p t h f u n c t i o nf i r s ti n1 9 7 5 ,w h i c hi sh a l f s p a c e d e p t h h eg a v ead e p t ho fa n yp o i n ti nh i g hd i m e n s i o nw i t hr e s p e c tt oag i v e nd a t a s e t t h e r ea r em a n ym e t h o d st od e f i n ed e p t hf u n c t i o n si nr e c e n ty e a r s l i u ( 1 9 9 0 ) i n t r o d u c e dan o t i o no f s i m p l i c i a ld e p t hf u n c t i o n z u oa n ds e r f l i n g ( 2 0 0 0 ) d i s c u s s e d p r o j e c t i o nd e p t hf u n c t i o n d e p t hf u n c t i o n st r yt oe x t r a c ta l li n f o r m a t i o na n da r e p r o v e nt ob eav e r yp r o m i s i n gt 0 0 1 g i v ead e f i n i t i o no fd e p t h ,t h ed e e p e s tp o i n ti so n el o c a t i o ne s t i m a t e t h i s l o c a t i o ne s t i m a t eh a sa p r o p e r t y o fr o b u s t n e s sa n dw i l ln o tb ei n f l u e n c e db yo u t l i e r s i na p p l i c a t i o n s tb e c a u s ed a t as e tm a yb ec o n t a m i n a t e di nv a r i o u ss i t u a t i o n s ,r o b u s t l o c a t i o ne s t i m a t e sc a ne l i m i n a t ei n f e c t i o no fo u t l i e r sa n dg e te x a c tr e s u l t b e c a u s e t h e r ea r em a n yd e f i n i t i o n so f d e p t hf u n c t i o n ,w es h o u l dc h o o s ea na p p r o p r i a t ed e p t h f u n c t i o n z u oa n ds e r f l i n g ( 2 0 0 0 ) i n t r o d u c e das y s t e m a t i cc o m p a r i s o no fa l lt h e s e d e p t hf u n c t i o n s l o c a t i o ne s t i m a t eb a s e do np r o j e c t i o nd e p t hi sp r o v e dt h em o s t r o b u s to n e i nt h i sp a p e r w eu s ep r o j 。e c t i o nd e p t hf u n c t i o ni nm o s tc 8 s e 8 - w ei n t r o d u c es o m em o s t p o p u l a rd e p t hf u n c t i o n sa n dg i v ed e f i n i t i o no f l o c a t i o n e s t i m a t eb a s e do nd e p t hf u n c t i o n si nc h a p t e r1a n d2 w ea l s op r o v i d ew i t ha l g o - i i i r i t h m so ft h e s ee s t i m a t e sa n dd i s c u s sa p p l i c a t i o n so fd e p t hf u n c t i o n si nr e g r e s s i o n a n a l y s i sa n d d i s c r i m i n a n ta n a l y s i s w eg e ts o m e p r o m i s i n g r e s u l t s : 1 a so t h e rr o b u s te s t i m a t e s ,c o m p u t a t i o no fl o c a t i o ne s t i m a t eb a s e dd e p t hf u n c - t i o n sw i l lb ev e r yb u r d e n s o m ew h e nd i m e n s i o no ft h ed a t as e tb e c o m e sh i g h i f w eh a v en o t g o o da l g o r i t h m s ,t h ea p p l i c a t i o no fd e p t hf u n c t i o n sw i l lb e l i m i t e d w h e nd i m e n s i o no ft h ed a t as e ti sh i g h e rt h a n 2 ,w ec a n f i n ds o m e a p p r o x i m a t e a l g o r i t h m s n o w t h e r ea r en o te f f e c t i v ea l g o r i t h m st oc o m p u t e p r o j e c t i o nd e p t h i ns e c t i o n4o fc h a p t e r1 ,w et r yt of i n dap r o j e c t i o ns p a c eu s i n gm e t h o do f c o n s t r u c t i n gu n i f o r ms a m p l e b yc o m p u t i n gp r o j e c t i o nd e p t hi nt h i sp r o j e c t i o n s p a c e ,w ec a ne x p l o r ei n f o r m a t i o no ft h i sd a t a s e tm o r e e x a c t l y 2 。i ns e c t i o n2o fc h a p t e r2 。w ep r o v i d ew i t ha n a p p r o x i m a t ea l g o r i t h mt oc o r n - p u r et h ed e e p e s tp o i n tb a s e do np r o j e c t i o nd e p t ha n dc o m p u t a t i o n a lc o s to f i t t h r o u 【g hs i m u l a t i o nw e c a l lc o n c l u d et h a tt h i sa l g o r i t h mi sv e r ye x a c ta n dn e e d s 8l i t t l et i m e 3 i nr e g r e s s i o ns e t t i n g ,w ec a nd e f i n ed e p t hf u n c t i o nt o o w ec o n s i d e rd e p t h o fac a n d i d a t ef i ti nl i n e a rr e g r e s s i o nm o d e l r o u s s c e u wa n dh u b e r t ( 1 9 9 0 ) i n t r o d u c e dr e g r e s s i o nd e p t ha n dm a x i m u m r e g r e s s i o nd e p t hb a s e de s t i m a t e i f s u c he s t i m a t ei sn o te x c l u s i v e ,t h ee s t i m a t eo fr e g r e s s i o nf i ti sm e a no ft h e s e f i t sw h i c hh a v em a x i m u mr e g r e s s i o nd e p t h s u c hs i m p l em e a nm a y b eb r i n g ai m p r o p e re s t i m a t e 。i nc h a p t e r3w ei n t r o d u c e8m e t h o db a s e do nl o c a t i o n d e p t h w ep r o v et h a tt h i sm e t h o di sm o r er o b u s tt h a nt h em e t h o db a s e do n r e g r e s s i o nd e p t ha n dc o m p a r et h e s et w om e t h o d st h r o u g hs i m u l a t i o n s 4 w es o l v es o m ed i s e r i m i n a n tp r o b l e m su s i n gd e p t hf u n c t i o n sa n d c o m p a r e t h i s r u e s , u sw i t hp r e s e n to n e 8 t h r o u g hr e p l a c i n gs a m p l em e a , na n ds c a t t e rm a t r i x b yr o b u s te s t i m a t e sb a s e do np r o j e c t i o nd e p t h ,w ep r o v i d ew i t hai m p r o v e d m e t h o di nd i s c r i m i n a n ta n a l y s i s t h i sm e t h o di sar o b u s to n e 。w ed i s c u s si t s r o b u s t n e s si nc h a p t e r4 i v k e y w o r d s :h a l f s p a c ed e p t h ,p r o j e c t i o nd e p t h ,s i m p l i c i a ld e p t h ,r e g r e s s i o n d e p t h ,m a x i m u mb i a s ,b r e a k d o w nv a l u e ,d i s c r i m i n a n ta n a l y s i s v 第一章统计深度函数的介绍 1 1 统计深度函数的提出 在数据分析中,排序是不可避免的对于一维数据,排序的概念清晰明了人们总 可以根据观测数据的大小来对观测到的数据进行排序排序后得到的极值( e x t r e m e v a l u e ) 可以用来估计数据的大小范围,而极差( r a n g e ) 可以用来估计数据的方差。 中间值( m e d i a n ) 是数据分布位置参数的一个稳键估计例如我们有某一天每小时 的温度数值,将数据排序以后,最大值和最小值可以用作最高温度与最低温度的估 计,而它们的差可以估计温差,中位数用来估计平均温度水平在各种各样的数据 分析中,排序都扮演着不可缺少的角色 但是当数据的维数比较大时,排序就没有自然统一的标准了近年来,人们找 了很多方法来对高维数据进行排序,但是结果都不理想这些方法要么只利用了数 据的部分信息,要么不够直观t u k e y ( 1 9 7 5 ) 提出了半空f 霹深度( h a l f s p a c ed e p t h ) 的概念,计算数据点相对于数据集的半空间深度,根据深度数值对数据进行排序, 开创了对统计深度函数的研究。所以我们先来看半空间深度的定义 设g 是r d 中的一点,f 是r d 上的一个分布函数那么茁相对于f 的半空 间深度( 记作h d ( x ,f ) ) 就是包含z 的半空间上的最小概率 定义1 1 h d ( x ,f ) = i n f f ( h ) :日是一个闭的半空间,日) ,。r , t ( 1 1 ) 设有数据集x 彬,用x 的经验分布r 来代替f ,就可以得到点茹相对于 整个数据集x 的半空间深度h d ( x ,x ) z 不必属于数据集x ,它可以是r d 上的 任意一个点 为了更好的理解h d ( x ,x ) 的含义,我们先考虑d = 2 ,也就是数据是二维时的 简单情形 图1 1 给出了平面上的一组数据点,这就是数据集x 它包含了8 个点如果 想求点z 的半空间深度h d ( x ,x ) 就要考虑通过z 的直线,每一条直线将平面分 图1 1 :平面上点z 的半空间深度 成两个半平面,然后计算这些半乎蕊中所包含x 中点的个数的最小值图中给出 了一些这样的直线,可以看出不论直线怎么取,所得到的半平面都至少包括两个x 中的点,所以h d ( x ,x ) = 2 从上面这个简单的例子中我们可以看出,点越是靠近数据的中心,经过它的直 线就会更平均的把数据分成两部分,它的深度也就越大了所以半空间深度的数值 反应了数据点的中心程度,提取了数据集的信息当d 2 时,定义1 1 就不是 那么容易计算了为了解决这个问题,r o u s s e e u wa n ds t r u y f ( 1 9 9 8 ) 中提到可以 将数据投影到一个方向上,然后计算点关于投影值的深度文中给出了高维情形下 h d ( x ,x ) 的另一种表达式t 定义1 2 设x l ,如是x 中的样本, 日d ( z ,x ) 2 州i n l :f 。h d ( “毛让x ) 2h 罐1 社a :u x i t $ ) - ( 1 2 ) 1 2 几种常用的深度函数定义 除了t u k e y ( 1 9 7 5 ) 提出的半空间深度定义之外,还有很多种深度定义通过不 2 同的深度定义,对数据的排序会得到不同的结果本节介绍一些应用较多的深度定 义 l i u ,s ( 1 9 9 0 ) 提出了单形深度( s i m p l i c i a ld e p t h ) 的概念顾名思义,一点g 相 对于分布f 的单形深度就是z 属于一个随机单形( r a n d o ms i m p l e x ) 的概率具体 定义如下t 定义1 3 s d ( z ;f ) = f ( z s 【z l ,z 2 ,x d + 1 】) 1z r d , ( 1 3 ) 其中z l ,正2 ,石d + 1 是来自f 的随机样本,s z l ,z 2 ,霉“1 】表示顶点为x l ,x 2 , ,z d + 1 的d 维单形当d = 1 时,s b i ,z 2 】就表示端点为x l 和x 2 的线段,当 d = 2 时,s x 1 ,z 2 ,现l 表示顶点为x l ,x 2 ,x 3 的三角形 用样本的经验分布r 来代替f 就可以得到z 相对于整个数据集x 的单形深 度s d ( z ,x ) 相当于从x 中随机的取d + 1 个数据点,以这d + 1 个点为顶点的单 形包含。的比例即; s d ( x ,x ) = ( 甜1 ) 。1 i x s l x i l ,m # j , ( 1 4 ) t 其中i f 1 表示示性函数 同样从单形深度的定义我们可以看出,点越是靠近数据集中心它的深度越大 第三种常用的定义是投影深度( p r o j e c t i o nd e p t h ) z u o ( 2 0 0 1 ) 中详细研究了 这种深度的定义投影深度的基本思想就是把数据投影到某些投影方向上,通过投 影点的离群程度来度量这个点的深度 定义1 4 令p ( ) 和口( ) 分别为位置和尺度参数一点z r d 相对于分布f 的投影深度( p r o j e c t i o nd e p t h ) 定义为一个离群值的函数; p d ( x ,f ) = l ( 1 十o d ( x ,f ) ) ,( 1 5 ) 其中离群值 仇( 茁,f ) = s u p0 1 ( u 0 ,r ) i w i i = l 而d l ( t o ,r ) = i i “o p ( 凡) 0 归( r ) ,其中r 是札k 的分布我们通常取( p ,盯) 为( m e d ,m a d ) ,m e d 表示分布的中位数,m a d = m e d l a ;- m e d ( x ) 3 投影深度描述了z 与中心点的离群程度,同样离群程度越小。投影深度也就越 大这是投影寻踪( p r o j e c t i o np u r s u i t ) 方法的一种,通过将数据投影在某些方向上 来获取信息 下面我们看一个投影深度的例子: 例l 。1 考虑r d 犯1 ) 中的多元标准正态分布f = ( o ,i d ) 取( 芦,矿) = ( m e d ,m a d ) 根据投影深度的定义, o ( x ,f ) = 恻i c ,其中c n = 庐- 1 ( ) 0 6 7 4 4 8 9 8 ,投影深度为t p d ( x ,f ) = c _ ( c n + i i 。1 1 ) , 其中l l 表示e u c l i d 范数 上例说明数据分布是标准多元正态分布时,投影深度可以精确的计算 1 3 深度函数的选择 上一节定义了三种常用的深度函数,在实际应用中就有选择什么定义的问题 为了判定一个深度函数定义的优劣,z u oa n ds e r f l i n g ( 2 0 0 0 ) 中给出了个深度函 数d ( x ,f ) 应该符合的4 个标准: 1 仿射不变性z 一点茁r 。的深度不应该依赖于坐标系的选择也就是说, 对于任何随机向量x r 4 ,任何非奇异的d xd 矩阵a ,任何d 维向量b , d ( 血+ b ,f h + b ) = d ( x ,f x ) 2 中心点深度最大t 对于一个有着唯一中心( c e n t e r ) 的分布,在这个中心深度 函数值应该达到最大也就是说,对于任何存在中心的分布f , d ( o ,f ) = s u p d 0 ,f ) r d 3 关于最深点的单调性t 当点。r 8 从中心点沿着某一个方向移动时,茹的深 度应该单调递减也就是说,对于任何个有最深点p 的分布f ,d ( x ,f ) s d ( 秽+ 口扛一侈) ,f ) ,d 【o ,1 j 4 在无限远处深度为ot 当忙0 趋向于无穷时,z 的深度应该趋向于0 4 注1 l 上面我们用到了中心点的概念,所谓中心点是相对于对称分布来说的 随机变量x 的分布关于8 对称,就说口是这个分布的中心在中心8 深度最大 最经典的对称定义是中心对称( c e n t r a l l ys y m m e t r i c ) 如果x 一口与口一x 在分布 意义下相等,我们就说一个随机向量x 的分布关于口中心对称l i u ( 1 9 9 0 ) 中将 对称的定义推广到角对称( a n g u l a r l ys y m m e t r i c ) 如果一8 ) 1i fx 一口i i 关于原 点中心对称,那么就说x 的分布是角对称的在z u oa n ds e r f l i n g ( 2 0 0 0 ) 中,给出 了对称更一般的定义。也就是半空间对称( h a l f s p a c es y m m e t r i c ) 通过口的任意一 个超平面将空间分为两个半空间,对于这样的半空间h ,p ( x h ) j ,那么就说 x 的分布关于p 是半空间对称的 上面三种定义满足z中心对称= 寺角对称= 号半空间对称所以对于深度函 数最重要的性质2 来说,应该对最一般的对称定义都满足,即对于每一个关于8 半 空问对称的分布f ,深度函数d ( ,f ) 应在中5 - 口处达到最大 z u oa n d s e r f l i n g ( 2 0 0 0 ) 中详细分析了各种深度函数是否符合这四个标准l i u ( 1 9 9 0 ) 中提出的简单体深度在连续分布时符合,但是在离散型分布时就不满足条件 了看下面这个反例 例1 2 令数据维数d = 1 ,随机变量x 的分布是离散型的,p ( x = 0 ) = 1 5 ,p ( x = :k 1 ) = 1 5 ,p ( x = 4 - 2 ) = 1 5 x 的分布是关于0 中心对称的不难 看出 s d ( ( 1 ,o ) ,p ) 一s d ( ( 1 1 2 ,o ) ,p ) = 31 2 ( 1 1 6 ) 3 = 1 1 8 0 , 所以离散墅的x 的单形深度不符合性质3 而半空间深度和投影深度符合这四个标准。成为实际应用中最常采用的定义 1 4 深度函数的计算 深度函数解决了高维数据的排序问题,但是从定义式我们可以看出,这些深度 的计算是非常繁琐的在数据维数d = 2 时,半空间深度可以精确的计算当维数 大于2 时。r o u s s e e u wa n ds t r u y f ( 1 9 9 8 ) 给出了近似的算法但是对于投影深度, 还没有成熟有效的计算方法本节主要讨论数据维效d 2 时,一点。关于整个数 据集x 的投影深度t d ( x ,x ) 的近似算法 为了计算z 的投影深度,就要找到在所有投影方向上的离群值0 1 ( 镪7 毛民) 的 上界数据维数d 2 时,通常不可能精确的找到这个上界我们只能在所有投影 方向的集合中找一个子集,在这个子集上算离群值的最大值算法的效果的好坏, 直接取决于是否选择了合适的投影方向珏,我们可以从以下这几个办法考虑t 1 最简单朴素的方法就是固定个方向 2 考虑垂直于d 个数据点决定的超平面的那些方向。这样应该可以得到更好的 近似。 3 z h a n g ( 1 9 9 6 ) 中给出了一种在任何流形上找均匀抽样的方法我们可以先用 z h a n ga n dm a ( 2 0 0 1 ) 中的方法,得到一组【0 ,1 上的基于正加表的l a t i n h y p e r c u b e 均匀抽样,然后再做变换,得到我们所需流形上的一组均匀点 当对数据一无所知的时候,投影到均匀方向上,应该能够较好的汲取数据的 信息 当投影方向取定为m 个时,计算某一个点茁对于数据集x 的近似投影深度 p d ( x ,x ) 的复杂度是o ( m ( n p + f l , + 1 ) ) 具体复杂度的大小可以从下面的计算步 骤得出: 1 令p d ( x ,x ) = 0 ,o ( 1 ) 2 重复m 次: o ( m 1 对每个数据点计算l t t x i , o ( n d ) 计算k = 1 ( t + o l ( u b ,凡) ) ,d ( 令p d ( x ,x ) = m i n ( p d ( x ,x ) ,七) o ( 1 ) 我们分别称这三种方法为固定法、垂直法和均匀法为了比较上面三种方法,我 们从三维标准正态分布抽取5 0 个样本作为数据集分别用这三种方法计算每个数 据点关于数据集的投影深度值总共重复做5 0 0 次抽样,分别记录每种方法得到的 深度值与精确值的差,将这5 0 0 次抽样所得所有误差的均值和方差列在表1 1 中, 从表1 1 我们可以看出这三种方法的精确程度 从表1 1 中可以看出,同样采用了5 0 个投影方向,采用第二种方法,也就是用 6 方法m = l om = 5 0 m = 1 0 0 1 均值 0 0 6 80 0 4 70 0 4 5 1 方差 0 0 0 0 10 0 0 0 10 0 0 1 2 均值 0 0 4 20 0 40 0 3 4 2 方差 0 0 0 0 1 10 0 0 0 1 20 0 0 0 1 4 3均值0 0 3 80 0 3 7 40 0 3 3方差0 0 0 0 10 0 0 0 1 0 50 0 0 1 衰1 方法m = 5 0 m = 1 0 0 2 均值 0 0 4 70 0 4 2 方差0 0 0 0 1 0 50 0 0 0 1 3 均值 0 0 4 1 20 0 3 7 3 方差 0 0 0 0 1 20 0 0 0 1 4 比较 垂直于d 个样本点决定的超平面的方向。得到的误差大于采用后一种均匀抽样的方 法当样本量和样本维数增大的时候,前一种方法所采用的方向数也将相应增加, 从而大大加大计算复杂度而后一种方法在采用较少方向的同时,仍然保持了很高 的精确度 因为深度的提出就是为了解决高维数据的问题,所以要比较垂直法和均匀法计 算高维数据投影深度的效果计算服从8 维标准正态分布的2 0 0 个样本的投影深度 值,分别用5 0 个和1 0 0 个投影方向模拟共做1 0 0 次随机抽样。得到误差均值与 方差见表1 2 从表1 2 我们可以看出均匀法的误差小于垂直法,因此我们可以建议,计算一 点相对于数据集的投影深度时,采用我们提供的第三种方法,即均匀抽样法 7 第二章深度函数在参数估计中的应用 2 1 在位置参数估计中的应用 提出定义并不是我们的最终目的,我们希望把统计深度函数应用到实际当中 去第一章中已经提过在数据分布的中心深度最大,那么很自然的。我们可以用深 度最大的那一点作为分布位置参数( 1 0 c a t i o ne s t i m a t e ) 的估计 给定一个深度定义d ( ,) 和分布f r d ,最深点0 定义为; 0 = a r g s u p z a d ( x ,f ) ( 2 1 ) 当d = 1 的时候,对于投影深度和半空间深度来说,0 就是我们通常说的中位数 所以0 可以看作是一个多维的中位数,也就是说是一维中位数的推广 我们最常用的位置参数估计是样本平均数牙,但是平均数的大小很容易受到离 群值( o u t l i e r ) 的影响,面不b 台反映数据所包含的真实信息实际数据中。由于抄录 失误与测量误差等原因,离群值非常普遍,这就需要找稳健的位置参数估计了用 0 来估计位置参数与经典的估计位置参数方法相比,最大的优势就是0 具有很好的 稳健性 不同的深度定义,也就得到了位置参数不同的估计,他们的稳健性也就不同 那么采用什么深度的定义,才能得到较好的估计呢? 为了从稳健性角度评价估计的 优劣,我们首先给出最大偏差( m a x i m u mb i a s ) 和崩溃值( b r e a k d o w nv a l u e ) 的概 念 对于一个分布f r a 和常数e 0 ,假设f 被g 以程度e 污染,也就是说 f ( e ,g ) = ( 1 一) f + e g 一个估计t 的最大偏差定义为 b ( e ;lf ) = s u pi i t ( f ( e ,g ) ) 一t ( f ) i i , g 其中”i i 表示e u c l i d 范数导致日( e ;正f ) 无界的最小的e 就叫作崩溃值,即 ,= m i n e :b ( q 正f ) = o o ) 崩溃值是衡量估计稳健性的一个主要标准d o n o h oa n dg a s k o ( 1 9 9 2 ) 中提 8 到,基于半空间深度h d 的位置估计0 ( 记作日螈) 的崩溃值不大于1 3 因为h d 主要研究了数据之间的相对位置,而没有考虑距离的大小,因此h m 。的崩溃值比 较低也就不足为奇了而投影深度p d 不仅考虑了数据之间的相对位置而且距离 的大小也算在其中,所以基于p d 的位置估计0 ( 记作p ) 拥有较高的崩溃值 z u o ( 2 0 0 1 ) 中详细证明了p m n 的崩溃值是i 2 这意味着如果数据的一半都遭受 了某种程度的污染,p m 仍然是有界的 2 2p 慨的计算 像其他的稳健估计一样,p m 。的计算也非常繁琐在数据量和数据维数较大 的情况下,不可能计算空间中所有点的深度,以此来得到深度最大的那个点这样 就需要设计出复杂度低而又计算准确的算法s t r u y fa n dr o u s s e e u w ( 2 0 0 0 ) 给出 了日m 。的近似算法假设数据集x 大小为n ,维数为d 该算法的主要思想是, 先给出口m 。的一个初始点m - ,然后挑选一些方向。在这些方向上移动m l ,使得 h d 增加最后得到日下面我们给出_ p m ,的一个近似算法的步骤以及每一步 所需要的计算复杂度 1 为了减少所需要迭代的步骤,我们最好采用一个已知靠近中心的点来初始化 p 蝇。通常采用逐坐标中位数,记作尬= ( m e d i a n ( x _ c 。) ,m e d i a n ( x i , f ) ) , 以通常很好计算,而且尬的p d 相对较高0 ( 如) 2 初始化p m 至少应该具有的深度值m i n d e p o ( 1 ) 3 首先给出一个投影方向的集合u ,其中投影方向的个数是m o ( m ) 4 对u 中的每个方向,按照定义1 4 计算0 l ( “7 尬,r ) ,找出使得0 l ( u 尬,r ) 最大的方向“,如果不唯一,则取平均值 o ( m n l o g n ) 5 因为在珏上o a ( u 尬,r ) 最大,也就是说投影到这个方向上离群程度最大, 我们就有理由认为在牡上p d 还可以得到改善,即可以缩小离群程度如果 p d ( m 1 ,f ) 小于深度最小值m i n d e p ,则表示还需要很大改善,我们就沿着 u 的方向迈一大步得到m 2 使得p d ( m 2 ,f ) 达到m i n d e p 如果p d ( m i ,f ) 大于m i n d e p ,那就沿着t 的方向迈一小步,使得p d ( m 2 ,f ) 增加o 0 1 9 2 0 污染4 0 污染 p “深度值时间p “深度值时间 d = 2 ( 0 6 80 ) 0 7 5i ( l 1 40 6 8 ) 0 。5 4l n = 5 0d = 4 ( o 1 90 2 90 3 10 6 ) o 6 81 ( 0 6o 7 50 4 20 6 8 ) o 5 91 d = 2 ( o 4 50 3 3 ) o 7 62 6 ( o 9o 7 5 ) 0 6 2 6 n = 1 0 0d = 4 ( o 4 700 3 5o 3 2 ) 0 6 43 3 ( 1 40 6 2o 9 70 7 6 ) 0 4 93 3 d = 2 ( o ,3 5o 3 4 ) o 7 88 2 ( o 9 81 ) o ,6 48 2 n = 5 0 0d = 4 ( o 2 8o 4 1o 2 1o 3 8 ) o 6 91 4 1 ( 0 8o 9 50 9 4o 8 4 ) 0 6 1 4 1 6 从m 2 开始重复第4 步,直到m 达到最大深度1 ,或者经过n t r y 步该算法 不能再改善尸d ( 尬,f ) 了 7 为了避免m 来来回回向上向下移动,如果n a l t 步中p d ( m t ,f ) 没有改善, 我们就尝试新的移动方向,例如连接前几步的尬与当前步的蚴的方向 注2 1 n 8 1 t 和n t r y 一般取作4 ( d + 1 ) 和l o ( g + 1 ) 为了评价以上算法的复杂度和精度,我们做以下模拟t 当礼= 5 0 ,1 0 0 ,5 0 0 ,d = 2 ,4 时产生服从于标准正态的数据,并分别给予2 0 和4 0 来自于n ( 1 0 ,i d ) 的污 染,用以上算法计算p j | i 靠,得到的结果和相应的投影深度值列于表2 1 ,同时也给出 了该算法所需要的时间( 以秒为单位) 模拟也证明以上算法精确度较高,复杂度较低当数据集的大小和维数较高时, 仍然可以较快的得到令人满意的结果 2 3p 螺的改进 虽然p 尬。的稳健性很好。崩溃值达到了1 2 可是当数据没有受到污染的时 候,p 尬。的均方误差小于样本均值的均方误差,也就是说p 螈相对效率的( r e l a t i v e e f f i c i e n c y ) 较低,为了改进p 螈,z u o ,c u ia n dh e ( 2 0 0 1 ) 中定义了基于投影深度 l o 加权的位置估计: 尸w m ( f ,= 销甓篙, 其中叫( ) 是权函数如果用一般的深度函数代替投影深度,可以得到一般的深度 加权位置估计为了表达简便,我们记关于分布f 的深度口一f ) 为d ( t ) ,记关于 经验分布的深度d ( ,r ) 为j ) n ( ) 介绍以下两个记号t f d ( a ) = j p d ( x ) a ) , f d 。( a ) 一言i 风( 墨) ) , ( 2 2 ) i 其中i 是示性函数,对于任意的0 o m 碱觚( d 扛1 ) d o o ) l 0 ,d ( 甄昧) 。,f l l z i l 2 伽( 。扛,f ) ) d f 白) 0 在( 0 ,1 】上满足w ( r ) sm r 2 那 么对于在一般位置上的x ” 2 d ) , ,( 尸畿,x “) = i l l i n 【( 凡一k + 2 ) 2 【( 礼+ k + 1 2 d ) 2 】 其中m a d k ( x “) = m e d k ( z 1 一m e d ( x ”) i ,f 。一m e d ( x “) j ) ,m e d k ( x “) = ( z ( n + 女) ,2 i ) + z ( 【( n + k + 1 ) 2 1 ) ) 2 ,1 k 扎,z ( 1 ) ,写( 砷是z l ,z 。的次序统计量 当k = 0 时,m a d k = m a d ,将此时得到的加权估计记作p w s 这样就可 以利用上面计算位置参数时得到的结果。从而大大减少计算步骤而此时 ,( p w s ,x n ) : ( n + 1 - 2 d ) 2 1 , 这个值也是比较高的,在实际应

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论