非线性时间序列第六章_第1页
非线性时间序列第六章_第2页
非线性时间序列第六章_第3页
免费预览已结束,剩余58页可下载查看

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、第六章 时间序列的平滑6.1 引论 上一章我们引进非参数函数估计的基本概念,现在将它应用到时间序列别的重要平 滑问题上 . 对估计慢变化时间趋势,平滑技术是有用的图示工具,它产生了时域平滑 (§ 6.2). 对将来事件和与之相联系的现在与过去变量之间的关系的非参数统计推断导 致了§ 6.3的状态域平滑 . §6.4 引入的样条方法是对§ 6.3引入的局部多项式方法的有用 替代. 这此方法能够容易地推广到时间序列的条件方差 (波动性) 的估计,甚至整个条件 分布的估计,参阅§ 6.5.6.2 时域平滑6.2.1 趋势和季节分量分析时间序列的第一步

2、是画数据图 . 这种方法使得人们可以从视觉上检查一个时间 序列是否像一个平稳随机过程 . 如果观察到趋势或季节分量, 在分析时间序列之前通常要 将它们分离开来 .假定时间序列 Yt 能够分解成其中 ft 表示慢变函数,称为“趋势分量” 分量,它被假定是零均值的平稳序列 Box-Cox 变换 . 这类幂变换有如下以参数Yt ft st Xt ,(6.1),st 是周期函数,称为“季节分量” , Xt 是随机 . 在使用这种分解之前,可以先用方差稳定变换或 为指标的形式或具有在0点处连续的变换形式g(x)u, log(u),0,0,6.2)g(u)(u 1)/ .这类变换由 Box 和 Cox(

3、1964)给出 . 注意,由在幂变换中数据必须是非负的,因此,在 使用幂变换之前,可能必须先实施平移变换 .我们的目的是估计和提取确定性分量ft 和 st . 我们希望残差分量 Xt 是平稳的,且能够用线性和非线性技术做进一步的分析 . 通过推广 Box 和 Jenkins( 1970)而发展的一个替 代方法是对时间序列 Yt 重复应用差分算子,直到被差分的序列表现为平稳为止. 这时,. 作为说明 Box 和 Jenkins 方法的一个被差分的序列可以进一步平衡时间序列技术来处理例子,我们先取 S&P500指数的对数变换,然后计算一阶差分图6.1给出了这个预处理序列 . 所得序列基本上

4、是该指数中变化的每日价格的百分比 . 除了几个异常值(即 1987年10月19日20.47%的市场崩盘,金融市场称之为“黑色星期一”)外,这个序列显示出平稳性.这个变换与金融工程中常用资产定价的几何布朗运动模型的离散化有关.空分序列的一*機匿图6.1 1972年1月3日至1999年12月31日(上图)和1999年1月4日至1999年12月31日(下图)S&P500指数对数变换的差分我们首先把注意力集中在没有季节分量的情形,即YtftXt, EXt0.(6.3)然后,我们再在§中估计趋势和季节分量.6.2.2 滑动平均平均是最常用的消除随机噪声的技术.假定趋势是慢变化的,使得其

5、能够在大小为 h的局部时间窗中用常数来逼近,即Y ift Xt i, h i h.( 6.4)这时ft能够用该窗周围的局部平均来估计:h卩t (2h 1) 1 Y i,(6.5)i h随着中心t的改变,局部窗也在移动.例如,在图6.2中,t 50处h 20所得的估计是 落在第一个窗内的那些数据的平均.窗的中心移动到新的点处以构成在这些点处的估计.随着局部窗从左向右滑动,它的轨迹就是所得的滑动平均曲线.这是滑动平均平滑的最简单的例子.它常常被用来验证时间序列的趋势 .图6.2描绘的是从1999年1月4日到1999 年12月1日S&P500指数一个月和两个月的滑动平均.图6.21999年1

6、月4日至12月31日S&P500指数和它的21个交易日(粗线)和41个交易日(虚线)的滑动平均在边界处,滑动平均估计的习惯做法是忽略超出观察时间范围的那些数据.例如,f2是用数据第丄,丫2 h的平均所得的简单估计(时间点2右边的数据比左边更多).这种不对称平均可能会产生边界偏倚.当边界处趋势陡峭且带宽又大时,这种边界效应更为明显 正如图6.2所示那样,在右边界处的滑动平均低估了趋势该问题能够通过使用局部线性平滑(参见§ )或别的边界改善方法,比如,边界核方法(Gasser和M Mer 1979;M Mler 1993)和数据削尖方法(Choi, Hall和Bousson 20

7、00来减弱.滑动平均数列(6.5)利用了时间t周围两边的数据.这样它还依赖于时间t之后的数 据.为便于预报,单变滑动平均数列*h1fth Yi(6.6)i 1也常被用来验证时间趋势.数列仅用直到时间t 1的过去的数据.6.2.3 核平滑滑动平均估计的一个改善方法是引进一个加权设计.这允许对所给时间点附近的数据给予较大的权数.这也就得到了核回归估计,定义为*(旨)ft0十.(6.7):1“ t0)h这个估计还被称为 Nadaraya-Watson估计.参阅Nadaraya( 1964)和 Watson( 1964).当我们使用均匀核 K(u) 0.51 (|u | 1)时,上述核估计就变成滑动平

8、均估计(6.5).当核函数有有界支撑1,1时,核回归估计就是一个局部 (2h 1)数据的加权平均.当核K(t)是 模在零点的单峰函数时,to附近的数据点获得更多的权.一般地,核函数不要求有一个有 界的支撑,只要它薄尾的(如它是一个有二阶矩的密度函数).K的非负性要求还能被减弱.带宽h也不必是整数.注意,在高斯核定义中的标准化常数和核的对称Beta族只是用来保证函数K是一个概率密度函数.在核回归估计中它们并不起作用.在计算时,我们常常标准化各种核函数 使得它们如图5.2那样有相同的最大值1.由于这种标准化,(6.7)可以直观地理解为hK(t to)/h数据点的有效平均.当核函数有在(,0)中的支

9、撑时(这样的核还可看作是单边核),核回归估计所使用的数据仅到时间t0 1 .这是单边滑动平均(6.6)的推广.如同在核密度估计中那样,在核回归估计中带宽h是一个重要参数.如同在图6.2中所显示的那样,大的带宽h产生过度平滑的估计,遗漏趋势和所估计的峰和谷的度量上的一些可能的细节.特别地,当使用大的带宽时,估计可能产生大的偏差.当使用小的带宽时,仅有几个局部的数据被使用,降低了估计的方差,却导致所得估计是一条波动的 曲线.例如,用带宽h 0,滑动平均估计(6.5)简单地复制原始数据.为了得到满意的 结果需要反复尝试和修正.带宽的数据驱动选择能够帮助我们确定所要的平滑度.正如.实际上,Altman

10、 (1990), Chu 通常的留一在外 (leave-o ne-out) .对带宽选择的嵌入方法由 Ray.经过直接计算,在模型在§ 所看到的那样,渐近方差本质上依赖于所研究的过程的相关结构.因此,针对独立数据的由数据驱动选择的带宽在时域平滑中效果不佳和Marron (1991a)以及Hart (1991)指出,对相依数据,交叉核实方法效果不好.这些作者提出了几个修正的方法和 Tsay (1997)以及 Beran 和 Feng (2000)提出.以上考虑能够通过计算核回归估计的偏倚和方差得到理解(6.3)下,核估计得偏倚为T(ft ft0)K(-t 1 ;0h它不依赖于误差过程.

11、它实际上是个逼近误差.当带宽取得小时,逼近误差 ft札小, 从而偏倚也小.另一方面,当h取得大时,大多数逼近误差ft ft0是大的归因于t和t0间的距离是大的,因此,偏倚可能是大的.这个线性估计的方差T卩t0wYt,wtt 1K()hTM ©)h还能够被计算 . 令 X (t) 是过程 X(t) 的自协方差函数,则TTVar( ft0)x(|i j |)WiWj .(6.8)i 1 j 1该方差依赖于自相关函数进一步简化需要渐近分析我们将在§ 629中讨论.在那里我 们将看到当k 时方差x(k)的渐近行为但我们现在可以指出,当带宽小时,核平 滑的方差增大,这归因于在局部领域

12、中数据点数太小的缘故 .6.2.4 核平滑的变种核平滑有许多变种替用核函数的高度作为权, 积是 1,分母不需要 . 这就是隐含在在现在的框架下, 令 st (2t 和M tiler (1979)提出了以下的估计:.(6.7)中的分母对相对于t求导数和数学上的分析是不方便的代, 我们还可用核函数下方的面积作为权 . 由于核函数下方的总面Gasser-Muller估计中的基本思想.1)/ 2(t1,L ,T 1),其中 s0和 sT. Gassert1stst 1Kh(u t0 ) duYt .由于总的权Tstt0)duKh(u t0)du 1,s Kh(u t 1 st 1 h所以没有分母.Ga

13、sser-Mtler估计是对 Priestley和Chao (1972)早期版本的一种修正Priestley和Chao ( 1972)给出的估计定义为 Tft0Kh(t t°)Yt1这个估计简单地去掉了Nadaraya-Watson估计的分母.通过积分和变量变换逼近黎曼和,对适当选择的h,我们得到总的权TT(T t0 )/hKh(t t0)1 Kh(t t0)du(t 1)/hK(u)du,t 11(t0 1)/h如果t。不太接近边界,且 h相对于T小,并使得(t。1)/h和(T t°)/h大,则上述积分 近似地等同于K (u)du 1.事实上,只要 K的支撑限制在区间(t

14、。1)/h, (T to)/h内,等式就精确地成立.换 句话,对不在边界区域的点 to ,总的权近似于1.以上观点依赖于设计点为等间隔的 .事 实上,Priestley和Chao估计仅能用于等间隔情形.它不能用于§ 6.3所讨论的状态域平滑.6.2.5 滤波核回归是用于工程的卷积滤波的一种特殊形式 . 一般地,一个长度为 2h 1 的线性滤 波定义为h件wYt i .(6.9)ih当K有支撑1,1时,核回归对应Wi K(i/h) h hK(j/h).滤波能够被设计为拥有各 种性质 . 例如,它能够被设计成可以去掉高频信号(低通滤波) ,或低频信号(高通滤波) 或超出某个频率范围的信号

15、(带通滤波) ;见§ 2.3.3.核平滑是一种低通滤波 .线性滤波变换可以用递推方式来定义例如,单边滑动平均 幷可以对某个b 1,利用下式来定义卩t bY (1 b)升t 2,L ,T ,这等价于用y,l ,Y的如下的加权滑动平均:ft bYt b(1 b)Yt 1 L b(1 b)t 2Y2 b(1 b)t 1Y1. 由于权以指数速度快速衰减,以上滤波实际上仅用了时刻 t 附近的局部数据 . 平滑的有效 性依赖于参数 b. 这种方法称为指数平滑 .指数平滑是用 1/h1 b的Kh(x) xI(x 0)的一种特殊的核平滑.这是一种单边平滑它仅使用直到现大时刻 t的数据.关于这方面内容

16、的进一步讨论可参见 Gijbels、 Pope 和 Wand( 1999) .6.2.6 局部线性平滑局部常数逼近( 6.4)能够通过使用局部线性逼近来改善. 我们把趋势 fi 通过如下线性函数局部地近似为 i 的函数Yi ft ft(i t) Xi, |i t| h.这样, ft 就近似地看做上述局部线性模型的截距. 可见图 6.3中时刻 t 200处的图示 . 窗内的数据用一个线性回归来拟合 . 对局部窗附件的数据用最小二乘方法, 我们通过相对于 a和b极小化下式可得到局部截距的估计T2Yi a b(i t)2Kh(i t).i1这里引进核权是为了减少距离给定时间点t较远的数据的贡献.令曲

17、和$t是最小二乘解. 这里用下标t是为了表示所得的解依赖于给定的时间点t.这时,ft用局部截距気来估计,它有如下的精确表示TTfta$wt,iYi/wt,i,wt,iKh(it)ST,2(t)(it)ST,1(t) ,(6.10)i 1i 1其中Sr,j(t)T1Kh(i t)(i t)j.当t从1取到T时就得到整个趋势函数这样,局部线性平滑实际上是一种移动线性回归方法正如图6.3所示那样,在t80处的估计由一个新的局部最小二乘问题得到在每个数据窗中拟合的直线用实线表示估计的局部截距的值位于虚垂直线和局部直线的交叉处局部斜率是时间趋势导数的估计此外,这些局部窗还可以互相重叠(见图6.2). S

18、-Plus函数“ lls.s”已写成程序差可用于计算图6.3中的平滑曲线这个S-Plus函数能够从本书的网址获得图6.3使用Epanechnikov核和带宽h 20所得的1999年1月4日至1999年12月31日S&P500指数局部线性拟合.在每个窗中的虚抛物线表示每个局部数据点所得的权局部线性平滑能够很容易地堆广到局部多项式平滑.局部多项式拟合和它的应用的全面介绍可参阅Fan和Gijbels( 1996).局部多项式拟合的优点总结在§中.注意,(6.11)中的权满足TWt(ii 1t)ST,1(t)ST,2(t)ST ,2(t) ST,1(t)0-(6.11)这就蕴涵了如果

19、趋势是线性的,fttTE 什Wt,i( ii 1,则局部线性平滑是无偏的:T)/Wt,it.i 1换句话,无论趋势函数多以陡峭,只估计线性趋势时,局部线性平滑就是无偏的.这对在内部以及边界处的点t的同样成立.也就是说对于估计陡峭趋势,局部线性估计将有小的 偏倚.另一方面,因为类似于(6.11)的方程即便是近似地也都不成立,因此,对估计边 界区域附近的点估计陡峭趋势,核平滑将有较大的偏差6.2.7 其他的平滑方法核局部线性平滑有许多别的方法例如,Gasser和M tiler (1979)使用了不同于核和局部线性平滑的权形式,Jone( 1997)介绍了局部线性平滑的各种形式 Fan和Gijbel

20、s( 1996)给出了各种平滑技术的概述,包括样本和正交级数方法 核回归和局部多项式建模是基于在许多格子点上的局部近似 诸如样条这样的全局逼近方法还能够用于对时间域的平滑这些思想将在关于状态域平滑的§6.4中介绍对诸如时域平滑这样的等间隔设计, 正交级数方法也非常容易使用 其基本思想是先 用正交矩阵对数据进行变换,然后,在高频点向零点有选择地调整系数(或向零点收缩 它们).平滑估计能够通过tapered系数的逆变换来获得常用的正交变换包括傅里叶变换 和小波变换它们的统计应用可参阅Ogden( 1997)、Efromovich( 1999)和Vidakovic( 1999)等近期出版的

21、专著 6.2.8 季节分量修正有许多实用的修正季节分量的方法 在此我们概要地介绍一个方法以说明其基本大 意.假定(6.1 )中的季节分量的周期是p,即pSk jp Sk,Sk 0.( 612)k1后一个约束是一个可识别条件 . 若此约束不成立时,只要加一个常数到趋势分量ft ,并在季节分量修正中减去相同的常数.归因于约束(6.12),当p是一个奇数时,趋势能够方便地用具有 h (p 1)/2的滑动平均( 6.5)来估计 . 在( 6.5)中季节分量平均掉,因 而对趋势估计没有贡献.当周期p是偶数时,用如下稍加修改的形式估计趋势Ft (0.5Yt d Yt d 1 L Y d 1 03 d)/p

22、, d p/2.季节分量能够按如下步骤来估计 . 就一个例子来说, 我们假定要处理的月度数据, 且周期 p 12. 在 3月的季节分量的值能用在 3 月所得一切观测值的移去趋势分量后的平均来 很好地近似 . 这就得到估计*(T d k) /pSkMjpFk jp)/(T d k)/p (d k)/p 1,j (d k)/ p 1其中a表示a的整数部分,d p/2.在上述求和中对上下限所作的限制是为了保证 数据不要太接近边界使得在趋势估计中边界影响达到最小. 这种初步估计可能不能精确地满足约束(6.12).但这能够容易地通过用下式估计季节分量 Sk来作修正k 1,L , p .i1以上方法还被用

23、于没有趋势分量ft 的情形 . 在这种情形,不需要移去趋势,即令卩t 0.6.2.9 理论概况 *问题( 6.3)的理论表述应该得到注意作是来自如下连续过程的离散化样本路径Y(t)这种表述常常被用在金融时间序列建模中. 一个简单的方式是把所得的时间序列Yt 看f(t) X(t). 时间单位通常取年,每星期数据被看作是以1/ 52的速度抽自连续过程 . 对金融中的期权定价和风险管理,这种表述是非常有效 的. 然而,在时域平滑方面,这种述有一些缺点 . 首先,为了能够相容地估计 f (t) ,我们 需要在给定的时间to的周围用大小为h 0的窗局部化数据但是,只要过程 X(t)是连 续的,所有的局部

24、数据 Y(t):t t0 h 都是高度相关的,且当 h 0时,相关系数趋于1. 这就蕴涵了局部数据变化不大, 因而也就不需要局部平滑 . 正如在图 6.2中所看到的那 样, 局部数据变化很大, 局部平滑就能改善趋势估计 . 这样, 以上表述从理论的观点来看 似乎是病态的.其次,在以上的表述下,趋势f (t)和随机误差X(t)有相似的光滑度(两者都是连续的)因此,在Y(t)中没有希望将随机部分与趋势部分分离开来一个代替的表述是推广等间隔设计的非线性回归模型到时间序列框架. 假定所得到的时间序列是来自模型Yt g(t/T) Xt, t 1,L ,T,( 6.13)其中g是平滑时间趋势函数,Xt是随

25、机过程,EXt 0.在这种表述下,我们现在能 够利用平滑技术从随机噪声中分离出平滑趋势 . 一个小的缺点是平滑趋势 f(t) g(t/T) 依赖于观测数量 T . 这个问题早就出现在具有固定设计的非参数回归文献中. 实际上它不是一个严重问题 . 渐近理论毕竟只是一个工具,为我们理解理论性质提供简化的结构.用g(t/T)建模趋势是捕捉趋势比噪声变化更慢这一特征的简单的技术手段在以上两种表述之间选择哪一个依赖于所研究的问题. 在纵向数据和泛函数据分析中, Hart 和 Wehrly ( 1986)以及 Silverman( 1996)基本上是用前一种表述:人们通过模 型Y(t) f(t) X(t)

26、观测到大量独立序列.这种表述对他们的问题是适合的.对时域平滑,模型(6.13)常被假定.例如见 Hall 和 Hart( 1990), Robinson (1997),以及 Johnstone 和 Silverman( 1997) . 这就保证了能捕捉到时间趋势比随机噪声更光滑这一特征 . 进一步,它也保证了能相容地估计时间趋势由公式(6.13)能够获得核和局部线性平滑的渐近性质估计g的偏倚与具有均匀设计的独立样本情形是相同的核和局部线性平滑的方差经繁琐的计算也可得到它们依赖于噪声过程Xt的协方差结构 一般地,我们假定Xt的自方差函数满足x(k) Cov(Xt,Xt k) Cxk , k,(6

27、.14)其中 0, CX是常数.在中定义的分式 ARIMA过程就满足(6.14).我们将估计(6.10)重写为 0(t/T).对任何 u t/T (0,1),使用 EY g(i/T)和(6.11),我们得到偏倚E如 g(u)(6.15)T 1Wru,ig(i /T) g(u) g (u)(i /T u)Ti 1Wfu,i注意,这个偏倚不依赖于误差过程X(t).它完全是局部线性拟合的近似误差.为理论叙述的简单,我们假定K有有界支撑.这个假定可以冗长的叙述为代价而得到减弱.特别地,可以使用像高斯核这样的轻尾核.由j表示vjK(v)dv.在下面的定理中我们总结了渐近偏倚和方差,定理的证明放在

28、7; 6.6.1.注意,由于时间单位的尺度,h/T和用在一般的非参数回归中的带宽是相同的.定理6.1 假定K有有界支撑,满足0(K) 1和1(K)0 ,且当 h/T0时,带宽h(a)如果g ()存在,且在点u处连续,则E*u)1 3 g(u) - 2(K)g (x)(x/T)3o(h/T)2.(b)如果自方差函数X满足(6.14),我们有CX K(x)K(y)|x y | dxdyh , 01,Var型 u)2Cx |K|2h 1log(h),1,(6.16)2 1jx(j)|K|bh ,1.定理6.1表明,过程Xt的协方差结构对渐近方差有强烈的影响.反过来这也影响到渐近最优带宽,并解释了为什

29、么独立数据的数据驱动带宽选择不能直接应用到相依数据.对核估计的类似于定理6.1的结果由Hall和Hart(1990)证明.最近,这些结果被Beran和Feng (2000)用不同于§给出的方法推广到局部多项式拟合.他们还证明了对anti-persistent过程,渐近方差具有阶h 1 2d.局部线性估计的渐近正态性也可以被建立.如果误差过程Xt是高斯的,则它的加权平均估计(6.10)还是高斯的这样,局部线性估计的渐近正态性直接由定理6.1得到.此外,在正态假定下,Cs?rg? Mielniczuk( 1995)建立了类似于定理 5.4的最大偏差的渐近分布然而,对X的正态假定并不是本质

30、的.正如在Robinson( 1997)中所证明的那 样,这个条件可以去掉我们在此概要地叙述用于本章的技术 令 J是相对于它自身域的鞅差序列,即E( t| j,j t)0, a.s.假定Xt是一双边无穷阶滑动平均过程:Xtjaj t j,2ajj且 t2 是-一致可积的,并满足E( t2|j, j t)1, a.s分式ARIMA过程满足这三个假定.考虑加权和TTSrwr,t XtwT,tat j j,t 1jt 1它是鞅差序列的和由鞅的性质,2 Var(Sr)Wt® j ,j t 1假定这个方差存在.下面的定理由 Rob in son ( 1997)给出.类似的结果还可在Ibragi

31、mov和 Linnik ( 1971)中发现.定理6.2 在上面所述的条件下,倘若TmaxwT,tat jo(Var(Sr) 1/2),j t 1则有Var(Sr) 1/2SrD N(0,1).对于局部线性估计(6.10),易见TT代 E 件Wt,iXi/wt,i.i 1i 1这时渐近正态性变为验证定理6.2中所叙述的条件.我们略去细节.6.3 状态域平滑6.3.1 非参数自回归状态域平滑与非参数预报密切相关 考虑一个平稳时间序列Xt.为了简单起见,我 们考虑仅基于变量 Xt 1的预报基于Xt 1 x的Xt的最优预报是给定 Xt 1 x时,Xt 的条件期望m(x) E(Xt|Xx),它在所有的

32、预报函数 g中极小化MSEEXt g(Xt i)2.这个函数还称为阶为1的自回归函数.当Xt是零均值平稳高斯过程时,这个条件均值是线性函数 m(x) ax,条件方差是常数.这就得到一个 AR( 1)模型Xt aXt 1 t.一般地,函数 m(x)不必是线性的,条件方差也不必是常数.然而,总是能够以如下方式表示数据Xt m(Xt 1)(Xt 1) t,( 6.17)其中2(x) Var( Xt |Xt 1 x).这里,t的条件均值为零,条件方差为1,即E( t|X)0, Var( t|X)1.非参数平滑技术还能够用于包括自回归函数的估计以外的领域考虑一个双变量序列(Xt,Y):t 1L ,T,它

33、可以被看作是来自平稳过程的一个实现 .我们的兴趣是估计 回归函数m(x) E(Y|Xt x).为便于对问题的理解,我们记Yt m(Xt) (Xt) t,(6.18)其中 2(x) Var(Y|Xt x), t 满足E( t |Xt)0, Var( t|Xt) 1.显然,这个结构包括通过取 Y Xt 1而把估计的自回归函数作为一个特定的例子.下面是三个有用的例子.例6.1 考虑平稳时间序列Zt.对给定的k,我们取Y (Zt)k, Xt乙1.则目 标函数变为mk(x) E(Ztk|Zt 1 x).2条件方差可以通过用 m2 (x) mh(x)来估计.特别地,当 口仪)小得如例1.1中所给的利 率差

34、分数据,m2(x)基本上就如同条件方差.换句话,对下面图6.4中所给的数据,均值 回归函数是波动函数的平方(x),Var(Xt|Xt1 x).这就是由Stanton ( 1997)以及Fan和Yao (1998)所给出的波动估计的基础101214个刃围聲券回报數彌的条件一阶矩46a101214k 12厶I国那券冋报数据的波劲率图6.4对12个月国库券回报用局部线性拟合估计条件方差.(a)具有Epanechnikov核和带宽索h 3.06的局部线性拟合的图示;(b)估计条件标准差用局部线性拟合(实曲线),Fan和Yao( 1998)的基于残差的方法(短虚曲线)和具有0.143和 1.324的参数

35、模型(x) x (长虚曲线)例6.2 再考虑平稳时间序列Zt.我们取Y I(a Zt b),它是区间(a,b上的 示性函数,Xt乙1.则目标函数变为m(x) P(a Zt b | Zt 1 x).特别地,如果a,我们就得到条件分布估计.进一步,如果a y 和b y ,则当取值小时,m(x)/(2 )基本上就如同给定 乙1 x时乙的条件密度.这个条件密度函数对了解给定 Zt 1 x时Zt分布的全貌是非常有用的.特别地,自回归函数是这个 分布的中心,波动函数是这个分布的扩展.这个思想形成了 Fan、Yao和To ng( 1996)估计条件密度(§ 6.5)和与它们相关的泛函(§

36、10.3),以及Hall,Wolff和Yao( 1999)估计条件分布函数(§ 10.3), Polonik和Yao (2000)估计最小量预报区域(§10.4)等所用方法的起源例6.3 对给定的时间序列乙,多步预报能够通过令 Y 乙d和Xt 乙来完成, 其中d是预报步长数.对这种情形,我们用非参数方法,基于变量乙来估计最优d步预报m(x) E(Zt d |Zt x),下面的图6.6画出了山猫数据的一步和两步预报.把这个方法和例6.1和例6.2中的技术结合起来,我们能够估计多步预报的条件方差和条件密度6.3.2 局部多项式拟合局部多项式拟合是一个用途广泛的非参数技术.它拥有

37、多种好的统计性质.关于这些内容可参阅 Fan和Gijbels( 1996).令m(v)(x)是定义在(6.18)中的回归函数v阶导数.局部多项式技术可非常方便地用 来估计m(v)(x),包括回归函数本身 m(x)m(0)(x).由于回归函数的形式没有被指定,因而距离x0远的数据点对 m(x。)提供了很少的信息.因此,我们只能使用X。附近的局部数据点.假定m(x)在x0点处有(p 1)阶导数.由泰勒展开,对X。局部邻域的x,我们有m(x)m(x°) m(x°)(x x°) m (x) (x x°)22!(p)L 血(x X0)p O( x x°)

38、p1.( 6.19)p!在统计建模方面,对 X。周围的局部点,我们建模(x)为p(x)j (x x0)j .( 6.20)j 0参数 j依赖于X0,故称之为局部参数.显然,局部参数 v (v)(X0)/v!.用局部数据 拟合局部模型(6.20)可极小化TpYtj(Xt x°)j2Kh(Xt X0),( 6.21)t 1j 0其中h是控制局部邻域大小的带宽.作为一个说明的例子,我们取Yt (Xt Xt 1)2,其中Xt是12个月国库券回报.带宽为h 3.06,它是由预渐近代入法(见§ )用C-程序“lls.c”计算得到的.在X)12点处(百分数),线段(p 1)用来拟合在阴影

39、区域 x0 h中的局部数据,在此对每个数 据,权用虚曲线(对应于Epanechnikov核)表示.在x0点处局部截距0是拟合的线段和垂直线段间的交点.这就构成了在点x0 12处的回归函数(v 0)的估计.沿着水平轴滑 动这个窗,我们就获得在区间3, 14上要估计的曲线.条件标准差被展示在图6.4(b)中.基于残差来估计条件方差的方法由Fan和Yao( 1998)提出,其计算通过C程序"autovar.c”来实现(还可见§ 8.7.2),为比较方便,它用短虚曲线表示.参数模型m(x) x常被用 来对生产率动态的波动进行建模,它用长的虚曲线表示.正如人们所看到的那样,在参数和非

40、参数方法之间还存在本质差异,这对参数拟合是否合适提出了疑问.选择带宽预渐近代入方法由 Fan和Gijbels (1995)提出,见§ 6.3.5.用Uj,j 0,L ,p,表示最小二乘问题(6.21)的解.m(v)(xg)的局部多项式估计是(v)mv(Xg) v!巴(V 0,1,L , p).这里,我们不用记号 m (X0)是为了避免由估计回归m(X0)的v阶导函数所带来的混淆.事实上,导数 m(x)是用局部斜率来估计,而不是用 估计的回归函数的导数来估计.当p 0 ,局部多项式拟合退化为该回归估计m(x):1YKh(Xt x)T ;1心区x)它还被称为 Nadaraya-Watso

41、n估计.因此,从局部逼近的观点来看,核回归估计是基于局 部常数逼近的.见(6.19).1(X1X。)LX MM1(XtX0)L且令使用矩阵记号来表示局部多项式回归更为方便.用X表示相应于(6.21)的设计矩阵:(X1 X0)pM ,(Xt汀y M , 卩 M .YT卩p则加权最小二乘问题(6.21 )能够写为(6.22)min(y X )T W(y X ),其中 (0,L , p)T , W是对角矩阵,它的第i个元素为Kh(Xi X。).解向量为卩(XTWX) 1XTWy .(6.23)为了实现局部多项式估计,我们需要选择阶p,带宽h和核K .当然,这些参数相互关联.当h时,局部多项式拟合就变

42、成全局多项式拟合,阶p决定模型的复杂性.与参数模型不同,局部多项式拟合的复杂性主要是由带宽来控制.因此,p通常是较小的,故而选择p的问题就变得不重要了 .如果目的是估计 m(v),则当p v是奇数,局部 多项式拟合自动修正边界偏倚 .进一步,当p v是奇数,与p 1阶拟合(则p v 1是 偶数)相比较,p阶拟合包含了一个多余参数,但没有增加估计m(v)的方差.不过这个多余参数创造了一个降低偏倚的机会,特别是在边界区域见Fan (1992)、Fan和Gijbels(1992)、Hastie 和 Loader( 1993)、Ruppert 和 Wand( 1994).因为这些理由,奇数阶拟 合(选

43、择p使和p v是奇数)比偶数阶拟合(选择 p 1使得p v是偶数)更好.基于 理论和实际的考虑, 在Fan和Gijbels( 1996)中推荐阶p v 1.如果主要目的是估计回 归函数,我们使用局部线性拟合,如果目标函数是一阶导数,我们就使用局部平方拟合, 等等.另一方面,带宽h的选择在多项式拟合中起着重要作用.太大的带宽引起过度平滑,产生过大的建模偏倚,而太小的带宽会导致不足平滑,获得受干扰的估计.带宽可由使用者通过目测检查所得到的估计曲线来主观选择,或由数据通过极小化的估计理论风 险来自动选择(见 ).由于估计基于局部回归(6.21),我们有理由要求一个非负权 函数 K. Fan, Gas

44、ser, Gijbels, Brockmann 和 Engel( 1995)已证明,对所有 p 的选择和 v,3最优权函数是 K(z) (1 z2),它被称为Epanechnikov核.这样,它是一个万能的加4权方式,并对比较其他核提供了一个有用的基准.正如在5.5所证明的那样,对实际中使用的p和v,其他核具有几乎相同的有效性 .因此,核函数的选择并不是至关重要的 .将局部多项式估计与其他估计进行比较,包括Nadaraya-Watson估计、Gasser和M dler估计和Priestley和Chao估计.实际上,由Fan (1993a)可知,局部线性拟合在所有线性 估计中是渐近最小最大的,而

45、在所有可能的估计中几乎是最小最大的.这种最小最大性质由Fan, Gasser, Gijbels, Brockmann和Engel (1995)推广到更一般的局部多项式拟合.6.3.3 局部多项式估计的性质k整个这一节中,我们假定(X1"),L ,(Xt,Yt)是平稳序列.令Fi是有随机变量(Xj,Yj), 1 j k生成的事件的域.令(k)和(k)是它们相应的和 混合系数.用ev 1表示单位向量,其(v 1)位置的元素为1.令TStjKh(Xt x°)(Xt x°)j(6.24)t 1和St XtWX是(p 1) (p 1)矩阵,它位于(i,j)的元素是Stj j

46、 2.首先,我们容易证明估计能够写为匕事卩W;Y ,(6.25)t 1h其中有效核 WvT是核K和一个多项式函数的乘积,其定义如下WvT(t) eT1ST11,th,L ,(th)pTK(t)/h.(6.26)以上表达式显示除了 “核”WT依赖于设计点X1丄,Xt和位置X0外,估计 巴看起来就像传统的核估计.这就解释了为什么局部多项式拟合能够自动地适应各种设计框架和 边界估计.图6.5给出了局部常数拟合 (p 0)的有效核函数和对 Epanechnikov核K在点xo0.05和xo0.5处的局部线性拟合(p 1).它们满足如下矩性质" 时:値 怙计腿真垄ts 怙什世fh)图6.5对局

47、部常数拟合(P 0)和具有核Kx00.5处(权由表示)和边界点x0平实线和虚线分别是真实函数和估计的函数在点 在这两个点处的偏倚.不包含噪声为Epanechnikov核的局部线性拟合(p 1)在内点0.05 (权由表示)分配给局部数据点的有效权.水(a) Nadaraya-Watson估计;X。(b)0.05和X) 0.5的高度.它们的差是局部线性拟合.为清楚起见,数据(命题6.1 有效权wZT(Xtt 1满足如下有限矩性质:q TX0)qWvXt X0hv,q0 v,q其中如果证明v q,则v,q 0,否则为 由St的定义T(Xt X0)qwVrt 11.Xtx0hTeSr1 (Xtt 1e

48、v 1 ST St eq 1x°)q XtMXoKh(Xix°)(Xt Xo)pv,q从而得到所要的结论作为命题6.1的结果,当真实的回归函数 m(x)是阶为p的多项式时,v的局部多项式估计的无偏倚的.为了获得更多有关有效核的知识,我们提供它的渐近形式.我们首先引进一些记号令S是(p 1) (p 1)矩阵,它的第(i,j)元素为 2,其中jujK(u)du.定义等价核如下p*t1p tvl lKv(t) ev 1S (1,t,L ,tp) K(t) ( S t )K(t),(6.27)l 0其中Svl是S 1的(v 1,l 1)元素命题6.2 在定理5.5的条件下,如果 X

49、的边缘密度f在点X。处有连续的导数,则 在对Xo a,b和t 一致地有T1*Wv (t)77Kv(t)1 Op(av),Th f (xo)1/2其中avh (log T/Th).对高阶核而言,等价核满足如下矩条件:uqKv(u)duv,q 0 v,q p.证明 注意到Sv,j/(Thj)基本上和具有诱导核 K*(x) xjK(x)的核密度估计是相 同的因此,由定理5.5,对xo a,b 一致地有(Thj)S,jf(xo) j Op(qv),(6.28)把(6.28)代入ST的每一个元素就立即得到T 1H 1SvH 1 f (xo)S1 Op(av),或等价地有Sv Tf(x°)HSH

50、1 Op(av),其中H diag(1,h,L ,hp),因此,把这个式子代入 W;的定义,我们得到T1T 1p TWv (t)77S (1,t,L ,tp) K(t)1 op(av).hf(Xo)这就证明了第一个结果.第二个结果用与命题6.1相同的证明可得.由(6.25)和命题 6.2, 有vThv 1f (xo) t i*KvXtXoY1OP( aT ).(6.29)因此,使用局部多项式估计就像使用具有已知设计密度f的核回归估计一样这就解释了为什么局部多项式拟合适应于多种设计密度反过来,核回归估计在f的导数偏大的区域有大的偏倚,即它不能适应高偏斜设计为了搞清楚这一点,想象真实的回归函数在

51、这样的区域内有大的斜率.对给定的x0,由于设计密度的导数是大的,故而在x0的一边比另一边有更多的点当使用局部平均时,由于局部数据呈现对称状态,故 Nadaraya-Watson估计向着有更多局部数据点的那一边产生偏倚.由于局部数据多是非对称的,故而这个问题在边界区域更显著,见图6.5.另一方面,如果需要,局部多项式拟合造出非对称权以补偿这类设计偏倚(图 6.5(b).因此,它适合于各种设计密度和边 界区域.我们现在给出局部多项式估计的渐近偏倚和方差表达式.对独立数据,我们通过在设计矩阵X上加条件来获得偏倚和方差表达式.然而,对诸如在例中所给出的时间序列,加在 X上的条件将意味着几乎是加在整个序

52、列上.因此,我们用渐近正态性而不是用条件期望来导出渐近偏倚和方差.正如在§ 5.3所解释的那样,状态局部化减弱了局部数据的相依结构.因此,人们期望对独立数据的结果对具有某种混合条件的平稳序列依 然成立混合条件和窗的大小是有关系的这点的严格叙述由在§中的条件1( iv)中概要地给出.3),且m(p 1()在点x处是连T 时,给出.下面属于 Masry和Fan (1997)的定理的证明将在§ 定理6.3 在§ 的条件1下,如果h O仃1/(2p 续的,则当其中o(x)Vj 2Th diag(1L ,hp)卩(x)D N0,(m(x)丄,m®(x)/

53、p!)Tti j 2K2(t)dt, Cp 是(po(x)2(x)S 1S*S 1 / ,S* 是(p 1)1)维向量,其第7p 1)!f (x),(p 1)矩阵,它的第(i, j)元素是i个元素为 p 2 i.注意,由等价核的定义易见tp1K;(t)dt eT1S1Cp和Kv(t)2dte1S 1SS1e/1.因此,定理6.1的直接推论是导数估计mv(x)是渐近正态的:,Th2v1 mv(x) m(v) (x)tp 1KV(t)dtv!m(p1)(x)hp (p 1)!(v!)2 2(x) K;2(t)dt N 0,r(x)(6.30)当V 0时,(6.30)给出m(x)本身的渐近正态性局部多项式估计的渐近偏倚和渐近方差被自然地定义为(p 1)AB( x) tp 1Kv(t)dt v!m凶 hp1v ,(p 1)!(v!)2 2(x) K;2(t)dtAV( x)Th2v1 f (x)(6.31)(6.32)对给定的权函数w,理想的带宽h应极小化2AB (x) AV( x)w(x)dx.这就得到渐近最优带宽hopt Cv, p(K)2(x)w(x) / f (x)dxm(p °(x

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论