4 残差与模型诊断_第1页
4 残差与模型诊断_第2页
4 残差与模型诊断_第3页
4 残差与模型诊断_第4页
4 残差与模型诊断_第5页
已阅读5页,还剩18页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

GLM残差与模型诊断孟生旺GLM的基本假设数据中没有异常值.使用了正确的连接函数.线性预测项中包含了所有的重要解释变量,每个解释变量使用了正确的尺度.使用了正确的方差函数.离散参数是常数.因变量的观察值相互独立.因变量来自特定的指数离散族.残差残差01原始残差02皮尔逊残差03偏差残差04分位残差

y1异常,y2正常

原始残差(因变量残差)

局限性:在分布偏斜严重时(如二项分布中概率接近0或1,泊松分布中均值很小),即使模型正确,皮尔逊残差的分布也可能不对称,不太像正态分布。Pearson残差Deviance残差

偏差衡量当前模型与饱和模型之间的差距。偏差残差是考虑了似然函数本身,更符合GLM的似然框架。与皮尔逊残差相比,偏差残差通常更接近正态分布,尤其是在小到中等规模的样本中。在模型诊断中,应优先使用偏差残差。近似服从标准正态分布。当需要严格检验分布假设(特别是通过Q-Q图)时,分位残差是最强大、最可靠的工具。

par(mfrow=c(1,2))x=seq(0,400,1)y=pgamma(x,shape=2,scale=50)plot(x,y,type='l',col=2,xlab='y',ylab='pgamma(y)',lwd=2)x1=seq(-3,3,0.1)y1=pnorm(x1)plot(x1,y1,type='l',col=3,xlab='r=qnorm(pgamma(y))',ylab='pgamma(y)',lwd=2)分位残差

par(mfrow=c(1,2))x=seq(0,400,1)y=pgamma(x,shape=2,scale=50)plot(x,y,type='l',col=2,xlab='y',ylab='pgamma(y)',lwd=2)x1=seq(-3,3,0.1)y1=pnorm(x1)plot(x1,y1,type='l',col=3,xlab='r=qnorm(pgamma(y))',ylab='pgamma(y)',lwd=2)Gamma(shape=2,scale=50)Norm(0,1)

dpois(lambda=1)Norm(0,1)标准化残差将杠杆效应考虑在内后,对普通残差(如偏差残差)的进行修正,能够:公平地比较不同杠杆位置上的观测点的拟合优劣。精确地识别出真正的统计异常值。作为计算Cook距离的基础,从而系统地发现那些对模型参数估计有巨大影响力的数据点。

基于残差的模型诊断流程dt=data.frame(y=c(1,3,3,5,6,7,9,10),x=c(-1,-1,0,0,0,0,1,1))mod=glm(y~x,data=dt,family=poisson(link=log))#残差resid(mod,type='pearson')#Pearson残差resid(mod,type='deviance')#Deviance残差rstandard(mod)#标准化Deviance残差mod$residuals#相对残差,等价于下式(dt$y-fitted(mod))/fitted(mod)#分位残差library(statmod)qresid(mod)R中的残差dt=data.frame(y=c(1,3,3,5,6,7,9,10),x=c(-1,-1,0,0,0,0,1,1))

mod=glm(y~x,data=dt,family=poisson(link=

'log'))

#残差

resid(mod,type=

'pearson')#Pearson残差##12345678

##-0.89880.3952-0.84400.06310.51670.9703-0.28280.0352resid(mod,type=

'deviance')#Deviance残差##12345678

##-1.01810.3799-0.90890.06280.49830.9097-0.28720.0352rstandard(mod)#标准化Deviance残差

##12345678

##-1.19590.4462-0.97980.06770.53720.9807-0.38570.0472mod$residuals#相对残差,等价于下式##12345678

##-0.58150.2556-0.38280.02860.23440.4401-0.08990.0112(dt$y-fitted(mod))/fitted(mod)##12345678

##-0.58150.2556-0.38280.02860.23440.4401-0.08990.0112#分位残差

library(statmod)qresid(mod)##[1]-1.15860.3137-0.8726-0.07770.59471.0112-0.09950.0469练习根据索赔次数数据,在负二项分布假设下,建立仅含截距项的GLM,估计模型参数,绘制分位残差的QQ图。n=0:5#索赔次数policy=c(1235,521,98,32,4,1)#保单数#负二项的极大似然估计与随机分位残差

n=

0:5

policy=

c(1235,521,98,32,4,1)

library(fitdistrplus)data=

rep(n,policy)

fit=

fitdist(data,‘nbinom’,

method=

‘mle’)

r=

fit$estimate[1]

mu=

fit$estimate[2]

set.seed(2203)

Fn=

c(0,pnbinom(n,size=r,mu=mu))#负二项分布函数

u=

NULL

for(i

in

1:6){

u=

c(u,runif(policy[i],Fn[i],Fn[i+1]))

}

Qn=

qnorm(u,0,1)#随机分位残差

qqnorm(Qn);qqline(Qn)方法2:应用statmod程序包n=

0:5

#索赔次数

policy=

c(1235,521,98,32,4,1)#保单数

num=

rep(n,policy)

dt=

data.frame(num=num)

library(statmod)

library(MASS)

mNB=

glm.nb(num~

1,data=dt)

qqnorm(qresid(mNB));qqline(qresid(mNB))n=

0:5

#索赔次数

policy=

c(1235,521,98,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论