Logistic回归的实际应用_第1页
Logistic回归的实际应用_第2页
Logistic回归的实际应用_第3页
Logistic回归的实际应用_第4页
Logistic回归的实际应用_第5页
已阅读5页,还剩6页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、Logistic 回归的介绍与实际应用 摘要 本文通过对 logistic 回归的介绍,对 logistic 回归模型建立的 分析,以及其在实际生活中的运用,我们可以得出所建立的模型对实 际例子的数据拟合结果不错。 关键词:logistic 回归;模型建立;拟合;、logistic回归的简要介绍 1 、Logistic 回归的应用范围: 适用于流行病学资料的危险因素分析 实验室中药物的剂量-反应关系 临床试验评价 疾病的预后因素分析 2、 Logistic回归的分类: 按因变量的资料类型分:二分类、多分类;其中二分较为常用 按研究方法分:条 件Logistic回归、非条件Logistic回归

2、两者针对的资料类型不一样,后者针对成组研究,前者针对配对或配伍 研究。 3、 Logistic回归的应用条件是: 独立性。各观测对象间是相互独立的; Logit P与自变量是线性关系; 样本量。 经验值是病例对照各 50例以上或为自变量的5-10倍 (以10 倍为宜) ,不过随着统计技术和软件的发展,样本量较小或不能进行似 然估计的情况下可采用精确logistic回归分析,此时要求分析变量不能太 多,且变量分类不能太多; 当队列资料进行logistic回归分析时,观察时间应该相同,否则需考虑 观察时间的影响(建议用 Poisson回归)。 4、拟和logistic回归方程的步骤: 对每一个变量

3、进行量化,并进行单因素分析; 数据的离散化,对于连续性变量在分析过程中常常需要进行离散变成 等级资料。可采用的方法有依据经验进行离散,或是按照四分、五分位 数法来确定等级,也可采用聚类方法将计量资料聚为二类或多类,变为 离散变量。 对性质相近的一些自变量进行部分多因素分析,并探讨各自变量(等 级变量,数值变量)纳入模型时的适宜尺度,及对自变量进行必要的变 量变换; 在单变量分析和相关自变量分析的基础上,对 PWa(常取0.2,0.15 或0.3)的变量,以及专业上认为重要的变量进行多因素的逐步筛选;模 型程序每拟合一个模型将给出多个指标值,供用户判断模型优劣和筛选 变量。可以采用双向筛选技术:

4、a进入变量的筛选用score统计量或G统 计量或LRS(似然比统计量),用户确定P值临界值如:0.05、0.1或0.2, 选择统计量显著且最大的变量进入模型;b剔除变量的选择用Z统计量 (Wald统计量),用户确定其P值显著性水平,当变量不显者,从模型中 予以剔除。这样,选入和剔除反复循环,直至无变量选入,也无变量删 除为止,选入或剔除的显著界值的确定要依具体的问题和变量的多寡而 定,一般地,当纳入模型的变量偏多,可提高选入界值或降低剔除标准, 反之,则降低选入界值、提高删除标准。但筛选标准的不同会影响分析 结果,这在与他人结果比较时应当注意。 在多因素筛选模型的基础上,考虑有无必要纳入变量的

5、交互作用项; 两变量间的交互作用为一级交互作用,可推广到二级或多级交互作用, 但在实际应用中,各变量最好相互独立(也是模型本身的要求),不必研究 交互作用,最多是研究少量的一级交互作用。 对专业上认为重要但未选入回归方程的要查明原因。 5、回归方程拟合优劣的判断(为线性回归方程判断依据,可用于 logistic回 归分析) 决定系数(R2)和校正决定系数 ( ),可以用来评价回归方程的 优劣。R2随着自变量个数的增加而增加,所以需要校正;校正决定系数 ( )越大,方程越优。但亦有研 究指出R2是多元线性回归中经常用到的一个指标,表示的是因变量的变 动中由模型中自变量所解释的百分比, 并不涉及预

6、测值与观测值之间差 别的问题, 因此在logistic回归中不适合。 CP选择法:选择CP最接近p或p+ 1的方程(不同学者解释不同)。CP 无法用SPSS直接计算,可能需要手工。1964年CL Mallows提出:Cp接近(p+1)的模型为最佳,其中p为方程中自变量的个数,m为自 变量总个数。 AIC准则:1973年由日本学者赤池提出 AIC计算准则,AIC越小拟合的 方程越好。 在logistic回归中,评价模型拟合优度的指标主要有 PearsonX、偏差 (devianee) Hosmer- Lemeshow (HL)指标、Akaike 信息准则(AIC)、SC 指标 等。Pearson

7、X、偏差(devianee主要用于自变量不多且为分类变量的情况, 当自变量增多且含有连续型变量时,用 HL指标则更为恰当。PeasonX、偏 差(devianee) Hosmer- Lemeshow (HL)指标值均服从 X分布,X检验无统计 学意义(P0.05)表示模型拟合的较好,X检验有统计学意义(Pw 0.05)则表示 模型拟合的较差。AIC和SC指标还可用于比较模型的优劣, 当拟合多个模 型时, 可以将不同模型按其 AIC和SC指标值排序,AIC和SC值较小者一 般认为拟合得更好。 6、拟合方程的注意事项: 进行方程拟合对自变量筛选采用逐步选择法前进法(forward)、后退法 (ba

8、ckward)、逐步回归法(step wise)时,引入变量的检验水准要小 于或等于剔除变量的检验水准; 小样本检验水准a定为0.10或0.15,大样本把a定为0.05。值越小说明 自变量选取的标准越严; 在逐步回归的时可根据需要放宽或限制进入方程的标准,或硬性将最感 兴趣的研究变量选入方程; 强影响点记录的选择:从理论上讲,每一个样本点对回归模型的影响应 该是同等的,实际并非如此。有些样本点(记录)对回归模型影响很大。 对由过失或错误造成的点应删去,没有错误的强影响点可能和自变量与 应变量的相关有关,不可轻易删除。 多重共线性的诊断(SPSS中的指标):a容许度:越近似于0,共线性 越强;b

9、特征根:越近似于0,共线性越强;c条件指数:越大,共线性 越强; 异常点的检查:主要包括特异点(outher)、高杠杆点(high leverage points) 以及强影响点(influential points)。特异点是指残差较其他各点大得多的 点;高杠杆点是指距离其他样品较远的点;强影响点是指对模型有较大 影响的点,模型中包含该点与不包含该点会使求得的回归系数相差很大。 单独的特异点或高杠杆点不一定会影响回归系数的估计,但如果既是特 异点又是高杠杆点则很可能是一个影响回归方程的“有害”点。对特异 点、高杠杆点、强影响点诊断的指标有 Pearson残差、Devia nee残差、杠 杆度

10、统计量 H (hat matrix diagnosi、Cook 距离、DFBETA、Score 检 验统计量等。这五个指标中,Pearson残差、Devia nee残差可用来检查特 异点,如果某观测值的残差值2,则可认为是一个特异点。杠杆度统计 量H可用来发现高杠杆点,H值大的样品说明距离其他样品较远,可认 为是一个高杠杆点。Cook距离、DFBETA指标可用来度量特异点或高杠 杆点对回归模型的影响程度。Cook距离是标准化残差和杠杆度两者的合 成指标,其值越大,表明所对应的观测值的影响越大。 DFBETA指标值 反映了某个样品被删除后logistic回归系数的变化,变化越大(即DFBETA

11、指标值越大),表明该观测值的影响越大。如果模型中检查出有特异点、 高杠杆点或强影响点,首先应根据专业知识、数据收集的情况,分析其 产生原因后酌情处理。如来自测量或记录错误,应剔除或校正,否则处 置就必须持慎重态度,考虑是否采用新的模型,而不能只是简单地删除 就算完事。因为在许多场合,异常点的出现恰好是我们探测某些事先不 清楚的或许更为重要因素的线索。 7、 回归系数符号反常与主要变量选不进方程的原因: 存在多元共线性; 有重要影响的因素未包括在内; 某些变量个体间的差异很大; 样本内突出点上数据误差大; 变量的变化范围较小; 样本数太少。 8、 参数意义 Logistic回归中的常数项(bo)

12、表示,在不接触任何潜在危险/保护因素 条件下,效应指标发生与不发生事件的概率之比的对数值。 Logistic回归中的回归系数(bi)表示,其它所有自变量固定不变,某一 因素改变一个单位时,效应指标发生与不发生事件的概率之比的对数变 化值,即OR或RR的对数值。需要指出的是,回归系数 B的大小并不 反映变量对疾病发生的重要性, 那么哪种因素对模型贡献最大即与疾病 联系最强呢?(InL(t-i)-lnL(t)三种方法结果基本一致。 存在因素间交互作用时,Logistic回归系数的解释变得更为复杂,应特别 小心。 模型估计出OR,当发病率较低时,ORRR,因此发病率高的疾病资料 不适合使用该模型。另

13、外,Logistic模型不能利用随访研究中的时间信息, 不考虑发病时间上的差异,因而只适于随访期较短的资料,否则随着随 访期的延长,回归系数变得不稳定,标准误增加。 9、统计软件 能够进行logistic回归分析的软件非常多,常用的有SPSS SAS、Stata EGRET (Epidemiological Graphics Estimatio n and Test ing Package等。 二、logistic 回归模型的建立 1、实际的例子:在一次住房展销会上,与房地产商签订初步购房意向书的 共有n=313名顾客。在随后的3个月的时间内,只有部分顾客确实购买了房屋。 购买房屋的顾客记为1

14、,没有购买房屋的顾客记为0。以顾客的年家庭收入(万 元)为自变量x,对表1中的数据建立Logistic回归模型。 序号 年家庭收 入(万元) x 签订意向 书人数 ni 实际购房 人数 mi 实际购房 比例 Pi mi /ni 逻辑变换 Pi ln( Pi ) 1 Pi 权重 Wi ni Pi(1 Pi) 1 1.5 25 8 0.320000 -0.75377 5.440 2 P 2.5 32 13 0.406250 -0.37949 7.719 3 3.5 58 26 0.448276 -0.20764 14.345 4 4.5 52 22 0.423077 -0.31015 12.692

15、 5 P 5.5 43 20 0.465116 -0.13976 10.698 6 6.5 39 22 0.564103 0.257829 9.590 7 7.5 28 16 0.571429 0.287682 6.857 8 P 8.5 21 12 0.571429 0.287682 5.143 9 9.5 15 10 0.666667 0.693147 3.333 表1 2、模型的建立: Logistic 回归方程: pi eXP(0 - , i=1,2,.,c (1) 1 exp( o iXi) (1)式中c为分组数据的组数。 本例中,c=9。将以上回归方程做线性变换,令 p; ln(

16、匕) (2) 1 Pi 式(2)的变换称为逻辑变换,变换后的线性回归模型为: p匚 必 匚(3) 式(3)是一个普通的一元线性回归模型。式(3)没有给出误差项的形式,我们 认为其误差项的形式就是做线性变换所需要的形式。对表1中的数据,算出经验 I 回归方程为:p 0.886 0.156X, ( 4) 判别系数 r2 0.9243,显著性检验P值0,高度显著。将式(4)还原为式(1) 的 Logistic 回归方程为:p exp( 0.886_0.156x) (5) 1 exp( 0.886 0.156x) 三、 运用模型进行预测 利用式(5 )可以对购房比例做预测,例如怡8,则有 exo( 0

17、.886 0.156x) p =0.590。 1 exo( 0.886 0.156x) 四、 结果的实际意义 这表明在住房展销会上与房地产商签订初步购房意向书的年收入 8万元家 庭中,预计实际购房比例为 59%或者说,一个签订初步购房意向书的年收入 8 万元的家庭,其购房概率为59%. 五、 模型的拟合效果分析 我们用Logistic回归模型成功地拟合了因变量为定性变量的回归模型, 但是 仍然存在一个不足之处,即异方差性并没有解决。式( 3)的回归模型不是等方 差的,应该对式(3),用加权最小二乘估计。当 ni较大,p;的近似方差为: D(p;) - ( 6),其中 i E(yJ,因而选取权数

18、:W np(1 p),( 7) ni i(1 i) 对例题重新用加权最小二乘做估计。利用SPSS软件操作,点选分析回归线 性回归,因变量:逻辑变换;自变量:年家庭收入; WLS权重:权重 wi。得到 结果如下: 模型汇总b,c 模型 R R方 调整 R方 标准估计的误 差 Durbin-Watson 1 .939a .881 .864 2.4282 2.059 a.预测变量:(常量),逻辑变换。 b.因变量:年家庭收入 x c.加权的最小二乘回归 -按权重 w进行加权 Anovab,c 模型 平方和 df 均方 F Sig. 1 回归 306.486 1 306.486 51.982 .000a 残差 41.272 7 5.896 总计 347.758 8 a.预测变量:(常量),逻辑变换。 b.因变量:年家庭收入 x c.加权的最小二乘回归 -按权重

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论