缺失值处理的现代方法_第1页
缺失值处理的现代方法_第2页
缺失值处理的现代方法_第3页
缺失值处理的现代方法_第4页
缺失值处理的现代方法_第5页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

缺失值处理的现代方法前文:缺失值的机制和传统处理方法/s/blog_7fb03f7d01012j6p.html传统的方法存在种种不足,新的方法也在不断发展,其中最为研究者推崇的方法为多重填补(MultipleImputation,MI)和极大似然估计(Allison,2003;Graham,2009;Schafer&Graham,2002)。极大似然估计极大似然估计在处理缺失值数据时又称作全息极大似然估计(FullInformationMaximumLikelihood,FIML),意指使用所有观测变量的全部信息。FIML同ML分析完整数据过程一样,只是在计算单个对数似然值时使用全部完整信息而不考虑缺失值(公示见,Enders,2006,2010)。因此,ML处理缺失值并非使用替代值将缺失填补,而是使用已知信息采用迭代的方式估计参数。FIML在MCAR和MAR下产生无偏和有效的参数估计值。当在非正态分布时,FIML需要使用同完整数据时的参数校正统计量(S-Bχ2等,见本章),Bootstrapping也是有效的策略之一。FIML法包含辅助变量的分析使用Graham(2003)提出的饱和相关模型(SaturatedCorrelates),即将辅助变量纳入模型中,同时允许辅助变量间、辅助变量与外生观测指标以及内生观测指标的测量误差相关。假设第5章PTSD例子的数据存在缺失值,同时假定性别和年龄为辅助变量,表9-5给了使用FIML估计DSM三因子结构的Mplus程序。表9-5FIML处理缺失值的Mplus语句TITLE:CFAModelWithMissingData;DATA:FILEISPTSDwithMissing.dat;VARIABLE:NAMEaregenderagey1-y17;USEVARIABLES=y1-y17;MISSING=ALL(9);AUXILIARY=(m)genderage;

!设置自动包含辅助变量,(m)指定缺失分析的辅助变量。也可在模型中设置辅助变量与指标的相关,见(Enders,2010,例5-14)ANALYSIS:TYPE=missing;!第5版之后此项为默认设置;ESTIMATOR=ML;!非正态时可以选用MLM或MLR等;INFORMATION=observed;!Mplus提供Expected和Observed两种信息矩阵,两者的区别在于计算标准误时依据的缺失值机制不同,期望矩阵的要求是MCAR而观测依据的是MAR,所以通常使用的Observed矩阵(Enders,2010)。BOOTSTRAP=500(residual);!获得BOOTSTRAP标准误;MODEL:F1byy1-y5*;F2byy6-y12*;F3byy13-y17*;F1-F3@1;OUTPUT:sampstatstandardized;多重插补法(MultipleImputation,MI)该方法由Rubin(1987)最早提出,假设在数据随机缺失情况下,用两个或更多能反映数据本身概率分布的值来填补缺失值的方法。一个完整的MI包含三步:数据填补(ImputationPhase),计算(AnalysisPhase)和汇总(PoolingPhase)。数据填补是关键一步,对每一个缺失数据填补m(m>1)次。每次填补将产生一个完全数据集,以此类推,共产生m个完全数据集。第二步,对每一个完全数据集采用标准的完全数据分析方法进行分析。第三步,将所每次分析得到的结果进行综合,得到最终的统计推断。根据数据缺失机制、模式以及变量类型,可分别采用回归、预测均数匹配(predictivemeanmatching,PMM)、趋势得分(propensityscore,PS)、Logistic回归、判别分析以及马尔可夫链蒙特卡罗(MarkovChainMonteCarlo,MCMC)等不同的方法进行填补。与FIML不同,MI采用填补缺失值的方法。MI要求数据缺失为MAR,如果采用ML估计同样要求数据分布符合多元正态分布假设,但研究发现违反正态性假设对MI参数精确性影响不大(Demirtas,Freels,&Yucel,2008;Schafer,1997)。另外一个影响估计精确性的因素是缺失率,Demirtas等(2008)的研究发现缺失率高达25%仍能得到精确的参数估计结果。在具体使用MI时需要考虑m的次数,类似Bootstrapping抽样,理论上来说m的数量越多估计越精确,但太大的数量会增加计算负荷,模拟研究指出m=20在多数情况下是合适的(Graham,Olchowski,&Gilreath,2007)。在Mplus中执行MI需要两步,第一步数据插补,第二步使用第一步插补的数据集估计计算并输出汇总结果,两步的Mplus语句呈现在表9-6中。表9-6多重插补法处理缺失值的Mplus语句TITLE:CFAModelWithMissingData;DATA:FILEISPTSDwithMissing.dat;VARIABLE:NAMEaregenderagey1-y17;USEVARIABLES=y1-y17;MISSING=ALL(9);AUXILIARY=(m)genderage;

!括号内的m表示其后的变量作为缺失值的辅助变量。DATAIMPUTATION:

IMPUTE=y1-y17;!设置存在缺失值的变量进行插补,如果是类别变量在变量名后加“(C)”。

NDATASETS=50;!设置m=50,默认值为5;

save=PTSDimp*.dat;!设置插补的50个数据集保存文件名,“*”将被数值替换。

ANALYSIS:

type=basic;

!SEEDFORDATAAUGMENTATIONALGORITHM;

bseed=79566;

!NUMBEROFDATAAUGMENTATIONCHAINS;

chains=1;

TITLE:SummaryStatisticswithMultiplyImputedData;DATA:FILEISPTSDimplist.dat;使用第一步保存的插补数据文件集;

TYPE=imputation;进行MI设置;VARIABLE:

NAMEaregenderagey1-y17;USEVARIABLES=y1-y17;ANALYSIS:

ESTIMATOR=ML;

INFORM

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论