应用统计学教学(北大)应统作业hw3_答案_第1页
应用统计学教学(北大)应统作业hw3_答案_第2页
应用统计学教学(北大)应统作业hw3_答案_第3页
应用统计学教学(北大)应统作业hw3_答案_第4页
应用统计学教学(北大)应统作业hw3_答案_第5页
已阅读5页,还剩10页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、姓名: 学号:作业三1、假设我们得到一个抽样调查数据,得到一个回归分析结果如下,根据以下表格,答复以下问题 。问题1:R20.169的意义是? 答:R20.169表示上学年数、结婚与否、年龄、个人月收入以及生活满意度5个自变量能解释因变量非传统婚姻观总方差的16.9%。问题2:上学年数对Y的作用是? 答:因为上学年数与因变量之间关系的假设检验的显著度小于0.05,个单位;或者:因为上学年数与因变量之间关系的假设检验的显著度小于0.05,由此题标准化回归系数表数据看出,在95%的置信水平下,在控制其他变量的情况下,上学年数每增加一个标准差,非传统婚姻观变化0.139个标准差。问题3:结婚与否对Y

2、的作用是? 答:因为结婚与否这个变量与因变量之间关系的假设检验的显著度小于0.05,由此题回归系数表数据看出,在95%的置信水平下,在控制本模型中其他变量的情况下,已婚人士的非传统婚姻观的平均分比未婚的少3.487分; 或者:因为结婚与否这个变量与因变量之间关系的假设检验的显著度小于0.05,由此题标准化回归系数表数据看出,在95%的置信水平下,在控制其他变量的情况下,已婚的相比未婚的在非传统婚姻观上反向变化0.164个标准差。问题4:X1、X2、X3、X4、X5中谁对Y的相对作用更大?为什么? 答:X2结婚与否对因变量的相对作用更大。因为结婚与否的标准化回归系数的绝对值0.164大于其他自变

3、量的标准化回归系数的绝对值,因此X2结婚与否对因变量的相对作用更大。2、请根据L9_factor.sav,选择h1b至h1l共7个变量,或者c4a-c4f共14个变量,做因子分析,并进行描述,要求:1把分析结果整理在这样的表格中:表3 人们经常从事的业余活动类型的因子分析表公因子负载公因子方差共同度公因子1公因子2公因子3ExtractionC4A 去电影院看电影C4B 去酒吧/咖啡厅/茶馆C4C 去体育场馆或健身房C4D 棋牌/打麻将C4E 看演唱会C4F 看影碟C4G 上互联网C4H 听音响C4I 听音乐会C4J 读闲书C4K 同朋友聚餐C4L 逛商场/逛街C4M 旅游C4N 参观博物馆/

4、艺术展览公因子奉献率公因子累计奉献率Extraction Method: Principal Component Analysis.Rotation Method: Varimax with Kaiser Normalization.2各个公因子分别能够很好地负载哪些观测变量?为什么这么说?可以起什么名字? 公因子1:承载C4F,C4G,C4K,因为他们的因子负载和共同度都大于0.55。代表时尚娱乐休闲,公因子2:承载C4E,C4I,因为他们的因子负载和共同度都大于0.55。代表高端文化休闲公因子3:承载C4D,因为他们的因子负载和共同度都大于0.55。代表棋牌休闲3哪几个观测变量没有得到公因

5、子的良好代表?为什么?C4A,C4B,C4C,C4H,C4J,C4L,C4M,C4N这些变量没有得到公因子的良好代表,因为这些变量的3个公因子负载或者低于0.55,或者与该组其他条目的因子负载也不接近,并且公因子共同度还低于0.55。公因子的累计奉献率也为未到达55%。3、请根据下面描述,答复以下问题。为考察全国31个省/市/自治区的18岁以上常住居民在本地居住6个月以上的法律意识和维权行为,工程组利用概率抽样调查,入户面访的方式采集数据。将全国31个省/市/自治区分为华北,华中,西部,长三角,珠三角五大经济区,然后分别在这些经济区中,按照概率与人口规模成比例的抽样方法pps,抽取了假设干个县

6、级行政单位。每个经济区内的县级行政单位的数量按照该经济区人口占总人口的比例分配。工程组共抽取了30个县级单位,在每个入选的县级单位中,按照pps抽样方法,抽取了2个乡镇级行政单位,在每个入选的乡镇级行政单位中,按照pps抽样方法,抽取了2个村/居。最后在每个村/居中根据村/居委会户籍资料名单等距抽取40户家庭,每户随机抽取1人进行访问。1研究总体是什么? 全国31个省/市/自治区的常住在本地居住6个月以上居民。2初级抽样单位是什么?有多少个? 初级抽样单位是县级行政单位,有30个。3是否分层了?如果是,那么分层的标准是什么? 分层了,分层标准是经济区,分了华北,华中,西部,长三角,珠三角五个层

7、。4这个抽样方案的关键性的弱点是哪几个? 初级抽样单位数量少,全国有2800多个县,至少抽到57个才能尽量减少估计量的方差;抽取家庭时用的户籍抽样框不完整,本次的研究设计已经把“在本地居住6个月以上的人算作常住居民,那么只根据村/居委会户籍资料名单来抽取家庭,就会漏掉那些没有在村/居委会登记的家庭和个人,从而有可能导致覆盖偏差。4、请根据任意数据库,选择你感兴趣的变量,做多元线性回归分析,并进行描述,要求:(1) 写明理论假设,指明因变量和自变量(2) 自变量中至少一个定距变量和至少有一个虚拟变量(3) 至少找出两个对因变量有显著线性影响的自变量(4) 检验多重共线性(5) 使用残差分析(6)

8、 分别解释自变量对因变量的作用(7) 解释回归模型的整体解释力学生作业范本如下:摘自陈楚仪的作业,老师有略微修改理论假设:理论假设清晰地写出变量之间的关系什么样的人群平均每天自由做一些事情的时间更多?本文假设人们的年龄、2006年全家平均每月的总收入、婚姻状况以及是否有需要抚养的子女影响着他们平均每天自由做一些事情的时间。分假设:在控制了其他变量的情况下,年龄越大的人平均每天自由做一些事情的时间更多;2006年全家平均每月总收入越高的人平均每天自由做一些事情的时间更少;已婚的人比单身的人平均每天自由做一些事情的时间更少;需要抚养子女的人比不需要抚养子女的人均每天自由做一些事情的时间更少。因变量

9、:受访人平均每天自由做一些事情的时间,变量名为c5a。自变量:自变量的处理方法得当年龄AGE,为定比变量;2006年全家平均每月的总收入k22,为定比变量;婚姻状况k17,为1/0编码的虚拟变量1为“已婚,0为“单身;是否有需要抚养的子女k19DUM,由于原来该变量的编码不是1/0编码,因此我把该变量转化为1/0编码的虚拟变量1为“有,0为“没有。 根据以上理论假设,本文使用SPSS软件对选定的因变量和自变量进行多元线性回归分析,以下是使用ENTER法得出的结果:表4-1 Variables Entered/RemovedbModelVariables EnteredVariables Rem

10、ovedMethod12006年,您全家平均每月的总收入, 受访人年龄, 您是否有需要抚养的子女, 您目前的婚姻状况.Entera. All requested variables entered.b. Dependent Variable: 平均每天自由做一些事情的时间表4-2 Model SummarybModelRR SquareAdjusted R SquareStd. Error of the EstimateDurbin-Watson做了回归分析假定条件的检验1.324a.105.097a. Predictors: (Constant), 2006年,您全家平均每月的总收入, 受访

11、人年龄, 您是否有需要抚养的子女, 您目前的婚姻状况b. Dependent Variable: 平均每天自由做一些事情的时间表4-3 ANOVAbModelSum of SquaresdfMean SquareFSig.1Regression4.000aResidual483Total487a. Predictors: (Constant), 2006年,您全家平均每月的总收入, 受访人年龄, 您是否有需要抚养的子女, 您目前的婚姻状况b. Dependent Variable: 平均每天自由做一些事情的时间表4-4 CoefficientsaModelUnstandardized Coef

12、ficientsStandardized CoefficientstSig.Collinearity StatisticsBStd. ErrorBetaToleranceVIF1(Constant).501.000您目前的婚姻状况这个已经转换成虚拟变量,有的同学会在这里出现错误,把定类和定序变量直接放进模型中了.432.004.605受访人年龄.079.012.317.000.754您是否有需要抚养的子女.345.004.7712006年,您全家平均每月的总收入.000.942.986a. Dependent Variable: 平均每天自由做一些事情的时间表4-5 Collinearity

13、DiagnosticsaModelDimensionEigenvalueCondition IndexVariance Proportions(Constant)您目前的婚姻状况受访人年龄您是否有需要抚养的子女2006年,您全家平均每月的总收入11.01.01.01.02.012.871.00.00.00.04.863.361.03.00.03.74.104.144.15.82.01.16.025.044.81.17.95.05.01a. Dependent Variable: 平均每天自由做一些事情的时间根据表4-3可以看出,在ANOVA方差分析中,显著度,可以认为在至少95%的置信水平下,

14、至少有一个自变量与因变量存在线性回归关系,即至少有一个自变量对受访人平均每天自由做一些事情的时间有显著影响,下面表达符合读者的习惯,有过渡句我们将具体分析哪些因素对因变量有显著影响。检验多重共线性请同学们注意对多重共线性的描述方法。以下的描述是标准根据表4-4可以得出,在多重共线性测试中,k17、AGE、k19DUM和k22四个自变量的容忍度分别为0.605、和,均远大于,说明各个自变量与其他自变量之间的多重共线性在容许限度之内,并且各自变量与其他自变量的独立性较强,那么计算得出的回归系数B不会受到多重共线性的影响。分别解释自变量对因变量的作用根据表4-4,在至少95%的置信水平下并且控制其他

15、变量的情况下,受访人婚姻状况k17、年龄AGE和是否有需要抚养的子女k19DUM分别对人们平均每天自由做一些事情的时间多少具有显著影响k17:;AGE:;k19DUM:。因“2006年全家平均每月的总收入k22的,因此该自变量对于人们平均每天自由做一些事情的时间没有显著影响,即2006年全家平均每月的总收入不同的人平均每天自由做一些事情的时间并没有显著差异。先总括有影响的因素,并且在括号里说明了依据;读者友好型写作法对于人们的婚姻状况来说,回归系数为3,说明在控制其他变量的情况下和95%的置信水平下,已婚的人编码为1比单身的人编码为0平均每天自由做一些事情的时间减少个单位。解释很标准很全面一般

16、来说,已婚的人除了工作之外还要花大量时间照顾家庭、整理家务,因此平均每天自由做一些事情的时间会少于单身的人。能够做归纳和概括,方便读者理解对于年龄来说,它的回归系数B为,说明在控制其他变量和95%的置信水平的情况下,年龄每增加一岁,人们平均每天自由做一些事情的时间那么增加个单位。一般来说,年龄较大的人工作的时间会相对减少,因此平均每天可自由支配的时间也会增加;年纪较轻的人一般忙于学习或工作,所以平均每天自由支配的时间那么较少。对于是否有需要抚养的子女来说,回归系数为,说明在控制其他变量和95%的置信水平的情况下,有需要抚养子女的人群编码为1比不需要抚养子女编码为0的人群平均每天自由做一些事情的

17、时间减少个单位。就现实来说,有需要抚养子女的人需要照顾子女的日常生活和学习,通常要工作更多时间以赚钱养家糊口,因此其平均每天自由支配的时间那么少于不需要抚养子女的人群。由于在标准化回归系数分析了标准化回归系数的作用,信息全面中,年龄Beta=.317的绝对值最大,而婚姻状况为,是否有需要抚养的子女为,所以可以认为年龄在众自变量中对因变量的奉献作用最大,即年龄与人们平均每天自由做一些事情的时间具有最强烈的线性关系。解释回归模型的整体解释力在表4-2的模型总体评价中,R2的值为,调整后的R2值为,说明了在排除了自变量数量过多的影响后,对调整后确实定系数解释很准确年龄、2006年全家平均每月的总收入

18、、婚姻状况以及是否有需要抚养的子女这四个自变量可以解释掉因变量%的总方差或者总变异。由于确定系数越接近于1,变量对y的解释能力越强。因此总体而言,这个比例还是相比照拟低的,说明这个模型的解释能力不强。有判断,方便读者理解残差分析表4-6 Residuals StatisticsaMinimumMaximumMeanStd. DeviationNPredicted Value488Residual.00000488Std. Predicted Value.000488Std. Residual.000.996488a. Dependent Variable: 平均每天自由做一些事情的时间根据表4

19、-6残差描述统计表可以得知,对残差分析的结果解读得很标准、全面、条理清晰各残差的平均值Residual-Mean为0,即说明在自变量取一定值的条件下,总体各误差项的条件平均值为0,那么这个模型满足“零均值的条件;其次,表4-2中显示,Durbin-Watson的值为,处于,2.3之间,满足“误差项独立的条件。图4-1图4-2图4-3但是从图4-1标准化残差散点图来看,各个点并没有在-2,2之间均匀分布,在该区间内呈现出向右下角倾斜的长方形,并且有许多点分散在2,6区间之外,因此这个模型不满足“等方差和“误差项与自变量独立的条件。最后,观察图4-2标准化残差直方图可以看出,各直方柱顶端没有紧密地

20、贴紧标准正态分布的曲线,尤其某一个区间内还大大超出曲线;而在图4-3中,粗黑曲线也没有很好地与直线拟合,因此总体误差项不满足正态分布条件。综上所述,这些自变量不满足多元线性回归分析的条件,因此必须用另外的分析方法以上是非常标准的解读残差分析结果的表述,请大家参照。5、请根据任意数据库,选择你感兴趣的变量,做二分类变量的logisitc回归分析,并进行描述,要求:(1) 写明理论假设,指明因变量和自变量(2) 自变量中至少一个定距变量和至少有一个虚拟变量(3) 至少找出两个对因变量有显著线性影响的自变量(4) 分别解释自变量对因变量的作用(5) 解释回归模型的整体解释力学生作业范本如下: 本模型

21、的理论假设:什么样的人群近期会有购置住房的方案?本文假设人们的年龄、家庭是否负债以及2006年全家平均每个月的日常支出总数影响着他们近期是否有购置房屋的方案。分假设:. 家庭没有负债的人近期有购置住房的方案的概率高于家庭负债的人;. 2006年全家平均每个月的日常支出越少的人近期有购置住房的方案的概率更高。. 年纪越小的人近期有购置住房的方案的概率更高。因变量:人们近期是否有购置房屋的方案重新编码的虚拟变量,“是编码为1,“否编码为0自变量:年龄AGE、家庭是否负债k29DUM、2006年全家平均每个月的日常支出k23,其中年龄和对收入状况的满意程度为定比变量,家庭是否负债为重新编码的虚拟变量

22、“是编码为1,“否编码为0。根据以上理论假设,我用SPSS软件中的ENTER法对因变量和自变量进行二分类逻辑斯蒂回归分析,这一点时必须包含的,有的学生有遗漏,注意此处以下表格是分析所得出的结果注:Block 0为截距模型:表5-1 Case Processing SummaryUnweighted CasesaNPercentSelected CasesIncluded in Analysis999Missing Cases2.2Total1001Unselected Cases0.0Total1001a. If weight is in effect, see classification

23、table for the total number of cases.表5-2 Dependent Variable EncodingOriginal ValueInternal Value没有0有1Block 0: Beginning Block截距模型可以不放在文章中表5-3 Classification Tablea,bObservedPredicted您近期是否有购置住房的方案Percentage Correct没有有Step 0您近期是否有购置住房的方案没有8830有1160.0Overall Percentagea. Constant is included in the mod

24、el.b. The cut value is .500表5-4 Variables in the EquationBS.E.WalddfSig.Exp(B)Step 0Constant.0991.000.131表5-5 Variables not in the EquationScoredfSig.Step 0Variablesk29DUM1.027AGE1.000k231.002Overall Statistics3.000Block 1: Method = Enter表5-6 Omnibus Tests of Model CoefficientsChi-squaredfSig.Step 1

25、Step3.000Block3.000Model3.000表5-7 Model SummaryStep-2 Log likelihoodCox & Snell R SquareNagelkerke R Square1a.029.057a. Estimation terminated at iteration number 5 because parameter estimates changed by less than .001.表5-8 Classification TableaObservedPredicted您近期是否有购置住房的方案Percentage Correct没有有S

26、tep 1您近期是否有购置住房的方案没有8830有1151.9Overall Percentagea. The cut value is .500表5-9 Variables in the EquationBS.E.WalddfSig.Exp(B)Step 1ak29DUM.3831.015.394AGE.0081.000.969k23.000.0001.003Constant.3121.001.363a. Variable(s) entered on step 1: k29DUM, AGE, k23.由表5-1可知,一共1001个受访人中只有2个缺失值,其比例非常小,这是做研究时需要注意的地

27、方那个,如果无答复比例比拟高,那么会受到答复误差的影响,结论会有偏因此数据可以用作分析。从表5-6看出,卡方检验的结果为,说明至少有一个自变量对因变量有显著的影响。根据表5-9可以得出,在控制其他变量的情况下,在至少95%的置信水平下,家庭是否负债k29DUM、年龄AGE以及2006年全家平均每个月的日常支出k23这三个自变量均对人们近期是否有购置住房的方案的发生概率具有显著影响家庭是否负债:15;年龄:;2006年全家平均每个月的日常支出:3。以下将具体分析各个自变量对于因变量的作用。先总括,读者方便理解分别解释自变量对因变量的作用首先,对于家庭是否负债来说,因为回归系数B=-0.930,发生比率Exp(b)=0.394,所以在控制

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论