数理统计课程设计.doc_第1页
数理统计课程设计.doc_第2页
数理统计课程设计.doc_第3页
数理统计课程设计.doc_第4页
数理统计课程设计.doc_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一:题目8.高考单科成绩与公共基础课、专业基础课、专业选修成绩的相关性分析;公共基础课、专业基础课、专业选修课的分类在辅导员处查找。二:题目分析 根据题意,我们要分析高科单科成绩与公共基础课、专业基础课、专业选修成绩的相关性,就需找一个统计量,它能反映出它们之间的相关程度。假设高考单科成绩:语文,数学,英语,综合以及公共基础课,专业基础课和专业选修课均是连续型变量,并且它们各自的分布是某个分布族中的一个。而对于连续性的变量,最常用的是描述变量间取值线性相关的样本Pearson相关系数。设变量的样本量为的观测值为,则样本Pearson相关系数(coefficient of correlation)为 且r介于-1与1之间,r的绝对值越大,表示x,y取值间的线性联系越强。 三:变量说明x1: 高考语文成绩 x2: 高考数学成绩x3: 高考英语成绩x4: 高考综合成绩y1: 所有公共基础课总成绩y2: 所有专业基础课总成绩y3: 所有专业选修课总成绩Ex: 观测值x(x1,x2,x3,x4)的均值Ey: 观测值y(y1,y2,y3)的均值cov: 观测值x与y之间的协方差r为相关系数矩阵且r(j,k)为xj与yk之间的相关系数(j=1,2,3,4;k=1,2,3)四:缺失值处理 对数据缺失特征的描述,最重要的是要考察数据的缺失值机制。数据的缺失值机制包括三种:完全随机缺失(Missing Completely At Random, MCAR)、随机缺失(Missing At Random, MAR)与非随机缺失(Not Missing At Random, NMAR)。如果数据缺失的概率既不依赖于观测值也不依赖于缺失值,则数据缺失状态属于MCAR;如果数据缺失的概率仅仅依赖于观测值,那么数据缺失状态属于MAR;而如果数据缺失的概率既依赖于观测值又依赖于缺失值,那么数据缺失状态属于NMAR,这种缺失状态又被称为不可忽视缺失。对于数据缺失状态是否属于MCAR,Little提出了一种检验方法,即Little检验。缺失值的处理有以下几种方法: 一)个案剔除法(Listwise Deletion)最常见、最简单的处理缺失数据的方法是用个案剔除法(listwise deletion),也是很多统计软件(如SPSS和SAS)默认的缺失值处理方法。在这种方法中如果任何一个变量含有缺失数据的话,就把相对应的个案从分析中剔除。如果缺失值所占比例比较小的话,这一方法十分有效。至于具体多大的缺失比例算是“小”比例,专家们意见也存在较大的差距。有学者认为应在5%以下,也有学者认为20%以下即可。然而,这种方法却有很大的局限性。它是以减少样本量来换取信息的完备,会造成资源的大量浪费,丢弃了大量隐藏在这些对象中的信息。在样本量较小的情况下,删除少量对象就足以严重影响到数据的客观性和结果的正确性。因此,当缺失数据所占比例较大,特别是当缺数据非随机分布时,这种方法可能导致数据发生偏离,从而得出错误的结论。二)均值替换法(Mean Imputation)在变量十分重要而所缺失的数据量又较为庞大的时候,个案剔除法就遇到了困难,因为许多有用的数据也同时被剔除。围绕着这一问题,研究者尝试了各种各样的办法。其中的一个方法是均值替换法(mean imputation)。我们将变量的属性分为数值型和非数值型来分别进行处理。如果缺失值是数值型的,就根据该变量在其他所有对象的取值的平均值来填充该缺失的变量值;如果缺失值是非数值型的,就根据统计学中的众数原理,用该变量在其他所有对象的取值次数最多的值来补齐该缺失的变量值。但这种方法会产生有偏估计,所以并不被推崇。均值替换法也是一种简便、快速的缺失数据处理方法。使用均值替换法插补缺失数据,对该变量的均值估计不会产生影响。但这种方法是建立在完全随机缺失(MCAR)的假设之上的,而且会造成变量的方差和标准差变小。三)热卡填充法(Hotdecking)对于一个包含缺失值的变量,热卡填充法在数据库中找到一个与它最相似的对象,然后用这个相似对象的值来进行填充。不同的问题可能会选用不同的标准来对相似进行判定。最常见的是使用相关系数矩阵来确定哪个变量(如变量Y)与缺失值所在变量(如变量X)最相关。然后把所有个案按Y的取值大小进行排序。那么变量X的缺失值就可以用排在缺失值前的那个个案的数据来代替了。与均值替换法相比,利用热卡填充法插补数据后,其变量的标准差与插补前比较接近。但在回归方程中,使用热卡填充法容易使得回归方程的误差增大,参数估计变得不稳定,而且这种方法使用不便,比较耗时。四)回归替换法(Regression Imputation)回归替换法首先需要选择若干个预测缺失值的自变量,然后建立回归方程估计缺失值,即用缺失数据的条件期望值对缺失值进行替换。与前述几种插补方法比较,该方法利用了数据库中尽量多的信息,而且一些统计软件(如Stata)也已经能够直接执行该功能。但该方法也有诸多弊端,第一,这虽然是一个无偏估计,但是却容易忽视随机误差,低估标准差和其他未知性质的测量值,而且这一问题会随着缺失信息的增多而变得更加严重。第二,研究者必须假设存在缺失值所在的变量与其他变量存在线性关系,很多时候这种关系是不存在的。五)多重替代法(Multiple Imputation)多重估算是由Rubin等人于1987年建立起来的一种数据扩充和统计分析方法,作为简单估算的改进产物。首先,多重估算技术用一系列可能的值来替换每一个缺失值,以反映被替换的缺失数据的不确定性。然后,用标准的统计分析过程对多次替换后产生的若干个数据集进行分析。最后,把来自于各个数据集的统计结果进行综合,得到总体参数的估计值。由于多重估算技术并不是用单一的值来替换缺失值,而是试图产生缺失值的一个随机样本,这种方法反映出了由于数据缺失而导致的不确定性,能够产生更加有效的统计推断。结合这种方法,研究者可以比较容易地,在不舍弃任何数据的情况下对缺失数据的未知性质进行推断。NORM统计软件可以较为简便地操作该方法。五:本题处理方法由于本题数据的缺失不依赖与任何不完却变量或数据缺失的概率既不依赖于观测值也不依赖于缺失值,则数据缺失状态属于完全随机缺失(Missing Completely At Random, MCAR)。所以采用:一)个案剔除法(Listwise Deletion)二)均值替换法(Mean Imputation)六:计算计算程序:X=x1,x2,x3,x4;Y=y1,y2,y3;n=size(x1);n=n(1)r=zeros(4,3);for j=1:4 x=X(:,j); for k=1:3 y=Y(:,k); Ex=0; Ey=0; cov=0; Darx=0; Dary=0; for i=1:n Ex=Ex+(1/n).*x(i); Ey=Ey+(1/n).*y(i); end for i=1:n cov=cov+(x(i)-Ex).*(y(i)-Ey); Darx=Darx+(x(i)-Ex).2; Dary=Dary+(y(i)-Ey).2; end Dar=(Darx.*Dary).1/2; r(j,k)=cov./Dary; endendr=r七:计算结果及分析一)用个案剔除法(Listwise Deletion),去掉含有缺失值的个案后,得到高考单科成绩与公共基础课,专业基础课及专业选修课成绩之间的相关系数如下: 公共基础课专业基础课专业选修课高考语文成绩-0.0811-0.0066-1606高考数学成绩-0.05080.0153-0.1331高考英语成绩-0.05840.0024-0.1225高考综合成绩-0.1636-0.0037-0.2098(具体数据,程序分别为附录数据1和Untiled1)。二)用均值替换法(Mean Imputation) 法,确定缺失值后,得到高考单科成绩与公共基础课,专业基础课及专业选修课成绩之间的相关系数如下:公共基础课专业基础课专业选修课高考语文成绩-0.0586-0.0013-1275高考数学成绩-0.01860.0222-0.0903高考英语成绩-0.02600.0135-0.0627高考综合成绩0.00230.0098-0.1436(具体数据,程序分别为附录数据2和Untiled2)。由样本Pearson相关系数(coefficient of correlation)绝对值的大小可知:(1) 高考单科成绩与公共基础课,专业基础课及专业选修课成绩之间具有一定的相关性,并不是独立的,相关性较低。(2) 高考单科成绩与专业选修课最具相关相关性,与公共基础课相关程度次之,与专业基础课的相关性最小。 (3) 用均值替换法(Mean Imputation)处理缺失值 比用个案剔除法(Listwise Deletion)处理缺失值后得到的样本Pearson相关

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论