基于excel和ss的描述性统计方法的比较_第1页
基于excel和ss的描述性统计方法的比较_第2页
基于excel和ss的描述性统计方法的比较_第3页
全文预览已结束

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于excel和ss的描述性统计方法的比较

描述性统计在不同分析软件中的应用描述性统计分析是对观察数据进行概括和分类的,以便人们能够基本理解和发现数据的一般规律。同时,它也是计算、诊断和分析的基础。其内容主要包括对数据的集中趋势分析、离散程度分析、数据的分布情况以及绘制一些基本的统计图形等。描述性统计在不同的分析软件中具有不同的统计数集合,他们之间存在着相同的统计数,也存在不同的统计数,甚至同一统计数具有不同分析结果。本文正是在此基础上,采用Excel和SAS数据处理软件,结合实例探讨描述性统计在Excel和SAS中的异同。旨在为描述性统计的正确应用及其操作的便捷程度给予说明,同时对同一统计数具有不同分析结果给予理论分析和实例介绍。1统计数的计算在Excel中进行描述性统计,主要有3种方法。第1种方法是通过加载宏,在里面选中“分析工具库”等选项,点击确定后(需要原软件安装盘),在“工具”菜单下会有1个“数据分析”选单,单击它会出现一个对话框,对话框内有1个“描述性统计”选项,其属于微软集成的1个统计功能,但输出结果较少,只包含表1中“置信度”以前的统计数。第2种方法是通过Excel集成的函数功能进行计算,部分统计数需要构造表达式或者计算式,详见表1。第3种方法是采用VBA编程实现。相对来讲,第1种方法操作最为简单,但结果输出比较单一,很多时候不满足实际需要;第2种方法比较灵活,但需要一定的统计学知识和相应的Excel统计函数等知识;第3种方法比较难,需要一定的编程功底和VBA语言基础,但编程成功后,可以一劳永逸,相当于软件集成或者基于Excel的2次开发。在SAS中进行描述性统计,主要有MEANS过程、UNIVARIATE过程、SUMMARY过程,其内部统计数关键字大部分是相同的,见表1的SAS关键字(常用内容)。MEANS过程可用来对数值变量计算描述性统计数。它可以通过VAR语句指定需要分析的变量,也可通过BY语句,将变量进行分组计算,在BY组内还可通过CLASS语句进一步分组。UNIVARIATE过程与MEANS过程一样,能计算各种描述统计量,但它的功能比MEANS过程还要强大,除了可完成MEANS过程的基本统计量的计算外,还能生成频率表,以及进行正态性检验和绘制正态概率图、茎叶图和盒形图(箱式图)等功能。SUMMARY过程与MEANS过程比较接近,所不同的是输出文件存在差别。由此可以看出,Excel和SAS均能够进行描述性统计,其统计数名称、Excel函数及表达式、SAS关键字对应表见表1。2统计数的结果假设1个班有20人,其数学成绩分别为56,80,52,81,60,87,90,89,90,93,89,69,79,83,92,95,89,74,86,89,采用Excel和SAS进行描述性统计,统计数结果详见表1。由表可知,Excel和SAS的描述性统计的计算结果几乎相同(四分位点数和百分位数除外)。而四分位点数和百分位数在Excel和SAS的计算结果中存在差别,这表明四分位点数和百分位数的计算法则可能存在差别。同时在表中的结果也可以看到,四分位点数在Excel中函数为QUARTILE(array,k),array为待分析的数据向量,k为供选参数,取值为0、1、2、3和4。其所对应的百分位数函数为PERCENTILE(array,k),k分别为0%、25%、50%、75%和100%。3pcd值的含义在Excel中百分位数的计算法则如下:d=1+(n−1)p=j+g(1)Xp=Xj+(Xj+1−Xj)×(d−j)(2)d=1+(n-1)p=j+g(1)Xp=Xj+(Xj+1-Xj)×(d-j)(2)(1)式中n为样本观测值个数,p为百分比,其值等同于Excel中函数percentile(array,k)中的k值。所以d值的含义可以表述为百分位数Xp的相对排序位置,j表示d值的整数部分,g表示d值的小数部分。(2)式中Xj代表Xp的相对位置下界(即升序排序后第j个X值),Xj+1表示Xp的相对位置上界(即升序排序后第j+1个X值)。需要特别指出的是,当d值为整数,其代表的百分位数Xp的绝对排序位置(即Xp在数值上等于Xd)。在SAS中,百分位数的计算共有5种算法,其默认算法基于d=np=j+g,当g=0时:Xp=(Xj+Xj+1)/2;当g>0时:Xp=Xj+1。需要特别指出的是,当d=0时,Xp=X1;当d=max(j)时,Xp=Xmax(j)。其他四种算法在此不再一一例举。在计算法则上,Excel的百分位数不但与SAS的默认算法存在差别,经过实际分析后,Excel的计算法则与SAS的5种计算法则均存在差别,见表3。这表明在进行描述性统计时,采用哪种软件分析会直接影响四分位点数和百分位数的计算结果,不能说哪个软件是对的,也不能说哪个软件是错的,我们只能说因为软件的不同,其构造的算法法则存在差别,或者说其内嵌的算法不同。4不同的算法,对计算结果表达的数据集中程度不同四分位数的统计学意义是判断数据分布状态,即根据四分位点数据,判断变量数据在中位数处是左偏,右偏还是对称。由于四分位数间距不受两端个别极大值或极小值的影响,因而四分位数间距较全距稳定,但仍未考虑全部观察值的变异度。根据前面的计算结果可知,不管是在Excel中还是在SAS中,其四分位数计算结果均显示为:20个人的数学成绩不是对称分布的,都左偏(图1)。同时,根据箱式图的统计学意义,箱体越扁(越长)代表数据越集中,即端线越短代表数据越集中,在图中可以看到,由于算法的差异导致同一数据组的数据集中程度表现不同,SAS中的默认算法5与Excel的算法更接近。也恰恰是因为算法不同,导致同一组数据计算结果表达的数据集中程度,偏态状态均存在差别。这在数据的实际分析中,就要求研究者选择适合自己的算法,以满足自己的研究目的,绝对不能套用和固守某种固定的模式,一定认识到任何统计方法都是为自己所学的专业服务,也就是运用统计学工具,解释说明自己的专业问题。在图中也可以看到,在变异系数相同的情况下,由于四分位数的算法不同,导致箱式图也存在很大的差别。这种差别不但表现在中位数的不同上,也表现在四分位间距上,同时还表现在箱体的起始点和终止点上(也就是25%和75%的百分位点不同)。表明如果选用Excel和SAS进行描述性统计时,箱式图会存在很大差别,这种差别的主要是因为四分位数算法存在差别。5内部算法不同描述性统计是进行统计推断和分析的基础,但不同的软件会有不同的统计数集合,同一统计数又因算法的不同会有不同的结果,这会给非统计专业研究者带来一定的困惑。因此,为非统计专业的研究者提供描述统计的详情十分必要。Excel有内部集成、函数和VBA编程3种操作方法;SAS有MEANS、UNIVARIATE和SUMMARY的3个主要过程。描述性统计在Excel和SAS中的统计数前者少于后者,但Excel可以通过函数建立表达式或计算式来完成所要计算的统计数,也可以通过VBA编程实

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论