版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
统计软件包SAS系统与统计分析第四章统计描述与SAS过程4.1变量的数字特征与MEANS过程4.2单变量分析与UNIVARIATE过程1、表示位置的数字特征总体均值、中位数、众数众数是使得随机变量密度函数取最大值的数值一、随机变量的数字特征2、表示离散程度的数字特征极差、方差、标准差、标准差(变异)系数4.1变量的数字特征与MEANS过程极差:变异系数:标准差系数反映了单位均值上的离散程度常用在两个总体均值不等的离散程度的比较上。3、表示分布形状的数字特征偏度、峰度(对称正态为0)偏度:度量总体分布偏斜程度随机变量分布为对称分布;非对称的右偏分布,即随机变量取值在右边比较分散;非对称的左偏分布,即随机变量取值在左边比较分散;峰度:度量总体分布尾部粗细程度(与正态分布相比)正态分布随机变量的峰度为0;与正态分布相比,随机变量X偏离均值的极端值较少,分布形状较平坦。与正态分布相比,随机变量X偏离均值的极端值较多,分布有一个沉重的尾部,也称重尾或粗尾,分布形状较陡峭;3、表示分布形状的样本统计量样本偏度、样本峰度4、区间估计二、参数估计1、表示位置的样本统计量样本均值、中位数、百分位数2、表示离散程度的样本统计量样本方差、样本标准差、四分位差,样本变异系数、样本均值标准误差例题4.1,P93在实际应用中,经常会遇到数据处理的问题,那么为了分析数据我们就需要利用相关的统计量,数字特征来反映数据的特性。
主要功能
:
MEANS过程用来对数据集中的数值变量的全部非丢失观测计算简单的描述统计量;还可以对均值进行假设检验并给出置信区间;对观测组(BY组)分别计算简单描述统计量。三、MEANS过程MEANS过程的一般格式为:PROC
MEANS<option-list><statistic-keyword-list>;(必需的语句)varvariable-list;classvariable-list;freqvariable;weightvariable;idvariable-list;byvariable-list;output<out=sas-data-set><output-sataistic-list>….其余都是可选语句1、PROCMEANS语句一般格式:PROCMEANS<options><statistic-keywords>;常用options:(1)DATA=数据集名(2)NOPRINT或PRINT:规定不输出或输出描述统计量;(3)MAXDEC=number;规定输出结果小数部分的最大位数,缺省为2;(4)ALPHA=value:规定置信区间的置信水平,缺省为0.05;常见统计量:MEAN:均值STD:标准差MIN:最小值MAX:最大值RANGE:极差SUM:求和VAR:方差SKEWNESS:偏度KURTOSIS:峰度等等语句说明statistic-keywords:规定输出的统计量2、VAR语句:一般格式VARvariable-list;规定要求计算简单统计量的数值变量及次序。3、BY语句:一般格式BYvariable-list;根据by语句定义的观测组分别计算各组相应的简单统计量。(要先排序)4、CLASS语句:一般格式CLASSvariable-list;可用其规定的变量定义观测组,并分别计算各组相应的简单统计量。5、FREQ语句:一般格式FREQvariable;指定变量表示相应观测出现的频数6、WEIGHT语句:WEIGHTvariable;指定变量表示相应观测的权数7、ID语句:一般格式IDvariable;对产生的数据集增加一个或几个附加变量,用于识别输出数据集里的观测。
要求把计算的描述统计量输出到新的SAS数据集中,并对新数据集的名字及所包含的统计量名字列表。8、OUTPUT语句:一般格式:OUTPUT<OUT=SAS-data-set><output-statistic-list><MAXID<(var-1<id-list-1><…var-n<(id-list-n)>>)>=name-list><MINID<(var-1<id-list-1><…var-n<(id-list-n)>>)>=name-list>;三类任选项:(1)OUT=SAS-data-set:给出产生输出数据集的名字;(2)output-statistic-list;规定输出数据集里所要求的统计量,并规定这些统计量的变量名。有以下几种形式:1)statistic-keyword=:如outputout=resultmean=meanx;2)statistic-keyword=name-list(名字列表)对所有的分析变量规定统计量的变量名如:outputout=result1mean=meanx1meanx2;(3)<MAXID<(var-1<id-list-1><…var-n<(id-list-)>>)>=name-list><MINID<(var-1<id-list-1><…var-n<(id-list-n)>>)>=name-list>;该项选择用不同分析变量的最大或最小值来识别变量的列表。3)statistic-keyword(variable-list)=name-list对部分分析变量规定统计量的变量名如:outputout=result2mean=premeanpostmeanstd(post)=stdpost;(统计关键词(变量列表)=名字列表)Var是被取最大值或最小值变量;id-list是对最大值或最小值的识别变量。dataa;inputname$sex$heightage;cards;rosef16519katef16817mikem17620johnm18019alicef17022;proc
meansdata=a;varheightage;outputout=newmax=maxhmaxamaxid(height(name)age(name))=heightstagest;run;maxid(height(name)age(name))=heightstagest;要求给出身高和年龄最大者的姓名,并分别用变量名保存在输出数据集中。如:要求找出数据集a中身高最高者和年龄最大者输出结果课本例4.1(P97)dataincomes;inputincome@@;cards;27139628739946626929533042532422811322617632023040448712774234523164336343330436141388293464200392265403259426262221355324374347261287113135291176342443239302483231292373346293236223371287400314468337308359352273267277184286214351270330238248419330319440427314414299265318415372238323412493286313412;proc
meansdata=incomesmeanvarstdcvskewnesskurtosisalpha=0.1tprtclmmaxdec=2;varincome;run;MEANS过程应用mean:均值;var:方差;std:标准差cv:标准差系数;skewness:偏度kurtosis:峰度;alpha=0.1:显著性水平为0.1,即置信水平为90%;t:均值是否为零的t检验值;prt:对应t值的概率clm:上、下置信限maxdec=2:保留两位有效小数输出结果1、计算家庭人均收入(income),家庭人均消费支出(consume)和食品支出(food)的均值、标准差、变异系数、偏度和峰度;procmeansdata=cjl.xf2000meanstdcvskewnesskurtosismaxdec=2;varincomeconsumefood;run;procmeansdata=cjl.xf2000meanmaxdec=2;Classarea;varincomeconsumefood;Outputout=newmax=maxinmaxconmaxfmaxid(income(province)consume(province)food(province))=incomestconsumestfoodest;run;procprintdata=new;varareamaxinmaxconmaxfincomestconsumestfoodest;run;2、按地区计算家庭人均收入(income),家庭人均消费支出(Consume)和食品支出(food)的均值;计算各地区以上变量的最大值以及对应的省份,并保存到数据集new中。各地区均值各地区三个变量的最大值及相应省份4.2、单变量分析与UNIVARIATE过程
在研究一个随机变量的统计特性时,仅仅靠一些数字特征是不够的;还必须研究其他反映变量统计特征的形式,比如:样本的极端值、分位数、直方图、茎叶图、盒型图、正态概率图等。能完成MEANS过程的基本统计量的计算描述变量极端值的情况计算分位数,如中位数,上、下四分位数生成若干个描述变量分布的图,如茎叶图、盒型图、正态概率图等生成频率表对数据进行正态性检验UNIVARIATE过程的主要功能UNIVARIATE过程的一般格式为:procunivariate<option-list>;varvariable-list;byvariable-list;freqvariable;weightvariable;idvariable-list;output<out=sas-data-set><output-statistic-list><pctlpts=percentilespctlper=prefix-name-list><pctlname=suffix-name-list>;
语句说明options除了类似与means过程的选项外还有:1、procunivariate<option-list>语句(1)freq:要求生成包含变量值、频数、百分数和累积频数的频率表(2)Normal:要求检验输入的数据是否服从正态分布(3)Plot:要求生成茎叶图、盒型图、正态概率图(4)pctldef=value:规定计算百分位数的方法(1)Q3、Q1:上下四分位数(2)QRANGE:上下四分位数间的差(3)MSIGN:符号统计量(4)PROBM:大于符号秩统计量绝对值的概率(5)SIGNRANK:符号秩统计量(6)PROBS:大于中心符号秩统计量的绝对值的概率(7)NORMAL:检验正态性统计量(8)PROBN:检验数据来自正态分布的假设的概率(9)PCTLPTS=percentiles:规定用户希望计算的百分位数。2、OUTPUT语句输出统计量表除了MEANS语句中常用统计量外,还有以下一些统计量:procunivariatedata=cjl.xf2000plotnormal;
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 国际贸易关键研发协议
- 食品独家技术服务协议
- 人工智能个性化软件许可协议
- 生产主管岗位绩效评定表生产安全
- 传统文化与传统美德在小学主题班会课件中的传承
- 警惕不良社交守护纯真童年小学主题班会课件
- 诚实守信为本立德树人奠基小学主题班会课件
- 智能客服系统多语言交互优化手册
- 筑牢安全防线警钟长鸣守护成长小学主题班会课件
- 2026年义务教育质量监测模拟演练方案模板
- 2026年安徽省检察官逐级遴选笔试题目及答案
- 2026-2030直升机市场发展现状调查及供需格局分析预测报告
- 剖宫产患者术前皮肤准备与护理
- (2026)高血压性脑出血重症管理专家共识课件
- 施工现场临边洞口防护标准化规范
- 建筑工程材料见证取样手册
- 反恐怖防范安全风险评估工作指南(试行)
- 污染治理和节能减碳专项2024年中央预算内投资备选项目资金申请报告
- 李叔同简介课件
- 房地产开发项目融资分析报告模板
- CMBS业务培训课件
评论
0/150
提交评论