版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
统计软件SAS教程(金融)统计科学与科学统计Lies,damnedlies,andstatistics.
一句著名的西方谚语。主要描述数字的说服能力,特别是用来讽刺一些使用统计数字支持、但毫无说服力的分析报告,以及人们倾向于贬低那些不支持其立场的统计结论。——摘自维基百科统计科学与科学统计
其名言部分来自19世纪英国首相本杰明·迪斯雷利,此后经美国著名文豪马克·吐温之笔,被广泛传诵,原句载马克·吐温的《我的自传》:“(统计)数字经常欺骗我,特别是我自己整理它们时候。在此类情况下本杰明·迪斯雷利的评述经常正确有效:“世界上有三种谎言:谎言,该死的谎言,统计数字。”(Therearethreekindsoflies:lies,damnedlies,andstatistics.)”。但其原句并没有发现在本杰明·迪斯雷利的演说稿或者其他作品中。——摘自维基百科
第一章导言
一、统计的科学性(一)统计推断的基本内容:1.点估计待估参数β
的点估计量为β2.区间估计以点估计值为中心确定误差范围β±△3.确定信度确定误差范围的置信概率(二)统计为什么存在谬误:1.真实的谎言使用违反数据特性的统计方法。2.对谎言求真没有取得真实数据3.用谎言制造谎言制造数据二、统计软件可以做什么统计计算数据管理数据挖掘统计调查三、如何用统计软件进行计算1.根据菜单提示进行选择工作2.人机互动式工作3.编程进行程序式工作输入处理输出四、为什么要使用统计软件统计软件的使用过程,不是简单的输入数据,取得结果。而是在统计学理论指导下,实现统计思想的系统过程,。例1-1:散户投资者股票收益的均值检验。例1-2:散户投资者与大户投资者股票收益的均值检验
SAS系统22:24Monday,July22,20101VariableMethodVariancesDFtValuePr>|t|xPooledEqual181.740.0996xSatterthwaiteUnequal171.740.1005EqualityofVariancesVariableMethodNumDFDenDFFValuePr>FxFoldedF991.620.4838
五、常用的统计软件1.常用的统计软件SASSPSSBMDPStataEPINFOMinitabStatisticaS-PLUSR六、SAS软件简况发展历史:1966年开始研制1976年由美国SAS公司实现商业化1985年推出PC版本2006推出版本为V9客观评价国际公认的最优秀统计软件最昂贵的统计软件应用领域:统计、金融、商业、经济、社会、医学、生物、教育等。SASV9主要产品SAS/BASE(基础)——初步的统计分析SAS/STAT(统计)——广泛的统计分析SAS/QC(质量控制)——质量管理方面的专门分析计算SAS/OR(规划)——运筹决策方面的专门分析计算SAS/ETS(预测)——计量经济的时间序列方面的专门分析计算SAS/IML(矩阵运算)——提供了交互矩阵语言SAS/GRAPH(图形)——提供了许多产生图形过程并支持众多图形设备SAS/ACCESS(外部数据库接口)——提供了与大多数流行数据库管理系统的方便接口并自身也能进行数据管理SAS/ASSIST(面向任务的通用菜单驱动界面)——方便用户以菜单方式进行操作SAS/AF(面向对象编程的应用开发工具)第一章SAS入门一、SAS安装和启动二、SAS的工作窗口PROGRAMEDIT:程序窗口LOG:监视窗口OUTPUT:输出窗口GRAPH:图形窗口EXPLORER:环境窗口1.程序窗口这是一个全屏幕程序编辑窗口,用户在这个窗口输入要运行的程序,使用SAS系统提供的编辑工具对程序进行修改、运行、调试。当执行运行(提交)程序命令时,该窗口的程序被执行。2.监视窗口
该窗口记录了SAS程序运行过程的主要信息。如程序语句的语法错误,运行中的逻辑错误和警告信息,使用和建立的数据集、库文件,程序运行时间等。这些信息为程序调试提供了帮助。3.输出窗口
该窗口用于显示程序的统计分析结果,还可以在该窗口对计算结果进行输入、输出、编辑、修改,以及文件格式转换等操作。该窗口由被执行的SAS程序自动调出。4.图形窗口
该窗口用于显示程序的图形分析结果,还可以在该窗口对计算结果进行输入、输出、编辑、修改等操作。该窗口由被执行的SAS程序自动调出。5.环境窗口该窗口用于显示程序所在系统的文件目录结构。此外,该窗口还记录了每次程序的运行结果。例:熟悉SAS窗口参考程序exle三、SAS程序的结构与语法1.程序结构: SAS程序采用模块化结构,模块间相互独立,每个模块完成一个任务。
模块分两种类型,数据模块和程序模块。数据模块以英文单词Data为起始,程序模块以Proc(Pprocedure的缩写)为起始。模块通常用语句“run;”作为结束。
一个程序中可包含多个数据模块和程序模块。程序实例Dataa;inputx@@;cards;6.111.041.302.603.515.205.411.823.642.213.383.77Run;Procunivariatedata=anormalplot;varx;Run;2.程序语法标识符或数据之间用空格分隔,例如:inputs$;使用分号分隔语句;使用“Run”分隔模块;自定义名称最多包含8个符号,首字符为英文字母,名称不能有保留符号,如:空格-.,;…$等;缺失数据“.”表示;文本变量名首次出现时使用“$”作为后缀;程序可以包含注释语句,以“/*”开始,以“*/”结束,或以“*”作为行始符表示该行为注释语句;除数据外,SAS程序不区分英文字母大小写。例:找出程序中的语法错误Dataainputx-1,x-2,y’@@;CarDs;6.111.041.302.603.515.205.411.823.642.213.383.77;Procunivariatedata=anormalplot;varx;;四、SAS运算符号
算术运算符号关系运算符号逻辑运算符号五、SAS程序调试(注:参考程序exle)第二章SAS数据文件操作一、数据文件基本知识1.文件的逻辑结构与物理结构OBSFPUGNPFZHU1996236146.97451997241152.42561998245266.40651999248773.96862000251794.29992.名词解释文件:数据的集合;记录的集合;记录:关于一个实体的信息集合。一次统计观测可能对应一个记录,也可能对应多个。对应多记录时应使用关系连接记录。字段:各记录相同数据项的集合。一个字段通常对应一个变量,或统计观测的一个指标。索引:用于记录分类的标识字段或字段组合。关键字:用于唯一标识记录的字段或字段组合。二、数据文件的基本操作建立:在内存或外存中存储数据文件输出:显示数据文件的逻辑结构投影:从文件中选择出所需要的字段(变量)。筛选:从文件中选择出所需要的记录。投影和筛选可以组合使用。垂直连接:两个或多个文件按字段对应关系纵向连接,目的是增加样本量。水平连接:两个或多个文件按记录对应关系横向连接,目的是增加变量。1.建立文件基本工作要点:说明文件名说明变量包括变量名称、类型、排列顺序、格式等信息说明。说明数据位置并为变量赋值(1)建立临时文件dataexle;数据文件名inputs$xyz;输入语句cards;A123数据区B456C789run;临时文件特点:建立简单、存储在内存、不共享。(2)建立永久文件libnamep“c:\mydir”;定义库(路径)datap.exle;inputs$xyz;cards;A123B456C789run;注:c:\mydir为已经建立的磁盘文件目录。文件特点:存储在外存、共享。(3)数据导入读取异质数据文件。PROCIMPORTOUT=WORK.aa
DATAFILE="D:\sasv9\data\Book1.xls"DBMS=EXCEL2000REPLACE;SHEET="Sheet1$";GETNAMES=YES;RUN;读取文本格式数据文件语句:infile“c:\mydir\a.txt”firstobs=ndlm=“c”;dataexle;infile“c:\mydir\a.txt”firstobs=2;inputs$xyz;run;格式化输入——紧凑格式dataexle;inputs$xyz@@;cards;A123B456C789run;格式化输入——固定列格式dataexle;infile“c:\mydir\a.txt”;inputs$1-5x8y10-12z13-15;run;2.输出文件Procprintdata=exle;Varxyzs$;Run;输出结果:123A456B789C3.
投影学号姓名班级电话家庭年收入(万元)20070001李明统计0701130222620070002张华统计0701130223720070003林红精算0701130224520070004王成精算07011302256学号家庭年收入(万元)200700016200700027200700035200700046SAS的投影命令Dataexle(keep=snm);infile“c:\sasv9\data\a.txt”;inputsn$n$c$t$m;*dropn$c$t$;Run;4.
筛选学号姓名班级电话家庭年收入(万元)20070001李明统计0701130222620070002张华统计0701130223720070003林红精算0701130224520070004王成精算07011302256学号姓名班级电话家庭年收入(万元)20070001李明统计0701130222620070002张华统计07011302237SAS的筛选操作Dataexle;infile"c:\sasv9\data\a.txt”;inputsn$n$c$t$m;ifc^=”统计0701”thendelete;Run;5.垂直连接学号班级家庭年收入(万元)20070001统计0701620070002统计0701720070003精算0701520070004精算07016学号班级家庭年收入(万元)20070005精算0702220070006精算070230学号班级家庭年收入(万元)20070001统计0701620070002统计0701720070003精算0701520070004精算0701620070005精算0702220070006精算070230SAS的垂直连接操作Libnamepd:\mysasDataexle;setp.f1p.f2;Run;注:f1和f2已存在6.水平连接例:文件f1记录了学生基本情况,文件f2来自对学生支出情况的调查,请对学生消费情况进行统计分析。学号姓名家庭年收入成绩名次20070001李明61920070002张华7620070003林红53120070004王成623学号项目月支出/元20070001饭费30020070001通讯3020070001交通2020070001网络5020070001旅游30连接结果学号姓名项目月支出/元家庭年收入成绩名次20070001李明饭费30061920070001李明通讯3061920070001李明交通2061920070001李明网络5061920070001李明旅游3061920070002张华饭费5307620070002张华通讯1007620070002张华交通107620070002张华网络907620070002张华旅游6076SAS的水平连接Libnamep”d:\mysas”Procsortdata=p.f1;bysn;Run;Procsortdata=p.f2;bysn;Run;Dataexle;mergef1f2;bysn;Run;三、数据格式
数据格式通常用于输出数据,也可以用于输入数据。
数据按照规定的格式说明进行组织,以达到更为精确的描述目的。1.数值数据格式格式描述w.d说明有效位数,w<32,d<wEw.科学记数法COMMAw.d含有逗号、小数点的数值数据型格式DOLLARw.d含有美元号$、逗号和小数点的数值数据型格式Romanw.罗马数字SSNw.社会保险号码BESTw.
SAS最佳表示法2.字符数据格式格式描述$w.标准字符串,w<200$CHARw.含有空格字符串$HEXw.十六进制字符串3.日期数据格式格式描述Datew.ddMMMyy时期格式DDMMYYw.DDMMYY日期格式Timew.d.小时、分、秒DateTimew.d.时期和时间值为便于统计计算,日期值存储为与日间的天数。如被存储为797(66+365+31+28+7)。时间值存储为从午夜开始的秒数。如9:54被存储为35640(9×60×60+54×60)。日期时间值存储为午夜开始至此时的秒数四、Data部的控制语句一般情况下程序语句按出现顺序向下执行。控制语句可以改变程序顺序执行方式,以便完成更复杂的数据处理。主要控制语句判断语句(条件语句)循环语句(重复语句)子程序调用语句1.判断语句条件语句语句语句YNIfx>0theny=1;Ifx>0theny=1;elsey=-1;IF语句1.判断语句条件语句语句语句Select语句语句……Select语句Select表达式;When值1语句1;When值2语句2;…When值n语句n;Otherwise语句n+1;End;复合语句DoDo;语句1;语句2;…语句n;End;2.循环语句条件语句语句体Do语句Doi=初值to终值by增加值;语句体;End;DoWhile语句DoWhile条件表达式;语句体;End;DoUntil语句DoUntil条件表达式;语句体;End;3.子程序调用语句语句语句体语句Link语句Link标号;例:LinkMark1;…Mark1:语句1;语句体;Rtturn;例:IF用法datasale1sale2;inputname$salesregion$type$;iftype=’p’thenoutputsale1;elseoutputsale2;cards;(数据略)run;例:Select用法datasale;inputname$salesregion$type$;select;when(sales<20000)group=10000;when(20000<=salesandsales<40000)group=30000;when(40000<=salesandsales<60000)group=50000;when(60000<=salesandsales<80000)group=70000;otherwisegroup=90000;end;cards;(数据略)run;例:Do循环用法dataa;inputx@@;doi=1to10;y=x*x;end;cards;12345678run;例:Link用法dataa;inputStudentID$test1$test2$test3$@@;test=test1;linkrecord;test1=test;test=test2;linkrecord;test2=test;test=test3;linkrecord;test3=test;Record:iftest='E'thentest='F';return;cards;1ABC2EDC3ABF4CDE5EEE6ABA7CCF8DEDrun;第三章描述性统计一、SAS程序的一般形式Proc过程名过程选择项;语句1/语句选择项;语句2/语句选择项;……语句n/语句选择项;Run;例:计算描述性统计量Procmeansdata=a
alpha=0.01; Varxy; Weightw;Run;二、常用的描述性统计过程
1.计算描述性统计量PROCMEANSStatementBYStatementCLASSStatementFREQStatementIDStatementOUTPUTStatementTYPESStatementVARStatementWEIGHTStatement功能:该过程用于常规的描述性统计计算。包括分组统计,加权计算等。计算结果可以输出到屏幕,也可以输出到数据文件。Means程序的主要选择项DATA=定义使用的数据库ALPHA=value0<value<1,缺省值为0.05MAXDEC=value定义小数位,value为小于9的整数MISSING考虑缺失数据的计算VARDEF=DF|N|WDF|WEIGHTStatistic
Keyword:定义计算的统计量描述统计量:MAXMINMEANNNMISSRANGECSSSTDDEVCVVARUSSSKEWNESSKURTOSISSTDERRLCLMUCLMSUMSUMWGT分位数:MEDIANP1P5P10P25P75P90P95P99QRANGE总体均值为零的T检验:PROBTT例:变量的统计概要NameGenderStatusYearSectionScoreFinalGradeAbbottF297A9087BranfordM198A9297CrandellM298B8171DennisonM197A8572EdgarF198B8980FaustM197B7873GreeleyF297A8291HartF198B8480IsleyM297A8886JasperM197B9193Means程序的主要语句DATA=定义使用的数据库ALPHA=value0<value<1,缺省值为0.05MAXDEC=value定义小数位,value为小于9的整数MISSING考虑缺失数据的计算VARDEF=DF|N|WDF|WEIGHTStatistic
Keyword:定义计算的统计量描述统计量:MAXMINMEANNNMISSRANGECSSSTDDEVCVVARUSSSKEWNESSKURTOSISSTDERRLCLMUCLMSUMSUMWGT分位数:MEDIANP1P5P10P25P75P90P95P99QRANGE总体均值为零的T检验:PROBTTBy语句功能:定义分组变量。格式:By分组变量。By语句必须与Sort过程联合使用。例:Procsortdata=a;Bys;Run;Procmeansdata=a;Varxy;Run;CLASS语句功能:定义分类变量。格式:class变量名称;例:classc;功能:定义频数变量。格式:freq变量名称;例:dataa;inputxyz;cards;1212
…run;procmeansdata=a;freqz;(相当于1212…共12组)run;FREQ语句功能:定义用于分析的变量,如果省略VAR语句,SAS程序将数据集中的所有数值变量都作为要分析变量。格式:var变量名称串;例:varxyz;VAR语句TYPE语句功能:定义分类组合形式。格式:TYPE变量1*变量2;需要与Sort过程联用。例:SortProcsortdata=a;TYPE
x*y;Run;功能:定义权数变量。格式:weight变量名称;例:dataa;inputxyz;cards;120.2
…run;procmeansdata=a;weightz;(使用变量Z为权变量)run;WEIGHT语句功能:输出计算结果到指定文件。格式:OUT=SAS文件;例:dataa;inputxyz;cards;120.2
…run;procmeansdata=a; OUT=SASArun;OUTPUT语句ID语句功能:在输出统计结果列表时,同时显示观测中ID规定,的变量值,以便于对结果定位。格式:ID变量名称串;2.数据探索
探索性数据分析通常是诸如建模、数据分布检验、建立数据仓库、数据挖掘、参数与非参数估计方法选择、及建立有效的统计报告等工作的第一步。通常可以使用表格、直方图和样本分布拟合等手段,寻找总体分布的主要特点。Univariate过程PROCUNIVARIATEBYvariable;CLASSvariable;FREQvariable;HISTOGRAMvariable/option;IDvariable;INSETkeywordDATA=dataset/option;OUTPUTOUT=dataset;PROBPLOTvariable/option;QQPLOTvariable/option;VARvariable;WEIGHTvariable;提供计算描述性统计量、可视化高分辨率图形显示和统计归纳、分布拟合功能。语句功能HISTOGRAM画直方图INSET在图中插入求和PROBPLOT使用概率图考察变量分布QQPLOT使用分位数(QQ)图考察变量分布例:Univariate1.美国人口普查数据分析。变量:州,1990、2000城市人口,1990、2000非城市人口,区域2.重复测验数据分析学生姓名、首次测试成绩、二次测试成绩、最终成绩3.生成随机分布基本统计测度
通常利用样本矩来估计总体中相应的参数.例如用一阶样本原点矩来估计总体的期望而用二阶样本中心矩来估计总体的方差.
分布检验资料对比分析2.相关分析
相关是度量变量之间是否存在某种共同变化趋势的一种测度。通常情况下,两个变量之间关系可以是,无关、存在线性关系、存在非线性关系。相关系数通常用于测度两个变量之间线性关系的强弱。Corr过程PROCCORRoptions; VARvariables; WITHvariables; PARTIALvariables; WEIGHTvariable; FREQvariable; BY
variables;
该过程计算数值型随机变量之间相关性的统计测度。包括Pearson积差相关系数,三种非参数相关性测度,以及对应相关性检验的概率。提供三种相关系数的计算方法。以及相关性可靠性系数计算。例:PROCCORRdata=a;VARxyz;RUN;PROCCORRdata=a;VARab;WITHxyz;RUN;例:PROCCORRdata=a;VARxy;PARTIALab;RUN;PROCCORRdata=apearson;VARxyz;RUN;Pearson相关性测度pearson相关系数也称为简单相关系数,pearson积差相关系数,是用来反映两个变量线性相关程度的统计量。双尾检验原假设为:H0:r=0,备择假设H1:r≠0例:PROCCORRdata=apearson;VARxyz;RUN;Spearman相关性测度
Spearman相关分析又称秩相关分析、等级相关分析。是利用两个变量的秩次大小作线性相关分析,属于非参数统计方法,适用范围较广。用于某些不能准确地测量指标值而只能以严重程度、名次先后、反应大小等定出的等级资料,也适用于某些不呈正态分布或难于判断分布的定量资料。取值范围在-1和1之间。服从Pearson相关系数的数据亦可计算Spearman相关系数,但统计效能要低一些。
PROCCORRdata=aspearman;
VARxyz;
RUN;Kendall相关性测度用于反映分类变量相关性的指标,适用于两个分类变量均为有序分类的情况,对相关的有序变量进行非参数相关检验。也适用于某些不呈正态分布或难于判断分布的定量资料。取值范围在-1和1之间。
PROCCORRdata=aKendall;VARxyz;RUN;Hoeffding相关性测度适用于两个分类变量均为有序分类的情况,对相关的有序变量进行非参数相关检验。也适用于某些不呈正态分布或难于判断分布的定量资料。取值范围在-0.5和1之间,1表示完全相关。
PROCCORRdata=aHOEFFDING;VARxyz;RUN;Cornbach相关性测度
由Cronbach在1951提出,通常是作为调查信度的测量指标。用于误差分析、问卷信度可靠性分析等。取值在负数和1之间,1表示存在较高的相关性,等于或小于0表示相关性较低。
PROCCORRdata=aalpha;
VARxyz;
RUN;3.相关分析1.Gplot(gplot_stock)功能:GPLOT过程用于绘制散点图,两个观察变量的值分别作为横、纵坐标,用二维空间展示变量之间的关系。语句格式:PROCGPLOT选项;PLOT选项;
PLOT2选项;
三
绘制统计图表
图性格式描述语句例:goptionsreset=globalgunit=pctcback=whiteborderhtitle=6htext=3ftext=swissbcolors=(back);Reset:清除以前设置Gunit:定义TitleSymbol语句定义高度的测量单位Cback:图形背景色Border:绘制边框Htitle(Ftitle,Ctitle):标题行高度、字形、颜色Htext(Ftext,Ctext):输出文本行高度、字形、颜色Colors:打印颜色
Symbol-图性格式描述语句I=连线方式Join:连直线Needle:向横轴连垂线Spline:连平滑线Rl:连一次回归线Rq:连二次回归线Rc:连三次回归线Hiloc:连股票价格线C=连线颜色L=连线线型(1-46)V=坐标符号(plus,x,star,square,dot,circle..)Axis-图性坐标描述语句例:axis1label=('Volume')order=(0to700000by100000)offset=(0,50);Label:定义坐标轴Order:定义坐标Offset:定义原点高度三、绘制统计图表1.Gchart用于绘制常用的统计图形,包括条形图、块形图、饼形图和星形图等。使用这些图形可以直观地表示变量的描述性分布特性。主要统计计算有:频数、累计频数频率、累计频率总计均值通过以上图表分析,可以了解随机变量取值、分布、异常值情况等。(1)语句格式:PROCGCHART选项;例:ProcGchartdata=a;BLOCK变量/选项;Piex;HBAR变量/选项;Run;VBAR变量/选项;PIE变量/选项;STAR变量/选项;
RUN;(2)分组变量:Gchart过程需要使用一个分组变量。如果分组变量值为有限个,则对每个值计算由选择项规定的统计量。统计量可以是关于分组变量的,如频数统计。也可以是关于另一个变量的,如均值统计。如果分组变量值是连续的,系统将首先对其进行分组,然后再执行图表分析。(3)选择项:TYPE=Value:说明计算的统计量,Value=FREQ|CFREQ|PERCENT|CPERCENT|SUM|MEAN。SUMVAR=VARIABLE:说明要分析的变量。FREQ|CFREQ|PERCENT|CPERCENT|SUM|MEAN|NOSTATS:说明在图形中显示(或不显示)统计量值。MIDPOINTS=Value:自定义中点值。LEVELS=Value:自定义分组数。GROUP=VARIABLE:分组统计。SUBGROUP=VARIABLE:贡献分析(Bar)。LEGENDn=Text:对SUBGROUP的说明。AXIS=Value1toValue2byStep:说明坐标轴。RAXIS=Value1,Value2,......:说明坐标轴。REF=Value1,Value2,......:参考值表。三、绘制统计图表(3)选择项(续):EXPLODE=Value:说明对应组的扇面离开中心。INVISIBLE=Value:说明对应组的扇面隐藏。PERCENT=ARROW|INSIDE|NONE|OUTSIDE:说明在图形中显示值的方法(pie)
。2.Gplot用于绘制散点图。用于观察:变量的周期性变化两个变量的相关性变量的分布情况异常值情况
三、绘制统计图表(1)格式:PROCGPLOT选项;
PLOT变量1*变量2/选项;
PLOT2变量1*变量2/选项;
BUBBLE变量1*变量2=变量3/选项;
BUBBLE2变量1*变量2=变量3/选项;SYMBOLn选项;
AXISn选项;BY变量;RUN;三、绘制统计图表(2)语句说明:PLOT变量1*变量2/选项;
PLOT2变量1*变量2/选项;
用于绘制变量1对变量2的散点图。BUBBLE变量1*变量2=变量3/选项;
BUBBLE2变量1*变量2=变量3/选项;
用于绘制变量3对变量1*变量2的相关图。三、绘制统计图表(2)语句说明(AXISn):Label=Text:说明坐标轴标志。Order=(value1tovalue2bystep):说明刻度。Offect(m,n):说明轴上第一个刻度到原点的位移量。三、绘制统计图表(3)PLOT,BUBBLE选择项:OVERLAY:把本语句做的图画在同一坐标系下。HAXIS=Value1toValue2bySTEP:定义横坐标轴。VAXIS=Value1,Value2......:定义纵坐标轴。HAXIS=AXISn|VAXIS=AXISn:用前面定义的坐标轴定义当前坐标轴。HREF=Value1,Value2,......:参考值表。VREF=Value1,Value2,......:参考值表。LHREF=1..46:定义参考线型。LVREF=1..46:定义参考线型。CHREF=1..46:定义参考线颜色。CVREF=1..46:定义参考线颜色。
VREVERSE纵轴向下。三、绘制统计图表(3)SYMBOL选择项:I=NONE|JOIN|NEEDLE|SPLINE|RL|RQ|RC:说明点之间连线方式。CLMnn:绘制置信限。CV,CI规定符号和连线颜色。L定义线型。V=PLUS|X|STAR|DOT|CIRCLE|字母|数字:说明绘点符号。STEPL|STEPR|STEPC|:绘制阶梯线。HILOC:极值、均值连线。STD1|STD2|STD3|:标准差倍数点连线。REGEQN显示回归方程Gchart直方图选项Type=mean|sum|freq|cfreq|percent|cpercent指定计算内容Subvar=变量指定计算变量Subgroup=变量指定子组分类变量第四章统计推断
一、回归分析研究关于因变量(也称被解释变量)对一组自变量(也称解释变量)的依赖关系。目的是通过解释变量的已知数据,推断和预测被解释变量的总体特征。
使用软件进行回归分析的一般工作步骤是,设定模型、估计参数、对模型进行诊断、使用模型预测。1.线性回归
(1)模型设定指根据研究目的,确定模型的试验过程。模型设定的理由例:根据石油经济评价理论,原油开采成本受以下因素影响:产量、井深、注水量、原油含水量、原油粘度、井口压力、井下压力、渗透率、土壤类型、劳动力成本、管理成本、交通……。常用的模型设定方法向前选择法,向后消去法,逐步筛选法,最大R2增量法,最小R2增量法,R2选择法,调整后的R2选择法,MallowsCp选择法。向前选择法
初始模型没有任何自变量。对每个可能的自变量计算其进入模型的F值贡献,如超过设定值则将其引入模型。如此循环直到没有满足条件的变量时为止。R2选择法
根据用户给定的最大或最小自变量数目,寻找能最佳预测因变量的自变量子集。
按照R2准则,其对样本的拟合是最优的。(2)参数估计给出模型形式给定权数给定约束条件标准化回归(3)模型诊断模型的显著性检验变量的显著性检验经济计量学检验强影响点分析残差分析(4)预测均值预测单值预测预测值的置信区间(5)Reg回归过程格式:PROCREG<options>;BYvariable;MODELdependents=<regressors></options>;FREQvariable;IDvariables;VARvariables;WEIGHTvariable;ADDvariables;DELETEvariables;MTEST<equation,...,equation></options>;OUTPUTOUT=SAS-data-set;PAINTcondition/options;PLOTyvariable*xvariable/options;PRINToptions;REFIT;RESTRICTequation,...,equation;REWEIGHTcondition/options;TESTequation/option;MODEL语句用法:例:MODELy=x1x2/SELECTION=FORWARD;MODEL语句的重要选项:SELECTION=forward,backward,stepwise,rsquare,cp,maxr,minr,adjrsq,noneNoint截距项=0Include=n模型必须包含前n个自变量Slentry=规定SELECTION的显著性水平,forward选项的缺省值为0.5Stop=n最优子集变量最大数目Best=n最优子集变量数Stb计算标准化回归系数MODEL语句用法(续):AIC,SAWA,BAYESIAN,PC一组信息准则Collin共线性检验Collinoint共线性检验Spec异方差检验DW自相关检验Influence强影响点分析P计算预测值Cli计算预测值的置信区间Clm计算预测值的置信区间R残查分析WEIGHT语句——加权最小二乘法 WEIGHT规定的变量是加权最小二乘拟合对应的权数。如权数值小于等于零,相应观测不参加计算。
使用REWEIGHT语句可以重新赋权:格式:REWEIGHTCONDITION/OPTION;例:REWEIGHTALLOBS/WEIGHT=0.1;REWEIGHTALLOBS/RESET;恢复初始权数设置REWEIGHTT=“2000”;对应观测不参加回归计算REWEIGHTALLOBS/WEIGHT=0.1
STATUS;在LOG窗口列出重新赋权的观测RESTRICT——使用约束条件
格式:RESTRICT约束方程例:RESTRICTA+B=1,INTERCEPT+C=1约束方程中的变量必须为MODEL语句中出现的变量,表示其系数被施加约束。TEST——变量的联合检验常规检验TEST子句规定的检验例:TEST1:TESTB1+B2+INTERCEPT=1;B1,B2为MODEL语句中的变量,F检验被施加于对应系数。TEST2=TESTB1=0,B2=0表示进行联合检验共线性检验在MODEL语句中使用COLLIN,COLLINOINT选择项对模型进行共线性检验。共线性检验的主要方法有:特征值法:若有N个特征值近似为0,则模型有N个共线关系。条件指数法:最大特征值与每个特征值之比。条件指数大意味共线性严重。方差膨胀因子VIF法VIF=1/(1-R2(i))R2(i)为Xi的偏相关系数。VIF大说明共线性严重。强影响点分析在MODEL语句中使用INFLUENCE选择项对模型进行强影响点分析。主要的检验统计量有:Cook'sD:大于0.3为影响点RSTUDENT,DFBETAS:大于2为影响点DEFFIT:大于2或大于SQRT(P/N)为影响点。P为参数数目,N为样本量残差分析常规分析:在MODEL语句中使用R选项PLOT子句绘制残差分析图例:PLOT
RESIDUAL.*X;PLOTRESIDUAL.*PREDICTED.;PLOTRESIDUAL.*NQQ.;绘制残差正态性检验图ORTHOREG—共线性时的估计方法PROCORTHOREGoptions;MODELdependent=independents/option;BYvariables;CLASSvariablesoption;WEIGHTvariable;2.非线性回归分析
迭代法拟合非线性模型的基本原理:
设β
为模型待估参数,β(0)为其一组可能的待估参数值。按某种迭代算法使用β(0)+△代替β(0),如果新拟合模型的残差平方和更小,则β(0)+△是较β(0)为优的解。依此类推,直到无法找到使残差平方和更小的解为止。SAS使用的算法有:梯度法、牛顿法、修正的高斯-牛顿法、麦夸特法等。NLIN过程简介
格式:PROCNLIN<options>;MODELdependent=expression;PARAMETERSparameter=values;BOUNDSinequality;BYvariables;DER.parameter=expression;DER.parameter.parameter=expression;IDvariables;OUTPUTOUT=SAS-data-setkeyword=names<,...,keyword=names>;CONTROLvariable<=values><...variable<=values>>;MODEL语句模型定义语句。例:模型
Y=b0×(1-e-b1X)表示为,ModelY=b0*(1-exp(-b1*X));或,Temp=exp(-b1*X);ModelY=b0*(1-Temp);PARAMETERS语句说明迭代初值。例:PARAMETERSb0=0b1=3;PARAMETERSb0=0.2to0.6by0.2b1=3,4;BOUNDS语句说明参数范围。例:BOUNDSb0<=15,1<b1<10;DER语句说明函数的一阶或二阶导数。例:Y=b0×(1-e-b1X)说明一阶导数DER.b0=1-exp(-b1*X)DER.b1=b0*X*exp(-b1*X)说明二阶导数DER.bo.b1=-DER.b1*X例:估计如下模型Y=a+bx+cx2,如果X<X0Y=P
,如果X>=X0设:X0=-b/2c,P=a-b2/4c九、不同水平下数据的差异性比较例:五种5年期银行理财产品(用代码D1-D5表示)的收益率如下,D121D121D145D133D127D236D251D236D254D254D342D354D354D357D357D457D475D466D457D469D521D530D533D545D533试对上述理财产品进行收益分析。收益分析内容不同理财产品的平均收益率不同理财产品的风险评估不同理财产品之间收益的差异比较进行差异性比较的统计方法—方差分析
方差分析(analysisofvariance)方法由著名统计学家R.A.Fisher提出的,是对两个或两个以上样本均值差异进行比较的统计检验方法。也常用于研究关于因变量对一组性质自变量(具有有限个取值)的依赖关系。方差分析的基本思想
方差分析首先把全部样本数据作为一类,计算数据间的总的变差(一般采用离差平方和计算),称总变差或总离差平方和。然后把每个样本作为子类,计算样本内的变差,称为组内变差或组内离差平方和。再计算各组之间的变差,称为组间变差或组间离差平方和。通过各类变差间的比较完成统计检验。单因素方差分析
研究只有一个影响因素(控制变量),其不同取值水平是否对因变量产生影响。例如不同职业投资者证券投资收益。多因素方差分析
多因素方差分析用来研究两个或两个以上影响因素,其不同取值水平是否对因变量产生影响。多因素方差分析不仅要分析每个因素对因变量的影响,还要分析多个因素相互作用的影响。例如,不同职业及不同教育程度投资者证券投资收益研究。多因素的交互作用
例:不同职业及不同教育程度投资者证券投资收益研究。职业:工、农、商、学、兵教育程度:小学、中学、大学职业+教育程度:工(小学、中学、大学)……单因素方差分析的统计检验方法
设ST为总平方和,SA为,SR为组内平方和,样本量为n,因素类别数为k。则,ST=SA+SR可以证明,当假设H0成立时,统计量多因素方差分析方法SOURSE来源SS离差平方和Df自由度MS均方差FF统计量因素ASAI-1MSA=SA/(I-1)FA=MSA/MSE因素BSBJ-1MSB=SB/(J-1)FB=MSB/MSEAB相互作用SAB(I-1)(J-1)MSAB=SAB/(I-1)(J-1)FAB=MSAB/MSE误差SRIJ(K-1)MSE=SR/IJ(K-1)总和STIJK-1方差分析的基本假定(1)样本是随机的;(2)各样本之间相互独立;(3)样本分别来自正态分布总体,各样本方差相同。
1.ANOVA过程—齐次样本方差分析PROCANOVA<options>;CLASSvariables</option>;MODELdependents=effects</options>;BYvariables;FREQvariable;MANOVA<test-options></detail-options>;MEANSeffects</options>;REPEATEDfactor-specification</options>;TEST<H=effects>E=effect;CLASS语句:说明分类变量。例:CLASSabc;MODEL语句:说明分类变量。例:MODELY=aba*b;MEANS语句:说明计算每个效应对应的因变量均值。在该语句中还可以规定对主效应进行均值检验。例:MEANSaba*b/DUNCANALPHA=0.1CLM;
2.GLM过程—非齐次样本方差分析PROCGLM<options>;CLASSvariables</option>;MODELdependents=independents</options>;BYvariables;FREQvariable;IDvariables;WEIGHTvariable;MEANSeffects</options>;OUTPUT<OUT=SAS-data-set>;RANDOMeffects</options>;REPEATEDfactor-specification</options>;TEST<H=effects>E=effect</options>;
3.Ttest过程—两个总体均值比较PROCTTEST<options>;CLASSvariable;BYvariables;VARvariables;FREQvariable;WEIGHTvariable;
例:
某制鞋厂生产两种型号的运动鞋,各随机抽取10双,发给两组志愿者人。要求每位志愿者每天穿其领取的鞋徒步行走3小时。30天后测试所有20双鞋的磨损程度,测试数据如下:
A:27351939343215261817B:23281631383017221516
试比较两种鞋的耐用程度。解法二——配对检验
使各随机抽取10双鞋,分给每人A、B型号各一双。规定其使用方法,记录他们穿鞋的磨损情况,并进行比较。
配对检验有可能对研究对象的信息利用更充分。以上面检验问题为例,考虑不同志愿者在身体条件、生活习惯等方面的差异,也会导致鞋的磨损程度不同,因此可以考虑采用配对检验。Freq-频数统计语句格式:PROCFREQ选项;TABLES变量组合/选项;WEIGHT变量;BY分组变量表;Freq语句选项DATA=数据文件ORDER=Freq|Data|Internal|Formatted
例:下面是一组关于性别与个人股票投资收益情况的调查数据,试分析性别与个人股票投资收益之间的分布,以及性别与个人股票投资收益之间是否相关(独立性检验,H0=独立)。三、多元统计分析
关于多元随机变量问题的研究。1.主成分分析
主成分分析是将研究对象的多个相关变量化为少数几个不相关变量的多元统计方法。例:双因素变量的主成分图示X1X2P1P2主成分的方差贡献率
设原始变量集为X1,X2……Xk,其主成分为P1,P2……Pk,则∑σi2=∑λi其中σi2为Xi的方差,λi为Pi的方差(λ1≥
λ2……≥λp)。主成分Pi的方差贡献率定义为,ai=
λi/∑λi前n个主成分的累计方差贡献率为∑ai,反映了主成分概括原始变量信息的大小。主成分分析过程—PRINCOMPPROCPRINCOMP<options>;BYvariables;FREQvariable;PARTIALvariables;VARvariables;WEIGHTvariable;PRINCOMP的常用选项COV从协方差阵出发计算主成分N=规定计算的主分量个数OUT=文件名输出原始数据及主成分得分到文件;OUTSTAT=文件名输出特征向量到文件;例:区域经济效益评价
评价区域经济效益。能够收集的数据如下:每百元固定资产原值实现的利税,资金利税率,产值利税率,每百元销售收入实现的利税,每百元销售成本实现的利润,流动资金周转次数。例:含缺失数据的分析十名评委对35个竞争者进行评分,试进行主成分分析,得出一个综合变量作为评价结果。每个评委评分时只给出了其认为较好的竞争者的排名。主成分回归
设Y为
因变量,X1,X2,……Xm为自变量,其主成分为P1,P2,……PK。则主成分回归模型为,Y=f(P1,P2,……PK)+U又设Pi为模型中第i个主成分,其对应的特征向量为ei’=,X*为自变量的标准化向量,则Pi=ei’X*2.因子分析
例:学生成绩的系统影响可以表示为,Xi=aiF+ui其中F是对所有课程都起作用的公因子(其解释了课程的“相关”效应),ui为影响某门课程的特殊因子。1234561.语文2.写作3.英语4.数学5.自然6.音乐1.83.78.70.66.631.67.67.65.571.64.54.511.54.511.41模型的一般形式
P个变量X1…Xp受m个公因子影响,且每个变量还单独受一个特殊因子影响,如这些影响是线性的,则有:X1=a11F1+a12F2+…a1mFm+u1X2=a21F1+a22F2+…a2mFm+u2…Xp=ap1F1+ap2F2+…apmFm+upX=AF+UA称为因子载荷矩阵,aij称为变量Xi在公因子j上的载荷。正交因子模型
若X=(X1…Xp)的均值为U=(u1…up),协方差阵为∑,
X中心化的因子分析模型可写为,X-U=AF+U假设存在E(F)=0,COV(F)=IE(U)=0,COV(U)=φ=diag(φ12,φ22,…φp2)COV(U,F)=0则称上述模型为正交因子模型。正交因子模型的共同度
可以证明,对于正交因子模型有
∑=AA’+φ
(1) COV(X,F)=A(2)由(1)式知,σii2=VAR(Xi)=ai12+ai22+…+aim2+φi2ai12+ai22+…+aip2是因子载荷矩阵第i行元素平方和,记为hi2。则,σii2=hi2+φi2hi2描述了全部公因子对Xi方差贡献和,称为对Xi的共同度。称φi2为特殊度。公因子重要性的度量及意义解释
令gj2为因子载荷矩阵第j列元素平方和,则gj2=a1j2+a2j2+…+apj2gj2描述了公因子Fj对全部变量方差贡献,反映了其对所有原始变量的影响。从前面公式(2)可以看出,COV(Xi,Fj)=aij如原始变量已经标准化,则它是原始变量和公因子之间的相关系数。这就为解释公因子的含义提供了依据。因子载荷矩阵及特殊方差的估计
极大似然法主成分法主因子解法……因子正交旋转
当m大于1时,正交因子载荷矩阵不唯一。但可以证明,若F*是由F经过正交旋转获得,则两者具有相同的共同度。因子分析程序—Factor格式:PROCFACTOR<options>;VARvariables;PRIORScommunalities;PARTIALvariables;FREQvariable;WEIGHTvariable;BYvariables;Factor程序选项(1)METHOD=PRINCIPAL缺省选则。说明使用主分量法提取因子。如规定PRIORS语句,或PRIORS选项不等于1,则执行主因子分析。ML最大似然法。要求相关阵非奇异。PRINIT迭代主因子分析。……PRIORS=规定计算先验证公因子方差计算方法。MAXIER=N,规定最大迭代次数。NFACTORS=N,规定提取的最大因子数。……Factor程序选项(2)ROTATE=旋转方法选则。M,使用均方最大旋转。P,使用PROMAX旋转。Q,使用四次方最大旋转。V,使用方差最大旋转。……Factor程序子句PRIORS数值;对每个变量规定先验公因子方差。数值顺序对应VAR语句中的变量顺序。例:VARX1-X3;PRIORS.7.8.9;例:
收集了12个社区的以下社会经济统计资料:总人口,平均入学年龄,就业人数,服务点数目,房价。试进行因子分析。3、聚类分析
将研究对象的一批个体,依据其指标特征划分为若干类型。根据研究目标不同,划分标准可能采用不同方法。经常使用的方法有:根据个体之间的距离进行划分;根据个体的相关性进行划分。既可以对于数值变量进行聚类,也可以对性质变量进行聚类。常用聚类方法系统聚类法:从每个个体自成一类开始,每次将最接近的类合并,再将聚合的类再次合并,直到剩余类均不满足聚合条件为止。分解聚类法:从全部个体为一类开始,依此分解为2类、3类……,直到不能再根据分离条件划分新类为止。动态聚类法:在大样本时,先进行粗分类,然后再进行调整的聚类方法。划分类别的常用标准
1.距离
距离用于度量类之间的远近程度。常用的基于尺度意义的距离,如p维空间的点X和X’之间的明考夫斯基距离的计算公式为:DXX’=(∑|Xi-X’i|m)1/m其中m>0,i=1…p。类别之间的尺度距离
设A和A’表示两个类,Dij表示A中的点i和A’的点j之间的距离。则常用的类间距离有:最小距离:用两类中个体之间的最小距离度量。D=MIN(Dij)最大距离:用两类中个体之间的最大距离度量。D=MAX(Dij)重心距离:用两类重心之间的距离度量。D=DĀĀ’类平均距离:用两类中两两个体之间的距离平均值度量。D=∑∑(Dij)/(nAnĀ’)类别之间的离差平方和距离
设A和A’表示两个类,SA,SĀ’,S分别A和A’及两个类合并后的离差平方和。则两类之间的距离可以表示为,DSAĀ’=S-(SA+SĀ’)称为类别之间的离差平方和距离。划分类别的常用标准
2.相关性
有些研究对象个体之间具有很大的相似性,仅是尺度相差较大。此时,使用相关性作为划分类别的标准更有意义。常用的度量方法有相关系数法;变量夹角余弦法。性质变量的聚类标准
1.匹配系数
设二值变量的取值为0和1。当两点的取值同为0,或同为1时称为匹配。否则,称为不匹配。当存在如下列联表时,匹配系数可定义为,Dij=(n1+n4)/(n1+n2+n3+n4)1010n1n2n3n4性质变量的聚类标准
2.相合系数
设二值变量的取值为0和1,当存在如下列联表时,相合系数可定义为,(n1n4-n2n3)DRij=(n1+n2)(n1+n3)(n2+n4)(n3+n4)1010n1n2n3n4聚类结果判别统计量
判别聚类结果的统计量主要有信息类统计量和检验统计量。信息统计量如R2统计量,定义为R2=1-PG/T其中T=∑||Xi-E(X)||2为向量的欧式距离,P
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年秋季学期北师大版(新教材)三年级数学上册九月月考练习卷含答案
- 保险行业合规管理模拟试题
- 保险行业保险代理人资格考试备考
- 中级统计师资格考试(统计基础理论及相关知识)能力提高训练试题库及答案(昭通2026年)
- 减速机检修维护技师试题及答案
- 住房和城乡建设领域现场专业人员培训考试(设备安装施工员专业基础知识)题库(日照2025年)
- 2026年中医执业医师方剂学练习题及答案
- 2026年江苏省溧阳市高二生物上册期末考试考试卷附答案【B卷】
- 山西2026年注册国际投资分析师(CIIA)考试(试卷一)全真题库及答案
- 司磅员岗位考试题及答案
- 2026年甘肃省酒泉市金塔县招聘社区工作者考试参考题库及答案解析
- 武汉市2027届高中毕业生九月调研考试地理试卷(含答案)
- 园林植物病虫害防治技术全套课件
- 第3课 寻找可靠数据源 课件+视频 2025-2026学年四年级全一册信息技术人教版
- 项目部对分包考核制度
- AI辅助PBL教学在内科规培中的实践
- 2026年中国火锅调味料行业市场规模、市场供需现状及促进市场需求的主要因素分析
- 1.2地球的公转课件-高中地理湘教版选择性必修1
- 麻醉科重点专科建设工作汇报
- 临床护理文书书写规范(2024版)
- 广州市下沙村地块土壤污染状况初步调查报告地块五
评论
0/150
提交评论