薛薇《统计分析软件SPSS应用》教学义SPSSpPPT课件_第1页
薛薇《统计分析软件SPSS应用》教学义SPSSpPPT课件_第2页
薛薇《统计分析软件SPSS应用》教学义SPSSpPPT课件_第3页
薛薇《统计分析软件SPSS应用》教学义SPSSpPPT课件_第4页
薛薇《统计分析软件SPSS应用》教学义SPSSpPPT课件_第5页
已阅读5页,还剩312页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、.,1,统计分析软件应用,薛薇 中国人民大学统计学院 2011.2,.,2,第一章 SPSS 概述,.,3,SPSS概述,SPSS: Statistical Package for Social Science Statistical Product and Service Solutions SPSS的发展: 60年代:美国斯坦福大学三位研究生研制 70年代:SPSS总部成立于芝加哥,推出SPSSX中小型机版 80年代:SPSS公司(SPSS/PC+微机版13) 90年代:SPSS公司(SPSS WINDOWS版514),.,4,SPSS 主要特点,操作简便。绝大多数操作是通过菜单、按钮、对

2、话框完成的。 无需计算机编程、需记忆大量命令和参数。 分析方法丰富、分析结果清晰、直观。 可以直接读取其他软件格式的数据文件,如:dbf、xls、sas等。 最新版本采用分布式分析系统,适应互联网,支持动态收集、分析数据和HTML报告 与一般的办公软件直接兼容不方便,.,5,SPSS主要窗口:数据编辑窗口,窗口标题:data editor 功能:对SPSS的数据文件进行录入、 修改、管理等基本操作的窗口。 组成:窗口主菜单、工具栏、数据编辑区、状态显示区 特点: SPSS运行过程中自动打开 SPSS中各统计分析功能都是针对该窗口中的数据进行的 窗口中的数据文件以.sav存于磁盘上 两个视图:数

3、据视图和变量视图,.,6,SPSS主要窗口:数据输出窗口,窗口标题:viewer 功能:SPSS统计分析报表及图形的输出的窗口。 组成:窗口主菜单、工具栏、结果显示区、状态显示区 特点: 在进行第一次分析时自动打开,也可手工打开 可以手工打开若干个可相互切换的viewer窗口;状态栏上的!表示当前输出窗口 输出窗口可以关闭,窗口内容以.SPO存于磁盘上 两个视图:目录视图和内容视图,.,7,SPSS主要窗口:数据输出窗口,驾驭数据出输出窗口 一般操作 结果文件的打开和保存 加密保存 窗口元素的移动和删除 标准的拖放式操作 在大纲视图中操作最方便 结果的导出 以纯文本格式导出、以HTML格式导出

4、 如何在WORD中引用分析结果 统计表格:拷贝或拷贝对象 统计图:拷贝对象,表格的编辑 表格状态的确定 单元格内容编辑 行列转置 Autofit 表格样式的变换,.,8,SPSS基本运行方式,完全窗口菜单方式: 所有分析操作过程都是通过菜单和按钮及对话框方式进行的. 是经常使用的一种运行方式,适用于一般分析和SPSS的初学者.,.,9,SPSS基本运行方式,程序运行方式: 手工编写SPSS命令程序 一次性提交计算机运行 适用于大规模的分析工作和熟练的SPSS程序员. 实现方法: (1)打开SYNTAX语句窗口并编写和修改SPSS程序 (2)点击语句窗口中的RUN菜单项,选择运行方式运行,.,1

5、0,Syntax语句窗口,窗口标题: syntax editer 功能:编写和修改SPSS程序的窗口. 特点: 打开: FILE - NEW - SYNTAX或FILE-OPEN-.SPS扩展名 窗口中的程序以.SPS存于磁盘上 菜单项RUN中提供四种程序执行方式:All、Selection、Current、To end,.,11,SPSS 基本运行方式,菜单程序混合运行方式: 先通过菜单选择分析过程和参数,不立即提交(OK)执行,而是按动PASTE按钮. 计算机自动将用户刚定义的分析过程和参数转换成SPSS的命令,并显示到SYNTAX语句窗口中. 用户可对其进行必要的修改后再提交给计算机执行

6、. 一般适用于熟练的SPSS程序员.,.,12,利用SPSS进行数据分析的步骤,建立SPSS数据文件 定义数据文件结构 录入修改和编辑待分析数据 数据的统计分析 统计分析之前的预处理 统计分析 数据和分析结果的保存 结果的说明和解释,.,13,思考复习,SPSS有哪两个主要窗口?功能是什么?有哪些特点? SPSS有哪些运行方式?特点是什么?,.,14,第二章 SPSS数据文件的建立和管理,.,15,一份简单的调查问卷,单项选择题 提供几个备选择答案,从其中选择一个答案 变量类型:分类数据、定序数据 数据类型:字符型 填空题 变量类型:定距数据 数据类型:数值型,.,16,如何利用SPSS组织数

7、据,SPSS数据文件是一种有结构的数据文件,年级 性别问题1问题n,11. 4 222 .,文件结构,数据,个案case,变量名,变量,用字符或数字表示字符型数据 SPSS数据文件一般只能通过SPSS软件打开,.,17,一份简单的调查问卷,多项选择题 提供几个备选择答案,从其中选择多个答案 如:在下列品牌中您信任哪些品牌? 被诊断为高血要后你采取了以下哪些辅助治疗手段? 如:高考时报考学校 (1)北京大学 (2)清华大学 (3)人民大学 (4)北京理工大学 (5)北京师范大学 (6)北京外国语大学 多项选择题不能在SPSS中直接存储,因为SPSS的一个变量只能有一个取值,.,18,如何利用SP

8、SS组织数据,多项选择题的处理方法 思路: 将一个问题定义成几个变量,用这几个变量来描述该问题的几个可能被选择的答案。 编码方式: 多选项二分法(multiple dichotomize method) 多选项分类法(multiple category method),.,19,多选项二分法 将每个答案作为一个变量,每个变量只有两个取值(0或1)。 例如:,如何利用SPSS组织数据,.,20,多选项分类法: 预先估计多选项问题可能被选择的最多答案数.为每个答案建立一个变量,取值为多选项问题的可选答案. 例如:,如何利用SPSS组织数据,.,21,频数数据:,如何利用SPSS组织数据,设置三个变

9、量: 专业方向、性别、人数,.,22,SPSS数据文件的结构,(一)变量名(Variable name): 变量名是变量存取的唯一标志。 起名规则: 不多于8个字符组成 不区分大小写 允许汉字作为变量名 默认变量名为VARn,如:var00001,.,23,SPSS数据文件的结构,(二)变量的类型(type)和显示宽度(width) 1、数值型: 标准数值型(Numeric):默认类型 8.2 如: 12345678、12345.67、-1234.56 带逗号的数值型(Comma): 从个位开始三位一个逗号8.2 如:1,234.56 科学计数法(Scientific Notation):表示

10、很大或很小的数据 8.2 如:1.2E+05 带美元符号(Dollar):表示货币 格式很多,如:$12.30,.,24,SPSS数据文件的结构,2 、字符型(String): 存储字符数据 8位 如:beijing 处理时用双引号扩起来 3、日期型(Date):存储日期数据 格式很多,如:20-AUG-1999 4、其他: 如:圆点数值型(dot)、用户自定义型(customer) 注意:显示宽度不影响数据的存储,.,25,SPSS数据文件的结构,(三)变量名标签(Variable label) : 对变量名的一些解释说明,增强分析结果的可视性。可以省略。 (四)变量值标签(Value la

11、bel) 对变量所取值的一些解释说明,增强分析结果的可视性。可以省略。 一般用于品质数据 如:1-男 2-女、1-高 2-中 3-低,.,26,SPSS数据文件的结构,(五)变量列格式(Column Format) 对齐方式(Text Alignment) 左对齐(Left):字符型默认。 右对齐(Right):数值型默认。 居中对齐(Center) 列宽度(Column Width) 默认值为变量的总长度。,.,27,SPSS数据文件的结构,(六)缺失值(Missing Values) 1、什么是缺失值? 漏填数据 明显错误的数据 2、对缺失值的一般处理 事先指定:指定某个特定值为缺失值(用

12、户缺失值) 其他处理方法,如:以均值、众数替代等 3、SPSS缺失值 用户缺失值 系统缺失值:数值型:点 () 字符型:空,.,28,SPSS数据文件的结构,(七)变量计量尺度(Measurement) scale: 定距数据,一般为数值型数据。 如:收入、人数。 ordinal: 有固有顺序的顺序水准的数值型或字符型数据。 如:职称、年龄段 nominal: 无固有顺序的名义水准的数值型或字符型数据。 如:性别、民族,.,29,定义SPSS数据文件结构,操作方法:利用变量视图 如何查看变量定义的情况 菜单选项: Utilities - Variables,.,30,SPSS数据的录入与保存,

13、录入时应注意: 黑框确定当前数据单元 录入带有变量值标签的数据:手工输入代码,屏幕显示变量值标签 冻结第一列 数据保存: 操作 保存格式: (1)*.sav :SPSS数据文件(默认)。 (2)*.dbf : dbase数据文件。 (3)*.xls : Excel工作表文件。 注意:有些信息会丢失,.,31,SPSS数据的编辑,(一)打开数据文件 菜单选项:File - Open - .sav (二)数据定位 按个案号码定位 菜单: Data - Go to case - 输入样本号 按值定位 光标定位到某列变量上 - Edit - Find.,.,32,SPSS数据的编辑,(三)插入和删除一

14、个个案 插入:data-insert case 删除:选定待删行,鼠标右键找到Cut (四)插入和删除一个变量 插入:光标定位到某列变量上 - Data - Insert Variable (插到某列前) 或鼠标右键 删除:选定列,鼠标右键Cut项,.,33,SPSS数据的编辑,(五)数据移动、复制和删除 定义源数据块 鼠标右键:cut copy clear 确定目标单元 鼠标右键:paste,.,34,数据文件的合并,目的: 将两个SPSS数据文件合并到一个数据文件中 文件合并的方式: 纵向合并 横向合并,.,35,(一)纵向数据合并 (1)含义: 将磁盘上的一个SPSS数据文件追加到当前d

15、ata editor窗口中的数据文件中。 (2)前提: 两个SPSS数据文件应可以合并的内容,且最好有相同的变量名和变量类型。 (3)菜单选项: data - merge file - add cases,数据文件的合并,.,36,数据文件的合并,(二)横向数据合并 (1)含义: 将磁盘上的一个SPSS数据文件中的若干个变量增加到当前data editor窗口的数据文件中。 (2)前提: a.两个数据文件必须有一个共同的变量名为关键字段-合并的依据; b. 两个数据文件应事先按关键字段升序排序。,.,37,数据文件的合并,(二)横向数据合并 (3)菜单选项: data - merge file

16、 - add variable (4)选项说明: math cases on key variables in sorted files:以关键字作为合并标志。 Both files provide cases:合并后的文件的数据由两个文件共同提供。 External file is keyed table:以data editor的数据为基础。 Working data file is keyed table:以磁盘文件的数据为基础。,.,38,与其他软件数据共享,共享dbf和xls格式文件 菜单选项: Data - Open (1)*.dbf : dbase数据文件。字段名、字段类型自动转

17、成SPSS数据文件中的变量名和类型。一条记录为一个个案。 (2)*.xls : Excel文件 (Read variable name选项) 共享数据库文件 建立ODBC数据源,.,39,第三章 SPSS数据文件的基本加工和处理,.,40,SPSS数据文件的基本加工和处理,数据文件的整理 个案排序、个案选取 数据加工 变量计算、计数 数据分组 自动分组、手工分组 数据文件的其他处理功能 指定加权变量,.,41,目的: 将所有个案按照用户指定的某一个或多个变量的变量值的升序或降序重新排列。 菜单选项: data - sort cases 注意: (1)Ascending:升序、Descendin

18、g:降序。 (2)多重排序,选择变量名的次序很关键。,个案排序,排序在数据分析中的作用?,.,42,个案选取,目的: 从现有数据中挑选出部分数据。 菜单选项: data - select cases 选取个案的几种不同方式 (1)选择符合一定条件的个案(If condition is satisfied) (2)随机选取个案(Random sample of cases) 近似选取、精确选取 (3)选取某一区域内的个案(Based on time or case range) (4)使用过滤变量(use filter variable) 注意:以后的操作和分析都在该个案选取的基础上进行.,个案

19、选取在数据分析中的作用?,.,43,变量计算,目的:产生新变量或对原变量进行必要的转换处理 (如:预测问题 产生比率数据 偏态数据的正态处理 时间序列的平稳处理等) (1)含义: 根据用户给出的SPSS算术表达式,对所有或部分样本数据进行加工。 (2)菜单选项: transform-compute if 按钮 (3)SPSS算术表达式(Numeric Expression): 由算术运算符(+ 、-、 *、 /、 *)、SPSS函数以及SPSS变量名组成的式子。,.,44,变量计算,算术函数 统计函数 分布函数 逻辑函数 字符串函数 缺失值函数 日期时间函数 其他函数,(4) SPSS函数,.

20、,45,算术函数 Abs():求绝对值 sqrt():求平方根 rnd():四舍五入后取整 trunc():截取小数部分取整 mod():取余 Ln():自然对数 Lg10():以10为底的对数,(4) SPSS函数,变量计算,.,46,统计函数: mean():均值 sd():标准差 sum():求总和 cfvar():求变异系数 max() min():求最大最小值,(4) SPSS函数,变量计算,.,47,分布函数: normal():产生服从标准正态分布的随机数序列 uniform():产生均匀分布的随机数序列 rv.():产生指定分布的随机数序列,如:rv.t(10) cdf.():

21、计算指定分布的累计概率值 idf.():计算指定分布的临界值,(4) SPSS函数,变量计算,.,48,逻辑函数: range():判断变量值是否在指定的区间内 any():判断变量值是否为指定的若干值 字符串函数: index(S1,S2):判断字符串S2在S1中首次出现的位置 length():求字符串长度 lower() upcase():字符串的大小写转换 lpad():用指定字符补齐字符串为指定长度 ltrim():压缩字符串空格 substr():取子串,(4) SPSS函数,变量计算,.,49,缺失值函数 missing():判断变量是否取系统或用户缺失值 sysmis():判断

22、变量是否取系统缺失值 其他函数: Lag():便于进行差分计算,(4) SPSS函数,变量计算,.,50,变量转换,(5)SPSS条件表达式: 条件表达式:由SPSS关系运算符、逻辑运算符、SPSS函数以及SPSS变量名组成的式子。 关系运算符: (大于)、 =(大于等于)、 32、sr=700,逻辑运算符: 大于0表示正偏差大(右偏),频数最大的值比均值小,极值大于均值; 小于0表示负偏差大(左偏),.,72,计算描述统计量,描述陡峭程度的统计量 峰度(kurtosis):描述某变量所有变量值分布形态陡缓程度的统计量。 峭度为0表示与标准正态分布峭度相同。 大于0表示比标准正态分布陡,尖峰。

23、 小于0表示比标准正态分布缓;平峰。,.,73,计算描述统计量,其他统计量 标准误差(standard error S.E):抽样分布中的标准差,反映样本误差。 均值标准误差(means of S.E) 中心极限定理认为:样本均值N(u,2/n) 反映样本均值与总体真值间的平均离散程度 样本数越大,样本均值的离散程度越小,对真值的估计越准确,.,74,计算描述统计量,基本操作步骤 (1)菜单选项:analyze-descriptive statistics-descripive (2)选择将参加计算的数值型变量名到variables框。 分析比较不同户口所在地储户取款情况 比较集中趋势 比较离

24、散趋势 比较偏斜程度 比较陡峭程度 实现方式:数据拆分,.,75,其他功能 数据标准化处理 新变量的均值为0,标准差为1; 小于0表示在平均水平下,大于0反之. 正态分布的数据标准化后呈标准正态分布(68.2%,95.4%,99.7%) save standardized values as variables选项 将变量作标准化后,结果存入名为“Z+原变量名”的新变量中. 数据标准化处理应用举例 你能以较简便的方法快速找到取款数目出众的储户吗?,计算描述统计量,.,76,基本统计分析的图形工具,以制作条形图为例,.,77,以制作条形图为例 第一种模式下的三种图形:用于某变量在各分类情况的比较

25、,基本统计分析的图形工具,.,78,以制作条形图为例 第二种模式下的三种图形:用于若干变量的统计量的比较,基本统计分析的图形工具,.,79,箱线图 (箱线图中以四分位差的1.5倍为标准剔除值),基本统计分析的图形工具,.,80,直方图和P-P图,基本统计分析的图形工具,.,81,交叉分组下的频数分析,目的 了解不同变量在不同水平下的数据分布情况 例:学习成绩与性别有关联吗?(两变量) 例:职业、性别、爱逛商店有关联吗?(三变量) 分析的主要步骤 产生交叉列联表 分析列联表中变量间的关系,.,82,产生交叉列联表,基本操作步骤 (1)菜单选项: analyze-descriptive stati

26、stics- crosstabs (2)选择一个变量作为行变量到row框. (3)选择一个变量作为列变量到column框. (4)可选一个或多个变量作为控制变量到layer框. 控制变量的层次设置:同层为水平数加;不同层为水平数积. (5)是否显示各分组的棒图(display clustered bar charts ),.,83,产生交叉列联表,应用举例 户口与收入水平有关联吗吗? 行变量:户口;列变量:月收入 不同户口不同收入水平的储户对物价水平的看法一致吗? 行变量:收入水平; 列变量:物价水平; 控制变量:户口,.,84,产生交叉列联表,应用举例,不同户口不同收入水平的储户对物价水平水

27、平的看法一致吗?,.,85,产生交叉列联表,进一步计算 cells选项:选择在频数分析表中输出各种百分比. row:行百分比(Row pct); column:列百分比(Col pct); total:总百分比(Tot pct);,.,86,分析列联表中变量间的关系,目的: 通过列联表分析,检验行列变量之间是否独立。 方法: 卡方检验:对品质数据的相关性进行度量,.,87,分析列联表中变量间的关系,卡方检验 年龄与工资收入交叉列联表 低 中 高 青 400 00 中 0 5000 老 0 0600 低 中 高 青 0 0500 中 0 6000 老 400 00,.,88,分析列联表中变量间的

28、关系,卡方检验基本步骤 (1)H0:行列变量之间无关联或相互独立 (2)构造卡方统计量 统计量服从(r-1)*(c-1)个自由度的卡方分布 count:观察(实际)频数 expected count:期望频数 (期望频数反映的是H0成立情况下的数据分布特征) Residual:剩余 (观察频数-期望频数),.,89,分析列联表中变量间的关系,卡方检验基本步骤 (3)计算卡方统计量的值,并得到该统计量值的概率P值 (4)决策。概率P与显著性水平比较,小于等于则拒绝H0,否则不能拒绝 实现步骤 statistics选项 cells选项,.,90,分析列联表中变量间的关系,应用举例 户口对平均收入水

29、平的分布会产生影响吗? 独立性检验:从一个总体中随机抽样。按某两个属性变量将样本进行分类 不同行业人对的自己职业的选择标准是否存在差异? 一致性检验:从两个总体中独立抽样,根据一个属性变量将样本进行分类。 制造业 服务业 物质报酬 105 45 稳定性 40 35,.,91,分析列联表中变量间的关系,卡方检验的要求: 一般要求列联表中期望频数小于5的格子数不超过20%,否则会夸大卡方值,容易得出拒绝结论,可以合并单元格。 卡方值会受样本数的影响,.,92,分析列联表中变量间的关系,行列变量相关性的其他测度指标 phi系数:适用于22列联表 当行列变量独立时: 有: 当行列变量完全相关时: 有:

30、 越接近于1,相关性越强。越接近0,相关性越弱,.,93,分析列联表中变量间的关系,行列变量相关性的其他测度指标 列联C系数(contingency coefficient), 通常为0,1),取值受到行列数的影响(见EXCEL) V系数 0,1 值越大表示行列变量的相关性越大,.,94,多选项分析,多选项分析的基本思路 定义多选项变量集 多选项频数分析 多选项交叉分组下的频数分析,.,95,多选项分析,定义多选项变量集 目的:将已分解的变量定义为一个集合,便于进行多选项分析 菜单选项:analyze-multiple response-define sets 从原变量中选取被分解的变量(数值

31、型)到variables in sets框 指定被分解的变量是按多选项二分法(dichotomize)分解还是按多选项分类法(categories)分解的 为变量集命名。系统自动在名字前加字符$.,.,96,多选项分析,多选项频数分析 菜单选项:analyze-multiple response-frequencies 多选项交叉分析下的频数分析 菜单选项:analyze-multiple response-crosstabs,.,97,多选项分析,多选项分析实例 分析居民的储蓄目的 采用多选项分类法组织数据 在某次市场调查中收集了北京、上海和广州三个城市的受访者对几种常见饮料的喜好情况,可选

32、的饮料有茶、牛奶、咖啡、果汁、矿泉水。(数据是从原始数据库中抽出的一小部分资料),作以下分析: 采用二分法组织数据 受访人群中最受欢迎的饮料是哪种? 男、女喜爱的饮料有无差异? 三个城市的人群对饮料的喜好有无差异?,.,98,作业,根据第三章的关于学生成绩的合并后的SPSS数据文件做以下处理: 对各门课程分组后,做频数分析, 绘制某两门课程成绩的直方图 绘制男女生构成的饼图 分别计算男女生各门成绩的基本描述统计量,并对数据的集中趋势、离散程度和偏度加以比较(数字和图形的对比),.,99,第五章 SPSS参数检验,.,100,假设检验概述,假设检验是一种根据样本数据来推断总体的分布或均值、方差等

33、总体统计参数的方法。 根据样本来推断总体的原因: 总体数据不可能全部收集到。如:质量检测问题 收集到总体全部数据要耗费大量的人力和财力 假设检验包括: 参数检验 非参数检验,.,101,假设检验的基本原理,基本信念:利用小概率原理进行反证明。小概率事件在一次实验中不可能发生。 例如:对人民大学男生平均身高进行推断 H0:平均身高为173 样本平均身高为178,由于存在抽样误差,不能直接拒绝H0。而需要考虑:在H0成立的条件下,一次抽样得到平均身高为178的可能性有多大。如果可能性较大,是个大概率事件(与相比较),则不能认为H0不正确。否则,如果可能性较小,是个小概率事件,但确实发生了,则只能认

34、为H0不正确。 概率P值即为观测结果或更极端现象在零假设成立时出现的概率,.,102,假设检验的基本步骤,(1)根据检验的目标,对待推断的总体参数或分布作一个基本假设H0 (2)构造检验统计量,且该统计量服从某种已知分布. (3)利用收集到的样本数据和基本假设计算检验统计量的值,并得到相应的相伴概率P值,即:检验统计量在某个特定的极端区域取值在H0成立时的概率. (4)如果概率P值小于用户给定的显著性水平a,则拒绝H0 .否则,不拒绝H0 .,.,103,SPSS中的参数检验方法,单样本t检验 两独立样本t检验 两配对样本t检验,.,104,SPSS单样本t检验,(一)含义: 检验某变量的总体

35、均值与指定的检验值之间是否存在显著差异。 例如:周岁儿童的平均身高是否为75厘米 (二)要求: 样本来自的总体服从正态分布,为什么?,.,105,SPSS单样本t检验,(三)基本思路: H0:u=u0,总体均值与检验值之间不存在显著差异. 构造检验统计量.从样本均值的分布出发,即:N(u0, 2/n).于是: 总体方差未知时构造t统计量 D=X- u0 t统计量服从n-1个自由度的t分布 计算t统计量和对应的相伴概率P(绝对值大于等于的双侧概率) 结论:P,则拒绝H0,认为总体均值与检验值之间有显著差异.P ,不能拒绝H0.,.,106,SPSS单样本t检验,(四)基本操作步骤 (1).菜单选

36、项: Analyze-compare means-one-samples T test (2).指定检验值: 在test后的框中输入检验值,.,107,SPSS单样本t检验,(五)option选项 confidence interval:指定输出0的置信区间.默认值为95%. Missing values: 缺失值的处理(单样本检验时以下选项没有差别) exclude cases analysis by analysis:当分析时涉及到有缺失值变量时再剔除相应的个案 exclude cases listwise:剔除所有含缺失值的个案后再分析,.,108,SPSS单样本t检验,(六)应用举例

37、周岁儿童的平均身高为75厘米吗? 根据以前的大量调查,已知顾客对某产品的满意度评分在72分左右,现该产品进行了重新包装,收集了一批顾客的满意度评分,现在的评价是否显著高于以前?,.,109,SPSS两独立样本t检验,(一)含义: 根据两独立样本的数据,对两总体均值是否有显著差异进行推断。 例如:男生和女生的计算机平均成绩有显著差异吗? (二)要求: 两样本必须相互独立,即:抽取其中一批样本对抽取另一批样本没有任何影响.(如:北京周岁儿童与上海儿童的平均身高) 两总体服从正态分布,为什么?,.,110,SPSS两独立样本t检验,(三)基本思路: H0:u1-u2=0,两总体均值无显著差异. 构造

38、检验统计量.从两样本均值差的分布出发,即:N(u1-u2, 2x1-x2).于是两总体均方差未知时构造t统计量: 两总体均值差的抽样分布标准差: 方差相等:用合并方差 方差不等: 计算t统计量和对应的相伴概率P (绝对值大于等于该值的双侧概率),.,111,SPSS两独立样本t检验,(三)基本思路: 结论: 方差齐性F检验 利用Levene F检验确定两总体方差是否齐性.H0:两总体方差无显著差异. 该检验首先计算每个个案与所属组均值之差并取绝对值.然后对其进行单因素方差分析.,.,112,SPSS两独立样本t检验,(三)基本思路: 结论: 首先,如果F检验的P,则拒绝F检验的H0,认为方差不

39、齐性;其次看Unequal行的t检验概率.如果,则拒绝t检验的H0,认为两总体均值有显著差异;如果,则不拒绝t检验的H0. 首先,如果F检验的P ,则不能拒绝F检验的H0,认为方差齐性;其次看equal行的t检验概率.其余同上,.,113,SPSS两独立样本t检验,(四)基本操作步骤 (1).菜单选项:analyze-compare means-independent-samples T (2).选择若干变量作为检验变量到test variables框 (3).选择代表不同总体的变量作为分组变量到grouping variable 框 (4).定义分组变量的分组情况Define Groups.

40、: use specified values:定义分组变量的分组标志值分别是什么 cut point:分组变量为连续变量.输入一个数字,将大于等于该值的分成一组,小于该值的分成另一组.,.,114,SPSS两独立样本t检验,应用举例 上海周岁儿童的平均身高与北京周岁儿童的平均身高有显著差异吗? 某商场为某种产品进行了促销活动,请比较前后数日的销售额,以确认促销活动对销量有无作用。 A、B两种减肥产品的作用有明显差异吗? 随机选了200名肥胖者服用A种减肥产品,其中:92人体重明显减轻了;另随机选了183名肥胖者服用B减肥产品,其中:161人体重明显减轻了。,.,115,SPSS两配对样本t检验

41、,(一) 含义: 根据配对样本对两总体均值是否有显著差异进行推断. 例如: 某种减肥茶是否有效 (二)要求: 两样本数据必须两两配对,即:样本个数相同,个案顺序相同.如:减肥茶的效果、不同广告形式对销售额的影响.(控制了个案自身的影响) 两总体服从正态分布,.,116,SPSS两配对样本t检验,(三)基本思路 H0:两总体均值无显著差异,差值序列的均值u0 =0. 构造统计量:同单样本均值检验 D=X- u0 S为差值序列的标准差 实质是先求出每对测量值的差值;然后检验差值序列的均值是否与0有显著差异. 如果差值的均值与0有显著差异,则认为两总体均值存在显著差异;否则,与0无显著差异,则认为两

42、总体均值不存在显著差异.,.,117,SPSS两配对样本t检验,(三)基本思路 计算t统计量和对应的相伴概率P(绝对值大于等于的双侧概率) 结论:P,则拒绝H0,认为两总体均值有显著差异.P ,不能拒绝H0.,.,118,SPSS两配对样本t检验,(四)基本操作步骤 (1).菜单选项: analyze-compare means-paired-samples T (2).选择一对或若干对配对变量作为检测变量到paired variables框. (3)option选项 同独立样本的T检验,.,119,SPSS两配对样本t检验,应用举例 某种减肥茶真起到减肥作用了吗? 对促销人员培训前和培训后销

43、售额的比较,以确认业务培训有无效果。,.,120,作业,一、给幼鼠以不同的饲料,研究每天钙的留存量是否有显著不同。以下两种方法涉及实验样本: 方式1:同一鼠喂不同的饲料 鼠号 1 2 3 4 5 6 7 8 9 饲料1 33.1 33.1 26.8 36.3 39.5 30.9 33.4 31.5 28.6 饲料2 36.7 28.8 35.1 35.2 43.8 25.7 36.5 37.9 28.7 方式2:甲组12只喂饲料1,乙组9只喂饲料2 甲组:29.7 26.7 28.9 31.1 31.1 26.8 26.3 39.5 30.9 33.4 33.1 28.6 乙组:28.7 28

44、.3 29.3 32.2 31.1 30.0 36.2 36.8 30.0 二、根据学生成绩数据,分析: 是否有男女生平均成绩存在明显差异的课程 判断学生在哪些课程上的平均成绩差别不明显,.,121,第六章 方差分析,.,122,方差分析概述,一、问题的提出 最优方案的设计 如何获得最佳的产品销售量 哪些因素是影响销售量的主要因素 哪些因素的那种情况更利于提高销售量 哪些因素的组合更利于提高销售量 可以利用方差分析的方法来实现,.,123,方差分析概述,二、方差分析 目的:方差分析从分析数据的差异入手,分析哪些因素是影响数据差异的众多因素中的主要因素. 相关概念: (1)观测变量:作为观测的对

45、象(如:亩产量、推销量等). (2)控制因素:人为可以控制的因素(如:施肥量、品种、推销策略、价格、包装方式等),在方差分析中称为控制因素.将控制变量的不同情况称为控制变量的不同水平. (3)随机因素:人为很难控制的因素(如:气候、推销人员的形象、抽样误差等),方差分析中主要指抽样误差。,.,124,方差分析概述,三、核心问题 从数据差异角度看: 观测变量的数据差异=控制因素造成+随机因素造成 当控制因素对实验结果有显著影响时,和随机因素共同作用必然使观测变量产生显著变动;反之,观测变量的变动较小,将归结为随机性造成的(这里指抽样误差造成的).,.,125,方差分析概述,四、方差分析的类型 单

46、因素方差分析: 只考虑一个控制因素的影响 多因素方差分析: 考虑两个以上的控制因素和它们的交互作用对观测变量的影响 协方差分析: 在尽量排除其他因素的影响下,分析单个或多个控制因素对观测变量的影响.(引入协变量),.,126,单因素方差分析,(一)目的 检验某一个控制因素的改变是否会给观察变量带来显著影响. 例如:应用面很广(科学试验,社会经济问题) 考察不同肥料对某农作物亩产量是否有显著差异. 考察不同温度下某化工产品的获得率 考察妇女生育率在不同地区是否有显著差异. 考察不同学历是否对工资收入产生显著影响.,.,127,单因素方差分析,(二)基本思路 (1)入手点: 检验控制变量的不同水平

47、下,各总体的分布是否存在显著差异,进而判断控制变量是否对观测变量产生了显著影响. (2)前提: 各组样本独立 不同水平下各总体服从方差相等的正态分布. (3) H0:不同水平下,各总体均值无显著差异.即:不同水平下控制因素的影响不显著.,.,128,通过参数检验可以解决两两总体均值的比较 多个总体均值的检验如何作?(如:北京、上海、广州周岁儿童平均身高的比较) 可以多次采用两样本t检验方法实现 产生的问题:犯第一类错误的概率明显增大 例如:K个变量两两进行t检验,需要作N=k! (2! (k-2)!)次,如果为0.05,那么每次不犯错的概率为0.95。N次检验均不犯错的概率为0.95N,而犯错

48、的概率为1-0.95N,远远大于设定的0.05 可以利用方差分析的方法来实现多个总体的均值比较,单因素方差分析,.,129,单因素方差分析,(二)基本思路 (4) 构造F统计量 因为:总变差=组间差异+组内差异 可证明:SST= SSA+SSE(设:k个水平,每个水平有ni个数据) 考察平均的组间差异与平均的组内差异的比值,于是:,F(k-1,n-k),.,130,单因素方差分析,(二)基本思路 (5)结论: F值较大,F值的概率p值小于或等于用户给定的显著性水平a,则拒绝H0,认为不同水平下各总体均值有显著差异; F值较小,F值的概率p值大于用户给定的显著性水平a,则不能拒绝H0,不可以认为

49、不同水平下各总体均值存在显著差异.,.,131,单因素方差分析,(三)数学模型 设控制变量A有k个水平,每个水平均有ni个数据,在水平Ai下第j个数据xij可以分解为: xij=i+ij i为水平Ai下的理论指标值,ij为误差,服从正态分布(0,2),i为水平Ai对试验结果产生的影响,称为水平Ai的效应。如果A对观测变量没有影响,则各水平的效应全为0,否则不全为0。于是有: H0:1= 2= 3= k=0,.,132,单因素方差分析,(四)基本操作步骤 (1)菜单选项: analyze-compare means-one-way ANOVA (2)选择一个或多个变量作为观察变量到depende

50、nt list 框 (3)选择一个变量作为控制变量到factor框 (4) option中的statistics项: descriptive:输出观察变量不同水平下的描述统计量,.,133,单因素方差分析,(五)应用举例 不同推销方式是否对推销额有显著影响 观测变量的数据安排 控制变量可以定义成定类或定序变量 观察方差分析表,分析控制变量对观测变量差异解释的比例R2 不同的施肥量是否对亩产量造成了显著影响,.,134,单因素方差分析,(六)进一步的分析 前提的检验:各水平下方差齐性检验 实现方法: option中的statistics:Homogeneity-of-variance,检验各水平

51、下各总体方差是否齐性.H0:各水平下各总体方差无显著差异.,.,135,单因素方差分析中的多重比较,(一)目的 如果各总体均值存在差异,F检验不能说明哪个水平造成了观察变量的显著差异. 多重比较将对每个水平的均值逐对进行比较检验. (二)几种常用的多重比较方法 LSD(Least significant Difference)最小显著性差异法 T(Tukey)方法,.,136,单因素方差分析中的多重比较 -几种常用的多重比较方法,LSD(Least significant Difference)最小显著性差异法 特点: 利用了全部样本数据,而不仅是所比较的两组的数据,且认为各水平均是等方差的

52、与其他方法相比,其检验敏感度最高 在一定程度上克服了放大犯一类错误的问题,各组方差相等,.,137,单因素方差分析中的多重比较 -几种常用的多重比较方法,T(Tukey)法 特点: 利用了全部样本数据,而不仅是所比较的两组的数据,且认为各水平均是等方差的 q分布平缓些,克服了扩大犯错的可能性,但不如LSD方法敏感 适合各水平下样本数均相同的情况,即:均衡试验,.,138,S-N-K(Student-Newman-Keul)方法:帮助对各水平进行相似子集划分 首先计算dt 各水平均值排序后计算相邻两水平下的样本均值的差,大于dt为不相似子集,小于dt为同一相似子集 如果所分组中包含的水平数小于等

53、于2,则分组结束,否则继续分组 继续分组计算dl,依据一统计量,考察这个最大距离是否足够远。是则将其分出,否则留在本组内 适合于均衡试验情况,单因素方差分析中的多重比较 -几种常用的多重比较方法,.,139,单因素方差分析中的多重比较,(三)实现方式 post hoc选项 (四)应用举例 哪两种推销方式对推销额产生了显著影响 *表示在0.05的显著性水平下I和J水平之间的均值存在显著差异. 那两组施肥量对亩产量产生了显著影响 施肥量的决策,.,140,单因素方差分析中的先验对比,(一)目的 先凭经验确定各水平均值之间的对比系数,然后判定这两组均值的线性组合是否存在显著差异.如: 1/3 (k1

54、+k2+k3)=1/2 (k4+k5) H0:两组均值的线性组合无显著差异. (二)实现方式 Contrasts选项,在Coefficients框中输入每个水平均值的系数值和正负符号. 注意: 输入系数的顺序与控制变量水平值的升序一一对应 系数的和为0,.,141,单因素方差分析中的趋势检验,(一)目的 将组间平方和分解成线性、二次、三次或更高次的多项式,检验观测变量是否随控制变量呈不同次幂变化。 (二)实现方式 Contrasts选项, polynomial框 (三)应用举例 促销方式与与销售额的趋势检验(假设促销方式具有定序性),.,142,作业,1、一名证券经纪人收集到了某年三个公司的股

55、票每股净收益。试比较这三种不同类型的公司股票所挣的钱是否相同 计算机公司 :1.94 2.76 8.95 3.23 3.04 0.69 1.52 药品公司: 7.89 1.65 2.59 1.09 -1.70 2.30 3.10 公用公司: 2.26 4.66 2.22 1.77 -0.15 2.10 2.89,.,143,作业,2、有人调查过美国某年不同工种的工人每小时的收入。试检验这四种工种的收入是否存在显著的差异?并进行多重比较. 日用品 8.90 10.15 10.00 9.65 9.9 9.85 非日用品 9.40 9.00 9.15 9.20 9.15 9.30 建筑业 11.40

56、 11.40 11.80 11.45 10.80 10.95 零售业 8.60 8.65 8.90 8.80 8.75 8.50,.,144,多因素方差分析,(一)目的 测试若干个控制因素的不同水平的交叉变化是否给观察变量带来了显著影响. 例如:,.,145,多因素方差分析,(二)基本思路 认为观测变量的变动是由各控制变量独立作用、它们的交互作用、以及随机因素造成的。以两个控制变量的方差分析为例: SST=SSA+SSB+SSAB+SSE (main effects) (N-way 交互) (Residual) (explained) 其中:SAB表示两个控制变量交互影响带来的变差,.,146

57、,多因素方差分析,(二)基本思路 SST=SSA+SSB+SSAB+SSE A有p个水平,B有q个水平,每组有r个样本,.,147,多因素方差分析,(二)基本思路 检验方法统计量(F检验),.,148,多因素方差分析,(二)基本思路 结论 依次查看各F值的概率p值.如果其相伴概率大于a,则不能拒绝H0,可以认为相应不同水平的控制变量或交互影响没有造成均值的显著差异; 相反 (三)说明,.,149,多因素方差分析-说明,多因素方差分析中因素的划分 固定效应因素:该因素的所有可能水平在样本中都出现。针对该因素而言,从样本的分析结果中就可以得知所有水平的状况,无需外推 如:性别,糖尿病有无:糖尿病,

58、糖耐量异常,正常人:-固定效应模型 随机效应因素:人为无法对所有水平值进行准确控制和观测。 如:城市规模,教育水平等:随机效应模型 -混合效应模型,.,150,多因素方差分析-说明,交互作用,即:两个或多个控制变量各水平之间搭配时对观察变量的影响.即:如果一个因素所产生的效应在另一个因素的不同水平下有明显差异,则称该这两因素存在交互作用 交互作用的理解举例:饮食习惯、适量运动对减肥的作用;排球对的二传手和主攻手对赢球的作用 交互作用的图形观察: A1 A2 A1 A2 B1 2 5 B1 2 5 B2 7 10 B2 7 3 当A从A1变化到A2时, A对观测变量值的影响与B取什么 观测变量值

59、均增加且幅度相同, 水平有关 与B1或B2无关;同理B,.,151,多因素方差分析-说明,多因素方差分析的核心内容: 检验在不同控制变量的不同交叉水平下,各交叉分组下样本数据所来自的总体均值,有无显著差异。 进而判断多个因素是否对观测变量产生了显著影响 H0:各交叉水平下的总体均值均无显著差异. 数学模型:以双因素为例 H0: ai=0;bi=0;(ab)ij=0,.,152,多因素方差分析-说明,多因素方差分析的前提: 样本独立;各水平交互下的总体服从正态和方差齐性 但第二个前提在实际中有时很难保证: 无重复数据的多因素方差分析,如:交叉设计、正交设计等,单元格中无重复数据的多因素方差分析 有重复数据的多因素方差分析:检验是以单元格

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论