第9章相关和回归分析(课件)-《统计学(微课版)》同步教学(人民邮电版)_第1页
第9章相关和回归分析(课件)-《统计学(微课版)》同步教学(人民邮电版)_第2页
第9章相关和回归分析(课件)-《统计学(微课版)》同步教学(人民邮电版)_第3页
第9章相关和回归分析(课件)-《统计学(微课版)》同步教学(人民邮电版)_第4页
第9章相关和回归分析(课件)-《统计学(微课版)》同步教学(人民邮电版)_第5页
已阅读5页,还剩49页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

统计学

Statistics

第9章相关和回归分析

u9.1相关分析

u9.2线性回归模型的建立和估计

u9.3拟合优度和显著性检验

u9.4多重共线性

u9.5利用回归方程进行预测

u9.6引入虚拟变量的回归分析

u9.7小结

第9章相关和回归分析

•9.1相关分析

相关分析

•如果变量x取值相同时,变量y的值不会发生变化,可以依据一个表达

式唯一确定,我们把变量之间这种确定性的关系称为函数关系

(functionalrelation)。

•但现实生活中,由于影响变量y的因素可能有很多,即使把所有的影

响因素(变量x)都考虑进来,仍然还可能存在某些随机因素,从而

导致当变量x取相同值的时候,变量y并不能被唯一确定,其取值可能

发生变化。

•变量之间这种不确定性的关系称为相关关系(correlation)。

相关分析

•散点图(scatterplot)是用于描述两个变量相关关系最常用的一个工具。图9-

1给出了相关关系的几种不同表现形式。

(a)完全正线性相关(b)完全负线性相关(c)正线性相关

(d)负线性相关(e)非线性相关(f)不相关

图9-1相关关系的不同表现形式

相关分析

•如果两个变量的散点图如图9-1(a)、(b)所示,所有数据点都恰好落在一条直

线上,则称这两个变量是完全线性相关。依据直线斜率的正负,(a)为完全正

线性相关,(b)为完全负线性相关。

•图9-1(c)、(d)所描述的是典型的线性相关关系,两个变量的观测值大致呈一

条直线分布,但并不完全与之吻合,各数据点可能在直线附近略有波动。如

果整体上一个变量随着另一个变量取值的增加而增加,则为正线性相关;反

之,则为负线性相关。

•有时候,两个变量的观测值并不呈直线分布,而是大致在一条曲线附近波动,

如图9-1(e)所示,称两个变量是非线性相关。

•特别地,当两个变量的观测值表现为图9-1(f)所示的分布形态时,说明一个变

量的取值与另一个变量没有任何明显的关联,则称二者不相关。

相关分析

【例9.1】面对各种诱人的食物,想要保持身材的你是否留意过每种食物所含的

脂肪和热量?表9-1列出了16种食物每百克中的脂肪含量和热量,这两个指标之

间是否存在某种关联?如果存在,这种关系的表现形式是什么?

表9-116种食物每百克中的脂肪含量和热量

食物脂肪(克)热量(千卡)

乐事薯片30.67521

甜甜圈14.68227

原味手指饼干22.70494

玉米饼2.40151

炸薯条11.01201

炸鸡翅10.97224

巧克力40.10589

冰淇淋5.30127

辣条23.70357

鸭脖子5.80206

士力架23.60489

香辣豆腐干11.30197

酸辣粉3.8797

三明治11.84219

鸡蛋饼7.58151

沙琪玛30.40505

相关分析

解:从表9-1中的数据我们注意到,脂肪含量相对较低的食物似乎热量也较低,

脂肪含量较高时,食物的热量也较高。为了更加直观地揭示二者之间是否真的存

在这种关系,我们可以绘制散点图。以热量为纵坐标变量y,脂肪为横坐标变量x,

Excel绘制的散点图如下:

图9-2不同食物每百克脂肪含量(克)和热量(千卡)的散点图

从图9-2可以清晰地看到,这些食物的脂肪含量和热量的数据点大体呈一条直线,

并且随着脂肪含量的增加,整体上热量也呈现出上升的趋势,说明二者之间存在

典型的正线性相关关系。

相关分析

•相关系数(correlationcoefficient)是度量两个数值变量之间线性关系强度的

统计量。基于总体数据计算得到的称为总体相关系数,记为ρ;基于样本数据

计算得到的称为样本相关系数,记为r。样本相关系数的计算公式有多种,最

常用的为:

n

(xix)(yiy)

ri1

nn

22

(xix)(yiy)

i1i1

nn

•其中,n为样本量,xxi/n为变量x的样本均值,yyi/n为变量y的样本均值。

i1i1

•按上式计算的相关系数称为Pearson相关系数(Pearson’scorrelation

coefficient)

相关分析

•Pearson相关系数有三个假定条件:

(1)两个变量之间是线性相关关系;

(2)两个变量都是随机变量且服从联合正态分布;

(3)样本数据中没有极端值。

•相关系数r的取值范围为[-1,1],r>0表明两个变量之间存在正线性相关

关系;r<0则为负线性相关关系。

•r的绝对值越接近于1,两个变量之间的线性相关关系越强;r的绝对值

越接近于0,两个变量之间的线性相关关系越弱。

相关分析

•相关系数显著性检验的原假设和备择假设为:

H0:ρ=0;H1:ρ≠0

•在原假设成立的前提下,构造的检验统计量:

rn2

t

1r2

服从自由度为n-2的t分布。

•结合指定的显著性水平α,临界值即为t(n-2)分布的α/2上下侧分位数

(t/2和-t/2),根据样本数据计算出检验统计量t的实际取值,与临界值进行

比较,判断是否落入拒绝域并做出决策。

•利用计算机也可以直接计算p-值,通过比较p-值与α的大小,做出决策。

相关分析

【例9.2】沿用例9.1的数据,计算每百克食物所含的脂肪和热量两个变量之间的

相关系数,并在0.05的显著性水平下,检验相关系数是否显著。

解:基于表9-1的数据,使用Excel中的【CORREL】函数可以计算得到r=0.9576,

说明每百克食物所含的脂肪和热量两个变量之间存在很强的正线性相关关系,与

散点图9-2显示的直观印象一致。

进一步地,将样本量n=16,r=0.9576代入公式,计算得到检验统计量

0.9576162

t12.438

10.95762

指定的显著性水平α=0.05,使用Excel中的【T.DIST.2T】函数计算得到双侧检验

的p-值=5.895E-09,p-值<α,检验通过,即有理由认为每百克食物所含的脂肪和

热量两个变量之间总体上也存在显著的线性相关关系。

第9章相关和回归分析

•9.2线性回归模型的建立和估

线性回归模型的一般表达式

•回归分析中把重点考察的目标变量称为因变量(dependentvariable)

或被解释变量(explainedvariable),通常记为y。

•可能影响因变量的其他变量称为自变量(independentvariable)或解

释变量(explanatoryvariable),通常记为x。

•用于量化描述自变量和因变量之间关系的表达式称为回归模型

(regressionmodel)。

•如果变量之间存在显著的线性相关关系,就可以建立线性回归模型

(linearregressionmodel)对其进行刻画。

线性回归模型的一般表达式

•当涉及的自变量只有一个时,建立的回归模型称为一元线性回归模型

(simplelinearregressionmodel),其一般表达式为

y=β0+β1x+ɛ

•其中,β0、β1称为模型的参数,ɛ为误差项。

•一元线性回归模型由两部分构成:β0+β1x反映了因变量y的取值中可

以由自变量x的线性函数决定的部分,或者说可以由x和y的线性关系

解释的y取值的变异部分;误差项ɛ则反映了除自变量x以外的其他随

机因素对因变量y的影响,是不能由x和y的线性关系解释的y取值的变

异部分。

线性回归模型的一般表达式

•ɛ是一个随机变量,需要满足三个假定条件:

(1)独立性。对于不同的x值,所对应的误差项ɛ相互之间是不相关的。

(2)正态性。ɛ服从正态分布,且期望值为0。

(3)方差齐性。对于不同的x值,ɛ分布的方差σ2都相等。

•当ɛ满足上述条件时,对于给定的x值,y服从期望值为E(y)=β0+β1x,方差为

σ2的正态分布,且相互之间独立。

•参数β0就是回归直线(regressionline)在y轴上的截距,它表示当自变量x等

于0时,y的平均值。

•参数β1就是回归直线的斜率,也称为回归系数(regressioncoefficient),它

表示当自变量x变动一个单位时,因变量y的平均变动值。

线性回归模型的一般表达式

•如果涉及的自变量不只一个时,建立的回归模型称为多元线性回归模型

(multiplelinearregressionmodel),其一般表达式为

y=β0+β1x1+…+βkxk+ɛ

•多元线性回归模型由两部分构成:β0+β1x1+…+βkxk反映了可以由k个(k>1)

自变量x1,…,xk和y的线性关系解释的y取值的变异部分;误差项ɛ则反映了除k

个自变量以外的其他随机因素对因变量y的影响。

•当ɛ满足独立性、正态性和方差齐性的假定条件时,对于给定的x1,…,xk的值,

E(y)=β0+β1x1+…+βkxk。

•参数β0表示当k个自变量都等于0时,y的平均值;β1、…、βk称为偏回归系数

(partialregressioncoefficient),其含义分别表示当其他k-1个自变量都不

变时,所对应的自变量变动一个单位,因变量y的平均变动值。

线性回归模型的一般表达式

•回归模型的参数是未知的,需要利用样本数据对其进行估计,得到估计的回

归方程(regressionequation)。

•对于一元线性回归,估计的回归方程为

ˆˆ

yˆ01x

•对于多元线性回归,估计的回归方程为

ˆˆˆ

yˆ01xkxk

•最小二乘法(leastsquaresmethod)通过使因变量的观测值yi和估计值yˆi

之间的离差平方和达到最小来估计参数,也称为最小平方法。

线性回归模型的一般表达式

•根据最小二乘法,对于一元线性回归,令

nn

2ˆˆ2

Q(yiyˆi)(yi01xi)

i1i1

ˆˆ

•使得Q达到最小的0和1即为模型参数的最小二乘估计值。

•从示意图9-3可以更加直观地看出,最小二乘法的基本思想就是要寻找一条直

线,使得所有数据点到它的竖直距离平方和达到最小,这一过程也称为拟合

(fit)。

•同样地,对于多元线性回归,令

nn

2ˆˆˆ2

Q(yiyˆi)(yi01x1kxk)

i1i1

ˆ,ˆ,,ˆ

•使得Q达到最小的01k即为模型参数的最小二乘估计值。

线性回归模型的一般表达式

线性回归模型的一般表达式

【例9.3】沿用例9.1的数据,由于体重的控制通常关注摄入食物的热量,为进一

步确定食物脂肪含量与热量之间的影响关系,试以热量为因变量,脂肪含量为自

变量,建立二者的线性回归方程。

解:由例9.2的相关分析结果已知,每百克食物所含的脂肪和热量两个变量之间

存在显著的线性相关关系,因此可以考虑以热量为因变量y,脂肪为自变量x,建

立一元线性回归模型。基于表9-1的样本数据,利用Excel中的【数据分析】工具

输出如表9-3所示的回归分析结果(参数估计部分):

表9-3食物所含脂肪和热量的回归模型参数估计结果(Excel)

Coefficients标准误差tStatP-value下限95.0%上限95.0%

Intercept69.967737222.064606953.1710393640.00680114422.64386194117.2916125

脂肪14.205674451438035635.89546E-0911.7560801316.65526877

线性回归模型的一般表达式

表中第一列(coefficients)即为模型参数β0、β1的最小二乘估计结果(其他输出

结果的解释见后文),因此建立的一元线性回归方程为

yˆ69.96814.206x

ˆ

其中,回归系数1=14.206,表示当每百克食物脂肪含量增加(或减少)1克时,

热量平均将增加(或减少)14.206千卡。

第9章相关和回归分析

•9.3拟合优度和显著性检验

拟合优度

•回归方程对观测值的解释能力称为拟合优度(goodnessoffit)。

•判定系数(coefficientofdetermination)是评价回归方程拟合优度最常用的

统计量,也称为决定系数或可决系数,记作R2,其计算公式为

n

2

(yˆiy)

2SSRi1

Rn

SST2

(yiy)

i1

•R2在0到1之间取值,它测度了回归方程对因变量变异的解释程度。

•对于多元线性回归方程,按照上式计算的统计量称为多重判定系数(multiple

coefficientofdetermination)

•为更加客观地评价回归方程的拟合优度,通常还会计算调整的多重判定系数

2

(adjustedmultiplecoefficientofdetermination),记作Ra,计算公式为

n1

R21(1R2)

ank1

拟合优度

•基于样本数据计算的因变量观测值和估计值的差值称为残差(residual),记

作ei。

•估计标准误差(standarderrorofestimate)是残差的标准差,记作se,其计

算公式为:

n

ˆ2

(yiyi)SSE

si1

en2n2

•估计标准误差即残差平方和的均方根,它从另一个角度度量了回归方程对观

测值的拟合优度。

拟合优度

【例9.4】沿用例9.3的回归分析结果,对建立的线性回归方程拟合优度进行评价。

解:在例9.3中利用Excel的【数据分析】工具输出回归模型参数估计结果的同时,

还将输出如表9-5所示的拟合优度结果:

表9-5食物所含脂肪和热量的回归方程拟合优度结果(Excel)

回归统计

MultipleR0.95760888

RSquare0.91701477

AdjustedRSquare0.91108726

标准误差49.4969866

观测值16

显著性检验

•线性回归模型的建立是以自变量和因变量之间存在线性关系为假设前提的,

因此,利用样本数据估计得到的回归方程能否适用于总体就需要进行假设检

验。

•对于包含k个自变量的多元线性回归方程,检验的原假设和备择假设为

H0:β1=…=βk=0;

H1:βi至少有一个不等于0(i=1,…,k)

SSR/kMSR

在原假设成立的前提下,构造的检验统计量F服从自由

•SSE/(nk1)MSE

度为k和n-k-1的F分布。

•结合指定的显著性水平α,临界值即为F(k,n-k-1)分布的α上侧分位数(Fα),

根据样本数据计算出检验统计量F的实际取值,与临界值进行比较,若F>Fα,

则拒绝原假设,有理由相信自变量和因变量之间总体上也存在显著的线性关

系。当利用计算机还可以直接输出p-值,通过比较p-值与α的大小,做出决策。

显著性检验

•对回归系数逐一进行检验,相应的原假设和备择假设为

H0:βi=0;

H1:βi≠0(i=1,…,k)

ˆˆ

•可以证明,在误差项满足前述假定条件时,i服从正态分布,期望值E(i)i,

标准误差记为ˆ。ˆ往往是未知的,通常用样本数据计算其估计值,记为sˆ。

iii

ˆ

原假设成立时,构造的检验统计量i服从自由度为的分布。

tin-k-1t

i

•结合指定的显著性水平α,临界值即为t(n-k-1)分布的α/2上下侧分位数

(t/2和-t/2),根据样本数据计算出检验统计量t的实际取值,与临界值进

行比较,若ti>t/2或ti<-t/2,则拒绝原假设,有理由相信第i个自变量对因变

量的影响是显著的。也可以利用计算机直接输出p-值,通过比较p-值与α的大

小,做出决策。

显著性检验

【例9.5】沿用例9.3的回归分析结果,在0.05的显著性水平下,对建立的回归方

程及其回归系数进行显著性检验。

解:利用Excel中的【数据分析】工具输出的回归分析结果中还包含如表9-7所示

的回归方程检验结果:

表9-7食物所含脂肪和热量的回归方程检验结果(Excel)

dfSSMSFSignificanceF

回归分析1379019.114379019.114154.70473035.89546E-09

残差1434299.323542449.951681

总计15413318.4375

计算得到F统计量的值为154.7047303,最后检验的p-值为5.89546E-09,远小于

指定的显著性水平0.05,通过了检验。因此,有理由相信例9.3中建立的食物所

含脂肪和热量的一元线性回归方程整体上是显著的。

显著性检验

而关于回归系数的显著性检验,已经在例9.3中的表9-3与模型参数估计结果

一并给出。

n可以看到,Excel在提供回归系数β1的最小二乘估计结果的同时,给出了估计

量ˆ的标准误差(),并基于此计算得到统计量的值为

11.142115594t

12.43803563,最后检验的p-值为5.89546E-09,显然与整个回归方程的显著

性检验p-值相等,证明了在一元线性回归分析中二者是等价的。

n因此,可以推断,总体上食物脂肪含量对热量的影响是显著的。

显著性检验

【例9.6】改革开放以来,我国寿险业获得极大发展,2017年成为世界第二大寿

险市场。为研究我国寿险行业的未来发展趋势,现收集整理了2017年我国31个

地区的人身险保费收入、地区生产总值、居民人均可支配收入、大专及以上学历

人数和死亡率等指标数据,如表9-8所示(此处略)。试以人身险保费收入为因

变量,其他指标为自变量,对其进行多元线性回归分析。(显著性水平α=0.05)

解:根据题意,以人身险保费收入为因变量y,地区生产总值、居民人均可支配

收入、大专及以上学历人数和死亡率分别为自变量x1,x2,x3,x4,尝试建立多

元线性回归方程。表9-9至表9-11为SPSS软件输出的回归分析结果。

显著性检验

表9-9回归方程拟合优度

模型汇总

模型

RR方调整R方标准估计的误差

1.964a.930.919188.39247

a.预测变量:(常量),死亡率,地区生产总值,居民人均可支配收入,大专及以上学历人数。

表9-10回归方程显著性检验

Anovab

模型平方和df均方FSig.

1回归1.226E743064203.91386.336.000a

残差

922784.8042635491.723

总计1.318E730

预测变量常量死亡率地区生产总值居民人均可支配收入大专及以上学历人数。

a.:(),,,,

b.因变量:人身险保费收入

显著性检验

表9-11回归模型参数估计结果及显著性检验

系数a

模型

非标准化系数标准系数

B标准误差试用版tSig.

1(常量)-165.722322.074-.515.611

地区生产总值.013.005.4272.787.010

居民人均可支配收入.003.004.044.625.537

大专及以上学历人数.123.039.5333.148.004

死亡率-4.43246.984-.006-.094.926

a.因变量:人身险保费收入

显著性检验

由表9-11的模型参数估计结果可知,建立的回归方程为

yˆ165.7220.013x10.003x20.123x34.432x4

22

n表9-9中的多重判定系数R=0.93,调整的多重判定系数Ra=0.919,表明4个

自变量的线性函数可以解释因变量观测值90%以上的变异部分,拟合优度很

高。

n表9-10是对回归方程整体的显著性检验,由于p-值接近于0,通过了检验,表

明从整体上而言,4个自变量和因变量之间具有显著的线性关系。

n表9-11在给出各回归系数最小二乘估计结果的同时,还对其逐一进行了显著

性检验。在指定的显著性水平下,只有地区生产总值和大专及以上学历人数

两个自变量的回归系数通过了检验(p-值分别为0.01和0.004),居民人均可

支配收入和死亡率两个自变量的回归系数则没有通过检验(p-值分别为0.537

和0.926)。

第9章相关和回归分析

•9.4多重共线性

多重共线性

•在多元线性回归模型中,除了自变量与因变量之间可能存在较强的相关关系,

自变量与自变量之间也可能存在一定的相关性,称之为多重共线性

(multicollinearity)。

•如果在多元线性回归中存在严重的多重共线性,违背了自变量相互独立的条

件,就可能导致各种问题的出现。

•首先,整个回归方程的拟合优度很高且通过了显著性检验,但多数自变量的

回归系数无法通过检验;

•其次,回归系数的大小甚至符号与基于理论或经验的判断不一致,难以解释;

•第三,理论上重要的影响变量被排除在模型之外,无法通过显著性检验;

•第四,参数估计值的方差变大,对样本数据的微小变化十分敏感,模型的预

测精度降低。

多重共线性

【例9.7】沿用例9.6,针对回归方程存在的问题,采用逐步回归法重新进行分析。

(显著性水平α=0.05)

解:基于表9-8的数据,仍然以人身险保费收入为因变量,地区生产总值、居民

人均可支配收入、大专及以上学历人数和死亡率为自变量,SPSS软件逐步回归

分析的输出结果如表9-13至表9-16所示。

表9-13自变量的筛选过程及标准

输入/移去的变量a

模型

输入的变量移去的变量方法

1大专及以上学历人数.步进(准则:F-to-enter的概率<=.050,F-

to-remove的概率>=.100)。

2地区生产总值.步进(准则:F-to-enter的概率<=.050,F-

to-remove的概率>=.100)。

a.因变量:人身险保费收入

多重共线性

表9-14回归方程拟合优度

模型汇总c

模型RR方调整R方标准估计的误差

1.953a.908.905203.95523

2.964b.928.923183.56946

a.预测变量:(常量),大专及以上学历人数。

b.预测变量:(常量),大专及以上学历人数,地区生产总值。

c.因变量:人身险保费收入

表9-15回归方程显著性检验

Anovac

模型平方和df均方FSig.

1回归1.197E711.197E7287.835.000a

残差

1206334.3842941597.737

总计1.318E730

2回归1.224E726118031.750181.556.000b

残差

943536.9552833697.748

总计1.318E730

a.预测变量:(常量),大专及以上学历人数。

b.预测变量:(常量),大专及以上学历人数,地区生产总值。

c.因变量:人身险保费收入

多重共线性

表9-16回归模型参数估计结果及显著性检验

系数a

模型非标准化系数标准系数

B标准误差试用版tSig.

1(常量)-232.69471.633-3.248.003

大专及以上学历人数.219.013.95316.966.000

2(常量)-150.58470.861-2.125.043

大专及以上学历人数.134.033.5834.112.000

地区生产总值.012.004.3962.793.009

a.因变量:人身险保费收入

针对例9.6的研究问题,最终可以建立如下线性回归方程(模型2):

yˆ150.5840.134x10.012x2

其中,偏回归系数ˆ,表示当地区生产总值保持不变时,大专及以上

n1=0.134

学历人数每增加(或减少)1人,人身险保费收入平均将增加(或减少)0.134

ˆ

亿元;2=0.012,表示当大专及以上学历人数保持不变时,地区生产总值每增

加(或减少)1亿元,人身险保费收入平均将增加(或减少)0.012亿元。

第9章相关和回归分析

•9.5利用回归方程进行预测

利用回归方程进行预测

•如果直接将各个自变量的观测值代入到已经建立的线性回归方程中,

就可以计算得到因变量的点估计值。

•基于点估计,还可以构造因变量的两个估计区间:

•一个是对自变量的给定值,计算因变量平均值的估计区间,这一区间

称为置信区间(confidenceinterval);

•另一个是对自变量的给定值,计算因变量个别值的估计区间,这一区

间称为预测区间(predictioninterval)。

利用回归方程进行预测

【例9.8】沿用例9.3建立的线性回归方程,对于给定的食物脂肪含量观测值,计

算所含热量的点估计值以及95%置信区间和预测区间。

解:例9.3建立的线性回归方程为

yˆ69.96814.206x

基于此,SPSS软件输出的因变量点估计值及95%置信区间和预测区间如表9-17

所示。

利用回归方程进行预测

表9-17食物所含热量的点估计值、95%置信区间及预测区间

xyPRE_1LMCI_1UMCI_1LICI_1UICI_1

30.67521505.65577460.97220550.33935390.47475620.83680

14.68227278.50704251.77215305.24193169.03192387.98216

22.70494392.43655361.22528423.64781281.78308503.09002

2.40151104.0613661.47712146.64559-10.32161218.44433

11.01201226.37221197.15763255.58680116.26527336.47916

10.97224225.80399196.54831255.05966115.68613335.92184

40.10589639.61528574.87749704.35308515.27290763.95767

5.30127145.25781107.96526182.5503732.73767257.77795

23.70357406.64222374.07521439.20924295.59873517.68572

5.80206152.36065115.91810188.8032040.11936264.60194

23.60489405.22165372.79599437.64732294.21953516.22377

11.30197230.49186201.56700259.41672120.46143340.52228

3.8797124.9437085.11221164.7751811.55678238.33062

11.84219238.16292209.73809266.58775128.26289348.06296

7.58151177.64675144.04188211.2516266.29445288.99905

30.40505501.82024457.66700545.97348386.84391616.79657

其中,PRE_1是对给定的脂肪含量x,热量y的点估计值;LMCI_1和UMCI_1分

别是热量y的95%置信区间下限值和上限值;LICI_1和UICI_1分别是热量y的95%

预测区间下限值和上限值。

利用回归方程进行预测

图9-4更加直观地展示了预测的效果图。图中的实线即为例9.3拟合的回归直线,

靠近该直线两侧的带状区间为因变量的95%置信区间,外侧两条虚线构成的带状

区间则为因变量的95%预测区间。

图9-4例9.3拟合的回归直线及因变量的95%置信区间和预测区间

第9章相关和回归分析

•9.6引入虚拟变量的回归分析

引入虚拟变量的回归分析

•“量化”后的类别变量称为虚拟变量(dummyvariable,也称哑变量)。

•一般地,当类别变量的取值有k个水平(类别)时,需要选取一个水

平作为参照水平(如水平k),然后在模型中引入k-1个虚拟变量,分

别表示为

1,水平11,水平k1

,,

x1xk1

0,其他水平0,其他水平

•引入虚拟变量的回归方程拟合过程与前文类似,但虚拟变量xi的回归

系数的含义为,相对于参照水平,水平i可能引起的因变量的变化程度。

引入虚拟变量的回归分析

【例9.9】某就业服务机构认为,工资收入(月薪)与工龄、学历之间可能存在

密切关联,为验证该想法并进一步确定其影响关系,随机调查了20名就业者的基

本情况如表9-18所示(此处略)。试以月薪为因变量y,工龄、学历为自变量,

建立合适的线性回归方程。(显著性水平α=0.05)

解:如果只考虑工龄一个自变量,利用SPSS输出的回归分析结果如表9-19至表

9-21所示。

表9-19一元线性回归方程拟合优度

模型汇总

模型

RR方调整R方标准估计的误差

1.515a.265.225962.909

a.预测变量:(常量),工龄。

引入虚拟变量的回归分析

表9-20一元线性回归方程显著性检验

Anovab

模型平方和df均方FSig.

1回归6030448.66016030448.6606.504.020a

残差1.669E718927194.505

总计2.272E719

a.预测变量:(常量),工龄。

b.因变量:月薪

表9-21一元线性回归模型参数估计结果及显著性检验

系数a

模型

非标准化系数标准系数

B标准误差试用版tSig.

1(常量)554.9351882.851.295.772

工龄119.40746.821.5152.550.020

a.因变量:月薪

引入虚拟变量的回归分析

可以看到,虽然工龄对月薪的影响是显著的,但判定系数R2仅为0.265(调整

的判定系数更低),说明工龄只能解释月薪变化的26.5%,还有重要的影响

因素没有考虑进来,因此有必要将学历作为另一个自变量纳入到模型中。

n由于学历是类别变量,取值水平为2个,所以设定1个虚拟变量x2(工龄为自

变量x1):

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论