中职数学基础模块下册《一元线性回归》课件_第1页
中职数学基础模块下册《一元线性回归》课件_第2页
中职数学基础模块下册《一元线性回归》课件_第3页
中职数学基础模块下册《一元线性回归》课件_第4页
中职数学基础模块下册《一元线性回归》课件_第5页
已阅读5页,还剩99页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

线性回归分析

双变量模型1线性回归分析

双变量模型1回归分析的含义

回归分析是研究一个叫做因变量的变量对另一个或多个叫做解释变量的变量的统计依赖关系。其用意在于,通过解释变量的已知值或给定值去估计或预测因变量的总体均值。

双变量回归分析:只考虑一个解释变量。(一元回归分析,简单回归分析)复回归分析:考虑两个以上解释变量。(多元回归分析)2回归分析的含义回归分析是研究一个叫做因变量的变量对另术语与符号自变量(independentvariable)解释变量(explanatoryvariable)控制变量(controlvariable)预测变量(predictorvariable)回归元(regressor)因变量(dependentvariable)被解释变量(explainedvariable)响应变量(responsevariable)被预测变量(predictedvariable)回归子(regressand)XY3术语与符号自变量因变量XY3统计关系与确定性关系

统计(依赖)关系:非确定性的关系。在统计依赖关系中,主要处理的是随机变量,也就是有着概率分布的变量。特别地,因变量的内在随机性是注定存在的。例如:农作物收成对气温、降雨、阳光以及施肥的依赖关系便是统计性质的。

这些解释变量固然重要,但是并不能使我们准确地预测农作物的收成。

确定性关系:函数关系。例如物理学中的各种定律。4统计关系与确定性关系统计(依赖)关系:非确定性的关系回归与因果关系回归分析研究因变量对于解释变量的统计依赖关系,但并不一定意味着因果关系。一个统计关系式,不管多强和多么具有启发性,都永远不能确立因果联系。因果关系的确立必须来自于统计关系以外,最终来自于这种或那种理论(先验的或是理论上的)。5回归与因果关系回归分析研究因变量对于解释变量的统计依赖关系,回归分析与相关分析(一)相关分析:用相关系数测度变量之间的线性关联程度。例如:测度统计学成绩和高等数学成绩的的相关系数。假设测得0.90,说明两者存在较强的线性相关。回归分析:感兴趣的是,如何从给定的解释变量去预测因变量的平均取值。例如:给定一个学生的高数成绩为80分,他的统计学成绩平均来说应该是多少分。6回归分析与相关分析(一)相关分析:用相关系数测度变量之间的线回归分析与相关分析(二)在相关分析中,对称地对待任何两个变量,没有因变量和解释变量的区分。而且,两个变量都被当作随机变量来处理。在回归分析中,因变量和解释变量的处理方法是不对称的。因变量被当作是统计的,随机的。而解释变量被当作是(在重复抽样中)取固定的数值,是非随机的。

(把解释变量假定为非随机,主要是为了研究的便利,在高级计量经济学中,一般不需要这个假定。)7回归分析与相关分析(二)在相关分析中,对称地对待任何两个变量双变量回归模型

(一元线性回归模型)8双变量回归模型

(一元线性回归模型)8双变量回归模型

(最简单的回归模型)模型特点因变量(Y)仅依赖于唯一的一个解释变量(X)。回归分析的内容与目的1、通过样本数据去估计出因变量与解释变量的统计依赖关系式(总体回归函数);2、给定解释变量的取值,去估计因变量的均值;3、假设检验;4、根据样本外解释变量的取值,预测因变量的均值。9双变量回归模型

(最简单的回归模型)模型特点9总体回归函数

(Populationregressionfunction,PRF)

以函数形式(方程、模型)揭示出来的因变量与解释变量的统计依赖关系式。回归分析的最终目的估计出总体回归函数10总体回归函数

(Populationregression估计总体回归函数的首要任务设定总体回归函数的合理形式11估计总体回归函数的首要任务设定总体回归函数的合理形式11假想例子对每周博彩支出和每周个人可支配收入作回归分析。

因变量:每周博彩支出解释变量:每周个人可支配收入12假想例子对每周博彩支出和每周个人可支配收入作回归分析

在一个假想的经济社会中,共有100个人参与博彩。个人可支配收入分为10档,每档收入对应的博彩支出有10种情况。例子说明13在一个假想的经济社会中,共有100个人参与博彩。个人可支1414****************************************************************************************************150175200225250275300325350375每周个人可支配收入(X)总体回归曲线每周个人博彩支出Y条件均值15150175200225250“线性”一词的含义线性的含义对变量为线性对参数为线性

从现在起,线性回归总是指对参数为线性的一种回归,也即参数总是以它的一次方出现。对于解释变量以什么方式进入模型则没有特别限制。16“线性”一词的含义线性的含义从现在起,线性回归总是指对********************(线性)总体回归函数(曲线)XY相同的X对应着不同的Y。Y的所有条件期望落在一条曲线上。该形式的总体回归函数体现了因变量的条件均值与解释变量的固定取值之间的确定关系。********************************************************************************17(线性)总体回归函数(曲线)XY相同的X对应着不同的Y。17总体回归函数斜率度量了解释变量X每变动一个单位,因变量Y的条件均值变化多少个单位。

截距项度量了解释变量为零时因变量的条件均值。一般来说,不解释其经济意义。该形式的总体回归函数称为

确定(非随机)总体回归函数18总体回归函数斜率度量了解释变量X每变动一个单位,因变量Y的条********************XY虽然Y的所有条件期望都落在一条直线上,但是相同的X却对应着不同的Y。总体回归函数的确定形式不能完全体现因变量的个别值与解释变量的固定值之间的统计依赖关系。********************************************************************************19XY虽然Y的所有条件期望都落在一条直线上,但是相同的X却对应每周个人可支配收入(X)总体回归函数(PRF)的随机设定每周个人博彩支出收入Y随机干扰项

(随机误差项)20每周个人可支配收入(X)总体回归函数(PRF)的随机设定每总体回归模型的随机形式随机总体回归函数21总体回归模型的随机形式随机总体回归函数21引入随机干扰项的意义1、理论的不完全性

与因变量相关的因素很多,随机干扰项替代了未纳入模型的全部变量。2、人类行为的内在随机性

随机因素永远存在3、节省原则模型是现实的简化,若无充分理由,宁简勿繁。4、度量误差22引入随机干扰项的意义1、理论的不完全性22总体回归函数23总体回归函数23总体回归函数的参数通常是永远不得而知的。

一则,实践中不能获得整个总体数据;

二则,收集所有总体数据会浪费大量人力、财力,不经济。

通常,我们仅有来自总体的一个或少数几个样本。因此,总体回归函数必须从已掌握的样本数据去估计。24总体回归函数的参数通常是永远不得而知的。

一样本回归函数(曲线)假设仅从总体中得到两组样本,样本容量均为10,对应每个X值均仅随机抽取一个Y值。SRF1SRF2样本1样本2YX25样本回归函数(曲线)假设仅从总体中得到两组样本,样本样本回归函数的特点由于抽样的随机性,样本回归函数与总体回归函数总是不可避免存在差异。因此,样本回归函数过高或者过低估计总体回归函数自然是不可避免的。可以说,任何SRF都仅仅是PRF的近似或者是估计。26样本回归函数的特点由于抽样的随机性,样本回归函数与总体回归函样本和总体回归曲线(函数)YX27样本和总体回归曲线(函数)YX27

既然样本回归函数只是总体回归函数的一个近似,那么能不能设计一种规则或方法去构造SRF,以使得这种近似是一种尽可能“接近”的近似呢?28既然样本回归函数只是总体回归函数的一个近似,那么能不能设设定样本回归函数的形式样本回归函数的形式应该与总体回归函数一致。原因很简单,构造样本回归函数是为了估计总体回归函数,所以形式上应该一致。对应于总体回归函数的两种形式,样本回归函数也应该有两种形式。

1、确定样本回归函数

样本回归函数的非随机形式

2、随机样本回归函数

样本回归函数的随机形式29设定样本回归函数的形式样本回归函数的形式应该与总体回归函数一样本回归函数的非随机形式30样本回归函数的非随机形式30样本回归函数的随机形式31样本回归函数的随机形式31样本和总体回归曲线(函数)YX32样本和总体回归曲线(函数)YX32样本回归函数形式

也就是说,如何构造SRF以使得尽可能接近真实的,尽可能接近真实的?

如何确定样本回归函数的参数?33样本回归函数形式也就是说,如何构造SRF以使得普通最小二乘法

Methodofordinaryleastsquares

(OLS)34普通最小二乘法

Methodofordinarylea样本YX35样本YX35样本YX最小二乘原理:构造合适的估计量,使得残差平方和(residualsumofsquares,RSS)最小。36样本YX最小二乘原理:构造合适的估计量,使得残差平方和(re样本YX37样本YX37最小二乘估计量的推导一阶条件38最小二乘估计量的推导一阶条件38解方程正规方程组惯例:小写字母表示对均值的离差39解方程正规方程组惯例:小写字母表示对均值的离差39最小二乘估计量的特点OLS估计量是可观测样本值的函数,因而容易计算。OLS估计量是点估计量。对于给定的样本,只能获得总体参数的一个估计值。一旦计算出OLS估计值,便容易画出样本回归线。40最小二乘估计量的特点OLS估计量是可观测样本值的函数,因而容最小二乘估计量的数值性质1、样本回归曲线经过Y和X的样本均值所决定的点。2、估计的Y的均值等于实测的Y的均值。3、残差均值等于零。4、残差和样本X不相关。5、残差和预测的Y值不相关。41最小二乘估计量的数值性质1、样本回归曲线经过Y和X的样本均值单纯的最小二乘估计量只能提供总体参数的一个点估计值,却不能对总体参数做出任何统计推断。要对总体参数从而对因变量做统计推断,还需要对回归模型进行一系列详细的假定。42单纯的最小二乘估计量只能提供总体参数的一个点估43434444经典线性回归模型基本假定45经典线性回归模型基本假定45经典线性回归模型的基本假定

(又称“古典、高斯或标准线性回归模型”)

Classicallinearregressionmodel,CLRM46经典线性回归模型的基本假定

(又称“古典、高斯或标准线性回归此假定意味着,我们所进行的回归分析是条件回归分析!47此假定意味着,我们所进行的回归分析是条件回归分析!4748484949505051515252535354545555假定的总结假定的真实性假定的意义假定的检验56假定的总结假定的真实性56经典线性回归模型基本假定之下

最小二乘估计量的统计性质57经典线性回归模型基本假定之下

最小二乘估计量的统计性质57最小二乘估计量的精度(标准差)58最小二乘估计量的精度(标准差)58影响回归系数估计精度的因素(一)59影响回归系数估计精度的因素(一)59影响回归系数估计精度的因素(二)60影响回归系数估计精度的因素(二)60最小二乘估计量的优良性质高斯—马尔可夫定理

在经典线性回归模型的假定条件下,最小二乘估计量,在所有无偏线性估计量中,具有最小方差,也就是说,它们是BLUE。最优线性无偏估计量Bestlinearunbiasedestimator(BLUE)

同时满足“线性”、“无偏”、“方差最小”三个优良性质的估计量

61最小二乘估计量的优良性质高斯—马尔可夫定理最优线性无偏估计量一、线性62一、线性626363二、无偏性64二、无偏性646565三、最小方差性66三、最小方差性66四、一致性一致性的一个充分条件:估计量无偏,而且随着样本容量趋于无穷,其方差趋于零。67四、一致性一致性的一个充分条件:67至此,虽然已经在经典线性回归模型的基本假定之下推导出了最小二乘估计量的若干统计性质,但疑问仍然存在!68至此,虽然已经在经典线性回归模型的基本假定之下推导出了最小二6969经典正态线性回归模型在经典线性回归模型基本假定的基础上增补正态假定随机干扰项正态性假定的依据?

中心极限定理

独立随机变量,随着变量个数的无限增加,其和的分布一般来说近似服从正态分布。70经典正态线性回归模型在经典线性回归模型基本假定的基础上增正态性假定下OLS估计量的概率分布71正态性假定下OLS估计量的概率分布7172727373自由度(df)

degreesoffreedom自由度取值的一般规律74自由度(df)

degreesoffreedom自由度取75757676知道了统计量的概率分布,从而可以很方便地进行区间估计和假设检验。77知道了统计量的概率分布,从而可以很方便地进行区间估计和假回归系数显著性检验(t检验)一、设计检验方案78回归系数显著性检验(t检验)一、设计检验方案787979二、构造检验统计量(随机变量)80二、构造检验统计量(随机变量)80三、计算检验统计值81三、计算检验统计值81四、选择一定的显著性水平,根据检验方案确定拒绝域和非拒绝域。五、察看检验统计值落入哪个区域。如果落入拒绝域,那么表明在该显著性水平下,检验是统计上显著的,说明总体参数显著异于假设值。六、也可以根据检验方案直接计算出获得该统计值的单侧或双侧P值。如果该P值小于给定的显著性水平,那么拒绝原假设。陈述同上。82四、选择一定的显著性水平,根据检验方案确定拒绝域和非拒绝域。例题做钟表年代对钟表价格的回归分析,检验钟表年代对钟表价格是否存在显著影响。回归结果如下:83例题做钟表年代对钟表价格的回归分析,检验钟表年代对钟表价检验方案原假设:钟表价格的总体回归系数等于零(表明钟表年代不影响钟表价格)备选假设:钟表价格的总体回归系数不等于零(表明钟表年代影响钟表价格)84检验方案84VariableCoefficientStd.Errort-StatisticProb.AGE10.485621.7937295.8457110.0000C-191.6662264.4393-0.7248020.474285VariableCoefficientStd.Errort86860P值检验870P值检验8788888989统计显著统计不显著90统计显著统计不显著90检验结果陈述在0.01的显

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论