有关多元线性回归的毕业论文_第1页
有关多元线性回归的毕业论文_第2页
有关多元线性回归的毕业论文_第3页
有关多元线性回归的毕业论文_第4页
有关多元线性回归的毕业论文_第5页
已阅读5页,还剩25页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、. .30/30摘 要许多现象往往不是简单的与某一因素有关而是要受多个因素的影响,此时就需要用两个或两个以上的影响因素作为自变量来解释因变量的变化,这就是多元回归亦称多重回归。当多个自变量与因变量之间是线性关系时,所进行的回归分析就是多元性回归。本文的研究主要从四个部分来进行。第一章从基础容和研究对象着手,对主要研究容进行了简单的阐述。第二章对多元线性回归的基础进行了详细分析。第三章介绍了中国经济的现状。最后通过多元线性回归模型对我国工业生产总值进行了分析。总的来说,本文在2007年全国各省市主要工业产品的产量与工业总产值的具体数据下,选用塑料、水泥、钢筋、平板玻璃、粗钢、盘条以与原煤等工业产

2、品的产量作为研究对象,建立多元线性回归模型,并对模型做出参数估计.在此基础上对模型做出一定的解释,对于预测工业总产值具有一定的理论指导和现实意义。关键词:多元线性回归模型 工业生产总值 假设检验 预测Abstract Many phenomena are often not simply associated with a number of factors but with varieties. At this point we need to use two or more factors as independent variables to explain changes in the

3、 dependent variable. This is also known as multiple regression. When more than one independent variable and the dependent variable are linear relationship, the regression analysis is carried out by diversity regression.The main research work of this thesis is divided into four parts. In the first ch

4、apter, the thesis proceed from the basic content and object of study and elaborate main content simply. In the second chapter, multiple linear regression model is analyzed detail. In the third chapter, the thesis introduces status quo of china. And at last, gross industrial production is analyzed by

5、 multiple linear regression model in this article.Over all, this article use the specific data of the output of major industrial products and industrial output in nationwide provinces in 2007, and select the output of plastics, cement, steel, plate glass, crude steel, wire rod and raw coal as study

6、object to establish multiple linear regression model, and then make the model parameter estimation. Based on this,we make some explanations to the model. All of these are of momentous current significance and far-reaching historical significance to the forecast of industrial production.Key Words:Mul

7、tiple linear regression modelGross industrial production Hypothetical test Prediction TOC o 1-3 h z u 目 录摘要1Abstract21 HYPERLINK l _Toc296777947绪论4HYPERLINK l _Toc2967779482 多元线性回归分析基础5HYPERLINK l _Toc2967779492.1 多元线性回归定义5HYPERLINK l _Toc2967779502.2多元线性回归模型6 2.2.1模型的建立与矩阵表示6 2.2.2模型的假设7HYPERLINK l

8、 _Toc2967779552.3多元线性回归参数估计7HYPERLINK l _Toc2967779562.3.1 最小二乘估计和正规方程组7HYPERLINK l _Toc2967779572.3.2 最小二乘估计的矩阵形式8HYPERLINK l _Toc2967779592.4 回归拟合度评价和决定系数9HYPERLINK l _Toc2967779602.4.1 离差分解和决定系数9HYPERLINK l _Toc2967779612.4.2 决定系数的性质与修正可决系数10HYPERLINK l _Toc2967779622.5统计检验11HYPERLINK l _Toc29677

9、79632.5.1回归参数的显著性检验(检验)11HYPERLINK l _Toc2967779642.5.2回归方程的显著性检验(F检验)12HYPERLINK l _Toc2967779652.5.3 多重共线性检验12 2.5.4 异方差检验13HYPERLINK l _Toc2967779513中国经济现状15HYPERLINK l _Toc2967779523.1中国经济现状15HYPERLINK l _Toc2967779553.2 工业生产总值的概述15HYPERLINK l _Toc2967779674工业生产总值的多因素模型分析 PAGEREF _Toc296777967 h

10、 16HYPERLINK l _Toc2967779684.1建立多因素分析模型 PAGEREF _Toc296777968 h 16HYPERLINK l _Toc2967779694.2数据收集 PAGEREF _Toc296777969 h 16HYPERLINK l _Toc2967779754.3统计检验19HYPERLINK l _Toc2967779764.4计量经济学检验与模型修正20HYPERLINK l _Toc2967779774.4.1 异方差检验21HYPERLINK l _Toc2967779784.4.2 自相关检验215 结论26致 27HYPERLINK l

11、_Toc296777980参考文献281绪 论在各个方面,变量之间的关系一般来说可分为确定性的与非确定性的两种。确定性关系是指变量之间的关系可以用函数关系来表达的。另一种非确定性的即所谓的相关关系。例如人的身高与体重之间存在着关系,一般来说,人高一些,体重也要重一些,但同样高度的人,体重往往不一样。人的血压与年龄之间也存在着关系,但同年龄的人的血压往往不一样。气象中的温度与湿度之间的关系也是这样的。这是因为我们涉与的变量(如体重、血压、适度)是随机变量,上面所说的变量关系是非确定性的。此时 ,便可以用到回归分析。回归分析能帮助我们从一个变量取得的值去估计另一个变量所取的值。工业生产总值从数值上

12、反应一个地区的工业生产规模,是衡量一个地区的经济繁荣程度的重要指标。研究研究工业总产值与格工业产出指标之间的关系具有非常重要的现实意义,对于做好一个地区的的工业产值预测以与制定国民经济发展规划都有的非常重要的作用。工业总产值 是指以货币表现的工业企业在一定时期生产的已出售或可供出售的工业的产品的总量。它是反映一定时间工业生产总规模和,总水平的重要指标,是计算工业生产发展速度和主要比例关系,计算工业产品销售率和其他经济指标的重要依据。工业总产值包括成品价值、工业性作业价值和自制半成品、在产品期末期初差额价值。工业,总产值采用“工厂法”计算,即以工业企业作为一个整体,按企业工业生产活动的最终成果来

13、计算。但各企业之间、行业之间、地区之间存在着重复计算。其计算公式为:报告期工业总产值=报告期全部产品的成品价值+报告期工业性作业价值+(报告期自制半成品和在产品期末余额- 报告期自制半成品和在产品期初余额) 计算工业总产值采用的价格有不变价格和现行价格。即,工业生产总值收多个因素影响,此时便需要多个影响因素来分析工业生产总值的变化。而这些变量之间的关系是线性的,这样在分析工业生产总值是用到的回归分析方法便是多元线性回归。2 多元线性回归分析基础2.1多元线性回归定义在客观世界中普遍存在着变量之间的关系。变量之间的关系一般来说可分为确定性的与非确定性的两种。确定性关系是指变量之间的关系可以用函数

14、关系来表达的。另一种非确定性的即所谓的相关关系。例如人的身高与体重之间存在着关系,一般来说,人高一些,体重也要重一些,但同样高度的人,体重往往不一样。人的血压与年龄之间也存在着关系,但同年龄的人的血压往往不一样。气象中的温度与湿度之间的关系也是这样的。这是因为我们涉与的变量(如体重、血压、适度)是随机变量,上面所说的变量关系是非确定性的。此时 ,便可以用到回归分析。回归分析能帮助我们从一个变量取得的值去估计另一个变量所取的值。在回归分析中,如果有两个或两个以上的自变量,就称为多元回归。事实上,一种现象常常是与多个因素相联系的,由多个自变量的最优组合共同来预测或估计因变量,比只用一个自变量进行预

15、测或估计更有效,更符合实际。因此多元线性回归比一元线性回归的实用意义更大。在研究问题是,我们考虑一个变量受其他变量的影响时,把这变量称为因变量,记为,其他变量称为自变量,记为,这时相关系数可记作其中为当时,因变量的均值,即.称为对的回归函数,为与的偏差,它是随机变量,并假定。回归函数可以是一元函数,也可以是多元函数,即其中 为元回归函数,统称为多元回归函数。2.2多元线性回归模型2.2.1 模型的建立与矩阵表示多元线性回归模型的一般形式是: (2.1)其中是回归系数,Y是被解释变量,,,是k个对Y有显著影响的解释变量(k2),是 反映各种误差扰动综合影响的随机项,下标i表示第i期观察值(,),

16、。假设多元样本回归函数为:回归残差为:。由于有n期的观察值,这一模型实际上包含个方程写成矩阵形式: (2.2)其中2.2.2 模型的假设因为多元线性模型的建立或选择过程包含相当的主观性,所依据的理论和经验也可能不正确,因此并不能保证模型符合变量的实际关系。而如果模型本身有问题,那么分析的有效性和价值就很难有保证,为了保证所分析的变量关系符合多元线性回归分析的基本规定性,明确分析对象,保证回归分析的有效性和性质,也为了检验判断的依据,需要对多元线性回归模型作一些架设,共包括下列六条:(1)变量和,(=1,2.n)之间,存在线性随机函数关系,其中是随机误差项。(2)对应每组观测数据的误差项,都为零

17、均值的随机变量,即的数学期望E()=0对=1,2.n都成立。(3)误差项的方差为常数,即 对=1,2.n 都成立(假设(2)成立为前提)。(4)对应不同观测数据的误差项不相关,即对任意的都成立(假设(1)成立为前提)。(5)解释变量是确定性变量而非随机变量。当存在多个解释变量(r1)时假设不同解释变量之间不存在线性关系,包括严格的线性关系和强的近似线性关系。(6)误差项服从正态分布7。2.3 多元线性回归参数估计2.3.1 最小二乘估计和正规方程组这里直接根据回归残差平方和最小的准则,推导多元线性回归模型参数的最小二乘估计量。对于多元线性回归模型,如果用,分别表示模型参数,,的估计,那么样本回

18、归方程就是回归残差平方和为: (2.3)当V对,的一阶偏导数都等于0,即下列方程组:,同时成立时,有最小值。对这个方程组整理,可得到如下的正规方程组:其中,上述正规方程组有K+1个方程,未知数也是K+1个。只要系数矩阵非奇异即满足解释变量矩阵列满秩:。此时,有,可逆。可以解出,的唯一的一组解,就是,的最小二乘估计8。 2.3.2 最小二乘估计的矩阵形式 引进参数估计量,解释变量回归值和回归残差的下列向量表示:, , (2.4)把样本数据分别带入样本回归方程,得到回归方程组为:, (2.5)写成等价的向量方程,则为:这样回归残差向量为:在利用向量,矩阵的运算法则,可以得到残差平方和为=求对,的偏

19、导数,等价于对向量求梯度,因此最小二乘估计的正规方程组为:整理得到矩阵 形式:当可逆,也就是是满秩矩阵,在上述向量方程两端左乘的逆矩阵,得到:(2.6)这就是多元线性回归模型最小二乘估计的矩阵一般形式。2.3.3 最小二乘估计量的性质(1)线性性: 多元线性回归模型参数的最小二乘估计向量为:,各个参数的最小二乘估计向量为,其中的是矩阵的+1行元素构成的行向量,上式对=1,K都成立,正是被解释变量观测值的线性组合,也就是多元线性回归参数的最小二乘估计是线性估计。(2)无偏性:多元线性回归的最小二乘估计也是无偏估计,即参数最小二乘估计量的数学期望都等于相应参数的真实值,最小二乘估计向量的数学期望等

20、于参数真实值的向量,参数真实值是参数估计量的概率分布中心。(3)最小方差性:根据最小二乘估计公式和模型假设,可以直接导出包含各个参数估计量方差和不同参数估计量协方差的,参数估计向量的协方差矩阵为:(2.7)2.4 回归拟合度评价和决定系数2.4.1 离差分解和决定系数判断回归结果好坏基本标准,是回归直线对样本数据的逆合程度,称为“拟合度”。回归直线的逆合度一方面取决于回归直线的选择,这就是由参数估计方法决定的,另一方面则取决于样本数据的分布。当参数估计方法固定时,主要取决于样本数据的分布。样本数据的分布在本质上是由变量关系决定的。因此回归拟合度也是检验模型变量关系真实性,判断模型假设是否成立的

21、重要方法。拟合度较好是对模型的支持,否则,可能意味着必须对模型进行修改。首先需要从Y的离差中分离出由解释变量决定的部分,因变量的实际观测值与其样本均值的离差即总离差()可以分解为两部分:一部分是因变量的理论回归值与其样本均值的离差(), 它可以看成是能够由回归直线解释的部分,称为可解释离差;另一部分是实际观测值与理论回归值的离差(),它是不能由回归直线加以解释的残差。 对任一实际观测值Y总有: (2.8)对公式(2.8)两边平方并求和并计算,可得到:根据最小二乘估计和回归残差的相关公式,所有的离差的平方和记为=称为“总离差平方和”,而记为称为“残差平方和”,记为称为“回归平方和”。式(2.9)

22、两边同除以,得: (2.10)显而易见,各个样本观测点与样本回归直线靠的越近,在中所占的比重就越大。(2.10)式中的正是反映解释变量(或回归直线)对被解释变量决定程度的指标,我们称它为“决定系数”(determined coefficient),通常用表示。计算公式为:2.4.2 决定系数的性质与修正可决系数决定系数是对回归模型拟合程度的综合度量,决定系数越大,模型拟合程度越高。决定系数越小,则模型对样本的拟合程度越差。决定系数具有如下性质:(1) 决定系数具有非负性。由决定系数的定义式可知,的分子分母均是不可能为负值的平方和,因此其比值必大于零。(2) 判定系数的取值围为01。由的计算公式

23、可以看出:当所有的观测值都位于回归直线上时,=0,这时=1,说明总离差可以完全由所估计的样本回归直线来解释;当观测值并不是全部位于回归直线上时,0,则0,这时10, 模型总体显著性检验得知模型总体显著,也就是全体解释变量总体对被解释变量存在明显影响。对t检验由上述分析结果知,除粗钢和原煤外其余预测变量都是显著的。故我们对上述模型进行计量经济学的检验,并进行修正,看是否能使模型方程得到改进。其中我们看到平板玻璃和盘条产量的系数是负值,一般来说,平板玻璃和盘条产量等经济发展量应该与工业总产值成正比关系,但由于在研究具体某个地区的经济发展关系时,由于政策领导或其它的因为地区的特殊性的原因,造成了平板

24、玻璃和盘条产量的系数是可能成为负值的。比如工业总产值在下降,但是因为政策或其它原因平板玻璃和盘条产量却在上升,或工业总产值在上升,但是平板玻璃和盘条产量却在下降。4.4 计量经济学检验与模型修正4.4.1 异方差检验 计算残差绝对值与个自变量的斯皮尔曼相关系数,结果如下表:Correlations塑料制品x1水 泥x2平板玻璃x3生铁 x4粗 钢x5钢筋 x6盘 条x7abs_1Spearmans rho塑料制品x1Correlation Coefficient10.7350.7380.6150.6850.5920.7110.590Sig. 1-tailed00000000N313131313

25、1313131水泥x2Correlation Coefficient0.73510.8550.5470.6040.7820.7600.470Sig. 1-tailed00.00200.0010000.004N3131313131313131平板玻璃x3Correlation Coefficient0.7380.85510.6650.7170.6650.6900.287Sig. 1-tailed00000000.059N3131313131313131生铁x4Correlation Coefficient0.6150.5470.66510.9860.7000.7540.489Sig. 1-tai

26、led00.0010.0000.003N3131313131313131粗钢x5Correlation Coefficient0.6850.6040.7170.98610.7200.7880.513Sig. 1-tailed0000.000.002N3131313131313131钢筋x6Correlation Coefficient0.5920.7820.6650.700.72010.8580.416Sig. 1-tailed00000000.01N3131313131313131盘条x7Correlation Coefficient0.7110.7600.6900.7540.7880.85

27、810.547Sig. 1-tailed00000000.001N3131313131313131abs_1Correlation Coefficient0.5900.4700.2870.4890.5130.4160.5471Sig. 1-tailed00.0040.0590.0030.0020.010.0010.001N3131313131313131Correlation is significant at the 0.01 level 1-tailed.表4.6Correlations残差绝对值与各自变量的相关系数分别为0.59,0.47,0.287,0.489,0.513,0.416,

28、0.547说明存在异方差,需采用加权最小二乘估计;加权估计,得到最优权重为3.000,对其进行加权分析。表4.7 Variables Entered/Removed(b,c)ModelVariables EnteredVariables RemovedMethod1盘条x7, 塑料制品x1, 钢筋x6, 生铁x4, 平板玻璃x3, 粗钢x5, 水泥x20.536Entera All requested variables entered.b Dependent Variable: 工业总产值yc Weighted Least Squares Regression - Weighted by W

29、eight for 工业总产值y from WLS, MOD_4 abs_1* -3.000表4.8 Model Summary(b,c)ModelRR SquareAdjusted R SquareStd. Error of the EstimateDurbin-Watson11.000(a)1.0001.0000.085921.581a Predictors: (Constant), 盘条x7, 塑料制品x1, 钢筋x6, 生铁x4, 平板玻璃x3, 粗钢x5, 水泥x2b Dependent Variable: 工业总产值yc Weighted Least Squares Regress

30、ion - Weighted by Weight for 工业总产值y from WLS, MOD_4 abs_1* -3.000表4.9 ANOVA(b,c)ModelSum of SquaresdfMean SquareFSig.1Regression2587.0987369.58550065.4390.000(a)Residual0.170230.007Total2587.26830a Predictors: (Constant), 盘条x7, 塑料制品x1, 钢筋x6, 生铁x4, 平板玻璃x3, 粗钢x5, 水泥x2 b Dependent Variable: 工业总产值yc Wei

31、ghted Least Squares Regression - Weighted by Weight for 工业总产值y from WLS, MOD_4 abs_1* -3.000表4.10 Coefficients(a,b)ModelUnstandardized CoefficientsStandardized CoefficientstSig.Collinearity StatisticsBStd. ErrorBetaToleranceVIF1(Constant)-13.0133.486-3.7330.001塑料制品x10.8410.0950.2648.8230.0000.003314

32、.686水泥x20.0200.0100.2602.1030.0470.0005366.476平板玻璃x3-0.0170.019-0.084-0.8660.3950.0003333.757生铁x4-0.0080.019-0.038-0.4400.6640.0002602.303粗钢x50.0800.0210.3703.8360.0010.0003255.656钢筋x60.4050.0550.3937.4080.0000.001984.360盘条x7-0.2170.104-0.163-2.0900.0480.0002131.465由上表所知,方程的决定系数较高,=1.000,修正可决系数=1.00

33、0,又回归模型拟合程度与决定系数有关,决定系数越大,模型拟合程度越高,可见本模型拟合程度较好,又=50065.43910, 模型总体显著性检验得知模型总体显著,也就是全体解释变量总体对被解释变量存在明显影响。但是值为1.581,要比原来多元线性回归的值要小,自相关性比较严重,需要进一步讨论4.4.2 自相关检验自相关(Autocorrelation)是对随机扰动项之间相互独立假定的违背,指扰动项序列相邻期之间不是随机独立而是存在相关关系,又称为序列相关。自相关主要表现在时间序列中。因此对于线性回归模型:自相关可表示为:用于检验扰动项是否存在自相关的方法主要有:D-W 检验(Durbin-Wat

34、son 杜宾-瓦特森检验),D-W 检验是Durbin 和Watson 于1951 年提出的一种自相关检验方法。它只适用于扰动项的形式为:(为自相关系数)的一阶自相关问题。这种方法是最常用的一阶自相关检验方法。其检验步骤如下:(1)提出假设。:,即扰动项不存在一阶自相关;:,即扰动项存在一阶自相关。(2)构造统计量。定义DW 统计量为,对于大样本可以把统计量写为,其中为自相关系数的估计。因为|1,所以检验统计的值域为0DW4。(3)判断。根据样本容量n 和解释变量的数目p 查分布表,得下临界值和上临界值,并依下列准则判断扰动项的自相关情形。 = 1 * GB3 如果0,则拒绝零假设,扰动项存在

35、一阶正自相关。越接近于0,正自相关性越强。 = 2 * GB3 如果,则无法判断是否有自相关。 = 3 * GB3 如果4-,则接受零假设,扰动项不存在一阶正自相关。越接近2,判断无自相关性把握越大。 = 4 * GB3 如果4-4-,则无法判断是否有自相关。 = 5 * GB3 如果4-4,则拒绝零假设,扰动项存在一阶负自相关。越接近于4,负自相关性越强。由上图4.3得知Durbin-Watson Statistics=1.955873,查表得在显著水平=0.05下,查表 n=30,k=3时,=1.21,=1.55,由于=1.21DW=1.95587310, 模型总体显著性检验得知模型总体显

36、著,也就是全体解释变量总体对被解释变量存在明显影响,并且值为1.867,与原来的线性回归结果相比自相关性得到了进一步的优化。此时的多元线性回归方程为:由表可知,值为1.867,可以看出自相关性得到了进一步改善,下面再次迭代:,来改善自相关性。.进行迭代计算,得到如下结果:表4.15 Variables Entered/Removed(b)ModelVariables EnteredVariables RemovedMethod1X72, X12, X42, X32, X22, X62, X52(a).Entera All requested variables entered. b Depen

37、dent Variable: Y22表4.16 Model Summary(b)ModelRR SquareAdjusted R SquareStd. Error of the EstimateDurbin-Watson10.994(a)0.9880.984243.399802.072a Predictors: (Constant), X72, X12, X42, X32, X22, X62, X52 b Dependent Variable: Y22表4.17 ANOVA(b)ModelSum of SquaresdfMean SquareFSig.1Regression112177062.

38、223716025294.603270.499.000(a)Residual1362599.6612359243.464Total113539661.88530a Predictors: (Constant), X72, X12, X42, X32, X22, X62, X52b Dependent Variable: Y22表4.18 Coefficients(a)ModelUnstandardized CoefficientsStandardized CoefficientstSig.Collinearity Statistics BStd. ErrorBetaToleranceVIF1(

39、Constant)-1.45945.400-0.0320.975X121.1200.4530.3612.4720.0210.02440.909X220.0320.0240.4141.3650.1850.006176.467X32-0.0600.051-0.308-1.1750.2520.008131.958X420.1290.1510.5870.8570.4000.001898.594X52-0.1120.170-0.521-0.6590.5170.0011198.068X620.5500.3270.5341.6820.1060.005193.112X72-0.0820.422-0.061-0

40、.1950.8470.005187.968a Dependent Variable: Y22由上表可知方程的决定系=0.988,修正可决系数=0.984,与上次迭代相比基本稳定,且均接近于1,可见本模型拟合程度较好,又F=270.49910, 模型总体显著性检验得知模型总体显著,也就是全体解释变量总体对被解释变量存在明显影响,并且值为2.072,自相关性的影响基本消除。此时的多元线性回归方程为:5 结 论在本文中,我们通过一系列主要工业产品产量的分析,探索通过个工业产品产量来预测工业总产值的方法。我们在本文中选取了工业总产值,塑料制品产量,水泥产量,平板玻璃产量,生铁产量,粗钢产量,钢筋产量,盘条产量。在通过对模型的异方差性和自相关性的检验以与修正之后我们得到的最终的线性回归方程为: 通过以上线性回归方程我们可以知道,工业总产值与塑料制品产量有较大关系,塑料产量每增加一个单位,工业总产值就会增加1.120个单位,水泥产量每增加1个单位总也总产值就会

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论