SPSS 数据分析与应用课件 第6章 线性回归分析_第1页
SPSS 数据分析与应用课件 第6章 线性回归分析_第2页
SPSS 数据分析与应用课件 第6章 线性回归分析_第3页
SPSS 数据分析与应用课件 第6章 线性回归分析_第4页
SPSS 数据分析与应用课件 第6章 线性回归分析_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第6章线性回归分析学习目标1.了解回归分析的基本原理2.理解一元线性回归分析模型原理3.掌握多元线性回归分析模型的原理、SPSS实现与解读方法4.掌握线性回归分析报告的撰写方法学习导读与引导案例回归分析:探究变量间数量关系的核心方法,广泛用于预测与决策本章系统讲解一元及多元线性回归的模型原理、参数解读与统计检验方法,并通过“空气质量指数影响因素分析”案例完整展示从建模、检验到结果解读的全过程。图6-1空气质量指数数据.sav(部分)引导案例天空是否湛蓝、呼吸是否顺畅,主观感受凝结为空气质量指数AQI——其背后是否存在客观的量化驱动因素?思考①成都市不同季度的AQI是否存在差异?如何量化对比?②哪些指标对2023–2024年AQI影响最大?回归分析三要素:因变量(核心诉求)×自变量(解释因素)×相关性(数量关系)。Part6.1回归分析概述6.1.1回归分析的基本思想用数学公式表达变量关系,衡量影响能力并预测趋势回归分析研究自变量与因变量之间的数量变化关系:建立回归模型衡量自变量对因变量的影响能力,进而预测因变量的发展趋势。概念源于高尔顿对父子身高关系的研究。因变量业务的核心诉求,所有分析围绕它进行。例:空气质量整体评价(AQI)自变量用来解释因变量,揭示对因变量的影响程度。例:各污染物浓度、季度相关性两个变量的关联程度;回归用公式刻画并可预测实践三步骤:确定因变量→选取相关自变量→构建模型预测因变量回归分析与相关性分析的区别与联系回归要分角色、能预测;相关只看密切程度对比项相关性分析回归分析变量角色不区分因变量和自变量必须确定自变量与因变量研究内容描述两变量相关关系的密切程度揭示自变量对因变量的影响程度,且可预测表达方式相关系数数学公式(回归方程)联系两者研究的都是变量间的关联关系,高度相似、互为补充分类:按自变量个数分一元/多元回归;按关系类型分线性/非线性回归。线性回归的因变量必须是连续型数据;0-1回归的因变量为两取值数据。6.1.2一元线性回归模型y=β₀+β₁x+ε:一个自变量如何线性影响因变量模型定义因变量y的变化由两部分引起:自变量x引起的线性变化(β₀+β₁x),以及其他因素引起的随机变化(ε)。β₀为截距,β₁为回归系数。参数含义β₀:x=0时y的期望(注意x=0是否在观测范围内);β₁:x每变动一个单位,y平均变动的幅度——β₁>0正相关,<0负相关,=0线性上无法解释。线性假设因变量与自变量呈线性关系,模型设定无误独立性假设各观测值相互独立,不存在系统关联同方差假设不同x取值下随机误差方差保持恒定正态性假设给定x条件下,ε服从正态分布参数估计最常用最小二乘法:使残差平方和最小,得到样本回归方程用于预测。6.1.3多元线性回归模型多个自变量共同解释因变量的线性变化模型:y=β₀+β₁x₁+β₂x₂+…+βpxp+ε。其中β₀为截距项,β₁…βp为各自变量的偏回归系数——控制其他变量不变时,该变量对y的独立影响。参数估计:最小二乘法寻找一组参数估计值,使因变量观测值与模型预测值之间的残差平方和最小。估计出参数后即得样本回归方程,可用于预测。为什么需要多元模型一元回归是在“其他因素不变”的理想条件下分析单个因素的影响;现实问题(如AQI)影响因素众多,必须纳入多个自变量才能得到可靠结论。偏回归系数的解读关键:“控制其他因素不变”——这是多元回归与简单相关的本质区别。6.1.4线性回归模型检验方程显著性是“入场券”,系数显著性揭示各变量贡献①回归方程显著性:F检验H0:所有偏回归系数均为0(模型无效)。基于回归平方和SSR与残差平方和SSE构造F统计量(SST=SSR+SSE);P<0.05则拒绝H0,模型整体显著。②回归系数显著性:t检验H0:某自变量系数为0(无显著影响)。t=系数估计值/标准误;P<0.05说明该自变量对因变量有显著线性影响。③拟合优度:R²决定系数衡量模型对观测值的拟合程度,越接近1拟合越好。例:AQI模型R²=0.65,表示自变量解释65%的变异。③调整的R²考虑模型复杂程度(自变量个数),用于不同模型间拟合优度比较(因变量须相同),纳入冗余变量不会虚增。Part6.2模型实现与结果解读6.2.1数据准备:创建虚变量定性自变量不能直接进模型,须先转为0-1虚变量若自变量全为定量变量可直接建模;若含定性变量(如“季度”),必须先创建虚变量(DummyVariable),每个类别生成一列0-1变量。步骤1-2打开数据文件;【转换(T)】→【创建虚变量】步骤3将“季度”选入【针对下列变量创建虚变量】,勾选【创建主效应虚变量】,设置根名称步骤4结果查看器出现变量创建表:如“类型_1”表示“一季度”步骤5数据视图新增4列虚变量:原“一季度”对应“季度_1”列为1,否则为0图6-2“创建虚变量”对话框图6-4“类型”虚变量(部分)6.2.2线性回归的SPSS实现【分析(A)】→【回归(R)】→【线性(L)】步骤1打开“空气质量指数数据.sav”;选择【分析】→【回归】→【线性】步骤2“AQI”放入【因变量(D)】;污染物浓度与季度虚变量放入【自变量(I)】注意某分类生成k个虚变量时,模型中只放k−1个,消失的一个为基准组步骤3单击【确定】,输出4张表:输入/除去的变量、模型摘要、ANOVA、系数图6-5分析对话框图6-6“线性回归”对话框6.2.2结果解读①:模型摘要与ANOVA先看模型整体是否有效,再看各变量贡献模型摘要(表6-2)R=0.933R²=0.870调整后R²=0.868自变量解释AQI86.8%的变化标准估算误差12.561ANOVA方差分析(表6-3)回归平方和759441.341(df=9)残差平方和113923.277(df=722)F=534.782,P=0.000<0.05回归方程整体显著有效解读顺序:①ANOVA的F检验P值<0.05,说明模型整体有效,至少一个自变量对AQI有显著影响;②调整后R²=0.868,拟合优度高,模型具备很强的解释能力。两步都通过后,才有意义继续解读单个系数。6.2.2结果解读②:系数表P<0.05才显著;定量看单位变化,定性看与基准组对比变量BBetat显著性(常量)-2.318—-0.8410.401PM₂.₅浓度0.8820.68714.2530.000PM₁₀浓度0.2620.2717.1520.000SO₂浓度0.8900.0050.1680.867CO浓度-0.032-0.011-0.4070.684NO₂浓度-4.416-0.125-7.2560.000O3_8h浓度0.4610.66432.5560.000季度=一季度-4.654-0.058-3.4320.001季度=三季度9.3390.1174.9760.000表6-4系数(因变量:AQI,四季度为基准组)定量变量解读PM₂.₅每多1μg/m³,AQI平均增加0.882;PM₁₀每多1,AQI增0.262。定性变量解读基准组为四季度:一季度AQI低4.654,三季度高9.339(二季度不显著)。SO₂、CO的P>0.05,影响不显著。Part6.3应用实例与报告撰写6.3应用实例:空气质量指数影响因素分析识别影响AQI的核心污染物及其作用机制背景介绍WHO于2021年更新《全球空气质量指南》,提出更严格污染控制目标。在“双碳”目标背景下,科学识别AQI关键驱动因子、明确污染物贡献与季节特征,有助于生态环境部门优化预警与精细化治理。数据说明(表6-5)成都市2023–2024年监测数据:每个样本为一个监测日的污染物浓度指标与AQI、日期、季度记录,共9个变量、732个样本。分析路径:描述分析(直方图+散点图)→创建季度虚变量→多元线性回归→系数业务解读→结论与治理建议。因变量AQI(18~253,无量纲)定量自变量PM₂.₅/PM₁₀/SO₂/CO/NO₂/O3_8h定性自变量季度(一~四季度,需虚变量化)6.3.3描述分析AQI右偏分布;PM₂.₅、CO、PM₁₀与AQI均呈正相关图6-7AQI直方图图6-8AQI×PM₂.₅散点图图6-10AQI×PM₁₀散点图AQI平均值77.33、中位数73,呈右偏分布;PM₂.₅、CO、PM₁₀浓度升高时AQI同步增加,观测范围内基本保持线性增长趋势——为线性回归建模提供了直观依据。6.3.4回归模型结果模型整体显著,调整后R²=0.868模型整体评价F检验P=0.000<0.05,模型整体显著;调整后R²=0.868,自变量解释AQI86.8%的变异,拟合效果优秀。显著影响因素季度(一、三季度)、PM₂.₅浓度、PM₁₀浓度、NO₂浓度、O3_8h浓度在5%水平下显著;SO₂、CO不显著。系数解读(控制其他因素不变):①季度:与四季度相比,一季度AQI低4.654,二季度低0.793(不显著),三季度高9.339;②污染物:PM₂.₅每多1μg/m³,AQI高0.882;PM₁₀每多1,AQI高0.262;NO₂每多1,AQI低4.416;O3_8h每多1,AQI高0.461。6.3.5结论与建议主要影响因素:季度、PM₂.₅、PM₁₀、NO₂、O3_8h核心结论影响AQI的主要因素有季度、PM₂.₅浓度、PM₁₀浓度、NO₂浓度、O3_8h浓度。这些因素并非独立作用,其相互间的平衡共同决定了空气质量水平;三季度AQI相对四季度显著偏高,臭氧与颗粒物是关键驱动。建议1精准治理颗粒物PM₂.₅与PM₁₀均为显著正向驱动,应持续推进扬尘、机动车与工业源管控建议2关注夏季臭氧三季度AQI显著偏高且O3_8h系数为正,夏季应强化臭氧前体物(VOCs/NOx)协同减排建议3数据驱动预警将回归模型嵌入空气质量预警系统,按季节与污染物贡献动态调整管控重点线性回归分析报告的撰写框架1标题与摘要点明因变量与核心发现,摘要概述方法、结果与建议2背景介绍业务场景与问题:为什么要研究这个因变量3数据说明来源、样本量、变量说明表(名称/类型/取值/含义)4数据分析描述分析(分布+散点)→建模(虚变量/回归)→F/t/R²检验与系数解读5结论与建议回答背景问题;建议具体可行并呼应系数证据系数解读务必写明“控制其他因素不变”,并区分定量变量与定性变量(基准组对比)两种读法。本章小结基本思想因变量×自变量×相关性;回归能预测模型原理一元/多元;最小二乘法估计;四大假设模型检验F检验→t检验→R²/调整R²SPSS实现虚变量准备→线性回归→系数业务解读回归分析的价值:用可检验的数学关系替代直觉判断——先说模型整体有效,再说每个变量贡献多少。本章习题(节选)单选1以下适合作为线性回归模型因变量的变量是()。A.是否购买

B.是否出险C.是否恋爱

D.房价单选2线性回归模型的自变量是()。A.定性变量

B.定量变量C.定性变量或定量变量

D.以上都不正确单选5线性回归模型的“线性”是指因变量对于回归系数是()。A.非线性的

B.线性的

C.指数关系

D.以上都不正确判断1“是否出险”可作线性回归因变量()判断2SPSS做线性回归不用设置虚变量()判断5线性回归模型研究的是变量之间的相关性。()本章实训:汽车燃油效率影响因素分析构建多元回归模型,量化各因素影响并预测实训背景汽车燃油效率是衡量节能环保水平

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论