版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
DescriptiveStatistics第一章描述性统计第1章描述性统计本章探讨用于总结和解释数据的方法与技术。我们先从数值描述性度量入手,这些通常被称为点估计量的度量,通过使用单一值(或点)来估计未知的总体参数,从而支持对总体的推断。本章还介绍了常用的数据图形表示方法。相对于图形方法,数值方法提供了精确且客观确定的值,这些值易于操作、解释和比较。它们允许对数据进行比图形摘要所传达的一般印象更细致的分析,这在数据代表需要进行总体推断的样本时尤为重要。尽管本章集中讨论统计分析的一些基本和基础问题,但有众多全面的统计学入门教材可以为感兴趣的读者提供更详细的信息。例如,Aczel(1993)和Keller与Warrack(1997)详细描述了描述性统计和图形技术的示例。Tukey(1977)的著作是探索性数据分析和图形技术的经典参考文献。对于对估计量性质感兴趣的读者(第1.6节),Gujarati(1992)和Baltagi(1998)是优秀的、数学严谨的资料来源。•1.1相对位置指标•1.2集中趋势指标•
1.3离散程度指标•1.4偏度和峰度•1.5关联度量•1.6估计量性质章节目录1.1相对位置指标1.1相对位置指标一组数值观测值可以按从小到大的顺序排列。这种排序允许定义数据的边界,并支持比较特定观测值的相对位置。以在北京市某路段测量车辆行驶速度为例,驾驶员的速度会与测量期间该路段所有驾驶员的速度进行比较,其相对速度通过百分位数来衡量。假设速度的第85百分位数为60km/h,这意味着85%的观测驾驶员行驶速度低于60km/h,而15%的驾驶员速度高于此值。百分位数的定义为:样本中的值,其下方有P%的数据。对于足够大的样本,第P个百分位数的位置为:其中是样本量。四分位数是将数据分为四等份的百分点:四分位距(IQR)作为数据离散程度的度量,定义为第一和第三四分位数之间的数值差。1.第一四分位数(下四分位数):下方包含25%的数据2.第二四分位数(中位数):下方包含50%的数据3.第三四分位数(上四分位数):下方包含75%的数据1.2集中趋势度量1.2集中趋势度量四分位数和百分位数是给定数据集中各点相对位置的度量。中位数是一个能体现数据“中心性”或集中趋势的重要指标,它将数据分为两部分,一半数据点位于中位数之上,另一半位于其下。在众多集中趋势度量中,算术平均数,即样本均值或期望值,应用最为广泛。样本均值用于衡量样本观测值的集中趋势或平均水平,由于样本不同,样本均值也会有所差异,因此它是一个随机变量。一组测量值的均值定义为:其中是样本量。当考察整个总体时,样本均值被总体均值取代。与样本均值不同,总体均值是常数。总体均值的公式为:其中是总体的大小。1.2集中趋势度量一组观测值的众数(可能有多个)是出现频率最高的值,或最常出现的结果,严格适用于离散变量(名义和有序尺度变量)以及计数数据。从概率上讲,它是样本中最可能的结果;其出现次数多于其他任何值。众数也可以作为集中趋势的度量。这三种集中趋势度量各有优缺点。均值利用并总结了数据中的所有信息,是一个单一的数值度量,具有一些理想的数学性质,使其在许多统计推断和建模应用中非常有用。相比之下,中位数是排序后数据的中心点。计算中位数时,不考虑数据点在数轴上的精确位置;只需要它们相对于中心观测值的相对位置。这正是中位数的主要优点;它对数据中的极端观测值或异常值具有抗性。总体而言,均值是最常用的集中趋势度量;然而,在数据包含大量异常观测值的情况下,中位数可能是一个更可靠的度量。类似于中位数,稳健的统计建模方法旨在抵抗极端观测值的影响。当数据对称且单峰时,众数、中位数和均值大致相等(第1.4节讨论非对称分布中这三种度量的相对位置)。最后,如果数据是定性的(在名义或有序尺度上测量),使用均值或中位数是没有意义的,必须使用众数。对于名义数据,众数是包含最多观测值的类别。1.3离散程度度量1.3离散程度度量离散程度是一个统计术语,用于描述和量化数据围绕中心(通常是均值)的分散或离散程度。在大多数实际情况下,仅了解样本的平均值或期望值不足以充分理解数据。样本离散程度提供了数据相对于均值(或其他集中趋势度量)的分散程度的度量。有几种有用的离散程度度量,或称为离散度。之前讨论过的一种是四分位距。另一种是极差——数据中最大值与最小值之间的差。尽管极差和四分位距都能测量数据的离散程度,但四分位距对异常观测值更具抗性。两种最常用的离散程度度量是方差及其平方根,即标准差。低离散性高离散性高离散和低离散性数据示例1.3离散程度度量方差和标准差通常比极差更有用,因为它们与均值一样,利用了观测值中包含的所有信息。一组观测值的方差,或样本方差,是各个观测值与均值的平均平方差,它因样本而异。样本方差通常用作总体方差的估计量,由下式给出:当一组观测值构成整个总体时,方差用表示。与样本方差不同,总体方差是常数,由下式给出:其中式(1.3)中的被取代。1.3离散程度度量由于方差的计算涉及对原始数据测量尺度的差值进行平方,所以其测量单位是原始测量尺度的平方。例如,以米为单位测量的距离,其方差的单位就是平方米。虽然方差是衡量两组测量值相对离散性的有用指标,但人们通常希望用与原始数据相同的测量单位来表示离散性。这种度量就是方差的平方根,通常称为标准差。样本标准差和总体标准差的公式分别为:与之前的结果一样,样本标准差是一个随机变量,而总体标准差是一个常数。1.3离散程度度量在统计学实践中,一个经常出现的问题是:为何计算总体标准差时除以,而计算样本标准差时却除以。当从总体中抽取样本时,我们需要一个能近似总体方差的样本方差。更具体地说,我们希望一个统计量能够满足:由大量样本计算出的样本方差的平均值等于(真实的)总体方差。实际上,公式(1.3)实现了这一目标。对此有两种解释:(i)由于标准差的计算利用了样本均值,结果会“损失”一个自由度,即只剩下个独立观测值用于计算方差;(ii)在计算小样本的标准差时,所得标准差往往会被低估。对于小样本,通过在分母中使用来进行修正(需注意,随着增大,这种修正的影响会减小,因为根据中心极限定理,较大的样本能更好地近似其抽取自的总体)。1.3离散程度度量标准差是一种绝对离散程度的度量;它不考虑总体或样本中数值的大小。有时,需要一种考虑观测值大小的离散程度度量(相对离散程度)。变异系数(CoefficientofVariation,CV)正是这样一种度量。它提供了一种相对离散程度的度量,其中离散程度以均值的比例表示。对于样本,变异系数的计算公式为:1.3离散程度度量一个广泛归功于切比雪夫的数学定理,建立了一个通用规则:对于样本或总体中的所有观测值,至少有的观测值会落在均值的个标准差范围内,其中不一定是整数。对于近似钟形的正态分布观测值,经验法则表明,以下比例的测量值将分别落在均值的1、2或3个标准差范围内:标准差是一种绝对离散程度的度量;它不考虑总体或样本中数值的大小。有时,需要一种考虑观测值大小的离散程度度量(相对离散程度)。变异系数(CoefficientofVariation,CV)正是这样一种度量。它提供了一种相对离散程度的度量,其中离散程度以均值的比例表示。对于样本,变异系数的计算公式为::包含约68%的观测值:包含约95%的观测值:包含约99%的观测值例1.1为简化分析,暂不考虑季节、道路类型、公路等级及观测年份等因素,现需对北京市朝阳区某路段观测到的速度数据进行基本描述性统计分析。大多数具备统计功能的商业软件均可处理此类基础统计计算。表1.1给出了速度数据的描述性统计结果。描述性统计结果显示,所采集的整个样本的平均车速为58.86km/h,且速度观测值的变异性较小(标准差4.41,变异系数0.075)。均值与中位数几乎相等,表明速度样本的分布相当对称。该数据集包含其他信息,如观测年份、季节(季度)、公路等级以及观测点位于城市或农村区域——这些信息可能共同构建更完整的样本速度特征图景。例1.1表1.1北京市朝阳区道路速度的描述性统计统计量值N(观测数量)1296均值58.86标准差4.41方差19.51变异系数0.075中位数58.5表1.2郊区与城市道路速度的描述性统计统计量农村道路城市道路N888408均值58.7959.0标准差4.603.98方差21.1915.87变异系数0.0780.067中位数58.259.21.4偏度和峰度1.4偏度和峰度频率分布的两个重要特征是偏度和峰度。偏度(Skewness)是衡量频率分布不对称程度的指标,通常被称为三阶中心矩(thirdcentralmoment),而方差是二阶中心矩。一般来说,若概率分布的右尾比左尾更长,则称该分布为右偏(或正偏)分布;反之,若左尾更长,则为左偏(或负偏)分布。当分布右偏时,均值位于中位数右侧,中位数又位于众数右侧;左偏分布则相反。总体偏度参数通过将三阶中心矩除以(消除量纲影响)计算得到,其样本估计值()的计算公式为:1.4偏度和峰度如果一个样本来自正态分布的总体,那么参数服从均值为0、标准差为的正态分布。对称分配均值=中位数=众数右偏科分配众数中位数平均数众数中位数平均数左偏科分配分布的偏度1.4偏度和峰度峰度是衡量频率分布“扁平程度”(相对于“尖峰程度”)的指标。基于样本的估计值是整个样本中的平均值。峰度通常被称为四阶中心矩(fourthcentralmoment)。对于正态分布,参数的值为3。若该参数大于3,数据通常在均值附近聚集(尖峰分布,leptokurtic);若小于3,则分布的峰比正态分布更“扁平”(平峰分布,platykurtic)。样本峰度参数通常会作为众多统计软件包的标准输出呈现,其计算公式为:1.4偏度和峰度在大多数实际应用中,样本峰度参数会减去3,使得尖峰分布的样本峰度值为正,而平峰分布的样本峰度值为负。尖峰分布平峰分布分布的峰度例1.2回顾示例1.1中的北京市朝阳区速度数据,我们进一步分析城市道路与郊区道路的速度分布形态。结果显示:尽管两种道路的偏度相近,但峰度差异更大。郊区道路的峰度值为2.51,接近正态分布;而城市道路的峰度值为0.26,呈现显著的平峰特征,即分布较为扁平。•合并所有道路数据时,偏度为−0.05;•郊区道路的偏度为0.056,表明分布接近对称;•城市道路的偏度为−0.37,呈现左偏(负偏)分布。1.5关联度量1.5关联度量到目前为止,我们的焦点一直集中在用于量化单个变量或测量属性的统计量上。例如,均值和标准差提供了关于单个变量测量性质的有用信息。当然,也存在能够揭示变量之间潜在关系的统计量。两个随机变量之间的相关性是衡量它们线性关系的指标。总体线性相关参数是常用的衡量两个变量线性相关程度的指标。相关参数的取值范围是[-1,1]。当时,意味着两个变量之间不存在线性关联。不过,即便,这两个变量仍可能存在非线性联系。当时,两个变量呈现正线性相关关系,也就是说,当其中一个变量的值增大时,另一个变量的值也会增大。当
时,所研究的两个变量之间呈现出“完全”的正斜率直线关系。当时,两个变量之间呈现出负线性相关关系。最后,当时,两个变量之间呈现出成比例的负直线关系。1.5关联度量相关性直接源自另一种关联度量——协方差。假设有两个服从正态分布的随机变量和,其总体均值分别为和,总体标准差分别为和。和的总体协方差与样本协方差分别定义如下:1.5关联度量如方程所示,和的协方差是和与其均值偏差的乘积的期望值。当两个变量一起增加时,协方差为正;当两个变量朝相反方向变化时,协方差为负;当两个变量没有线性关系时,协方差为零。为了弥补协方差缺乏标准化的情况,将协方差除以标准差以获得一个限制在[-1,1]范围内的值的度量。这个度量称为皮尔逊积矩相关参数,或简称为相关参数。总体和样本的和的相关参数分别定义为:1.5关联度量两个变量之间的正相关(上)和负相关(下)例1.3利用上海市2020-2023年交通数据,研究人员对年度航空旅客吞吐量(万人次)、上海市人均GDP(万元)及航空燃油价格(元/升)之间的相关性进行了考察。通过居民消费价格指数(CPI)将货币价值换算为2020年基准值后,研究发现旅客吞吐量与人均GDP的相关系数为0.89,表明经济增长与航空出行需求呈强正相关;而旅客吞吐量与燃油价格的相关系数为-0.65,显示燃油价格上涨会抑制航空出行需求。需注意相关性并不等同于因果关系。例如,上海市地铁网络扩张与航空旅客吞吐量的相关系数为-0.78,呈现强负相关,但这并非直接因果关系,而是由于地铁网络完善分流了短途出行需求。当变量为有序尺度或不满足正态性时,应使用斯皮尔曼等级相关系数。计算公式为:其中为两变量排序的差值。1.6估计量的性质1.6估计量的性质在前面几节计算出的样本统计量,如样本均值、方差、标准差等,都被用作总体参数的估计量。而在实际中,总体参数(通常简称为参数),比如总体均值和方差,都是未知常数。在日常应用中,样本均值被用来估计总体均值,样本方差用于估计总体方差,诸如此类。然而,这些统计量都是随机变量,因而依赖于样本。用于估计真实总体参数的“优良”统计估计量需满足四个重要性质:无偏性、有效性、一致性和充分性。1.6估计量的性质1.6.1无偏性如果对于一个总体参数存在多个估计量,且其中一个估计量与未知参数的真实值一致,那么这个估计量就被称为无偏估计量。如果一个估计量的期望值等于它所要估计的总体参数的真实值,那么这个估计量就是无偏的。也就是说,对于一个估计量,比如样本均值,如果满足那么它就是总体均值的无偏估计量。有偏估计量无偏估计量偏差总体均值的有偏和无偏估计量1.6估计量的性质1.6.2有效性仅有无偏性这一性质是不够的,因为在有些情况下,两个或更多的参数估计量都是无偏的。在这些情况下,人们关注的是几个无偏估计量中哪个更优。估计量的第二个理想性质是有效性。有效性是一个相对的性质,即一个估计量相对于另一个估计量是有效的,这意味着该估计量的方差比另一个估计量的方差更小。方差更小的估计量更有效。一般来说,在选择估计量时,具有最小方差的无偏估计量优于其他估计量。比较有效性1.6估计量的性质1.6.3一致性第三个渐近性质是一致性。如果一个估计量随着样本量的增加,它接近被估计参数真实值的概率也增加,那么这个估计量就被称为是一致的。正式地说,对于任意常数,当时,有,。一个估计量被称为充分估计量,当且仅当它包含了数据中关于其估计参数的所有信息。换句话说,如果样本均值包含了样本中与总体均值相关的所有信息,那么就是的充分估计量。1.6.4充分性一个估计量被称为充分估计量,当且仅当它包含了数据中关于其估计参数的所有信息。换句话说,如果样本均值包含了样本中与总体均值相关的所有信息,那么样本均值就是总体均值的充分估计量。谢谢!
第二章区间估计、假设检验、多变量方差分析与非参数方法第2章区间估计、假设检验、多变量方差分析与非参数方法科学决策应基于合理的分析与准确的信息。本章阐述置信区间、假设检验和总体比较的理论及解读——这些均为统计工具,用于针对所研究的交通现象提出问题并作答。尽管置信区间极具价值,却常于交通实践中被忽视;假设检验与总体比较也频遭误用和误读。本章探讨的技术,可用于构建、检验大量假设,并依此做出明智决策。以下问题即为示例:某特定交叉口的事故发生情况,是否印证其属于危险路段?交通稳静化措施能否降低行车速度?通过可变信息标志系统发布的路线引导信息,能否成功将驾驶者从拥堵区域引流?航空运输市场的放松管制,是否提升了商务旅行的市场份额?调整对公交系统的运营补贴水平,是否会改变其运营绩效?•
2.1置信区间•
2.2假设检验•
2.3多变量方差分析•2.4非参数方法章节目录2.1置信区间2.1置信区间在实践中,由样本计算得出的统计量(如样本均值)、方差、标准差s,以及前一章介绍的其他统计量),都用于估计总体参数。例如,样本均值可作为总体均值的估计量,样本方差用于估计总体方差,诸如此类。回顾1.6节,理想的“优良”估计量需满足无偏性、有效性、一致性和充分性这四大重要性质。然而,无论估计量具备何种性质,其估计值都会因样本不同而变化,且被估计参数与目标总体参数之间至少存在一定的偏差概率。与前一章讨论的点估计量不同,此处核心是区间估计。区间估计通过设定一个包含下限和上限的区间推断总体,使未知参数以预设置信水平落于其中。其逻辑在于:利用样本数据计算的区间,在一定置信水平下包含总体真实参数(即从长期看,真实总体参数落入该区间的比例)。这类区间称为置信区间(CIs),可在不同置信水平上构建,下限为置信下限(LCL),上限为置信上限(UCL)。置信区间越宽,研究者对其包含总体参数的信心越强(总体置信度较高);反之,较窄的置信区间包含总体参数的可能性更低(总体置信度较低)。2.1.1已知时的置信区间中心极限定理(CLT)表明,只要从均值为、标准差为的任意总体中抽取足够大的随机样本,样本均值就近似服从均值为、标准差为的正态分布。可轻松验证,这个标准正态随机变量Z有0.95的概率处于区间[–1.96,1.96]内。关于Z的概率表述为:2.1.1已知时的置信区间通过基本的代数变换,方程(2.1)的概率表述可改写为另一种形式(但等价):方程(2.2)表明,当从总体中抽取大量不同随机样本并计算相应区间时,区间总体均值的样本均值的比例为0.95。该区间称为的95%置信区间估计式,其简写形式为:2.1.1已知时的置信区间显然,除了95%之外,其他概率水平也经常被使用。例如,90%置信区间为:一般而言,估计置信区间时可使用任意置信水平。置信水平为,其中表示标准正态曲线下每个尾部的面积为时对应的Z值。基于此符号表示,总体均值的置信区间估计式可写为:由于置信水平与置信区间未能包含总体均值μ实际值的风险成反比,因此其通常介于0.90至0.99之间,分别反映了10%和1%的未包含真实总体参数的风险水平。例2.1需要计算北京市朝阳区某路段车辆平均速度的95%置信区间。首先检验正态性假设;若该假设成立,即可进行分析。样本量n=1296,样本均值。假设长期研究表明总体标准差。根据公式,计算置信区间如下:结果表明,未知总体参数的95%置信区间由58.56和59.16这两个下限和上限构成。这意味着,平均而言,真实未知的总体参数在每100次中约有95次会落在该区间内。该置信区间相当“紧凑”,即可能的取值范围相对较小。这是由于所检验总体的假设标准差较低(即数据变异性较小)所致。2.1.2
方差未知时均值的置信区间上一节讨论了在总体方差已知的情况下,围绕正态总体均值构建置信区间的方法。然而,在大多数实际抽样情形中,总体方差很少是已知的,而是需要从数据中进行估计。当总体方差未知且总体呈正态分布时,总体均值的置信区间由下式给出:一般而言,估计置信区间时可使用任意置信水平。置信水平为,其中表示标准正态曲线下每个尾部的面积为时对应的Z值。基于此符号表示,总体均值的置信区间为估计式可写为:其中,s是估计方差的平方根,是自由度为的t分布的值例2.2继续上一个例子,计算北京市朝阳区某路段车辆平均车速的95%置信区间。假设总体方差未知,从数据中获取的估计值与之前相同。样本量n=1296,样本均值。使用公式计算得到的置信区间为:有趣的是,查看与t分布相关的概率表可以发现,当样本量时,t分布会收敛于标准正态分布。尽管当总体方差未知时,t分布是应当使用的正确分布,但当样本量足够大时,标准正态分布可作为t分布的充分近似。2.1.3
总体比例的置信区间有时,人们关注的是定性(名义量表)变量而非定量(区间或比率量表)变量。例如,人们可能会关注总体中某一特征的相对频率,如总体中使用公共交通的人群比例。在这种情况下,总体比例的估计量近似服从正态分布,前提是样本量n足够大(且,其中)。抽样分布的均值为总体比例,标准差为。大样本情况下,总体比例的置信区间由以下公式给出:其中,样本比例估计值等于样本中“成功”次数除以样本量,。例2.3一家交通规划机构希望以95%的置信水平估计每日通勤“市场”中的公共交通用户比例(即使用公共交通的通勤者百分比)。随机抽取了100名通勤者作为样本,发现其中28人是公共交通用户。根据公式,总体比例p的95%置信区间计算如下:因此,该机构有95%的把握认为,公共交通在日常通勤中的比例在19.2%至36.8%之间。2.1.4
总体方差的置信区间在许多情况下,例如在交通安全研究中,关注点在于总体方差(或相关指标如总体标准差)。举例而言,车辆速度会影响撞车概率,但道路车辆上的速度变异性可能更为重要。速度方差(通过道路上行驶速度的差异来衡量)与撞车频率相关,因为车辆间速度方差越大,撞车频率越高,尤其是涉及两辆或多辆车辆的碰撞。速度差异过大会导致驾驶员相互超车的频率增加,从而增加多车碰撞的机会。显然,以相同速度同向行驶的车辆不会相互超车,因此只要保持相同速度,它们就不会发生碰撞。假设总体服从正态分布,总体方差的置信区间由以下公式给出:其中,是自由度为n-1的卡方分布(分布)的分位数,该分位数对应的右尾面积为;而对应的左尾面积为(即右尾面积为)。例2.4需要计算北京市朝阳区某路段速度方差的95%置信区间。样本量为100,样本方差为19.51平方公里每小时。根据卡方分布表,得到(右尾面积0.025)和(左尾面积0.975)。因此,95%的置信区间计算如下:有95%的把握认为,速度方差处于15.05至26.02平方公里每小时之间。需注意,速度方差的单位为平方公里每小时。2.2假设检验2.2假设检验假设检验超出了计算总体参数估计量的范畴,涉及一系列更加复杂的问题。假设检验决定了从样本中能够获得哪些关于现实世界的信息。得出的结论会不会是偶然得到的呢?使用从样本中得到的结论能否拒绝已有的理论?如果理论上是正确的,则这一个特定样本被观测到的概率有多大?本节首先概述假设检验,然后考察t检验这种常用于检验单个回归参数的统计检验方法。接下来我们看一看置信区间——一个用来评估我们估计精度的工具,然后我们将学习怎样使用F检验来确定整个组系数影响因变量作为章节的话题。尽管研究者非常关心那些有争议的理论能否被实际观测样本中得到的估计结果所支持,但要证明已给出的假设是否正确几乎是不可能的。唯一能说明的是,特定的样本符合特定的假设。即便假设检验不能证实一个给定的理论,但却能在一定的显著水平下拒绝它。在这种情况下,研究者认为在理论假设正确的情况下,抽样结果很难被观测到。2.2假设检验假设检验超出了计算总体参数估计量的范畴,涉及一系列更加复杂的问题。假设检验决定了从样本中能够获得哪些关于现实世界的信息。得出的结论会不会是偶然得到的呢?使用从样本中得到的结论能否拒绝已有的理论?如果理论上是正确的,则这一个特定样本被观测到的概率有多大?本节首先概述假设检验,然后考察t检验这种常用于检验单个回归参数的统计检验方法。接下来我们看一看置信区间——一个用来评估我们估计精度的工具,然后我们将学习怎样使用F检验来确定整个组系数影响因变量作为章节的话题。尽管研究者非常关心那些有争议的理论能否被实际观测样本中得到的估计结果所支持,但要证明已给出的假设是否正确几乎是不可能的。唯一能说明的是,特定的样本符合特定的假设。即便假设检验不能证实一个给定的理论,但却能在一定的显著水平下拒绝它。在这种情况下,研究者认为在理论假设正确的情况下,抽样结果很难被观测到。2.2.1什么是假设检验——古典原假设和备择假设假设检验的第一步是明确需要检验的假设。这一步应该在方程估计之前完成,因为如果在估计之后才提出假设会出现这样的风险:假设检验仅仅是对特定结果的验证而不是检验结果的合理性。原假设(nullhypothesis)通常被表述为研究者不希望出现的结果,记作“H0”,紧接着便是不希望出现结果的数值范围。例如,如果希望出现一个正的参数,而不是零或者负的参数,那么原假设可以表述为:备择假设(alternativehypothesis)通常是对研究者希望出现的结果的表述,记作“Ha”,紧接着的是希望出现结果的数值范围。继续前面的例子,如果希望出现一个正的参数,则备择假设为:作为自我测试,请抽出时间思考一下,如果希望出现一个负的参数,那么相应的原假设和备择假设分别是什么呢?正确的表述应该是:2.2.1什么是假设检验——古典原假设和备择假设上述检验均为单侧检验(one-sidedtest),因为备择假设的值仅仅位于原假设的一侧。另一种方法是使用双侧检验(two-sidedtest)[或者是双尾检验(two-tailedtest)],其中备择假设的取值位于原假设的两侧。对于一个关于以0为中心的双侧检验来说,原假设和备择假设分别为:需要指出的是,在极少数情况下,不得不违背将希望出现的数值放置于备择假设的规则。古典假设检验要求在原假设中包含等号的一些形式(诸如=、≤或≥)。这一要求意味着如果研究者所期望的数值中包含等号,则不得不把该数值放置于原假设中。这种情况的发生在研究者指定的是某个特定的数值而不是一个范围。幸运的是,上述情况在基础的统计学分析中非常少见。2.2.1什么是假设检验——第一类错误和第二类错误传统的计量经济学检验是先为每个回归参数(常数项除外)设定一个期望的符号(或数值),然后通过检验决定是否拒绝原假设。因为回归参数仅仅是真实总体参数的估计值,所以,认为从回归分析中得到的结论总是正确的想法是不切实际的。在假设检验中可能会犯两种类型的错误:(1)类型1:拒绝了正确的原假设。(2)类型2:没有拒绝错误的原假设。这些错误分别称为第一类错误(typeIerrors)和第二类错误(typeIIerrors)。假设存在下列原假设和备择假设:2.2.1什么是假设检验——第一类错误和第二类错误即使参数β的真值不是正的,而研究人员得到的估计值是足够大的正数,导致拒绝β≤0的原假设。这就是第一类错误,拒绝了事实!相反,β的估计值可能非常接近于零(或为负)而被认为“不显著为正”。这一结果很可能使得研究者“接受”原假设β≤0,而实际上真值为β>0,这就是第二类错误,即我们没有拒绝错误的原假设。作为第一类错误和第二类错误的一个例子,假定你是一起谋杀案的陪审团成员。在这种情况下,“无辜到被证明有罪”的假定隐含着以下含义:2.2.1什么是假设检验——第一类错误和第二类错误第一类错误是什么呢?拒绝原假设意味着将被告送进监狱,因此,第一类错误,拒绝真实的原假设意味着:第一类错误:将无辜的被告送进监狱。与此类似的是,第二类错误:释放了有罪的被告。大多数通情达理的陪审团成员都希望将这两类错误发生的概率降至最低,但事实证明这几乎是不可能的。毕竟,现实中怎么会不存在错误的指认或说谎的证人?在当今社会中,降低第一类错误(将无辜的被告送进监狱)发生的概率就意味着增加第二类错误(释放了有罪的被告)发生的概率。即如果不将无辜的被告送进监狱,那么会释放更多的犯人!2.2.1什么是假设检验——假设检验的判定规则判定规则(decisionrule)是决定是否拒绝原假设的方法。一般情况下,判定规则是比较样本统计量与预先设定的临界值之间的大小,这些临界值可以在本书的最后找到。判定规则应该在得到回归估计量之前制定。参数估计值的可能范围分为两个区域,“接受”区域和拒绝区域,这两个区域的确定与原假设有关。为了确定这些区域,必须先确定参数估计值的临界值(对于双侧检验来说,应确定两个临界值)。因此,临界值(criticalvalue)即在检验原假设时用来划分“接受”区域与拒绝区域那个值。2.2.1什么是假设检验——假设检验的判定规则单侧检验中β的“接受”区域和拒绝区域双侧检验中β的“接受”区域和拒绝区域2.2.2t检验t检验是计量经济学家通常对单个回归参数的假设进行的检验。而对多个参数同时进价检验(对联合假设的检验)时,一般情况下,是利用F检验的。t检验便于应用,因为它考虑到了不同变量间计量单位的不同,以及估计参数的标准差的不同。更重要的是,当随机干扰项呈正态分布,并且需要估计该分布的方差时,t检验是一种合适的检验方法。由于这些情况普遍存在,因此,在假设检验中使用t检验已成为计量经济学的惯例。2.2.2t检验——t检验概述对于古典多元线性回归模型:最常用的t统计量的形式为:可以简化为或者为参数估计值除以它的标准差的估计值。这是大部分电脑程序中所使用的t检验公式。2.2.2t检验——t检验的临界值与判定规则在计算出t统计量后,就可以利用它的临界值来判断应该“拒绝”还是“接受”原假设。临界值是区分“接受”区域和拒绝区域的值。临界值不仅取决于t检验是单侧检验还是双侧检验,还取决于给定的第一类错误发生的概率和自由度,它从t分布表中选取,其中,自由度通常定义为N-K-1。在假设检验中,第一类错误发生的概率也称为显著性水平。t分布表由不同的临界值组成。计算出t统计量并得到对应的临界值后,比较和,如果的绝对值大于临界值,并且的符号与Ha中隐含的符号相同的话,则拒绝原假设。因此,在检验单个回归参数时应使用下面的规则:如果,并且的符号与假设Ha中隐含的符号相同,则拒绝H0,否则不能拒绝H0。2.2.2t检验——t检验概述这一判定规则适用于以0为中心的单侧假设检验:对于以0为中心的双侧假设检验有:对于以非零值为假设临界值的单侧假设检验有:以及基于非零临界值的双侧假设检验有2.2.2t检验——选择显著性水平根据建立在既定显著性水平下的判定规则,“显著地为正”一词从统计意义上说明除了原假设H0(β≤0)被拒绝,而支持备择假设Ha(β>0)。显著性水平(levelofsignificance)是指如果原假设是正确的,则得到的t统计量大于临界值的概率。它度量了特定临界值情况下第一类错误发生的概率。如果给定显著性水平为10%,并在此水平上,拒绝了原假设,则意味着原假设成立的概率只有10%。通常情况下,我们不对它们的参数符号进行假定,而是用“*”标记出“显著”的参数。这些“*”表明当t统计量的绝对值大于10%显著性水平下的双侧检验的临界值(标记为一个“*”),或大于5%显著性水平下双侧检验的临界值(标记为两个“*”),抑或大于1%显著水平下双侧检验的临界值(标记为三个“*”)。2.2.2t检验——p值t检验还有另一种实现方法,这种基于p值或微小的显著水平的方法已经逐渐在应用中得到普及。p值(p-value)表示的是在原假设为真的情况下,t统计量的临界值大于或等于根据样本数据计算出的t统计量的概率。从图形上来看,它是指t分布曲线下方实际检验统计量值至无穷大的这部分区域(假定符号的符号跟预期相同)。因为p值是一个概率,所以,它的取值范围介于0和1之间。它给出了拒绝原假设的最低显著水平(假定估计值与预期的方向一致)。一个小的p值意味着原假设应受到质疑,因此,为了拒绝原假设,就需要一个低的p值。2.2.2t检验——p值如何计算p值呢?一种方法是在统计分布表中一页一页地寻找与回归结果严格匹配的显著性水平,但这可能要花很多时间!幸运的是,标准回归软件包能够自动计算p值,并输出每个估计参数对应的p值。这样就可以在回归结果中读取相应所对应的p值。如何运用p值进行t检验呢?其判定方法是,如果选择的显著性水平是5%,且p值小于0.05,只要的符号与预期一样,那么,就可以拒绝原假设。因此,p值的判定规则是:如果p值<对应的显著性水平,且与备择假设Ha中隐含的符号相同,则拒绝原假设。2.2.3t检验的局限性t检验本身存在一个问题,就是容易被误用。由于t统计量是通过电脑的回归软件包输出的,从而使得t检验看起来很容易运用,因此,初学者有时会利用t检验来“证明”一些还未经检验的理论。基于这个原因,了解t检验的局限性与了解它的应用同等重要。在这些局限中,也许最重要的是,随着需要估计和检验的特定值越来越多,t检验的有效性也随之而大幅减弱,这也是第本节的主题。本节接下来的部分主要是通过一些例子来说明在哪些情况下不能使用t检验。2.2.3t检验的局限性——t检验不能检验理论的有效性回想一下,t检验的目的是帮助研究者对一个特定的总体参数值进行推断,该总体参数是以从总体的一个样本中得来的估计值作为基础。许多初学者认为任何一个统计意义上显著的结果在理论上也是正确的。这是一种危险的想法,因为这种推断将统计上的显著性与理论上的有效性相互混淆了。2.2.3t检验的局限性——t检验不能检验理论的有效性考虑下面的例子,下面给出的方程解释了某国的消费者价格指数:事实是,P是消费者价格指数,而C是在某国的累积降雨量!前面已经说过降雨量在解释价格指数方面是显著的,这是否也说明这一结果在理论上也是正确的呢?当然不是。但为什么在统计上又是显著地呢?原因在于方程中的变量恰巧有着共同的趋势,而这一共同的趋势是没有任何意义的。结论很容易得出:永远不能把t检验揭示的统计上的显著性等同于理论的有效性。2.2.3t检验的局限性——t检验不能检验“重要性”回归方程的应用之一是帮助研究者决定哪个解释变量对被解释变量的相对影响最大(最重要)。许多初学者错误地认为,在回归估计方程中,统计意义上最显著的变量同时也是对被解释变量解释程度最大的变量。统计意义上的显著,说明的是偶尔获得特定样本结果的可能性,但它几乎没有说明哪个解释变量对被解释变量的解释程度最大。为了判断它们的重要性,采取诸如参数值乘以解释变量的平均值或标准差的方法将会更有意义。2.2.3t检验的局限性——t检验不能检验理论的有效性考察下面假设的模型:假定所有其他的因素,包括价格、质量和竞争在估计时期内保持不变。企业需要决策:广告支出应优先投向哪个平台?从方程中可以得出,的参数值是的20倍,你很可能会认为更重要。然而,由于对应的t统计量为10.0,对应的t统计量为8.0,更显著。但这仅表明“杂志广告支出与销量的正相关关系更可靠”,不直接代表对销量的实际影响更大。2.2.3t检验的局限性——t检验不是针对总体的检验t检验帮助研究者对参数的真实值进行推断,该真实值是根据总体(样本从该群体中抽取)中的某一个样本所计算出的估计值而得来的。当样本容量接近总体规模时,无偏的参数估计值接近于真实值。如果参数是从总体中得来,则该无偏的估计值就是总体真值,进行t检验也就失去了意义。但也许有些人会忽略这一点,仍认为从与总体大小相近的样本中得到的t统计量很重要。特定的小样本可能会导致研究者拒绝真实的总体参数假设。t检验能办到的仅仅是帮助研究者确定犯这种错误的可能性有多大。2.2.4F检验尽管对于单个回归参数的假设检验,t检验起着举足轻重的作用,但是它不能同时对多个回归参数进行检验。正是这种局限性使得t检验在使用过程中存在不便之处,因为在现实生活中,许多有趣的想法涉及的都是若干个假设或者是一个包含多个参数的假设。比如,假设要检验一个包含季节虚拟变量的季节性回归方程,原假设为模型中不存在季节因素的变化。为了检验这样一个假设,许多研究者会采用F检验。2.2.4F检验——什么是F检验F检验(F-test)是在原假设中包含多个假设或涉及关于若干参数的单个假设时所进行的检验。像这种“联合”或“复合”假设适用于模型所隐含的经济理论中特定的数值针对多个参数的情况。F检验的作用方式很巧妙。首先,将原假设转化为方程中的约束条件。被约束后的方程可看作原假设正确时所对应的方程,将假设值代入原回归方程就可得到约束方程。在F检验中,原假设一般会产生一个约束方程,这违背了假设检验时在备择假设中包含预期正确理论的传统惯例。2.2.4F检验——什么是F检验两个拟合优度通过下面的F统计量进行比较:式中,RSS代表无约束方程的残差平方和;RSSM代表约束方程的残差平方和;M代表方程中限制条件的个数(通常等于从未约束方程中剔除出的参数β的个数);N-K-1代表无约束方程的自由度。F检验的判定规则为:如果根据方程(5-10)得出的F统计量的值(F)大于F临界值(Fc)时,拒绝原假设,即2.2.4F检验——什么是F检验F统计量的自由度有两个:方程中的分子自由度(M,原假设中约束条件的个数)和方程中的分母自由度(N−K−1,回归方程的自由度)。这里隐含的原则是,如果算出的F统计量的值(或F比率)大于临界值,则估计方程的拟合优度要优于约束方程的拟合优度,并且拒绝原假设。2.2.4F检验——方程总体显著性的F检验尽管判定系数R2和调整后的判定系数都度量了方程的整体拟合优度,但它们没有对这一拟合优度进行假设检验,这种假设检验可通过F检验完成。在方程总体显著性的F检验中,原假设为方程中所有的斜率参数均为0。对于有K个解释变量的方程而言,原假设和备择假设分别为:为了证明估计方程的整体拟合优度是显著的,在F检验中就要拒绝原假设。对于方程总体显著性的F检验,方程可简化为:2.2.4F检验——F检验的其他应用除模型的整体显著性检验外,F检验还有很多其他用途。以季节性虚拟变量的检验问题为例,季节性虚拟变量(seasonaldummies)是用来说明时间序列模型中季节变化的虚拟变量。在季度时间序列模型中:2.2.4F检验——F检验的其他应用则模型为:式中,不是虚拟变量,t为季度。注意模型中只用三个虚拟变量代表四个季节,表示第一季度与第四季度(被省略的条件)对Y的影响相比,第一季度对Y的影响程度,和同理。方程中包含的一系列季节性虚拟变量将Y“季节化”,只要Y与Xi之间在估计之前不存在“季节性调整”,这种方法就可使用。2.3多变量方差分析2.3多变量方差分析多变量方差分析是对多个独立变量是否受单个或多个因素影响而进行的方差分析。它不仅能够分析多个因素对观测变量的独立影响,更能够分析多个因素的交互作用能否对观测变量产生的影响。单样本多变量方差分析是指一组多变量已知总体均数的比较的方差分析。单因素多变量方差分析是指分组变量仅有一个的多变量方差分析。多元方差分析的适用条件:①资料具有多元正态性分布;②方差齐性;③各个因变量间存在一定关系;④样本含量足够大。2.3.1单样本多变量方差分析对单变量资料,样本观测值x服从正态分布,样本均数服从正态分布,可采用单样本t检验:即:对单样本多变量资料,将公式中的样本均数用样本均数向量替换,总体均数用总体均数向量替换,样本方差用样本协方差矩阵替换,用替换,则得Hotelling公式为:在H0成立的条件下,Hotelling与F有以下关系:2.3.2单因素多变量方差分析在单变量假设检验中,两个独立样本观察值分别来自x服从正态分布和,对检验可用独立样本t检验,计算公式如下::同理进行替换后,则得Hotelling公式为:在H0成立的条件下,Hotelling与F有以下关系:2.3.3多因素多变量方差分析多变量方差分析表一般情况下与F值的关系2.3.3多因素多变量方差分析多变量方差分析的检验统计量有:(1)Wilks统计量:Wilks在1932年提出一种WilksLambda统计量,即广义方差比:(2)Pillai迹(Pillai’strace):Pillai迹的值越大,说明处理效应也越大。(3)Hotelling迹(Hotelling-Lawleytrace):与Pillai迹相同,Hotelling迹越大,说明处理效应也越大。(4)Roy’s最大特征值(Roy’sgreatestroot)Roy’s最大特征值越大,说明处理效应也越大。一般Roy’s最大特征值小于或等于Hotelling迹。2.3.4含协变量的多变量方差分析含协变量的多变量方差分析(multivariateanalysisofvariancewithcovariates)是利用线性回归的方法消除了处理组间不均衡的协变量影响后再对校正后的因变量均数进行处理组间比较的方差分析。其基本模型为:式中,x1为分类变量表示处理因素或分组因素,x2为与因变量存在线性回归关系的协变量,即协变量。协方差分析适用条件:①各样本为正态分布随机样本,且满足独立、方差齐性;②协变量为连续变量且与因变量之间存在直线关系;③协变量与因变量的回归斜率应大致相同。2.4非参数方法2.4非参数方法
本章前面讨论的统计程序专注于对特定总体参数进行推断,并依赖于数据满足特定假设。其中一个假设是所检验的样本近似服从正态分布。对于所讨论的均值和方差检验,数据需要在比率或区间尺度上测量。最后,样本量需要足够大。本章剩余部分讨论的统计程序不做关于潜在总体参数的任何假设,因此被称为非参数方法。有些检验甚至不需要对所关注总体的分布做出假设(因此,非参数方法通常被称为分布自由方法)。非参数方法通常比其参数方法的替代方案需要更少严格的假设,并且它们使用的数据信息更少。如果将非参数技术应用于满足参数检验条件的数据,那么犯第二类错误(接受错误的原假设)的可能性会增加。因此,参数方法更具效力,更可能正确地导致对错误原假设的拒绝。2.4非参数方法
鉴于参数方法与非参数方法之间的权衡,针对何时使用非参数方法提供一些指导是合适的。在以下情况下,应考虑使用非参数技术:1. 样本数据为频数计数且没有合适的参数检验方法可用。2. 样本数据按有序尺度(ordinalscale)测量。3. 研究假设不关注特定总体参数(如均值μ和方差σ²)。4. 参数检验的要求(如近似正态性、大样本量、区间或比率尺度数据)被严重违反。5. 参数检验要求存在中度违反,且检验结果呈现边际统计显著性(即结果接近但未明确达到显著性水平)。1.4偏度和峰度如果一个样本来自正态分布的总体,那么参数服从均值为0、标准差为的正态分布。对称分配均值=中位数=众数右偏科分配众数中位数平均数众数中位数平均数左偏科分配分布的偏度1.4偏度和峰度峰度是衡量频率分布“扁平程度”(相对于“尖峰程度”)的指标。基于样本的估计值是整个样本中的平均值。峰度通常被称为四阶中心矩(fourthcentralmoment)。对于正态分布,参数的值为3。若该参数大于3,数据通常在均值附近聚集(尖峰分布,leptokurtic);若小于3,则分布的峰比正态分布更“扁平”(平峰分布,platykurtic)。样本峰度参数通常会作为众多统计软件包的标准输出呈现,其计算公式为:1.4偏度和峰度在大多数实际应用中,样本峰度参数会减去3,使得尖峰分布的样本峰度值为正,而平峰分布的样本峰度值为负。尖峰分布平峰分布分布的峰度例1.2回顾示例1.1中的北京市朝阳区速度数据,我们进一步分析城市道路与郊区道路的速度分布形态。结果显示:尽管两种道路的偏度相近,但峰度差异更大。郊区道路的峰度值为2.51,接近正态分布;而城市道路的峰度值为0.26,呈现显著的平峰特征,即分布较为扁平。•合并所有道路数据时,偏度为−0.05;•郊区道路的偏度为0.056,表明分布接近对称;•城市道路的偏度为−0.37,呈现左偏(负偏)分布。1.5关联度量1.5关联度量到目前为止,我们的焦点一直集中在用于量化单个变量或测量属性的统计量上。例如,均值和标准差提供了关于单个变量测量性质的有用信息。当然,也存在能够揭示变量之间潜在关系的统计量。两个随机变量之间的相关性是衡量它们线性关系的指标。总体线性相关参数是常用的衡量两个变量线性相关程度的指标。相关参数的取值范围是[-1,1]。当时,意味着两个变量之间不存在线性关联。不过,即便,这两个变量仍可能存在非线性联系。当时,两个变量呈现正线性相关关系,也就是说,当其中一个变量的值增大时,另一个变量的值也会增大。当
时,所研究的两个变量之间呈现出“完全”的正斜率直线关系。当时,两个变量之间呈现出负线性相关关系。最后,当时,两个变量之间呈现出成比例的负直线关系。1.5关联度量相关性直接源自另一种关联度量——协方差。假设有两个服从正态分布的随机变量和,其总体均值分别为和,总体标准差分别为和。和的总体协方差与样本协方差分别定义如下:1.5关联度量如方程所示,和的协方差是和与其均值偏差的乘积的期望值。当两个变量一起增加时,协方差为正;当两个变量朝相反方向变化时,协方差为负;当两个变量没有线性关系时,协方差为零。为了弥补协方差缺乏标准化的情况,将协方差除以标准差以获得一个限制在[-1,1]范围内的值的度量。这个度量称为皮尔逊积矩相关参数,或简称为相关参数。总体和样本的和的相关参数分别定义为:1.5关联度量两个变量之间的正相关(上)和负相关(下)例1.3利用上海市2020-2023年交通数据,研究人员对年度航空旅客吞吐量(万人次)、上海市人均GDP(万元)及航空燃油价格(元/升)之间的相关性进行了考察。通过居民消费价格指数(CPI)将货币价值换算为2020年基准值后,研究发现旅客吞吐量与人均GDP的相关系数为0.89,表明经济增长与航空出行需求呈强正相关;而旅客吞吐量与燃油价格的相关系数为-0.65,显示燃油价格上涨会抑制航空出行需求。需注意相关性并不等同于因果关系。例如,上海市地铁网络扩张与航空旅客吞吐量的相关系数为-0.78,呈现强负相关,但这并非直接因果关系,而是由于地铁网络完善分流了短途出行需求。当变量为有序尺度或不满足正态性时,应使用斯皮尔曼等级相关系数。计算公式为:其中为两变量排序的差值。1.6估计量的性质1.6估计量的性质在前面几节计算出的样本统计量,如样本均值、方差、标准差等,都被用作总体参数的估计量。而在实际中,总体参数(通常简称为参数),比如总体均值和方差,都是未知常数。在日常应用中,样本均值被用来估计总体均值,样本方差用于估计总体方差,诸如此类。然而,这些统计量都是随机变量,因而依赖于样本。用于估计真实总体参数的“优良”统计估计量需满足四个重要性质:无偏性、有效性、一致性和充分性。1.6估计量的性质1.6.1无偏性如果对于一个总体参数存在多个估计量,且其中一个估计量与未知参数的真实值一致,那么这个估计量就被称为无偏估计量。如果一个估计量的期望值等于它所要估计的总体参数的真实值,那么这个估计量就是无偏的。也就是说,对于一个估计量,比如样本均值,如果满足那么它就是总体均值的无偏估计量。有偏估计量无偏估计量偏差总体均值的有偏和无偏估计量1.6估计量的性质1.6.2有效性仅有无偏性这一性质是不够的,因为在有些情况下,两个或更多的参数估计量都是无偏的。在这些情况下,人们关注的是几个无偏估计量中哪个更优。估计量的第二个理想性质是有效性。有效性是一个相对的性质,即一个估计量相对于另一个估计量是有效的,这意味着该估计量的方差比另一个估计量的方差更小。方差更小的估计量更有效。一般来说,在选择估计量时,具有最小方差的无偏估计量优于其他估计量。比较有效性1.6估计量的性质1.6.3一致性第三个渐近性质是一致性。如果一个估计量随着样本量的增加,它接近被估计参数真实值的概率也增加,那么这个估计量就被称为是一致的。正式地说,对于任意常数,当时,有,。一个估计量被称为充分估计量,当且仅当它包含了数据中关于其估计参数的所有信息。换句话说,如果样本均值包含了样本中与总体均值相关的所有信息,那么就是的充分估计量。1.6.4充分性一个估计量被称为充分估计量,当且仅当它包含了数据中关于其估计参数的所有信息。换句话说,如果样本均值包含了样本中与总体均值相关的所有信息,那么样本均值就是总体均值的充分估计量。谢谢!第三章线性回归第三章线性回归线性回归是研究和应用最为广泛的统计与计量经济学技术之一,这得益于诸多原因。首先,线性回归适用于建模多种变量间的关系。此外,线性回归模型的假设在许多实际应用中通常能得到合理满足。再者,回归模型的输出相对易于解释和沟通,模型的数值估计较为简便,且许多“非专业”软件包中都配备了模型估计工具。当然,线性回归也可能被过度使用或误用。在某些情况下,模型假设未必严格成立,而合适的替代方法却未被了解、理解或应用。此外,更高级的技术可能需要专业软件和知识才能进行估计。线性回归作为说明统计模型估计程序的起点不足为奇。尽管它是一种灵活且有用的工具,但在其他方法更为适用时,应避免使用线性回归。本章阐述线性回归模型的估计方法,解释线性回归模型的适用场景,说明如何解读线性回归模型的输出结果,并讨论如何在一组竞争的线性回归模型中进行选择。本章全程使用矩阵代数来阐释相关概念,但仅局限于说明最重要的分析层面所需的内容。•3.1线性回归模型的假设•3.2回归分析基础•
3.3回归中的变量处理•3.4估计单个β参数•3.5针对变量区间估计β参数•3.6为变量m个水平中的m−1个估计单个β参数•
3.7检验回归假设章节目录•
3.8回归离群值•
3.9回归模型拟合优度度量•3.10回归中的多重共线性•3.11回归模型构建策略•3.12估计弹性•3.13删截因变量——Tobit模型•3.14Box-Cox回归3.1线性回归模型的假设3.1线性回归模型的假设线性回归用于对连续因变量与一个或多个自变量之间的线性关系进行建模。大多数回归应用旨在识别一组被认为与因变量共变的解释变量。一般来说,解释性或“因果”模型基于受控实验(如实验室中进行的实验)获得的数据,预测模型基于观察性研究获得的数据,而质量控制模型则基于受控过程或系统获得的数据。解释变量是导致因变量变化还是仅仅与因变量变化相关,取决于众多因素,无法仅通过统计建模来确定。线性回归模型存在诸多假设(或要求)。当任何假设未得到满足时,需采取补救措施,在某些情况下还需采用替代建模方法。以下是线性回归模型的一些假设。3.1线性回归模型的假设1.连续因变量Y回归分析的一个假设是,因变量(或响应变量)是连续的,即它可以在某个数值范围内取任何值。连续变量是在区间尺度或比率尺度上测量的。尽管常有人这么做,但对有序尺度的响应变量进行回归分析存在问题。2.
Y与x之间的参数线性关系这一要求常常会引起混淆。回归模型的形式要求变量之间的关系本质上是线性的——即因变量Y与解释变量之间存在直线关系。简单线性回归模型可表示为:在大多数应用中,响应变量是多个解释变量的函数。在这些多元情形下,用矩阵形式表示线性回归模型更为高效,即:3.1线性回归模型的假设3.观测值独立且随机抽样尽管采取补救措施后这一要求会有所放宽,但若要对目标总体进行推断,一个必要假设是数据需从总体中随机且独立抽样。独立性意味着某个观测被选中的概率不受先前已选观测的影响。在某些情况下,会使用随机分配代替随机抽样,而分层抽样、整群抽样等其他抽样方案则需通过修正措施纳入回归建模框架。4.变量之间的不确定关系直线方程与线性回归模型的区别在于后者增加了一个随机项、误差项或扰动项。扰动项由若干部分组成:首先,它可能包含模型中遗漏变量的影响——假设这些影响是许多微小、单独来看不重要(次要)的效应之和,其中一些为正、另一些为负;其次,它包含因变量的测量误差,即测量Y时的不精确性,同样假设为随机误差;最后,它包含基础数据生成过程中固有的随机变异。3.1线性回归模型的假设5.与x无关且期望值为零的扰动项平均而言,模型的高估量等于低估量——即模型扰动项的总和为零。而扰动项的方差在各观测值之间是独立的。这一性质被称为同方差假设,它意味着模型不确定性的净效应(包括未观测效应、测量误差和真实随机变异)在观测值之间并非系统性存在,而是在观测值和协变量之间随机分布。当扰动项存在异方差(即系统性地随观测值变化)时,可能需要采用加权最小二乘法或广义最小二乘法等替代建模方法。6.非自相关的扰动项扰动项在观测之间相互独立。当对个体进行重复观测时,这一假设常被违反,此时扰动项中的未观测异质性部分会在个体内部产生相关性。空间数据也可能因位置关系表现出观测间的依赖性。然而,跨时间的观测可能是扰动项相关最常见的情形。当扰动项在观测间存在相关性时,广义最小二乘法或时间序列方法(见第7章和第8章)通常最为适用。3.1线性回归模型的假设7.解释变量与扰动项不相关这一性质被称为解释变量的外生性(exogeneity)。当解释变量为外生时,它们与扰动项不相关。外生性意味着解释变量的值由“模型外”的因素决定,因此因变量Y不会直接影响外生解释变量的取值。当某个重要变量为内生变量(依赖于Y)时,需采用替代方法,如工具变量法(instrumentalvariables)、两阶段或三阶段最小二乘法(twoorthreestageleastsquares)或结构方程模型(structuralequationsmodels)。8.扰动项近似正态分布尽管扰动项的正态分布并非线性回归模型估计的必要条件,但为了对模型参数进行推断,仍要求扰动项近似服从正态分布。在此方面,中心极限定理(centrallimittheorem)使得对统计参数的性质进行精确推断成为可能。结合独立性假设,这一假设意味着扰动项服从独立同分布正态分布(independentlyandidenticallydistributednormal,i.i.d.normal)。3.1线性回归模型的假设回归模型的分析假设总结见下表。该表列出了前文所述的各项假设。谨慎起见,应将表中的假设视为需要满足的建模要求。若这些要求未得到满足,则必须采取补救措施。在某些情况下,采取补救措施后可继续在线性回归建模框架内对数据进行建模;在另一些情况下,则需采用替代建模方法以有效处理非理想条件。第4章将详细讨论回归假设不成立时的补救措施。3.2回归分析基础3.2回归分析基础线性回归的目标是对因变量Y与一个或多个自变量X之间的关系进行建模。我们通过回归模型中的参数(即系数)来阐述X对Y的影响方式。回归分析旨在通过考察样本估计的系数的性质(如它们的表现、能揭示的样本特征以及由此推断的总体特征),来提供关于总体模型参数的信息和性质。针对整个目标总体的线性回归模型可表示为:真实总体模型是从理论考量、过往研究发现和假设理论中构建的。给定协变量向量时的期望值是一个条件期望。总体回归模型的未知扰动项定义为:将总体模型表示为矩阵形式(省略条件期望符号,用帽符号表示估计值),可得:3.2.1最小二乘估计最小二乘估计(OrdinaryLeastSquares,OLS)是回归分析中常用的参数估计方法,其核心是利用样本数据估计回归模型参数。以简单回归模型为例,通过标准代数和矩阵代数推导OLS估计,具体步骤如下:OLS要求最小化扰动项平方和的解。OLS寻求使函数Q最小化的解:使函数Q达到最小值的和的值即为最小二乘估计参数。当然,和是总体参数,是未知的,因此需要得到估计量和,它们是随样本不同而变化的随机变量。通过令Q关于和的偏导数等于零,可得到最小二乘估计参数和使用和分别表示和的估计量,求解上述方程并整理项后可得:3.2.1最小二乘估计通过二阶偏导数为正可以验证这些方程对应最小值。正如预期,模型中的每个参数都会生成一个最小二乘正规方程,因此一个具有个参数的线性回归模型会产生五个正规方程。通过联立求解这两个方程中的系数可得:简单回归情形下最小二乘正规方程的矩阵代数推导也十分直接。在简单回归中,表达式对应的矩阵形式为:求解系数的矩阵运算步骤如下:3.2.2最大似然估计前一节通过最小化函数Q展示了OLS估计量的推导过程。另一种常用且有时非常有用的统计估计方法称为最大似然估计(maximumlikelihoodestimation,MLE),其结果为最大似然估计量(MLEs)。似然函数的一般形式在附录A中描述为:从具有参数向量β的统计分布中观测到样本数据的联合密度,即:对于回归模型,假设n个扰动项独立同分布且服从正态分布,其似然函数为:通常,对上面的方程取对数(即对数似然函数)比直接求解似然函数更简单,因此对L取对数得:对和求对数似然的极大值,得到的估计解与OLS估计量等价。因此,对于满足3.1节假设的回归模型,MLE和OLS估计量是等价的。需要注意的是,MLE基于渐近理论,随着样本量增大,MLE估计量具有一致性。3.2.3普通最小二乘法和极大似然估计法估计量的性质前一节表明,对于满足表3.1假设的回归模型,MLE和OLS估计量是等价的。MLE和OLS估计量的期望值推导如下:因此,MLE和OLS估计量是的无偏估计量。在不假设正态性的经典线性回归模型中,高斯-马尔可夫定理证明了β的OLS估计量是最佳线性无偏估计量(BLUE),即在所有线性无偏估计量中具有最小方差。该定理指出,在经典回归假设(不含正态性)下,MLE和OLS估计量在线性无偏估计类中具有最小方差。这意味着只有使用有偏估计量才能获得更小的方差。若加入正态性假设(除独立性和外),则OLS和MLE估计量在所有无偏估计量中具有最小方差(不再限于线性估计)。在正态理论回归模型中,MLE和OLS估计量(二者等价)均为基础总体参数的最佳线性无偏估计量。3.3回归中的变量处理3.3 回归中的变量处理在回归分析中,变量处理有诸多动机和技术。标准化回归模型允许直接比较自变量的相对重要性。变量变换有助于满足回归假设,指标变量允许对名义尺度和顺序尺度变量进行适当表达,而交互作用则能够对变量之间的协同效应进行建模。1.标准化回归模型人们常常关注自变量对因变量Y的相对影响。然而,使用变量的原始测量单位无法直接表明哪些变量对Y的相对影响最大。例如,在描述每日预期出行链数量的模型中,若两个自变量分别为孩子数量和家庭收入,其估计参数无法直接比较——前者的单位是“每单位孩子带来的每日出行链数量的边际变化”,后者是“每单位收入带来的每日出行链数量的边际变化”。孩子数量和家庭收入的量纲截然不同,缺乏直接可比性。家庭中孩子数量通常在0到8之间,而收入范围可能从5000人民币到500,000人民币,这使得对这些变量相对影响的有效比较变得困难。3.3 回归中的变量处理标准化回归模型通过对所有自变量进行标准化处理得到。标准化严格适用于连续变量(即基于间隔或比率尺度测量的变量)。通过对所有连续自变量应用标准化公式:生成新变量,其中标准化后的变量具有期望值为0且方差为1的特性。由此,所有连续自变量被转换为同一尺度,从而使得跨标准化单位的比较成为可能。标准化回归模型中的估计回归参数可解释为:自变量每变化一个标准差,因变量的变化量。大多数统计软件包会在普通最小二乘回归(OLS)中提供生成标准化回归模型输出的选项。若该选项未直接提供,大多数软件也支持对变量进行标准化处理,进而将其用于回归分析。3.3 回归中的变量处理2.变量变换线性回归的应用要求变量间关系为线性(少数例外如多项式回归模型)。这种线性是参数线性限制的直接结果。然而,物理、工程或社会现象未必总能以线性关系最佳表示,非线性关系往往更为合适。幸运的是,非线性关系可在线性回归框架内得到处理。能够容纳非线性关系为寻找两个或多个变量间合理且合适的关系提供了极大的灵活性。我们将介绍并讨论两种示例变换在回归中的应用及其带来的后果和影响。在线性回归建模框架中使用变量变换的一些基本准则值得注意:1.变量间的线性关系要求:回归建模框架要求因变量与所有自变量之间为线性关系,少数例外是变量的多项式表达。2.
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 水泵工安全操作规程15篇
- 2026红枣销售面试题目及答案
- 数字信号处理课程总结
- 2026会务组织面试题及答案
- 氨酚羟考酮用药指导-1
- 2026交通安全面试题及答案
- 实验室生物安全法律法规汇编与解读
- 水库及大坝施工方案
- 智能USB充电面板赋能银发族:适老化智能终端的交互新体验
- 人工智能在医疗影像诊断中的应用前景分析
- 公司转底炉工工艺技术规程
- 登革热和基孔肯雅热培训知识考试试题含答案
- 员工通勤交通安全培训课件
- 2024-2025学年广州市三校联考(广大附、铁一、广外)高一(上)期中英语试题及答案
- 旱改水农田管护协议书4篇
- (正式版)DB42∕T 2305-2024 《高品质住宅技术标准》
- 《老年人健康管理实务》老年保健与管理专业全套教学课件
- osahs讲解教学课件
- 特种设备安全风险分级管控与隐患排查治理体系建设指导手册
- DZ/T 0132-1994钻孔压水试验规程
- T/CNCA 038-2022车用甲醇汽油(M15)
评论
0/150
提交评论