版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第一章描述性统计第1章描述性统计本章探讨用于总结和解释数据的方法与技术。我们先从数值描述性度量入手,这些通常被称为点估计量的度量,通过使用单一值(或点)来估计未知的总体参数,从而支持对总体的推断。本章还介绍了常用的数据图形表示方法。相对于图形方法,数值方法提供了精确且客观确定的值,这些值易于操作、解释和比较。它们允许对数据进行比图形摘要所传达的一般印象更细致的分析,这在数据代表需要进行总体推断的样本时尤为重要。尽管本章集中讨论统计分析的一些基本和基础问题,但有众多全面的统计学入门教材可以为感兴趣的读者提供更详细的信息。例如,Aczel(1993)和Keller与Warrack(1997)详细描述了描述性统计和图形技术的示例。Tukey(1977)的著作是探索性数据分析和图形技术的经典参考文献。对于对估计量性质感兴趣的读者(第1.6节),Gujarati(1992)和Baltagi(1998)是优秀的、数学严谨的资料来源。•1.1相对位置指标•1.2集中趋势指标•
1.3离散程度指标•1.4偏度和峰度•1.5关联度量•1.6估计量性质章节目录1.1相对位置指标1.1相对位置指标一组数值观测值可以按从小到大的顺序排列。这种排序允许定义数据的边界,并支持比较特定观测值的相对位置。以在北京市某路段测量车辆行驶速度为例,驾驶员的速度会与测量期间该路段所有驾驶员的速度进行比较,其相对速度通过百分位数来衡量。假设速度的第85百分位数为60km/h,这意味着85%的观测驾驶员行驶速度低于60km/h,而15%的驾驶员速度高于此值。百分位数的定义为:样本中的值,其下方有P%的数据。对于足够大的样本,第P个百分位数的位置为:其中是样本量。四分位数是将数据分为四等份的百分点:四分位距(IQR)作为数据离散程度的度量,定义为第一和第三四分位数之间的数值差。1.第一四分位数(下四分位数):下方包含25%的数据2.第二四分位数(中位数):下方包含50%的数据3.第三四分位数(上四分位数):下方包含75%的数据1.2集中趋势度量1.2集中趋势度量四分位数和百分位数是给定数据集中各点相对位置的度量。中位数是一个能体现数据“中心性”或集中趋势的重要指标,它将数据分为两部分,一半数据点位于中位数之上,另一半位于其下。在众多集中趋势度量中,算术平均数,即样本均值或期望值,应用最为广泛。样本均值用于衡量样本观测值的集中趋势或平均水平,由于样本不同,样本均值也会有所差异,因此它是一个随机变量。一组测量值的均值定义为:其中是样本量。当考察整个总体时,样本均值被总体均值取代。与样本均值不同,总体均值是常数。总体均值的公式为:其中是总体的大小。1.2集中趋势度量一组观测值的众数(可能有多个)是出现频率最高的值,或最常出现的结果,严格适用于离散变量(名义和有序尺度变量)以及计数数据。从概率上讲,它是样本中最可能的结果;其出现次数多于其他任何值。众数也可以作为集中趋势的度量。这三种集中趋势度量各有优缺点。均值利用并总结了数据中的所有信息,是一个单一的数值度量,具有一些理想的数学性质,使其在许多统计推断和建模应用中非常有用。相比之下,中位数是排序后数据的中心点。计算中位数时,不考虑数据点在数轴上的精确位置;只需要它们相对于中心观测值的相对位置。这正是中位数的主要优点;它对数据中的极端观测值或异常值具有抗性。总体而言,均值是最常用的集中趋势度量;然而,在数据包含大量异常观测值的情况下,中位数可能是一个更可靠的度量。类似于中位数,稳健的统计建模方法旨在抵抗极端观测值的影响。当数据对称且单峰时,众数、中位数和均值大致相等(第1.4节讨论非对称分布中这三种度量的相对位置)。最后,如果数据是定性的(在名义或有序尺度上测量),使用均值或中位数是没有意义的,必须使用众数。对于名义数据,众数是包含最多观测值的类别。1.3离散程度度量1.3离散程度度量离散程度是一个统计术语,用于描述和量化数据围绕中心(通常是均值)的分散或离散程度。在大多数实际情况下,仅了解样本的平均值或期望值不足以充分理解数据。样本离散程度提供了数据相对于均值(或其他集中趋势度量)的分散程度的度量。有几种有用的离散程度度量,或称为离散度。之前讨论过的一种是四分位距。另一种是极差——数据中最大值与最小值之间的差。尽管极差和四分位距都能测量数据的离散程度,但四分位距对异常观测值更具抗性。两种最常用的离散程度度量是方差及其平方根,即标准差。低离散性高离散性高离散和低离散性数据示例1.3离散程度度量方差和标准差通常比极差更有用,因为它们与均值一样,利用了观测值中包含的所有信息。一组观测值的方差,或样本方差,是各个观测值与均值的平均平方差,它因样本而异。样本方差通常用作总体方差的估计量,由下式给出:当一组观测值构成整个总体时,方差用表示。与样本方差不同,总体方差是常数,由下式给出:其中式(1.3)中的被取代。1.3离散程度度量由于方差的计算涉及对原始数据测量尺度的差值进行平方,所以其测量单位是原始测量尺度的平方。例如,以米为单位测量的距离,其方差的单位就是平方米。虽然方差是衡量两组测量值相对离散性的有用指标,但人们通常希望用与原始数据相同的测量单位来表示离散性。这种度量就是方差的平方根,通常称为标准差。样本标准差和总体标准差的公式分别为:与之前的结果一样,样本标准差是一个随机变量,而总体标准差是一个常数。1.3离散程度度量在统计学实践中,一个经常出现的问题是:为何计算总体标准差时除以,而计算样本标准差时却除以。当从总体中抽取样本时,我们需要一个能近似总体方差的样本方差。更具体地说,我们希望一个统计量能够满足:由大量样本计算出的样本方差的平均值等于(真实的)总体方差。实际上,公式(1.3)实现了这一目标。对此有两种解释:(i)由于标准差的计算利用了样本均值,结果会“损失”一个自由度,即只剩下个独立观测值用于计算方差;(ii)在计算小样本的标准差时,所得标准差往往会被低估。对于小样本,通过在分母中使用来进行修正(需注意,随着增大,这种修正的影响会减小,因为根据中心极限定理,较大的样本能更好地近似其抽取自的总体)。1.3离散程度度量标准差是一种绝对离散程度的度量;它不考虑总体或样本中数值的大小。有时,需要一种考虑观测值大小的离散程度度量(相对离散程度)。变异系数(CoefficientofVariation,CV)正是这样一种度量。它提供了一种相对离散程度的度量,其中离散程度以均值的比例表示。对于样本,变异系数的计算公式为:1.3离散程度度量一个广泛归功于切比雪夫的数学定理,建立了一个通用规则:对于样本或总体中的所有观测值,至少有的观测值会落在均值的个标准差范围内,其中不一定是整数。对于近似钟形的正态分布观测值,经验法则表明,以下比例的测量值将分别落在均值的1、2或3个标准差范围内:标准差是一种绝对离散程度的度量;它不考虑总体或样本中数值的大小。有时,需要一种考虑观测值大小的离散程度度量(相对离散程度)。变异系数(CoefficientofVariation,CV)正是这样一种度量。它提供了一种相对离散程度的度量,其中离散程度以均值的比例表示。对于样本,变异系数的计算公式为::包含约68%的观测值:包含约95%的观测值:包含约99%的观测值例1.1为简化分析,暂不考虑季节、道路类型、公路等级及观测年份等因素,现需对北京市朝阳区某路段观测到的速度数据进行基本描述性统计分析。大多数具备统计功能的商业软件均可处理此类基础统计计算。表1.1给出了速度数据的描述性统计结果。描述性统计结果显示,所采集的整个样本的平均车速为58.86km/h,且速度观测值的变异性较小(标准差4.41,变异系数0.075)。均值与中位数几乎相等,表明速度样本的分布相当对称。该数据集包含其他信息,如观测年份、季节(季度)、公路等级以及观测点位于城市或农村区域——这些信息可能共同构建更完整的样本速度特征图景。例1.1表1.1北京市朝阳区道路速度的描述性统计统计量值N(观测数量)1296均值58.86标准差4.41方差19.51变异系数0.075中位数58.5表1.2郊区与城市道路速度的描述性统计统计量农村道路城市道路N888408均值58.7959.0标准差4.603.98方差21.1915.87变异系数0.0780.067中位数58.259.21.4偏度和峰度1.4偏度和峰度频率分布的两个重要特征是偏度和峰度。偏度(Skewness)是衡量频率分布不对称程度的指标,通常被称为三阶中心矩(thirdcentralmoment),而方差是二阶中心矩。一般来说,若概率分布的右尾比左尾更长,则称该分布为右偏(或正偏)分布;反之,若左尾更长,则为左偏(或负偏)分布。当分布右偏时,均值位于中位数右侧,中位数又位于众数右侧;左偏分布则相反。总体偏度参数通过将三阶中心矩除以(消除量纲影响)计算得到,其样本估计值()的计算公式为:1.4偏度和峰度如果一个样本来自正态分布的总体,那么参数服从均值为0、标准差为的正态分布。对称分配均值=中位数=众数右偏科分配众数中位数平均数众数中位数平均数左偏科分配分布的偏度1.4偏度和峰度峰度是衡量频率分布“扁平程度”(相对于“尖峰程度”)的指标。基于样本的估计值是整个样本中的平均值。峰度通常被称为四阶中心矩(fourthcentralmoment)。对于正态分布,参数的值为3。若该参数大于3,数据通常在均值附近聚集(尖峰分布,leptokurtic);若小于3,则分布的峰比正态分布更“扁平”(平峰分布,platykurtic)。样本峰度参数通常会作为众多统计软件包的标准输出呈现,其计算公式为:1.4偏度和峰度在大多数实际应用中,样本峰度参数会减去3,使得尖峰分布的样本峰度值为正,而平峰分布的样本峰度值为负。尖峰分布平峰分布分布的峰度例1.2回顾示例1.1中的北京市朝阳区速度数据,我们进一步分析城市道路与郊区道路的速度分布形态。结果显示:尽管两种道路的偏度相近,但峰度差异更大。郊区道路的峰度值为2.51,接近正态分布;而城市道路的峰度值为0.26,呈现显著的平峰特征,即分布较为扁平。•合并所有道路数据时,偏度为−0.05;•郊区道路的偏度为0.056,表明分布接近对称;•城市道路的偏度为−0.37,呈现左偏(负偏)分布。1.5关联度量1.5关联度量到目前为止,我们的焦点一直集中在用于量化单个变量或测量属性的统计量上。例如,均值和标准差提供了关于单个变量测量性质的有用信息。当然,也存在能够揭示变量之间潜在关系的统计量。两个随机变量之间的相关性是衡量它们线性关系的指标。总体线性相关参数是常用的衡量两个变量线性相关程度的指标。相关参数的取值范围是[-1,1]。当时,意味着两个变量之间不存在线性关联。不过,即便,这两个变量仍可能存在非线性联系。当时,两个变量呈现正线性相关关系,也就是说,当其中一个变量的值增大时,另一个变量的值也会增大。当
时,所研究的两个变量之间呈现出“完全”的正斜率直线关系。当时,两个变量之间呈现出负线性相关关系。最后,当时,两个变量之间呈现出成比例的负直线关系。1.5关联度量相关性直接源自另一种关联度量——协方差。假设有两个服从正态分布的随机变量和,其总体均值分别为和,总体标准差分别为和。和的总体协方差与样本协方差分别定义如下:1.5关联度量如方程所示,和的协方差是和与其均值偏差的乘积的期望值。当两个变量一起增加时,协方差为正;当两个变量朝相反方向变化时,协方差为负;当两个变量没有线性关系时,协方差为零。为了弥补协方差缺乏标准化的情况,将协方差除以标准差以获得一个限制在[-1,1]范围内的值的度量。这个度量称为皮尔逊积矩相关参数,或简称为相关参数。总体和样本的和的相关参数分别定义为:1.5关联度量两个变量之间的正相关(上)和负相关(下)例1.3利用上海市2020-2023年交通数据,研究人员对年度航空旅客吞吐量(万人次)、上海市人均GDP(万元)及航空燃油价格(元/升)之间的相关性进行了考察。通过居民消费价格指数(CPI)将货币价值换算为2020年基准值后,研究发现旅客吞吐量与人均GDP的相关系数为0.89,表明经济增长与航空出行需求呈强正相关;而旅客吞吐量与燃油价格的相关系数为-0.65,显示燃油价格上涨会抑制航空出行需求。需注意相关性并不等同于因果关系。例如,上海市地铁网络扩张与航空旅客吞吐量的相关系数为-0.78,呈现强负相关,但这并非直接因果关系,而是由于地铁网络完善分流了短途出行需求。当变量为有序尺度或不满足正态性时,应使用斯皮尔曼等级相关系数。计算公式为:其中为两变量排序的差值。1.6估计量的性质1.6估计量的性质在前面几节计算出的样本统计量,如样本均值、方差、标准差等,都被用作总体参数的估计量。而在实际中,总体参数(通常简称为参数),比如总体均值和方差,都是未知常数。在日常应用中,样本均值被用来估计总体均值,样本方差用于估计总体方差,诸如此类。然而,这些统计量都是随机变量,因而依赖于样本。用于估计真实总体参数的“优良”统计估计量需满足四个重要性质:无偏性、有效性、一致性和充分性。1.6估计量的性质1.6.1无偏性如果对于一个总体参数存在多个估计量,且其中一个估计量与未知参数的真实值一致,那么这个估计量就被称为无
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 运营部团队考评表
- 和谐校园从我做起:小学生文明礼仪教育小学主题班会课件
- 教育工作者教学质量与学生进步绩效评定表
- 服装行业智能制造与个性设计方案
- 考古研究员绩效考核表
- 关于开展2026年市场调研的通知函7篇
- 中小学信息技术教育课程资源开发与应用指导书
- 产品测试流程规范十二项关键步骤手册
- JJF(纺织) 020-2024 织物厚度仪校准规范
- 安全主管安全事件绩效评定表
- 尾矿库闭库后的环境监测施工方案
- 消毒供应中心打包工作规范
- 2025国际胰腺病学会急性胰腺炎修订指南解读课件
- 异物来源及异物防止培训
- DB54T 0275-2023 民用建筑节能技术标准
- 六年级语文非连续性文本阅读真题20套
- 医防融合培训课件
- 2025年货运驾驶员安全培训试题及答案
- 学堂在线 生活、艺术与时尚:中国服饰七千年 期末考试答案
- 【真题】青岛版四年级下学期期末数学考试卷(含解析)2024-2025学年山东省潍坊市诸城市
- 大豆异黄酮对安格斯肉牛免疫性能、抗氧化能力及血清代谢物的影响
评论
0/150
提交评论