单变量的描述统计_第1页
单变量的描述统计_第2页
单变量的描述统计_第3页
单变量的描述统计_第4页
单变量的描述统计_第5页
已阅读5页,还剩28页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

单变量的描述统计统计学基础课程·数据描述与分析方法全景Contents课程目录单变量的描述统计——从数据类型到分布形态,系统掌握描述统计的核心方法与可视化工具。01单变量数据的基本类型02集中趋势的度量方法03离散程度的度量方法04分布形态的描述指标05统计图表与可视化方法06常见概率分布模型CHAPTER01单变量数据的基本类型理解数据的本质属性,是一切统计分析的起点Chapter01·UnivariateData什么是单变量数据单变量数据是指对每个观察单位仅测量一个特征或属性的数据集合。它是统计分析中最基础的数据形态,虽不涉及变量间关系,却能完整揭示单一属性的分布规律与变异特征。数据分析工作场景01单变量(Univariate)中"Uni"意为"一",表示每次观测只记录一个变量的值,如100名员工各自的年薪。每次观测→一个值02核心目的是描述一个特征在不同观察单位间的变异模式,而非探索变量间的因果或相关关系。描述变异模式03可分为描述性统计和推断性统计两个层次:前者总结样本特征,后者据此推断总体参数。描述性+推断性单变量数据分类分类数据与数值数据单变量数据按测量性质分为分类数据和数值数据两大类型。分类数据以标签或名称标识属性类别,数值数据以数字量化特征大小,两者在适用的统计方法和图表类型上存在根本差异。TYPEA分类数据(Categorical)由非数值观察组成,将每个元素归入特定类别,如性别(男/女)、血型(A/B/O/AB)、学历(本科/硕士/博士)通常使用名义尺度(Nominal)或有序尺度(Ordinal)测量,前者类别无先后之分,后者类别存在等级顺序适用频数统计和百分比分析,常用条形图、饼图展示分布,无法进行加减乘除运算Nominal·Ordinal标签归类·无运算意义TYPEB数值数据(Numerical)由数值型观察组成,通过区间尺度(Interval)或比率尺度(Ratio)测量获得,如温度37.2°C、收入8500元可进一步分为离散型(有限或可数无限个取值)和连续型(取值为某个数值区间,如体重、时间)支持均值、标准差、相关系数等运算,适用直方图、箱线图、散点图等可视化方法Interval·Ratio数值量化·可运算比较MeasurementScales四种测量尺度测量尺度决定了数据的数学性质和可用的统计方法。尺度越高,可执行的数学运算越丰富,分析方法的选择空间也越大。01名义与有序尺度N名义尺度(Nominal):仅用于分类标记,类别间无大小顺序。如血型(A/B/O)、国籍、职业类型O有序尺度(Ordinal):类别间有明确等级或顺序,但间距不一定相等。如教育程度、满意度评级02区间与比率尺度I区间尺度(Interval):数值间距相等且有意义,但无真正零点。如摄氏温度、智商分数,可做加减但不能做倍数比较R比率尺度(Ratio):具有真正零点,支持全部四则运算。如身高、体重、收入,可以说"A的重量是B的两倍"03尺度选择的方法论意义低尺度数据不可使用为高尺度设计的方法:名义数据不能算均值,有序数据不能算标准差,违反将导致无效结论高尺度数据可降级使用低尺度方法:比率数据可按区间分组统计频率,但会损失部分信息DATATYPESINSURVEY实例:大学生消费调查中的数据类型同一研究场景中,不同调查问题会产生不同数据类型。准确识别每个变量的数据类型,是选择正确统计方法和图表的前提条件,也是避免分析错误的第一道防线。大学生消费调查:问题与数据类型对照调查问题示例回答数据类型测量尺度你每月网购几次?8次离散数值比率尺度你常用的购物平台?淘宝/京东/拼多多分类数据名义尺度你对物流速度的满意度?非常满意/满意/一般分类数据有序尺度上月网购总支出(元)?1,256.80元连续数值比率尺度你的年级?大一/大二/大三/大四分类数据有序尺度同一调查问卷中,不同问题产生不同数据类型和测量尺度,决定了后续可选用的统计分析方法CHAPTER02集中趋势的度量方法用一个数值概括数据的中心位置,是描述统计的核心任务DescriptiveStatistics·CentralTendency算术平均数(Mean)算术平均数是最常用的集中趋势指标,它利用了全部数据信息且数学性质优良,但对极端值高度敏感。在数据存在明显偏态或异常值时,均值的代表性会显著下降,需搭配中位数共同使用。01为μ,是最广泛使用的中心位置估计量02离差平方和达到最小03实际水平04适用尺度适用于区间尺度和比率尺度的数值型数据,不适用于名义数据和有序数据统计学课堂教学场景DESCRIPTIVESTATISTICS·位置度量中位数(Median)中位数是将数据按大小排序后位于正中间位置的值,它不受极端值影响,是偏态分布数据集中趋势的稳健估计量。但其仅依赖排序信息,未充分利用数值大小,在对称分布中效率低于均值。01定义与计算将n个观测值从小到大排列,n为奇数时取第(n+1)/2个值,n为偶数时取中间两个值的算术平均,记为Me或M。02核心优势:稳健性无论数据中存在多大的极端值,中位数只取决于排序后的中间位置,不会被拉偏。03右偏分布中的代表性在收入、房价等右偏分布数据中,中位数比均值更具代表性:2023年某市居民收入中位数4,200元而均值6,800元。04数据尺度限制适用于有序尺度及以上的数据,对于名义分类数据无法计算中位数,因为类别之间不存在可排序的大小关系。集中趋势度量众数与几何平均数众数是唯一适用于分类数据的集中趋势指标,通过频次最高值反映数据的典型类别;几何平均数则专门处理增长率、比率等乘性数据,两者在特定场景下不可替代。众数Mode01数据中出现频率最高的值,记为Mo,是唯一可用于名义数据的集中趋势指标,如"调查中最受欢迎的品牌为A(占38%)"02可能不唯一:双峰分布有两个众数、多峰分布有多个众数,均匀分布中每个值频率相同则无众数03连续型数据中原始值可能各不相同导致无众数,需先分组编制频率分布表,取频率最高组的组中值作为众数估计几何平均数GeometricMean01n个正数之积的n次方根,专门用于计算比率型数据的平均变化率,如连续三年增长率10%/20%/-5%的复合年均收益02几何平均数始终小于或等于算术平均数(AM-GM不等式),当数据波动越大时两者差距越明显G=(x₁·x₂·…·xₙ)1/n几何平均数计算公式ConcentrationTendency三大集中趋势指标的综合对比均值、中位数和众数各有其适用场景和局限性。选择集中趋势指标时,需综合考虑数据类型、分布形态和极端值情况,在实际分析中通常应同时报告多个指标以提供完整的数据画像。均值、中位数、众数核心特征对比对比维度算术平均数中位数众数信息利用利用全部数据仅利用排序位置仅利用频次极端值影响高度敏感完全不受影响通常不受影响适用数据区间/比率尺度有序及以上所有类型唯一性始终唯一始终唯一可能不唯一最佳场景对称分布数值数据偏态分布/有异常值分类数据/典型值三个指标各有优劣,实际分析中应根据数据特征选择或同时报告多个指标CaseStudy案例:三大指标在偏态数据中的表现在偏态分布中,均值、中位数和众数的数值大小和相对位置会呈现规律性变化:右偏分布中均值>中位数>众数,左偏分布则相反。三者的偏离程度本身即为分布形态的直观判据。0110户家庭年收入(万元):8/9/10/10/11/12/13/14/15/380,均值46.2万被极端高值严重拉高,失去代表性02中位数11.5万和众数10万更接近大多数家庭的真实收入水平,体现了中位数在偏态数据中的稳健优势03三者的大小关系"均值(46.2)>中位数(11.5)>众数(10)"是典型的右偏(正偏态)分布特征,尾部拉向右侧04实践建议:对此类右偏收入数据,报告中应优先使用中位数(11.5万),并附注均值(46.2万)和样本量以供参考居民社区场景·收入调查的典型研究对象CHAPTER03离散程度的度量方法量化数据的变异与分散程度,揭示集中趋势指标背后的真实面貌DISPERSIONMEASURES极差与四分位距极差是最简单的离散度量但仅依赖两个极端值,信息利用不充分;四分位距(IQR)衡量中间50%数据的跨度,稳健性更强,是箱线图和异常值识别的核心依据。极差(Range)极差=最大值−最小值,计算最简便,但仅利用了两个极端数据点,完全忽略了中间数据的分布形态。对样本量敏感:样本越大,越可能包含更极端的值,导致极差人为增大,不适合跨样本量的离散程度比较。MAX−MIN四分位距(IQR)IQR=Q3(第75百分位)−Q1(第25百分位),衡量中间50%数据的跨度,不受极端值影响,稳健性远优于极差。异常值判定规则:数据点<Q1−1.5×IQR或>Q3+1.5×IQR时被标记为潜在异常值(Outlier),广泛应用于数据清洗。Q3−Q1离散程度度量方差与标准差方差和标准差是最重要的离散度量指标,它们利用了每个数据点与均值的偏离信息。样本方差除以n-1(贝塞尔校正)以获得总体方差的无偏估计,标准差则恢复了与原始数据一致的度量单位。01方差(Variance)=各观测值与均值之差的平方和÷(n-1),样本方差记为s²,总体方差记为σ²,利用全部数据信息衡量离散程度02贝塞尔校正(除以n-1而非n)——样本均值本身从数据中估计,消耗了1个自由度,除以n-1可校正系统性低估03标准差(StandardDeviation)=方差的算术平方根,记为s或σ,单位与原始数据一致,比方差更直观易解释04经验法则:对于近似正态分布的数据,约68%的观测值落在均值±1个标准差内,约95%落在均值±2个标准差内DESCRIPTIVESTATISTICS·RELATIVEDISPERSION变异系数(CoefficientofVariation)变异系数(CV)是标准差与均值的比值,作为无量纲的相对离散指标,解决了不同量纲或不同均值水平的数据集之间无法直接比较离散程度的问题。01CV=(标准差s÷均值x̄)×100%,消除了度量单位和均值水平的影响,使得不同量纲的数据可以公平比较离散程度。σ/μ×100%02应用场景:比较身高(cm)与体重(kg)的变异大小、比较不同股票收益率的波动风险、比较不同生产线产品质量的稳定性。身高·体重·股票·产线03局限性:当均值接近零时CV会趋于无穷大,因此不适用于均值为零或接近零的变量(如温度变化量、利润变动)。μ≈0→CV→∞水稻种植场景—跨品种产量稳定性比较的典型案例CASESTUDY案例:两班考试成绩的离散程度比较两组均值相同的数据可能具有截然不同的离散特征。仅报告集中趋势而不报告离散程度,会导致对数据分布的严重误判。A班与B班统计学期末考试成绩描述统计对比统计指标A班B班解读均值78分78分两班平均水平相同中位数79分76分B班分布略向左偏标准差6分14分B班成绩分化远大于A班极差25分(65-90)55分(42-97)B班极值差距更大变异系数7.7%17.9%B班相对离散度为A班的2.3倍均值相同但离散程度迥异,说明仅报告集中趋势不足以描述数据全貌Chapter04分布形态的描述指标用偏度和峰度量化数据分布的形状特征DESCRIPTIVESTATISTICS偏度(Skewness)偏度衡量数据分布偏离对称性的程度和方向。偏度为0表示对称分布,大于0为右偏(正偏态),小于0为左偏(负偏态)。偏度值不仅揭示分布形状,还暗示了均值与中位数的相对位置关系。偏度公式与本质偏度=[n/((n-1)(n-2))]×Σ[(xi-x̄)/s]³,本质是标准化离差的三次方的加权和,三次方保留了偏离方向的符号信息偏度≈0·对称分布偏度≈0表示近似对称分布(如身高、测量误差),此时均值≈中位数≈众数,三个中心指标可以互换使用偏度>0·右偏/正偏态偏度>0为右偏/正偏态(如收入、房价),右尾拖长,均值>中位数>众数,高值端有少量极端大值拉高了均值偏度<0·左偏/负偏态偏度<0为左偏/负偏态(如简单考试成绩、寿命数据),左尾拖长,均值<中位数<众数,低值端有少量极端小值DESCRIPTIVESTATISTICS峰度(Kurtosis)峰度衡量数据分布的尖锐程度与尾部厚薄。超额峰度>0为尖峰厚尾,<0为平峰薄尾,在金融风险管理中具有关键意义。01计算公式—标准化离差四次方的加权和,四次方放大远离均值的极端值影响Σ[(xᵢ−x̄)/s]⁴02正态基准—正态分布峰度=3,超额峰度=峰度−3=0,以此为基准判断分布形态Excess=003尖峰厚尾—超额峰度>0,中心峰更尖峭,尾部更厚,极端值概率高于正态分布Leptokurtic04平峰薄尾—超额峰度<0,分布更扁平均匀,尾部较薄,极端值概率低于正态分布Platykurtic金融交易场景—峰度在极端行情风险评估中具有关键应用CASESTUDY·分布形态案例:电商订单金额的分布形态分析偏度和峰度的联合分析能够完整刻画数据分布的形状特征,高度偏态和尖峰厚尾数据通常需要数据变换或非参数方法。011000笔电商订单金额偏度2.3(高度右偏),大多数订单集中在低金额区间,少数大额订单形成长右尾。这种分布形态在电商数据中极为常见,反映了消费行为的典型特征。偏度2.302超额峰度5.8(显著尖峰厚尾),中心集中度极高,极端大额订单概率远超正态预期,存在"肥尾"风险。这意味着传统基于正态假设的统计推断可能产生偏差。峰度5.803Shapiro-Wilk或Kolmogorov-Smirnov检验可定量验证正态性假设,偏度峰度联合检验(Jarque-Bera)也常用。这些检验方法帮助研究者判断是否需要对数据进行变换处理。Jarque-BeraTest04高度右偏数据可取对数(ln)变换使其接近正态分布,或直接使用非参数统计方法(如Mann-WhitneyU检验)。对数变换能有效压缩极端值的影响,改善模型拟合效果。LogTransformChapter05统计图表与可视化方法将数据转化为直观的图形表达,是描述统计的核心呈现手段DESCRIPTIVESTATISTICS频率分布表与条形图频率分布表是数据整理的基础工具,通过统计各类别的频数和频率将原始数据结构化。条形图是分类数据的标准可视化方式,各柱之间保留间隔以体现类别的离散性,柱高直接反映各类别的频次或比例。频率分布表FREQUENCYTABLE分类数据整理分类数据直接统计各类别的频数(AbsoluteFrequency)和频率(RelativeFrequency),频率之和恒等于1(或100%)。频数反映绝对数量,频率便于跨数据集比较。数值数据分组数值型数据需先确定组数(Sturges公式:k≈1+3.322×log₁₀n)和组距,再统计落入各组的频数,形成分组频率分布表,使大量原始数据系统化呈现。条形图BARCHART基本构成与适用场景横轴为分类类别,纵轴为频数或频率,各柱之间有间隔以体现类别的离散性,适用于名义尺度和有序尺度数据。柱形高度直观反映各类别数量差异。与直方图的核心区别条形图用于分类数据(柱间有间隔),直方图用于连续数值数据(柱间无间隔),两者不可混用。这是区分离散型与连续型数据可视化的关键准则。单变量的描述统计直方图与频率多边形直方图通过相邻矩形的面积展示连续数值数据的频率分布,是判断分布形态(对称/偏态、单峰/多峰)的核心工具。频率多边形以折线形式勾勒分布轮廓,便于多组数据叠加比较。面积=频率矩形无间隔排列,面积代表频率;组距相等时高度即代表频数。每个矩形覆盖一个组距区间,直观呈现数据聚集区域。组数权衡过少掩盖细节,过多产生噪音,一般建议5–20组。组数选择需兼顾样本量与数据变异程度,Sturges公式可提供参考。折线叠加连接矩形顶部中点形成频率多边形,可叠加多组数据对比。折线图形式更简洁,便于观察分布趋势与组间差异。形态判读直观判断对称性、偏态、峰态,识别离群值孤立柱。正态分布呈钟形,偏态分布拖尾方向指示极端值位置。大学生在图书馆学习统计教材StatisticalCharts饼图与茎叶图饼图直观展示部分与整体的比例关系,适合类别较少(≤6)的分类数据;茎叶图巧妙地将分布形态展示与原始数据保留合二为一,是小样本探索性数据分析(EDA)的经典工具。饼图PieChart每个扇形面积与其代表的频率成正比,直观展示"部分占整体"的比例关系,适用于类别较少(≤6类)的分类数据展示。局限性:人眼对面积和角度的判断精度低于对长度的判断,类别超过6个时难以区分,专业分析中常建议用条形图替代。≤6类别上限茎叶图Stem-and-Leaf"茎"为数值的高位数字,"叶"为低位数字,如数据78中7为茎、8为叶,既展示分布形态又保留每个原始数据值。相当于横放的直方图,适用于小样本(20–200个)的探索性数据分析(EDA),在大样本中叶子过多会变得拥挤难以阅读。20–200样本量范围单变量的描述统计箱线图(BoxPlot)箱线图通过"五数概括"(最小值、Q1、中位数、Q3、最大值)在一张图中同时展示数据的集中趋势、离散程度、偏态方向和异常值,是多组数据分布比较最高效的可视化工具之一。01核心构成箱体下界=Q1、箱内横线=中位数、箱体上界=Q3;下须延伸至≥Q1−1.5×IQR的最小值,上须延伸至≤Q3+1.5×IQR的最大值。五数概括完整呈现数据分布骨架。02离散与偏态箱体高度即IQR,反映中间50%数据的离散程度;中位数线在箱内的位置反映偏态方向——居中对称,偏上左偏,偏下右偏。一眼即可判断分布形态特征。03异常识别超出须端的点被标记为离群点(Outlier),为数据清洗与质量检查提供直观视觉线索,便于快速识别潜在录入错误或极端个案,是数据预处理的重要辅助。04多组比较多组并列箱线图是探索性数据分析(EDA)中比较子群体分布差异的标准工具,可在单张图中高效对比多组数据的位置、离散和偏态,大幅提升分析效率。CHAPTER06常见概率分布模型从数据描述走向理论建模,理解数据生成背后的概率规律DISCRETEDISTRIBUTIONS常见离散概率分布离散概率分布描述取值为有限或可数无限个整数的随机变量。伯努利、二项与泊松分布是三大核心离散分布,递进关系明确,分别对应单次试验、重复独立试验与稀有事件计数。伯努利分布单次试验仅有两个结果(成功/失败),P(X=1)=p,P(X=0)=1−p,是全部离散分布的基础构件。Bernoulli二项分布n次独立伯努利试验中成功次数X的分布,均值=np,方差=np(1−p),如20个产品中的次品数。B(n,p)泊松分布描述单位时间/空间内稀有事件发生次数,均值=方差=λ,如某路口日均事故数2.3次。P(λ)二项→泊松近似当n很大且p很小(n≥100,np≤10)时,B(n,p)可用P(λ=np)近似,大幅简化计算。λ=npProbabilityDistribution正态分布NormalDistribution正态分布是统计学最重要的连续概率分布,其对称钟形曲线由均值μ和标准差σ两个参数完全决定。中心极限定理赋予了它"万物归一"的理论地位,大量推断统计方法均建立在正态性假设之上。01概率密度函数由μ(位置参数)和σ(尺度参数)完全决定,记为X~N(μ,σ²),曲线关于μ对称,μ处取得最大值,向两侧渐近趋于零0268-95-99.7法则:约68.3%的观测值落在μ±1σ内,约95.4%落在μ±2σ内,约99.7%落在μ±3σ内,为快速概率估计提供了直觉工具03标准正态分布Z~N(0,1)是μ=0、σ=1的特殊情形,任意正态变量可通过Z=(X-μ)/σ标准化,从而查标准正态分布表获得概率04中心极限定理(CLT):当样本量n足够大时,独立同分布随

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论