【学习课件】第十一讲《统计学》讲义_第1页
【学习课件】第十一讲《统计学》讲义_第2页
【学习课件】第十一讲《统计学》讲义_第3页
【学习课件】第十一讲《统计学》讲义_第4页
【学习课件】第十一讲《统计学》讲义_第5页
已阅读5页,还剩26页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第十一讲《统计学》讲义(1)从数据思维到统计推断:系统掌握经管类核心方法论Contents课程目录从基础概念到进阶方法,系统构建统计学知识框架01统计学基础概念与发展脉络02描述统计:数据搜集、整理与特征测度03推断统计:抽样估计与假设检验04进阶方法:方差分析、回归分析与时间序列CHAPTER01统计学基础概念与发展脉络从古典国势学到现代大数据科学的三百年演进之路LECTURE01统计学的定义、性质与发展简史统计学是一门关于数据搜集、整理与分析的科学,核心目的在于探索数据背后蕴含的内在数量规律性。它既具有严密的数学基础(科学性),又需要在模型选择与问题解读中展现判断力(艺术性),是经管类专业最重要的方法论基础课之一。高校统计学课堂教学场景研究对象统计学研究对象是社会经济现象的数量方面,通过资料的搜集、整理、分析和推断,阐明现象本质及其内在规律性三阶段演进学科发展经历三个阶段:17–18世纪古典国势学与政治算术、19–20世纪描述统计与推断统计体系建立、21世纪大数据与计算统计学的融合科学与艺术统计学既是科学也是艺术:科学性体现在以概率论为数学基础,艺术性体现在面对实际数据时需要灵活选择方法和模型广泛应用应用领域广泛覆盖经济管理、医学研究、工程技术和社会科学,顺应大数据分析需求已成为现代决策的核心工具STATISTICALCONCEPTS数据类型与统计学基本概念体系统计学的基本概念体系包括数据类型划分、总体与样本的关系、参数与统计量的区分,以及统计指标与指标体系的构建。正确理解这些概念是选择合适统计方法的前提,也是避免"用错方法得出错误结论"的第一道防线。数据类型的四种划分01定类数据仅表示类别区分(如性别、行业),只能做频数统计和众数计算02定序数据有等级顺序但间距不等(如学历、满意度),可计算中位数和分位数03定距数据有等距刻度但无绝对零点(如温度、智商),可计算均值和标准差04定比数据具有绝对零点(如收入、重量),支持所有数学运算和比率比较核心术语与概念框架01总体与样本:总体是研究对象的全体集合,样本是从中抽取的部分单位,统计推断的本质是用样本信息推断总体特征02参数与统计量:参数描述总体特征(如总体均值μ),统计量根据样本计算(如样本均值x̄),二者不可混淆03统计指标与体系:统计指标反映现象数量特征(如GDP),指标体系由多个关联指标构成,共同描述现象全貌CHAPTER11·STATISTICS描述统计与推断统计:两大方法体系统计学方法体系由描述统计和推断统计两大分支构成。描述统计解决"数据是什么"的问题,推断统计解决"数据说明了什么"的问题,二者构成完整的统计分析链条。描述统计:数据的"画像"核心定义研究数据搜集、处理、描述及可视化方法,核心在于对已有数据进行全面、准确的概括与展示,让复杂数据变得直观易懂主要工具频数分布表、直方图、箱线图等图表方法,以及均值、中位数、标准差等数值概括方法频数分布表直方图箱线图均值/标准差典型场景企业年度销售数据汇总、人口普查数据展示、学生成绩分布描述等"就数论数"的分析任务推断统计:从样本到总体核心定义基于概率论原理,利用样本数据对总体特征进行估计和检验,结论具有概率性而非确定性,通过局部推断整体核心方法参数估计(点估计与区间估计)、假设检验、方差分析和回归分析等,建立统计模型进行科学推断参数估计假设检验回归分析方差分析典型场景通过1000人抽样调查推断全国消费者满意度、新药临床试验效果评估、产品质量抽检与质量控制等LECTURE11·STATISTICS统计学三要素与核心统计思想统计学的三大构成要素——统计指标、统计分组和统计方法——共同支撑起完整的统计分析框架,核心思想是以概率为基础,用样本信息对总体做出合理推断并量化其可靠程度。01统计指标体系:通过多个相互关联的量化指标(如GDP、CPI、基尼系数)系统描述社会经济现象的数量特征02统计分组:将总体按某一标志划分为若干组别,揭示现象内部结构差异和组间关系,是深入分析的前提03统计方法:涵盖从数据搜集到模型推断的完整技术链条,不同方法适用于不同数据类型和研究目的04统计思想:核心是"由部分推断整体",承认推断存在误差,但通过概率论工具将误差控制在可接受范围内统计数据分析工作场景Chapter02描述统计:数据搜集、整理与特征测度从调查方案设计到集中趋势、离中趋势和分布形态的完整描述体系DataCollection&SurveyDesign统计数据的搜集方式与调查方案设计统计数据搜集是统计分析的起点,数据质量直接决定分析结论的可靠性。数据搜集的主要方式CENSUS普查对总体全部单位逐一调查,信息最完整但成本高、周期长,如全国人口普查每十年进行一次SAMPLING抽样调查从总体中抽取部分单位进行调查,以样本推断总体,是经济社会调查中最常用的方式FOCUS重点调查选取占有较大比重的重点单位,适用于了解总体基本情况,如重点城市房价监测EXPERIMENT实验数据通过控制条件下的实验获取,可建立因果关系,常见于产品质量测试和医学临床试验调查方案设计的五大环节01明确调查目的和任务方案设计的起点,决定了后续所有技术选择的方向02界定调查对象和调查单位明确"向谁调查",区分调查单位与报告单位03选择调查方式和方法问卷法、访谈法、观察法,需综合考虑精度、预算和时间04设计调查项目和问卷将调查内容转化为具体问题,问卷设计需科学规范05确定调查时间和组织实施安排调查时点、工作进度和人员培训,保障调查顺利开展DATAORGANIZATION&VISUALIZATION统计数据的整理与可视化展示方法数据整理是将原始杂乱数据转化为有序信息的关键环节,核心手段是统计分组和频数分布表编制。可视化展示则通过恰当的图表类型将数据特征直观呈现,使复杂数据"一目了然",是数据沟通的核心能力。01统计分组—按某一标志将总体划分为若干组别,分组标志的选择直接影响分析深度,需根据研究目的选择品质标志或数量标志02频数分布表—将数据按取值区间统计各组频数和频率,是后续计算集中趋势和离中趋势指标的数据基础03直方图—用相邻矩形面积表示各组频数,适用于连续型数据的分布展示,可直观判断数据是否呈正态分布04箱线图—通过最小值、Q1、中位数、Q3和最大值五个特征值,同时展示数据的集中位置、离散程度和异常值05茎叶图—保留原始数据信息的同时展示分布形态,适合小样本数据的快速探索性分析数据可视化分析场景DescriptiveStatistics集中趋势的度量:均值、中位数与众数集中趋势指标是描述数据"中心位置"的核心工具,不同指标各有适用场景和局限性。数值平均数系列01算术平均数是最常用的集中趋势指标,分为简单算术平均和加权算术平均,后者考虑各组频数权重的影响算术平均02调和平均数是各标志值倒数的算术平均数的倒数,适用于已知总量和标志值求平均的场景(如平均速度)调和平均03几何平均数是n个标志值连乘积的n次方根,专用于计算比率型数据的平均(如年均增长率、平均收益率)几何平均位置平均数与选择策略01中位数将数据按大小排列后处于中间位置的值,不受极端值影响,适合偏态分布和收入等右偏数据中位数02众数是出现频率最高的标志值,适合定类和定序数据,但在连续型数据中可能不存在或有多个众数03选择原则:正态分布优先用均值,偏态分布用中位数,分类数据用众数;同时报告多个指标可全面反映数据特征选择策略MeasuresofDispersion离中趋势的度量:方差、标准差与变异系数离中趋势指标衡量数据的分散程度,是集中趋势指标的必要补充。标准差是最常用的绝对离散指标,变异系数则消除了量纲和均值水平的影响,使得不同数据集的离散程度可以横向比较。二者配合集中趋势指标,构成数据分布特征的完整描述。概率统计课程课堂教学实景01方差与标准差:方差是各标志值与均值偏差平方的加权平均,标准差是方差的正平方根,二者共同衡量数据围绕均值的分散程度02平均差:各标志值与均值的绝对偏差的平均数,计算直观但因含绝对值在数学推导中不如标准差便利03变异系数(CV):标准差÷均值×100%,消除量纲和均值水平影响,可直接比较不同数据集的相对离散程度04是非标志方差:p(1−p),其中p为具有某种特征单位的比重,最大值为0.25(当p=0.5时),用于二分类数据的离散度量SKEWNESS&KURTOSIS分布形态的测度:偏度与峰度偏度和峰度是描述数据分布形态的两个关键指标,与集中趋势和离中趋势指标共同构成数据分布特征的完整描述体系。偏度揭示分布的对称性偏离方向,峰度刻画分布的尖锐程度和尾部厚度,二者在金融风险分析和经济数据解读中具有重要应用价值。偏度:分布的对称性📐定义公式偏度系数=[Σ(xᵢ−x̄)³/n]/σ³,等于0表示对称分布,大于0为右偏,小于0为左偏。该系数反映了数据分布偏离对称形态的程度和方向。📊典型特征右偏分布中均值>中位数>众数,经济数据中常见,少数极端高值拉高了均值。左偏则相反,常见于质量控制的寿命数据。🔧简化计算Pearson偏度系数=(均值−众数)/标准差,是一种简化的偏度度量方法,适用于快速估算分布偏斜程度。峰度:分布的尖锐程度📐定义公式峰度系数=[Σ(xᵢ−x̄)⁴/n]/σ⁴,正态分布峰度等于3,超额峰度=峰度−3。该指标衡量分布形态相对于正态分布的集中或分散特征。⚠️风险预警高峰度(尖峰厚尾)意味着极端值出现概率高于正态预期,是衡量"黑天鹅"风险的重要指标,在金融风控中尤为关键。📉低峰特征低峰度(平峰薄尾)表示数据分布较为均匀,极端值出现概率较低,形态比正态更扁平,常见于均匀分布或离散均匀数据。CHAPTER03推断统计:抽样估计与假设检验以概率论为基础,从样本信息推断总体特征的科学方法论SamplingDistribution&CLT抽样分布与中心极限定理抽样分布是统计量的概率分布,是连接样本与总体的桥梁。中心极限定理揭示了一个深刻的结论:无论总体分布如何,当样本量足够大时,样本均值的抽样分布趋近于正态分布。这一定理为参数估计和假设检验提供了坚实的理论基础。01统计量与抽样分布:根据样本数据计算的函数(如样本均值x̄、样本比例p̂),其抽样分布描述了反复抽样下统计量的取值规律。02中心极限定理:当样本量n充分大时(一般n≥30),样本均值的抽样分布近似服从N(μ,σ²/n),与总体分布形态无关。03无偏性与标准误:抽样分布均值等于总体均值μ,标准差即标准误等于σ/√n,随样本量增大而减小。04卡方分布:样本方差的抽样分布服从卡方分布(当总体为正态时),是方差推断和卡方检验的理论基础。正态分布钟形曲线·数学教学场景ParameterEstimation参数估计:点估计与区间估计参数估计是推断统计的基本方法之一,分为点估计和区间估计。点估计用单一数值估计总体参数,简洁但不提供可靠性信息;区间估计以概率保证的形式给出参数的取值范围,兼顾了精度和可靠性,在实际应用中更为广泛。Part01点估计与评价标准直接估计:用样本统计量的值直接作为总体参数的估计值,如用样本均值x̄估计总体均值μ评价标准:无偏性(期望等于真值)、有效性(方差最小)和一致性(样本量趋于无穷时趋于真值)构造方法:矩估计法和最大似然估计法,后者在大样本下具有优良的渐近性质Part02区间估计与置信区间核心公式:区间估计=点估计±边际误差,以一定置信水平(如95%)保证参数落入该区间宽度因素:置信水平(越高越宽)、样本量(越大越窄)和总体标准差(越大越宽)分布选择:大样本用Z分布,小样本用t分布;总体比例的区间估计基于正态近似HYPOTHESISTESTING假设检验的原理、步骤与两类错误基于反证法与小概率原理,用样本判断总体假设是否成立;α控制第一类错误,(1-β)衡量检验功效。01假设检验四步法:①建立原假设H₀和备择假设H₁②选择检验统计量③确定显著性水平α和拒绝域④计算统计量并做出判断02两类错误:第一类错误(弃真)H₀为真却拒绝,概率为α;第二类错误(取伪)H₀为假却未拒绝,概率为β03α与β的关系:此消彼长,不能同时减小;增大样本量是唯一能同时降低两类错误概率的方法04P值法:P值是在H₀成立下观察到当前或更极端结果的概率,P<α则拒绝H₀,P值越小拒绝证据越强统计学考试答题场景HYPOTHESISTESTING假设检验的应用场景与方法选择假设检验方法的选择取决于检验对象、总体数量以及样本大小和总体分布假设。正确选择检验方法是得出可靠结论的前提。常用假设检验方法对照表检验场景检验方法检验统计量适用条件单个总体均值Z检验Z=(x̄−μ₀)/(σ/√n)大样本(n≥30)或σ已知单个总体均值t检验t=(x̄−μ₀)/(s/√n)小样本、正态总体、σ未知两个总体均值差两样本t检验t=(x̄₁−x̄₂)/SE正态总体、独立样本单个总体比例Z检验(比例)Z=(p̂−p₀)/√[p₀(1−p₀)/n]大样本、np≥5且n(1−p)≥5单个总体方差卡方检验χ²=(n−1)s²/σ₀²正态总体两个总体方差比F检验F=s₁²/s₂²两个正态总体不同检验场景对应不同的检验方法和统计量,选择时需综合考虑样本量、总体分布和参数类型ContingencyTable&Chi-SquareTest分类数据分析:列联表与卡方检验卡方检验是分类数据分析的核心工具,适用于拟合优度检验和独立性检验两大场景。列联表将两个分类变量交叉排列,通过比较观察频数与期望频数的差异来检验变量间的独立性。卡方检验不要求总体服从正态分布,但对期望频数有最低要求。01拟合优度检验χ²=Σ(Oᵢ−Eᵢ)²/Eᵢ用于判断样本数据的分布是否符合某种理论分布(如均匀分布、二项分布)02列联表与独立性检验性别×品牌列联表将两个分类变量交叉分组形成二维频数表,独立性检验判断两个变量是否相互独立03卡方统计量与自由度df=(r−1)×(c−1)自由度=(行数−1)×(列数−1),当χ²>χ²α时拒绝独立性假设,认为两变量存在关联04使用条件与局限Eᵢ≥5每格期望频数应≥5,不满足时需合并类别或使用Fisher精确检验;列联分析仅检验关联性不能证明因果关系CHAPTER04进阶方法:方差分析、回归分析与时间序列从组间差异检验到变量关系建模,再到动态趋势预测的完整方法链ANOVA·HYPOTHESISTESTING方差分析:基本思想与单因素方差分析ANOVA分解组间与组内变异以检验多总体均值差异,单因素方差分析是实验设计与因果分析的基础。基本假定各组样本来自正态总体、各总体方差相等(方差齐性)、样本之间相互独立Normality·Homogeneity·IndependenceF检验若F>Fα(k−1,n−k),拒绝原假设,认为至少有两组均值存在显著差异F>Fα平方和分解SST=SSA+SSE,F统计量=MSA/MSE,总变异被系统分解为组间与组内两部分SST=SSA+SSE双因素拓展同时考察行、列因素及交互效应;有交互模型需重复观测,交互显著时做简单效应分析Two-WayANOVASTATISTICS·LECTURE11相关分析与一元线性回归模型相关分析衡量变量间线性关系的强度和方向,回归分析建立预测模型;二者相辅相成,但相关不等于因果,回归模型需经显著性检验方可使用。数据科学回归分析工作场景Pearsonr√[Σ(xᵢ−x̄)²·Σ(yᵢ−ȳ)²],|r|>0.8高度相关,|r|<0.3弱相关ŷ=a+bx位y的平均变动量;a为截距项OLS计参数a和b,具有最优线性无偏估计性质R²·t·F优度R²;R²越接近1模型解释力越强Statistics·Lecture11多元线性回归与等级相关分析多元线性回归将一元回归拓展到多个自变量的场景,能够同时控制多个因素对因变量的影响。但模型的复杂度增加也带来了多重共线性、过拟合等新问题,需要配合变量筛选和模型诊断技术。多元线性回归模型01ŷ=b₀+b₁x₁+b₂x₂+...+bₖxₖ,各回归系数表示在其他变量不变时该变量对因变量的边际效应02调整R²=1-(1-R²)(n-1)/(n-k-1),对自变量个数进行惩罚,避免盲目增加变量来"提升"拟合优度03VIF>10表明严重多重共线性,可通过逐步回归、主成分回归等方法处理等级相关与非参数方法01Spearman等级相关基于秩次计算,适用于等级数据或不服从正态分布的连续数据02分别对x和y排序得到秩次Rₓ和Rᵧ,代入公式rₛ=1-6Σdᵢ²/[n(n²-1)]03对异常值不敏感,能检测单调关系(不仅限于线性),作为Pearson相关的稳健替代REGRESSIONMODELŷ=b₀+b₁x₁+b₂x₂+...+bₖxₖbₖ为偏回归系数:控制其他变量后,xₖ对y的边际效应ADJUSTEDR²adjR²adj=1−(1−R²)·(n−1)/(n−k−1)对自变量个数施加惩罚,防止过拟合SPEARMANRANKrₛ=1−6Σdᵢ²/[n(n²−1)]基于秩次的非参数相关,检测单调关系TIMESERIESANALYSIS时间序列分析:基本概念与水平分析时间序列是按时间顺序排列的统计数据序列,其变动可分解为长期趋势、季节变动、循环波动和不规则变动四个构成要素。01·CLASSIFICATION序列分类时间序列按指标性质分为绝对数时间序列(含时期序列和时点序列)、相对数时间序列和平均数时间序列三类。绝对数·相对数·平均数02·DEVELOPMENTLEVEL发展水平发展水平是序列中各时期的指标值,平均发展水平(序时平均数)概括序列一般水平,计算方法因序列类型而异。序时平均数03·GROWTHAMOUNT增长量逐期增长量=报告期水平−前一期水平;累计增长量=报告期水平−固定基期水平,等于各逐期增长量之和。逐期+累计04·AVERAGEGROWTH平均增长量平均增长量=累计增长量÷(序列项数−1),反映现象在一段时期内平均每期增加或减少的绝对数量。Δ̄=ΣΔ/(n−1)SPEEDANALYSIS&TRENDMEASUREMENT时间序列速度分析与长期趋势测定速度分析通过发展速度和增长速度等相对指标描述现象变化的快慢程度,'增长1%的绝对值'揭示了相同增速在不同基数下的实际差异。长期趋势测定通过移动平均法平滑短期波动或用最小二乘法拟合趋势方程,为预测提供基础。速度分析指标体系01环比发展速度=报告期水平/前一期水平,定基发展速度=报告期水平/固定基期水平,定基发展速度等于各环比发展速度的连乘积02增长速度=发展速度-1(或100%),平均增长速度=平均发展速度-1,反映现象平均每期递增的相对幅度03'增长1%的绝对值'=前期水平/100,将相对速度与绝对增量联系起来,避免仅看增速而忽略基数差异的误导长期趋势测定方法01移动平均法以一定项数的序时平均数替代原序列值,消除短期波动揭示长期趋势,项数越多平滑效果越强02最小二乘法拟合趋势直线ŷ=a+bt或趋势曲线,通过数学模型对长期趋势进行量化描述和外推预测03季节变动测定通过计算季节指数揭示现象在一年内的周期性波动规律,为季节性调整和生产计划提供依据INDEXTHEORY统计指数的编制方法与因素分析统计指数是综合反映复杂现象总体数量变动的相对数,拉氏与帕氏指数分别从基期和报告期视角编制,指数体系通过因素分析将总量变动分解为各因素独立贡献。2020-2024年CPI与GDP增速CPI涨幅与GDP增速呈非线性关系,2021年GDP高增长但CPI低迷综合指数综合指数通过引入同度量因素将不能直接相加的现象转化为可以加总的总量,再对比两个时期的总量得出指数值拉氏与帕氏拉氏指数以基期数量为权数:Lp=Σp₁q₀/Σp₀q₀;帕氏指数以报告期数量为权数:Pp=Σp₁q₁/Σp₀q₁指数体系总量指数=数量指标指数×质量指标指数(如销售额指数=销售量指数×价格指数),实现因素分解因素分析利用指数体系定量测定各因素变动对总量变动的影响方向和影响程度,是经济分析的核心方法之一统计综合评价统计综合评价:指标体系与赋权方法统计综合评价通过构建多指标评价体系,对复杂现象进行系统性的定量比较和排名。其核心挑战在于如何处理指标间的量纲差异、方向差异和重要性差异。评价流程与指标预处理综合评价流程——确定评价目标→构建指标体系→数据搜集与预处理→赋权→综合合成→结果分析与排名正向化处理——将逆向指标转化为正向指标(取倒数或最大值减去原值),统一评价方向标准化处理——极差标准化x'=(x-min)/(max-min)或Z-scorex'=(x-μ)/σ,消除量纲差异赋权方法与合成技术主观赋权——AHP构建判断矩阵确定权重,德尔菲法专家打分达成共识,反映决策者偏好客观赋权——熵权法按信息熵确定权重(变异越大权重越高),主成分分析法降维提取综合因子合成方法——加权算术平均法最常用,几何平均法惩罚短板效应,TOPSIS基于理想解距离排序ELEVENTHLECTURE统计学各知识模块的能力要求与学习重点统计学知识体系涵盖描述统计、推断统计、回归分析、方差分析、时间序列和综合评价六大模块,各模块在理论深度和应用广度上各有侧重。学生应在掌握描述统计基础之上,重点突破推断统计的理论难点,同时强

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论