统计学贾俊平考研知识点总结_第1页
统计学贾俊平考研知识点总结_第2页
统计学贾俊平考研知识点总结_第3页
统计学贾俊平考研知识点总结_第4页
统计学贾俊平考研知识点总结_第5页
已阅读5页,还剩10页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

统计学贾俊平考研知识点总结一、导论:统计学的基本概念与范畴本章是统计学的入门,旨在建立对统计学的整体认知。1.统计学的含义与性质:明确统计学是关于数据的科学,其核心在于通过对数据的分析来揭示现象的数量规律性。理解描述统计与推断统计的区别与联系:描述统计是对数据的概括性描述,而推断统计则是基于样本信息对总体特征进行估计和检验。2.数据的类型:这是后续分析方法选择的基础。*按计量尺度:分类数据(只能归于某一类别的非数字型数据)、顺序数据(类别具有一定顺序的非数字型数据)、数值型数据(按数字尺度测量的观察值,可分为离散型和连续型)。*按收集方法:观测数据(通过调查或观测收集的数据)、实验数据(在实验中控制实验对象而收集到的数据)。*按时间状况:截面数据(在相同或近似相同的时间点上收集的数据)、时间序列数据(在不同时间上收集到的数据)。3.变量:变量是说明现象某种特征的概念。对应于数据的类型,变量也分为分类变量、顺序变量和数值型变量。4.统计中的几个基本概念:总体与样本、参数与统计量、变量。理解这些概念对于后续学习抽样分布、参数估计和假设检验至关重要。二、数据的搜集与整理数据是统计分析的基础,其质量直接影响结论的可靠性。1.数据的来源:*直接来源:通过调查(普查、抽样调查、重点调查、典型调查)或实验获取。其中抽样调查的设计(如抽样方法的选择)是重点。*间接来源:利用现有数据,如政府统计数据、行业协会数据、期刊文献等。需注意数据的适用性和时效性。2.数据的质量:评估数据质量的标准包括准确性、及时性、完整性、一致性和可比性。3.数据的预处理:*数据审核:检查数据的完整性和准确性。*数据筛选:根据研究目的选择符合要求的数据。*数据排序:按一定顺序排列数据,便于观察和分析。*数据透视表:一种交互式的汇总表格,是Excel等软件中常用的数据分析工具。4.品质数据的整理与展示:*分类数据:频数分布表、条形图、饼图。*顺序数据:除上述方法外,还可计算累积频数和累积频率,绘制累积频数分布图。5.数值型数据的整理与展示:*数据分组:单变量值分组与组距分组(等距分组与异距分组)。组距分组中涉及组数、组距、组限、组中值的确定。*频数分布表:展示各组数据的频数、频率等。*图形展示:直方图、茎叶图、箱线图、线图、散点图、气泡图、雷达图等。理解各种图形的适用场景和特点。三、描述性统计分析描述性统计是通过图表或数学方法,对数据的特征进行概括和展示。1.集中趋势的测度:*众数(Mode):一组数据中出现次数最多的变量值。不受极端值影响,适用于任何类型数据。*中位数(Median):将数据排序后处于中间位置的变量值。不受极端值影响,适用于顺序数据和数值型数据。*分位数(Quartiles,Percentiles):将数据等分为若干部分的数值,如四分位数、百分位数。*均值(Mean):算术平均数,是数据的重心所在。易受极端值影响,适用于数值型数据。理解简单算术平均数与加权算术平均数的计算与应用场景。*几何平均数(GeometricMean):适用于计算平均比率或平均增长率。*各种测度值的比较与应用原则:根据数据类型、分布特征选择合适的测度值。2.离散程度的测度:*异众比率:非众数组的频数占总频数的比例,用于衡量众数的代表性。*四分位差(InterquartileRange):上四分位数与下四分位数之差,反映中间50%数据的离散程度,不受极端值影响。*极差(Range):数据的最大值与最小值之差,易受极端值影响。*平均差(MeanDeviation):各数据与其均值离差绝对值的平均数,反映全部数据的离散程度。*方差(Variance)与标准差(StandardDeviation):各数据与其均值离差平方的平均数(方差)及其平方根(标准差)。是应用最广泛的离散程度测度值,反映数据的平均离散程度。理解总体方差、样本方差的计算差异(自由度的概念)。*离散系数(CoefficientofVariation):标准差与均值之比,用于比较不同均值水平数据的离散程度。3.分布形状的测度:*偏态系数(SkewnessCoefficient):衡量数据分布的不对称性。正态分布对称,偏态系数为0;右偏(正偏)分布,偏态系数大于0;左偏(负偏)分布,偏态系数小于0。*峰态系数(KurtosisCoefficient):衡量数据分布的尖峰或扁平程度。正态分布峰态系数为0(或3,取决于计算方法);尖峰分布峰态系数大于0(或3);扁平分布峰态系数小于0(或3)。四、概率、概率分布与抽样分布概率是推断统计的理论基础,抽样分布则是连接样本与总体的桥梁。1.随机事件及其概率:*随机事件:在随机试验中可能发生也可能不发生的结果。*概率的定义:古典定义、统计定义、主观概率。*概率的性质与运算法则:加法公式、乘法公式、条件概率、全概率公式、贝叶斯公式。*独立性:两个事件独立的定义和判断。2.随机变量及其概率分布:*随机变量:表示随机试验结果的变量,分为离散型随机变量和连续型随机变量。*离散型随机变量的概率分布:列出所有可能取值及其对应的概率。常见的有二项分布、泊松分布。*连续型随机变量的概率密度函数与分布函数:概率密度函数的性质,通过积分计算概率。3.常用的概率分布:*正态分布(NormalDistribution):最重要的连续型分布。掌握正态分布的概率密度函数形式、图形特征(单峰、对称、钟形)、参数(均值μ和标准差σ)的意义。标准正态分布的概念及标准化变换(Z变换)。正态分布的应用,如3σ原则。*二项分布(BinomialDistribution):n重伯努利试验中成功次数的概率分布。参数n,p。理解二项分布的期望和方差。当n较大,p较小时,二项分布可近似为泊松分布;当n足够大时,可由正态分布近似(中心极限定理的思想)。*t分布(t-Distribution):小样本场合下,总体标准差未知时,样本均值经标准化后服从的分布。了解其图形特征(与正态分布类似,自由度越小越平坦)、自由度概念。*χ²分布(Chi-squareDistribution):若干独立标准正态变量的平方和服从的分布。了解其图形特征(右偏)、可加性、自由度。*F分布(F-Distribution):两个独立χ²变量除以各自自由度后的比值服从的分布。了解其图形特征(右偏)、自由度(分子自由度、分母自由度)。4.抽样分布:*抽样分布的含义:样本统计量(如样本均值、样本比例、样本方差)的概率分布。*样本均值的抽样分布:*若总体服从正态分布N(μ,σ²),则样本均值无论样本量大小均服从正态分布N(μ,σ²/n)。*中心极限定理(CentralLimitTheorem,CLT):无论总体分布如何,当样本量n充分大时,样本均值的抽样分布近似服从正态分布N(μ,σ²/n)。这是后续参数估计和假设检验的重要理论依据。*理解标准误(StandardError)的概念:样本统计量的标准差,如样本均值的标准误为σ/√n(当σ未知时用s/√n估计)。*样本比例的抽样分布:当np和n(1-p)均大于等于5时,样本比例p̂近似服从正态分布N(p,p(1-p)/n)。*样本方差的抽样分布:若总体服从正态分布N(μ,σ²),则(n-1)s²/σ²~χ²(n-1)。*两个样本均值之差、两个样本比例之差的抽样分布(简要了解,为后续假设检验做准备)。五、参数估计参数估计是推断统计的重要内容,包括点估计和区间估计。1.点估计:*点估计的概念:用样本统计量的某个取值直接作为总体参数的估计值。*估计量与估计值:估计量是用于估计总体参数的随机变量(样本统计量),估计值是估计量的具体数值。*评价估计量的标准:*无偏性(Unbiasedness):估计量的数学期望等于被估计的总体参数。*有效性(Efficiency):对同一总体参数的两个无偏估计量,方差较小的估计量更有效。*一致性(Consistency):随着样本量的增大,估计量的值越来越接近被估计的总体参数。*常用的点估计:样本均值估计总体均值,样本比例估计总体比例,样本方差估计总体方差。2.区间估计:*区间估计的概念:在点估计的基础上,给出总体参数落在某一区间内的概率保证。*置信区间(ConfidenceInterval)与置信水平(ConfidenceLevel):置信区间是一个随机区间,置信水平(1-α)表示该区间包含总体参数真值的概率。常用的置信水平有90%、95%、99%。*区间估计的原理:利用抽样分布,根据样本统计量和给定的置信水平,计算出总体参数的置信区间。*单个总体参数的区间估计:*总体均值的区间估计:*正态总体、σ已知,或非正态总体、大样本(n≥30):使用Z分布。*正态总体、σ未知、小样本(n<30):使用t分布。*总体比例的区间估计:大样本条件下(np̂和n(1-p̂)均大于等于5),使用Z分布。*总体方差的区间估计:使用χ²分布。*样本量的确定:在估计总体均值或总体比例时,根据允许的边际误差、置信水平和总体标准差(或总体比例的估计值),计算所需的最小样本量。理解各因素对样本量的影响。六、假设检验假设检验是另一种重要的统计推断方法,用于对关于总体参数的某种假设进行检验。1.假设检验的基本思想:*小概率原理:小概率事件在一次试验中几乎不可能发生。*反证法思想:先提出原假设,然后在原假设成立的条件下,看检验统计量的观测值是否属于小概率事件,若是,则拒绝原假设,否则不拒绝原假设。2.假设的陈述:*原假设(NullHypothesis,H₀):研究者想收集证据予以反对的假设,通常表述为参数等于某个值或没有差异。*备择假设(AlternativeHypothesis,H₁或Hₐ):研究者想收集证据予以支持的假设,通常表述为参数不等于某个值、大于某个值或小于某个值(对应双侧检验和单侧检验)。3.检验统计量:根据样本数据计算得到的,用于决策的某个样本统计量。其分布在原假设成立时是已知的。4.拒绝域与临界值:根据显著性水平α确定的拒绝原假设的区域。临界值是拒绝域的边界值。5.P值(P-value):在原假设成立的条件下,检验统计量的观测值或更极端值出现的概率。P值越小,拒绝原假设的证据越强。6.假设检验的步骤:*提出原假设和备择假设。*确定适当的检验统计量。*规定显著性水平α。*计算检验统计量的值或P值。*做出统计决策(比较检验统计量与临界值,或比较P值与α)并得出结论。7.单个总体参数的检验:*总体均值的检验:*正态总体、σ已知,或非正态总体、大样本:Z检验。*正态总体、σ未知、小样本:t检验。*总体比例的检验:大样本条件下,Z检验。*总体方差的检验:χ²检验。8.假设检验中的两类错误:*第Ⅰ类错误(TypeIError):原假设为真时拒绝原假设,犯第Ⅰ类错误的概率为α(显著性水平)。*第Ⅱ类错误(TypeIIError):原假设为假时未拒绝原假设,犯第Ⅱ类错误的概率为β。*功效(PowerofTest):正确拒绝原假设的概率,即1-β。*α与β的关系:在样本量一定时,α减小,β增大;要同时减小α和β,需增大样本量。9.假设检验与区间估计的关系:两者都是基于抽样分布,对总体参数进行推断。在双侧检验中,若置信区间不包含原假设的参数值,则拒绝原假设。七、方差分析方差分析用于检验多个总体均值是否相等,是均值比较的扩展。1.方差分析的基本概念:*研究目的:检验分类型自变量对数值型因变量的影响是否显著。*相关术语:因素(Factor)、水平(Level)、观测值、误差(组内误差、组间误差)。2.方差分析的基本思想:*总误差平方和(SST)的分解:SST=组间平方和(SSA)+组内平方和(SSE)。*均方(MeanSquare):将平方和除以相应的自由度,得到组间均方(MSA)和组内均方(MSE)。*F检验统计量:F=MSA/MSE。若原假设(各总体均值相等)成立,则F值应接近1;若F值过大,则有理由拒绝原假设。3.单因素方差分析的步骤:*提出假设:H₀:μ₁=μ₂=...=μ_k;H₁:至少有两个总体均值不相等。*计算各项平方和与均方。*计算F检验统计量。*做出决策(比较F值与临界值,或比较P值与α)。4.方差分析中的多重比较:当方差分析结果拒绝原假设,表明至少有两个总体均值不同,但不能指出具体哪些均值不同。多重比较方法(如LSD法)用于进一步确定哪些均值之间存在显著差异。八、相关与回归分析相关与回归分析用于研究变量之间的关

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论