下载本文档
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、第四章是数据分布特征的测量,学习目的:熟悉数据集中趋势测量主要指标的含义和应用情况,掌握算术平均值的计算方法;熟悉数据离散度主要测量指标的含义,掌握标准差和变异系数的计算和应用;理解数据的偏斜度和峰度的含义及其测量方法。4-1,第一部分是数据集中趋势的测量,而数据的中心趋势是指某一群体或样本数据集中或接近某一中心值的趋势。1.算术平均值,也称为算术平均值,或简称平均值,是指人口或样本中每个个体的某个标记值,因此它被表示为人口或样本的某个标记量与人口或样本的容量之比。其基本计算公式如下:4-2,第一部分测量数据集中的趋势,并从原始数据计算算术平均值所述样本算术平均值;总容量为n;样本大小为。第一
2、部分是数据集趋势的测量。例4.1 12名工人在工厂处理某些零件完成工作所需的时间(计量单位:分钟)是31 34 29 32 35 38 34 30 29 32 31 26请尝试计算这组数据的平均值。解决方案:这是一组由12个工作人员组成的总数据,其平均值计算如下:交互区,4-4,第一部分测量数据集中的趋势,算术平均值由单值变量序列计算:在加权算术平均值方法或公式中,它是第一组变量值;是该组的频率,称为权重;是样本的分组数;k是数据包的总数。例4.3一个货场有10台起重机械,按起重吨位分组的数据见表4.1。得到这10台起重机械的平均吨位。表4.1起重机械在货场中的分布表解法:这10台起重机械的平
3、均吨位计算如下:4-6、第一组数据中趋势的测量值通过非数据算术平均比率或数量计算,整体非数据算术平均根据单值变量系列计算,如下所示:同样,样本可作为非数据算术平均=推论获得。排序后,用1、2、3或0、1、2等定义数据值。并计算有序数据的平均值。交互式区域,4-7,第一个数据集中趋势的度量由组距离系列计算:加权算术平均法或公式,即第一个组的组中值是组的频率,称为权重;是样本的分组数;k是数据包的总数。由组距离系列计算的算术平均值是近似值。例4.3餐馆午餐账单金额的频率分布如表4.3所示。试着计算这家餐馆午餐的平均账单金额。表4.3餐厅午餐账单金额的频率分布解决方案:首先,计算每组的组中位数,如下
4、表所示。然后,午餐的大致平均账单金额计算如下:4-9、第一部分是数据集中趋势的测量,以及权重含义的扩展。在群体距离序列中,只要一个指标与变量值的乘积等于群体的总指标,并且每个群体的总指标可以相加,那么这个指标就可以作为权重来计算分组数据的算术平均值。因此,用广义权重计算平均值的公式为:or,4-10、例4.5表4.5所示为一家公司15个销售网点的年度销售计划完成情况的分布,并尝试了该公司的平均销售计划完成程度。表4.5公司年度销售计划分配表解:计划完成度乘以计划销售金额等于实际销售金额,可以汇总求和得到公司的实际销售金额。因此,计划销售指数应该是我们要确定的权重,它是通过用下面的公式代替来计算
5、的:4-11,第一部分是对数据集中趋势的测量,调和平均:算术平均的另一种形式。当每组的总指数C(=xf,or=xw)和变量X已知时,谐波平均法可用于计算分组数据。例4.6表4.6显示了餐馆的买方在一天内在三个市场购买的相同蔬菜的数据,并获得了买方在同一天购买的该蔬菜的平均价格。表4.6餐厅蔬菜采购解决方案:互动区,4-13、第一部分是数据集趋势的测量,第二部分是几何平均值。如果变量值的乘积有一定的实际意义,我们可以用几何平均来求变量的平均指数。例4.7一个加工厂需要经过四道工序来加工某些零件,每道工序加工零件的合格率分别为95%、97%、96%和98%,因此计算出该批次加工零件的平均合格率。解
6、决方案:96.5%交互区,4-14,第一部分是对数据集中趋势的测量。首先,该模式也称为多重值,它是数据集中频率最高的数据值。模式测量适用于任何类型的数据(分类数据、数值数据)。模式的大小不受极值的影响。对于原始数据,使用定义找到模式: 1。编译单值变量序列2。频率最大的组的变量值是模式。对于一个数据集,该模式的测量结果将有三种情况:唯一模式;多种模式;没有模式。在第一节中,在数据集中趋势的度量,在组距离序列中,由于原始数据的信息损失更多,由组距离序列计算的模式值与实际值之间的差异可能很大。4-16,第一部分是对数据集中趋势的度量。首先,中间值也称为中间值,即变量值排名中间的值。中位数将整个系列
7、分为两部分,每部分包含50%的数据,一部分小于中位数,另一部分大于中位数。例如,在五次快艇实验数据中,最大速度值的排序结果(单位:毫秒)为27 30 31 33 35。显然,31位于这五个数据排名的中间,这是快艇最大速度的中间值。测量中位数的先决条件是数据必须按大小排序。因此,中位数不能用分类数据来计算。对于一个特定的系列,中位数是唯一必须存在的确定值。4-17,第一部分测量数据集中的趋势,并从原始数据中找到中位数。当数据数量为奇数时,中值确定为:当为偶数时,中间有两个数值,中值由这两个数值的简单算术平均值表示:1。计算累计频率,判断中值组(即比特中变量值所在的组)。2.用公式计算中位数:4-
8、18、例4.8某月对某城市50户居民进行抽样调查所得的消费品支出数据见表4.8。试着计算50个被调查家庭的消费品支出中值。解决方法:计算下列累积频率,中位数的等级是50/2=25。组24002600是中间组。L=2400元,d=2600元,2400元=200元,f=12户,且频率累计到中位数的下限组CF=24户。代入公式计算的中值如下:表4.8一个城市50户居民消费品支出累计分配表=,4-19、第一部分是对数据集中趋势的度量。1.分位数是当原始数据按照大小或优缺点的顺序排列时,可以将所有数据分成四部分的数据。有-1个分位数。最常用的分位数是二进制(中位数)、四分位数、十分位数、百分位数和其他已
9、知的原始数据。1.所有数据按升序排列(从小到大的变量值);2.计算每个子数字的等级。对于容量为的数据,第一个分位数的秩为3。确定或计算每个分位数的值。如果它不是一个整数,它将被向上舍入,下一个具有较大比率的整数代表分位数;如果是整数,#分位数是#和#值的算术平均值。在第一部分,测量数据集中的趋势,五数一般化方法可以通过使用三个四分位数加上两个最大值和最小值来简单地总结一组数据分布特征。例4.10某行业企业经理月起薪抽样调查数据排序如下:(单位:元)2710、2755、2850、2880、2880、2890、2920、2940、2950、3050、3130、3325。解决方案:首先对数据进行从小
10、到大的排序,然后确定最小值、下四分位数、中值、上四分位数和最大值,如下图所示:最小值Q1=2865 Me=2905 Q2=3000最大值方框图是一个以图形形式表达五位数一般化方法的图形。绘制方法是:首先找出坐标中最小值、下四分位数、中值、上四分位数和最大值的位置,然后将相邻的四分位数连接起来绘制两个方框,然后将两个极值与两个方框连接起来。4-21,第一部分是数据集趋势的测量,方框图说明了交互区域,4-22,第二部分是数据离散度的测量。可变性指标通常用于衡量数据变化的均衡性和稳定性,也用于衡量平均指数的代表性。通常用来衡量数据分散程度的指标是总距离、四分位数、平均差异、方差、标准偏差和变异系数。
11、4-23,第二部分是数据分散的度量。1.range也称为range或range,它是最大数据值和最小数据值之间的偏差。计算总距离是测量数据分散程度的最简单方法。计算总距离的公式如下:总距离极易受极端变量值的影响,因此很少使用。第二部分是数据分散的度量。四分位范围(IQR)是四分位中上四分位和下四分位之间的差值。在公式中,它表示四分位数之间的距离,上四分位数和下四分位数。四分位间距是中间50%数据值之间的距离,它反映了中位数的代表性。通常,我们怀疑小于1.5且大于1.5的数据为异常数据,并进一步测试这些数据的正确性或有效性。交互区,4-25,第二部分是数据离散度的度量,第三部分是所有研究数据值的
12、平均值和每个数据值变化的平方的算术平均值。总体方差、样本方差(总体方差的估计)或非数据方差很好地反映了所有数据的离散程度。交互式区域交互式区域,4-26、第二部分测量数据分散的程度。第四,标准偏差也被称为均方根差,它是方差的算术平方根的正根。给定原始数据,标准差的计算公式为:或给定区间序列,标准差的计算公式为:或标准差与平均值具有相同的计量单位,这是最常用的衡量数据离散程度的指标。4-27,4-27,4.12有一天从商店买东西的五个顾客的年龄分别是38岁,26岁,13岁,41岁和22岁。试着估计这家商店顾客年龄的差异和标准差。解决方法:首先,取当天五位顾客的年龄作为样本,计算样本均值(年),然
13、后计算样本方差作为该店总顾客的方差估计值(第二年)。计算标准偏差:4-28、例4.13公司所有3000名员工的月工资收入。尝试计算员工月工资收入的差异。表4.9公司员工月工资收入分配,4-29、解决方案:首先计算各组员工月工资收入的分组中位数(见表)和公司员工月工资收入的算术平均数。然后,计算公司员工月工资收入的方差:=90202.67(人民币)在第二节中,数据离差度的度量,Z得分(Z-SCOR) Z得分被称为变量的标准化值,即变量的平均值的标准差数。或者当用不同的测量单位研究两个或两个以上变量的分布特征时,或者当直接比较和操作不同的变量时,只有通过标准化它们,并用Z评分比较和操作它们,才能得
14、出正确的结论。标准化值(Z值)也可以帮助我们识别异常数据值。对于钟形数据,如果任何数据项目的Z值大于3或小于-3,我们有理由怀疑它是异常数据,并检查其准确性,以确定它是否属于所研究的数据集。4-31。第二部分是数据分散的度量。5.平均偏差是总数据值或样本数据值与算术平均值之间偏差绝对值的算术平均值。互动区六。变异系数是标准偏差与算术平均值的比率。如果平均值相同,且总距离、标准差和平均差值较大,则平均值的代表性较小;不同的平均值和较大的变异系数意味着代表性较低。交互区,4-32、第三节偏斜度和峰度是描述数据分布形状的两个重要方面。1.偏斜度及其度量偏斜度是数据分布的偏斜方向和程度的度量。如果频率分布是对称的,我们称之为无偏的,也就是说,分布的偏斜度为零。在数据的对称(无偏)分布中,其算术平均值、模式和中位数是相等的。如果一个或多个数据特别大,分布的算术平均值将大于中值或模式,这意味
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- GB/T 45354.2-2026智能家用电器的语音交互技术第2部分:测试方法
- 八年级道德与法治苏教版开学季第一单元同步测试卷基础版A卷
- 食品工厂虫害稽核关键要点
- 昆士兰大学就业前景
- 咽峡炎健康指导
- 国际空乘专业就业前景指南
- 2026年10月自考14317投资银行理论与实务押题及答案(江苏)
- 法律职业资格客观题真题汇编(含答案详解)
- 文具用品库存调整通知函(5篇)范文
- 石油化工行业工艺工程师安全与效率绩效考评表
- 2026年山东齐兴发展集团有限公司及权属企业招聘(42人)笔试备考题库及答案详解
- 2026年法学进阶理论测试题及答案
- 2026江苏镇江市总工会集中招录工会社会工作者11人笔试参考题库及答案详解
- 中小学教师超课时补贴与临时代课费管理办法(2026年修订)
- 四川绵阳市2026年从‘五方面人员’中选拔乡镇领导班子成员考试试题及答案
- 《黑龙江省超低能耗建筑评审信息表》
- 门诊手术室全套工作制度
- 药物检测滥用制度
- 2025年医师定考题库(附答案)
- 布老虎介绍教学课件
- 2026年时事政治测试题库100道附完整答案【考点梳理】
评论
0/150
提交评论