数据分析与数据挖掘课件第2章 数据_第1页
数据分析与数据挖掘课件第2章 数据_第2页
数据分析与数据挖掘课件第2章 数据_第3页
数据分析与数据挖掘课件第2章 数据_第4页
数据分析与数据挖掘课件第2章 数据_第5页
已阅读5页,还剩49页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第2章数据目录

CONTENTS1.52

2.12.22.3数据的属性数据的基本统计描述数据的相似性与相异性Chapter2.1数据的属性4

数据集由数据对象组成。一个数据对象代表一个实体。例如:销售数据库:顾客、

商品、销售医疗数据库:患者、医生、诊断治疗选课数据库:学生、教师、课程数据对象又称为样本、实例、数据点、对象或元组。数据对象用属性描述。数据表的行对应数据对象;列对应属性。2.1数据的属性1.数据对象5

属性(特征,变量)是一个数据字段,表示数据对象的一个特征。例如:客户编号、姓名、地址等商品编号、商品名、价格、种类等2.1数据的属性2.属性(Attributes)6

标称属性(nominal)二元属性(binary)序数属性(ordinal)数值属性(numeric)区间标度属性(interval-scaled)比率标度属性(ratio-scaled)2.1数据的属性3.属性类型7

标称属性(nominalattribute):类别,状态或事物的名字每个值代表某种类别、编码或状态,这些值不必具有有意义的序,可以看做是枚举的例如:头发颜色={赤褐色,黑色,金色,棕色,褐色,灰色,白色,红色}也可以用数值表示这些符号或名称,但并不定量地使用这些数。例如:婚姻状况,职业,ID号,邮政编码,

可以用0表示未婚、1表示已婚2.1数据的属性3.属性类型8

二元属性(binaryattribute):布尔属性,是一种标称属性,只有两个状态:0或1。对称的(symmetric):两种状态具有同等价值,且具有相同的权重。例如:性别非对称的(asymmetric):其状态的结果不是同样重要。例如:体检结果(阴性和阳性),惯例:重要的结果用1编码(如,HIV阳性)。2.1数据的属性3.属性类型9

序数属性(ordinalattribute),其可能的值之间具有有意义的序或者秩评定(ranking),但是相继值之间的差是未知的。例如:尺寸={小,中,大},军衔,职称序数属性可用于主观质量评估例如:顾客对客服的满意度调查。0-很不满意;1-不太满意;2-基本满意;3-满意;4-非常满意2.1数据的属性3.属性类型10

数值属性(numericattribute):定量度量,用整数或实数值表示区间标度(interval-scaled)属性:使用相等的单位尺度度量。值有序,可以评估值之间的差,不能评估倍数。没有绝对的零点。例如:日期,摄氏温度,华氏温度比率标度(ratio-scaled)属性:具有固定零点的数值属性。值有序,可以评估值之间的差,也可以说一个值是另一个的倍数。例如:开式温标(K),重量,高度,速度2.1数据的属性3.属性类型11

离散属性(discreteAttribute):具有有限或者无限可数个值。有时,表示为整型量。例如:邮编、职业或文库中的字集二进制属性是离散属性的一个特例连续属性(ContinuousAttribute):属性值为实数,一般用浮点变量表示。例如,温度,高度或重量,实际上,真实值只能使用一个有限的数字来测量和表示。2.1数据的属性离散属性VS连续属性Chapter2.2数据的基本统计描述13

2.2数据的基本统计描述目的数据的基本统计描述更好地识别数据的性质,把握数据全貌。中心趋势度量、数据分散度量、数据的图形表示中心趋势度量均值、加权算数均值、中位数、众数、中列数数据分散度量极差、分位数和四分位数、方差和标准差数据的图形显示箱图、饼图、频率直方图、散点图均值(Mean)令x1,x2,…,xN为某数值属性X的N个观测值,该值集合的均值如式(2-1)所示。14

2.2数据的基本统计描述1.中心趋势度量例:有学生考试成绩的值:60,45,33,77,80,100,100,90,70,65。

(2-1)截尾均值15

例:某同学的某一科的考试成绩:平时测验80,期中90,期末95。科目成绩的计算方式是:平时测验占20%,期中成绩占30%,期末成绩占50%。这里,每个成绩所占的比重为权重。那么,2.2数据的基本统计描述1.中心趋势度量加权算数平均数(WeightedMean)(2-2)对于i=1,…,N,每个值xi都有一个权重wi。

中位数(Median):正中间的值如果值有奇数个,取中间值,否则取中间两个数的平均值有序数据值的中间值如果观察值有偶数个,通常取最中间的两个数值的平均数作为中位数。16

2.2数据的基本统计描述1.中心趋势度量例:数据按递增排序为:33,45,60,65,70,77,80,90,100,100。有10个观测值,因此中位数不唯一。中间两个值为70和77,则中位数为17

分组数据中位数(GroupedMedian)2.2数据的基本统计描述1.中心趋势度量Me:中位数,L:中位数所在组的下限,Sm-1:中位数所在组以下各组的累计频数,fm:中位数所在组的频数,d:中位数所在组的组距。根据N/2确定中位数所在的组

(2-3)18

分组数据中位数2.2数据的基本统计描述1.中心趋势度量例:表2-1为某公司员工薪酬的分组数据,计算数据的近似分组数据中位数。SalaryFrequency15001699180170018994601900~19998502000~20992502100~21991302200~2299702300~2399202400~249910表2-1员工薪酬分组数据①判断中位数区间:N=110+180+320+460+850+250+130+70+20+10=2400;N/2=1200;因为:110+180+320+460=1070<1200<1070+850=1920;所以:1900~1999为对应区间。

19

2.2数据的基本统计描述1.中心趋势度量经验公式:可能最高频率对应多个不同值,导致多个众数例:数据按递增序排序为:33,45,60,65,70,77,80,90,100,100。mode=100众数(Mode):数据中出现最频繁的值20

2.2数据的基本统计描述1.中心趋势度量例:数据按递增序排序为:33,45,60,65,70,77,80,90,100,100。中列数(Midrange):数据集中最大值和最小值的算术平均值

最小值和最大值分别为33和100,则中列数为21

2.2数据的基本统计描述2.数据分散度量例:数据按递增序排序为:33,45,60,65,70,77,80,90,100,100。极差(又称全距,Range):是集合中最大值与最小值之间的差距,即最大值减最小值后所得数据。100-33=6722

2.2数据的基本统计描述2.数据分散度量分位数(Quantile):取自数据分布的每隔一定间隔上的点,把数据划分成基本上大小相等的连贯集合。给定数据分布的第k个q-分位数的值为x,使得小于x的数据值最多为k/q,而大于x的数据值最多为(q-k)/q,其中k是整数,使得0<k<q。这里有q-1个q-分位数。图2-1某变量X的数据统计描述显示23

2.2数据的基本统计描述2.数据分散度量四分位数(Quantile):把数据分布划分成4个相等的部分,使得每部分表示数据分布的四分之一。这3个数据点称为四分位数。图2-1某变量X的数据统计描述显示Q1:“下四分位数”;Q2:“中位数”;Q3:“上四分位数”。24

2.2数据的基本统计描述2.数据分散度量四分位数极差(

InterQuartileRange,IQR):

Q1和Q3之间的距离。图2-1某变量X的数据统计描述显示

确定四分位数的位置:

Q1的位置=(n+1)/4=(n+1)×0.25

Q2的位置=2*(n+1)/4=(n+1)×0.5

Q3的位置=3*(n+1)/4=(n+1)×0.75

n表示项数25

2.2数据的基本统计描述2.数据分散度量四分位数极差(

InterQuartileRange,IQR):

Q1和Q3之间的距离。

例:由8人组成的旅游小团队年龄分别为:17,19,22,24,25,28,34,37,求其年龄的四分位差。①计算Q1与Q3的位置:Q1的位置=(n+1)/4=(8+1)/4=2.25;Q3的位置=3*(n+1)/4=3*(8+1)/4=6.75②确定Q1与Q3的数值:Q1=19+(22-19)*0.25=19.75;Q3=28+(34-28)*0.75=32.5③计算四分位差:IQR=Q3-Q1=32.5-19.75=12.7526

2.2数据的基本统计描述2.数据分散度量四分位数极差(

InterQuartileRange,IQR):

Q1和Q3之间的距离。图2-1某变量X的数据统计描述显示

另一种确定四分位数的位置:

Q1的位置=1+(n-1)×0.25

Q2的位置=1+(n-1)×0.5

Q3的位置=1+(n-1)×0.75

n表示项数方差(样本方差):是每个数据分别与平均数之差的平方的平均数。总体方差:样本方差:27

标准差:方差的平方根

2.2数据的基本统计描述2.数据分散度量(2-5)28

例:有学生考试成绩的值:60,45,33,77,80,100,100,90,70,65。标准差:2.2数据的基本统计描述2.数据分散度量29

盒图(又称箱线图,Box-plot),是一种用来描述数据分布的统计图形,可以表现观测数据的中位数、四分位数和极值等描述性统计量。2.2数据的基本统计描述离群点:绘制在离群阈值范围外的点盒子外线延伸到最小和最大的观测值中位数用盒内线标记盒子的端点在四分位数上,使得盒子长度为四分位数极差IQR用盒子表示数据3.数据的图形显示30

盒图(又称箱线图,Box-plot),是一种用来描述数据分布的统计图形,可以表现观测数据的中位数、四分位数和极值等描述性统计量。2.2数据的基本统计描述3.数据的图形显示离群点:第三个四分位数之上或者第一个四分位数之下至少1.5xIQR的值盒图:分布直观表示,体现五数概括五数概括:min,Q1,median,Q3,max31

饼图(又称圆形图或饼形图,PieGraph),通常用来表示整体的构成部分及各部分之间的比例关系。饼图显示一个数据系列中各项的大小与各项总和的比例关系。2.2数据的基本统计描述3.数据的图形显示例:使用饼图表示不同年龄区间的人参与某活动的情况表2-4某活动覆盖人群年龄区间参与人数19岁及以下27020-29岁124830-39岁108040-49岁28050岁及以上180图2-4某活动覆盖人群饼图32

频率直方图(又称频率分布直方图,FrequencyHistogram),是在统计学中表示频率分布的图形。2.2数据的基本统计描述3.数据的图形显示例:使用直方图表示学生数学成绩的分布学号成绩70160702717035670499705667069070710070866709777106071188712797138371455表2-5

学生数学成绩图2-5学生成绩数据频率直方图33

散点图(ScatterDiagram):将样本数据点绘制在二维平面或三维空间上,根据数据点的分布特征,直观地研究变量之间的统计关系以及强弱程度。2.2数据的基本统计描述3.数据的图形显示例:使用散点图表示物流收货天数和客户满意度之间的关系物流收货天数客户满意度64.51238365181.573.53482.511325122.5152表2-6物流收货天数和客户满意度相关数据图2-7物流收货天数和客户满意度散点图34

散点图(ScatterDiagram)2.2数据的基本统计描述3.数据的图形显示(a)

线性相关

(b)非线性相关

(c)不相关图2-6散点图中属性之间的相关性35

散点图(ScatterDiagram)2.2数据的基本统计描述3.数据的图形显示(d)

正相关

(e)负相关图2-6散点图中属性之间的相关性盒图Boxplot描述五数概括饼图PieGraph显示一个数据系列中各项的大小与各项总和的比例关系直方图Histogramx-axis表示数值大小,y-axis表示频率36

散点图Scatterplot每个值视作一个坐标对,作为一个点画在平面上2.2数据的基本统计描述基本统计图Chapter2.3数据的相似性与相异性38

2.3数据的相似性与相异性相似性(Similarity)两个对象相似程度的数量表示数值越高表明相似性越大通常取值范围为[0,1]相异性(Dissimilarity)(例如距离)两个对象不相似程度的数量表示数值越低表明相似性越大相异性的最小值通常为0相异性的最大值(上限)是不同的邻近性(Proximity):相似性和相异性都称为邻近性39

2.3数据的相似性与相异性1.数据矩阵与相异矩阵数据矩阵:对象-属性结构行-对象:n个对象列-属性:p个属性二模矩阵(Twomodes)相异性矩阵:对象-对象结构n个对象两两之间的邻近度对称矩阵单模(Singlemode)40

2.3数据的相似性与相异性2.标称属性的邻近性度量相异性p是对象的属性总数,m是匹配的属性数目(即对象i和j状态相同的属性数)相似性

41

2.3数据的相似性与相异性2.标称属性的邻近性度量例:计算

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论