数据处理与数据建模方法_第1页
数据处理与数据建模方法_第2页
数据处理与数据建模方法_第3页
数据处理与数据建模方法_第4页
数据处理与数据建模方法_第5页
已阅读5页,还剩43页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

西南交通大学数学建模

2009.82

实际中大量信息或海量信息对应着大量的数据或海量数据,从这些数据中寻求所需要的问题答案--数据建模问题。

通过实际对象过去或当前的相关信息,主要研究两个方面问题:

(1)分析研究实际对象所处的状态和特征等,依此做出评价和决策;

(2)分析预测实际对象未来的变化状况和趋势等,为科学决策提供依据。

数据处理与数据建模方法

3

数据处理与数据建模方法

1.一般数据建模问题的提出

2.数据处理的一般方法

3.数据建模的综合评价方法

4.数据建模的动态加权方法

5.数据建模的综合排序方法

6.数据建模的预测方法

4?实际对象都客观存在一些相关的数据信息;

?如何综合利用这些相关信息给出综合评价结果、制定决策方案,或预测未来?

?这类问题都归结为信息综合利用与评价问题。

一般问题:

什么是综合评价与综合评价问题呢?

一、一般数据建模问题的提出

5

依据相关信息对被评价的对象所进行的客观、公正、合理的全面评价。

如果把被评价对象视为系统,则综合评价问题:在若干个(同类)系统中,如何确定哪个系统的运行(或发展)状况好,哪个状况差?即哪个优,哪个劣?

一类多属性(或多指标)的综合评价问题。

综合评价:

一、一般数据建模问题的提出

6?综合评价是科学、合理决策的前提。

?综合评价的基础是信息的综合利用。

?综合评价的过程是数据建模的过程。

?数据建模的基础是数据的标准化处理。

一、一般数据建模问题的提出

如何构成一个综合评价问题呢?

7综合评价问题的五个要素:

一、一般数据建模问题的提出

(1)被评价对象

综合评价问题中所研究的对象,或称为系统。

在一个问题中被评价对象是属于同一类的,且个数要大于1。

假设一个综合评价问题中有n个被评价对象(或系统),分别记为12,,,(1)nSSSn?。

8

(2)评价指标

它是反映被评价对象(系统)的运行状况的基本要素。

通常问题都有多项指标构成,每一项指标都是从不同的侧面刻画系统所具有某种特征大小的一个度量。

所有的评价指标一起称为综合评价的指标体系。

原则:系统性、科学性、可比性、可测性和独立性。

综合评价问题的五个要素

设系统有m个评价指标(属性)12,,,(1)mxxxm?,即评价指标向量12(,,,)Tmxxx?x。

9综合评价问题的五个要素

如果用jw来表示评价指标(1,2,,)jxjm?的权重系数,则0(1,2,,)jwjm??,且11mjjw???。

(3)权重系数

针对每一综合评价问题不同的评价目的,各评价指标之间的相对重要性是不同的。

权重系数:用来刻画评价指标之间相对重要性的大小。

10综合评价问题的五个要素

(4)综合评价模型

通过建立合适的综合评价数学模型将多个评价指标综合成为一个整体的综合评价指标,即得到相应的综合评价结果。

假设n个被评价对象的m个数据指标向量12(,,,)Tmxxx?x,权重向量为12(,,,)Tmwww?w,则构造综合评价函数(,)yf?wx。

11综合评价问题的五个要素

(5)评价者

评价者是直接参与评价的人,可以是某一个人,也可以是一个团体。

对于评价目的选择、评价指标体系确定、权重系数的确定和评价模型的建立都与评价者有关。

12

确定指标

初始值

计算综合

评价指标

对nsss,,,21?进行综合评价

排序或分类

?明

任

确

务

明

目

确

的

确定评价指标

规范化指标mxxx,,,21?

指

预

标

处

的

理

权重系数mwww,,,21?

确

系

定

数

权

综合评价指标),(wxfy?

选

价

择

模

评

型

依指标nyyy,,,21?对nsss,,,21?排序或分类

综合评价过程的流程

13

二、数据处理的一般方法

1.数据类型的一致化处理方法

极大型:期望取值越大越好;

极小型:期望取值越小越好;

中间型:期望取值既不要太大,也不要太小为好,即取适当的中间值为最好;

区间型:期望取值最好是落在某一个确定的区间内为最好。

一般问题的数据指标12,,,(1)mxxxm?可能有“极大型”、“极小型”、“中间型”和“区间型”指标。

什么是一致化处理?为什么要一致化?14

二、数据处理的一般方法

1.数据类型的一致化处理方法

(1)极小型:对某个极小型数据指标x,则令1(0)xxx???,或xMx???,即可将x极大化。

(2)中间型:对某个中间型数据指标x,则令

2()1,()22()1,()2xmmxMmMmxMxMmxMMm?????????????????

即可将中间型数据指标x极大化。

15

二、数据处理的一般方法

1.数据类型的一致化处理方法

(3)区间型:对某个区间型数据指标x,则令

1,1,1,axxacxaxbxbxbc?????????????????

其中[,]ab为x的最佳稳定区间,max{,}camMb???,M和m分别为x可能取值的最大值和最小值。即可将x极大化。

162.数据指标的无量纲化处理方法

在实际数据指标12,,,(1)mxxxm?之间,往往存在着不可公度性,直接应用是困难的,会出现“大数吃小数”的错误、从而导致结果的不合理。

常用方法:标准差法、极值差法和功效系数法等。

二、数据处理的一般方法

假设m个数据指标12,,,mxxx,不妨设已做了类型的一致化,并有n组样本观测值(1,2,,;1,2,,)ijxinjm??。

17

二、数据处理的一般方法

2.数据指标的无量纲化处理方法

令ijjijjxxxs???(1,2,,;1,2,,)injm??,

其中1221111,[()](1,2,,)nnjijjijjiixxsxxjmnn????????。

(1)标准差方法

显然(1,2,,;1,2,,)ijxinjm???的均值和均方差分别为0和1,即[0,1]ijx??是无量纲的,称之为ijx的标准观测值。

18

二、数据处理的一般方法

2.数据指标的无量纲化处理方法

(2)极值差方法

令ijjijjjxmxMm????(1,2,,;1,2,,)injm??,

其中11max{},min{}(1,2,,)jijjijininMxmxjm???????。则[0,1]ijx??是无量纲的标准观测值。

19

二、数据处理的一般方法

2.数据指标的无量纲化处理方法

(3)功效系数方法

令ijjijjjxmxcdMm??????(1,2,,;1,2,,)injm??,

其中,cd均为确定的常数。

c表示“平移量”,d表示“旋转量”,即表示“放大”或“缩小”倍数。

则[,]ijxccd???。

譬如若取60,40cd??,则[60,100]ijx??。

20

二、数据处理的一般方法

3.定性指标的量化处理方法

在社会实践中,很多问题都涉及到定性因素(指标)的定量处理问题。

诸如:教学质量、科研水平、工作政绩、人员素质、各种满意度、信誉、态度、意识、观念、能力等因素有关的政治、社会、人文等领域的问题。

如何对有关问题给出定量分析呢?

21

按国家的评价标准,评价因素一般分为五个等级,如A,B,C,D,E。

如何将其量化?若A-,B+,C-,D+等又如何合理量化?

简单地对应数字分量化方法是不科学的!

根据实际问题,构造模糊隶属函数的量化方法是一种可行有效的方法。

二、数据处理的一般方法

3.定性指标的量化处理方法

22

假设有多个评价人对某项因素评价为A,B,C,D,E共5个等级:{v1,v2,v3,v4,v5}。

譬如:评价人对某事件“满意度”的评价可分为

{很满意,满意,较满意,不太满意,很不满意}

将其5个等级依次对应为5,4,3,2,1。

为取连续量化,取偏大型柯西分布和对数函数作为隶属函数:

二、数据处理的一般方法

?????????????53,ln31,])(1[)(12xbxaxxxf??

其中ba,,,??为待定常数.

23

二、数据处理的一般方法

3.定性指标的量化处理方法

当“很满意”时,则隶属度为1,即1)5(?f;

当“较满意”时,则隶属度为8.0,即8.0)3(?f;

当“很不满意”时,则隶属度为0.01,即01.0)1(?f.

计算得,3915.0,8942.0,1086.1???a??

3699.0?b。则

?????????????????53,3699.0ln3915.031,)8942.0(1086.11)(12xxxxxf

24

二、数据处理的一般方法

3.定性指标的量化处理方法

根据这个规律,对于任何一个评价值,都可以给出一个合适的量化值。

根据实际情况也可构造其他的隶属函数。

?????????????????53,3699.0ln3915.031,)8942.0(1086.11)(12xxxxxf25

三、数据建模的综合评价方法

适用条件:各评价指标之间相互独立。

对不完全独立的情况,其结果将导致各指标间信息的重复,使评价结果不能客观地反映实际。

1.线性加权综合法

用线性加权函数1mjjjywx???作为综合评价模型,对n个系统进行综合评价。

主要特点:

(1)各评价指标间作用得到线性补偿;

(2)权重系数的对评价结果的影响明显。

26

2.非线性加权综合法

用非线性函数???mjwjjxy1作为综合评价模型,对n个系统进行综合评价。其中jw为权系数,且要求1?jx。

适用条件:各指标间有较强关联性。

三、数据建模的综合评价方法

主要特点:

(1)突出了各指标值的一致性,即平衡评价指标值较小的指标影响的作用;

(2)权重系数大小的影响不是特别明显,而对指标值的大小差异相对较敏感。

27

三、数据建模的综合评价方法

3.逼近理想点(TOPSIS)方法

首先设定系统指标的一个理想(样本)点),,,(**2*1mxxx?,然后对于每一个被评价对象与理想点进行比较。

基于这种思想的综合评价方法称为逼近理想点的排序方法(Thetechniquefororderpreferencebysimilaritytoidealsolution,简称为TOPSIS)。

如果某一个被评价对象指标),,,(21imiixxx?在某种意义下与理想点),,,(**2*1mxxx?最接近,则认为被评价对象),,,(21imiixxx?就是最好的。

28三、数据建模的综合评价方法

4.其他综合评价法

?

因子分析

?

聚类分析

?

模糊评价

?

层次分析法等

29

四、数据建模的动态加权方法

1.动态加权问题的一般提法

设有n个被评价对象(或系统)12,,,(1)nSSSn?,每个系统都有m属性(或评价指标)12,,,(1)mxxxm?。

对每一个ix都可分为K个等级12,,,Kppp(1)K?。而对每一个kp都包含一个()()[,)iikkab,且()()iikkab?

(1,2,,;1,2,,)imkK??,即当()()[,)iiikkxab?时,则ix属于第k类kp(1)kK??。

问题:如何对n个系统做出综合评价呢?30

四、数据建模的动态加权方法

2005年中国大学生数学建模竞赛的A题:“长江水质的评价和预测”问题的第一部份给出了17个观测站(城市)的最近28个月的实际检测指标数据,包括反映水质污染程度的最主要的四项指标:溶解氧(DO)、高锰酸盐指数(CODMn)、氨氮(NH3-N)和PH值,要求综合这四种污染指标的28个月的检测数据对17个城市的水质情况做出综合评价。

表(1):《地表水环境质量标准》(GB3838—2002)中4个主要项目标准限值

单位:mg/L指

标

Ⅰ类

Ⅱ类

Ⅲ类

Ⅳ类

Ⅴ类

劣Ⅴ类

溶解氧(DO)[7.5,∞)[6,7.5)[5,6)[3,5)[2,3)[0,2]高锰酸盐指数(CODMn)

(0,2](2,4](4,6](6,10](10,15](15,

∞)

氨氮(NH3-N)

(0,0.15](0.15,0.5](0.5,1](1,1.5](1.5,2](2,

∞)

PH值(无量纲)

[6,9]31

四、数据建模的动态加权方法

根据国标(GB3838—2002)的规定,关于地表水的水质可分为Ⅰ类、Ⅱ类、Ⅲ类、Ⅳ类、Ⅴ类、劣Ⅴ类共六个类别,每一个类别对每一项指标都有相应的标准值(区间),只要有一项指标达到高类别的标准就算是高类别的水质,所以实际中不同类别的水质有很大的差别,而且同一类别的水在污染物的含量上也有一定的差别。

在对17个城市的水质做综合评价时,要充分考虑这些指标值不同类别水的“质的差异”和同类别水的“量的差异”,在此简称为“质差”和“量差”。因此,这是一个较复杂的多因素多属性的综合评价问题。

32

四、数据建模的动态加权方法

针对长江水质的综合评价这一问题,采用动态加权综合评价方法来解决。假设17个城市为被评价对象1217,,,SSS,共有四项评价指标(或属性)DO、CODMn、NH3-N和PH值,分别记为321,,xxx和4x,前三项指标都有6个等级126,,,ppp,相应的分类区间值如表(1)所示,而PH值没有等级之分。

33

四、数据建模的动态加权方法

注意:

问题对于每一个属性而言,既有不同类别的差异,同类别的又有不同量值的差异。

对于这种既有“质差”,又有“量差”的问题,合理有效的方法是动态加权综合评价方法。

1.动态加权问题的一般提法

34

四、数据建模的动态加权方法

?

考虑到评价指标的“质差”与“量差”,既要能体现不同类型指标之间的差异,也要能体现同类型指标的数量差异。

?

具体取什么样的动态加权函数,主要是从实际问题出发分析确定。

?

对于不同的指标可以取相同的权函数,也可以取不同的权函数。

2.动态加权函数的设定

35

四、数据建模的动态加权方法

2.动态加权函数的设定

(1)

分段变幂函数

如果某项指标ix对评价效果的影响大约是随着类别kp的增加而按正幂次增加;同时在某一类中随着指标值的增加按相应的一个幂函数增加。则对指标ix可设定分段

变幂函数为变权函数。

1()()(),[,](1,2,,)iikikkwxxxabkK???,

其中1im??。

36

四、数据建模的动态加权方法

2.动态加权函数的设定

(2)偏大型正态分布函数

若某项指标ix对评价效果的影响大约是随着类别kp的增加,先缓慢增加,中间有一个快速增长的过程,随后平缓增加趋于最大,相应的图形呈正态分布曲线(左侧)形状。则对ix的变权函数可设定为偏大型正态分布函数。

20,()1,iiixiixwxex?????????????????????当时,当时,

其中参数i?可取()()11[,)iiab中的某

定值。

37返回

四、数据建模的动态加权方法

2.动态加权函数的设定

(3)S型分布函数

若某项指标ix对评价效果影响是随着类别kp增加而增加的过程,呈一条“S”曲线,则对指标ix的变权函数可设定为S型分布函数。

2()()11()()12()()()()12,,()12,,iiiiKiiiKKiiKxaaxcbawxxbcxbba?????????????????????????????

其中参数()()11(),()0.52(1)iiKicabwcim?????且。

38根据标准化后的指标值,仍用ix表示,相应动态权函数()(1,2,,)iwxim?,则n个系统的综合评价模型取1()miiiiXwxx????。

若每个系统的m个属性都N

组样本观测值{}(1,2,,;1,2,,)ijximjN??,则每一个系统都有N个综合评价指标值()(1,2,,;kXjkn?

1,2,,)jN?。按其大小排序可给出n个系统的N个排序方案。

四、数据建模的动态加权方法

3.动态加权的综合评价模型

39

五、数据建模的综合排序方法

1.综合排序问题的一般提法

设有n个系统(或方案)12,,,(1)nSSSn?,每个系统都有m属性(或指标)12,,,(1)mxxxm?。相应的都有N组本观测值为{}(1;1)ijximjN????。

如果按照某种方法由每一组样本都可以给出n个系统12,,,(1)nSSSn?的一个排序,则共有N个不同的排序结果。

问题:如何给出n个系统的最终排序结果呢?40

五、数据建模的综合排序方法

2.综合排序问题的方法

Borda函数方法:在第j个排序方案中排在第k个系统kS后面的个数为()jkBS,则系统kS的Borda数为

1()()(1,2,,)NkjkjBSBSkn????

按其大小排序,可得到n个系统的综合排序结果,即总排序结果。

41

1.指标数据的标准化处理

(1)溶解氧(DO)的标准化

注意到溶解氧(DO)为极大型指标,首先将数据指标作极小化处理,即令倒数变换111xx??,相应的分类标准区间变为

1111111111(0,],(,],(,],(,],(,],(,)7.57.566553322?,

然后通过极差变换5.011xx????将其数据标准化,对应的分类区间随之变为

(0,0.2667],(0.2667,0.3333],(0.3333,0.4],(0.4,0.6667],(0.6667,1],(1,)?

长江水质的综合评价模型

42

1.指标数据的标准化处理

(2)高锰酸盐指数(CODMn)的标准化

高猛酸盐指数本身就是极小型指标,即由极差变换将其数据标准化,

即令1522xx??,对应的分类区间随之变为

(0,0.1333],(0.1333,0.2667],(0.2667,0.4],(0.4,0.6667],(0.6667,1],(1,)?

(3)氨氮(NH3-N)的标准化

氨氮也是极小型指标,对指标数据作极差变换将其数据标准化,即令233xx??,对应的分类区间随之变为

(0,0.075],(0.075,0.25],(0.25,0.5],(0.5,0.75],(0.75,1],(1,)?

43

1.指标数据的标准化处理

(4)PH值的处理

酸碱度(PH值)的大小反映出水质呈酸碱性的程度,通常的水生物都适应于中性水质,即酸碱度的平衡值(PH值略大于7),在这里不妨取正常值的中值7.5。当PH<7.5时水质偏碱性,当PH>7.5时偏酸性,而偏离值越大水质就越坏,PH值属于中间型指标。为此,对所有的PH值指标数据作均值差处理,即令

5.7325.15.7444?????xxx,

则将其数据标准化。

44

2.动态加权函数的确定

根据对这一实际问题的分析,不妨取动态加权函数为偏大型正态分布函数,即

20,()1,iiixiixwxex?????????????????????当时,当时,

其中i?在这里取指标ix的Ⅰ类水标准区间的中值,即()()11()/2iiiba???,i?由)3,2,1(9.0)()(4??iawii确定。

由实际数据经计算可得0375.0,0667.0,1333.0321??????,,2197.0,1757.021????

3048.03??,则代入上式可以得到DO、CODMn和NH3-N三项指标的动态加权函数。

45

五、长江水质的综合评价模型

3.综合评价指标函数的确定

考虑到对实际评价效果影响差异较大的是前三项指标,以及指标PH值的特殊性,这里取前三项指标的综合影响权值为0.8,而PH值的影响权值取0.2。因此,根据综合评价模型,某城市某一时间的水质综合评价指标定义为

4312.0)(8.0xxxwXiiii????。

根据17个城市的28组实际检测数据,经计算可得各城市的水质综合评

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论