大连海事大学-刘巍-高等运筹第十四讲_第1页
大连海事大学-刘巍-高等运筹第十四讲_第2页
大连海事大学-刘巍-高等运筹第十四讲_第3页
大连海事大学-刘巍-高等运筹第十四讲_第4页
大连海事大学-刘巍-高等运筹第十四讲_第5页
已阅读5页,还剩154页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、高等运筹学,目录,第一篇 运筹学发展历史 第二篇 运筹学中的数学规划 第三篇 运筹学中的组合优化 第四篇 运筹学中的随机优化 第五篇 运筹学中的博弈论 第六篇 运筹学中管理科学 第七篇 运筹学中智能计算 第八篇 运筹学发展势态,第四篇 运筹学中的管理科学,第二十九章 决策理论与方法 第三十章 预测理论与方法 第三十一章 评价理论与方法,第三十章 评价理论与方法,运用多个指标对多个参评对象进行评价的理论和方法。目前较成熟的评价方法有: 层次分析法 模糊综合评价法 主成份分析法 聚类分析法 数据包络分析法,第1节 评价研究的基本概念,评价,就是指依据明确的目标,按照一定的标准,采用科学方法,测量对

2、象的功能、品质和属性,并对评价对象做出价值性的判断。 在评价研究中,可以通过问卷调查、量表测量来收集资料,但它只是评价研究中的收集资料的工具,而不等同于评价研究。,一、评价研究的特征,评价研究的特征表现在评价的目标性与价值性的判断。 (一)评价的目标性 评价的目标性是指评价研究是一项具有明确的目的和目标的研究活动。评价的目的是指通过评价活动后所期望达到的结果。通常有三种不同类型的期望结果。,比较评等,这属于相对性评价,目的是通过对两个不同对象的评价,以期对这两个对象的差异性做出判断。假如用a和b代表两个不同对象,比较评等就是要判断是否存在ab或ab。 达标衡量,这属于绝对性评价,是以某一对象作

3、为比较的标准(a0),经过对另一对象a的评价研究,对对象a做出是否达到aa0的判断。 发展比较,这属于自我评价,是以自身的前后状况进行比较,通过对对象a不同时期的评价研究,对对象a做出是否存在a2a1的判断。,(二)评价研究的价值判断性,评价研究的价值判断性表现在评价过程中,需要根据目标分解出若干评价要素(项目),由评判者依据一定的标准,对评价对象的各项功能、品质和属性进行等级的判断。在获得逐项的评判结果之后,还要根据各项目的重要程度制定权重,把各项目的评判等级与权重综合,从而对总体做出等级比较、达标状况或发展程度的判断。,二、评价研究的要素,评价研究由三个基本要素构成: 1. 评价对象 这是

4、指被评价、被研究的人或者事物。2. 评价指标体系 它是评价研究工作的工具,通过它有目的地进行资料的搜集、整理、分析;同时,它又是评价判断的依据,依据它作出价值性的判断。3. 评判者,三、评价指标体系的设计,评价对象是客观的事物。系统科学理论指出,任何客观的事物都是系统与要素的统一体。任何客观事物都是由若干相互联系、相互作用的要素组成的有机体。要素是构成系统的组成单元,系统的组成单元又可分为不同的层次。在一个稳定的系统中,一方面,要素之间相互独立,彼此存在,有着差异性;另一方面,要素之间又按一定比例,相互联系和相互作用,形成一定的层次结构。 根据这一基本原理,我们可以把评价对象根据某种特定的目标

5、分解为若干层次,每个层次又可分解出若干组成要素,依据每个要素和每一结构层次所起的作用和功能形成评价指标体系。因此,指标实际上是目标在一个方面的规定,它是具体的、可测的、行为化和操作化了的目标。,指标体系设计的原则,指标在评价中的地位决定了指标体系的设计必须从下列原则出发,并满足下列条件。 (一)与目标的一致性 指标既然是目标的具体化、行为化和操作化,那么它就必须充分地反映目标,要与目标或管理目标相一致。 指标与目标的一致性还蕴含着体系内各条具体指标的一致性,不能把两条相互冲突的指标放在同一体系中。同一体系内有两条指标相互冲突,说明这两条指标至少有一条是不符合目标的,在实践中,它必然会造成人们思

6、想的混乱,使评价工作无所适从。因此,这类情况需要引起我们的特别重视。,(二)直接的可测性,指标的直接可测性就是指标作为具体的目标,可用操作化的语言加以定义,它所规定的内容可通过实际观察加以直接测量,以获得明确的结论。 众所周知,培养学生良好的思想品质是我们应用教育技术开展教与学活动的一个目标。学生思想状态的总体变化无疑是反映学校思想政治工作优良程度的一个标志。但是,我们不能把思想作为评价的指标,因为思想是人体大脑内部的一种活动,它不具有直接可测性,我们至今还无法直接观察人的思想,测量人的思想。然而,这并不是说思想不可测,只是说它无法直接测量。我们可以把这一目标转化成可测量的指标间接地测量。比如

7、,我们可以通过学生在各项集体活动中的表现,把这些反映人的思想本质的行为作为思想状态的指标。这些指标把“良好的思想”这一抽象的目标具体化,就把这一不可直接测量的目标可测化了。,(三)体系内指标的相互独立性,评价的指标体系是由一组相互间有着紧密联系的指标结合而成的。但是,体系内的各条指标又必须是相互独立的,就是说在同一层次的各条指标必须不存在任何包含与被包含的关系,相互不重叠,不存在因果关系,不能从这一条导出那一条。 为什么评价的指标必须是独立的?原因主要有二:其一是指标不独立,两条指标实质上反映了同一事物,说明其中有一条是冗余的,它的存在对整个指标体系没有贡献,无疑还加大了整个评价的工作量,因而

8、也就降低了评价的可行性。其二,更重要的是,指标不独立,则在指标体系中,同一指标重复计算了两次,实际上是加大了这一条指标的权重。比如,如果把知识与能力看成是具有同等的重要性,那么,这两条指标的权重则是相等的。如果在能力中又加进智力这一条,则能力的权重就会出现倍于知识的情况。在权重集合中,这种偏差的出现无疑极大地影响了整个评价的科学性。,(四)指标体系的整体完备性 指标的整体完备性就是指标体系的指标全面性。指标体系不应遗漏任一重要的指标,能够全面地、毫无遗漏地再现和反映目标。 (五)指标的可比性 指标的可比性就是指标必须反映被评价对象共同的属性。这种属性的一致性,是可比的前提,也是可比的基础。例如

9、,高等教育的评价指标体系,每一所高等学校都有其特殊之点,但是指标不能反映这些特殊点。某些院校在办学方面具有自己的特色,这些特色是其一定办学水平的表现,但是作为对评价对象共同使用的指标,不能反映这些特殊性,因此,可以通过自报、自填项目的方式加以弥补。,(六)可接受性 指标的可接受性具有两层含义:其一是符合我国的国情,从实际出发提出指标才是可接受的。其二是按指标进行评价是可行的。这意思是,第一有足够的信息可利用;第二有足够的人力物力可利用;第三有切实可行的量化方法可利用。 上述指标体系的设计原则是对指标体系设计者提出的要求。同时也为指标体系的设计、修改和完善指出了途径和方法。,目标分解,指标必须与

10、目标相一致,可以通过分解目标的方式来形成指标体系。这是建立指标体系的基本途径。对于复杂的系统,还可以在目标与指标之间设置若干中间过渡环节。中间环节通常称之为次级目标。因此,我们可以把目标分解为三个基本层次,如图11-3所示,它分为总体指标(零级指标)、结构指标(一级指标)、单项指标(二级指标)三部分。,在科学研究中,最常见的评价对象是管理与应用水平的评价。它包括的范围很广,如工作水平的评价,建设水平的评价等。对于这些对象的评价,其结构指标部分有两种分类方法,一种是把管理状况作为单项列入结构指标中,另一类则把它分散列入条件与工作状态指标之中,如图11-4所示。,第2节 层次分析法,层次分析法,层

11、次分析法(Analytical Hierarchy Process ,简称AHP)是美 国匹兹堡大学教授A.L.Saaty于20世纪70年代提出的一种系统 分析方法。,目前,AHP应用在能源政策分析、产业结构研究、科技成果评 价、发展战略规划、人才考核评价、以及发展目标分析的许多 都取得了令人满意的成果。,层次分析法建模,一 问题的提出 日常生活中有许多决策问题。决策是指在面临多种方案时需要依据一定的标准选择某一种方案。 例1 某人准备选购一台电冰箱 他对市场上的6种不同类型的电冰箱进行了解后,选取一些中间指标进行考察。例如电冰箱的容量、制冷级别、价格、型式、耗电量、外界信誉、售后服务等。然后

12、再考虑各种型号冰箱在上述各中间标准下的优劣排序。借助这种排序,最终作出选购决策。在决策时,由于6种电冰箱对于每个中间标准的优劣排序一般是不一致的,因此,决策者首先要对这7个标准的重要度作一个估计,给出一种排序,然后把6种冰箱分别对每一个标准的排序权重找出来,最后把这些信息数据综合,得到针对总目标即购买电冰箱的排序权重。有了这个权重向量,决策就很容易了。,例2 旅游 假期旅游,是去风光秀丽的苏州,还是去凉爽宜人的北戴河, 或者是去山水甲天下的桂林?通常会依据景色、 费用、食宿条件、旅途等因素选择去哪个地方。 例3 择业 面临毕业,可能有高校、科研单位、企业等单位可以去 选择,一般依据工作环境、工

13、资待遇、发展前途、住房条 件等因素择业。,例4 科研课题的选择 由于经费等因素,有时不能同时开展几个课题,一般依据课题的可行性、应用价值、理论价值、被培养人才等因素进行选题。,面临各种各样的方案,要进行比较、判断、评价、最后 作出决策。这个过程主观因素占有相当的比重,各种因素的影响很难量化,从而给用数学方法解决问题带来不便。T. L. Saaty 等人在20世纪七十年代提出了一种能有效处理这类问题的实用方法。 层次分析法(Analytic Hierarchy Process, AHP)这是 一种定性和定量相结合的、系统化的、层次化的分析方法。 过去研究自然和社会现象主要有机理分析法和统计分析法

14、两 种方法,前者用经典的数学工具分析现象的因果关系,后者 以随机数学为工具,通过大量的观察数据寻求统计规律。近 年发展的系统分析是又一种方法,而层次分析法是系统分析 的数学工具之一。,层次分析法的基本思路:,与人们对某一复杂决策问题的思维、判断过程大体一致。,选择钢笔,质量、颜色、价格、外形、实用,钢笔1、钢笔2、钢笔3、钢笔4,将各个钢笔的质量、颜色、价格、外形、实用进行排序 经综合分析决定买哪支钢笔,广西沿海产业决策的属性层次建模方法,案例,1.问题的提出,北部湾地区包括广东省雷州半岛、广西壮族自治区南部、海南省西部和越南北部,其背靠大西南,毗邻越南,邻近港澳地区,面向东南亚,有着明显的区

15、位优势。近几年来,这些地方的经济发展都显露出勃勃生机,加快这一区域的开发,具有重大的现实意义。,1.1北部湾地区区位现状:,1.2北部湾广西区的产业状况:,北部湾广西段主要由北海、钦州、防城三市构成,它地处环北部湾的中心地带,对于整个北部湾经济圈的建设和发展有着至关重要的作用。目前广西沿海地区经济基础薄弱、技术实力欠缺、服务水平低下、商贸不够繁荣。如何加快广西沿海地区经济发展,促进北部湾(广西)经济区的建设,该重点建设那些产业?又应当优先发展那些产业?,经济区的产业决策,是一个复杂的问题,要考虑的因素很多,下面大家思考一下应考虑那些因素?,2.广西沿海产业决策属性层次结构,良好的区位条件 该地

16、区已有的产业结构层次 与其它经济区间的产业互补 现有的产业基础、交通条件和技术支持 产业发展所需资金 对环境产生的影响,广西沿海产业决策属性层次结构,我们选择如下六个主要方面来考虑,最高层为产业决策的综合评价层,记为G; 中间层为指标评价标准层,有6个指标项:1) 区位条件,记为C1;2) 产业结构,记为C2;3) 区域互补,记为C3;4) 产业基础,记为C4;5) 资金需求,记为C5;6) 环境因素,记为C6。 最底层为产业对象层,设为n个,记为,A1,A2 ,An。,广西沿海产业决策属性层次结构,建立层次结构,模型分为三层。,层次结构模型图:,广西沿海产业决策属性层次结构,3. 模型的求解

17、,模型的求解,按照AHP的比例尺度,得到评价北部湾(广西)经济区产业发展6个指标的重要性判别矩阵:,3.1构造属性判断矩阵和相对属性权,利用公式(1)(4)和判别矩阵,可得AHM属性判断矩阵和相对属性权WG,模型的求解,3.2计算受评产业对目标G的合成权重,模型的求解,北部湾(广西)区经济基础不高,急需发展一些主要产业来加速经济建设,依据广西沿海的实际情况,通过调研与分析,现假设拟加大投入发展海产品业(包括海洋渔业、海洋水产加和海洋药物制造等)、海洋油气业(以油气探测、开采为主)、重化工业(以石油化工、冶金、能源等为重点的临港重工业)和滨海旅游四个产业。由于资源有限,同时投入资金太大,且四个产

18、业在建设时间上有先后,投入比例侧重也有所不同。现通过建立产业决策的属性层次模型求出各产业投资的综合权重。,模型的求解,各产业对比指标,模型的求解,各指标的属性判断矩阵和相对属性权,模型的求解,最后的合成属性权为:,由求得的合成属性权可知,权重最大的是A3(重化工业,0.3331);权重第二的是A4(滨海旅游业,0.2859);第三是A1(海产品业,0.2230);最后是A2(海洋油气业,0.1589)。 所以在北部湾(广西)经济区的产业建设上首先就重点投资重化工业的建设,第二要大力发展旅游业,第三要逐渐将海洋渔业、海产品加工形成规模;最后再对南海的石油、天然气进行开采,为经济区的建设提供能源保

19、障。,模型的求解,4. 一致性检验与模型验证,4. 一致性检验与模型验证,属性层次模型(AHM)是球赛模型,而层次分析法模型(AHP)是重量模型,在AHP中若有AB,B C,则必要求A C。所以必须对模型进行一致性检验 。 在球赛模型AHM中,甲队胜乙队,乙队胜丙队,并不要求甲队一定要胜过丙队。所以,在AHM方法中,可不做一致性检验 。,4.1一致性检验,一致性检验与模型验证,4.2模型验证,利用区位优势,建设以大工业、大港口、大旅游为主的支柱产业是目前广西沿海的经济战略目标。 现拟投产建设的重大项目有:在广西沿海建全亚洲最大的铝业基地;中石油在钦州市建年加工1000万吨原油项目;柳钢与武钢联

20、合在防城港建设临海大型钢铁基地;此外,还有制糖、林浆纸工业等也在不断加大投入形成规模。 广西沿海地区经济基础薄弱、技术实力欠缺,适合发展以交通、原料、能源为基础的低端产业,它们既可以较好地辐射经济腹地,又可以承接发达地区的产业转移。另外,广西沿海旅游资源丰富,游客众多,发展旅游业,投资少、见效快、收益大,也是当前经济发展与产业融资的有效手段,所以也应大力发展。模型所求结果正与广西沿海的实际经济战略相吻合,验证了模型的正确性。,第3 节 模糊综合评价,模糊综合评价法是一种基于模糊数学的综合评价方法。该方法根据模糊数学的隶属度理论把定性评价转化为定量评价,具有结果清晰、系统性强的特点,能较好地解决

21、模糊的、难以量化的问题,适合各种非确定性问题的解决。,一、模糊综合评价模型,对方案、人才、成果的评价,人们的考虑的因素很多,而且有些描述很难给出确切的表达,这时可采用模糊评价方法。它可对人、事、物进行比较全面而又定量化的评价,是提高领导决策能力和管理水平的一种有效方法。,模 糊 集合,设 X 为一基本集,若对每个x X 都指定一个数 则定义模糊子集,基本概念,(一)模糊集合,称为 的隶属函数, 称为元素 的,隶属度。,模糊统计确定隶属函数的方法:,(二)隶属函数的确定,该方法是先选取一个基本集,然后取其中任一元素xi,再考虑此元素属于集合 的可能性。,模糊集合的 截集是指 中对 的隶属度不小于

22、 的一切元素组成的普通集合。 其定义为:,(三)截集,对于给定的实数 ,定义,为 的 截集,其中, 叫置信水平。,模糊综合评价的基本步骤:,(1)首先要求出模糊评价矩阵P,其中P表示方案X在第i个目标处于第j级评语的隶属度,当对多个目标进行综合评价时,还要对各个目标分别加权,设第i个目标权系数为W,则可得权系数向量: A(W1,W2,W),(2)利用矩阵的模糊乘法得到综合模糊评价向量B BAP(其中为模糊乘法) 例如: (0.8,0.5,0.3,0.7) (0.4,0.7,0.5,0.2) 则 (0.80.4)(0.5 0.7) 0.4 0.5 0.3 0.2 0.5,例:对某品牌电视机进行综

23、合模糊评价,设评价指标集合: U图像,声音,价格; 评语集合: V很好,较好,一般,不好,首先对图像进行评价: 假设有30%的人认为很好,50%的人认为较好,20%的人认为一般,没有人认为不好,这样得到图像的评价结果为 (0.3, 0.5, 0.2 , 0) 同样对声音有:0.4, 0.3, 0.2 , 0.1) 对价格为:(0.1, 0.1, 0.3 , 0.5) 所以有模糊评价矩阵:,设三个指标的权系数向量: A 图像评价,声音评价,价格评价 (0.5, 0.3, 0.2) 所以有综合评价结果为: BAP (0.3, 0.5, 0.2, 0.2) 归一化处理: B(0.25, 0.42,

24、0.17, 0.17) 所以综合而言,电视机还是比较好的比重大。,例:对科技成果项目的综合评价,有甲、乙、丙三项科研成果,现要从中评选出优秀项目。,三个科研成果的有关情况表,设评价指标集合: U科技水平,实现可能性,经济效益 评语集合: V高,中,低 评价指标权系数向量: A(0.2,0.3,0.5),专家评价结果表,由上表,可得甲、乙、丙三个项目各自的评价矩阵P、Q、R:,求得:,归一化后得:,所以项目乙可推荐为优秀项目,第4节 主成分分析法,主成份分析法是一种降维的统计方法。 借助于一个正交变换,将其分量相关的原随机向量转化为其分量不相关的新随机向量。 这在代数上表现为将原随机向量的协方差

25、阵变换成对角形阵,在几何上表现为将原坐标系变换成新的正交坐标系,使之指向样本点散布最开的p个正交方向,然后对多维变量系统进行降维处理,使之能以一个较高的精度转换成低维变量系统,再通过构造适当的价值函数,进一步把低维系统转化成一维系统。,主成分分析,每个人都会遇到有很多变量的数据。 比如全国或各个地区的带有许多经济和社会变量的数据;各个学校的研究、教学等各种变量的数据等等。 这些数据的共同特点是变量很多,在如此多的变量之中,有很多是相关的。人们希望能够找出它们的少数“代表”来对它们进行描述。 本节就介绍两种把变量维数降低以便于描述、理解和分析的方法:主成分分析(principal compone

26、nt analysis)和因子分析(factor analysis)。实际上主成分分析可以说是因子分析的一个特例。在引进主成分分析之前,先看下面的例子。,成绩数据(student.sav),100个学生的数学、物理、化学、语文、历史、英语的成绩如下表(部分)。,从本例可能提出的问题,目前的问题是,能不能把这个数据的6个变量用一两个综合变量来表示呢? 这一两个综合变量包含有多少原来的信息呢? 能不能利用找到的综合变量来对学生排序呢?这一类数据所涉及的问题可以推广到对企业,对学校进行分析、排序、判别和分类等问题。,主成分分析,例中的的数据点是六维的;也就是说,每个观测值是6维空间中的一个点。我们希

27、望把6维空间用低维空间表示。 先假定只有二维,即只有两个变量,它们由横坐标和纵坐标所代表;因此每个观测值都有相应于这两个坐标轴的两个坐标值;如果这些数据形成一个椭圆形状的点阵(这在变量的二维正态的假定下是可能的) 那么这个椭圆有一个长轴和一个短轴。在短轴方向上,数据变化很少;在极端的情况,短轴如果退化成一点,那只有在长轴的方向才能够解释这些点的变化了;这样,由二维到一维的降维就自然完成了。,主成分分析,当坐标轴和椭圆的长短轴平行,那么代表长轴的变量就描述了数据的主要变化,而代表短轴的变量就描述了数据的次要变化。 但是,坐标轴通常并不和椭圆的长短轴平行。因此,需要寻找椭圆的长短轴,并进行变换,使

28、得新变量和椭圆的长短轴平行。 如果长轴变量代表了数据包含的大部分信息,就用该变量代替原先的两个变量(舍去次要的一维),降维就完成了。 椭圆(球)的长短轴相差得越大,降维也越有道理。,主成分分析,对于多维变量的情况和二维类似,也有高维的椭球,只不过无法直观地看见罢了。 首先把高维椭球的主轴找出来,再用代表大多数数据信息的最长的几个轴作为新变量;这样,主成分分析就基本完成了。 注意,和二维情况类似,高维椭球的主轴也是互相垂直的。这些互相正交的新变量是原先变量的线性组合,叫做主成分(principal component)。,主成分分析,正如二维椭圆有两个主轴,三维椭球有三个主轴一样,有几个变量,就

29、有几个主成分。 选择越少的主成分,降维就越好。什么是标准呢?那就是这些被选的主成分所代表的主轴的长度之和占了主轴长度总和的大部分。有些文献建议,所选的主轴总长度占所有主轴长度之和的大约85%即可,其实,这只是一个大体的说法;具体选几个,要看实际情况而定。,对于我们的数据,SPSS输出为,这里的Initial Eigenvalues就是这里的六个主轴长度,又称特征值(数据相关阵的特征值)。头两个成分特征值累积占了总方差的81.142%。后面的特征值的贡献越来越少。,特征值的贡献还可以从SPSS的所谓碎石图看出,怎么解释这两个主成分。前面说过主成分是原始六个变量的线性组合。是怎么样的组合呢?SPS

30、S可以输出下面的表。,这里每一列代表一个主成分作为原来变量线性组合的系数(比例)。比如第一主成分作为数学、物理、化学、语文、历史、英语这六个原先变量的线性组合,系数(比例)为-0.806, -0.674, -0.675, 0.893, 0.825, 0.836。,如用x1,x2,x3,x4,x5,x6分别表示原先的六个变量,而用y1,y2,y3,y4,y5,y6表示新的主成分,那么,原先六个变量x1,x2,x3,x4,x5,x6与第一和第二主成分y1,y2的关系为: X1=-0.806y1 + 0.353y2 X2=-0.674y1 + 0.531y2 X3=-0.675y1 + 0.513y

31、2 X4= 0.893y1 + 0.306y2 x5= 0.825y1 + 0.435y2 x6= 0.836y1 + 0.425y2 这些系数称为主成分载荷(loading),它表示主成分和相应的原先变量的相关系数。 比如x1表示式中y1的系数为-0.806,这就是说第一主成分和数学变量的相关系数为-0.806。 相关系数(绝对值)越大,主成分对该变量的代表性也越大。可以看得出,第一主成分对各个变量解释得都很充分。而最后的几个主成分和原先的变量就不那么相关了。,可以把第一和第二主成分的载荷点出一个二维图以直观地显示它们如何解释原来的变量的。这个图叫做载荷图。,该图左面三个点是数学、物理、化学

32、三科,右边三个点是语文、历史、外语三科。图中的六个点由于比较挤,不易分清,但只要认识到这些点的坐标是前面的第一二主成分载荷,坐标是前面表中第一二列中的数目,还是可以识别的。,因子分析,主成分分析从原理上是寻找椭球的所有主轴。因此,原先有几个变量,就有几个主成分。 而因子分析是事先确定要找几个成分,这里叫因子(factor)(比如两个),那就找两个。 这使得在数学模型上,因子分析和主成分分析有不少区别。而且因子分析的计算也复杂得多。根据因子分析模型的特点,它还多一道工序:因子旋转(factor rotation);这个步骤可以使结果更好。 当然,对于计算机来说,因子分析并不比主成分分析多费多少时

33、间。 从输出的结果来看,因子分析也有因子载荷(factor loading)的概念,代表了因子和原先变量的相关系数。但是在输出中的因子和原来变量相关系数的公式中的系数不是因子载荷,也给出了二维图;该图虽然不是载荷图,但解释和主成分分析的载荷图类似。,主成分分析与因子分析的公式上的区别,主成分分析,因子分析(mp),因子得分,对于我们的数据,SPSS因子分析输出为,这里,第一个因子主要和语文、历史、英语三科有很强的正相关;而第二个因子主要和数学、物理、化学三科有很强的正相关。因此可以给第一个因子起名为“文科因子”,而给第二个因子起名为“理科因子”。从这个例子可以看出,因子分析的结果比主成分分析解

34、释性更强。,这两个因子的系数所形成的散点图(虽然不是载荷,在SPSS中也称载荷图,,可以直观看出每个因子代表了一类学科,计算因子得分,可以根据前面的因子得分公式(因子得分系数和原始变量的标准化值的乘积之和),算出每个学生的第一个因子和第二个因子的大小,即算出每个学生的因子得分f1和f2。 人们可以根据这两套因子得分对学生分别按照文科和理科排序。当然得到因子得分只是SPSS软件的一个选项(可将因子得分存为新变量、显示因子得分系数矩阵),因子分析和主成分分析的一些注意事项,可以看出,因子分析和主成分分析都依赖于原始变量,也只能反映原始变量的信息。所以原始变量的选择很重要。 另外,如果原始变量都本质

35、上独立,那么降维就可能失败,这是因为很难把很多独立变量用少数综合的变量概括。数据越相关,降维效果就越好。 在得到分析的结果时,并不一定会都得到如我们例子那样清楚的结果。这与问题的性质,选取的原始变量以及数据的质量等都有关系 在用因子得分进行排序时要特别小心,特别是对于敏感问题。由于原始变量不同,因子的选取不同,排序可以很不一样。,SPSS实现(因子分析与主成分分析),拿student.sav为例,选AnalyzeData ReductionFactor进入主对话框; 把math、phys、chem、literat、history、english选入Variables,然后点击Extractio

36、n, 在Method选择一个方法(如果是主成分分析,则选Principal Components), 下面的选项可以随意,比如要画碎石图就选Scree plot,另外在Extract选项可以按照特征值的大小选主成分(或因子),也可以选定因子的数目; 之后回到主对话框(用Continue)。然后点击Rotation,再在该对话框中的Method选择一个旋转方法(如果是主成分分析就选None), 在Display选Rotated solution(以输出和旋转有关的结果)和Loading plot(以输出载荷图);之后回到主对话框(用Continue)。 如果要计算因子得分就要点击Scores,再

37、选择Save as variables(因子得分就会作为变量存在数据中的附加列上)和计算因子得分的方法(比如Regression);之后回到主对话框(用Continue)。这时点OK即可。,案例,港口综合竞争力评价,第5节 聚类分析,分类,俗语说,物以类聚、人以群分。 但什么是分类的根据呢? 比如,要想把中国的县分成若干类,就有很多种分类法; 可以按照自然条件来分, 比如考虑降水、土地、日照、湿度等各方面; 也可以考虑收入、教育水准、医疗条件、基础设施等指标; 既可以用某一项来分类,也可以同时考虑多项指标来分类。,聚类分析,对于一个数据,人们既可以对变量(指标)进行分类(相当于对数据中的列分类

38、),也可以对观测值(事件,样品)来分类(相当于对数据中的行分类)。 比如学生成绩数据就可以对学生按照理科或文科成绩(或者综合考虑各科成绩)分类, 当然,并不一定事先假定有多少类,完全可以按照数据本身的规律来分类。 本章要介绍的分类的方法称为聚类分析(cluster analysis)。对变量的聚类称为R型聚类,而对观测值聚类称为Q型聚类。这两种聚类在数学上是对称的,没有什么不同。,饮料数据(drink.sav ),16种饮料的热量、咖啡因、钠及价格四种变量,如何度量远近?,如果想要对100个学生进行分类,如果仅仅知道他们的数学成绩,则只好按照数学成绩来分类;这些成绩在直线上形成100个点。这样

39、就可以把接近的点放到一类。 如果还知道他们的物理成绩,这样数学和物理成绩就形成二维平面上的100个点,也可以按照距离远近来分类。 三维或者更高维的情况也是类似;只不过三维以上的图形无法直观地画出来而已。在饮料数据中,每种饮料都有四个变量值。这就是四维空间点的问题了。,两个距离概念,按照远近程度来聚类需要明确两个概念:一个是点和点之间的距离,一个是类和类之间的距离。 点间距离有很多定义方式。最简单的是歐氏距离,还有其他的距离。 当然还有一些和距离相反但起同样作用的概念,比如相似性等,两点越相似度越大,就相当于距离越短。 由一个点组成的类是最基本的类;如果每一类都由一个点组成,那么点间的距离就是类

40、间距离。但是如果某一类包含不止一个点,那么就要确定类间距离, 类间距离是基于点间距离定义的:比如两类之间最近点之间的距离可以作为这两类之间的距离,也可以用两类中最远点之间的距离作为这两类之间的距离;当然也可以用各类的中心之间的距离来作为类间距离。在计算时,各种点间距离和类间距离的选择是通过统计软件的选项实现的。不同的选择的结果会不同,但一般不会差太多。,向量x=(x1, xp)与y=(y1, yp)之间的距离或相似系数:,欧氏距离:,平方欧氏距离:,夹角余弦(相似系数1),(相似系数2):,Chebychev: Maxi|xi-yi|,(绝对距离): Si|xi-yi|,Minkowski:,

41、当变量的测量值相差悬殊时,要先进行标准化. 如R为极差, s 为标准差, 则标准化的数据为每个观测值减去均值后再除以R或s. 当观测值大于0时, 有人采用Lance和Williams的距离,类Gp与类Gq之间的距离Dpq(d(xi,xj)表示点xi Gp和xj Gq之间的距离),最短距离法:,最长距离法:,重心法:,离差平方和: (Wald),类平均法:,(中间距离, 可变平均法,可变法等可参考各书).,有了上面的点间距离和类间距离的概念,就可以介绍聚类的方法了。这里介绍两个简单的方法。,事先要确定分多少类:k-均值聚类,前面说过,聚类可以走着瞧,不一定事先确定有多少类;但是这里的k-均值聚类

42、(k-means cluster,也叫快速聚类,quick cluster)却要求你先说好要分多少类。看起来有些主观,是吧! 假定你说分3类,这个方法还进一步要求你事先确定3个点为“聚类种子”(SPSS软件自动为你选种子);也就是说,把这3个点作为三类中每一类的基石。 然后,根据和这三个点的距离远近,把所有点分成三类。再把这三类的中心(均值)作为新的基石或种子(原来的“种子”就没用了),重新按照距离分类。 如此叠代下去,直到达到停止叠代的要求(比如,各类最后变化不大了,或者叠代次数太多了)。显然,前面的聚类种子的选择并不必太认真,它们很可能最后还会分到同一类中呢。下面用饮料例的数据来做k-均值

43、聚类。,假定要把这16种饮料分成3类。利用SPSS,只叠代了三次就达到目标了(计算机选的种子还可以)。这样就可以得到最后的三类的中心以及每类有多少点,根据需要,可以输出哪些点分在一起。结果是:第一类为饮料1、10;第二类为饮料2、4、8、11、12、13、14;第三类为剩下的饮料3、5、6、7、9、15、16。,SPSS实现(聚类分析),K-均值聚类 以数据drink.sav为例,在SPSS中选择AnalyzeClassifyK-Menas Cluster, 然后把calorie(热量)、caffeine(咖啡因)、sodium(钠)、price(价格)选入Variables, 在Number

44、 of Clusters处选择3(想要分的类数), 如果想要知道哪种饮料分到哪类,则选Save,再选Cluster Membership等。 注意k-均值聚类只能做Q型聚类,如要做R型聚类,需要把数据阵进行转置。,事先不用确定分多少类:分层聚类,另一种聚类称为分层聚类或系统聚类(hierarchical cluster)。开始时,有多少点就是多少类。 它第一步先把最近的两类(点)合并成一类,然后再把剩下的最近的两类合并成一类; 这样下去,每次都少一类,直到最后只有一大类为止。显然,越是后来合并的类,距离就越远。再对饮料例子来实施分层聚类。,对于我们的数据,SPSS输出为,例:5个样品距离阵令D

45、k为系统聚类法种第k次合并时的距离,如Dk为单调的,则称具有单调性.前面只有重心和中间距离法不具有单调性.,步骤: 最短距离法 最长距离法 阶段bk(第k阶段类的集合)DkDk D(0)(1)(2)(3)(4)(5)00 D(1) (1,3)(2)(4)(5)11 D(2) (1,3)(2,4)(5) 33 D(3) (1,3)(2,4,5)45 D(4) (1,3,2,4,5)69 注:最短和最长距离法结果一样(一般不一定一样),聚类要注意的问题,聚类结果主要受所选择的变量影响。如果去掉一些变量,或者增加一些变量,结果会很不同。 相比之下,聚类方法的选择则不那么重要了。因此,聚类之前一定要目

46、标明确。 另外就分成多少类来说,也要有道理。只要你高兴,从分层聚类的计算机结果可以得到任何可能数量的类。但是,聚类的目的是要使各类距离尽可能地远,而类中点的距离尽可能的近,而且分类结果还要有令人信服的解释。这一点就不是数学可以解决的了。,SPSS实现(聚类分析),分层聚类 对drink.sav数据在SPSS中选择AnalyzeClassifyHierarchical Cluster, 然后把calorie(热量)、caffeine(咖啡因)、sodium(钠)、price(价格)选入Variables, 在Cluster选Cases(这是Q型聚类:对观测值聚类),如果要对变量聚类(R型聚类)则

47、选Variables, 为了画出树状图,选Plots,再点Dendrogram等。,啤酒成分和价格数据(data14-02),啤酒名热量钠含量酒精价格 Budweiser 144.00 19.00 4.70 .43 Schlitz 181.00 19.00 4.90 .43 Ionenbrau 157.00 15.00 4.90 .48 Kronensourc 170.00 7.00 5.20 .73 Heineken 152.00 11.00 5.00 .77 Old-milnaukee145.00 23.00 4.60 .26 Aucsberger 175.00 24.00 5.50 .4

48、0 Strchs-bohemi149.00 27.00 4.70 .42 Miller-lite 99.00 10.00 4.30 .43 Sudeiser-lich113.00 6.00 3.70 .44 Coors 140.00 16.00 4.60 .44 Coorslicht 102.00 15.00 4.10 .46 Michelos-lich135.00 11.00 4.20 .50 Secrs 150.00 19.00 4.70 .76 Kkirin 149.00 6.00 5.00 .79 Pabst-extra-l 68.00 15.00 2.30 .36 Hamms 136

49、.00 19.00 4.40 .43 Heilemans-old144.00 24.00 4.90 .43 Olympia-gold- 72.00 6.00 2.90 .46 Schlite-light 97.00 7.00 4.20 .47,StatisticsClassify Hierarchical Cluster: Variables:啤酒名和成分价格等 Cluster(Case, R聚类) Display: (Statistics)(Agglomeration Schedule凝聚状态表), (Proximity matrix), Cluster membership(Single

50、solution, 4) Method: Cluster (Furthest Neighbor), Measure-Interval (Squared Euclidean distance), Transform Value (Range 0-1/By variable (值-最小值)/极差) Plots: (Dendrogram) Icicle(Specified range of cluster, Start-1,Stop-4, by-1), Orientation (Vertical) Save: Cluster Membership(Single solution 4),啤酒例子,下表

51、(Proximity matrix)中行列交叉点为两种啤酒之间各变量的欧氏距离平方和,凝聚过程:Coefficients为不相似系数,由于是欧氏距离,小的先合并.,分为四类的聚类结果,冰柱图(icicle),聚类树型图,学生测验数据(data14-03) 50个学生,X1-X10个测验项目 要对变量聚类(Q型聚类) 过程和R型聚类(对cases)一样,StatisticsClassify Hierarchical Cluster: Variables:x1-x10 Cluster(Variable, Q聚类) Display: (Statistics) (Proximity matrix),

52、Cluster membership(Single solution, 2) Method: Cluster (Furthest Neighbor), Measure-Interval (Pearson correlation), Plots: Icicle(All Cluster),学生测验例子,下表(Proximity matrix)中行列交叉点为两个变量之间各变量的欧氏距离平方和,分为两类的聚类结果,冰柱图(icicle),第6节 数据包络分析(DEA),数据包络分析法由美国运筹学家查恩斯和库伯1986年提出,它是对拥有多投入和多产出的多个决策单元进行效率评价的一种数学方法。目前已发展出

53、适用于不同数据和条件的多种数据包络分析模型,是评价理论最活跃的一个分支。,【例】某银行的4个分理处的投入产出情况如所示。要求分别确定各分理处运行的相对有效性,【例】某地区为了优化产业结构,对该地区的建筑、食品、纺织、医药、电子和房地产产业进行分析,确定相对优势的产业,为制定地区产业发展战略服务。,由上表可以看出,该问题分析的难点在于各分析评价对象在输出和输入指标上的差异很大,而且各项输入指标和输出指标之间也不是相互独立的,因此不能先用AHP法等确定权重。DEA给出了科学的评价方法和思路。,数据包络分析(DEA),数据包络分析是一种基于线性规划的用于评价同类型组织(或项目)工作绩效相对有效性的特

54、殊工具手段。这类组织例如学校、医院、银行的分支机构、超市的各个营业部等,各自具有相同(或相近)的投入和相同的产出。衡量这类组织之间的绩效高低,通常采用投入产出比这个指标,当各自的投入产出均可折算成同一单位计量时,容易计算出各自的投入产出比并按其大小进行绩效排序。,数据包络分析概述,119,数据包络分析概述,但当被衡量的同类型组织有多项投入和多项产出,且不能折算成统一单位时,就无法算出投入产出比的数值。例如,大部分机构的运营单位有多种投入要素,如员工规模、工资数目、运作时间和广告投入,同时也有多种产出要素,如利润、市场份额和成长率。在这些情况下,很难让经理或董事会知道,当输入量转换为输出量时,哪

55、个运营单位效率高,哪个单位效率低。 因而,需采用一种全新的方法进行绩效比较。这种方法就是二十世纪七十年代末产生的数据包络分析(DEA)。DEA方法处理多输入,特别是多输出的问题的能力是具有绝对优势的。,1978年,著名运筹学家、美国德克萨斯大学教授A.Charnes及W.W.Cooper和E.Rhodes发表了一篇重要论文:“Measuring the efficiency of decision making units”(决策单元的有效性度量),刊登在权威的“欧洲运筹学杂志”上。正式提出了运筹学的一个新领域:数据包络分析,其模型简称 C2R 模型。该模型用以评价部门间的相对有效性(因此被称

56、为DEA有效)。,数据包络分析(DEA)源起,DEA模型是直接使用输入、输出数据建立非参数的经济数学模型。,121,数据包络分析应用现状,DEA的优点吸引了众多的应用者,应用范围已扩展到美国军用飞机的飞行、基地维修与保养,以及陆军征兵、城市、银行等方面目前,这一方法应用的领域正在不断地扩大。它也可以用来研究多种方案之间的相对有效性(例如投资项目评价);研究在做决策之前去预测一旦做出决策后它的相对效果如何(例如建立新厂后,新厂相对于已有的一些工厂是否为有效)。DEA模型甚至可以用来进行政策评价。,122,数据包络分析应用现状,最引人注目的研究是把DEA与其它评价方法进行比较。例如将DEA应用于北

57、卡罗来纳州各医院的有效性评价。已有的按计量经济学方式给出的回归生产函数认为,此例中不存在规模收益。DEA的研究发现,尽管使用同样的数据,回归生产函数不能象DEA那样正确测定规模收益其关键在于: DEA和回归方法虽然都使用给定的同样数据,但使用方式不一样; DEA致力于每个单个医院的优化,而不是对整个集合的统计回归优化。 在其它的研究中,例如在评价医院经营有效性时,将DEA与马萨诸塞州有效性评定委员会使用的比例方法进行了比较,当使用模拟方法对DEA进行检验后认为,尽管由回归函数产生的数据有利于回归方法的使用,但是DEA方法显得更有效,123,数据包络分析(DEA)模型简介,DEA是使用数学规划(

58、包括线性规划、多目标规划、具有锥形结构的广义最优化、半无限规划、随机规划等)模型,评价具有多个输入、特别是多个输出的“部门”或“单位”(称为“决策单元”,简记DMU)间的相对有效性(称为DEA有效)。 实际上“效率”或“相对有效性”的概念也是指产出与投入之比,不过是加权意义之下的产出投入比。 根据对各DMU观察的数据判断DMU是否为DEA有效,本质上是判断DMU是否位于可能集的“生产前沿面”上。,在DEA中一般称被衡量绩效的组织为决策单元(decision making unitDMU)。 设:n 个决策单元( j = 1,2,n ) 每个决策单元有相同的 m 项投入(输入)(i = 1,2,

59、m ) 每个决策单元有相同的 s 项产出(输出) (r = 1,2,s ) Xij 第 j 决策单元的第 i 项投入 yrj 第 j 决策单元的第 r 项产出 衡量第 j0 决策单元是否DEA有效,数据包络分析基本概念,126,输入型与输出型的DEA模型,Input-DEA 模型:基于投入的技术效率,即在一定产出下,以最小投入与实际投入之比来估计。或者说,决策者追求的倾向是输入的减少,即求的最小。 Output-DEA 模型:基于产出的技术效率,即在一定的投入组合下,以实际产出与最大产出之比来估计。或者说,决策者追求的倾向是输出的增大,即求z的最大。,127,C2R模型,128,C2R的对偶输入模型模型,129,C2R的对偶输出模型模型,130,BC2的对偶输入模型模型,Banker, Charnes and Cooper(1984),衡量某一决策单元 j0是否DEA有效是否处于由包络线组成的生产前沿面

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论