《应用统计学》课件-第9章综合评价_第1页
《应用统计学》课件-第9章综合评价_第2页
《应用统计学》课件-第9章综合评价_第3页
《应用统计学》课件-第9章综合评价_第4页
《应用统计学》课件-第9章综合评价_第5页
已阅读5页,还剩140页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第九章综合评价第一节综合评价的基本问题第二节综合评价指标处理方法第三节综合评价常规方法第四节灰色关联度评价法第五节模糊综合评价法第六节主成分分析法第七节因子分析法案例某市直属单位因工作需要,拟向社会公开招聘8名公务员,具体的招聘办法和程序如下:(1)公开考试:凡是年龄不超过30周岁,大学专科以上学历,身体健康者均可报名,考试科目包括综合基础知识,专业知识和行政职业能力测验三个部分,每科满分为100分,根据考试总分的高低顺序选出16人进入第二阶段的面试考核。(2)面试考核:面试考核主要考核应聘人员的知识面,对问题的理解能力,应变能力,表达能力等综合素质。按照一定的标准,面试专家组对每个应聘人员的各个方面都给出了一个等级评分,从高到低分成A/B/C/D四个等级,具体结果见下表。应聘人员笔试成绩专家组对应聘者特长的等级评分知识面理解能力应变能力表达能力1290AABB2288ABAC3288BADC4285ABBB5283BABC6283BDAB7280ABCB8280BAAC9280BBAB10280DBAC11278DCBA12277ABCA13275BCDA14275DBAB15274ABCB16273BABC现要求根据表中的数据信息,选择合适的方法,对16名应聘人员作出综合评价,选出8名作为录用的公务员。问题:怎么选择??综合评价法的应用范围投资决策项目评估质量评估方案选优工厂选址资源分配成果评价人才考核优先排序……第一节综合评价的基本问题一、综合评价的意义所谓统计评价,是指从数量上展示和说明研究对象的规模大小、水平高低、适度快慢,以及各种关系是否协调的分析方法和过程。从统计分析意义上讲,评价是指从总体上展示分析对象的规模大小、水平高低、速度快慢,各种关系是否协调合理等的分析研究方法及其结果。传统的评价分析仅表现为简单的数量比较。这种方法的优点明显的表现为:灵活、简单、约束条件少、适用范围广出;但也存在着较大的局限性。因为传统的评价方法是对总体某一方面特征的单个指标、在不同时间、不同空间上进行对比。综合评价可以避免一般评价方法局限性,使得运用多个指标对多个单位进行的评价成为可能。这种方法从计算及其需要考虑的问题上看都比较复杂,但由于其显著的特点——综合性和系统性,使得综合评价方法得到人们的认可。二、综合评价的一般步骤1.确定评价指标和评价指标体系2.确定评价指标的转换和综合方法在综合评价时,必须做到两点:(1)使所有的指标都从同一角度说明总体,这就提出了如何使指标同向化的问题;(2)所有的指标可以相加,这就提出了如何消除指标之间不同计量单位(不同度量)对指标数值大小的影响和不能加总(综合)的问题,即对指标进行无量纲化处理——计算单项评价值。无量纲化处理过程也就是计算单项指标评价值的过程。3.确定各个评价指标的权重4.求综合评价值——将单项评价值综合而成第二节综合评价指标处理方法一、统计指标无量纲化方法由于来自实际中的指标数据可能是各种各样的,特别是对于不同类型,不同单位,不同数量组的数据,存在不可公度性,在应用之前需要对这样的数据做一定的预处理,以便于在综合评价中做相应的运算,比较,和分析等。(一)逆向指标、统计对象适度指标正向化1.逆向指标倒数法:在有最小阀值条件下:在有最大阀值条件下:2.适度指标首先确定一个最优的适度值,然后按下述公式转化为正向指标:反映了适度指标值与适度值间的偏差。偏差越大,说明指标实际值离适度值越远,也就越不好;反之,偏差越小,则越好。(二)定性指标定量化 在实际中,很多问题都涉及到定性,或模糊指标的定量处理问题。例如:教学质量、科研水平、工作政绩、人员素质、各种满意度、信誉、态度、意识、观念、能力等因素有关的政治、社会、人文等领域的问题。如何对有关问题给出定量分析呢?在实际工作中,定性评价指标往往采用名次和等级两种形式。对于名次评价指标的定量化,可按下述公式转换:式中x---被评价对象的名次y---第i个被评价对象的评价得分n---所有参评对象的个数公式中是为了避免最后一名被评价对象的评价得分为零的情况,并能保证各被评价对象的评价得分均匀的分布在0与1之间。由于名次越小,说明被评价对象在该指标上越好,因此评价得分应越多。所以要采用“倒扣”的方法,即用1减去。对于等级评价指标,一种方法是确定定性与定量转化的量化系数,如将“优、良、差”分别记为“1、0.5、0.1”的评价系数等。从实际工作看,确定这种评价系数是没有统一标准的,这需要根据具体情况灵活处理。另一种方法是将等级转化成标准百分比。(三)(正向)定量指标的无量纲化1.直线型——指标评价值与实际值之间是一种线性关系,评价值随实际值等比例变化。常见的直线型无量纲化方法包括阀值化、中心化、规格化、标准化和比重化等。阈值化阈值即临界值,是衡量事物发展变化的一些特殊指标值,如极大值、极小值(此时又称极值法)、满意值、不允许值、标准值(如平均数)等。阀值化是将指标的实际值与该指标的阀值相比较,从而得到指标评价值的方法,即这里,阀值的确定对综合评价是至关重要的。中心化也称为均值化,先求出每个评价指标的样本均值,再将指标的实际值与该指标的均值相比较,就得中心化后的评价值,即规格化也称极差正规化,先找出每个指标的最大值max和最小值min,这两者之差称为极差(也称全距),然后以每个指标实际值减去该指标的最小值,再除以极差,就得到正规化评价值,即这种无量纲化方法实际上是求各评价指标实际值在该指标全距中所处位置的比率。标准化在运用多元统计方法进行综合评价,用得最多的无量纲化方法就是标准化法。先求出每个指标的样本均值和标准差就得到标准化评价值,即

一般说来,只有当被评价对象(即样本)较多时,才能用上述无量纲化公式。比重化主要计算公式有:这种无量纲化方法为多目标决策分析中的一些方法所采用。2.折线型——现象小于某点时,对综合水平影响大,评价值变化大;大于某点时,对综合水平影响小,评价值变化小(现象发展呈阶段性、指标值在不同阶段对事物总体水平的影响不相同——就是分段处理)。这时将指标实际值转化为评价值应采用折线公式,即:3.曲线型——有些事物发展的阶段性的分界点不很明显,而前中后各期发展情况又截然不同,即指标值变化对事物总体水平的影响是逐渐变化的,而非突变的。常用的主要有如下形式的升半哥西分布公式,即:怎样选择无量纲化方法(模型)呢?需要(准确反映客观实际)与可能结合。实际中大多用直线代替曲线,因为:简单易行;评价是对事物发展水平的相对意义上的描述,而不是绝对的刻画,如A比B好,而不是评价A比B好的数量有多少,所以在不影响被评价对象相对地位的情况下,就用简单的近似的描述;不是任何情况下曲线就最精确,曲线还有模型形式和参数的选取问题,若选取不当,曲线评价的结果就不是最精确的。经济分析管理追求的是相对意义上的满意解,不象数学追求绝对意义上的最优解。第二节综合评价指标处理方法二、指标赋权方法按权数的表现形式分为:绝对数权数比重权数按确定权数的方法分为:主观赋权法客观赋权法

主观赋权法德尔菲法(专家法)——实际上各个专家可以根据自己的理解选择不同的方法相邻指标比较法;(先按重要性将全部评价指标排序,再将相邻指标的重要性进行比较层次分析法(AHP)——互反式两两比较构权法。

客观赋权法从指标的统计性质来考虑,它是由客观数据决定。常见的客观赋权的统计方法还有:变异信息构权、相关信息构权、熵信息构权。1.变异信息构权(离散系数法)指标的区分度越高,对排序的影响就越大。基于这种观点,以区分度(方差)信息量为权重。这种方法直接将各评价指标的标准差(系数)向量进行归一化处理而得。各指标的离散系数为做归一化处理后得权重为:1.变异信息构权(离散系数法)指标的区分度越高,对排序的影响就越大。基于这种观点,以区分度(方差)信息量为权重。这种方法直接将各评价指标的标准差(系数)向量进行归一化处理而得。各指标的离散系数为做归一化处理后得权重为:2.熵信息构权(熵值法)熵有不同定义,相应有不同评价方法。它本质上仍然是离散程度大-熵值小-权大。只是定义了一个新的测度变异情况的指标(=1—熵值)。由此,任一相对变异指标都可用来定权。3.相关信息构权复相关系数法——每个被选指标,根据其余指标对它的复相关系数来确定权数。复相关系数大,权数是应该取大还是取小?相关系数总和法——对其它指标的相关系数的总和,再作倒数处理并归一化(但对负相关的处理也有争议)。第二节综合评价指标处理方法三、指标评价值的综合方法线性综合法将各个指标评价值求和而获得综合评价值的一种综合方法。常采用加权求和的方式来计算综合评价值。基本公式为:线性综合法对评价值数据没有什么要求。无论什么数值,都可以按上式获得综合评价值,且方法计算方便。几何综合法基本公式为:当各评价指标间的重要程度差别较小,而评价值间的差异较大时,采用几何综合法比较适合。几何综合法对计算数据的要求较高,它要求各指标的评价值应均为正数。混合综合法混合的方式有多种,比较常用的方式是直接混合,即由于混合综合法兼有线性和几何综合两种方法的优点,因此,它适合于各评价指标间重要程度差异较大,而且各指标评价值间的差异也较大时的场合。这种方法在计算操作时比较麻烦。第三节综合评价常规方法一、综合评分法将各种不可加的指标实际值运用指标分数转换形式(如评分标准表)转换成可加的评价分数值,然后采用线性综合法求得综合分值,用以比较和排序。综合评分有以下两种具体形式:1.先确定各指标的权数和评分标准,然后对每一指标的实际值按照评分标准给其打分。一般按五级评分,即5分为最优,1分为最差。最后用权数对单项评价指标的得分进行加权线性求和,即可得综合分值。2.对各单项指标的实际值,以同类被评价对象的平均水平为基础进行打分。打分标准可按各指标与标准(平均水平)相比较的相对数定分,每高(或低)一定的百分比多打(或少打)1分;也可按各项指标的水平差异情况分组定分,每高于平均水平组一级则多记1分,高几级则多记几分,反之则少计分。最后将各指标的得分加权求和即得总得分。二、综合指数评价法这种方法先选定各指标的评价标准,然后把各指标的实际值与之比较,最后将计算得到的各指标个体指数加权平均。其计算公式为:这种方法既可对不同时期同一被评价对象进行纵向对比,也可对同一时期不同被评价对象进行横向比较。三、秩和比评价法秩和比评价方法首先把具有不同经济意义的各评价指标实际值转化为秩(也称等级),然后将各指标的秩加权求和,最后根据秩和比进行比较和排序。1.等级化2.确定指标相对重要性权数3.求秩和比4.比较和排序四、功效系数评价法功效系数评价法是根据多目标规划原理提出来的,其基本思想是,通过功效函数将不同度量的各指标实际值转化为无量纲的功效系数,然后采用线性或几何综合法将这些同度量的功效系数综合起来,得到综合评价值,以此作为综合评价的依据。(一)功效函数正指标功效系数:逆指标功效系数:(二)权数的确定在用功效系数评价法进行综合评价时,只要取1、2、3这三个正整数,就足以区分各评价指标的相对重要性程度。确定权数的基本原则是:比较重要的指标赋权3,与其它评价指标相关的指标赋权1,一般重要的赋权2。(三)综合功效系数的计算功效系数评价法既可以用线性综合法,也可以用几何综合法将各个指标的功效系数综合起来,从而得到一个综合功效系数。线性综合法:几何综合法:第四节灰色关联度评价法一、关联分析概述社会系统、经济系统、农业系统、生态系统等抽象系统包含有多种因素,这些因素哪些是主要的,哪些是次要的,哪些影响大,哪些影响小,那些需要抑制,那些需要发展,那些事潜在的,哪些是明显的,这些都是因素分析的内容。例如在社会系统中,人口是一种重要的子系统。影响人口发展变化的有社会因素,如计划生育、社会治安、社会道德风尚、社会的生活方式等。影响人口发展变化的因素还有经济的,如社会福利、社会保险;还有医疗的,如医疗条件、医疗水平等。总之,人口是多种因素互相关联、互相制约的子系统。这些因素的分析对于控制人口、发展生产是必要的。因素分析的基本方法过去采用的主要是统计的方法,如回归分析,回归分析虽然是一种较通用的方法,但大都只用于少因素的、线性的。对于多因素的,非线性的则难以处理。

灰色系统理论考虑到回归分析方法的种种弊病和不足,采用关联分析的方法来作系统分析。作为一个发展变化的系统,关联度分析事实上是动态过程发展态势的量化分析。即发展态势的量化比较分析。以下就介绍一种衡量因素间关联程度大小的量化方法。二、关联系数与关联度

数据列的表示方式关联系数计算公式关联系数计算关联度无量纲化数列的增值性数据列的表示方式做关联分析先要指定参考数据列。参考数据列常记为,记第1个时刻的值为,第2个时刻的值为,第k个时刻的值为。因此,参考序列可表示为关联分析中被比较数列常记为,类似参考序列的表示方法

,,关联系数计算公式

对于一个参考数据列,有几个比较数列的情况。可以用下述关系表示各比较曲线与参考曲线在各点(时刻)的差。式中,是第个时刻比较曲线与参考曲线的相对差值,它称为对在时刻的关联系数。其中,是分辨系数,记为一般在0与1之间选取;

==关联系数计算虽然两级最大差与最小差容易求出,但一般不能计算关联系数,这是由于作关联度计算的数列的量纲最好是相同的,当量纲不同时要化为无量纲。此外还要求所有数列有公共交点。为了解决这两个问题,计算关联系数之前,先将数列作初值化处理,即用每一个数列的第一个数除其它数,这样既可使数列无量纲又可得到公共交点即第1点。[例]关联系数的计算给出已出初值化的序列如下:

下面分三步计算关联系数:第一步求差序列各个时刻与的绝对差如下序号

12345600.0660.1660.250.686100.0250.9250.8751.3752.2500.11.31.452.12.8第二步求两级最小差与最大差容易求出第三步计算关联系数将数据代入关联系数计算公式,得

令,有因此有序号12345600.0660.1660.250.6861作关联系数在各个时刻的值的集合,得关联系数序

同理有关联度关联系数的数很多,信息过于分散,不便于比较,为此有必要将各个时刻关联系数集中为一个值,求平均值便是做这种信息处理集中处理的一种方法。关联度的一般表达式为:

无量纲化

无量纲化的方法常用的有初值化与均值化,区间相对值化。初值化是指所有数据均用第1个数据除,然后得到一个新的数列,这个新的数列即是各个不同时刻的值相对于第一个时刻的值的百分比。经济序列中常用此法处理。均值化处理则是用平均值去除所有数据,以得到一个占平均值百分比的数列。数列的增值性

数列的增值性是指原来两数列发展态势相同,经初值化后,初值大的发展态势变慢了,初值小的发展态势相对增大。所谓增值性是指:作为经济序列,指“初值”放在银行内,经过一定的时间后,由于利息引起的增值。作为资金序列,指在正常经营下,资金周转一定时间后带来的利益。作为价格上涨的情况,指初值的折算货物经一定时间后价格上涨所带来的增值。

作为其他数列,指不同初值经一定时间后所引起的不同效果。比如微分方程的解,在相同指数下,初始值大的曲线可能是衰减的,而初始值小的曲线是上升的。因此增值性大的数列要保持相对的发展速率则应有更大的绝对发展速率。

三、应用实例[例]山西省汾河上游的输沙量与降雨径流的灰色关联分析汾河是山西省的主要河流,在汾河下游距太原市100多公里的西山修建了汾河水库。该水库不但对农业灌溉、防洪蓄水、鱼类养殖等起着很大作用,并且还为太原市的用水提供了保证。建库以来,人们经常在考虑如何防止库容被泥沙淤塞,使水库能长期有效为工农业生产与人民生活服务。影响泥沙输入水库的因素较多,比如降雨量、径流量、植被覆盖率等。在这些因素中哪些是主要的,哪些是次要的有待研究和量化分析。

以输沙量为参考数列,以年径流量为,平均年降雨量为,平均汛期降雨量为则相应的关联系数序列如下:根据关联系数求关联度得(年径流量与输沙量的关联程度)(年平均降雨量与输沙量的关联程度)(平均汛期降雨量与输沙量的关联程度)相应的关联序为上述关联序表明对输沙量影响最大的是年径流量,其次是汛期降雨量,再其次是平均年降雨量。实际上,强度大的暴雨冲刷力大,难以被土壤吸收,从而在地表形成径流,造成水土流失,引起河道泥沙流量的形成。

而暴雨又大多在汛期,因此径流量是引起河道输沙的综合因素,所以径流量大反映了雨强大,反映了水土保持较差,反映了水土流失较严重,反映了汛期雨量较大。而汛期的降雨量可能是雨强较大的的降雨量,也可能是雨强较小的降雨量。而平均年降雨量则与雨强、水土保持、水土流失无直接关系。第五节模糊综合评价方法一、基本思想和原理模糊综合评价是借助模糊数学的一些概念,对实际的综合评价问题提供一些评价的方法。具地说,模糊综合评价就是以模糊数学为基础,应用模糊关系合成的原理,将一些边界不清、不易定量的因素定量化,从多个因素对被评价事物隶属等级状况进行综合性评价的一种方法。模糊综合评价的基本原理:首先确定被评价对象的因素(指标)集合评价(等级)集;再分别确定各个因素的权重及它们的隶属度向量,获得模糊评判矩阵;最后把模糊评判矩阵与因素的权向量进行模糊运算并进行归一化,得到模糊综合评价结果。特点在于评判逐对象进行,对被评价对象有唯一的评价值,不受被评价对象所处对象集合的影响。综合评价的目的是要从对象集中选出优胜对象,所以还需要将所有对象的综合评价结果进行排序。二、模糊综合评价法的模型和步骤1.确定评价对象的因素论域也就是说有m个评价指标,表明我们对被评价对象从哪些方面来进行评判描述。2.确定评语等级论域评语集是评价者对被评价对象可能做出的各种总的评价结果组成的集合,用V表示:实际上就是对被评价对象变化区间的一个划分。其中代表第i个评价结果,n为总的评价结果数。3.进行单因素评价,建立模糊关系矩阵R单独从一个因素出发进行评价,以确定评价对象对评价集合V的隶属程度,称为单因素模糊评价。在构造了等级模糊子集后,就要逐个对被评价对象从每个因素上进行量化,也就是确定从单因素来看被评价对象对各等级模糊子集的隶属度,进而得到模糊关系矩阵:

其中表示某个被评价对象从因素来看对等级模糊子集的隶属度。一个被评价对象在某个因素方面的表现是通过模糊向量来刻画的(在其他评价方法中多是由一个指标实际值来刻画,因此从这个角度讲,模糊综合评价要求更多的信息),称为单因素评价矩阵,可以看作是因素集U和评价集V之间的一种模糊关系,即影响因素与评价对象之间的“合理关系”。

在确定隶属关系时,通常是由专家或与评价问题相关的专业人员依据评判等级对评价对象进行打分,然后统计打分结果,然后可以根据绝对值减数法求得4.确定评价因素的模糊权向量为了反映各因素的重要程度,对各因素U应分配给一个相应的权数,通常要求满足,于是表示第i个因素的权重,再由各权重组成的一个模糊集合A就是权重集。在进行模糊综合评价时,权重对最终的评价结果会产生很大的影响,不同的权重有时会得到完全不同的结论。5.多因素模糊评价利用合适的合成算子将A与模糊关系矩阵R合成得到各被评价对象的模糊综合评价结果向量B。R中不同的行反映了某个被评价对象从不同的单因素来看对各等级模糊子集的隶属程度。用模糊权向量A将不同的行进行综合就可以得到该被评价对象从总体上来看对各等级模糊子集的隶属程度,即模糊综合评价结果向量B。模糊综合评价的模型为:其中是由A与R的第j列运算得到的,表示被评级对象从整体上看对等级模糊子集的隶属程度。6.对模糊综合评价结果进行分析模糊综合评价的结果是被评价对象对各等级模糊子集的隶属度,它一般是一个模糊向量,而不是一个点值,因而他能提供的信息比其他方法更丰富。对多个评价对象比较并排序,就需要进一步处理,即计算每个评价对象的综合分值,按大小排序,按序择优。将综合评价结果B转换为综合分值,于是可依其大小进行排序,从而挑选出最优者。四、模糊综合评价法的应用及案例分析

模糊综合评价法多用于模糊环境下对受多因素影响的事物坐综合决策的领域。比如对企业融资效率、创新能力、经济效益、绩效考核的评价;选址问题;交通路线比选等等模糊性问题中。

此外,模糊综合评价法常常与AHP、DEA、GRA以及BP神经网络等方法一起使用。第六节主成分分析法主成分分析的基本思想在很多情形,特征之间是有一定的相关关系的,当两个特征之间有一定相关关系时,可以解释为这两个变量反映样本的信息有一定的重叠。主成分分析是对于原先提出的所有特征,建立尽可能少的新特征,使得这些新变量是两两不相关的,而且这些新变量在反映研究对象的信息方面尽可能保持原有的信息。

一、主成分分析的基本原理

假定有样本,每个样本共有p个特征,构成一个n×p阶的数据矩阵

当p较大时,在p维空间中考察问题比较麻烦。为了克服这一困难,就需要进行降维处理,即用较少的几个综合指标代替原来较多的变量指标,而且使这些较少的综合指标既能尽量多地反映原来较多变量指标所反映的信息,同时它们之间又是彼此独立的。

定义:记x1,x2,…,xP为原变量指标,z1,z2,…,zm(m≤p)为新变量指标

系数lij的确定原则:①

zi与zj(i≠j;i,j=1,2,…,m)不相关;②z1是x1,x2,…,xP的一切线性组合中方差最大者,z2是与z1不相关的x1,x2,…,xP的所有线性组合中方差最大者;…;zm是与z1,z2,……,zm-1都不相关的x1,x2,…xP,的所有线性组合中方差最大者。

则新变量指标z1,z2,…,zm分别称为原变量指标x1,x2,…,xP的第1,第2,…,第m主成分。

从以上的分析可以看出,主成分分析的实质就是确定原来变量xj(j=1,2,…,

p)在诸主成分zi(i=1,2,…,m)上的荷载

lij(

i=1,2,…,m;

j=1,2,…,p)。从数学上可以证明,它们分别是相关矩阵m个较大的特征值所对应的特征向量。

二、主成分分析的计算步骤

(一)计算相关系数矩阵

rij(i,j=1,2,…,p)为原变量xi与xj的相关系数,rij=rji,其计算公式为:(二)计算特征值与特征向量

①解特征方程,常用雅可比法(Jacobi)求出特征值,并使其按大小顺序排列②

分别求出对应于特征值的特征向量,要求=1,即,其中表示向量的第j个分量。③

计算主成分贡献率及累计贡献率贡献率累计贡献率

一般取累计贡献率达85%~95%的特征值所对应的第1、第2、…、第m(m≤p)个主成分。

④计算主成分载荷

三、主成分分析方法应用实例

根据下表1给出的数据,对某农业生态经济系统做主成分分析。表1

某农业生态经济系统各区域单元的有关数据

步骤如下:(1)将表1中的数据作标准差标准化处理,然后将它们代入计算相关系数矩阵(表2)。表2相关系数矩阵

(2)由相关系数矩阵计算特征值,以及各个主成分的贡献率与累计贡献率(表3)。由表3可知,第1,第2,第3主成分的累计贡献率已高达86.596%(大于85%),故只需要求出第1、第2、第3主成分z1,z2,z3即可。

表3特征值及主成分贡献率

(3)对于特征值=4.6610,=2.0890,=1.0430分别求出其特征向量e1,e2,e3,再用公式计算各变量x1,x2,…,x9在主成分z1,z2,z3上的载荷(表4)。表4主成分载荷

上述计算过程,可以借助于SPSS或Matlab软件系统实现。

(1)第1主成分z1与x1,x5,x6,x7,x9呈现出较强的正相关,与x3呈现出较强的负相关,而这几个变量则综合反映了生态经济结构状况,因此可以认为第1主成分z1是生态经济结构的代表。

(2)第2主成分z2与x2,x4,x5呈现出较强的正相关,与x1呈现出较强的负相关,其中,除了x1为人口总数外,x2,x4,x5都反映了人均占有资源量的情况,因此可以认为第2主成分z2代表了人均资源量。

分析:

显然,用3个主成分z1、z2、z3代替原来9个变量(x1,x2,…,x9)描述农业生态经济系统,可以使问题更进一步简化、明了。(3)第3主成分z3与x8呈现出的正相关程度最高,其次是x6,而与x7呈负相关,因此可以认为第3主成分在一定程度上代表了农业经济结构。(4)另外,表3.5.4中最后一列(占方差的百分数),在一定程度上反映了3个主成分z1、z2、z3包含原变量(x1,x2,…,x9)的信息量多少。第七节因子分析法因子分析的基本思想因子分析是根据相关矩阵内部的依赖关系,把一些具有错综复杂关系的变量综合为数量较少的几个因子。通过不同因子来分析决定某些变量的本质及其分类的一种统计方法。简单地说,就是根据相关性大小把变量分组,使得同组内的变量之间相关性较高,不同组的变量相关性较低。每组变量代表一个基本结构,这个基本结构称为因子。

90例如某机关对其职员就以下6个方面进行考核,这6个方面是职员的词汇、阅读、写作能力,以及数字、代数、微积分的运算能力。而这6个方面可归结为职员的语文能力和数学能力两个方面。91因子分析(factoranalysis)是一种数据简化的技术。它通过研究众多变量之间的内部依赖关系,探求观测数据中的基本结构,并用少数几个假想变量来表示其基本的数据结构。这几个假想变量能够反映原来众多变量的主要信息。原始的变量是可观测的显在变量,而假想变量是不可观测的潜在变量,称为因子。

例如,在企业形象或品牌形象的研究中,消费者可以通过一个有24个指标构成的评价体系,评价百货商场的24个方面的优劣。92但消费者主要关心的是三个方面,即商店的环境、商店的服务和商品的价格。因子分析方法可以通过24个变量,找出反映商店环境、商店服务水平和商品价格的三个潜在的因子,对商店进行综合评价。而这三个公共因子可以表示为:

称是不可观测的潜在因子。24个变量共享这三个因子,但是每个变量又有自己的个性,不被包含的部分,称为特殊因子。93注意:因子分析与回归分析不同,因子分析中的因子是一个比较抽象的概念,而回归因子有非常明确的实际意义。主成分分析分析与因子分析也有不同,主成分分析仅仅是变量变换,而因子分析需要构造因子模型。主成分分析:原始变量的线性组合表示新的综合变量,即主成分。因子分析:潜在的假想变量和随机影响变量的线性组合表示原始变量。94一、

因子分析基本原理

(一)因子模型

设个变量,如果表示为95称为公共因子,是不可观测的变量,他们的系数称为因子载荷。是特殊因子,是不能被前m个公共因子包含的部分。并且满足:即不相关;96即互不相关,方差为1。97即互不相关,方差不一定相等,。98用矩阵的表达方式991、因子载荷aij的统计意义

因子载荷是第i个变量与第j个公共因子的相关系数

模型为

(载荷矩阵中第i行,第j列的元素)反映了第i个变量与第j个公共因子的相关性。绝对值越大,相关的密切程度越高。

根据公共因子的模型性质,有

(二)因子载荷矩阵中的几个统计特征100

因子载荷不是惟一的且满足因子模型的条件设T为一个p×p的正交矩阵,令A*=AT,,则模型可以表示为1012、变量共同度的统计意义统计意义:两边求方差

所有的公共因子和特殊因子对变量的贡献为1。如果非常靠近1,非常小,则因子分析的效果好,从原变量空间到公共因子空间的转化性质好。定义:变量的共同度是因子载荷矩阵的第i行的元素的平方和。记为102

3、公共因子方差贡献的统计意义因子载荷矩阵中各列元素的平方和称为所有的对的方差贡献和。衡量的相对重要性。103因子载荷矩阵的估计方法

设随机向量的均值为

,协方差为

,

的特征根,为对应的标准化特征向量,则

主成分分析法104

上式给出的表达式是精确的,然而,它实际上是毫无价值的,因为我们的目的是寻求用少数几个公共因子解释,故略去后面的p-m项的贡献,有105

上式有一个假定,模型中的特殊因子是不重要的,因而从的分解中忽略了特殊因子的方差。106107

假定某地固定资产投资率,通货膨胀率,失业率,相关系数矩阵为试用主成分分析法求因子分析模型。108

特征根为:

109

可取前两个因子F1和F2为公共因子,第一公因子F1物价就业因子,对X的贡献率为51.67%。第二公因子F2为投资因子,对X的贡献为28.33%。共同度分别为1,0.706,0.706。110(三)因子旋转(正交变换)

因子分析的数学目的不仅仅要找出公共因子以及对变量进行分组,更重要的要知道每个公共因子的含义,以便进行进一步的分析。如果每个公共因子的含义不清,则不便于进行实际背景的解释。由于因子载荷阵是不惟一的,所以应该对因子载荷阵进行旋转。目的是使因子载荷阵的结构简化,使载荷矩阵每列或行的元素平方值向0和1两极分化。主要的正交旋转法有方差最大法和四次方最大法。1.为什么要旋转因子111

百米跑成绩跳远成绩铅球成绩跳高成绩

400米跑成绩百米跨栏铁饼成绩撑杆跳远成绩标枪成绩

1500米跑成绩

奥运会十项全能运动项目得分数据的因子分析

112

因子载荷矩阵可以看出,除第一因子中所有的变量在公共因子上有较大的正载荷,可以称为一般运动因子。其他的3个因子不太容易解释。似乎是跑和投掷的能力对比,似乎是长跑耐力和短跑速度的对比。于是考虑旋转因子,得下表

113变量F1F2F3F4共同度X1X2X3X4X5X6X7X8X9X100.8840.6310.2450.2390.7970.4040.186-0.036-0.0480.0450.1360.1940.8250.1500.0750.1530.8140.1760.735-0.0410.1560.5150.2230.7500.1020.6350.1470.7620.1100.112-0.113-0.006-0.1480.0760.468-0.17-0.0790.2170.1410.9340.840.700.810.650.870.620.720.660.570.89114

通过旋转,因子有了较为明确的含义。百米跑,跳远和400米跑,需要爆发力的项目在有较大的载荷,可以称为短跑速度因子;铅球,铁饼和标枪在上有较大的载荷,可以称为爆发性臂力因子;百米跨栏,撑杆跳远,跳远和为跳高在上有较大的载荷,爆发腿力因子;为长跑耐力因子。1152.旋转方法(1)方差最大法(2)四次方最大旋转116

(1)方差最大法

方差最大法从简化因子载荷矩阵的每一列出发,使和每个因子有关的载荷值平方的方差最大。当只有少数几个变量在某个因子上有较高的载荷值时,对因子的解释最简单。方差最大的直观意义是希望通过因子旋转后,使每个因子上的载荷值尽量拉开距离,一部分的载荷趋于

1,另一部分趋于0。117118根据求极值的原理,使

,由此可求出因子轴旋转角度119当公共因子个数m>2时,可以将上述m=2的方法用于逐次对每两个公共因子进行旋转。每旋转一次,V值就会增大,即V是单调不减的,并且V是有界的,因为因子载荷的绝对值不大于1。因此,经过若干次旋转后,V变化相对就不大了,即可停止旋转。对两因子的旋转,120

(2)四次方最大旋转

四次方最大旋转是从简化载荷矩阵的行出发,通过旋转初始因子,使每个变量只在一个因子上有较高的载荷,而在其它的因子上尽可能低的载荷。如果每个变量只在一个因子上有非零的载荷,这时的因子解释是最简单的。

四次方最大法通过使因子载荷矩阵中每一行的因子载荷平方的方差达到最大。121122旋转后因子的共同度设正交矩阵,做正交变换旋转后因子的共同度没有发生变化!123旋转后公共因子的方差贡献设正交矩阵,做正交变换旋转后公共因子的方差贡献发生了变化!124(四)因子得分

1.因子得分的概念

前面我们主要解决了用公共因子的线性组合来表示一组观测变量的有关问题。如果我们要使用这些因子做其他的研究,比如把得到的因子作为自变量来做回归分析,对样本进行分类或评价,这就需要我们对公共因子进行测度,即给出公共因子的值。125

因子分析的数学模型为:

因子得分函数:可见,要求得每个因子的得分,必须求得分函数的系数,而由于p>m,所以不能得到精确的得分,只能通过估计。1262、回归法

(1)思想

其中127128简记为其中因此129而因子载荷阵故130

人均要素变量因子分析。对我国31个省市自治区的要素状况作因子分析。指标体系中有如下指标:X1:人口(万人)X2:面积(万平方公里)X3:GDP(亿元)X4:人均水资源(立方米/人)X5:人均生物量(吨/人)X6:万人拥有的大学生数(人)X7:万人拥有科学家、工程师数(人)

RotatedFactorPatternFACTOR1FACTOR2FACTOR3X1-0.21522-0.273970.89092X20.63973-0.28739-0.28755X3-0.157910.063340.94855X40.95898-0.01501-0.07556X50.97224-0.06778-0.17535X6-0.114160.98328-0.08300X7-0.110410.97851-0.07246131

高载荷指标

因子命名

因子1X2;面积(万平方公里)X4:人均水资源(立方米/人)X5:人均生物量(吨/人)自然资源因子

因子2X6:万人拥有的大学生数(人)X7:万人拥有的科学家、工程师数(人)

人力资源因子

因子3

X1;人口(万人)X3:GDP(亿元)经济发展总量因子

X1=-0.21522F1-0.27397F2+0.89092F3+X2=0.63973F1-0.28739F2-0.28755F3+X3=-0.15791F1+0.06334F2+0.94855F3+X4=0.95898F1-0.01501F2-0.07556F3X5=0.97224F1-0.06778F2-0.17535F3X6=-0.11416F1+0.98328F2-0.08300F3X7=-0.11041F1+0.97851F2-0.07246F3132

StandardizedScoringCoefficients

FACTOR1

FACTOR2

FACTOR3

X10.05764

-0.06098

0.50391X20.22724

-0.09901

-0.07713X30.14635

0.12957

0.59715X40.47920

0.11228

0.17062X50.45583

0.07419

0.10129X60.05416

0.48629

0.04099X70.05790

0.48562

0.04822F1=0.05764X1+0.22724X2+0.14635X3+0.47920X4+0.45583X5+0.05416X6+0.05790X7F2=-0.06098X1-0.09901X2+0.12957X3+0.11228X4+0.07419X5+0.48629X6+0.48562X7F3=0.50391X1-0.07713X2+0.59715X3+0.17062X4+0.10129X5+0.04099X6+0.04822X7133REGIONFACTOR1FACTOR2FACTOR3beijing©-0.081694.23473-0.37983tianjin-0.474221.31789-0.87891hebei-0.22192-0.358020.86263shanxi1-0.48214-0.32643-0.54219neimeng0.54446-0.66668-0.92621liaoning-0.205110.463770.34087jilin-0.214990.10608-0.57431heilongj0.10839-0.11717-0.02219shanghai-0.200692.38962-0.04259前三个因子得分134二、

因子分析法综合评价的基本步骤(一)选择分析的变量用定性分析和定量分析的方法选择变量,因子分析的前提条件是观测变量间有较强的相关性,因为如果变量之间无相关性或相关性较小的话,他们不会有共享因子,所以原始变量间应该有较强的相关性。(二)计算所选原始变量的相关系数矩阵相关系数矩阵描述了原始变量之间的相关关系。可以帮助判断原始变量之间是否存在相关关系,这对因子分析是非常重要的,因为如果所选变量之间无关系,做因子分析是不恰当的。并且相关系数矩阵是估计因子结构的基础。135(三)提取公共因子这一步要确定因子求解的方法和因子的个数。需要根据研究者的设计方案或有关的经验或知识事先确定。因子个数的确定可以根据因子方差的大小。只取方差大于1(或特征值大于1)的那些因子,因为方差小于1的因子其贡献可能很小;按照因子的累计方差贡献率来确定,一般认为要达到70%才能符合要求;(四)因子旋转通过坐标变换使每个原始变量在尽可能少的因子之间有密切的关系,这样因子解的实际意义更容易解释,并为每个潜在因子赋予有实际意义的名字。136(五)计算因子得分

求出各样本的因子得分,有了因子得分值,则可以在许多分析中使用这些因子,例如以因子的得分做聚类分析的变量,做回归分析中的回归因子。

(六)用因子分析方法进行综合评价通过因子分析,取m个公共因子,以每个公共因子的方差贡献率为权

构造综合评价函数按F值的大小对样品进行排序比较或分类。137三、应用举例

国民生活质量的因素分析

国家发展的最终目标,是为了全面提高全体国民的生活质量,满足广大国民日益增长的物质和文化的合理需求。在可持续发展消费的统一理念下,增加社会财富,创自更多的物质文明和精神文明,保持人类的健康延续和生生不息,在人类与自然协同进化的基础上,维系人类与自然的平衡,达到完整的代际公平和区际公平(即时间过程的最大合理性与空间分布的最大合理化)。

138

从1990年开始,联合国开发计划署(UYNP)首次采用“人文发展系数”指标对于国民生活质量进行测度。人文发展系数利用三类内涵丰富的指标组合,即人的健康状况(使用出生时的人均预期寿命表达)、人的智力程度(使用组合的教育成就表达)、人的福利水平(使用人均国民收入或人均GDP表

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论