第三章系统模型与模型化(主成分及聚类分析)_第1页
第三章系统模型与模型化(主成分及聚类分析)_第2页
第三章系统模型与模型化(主成分及聚类分析)_第3页
第三章系统模型与模型化(主成分及聚类分析)_第4页
第三章系统模型与模型化(主成分及聚类分析)_第5页
已阅读5页,还剩73页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第三章系统模型与模型化

1.系统模型与模型化概述2.系统模型化技术3.主成分分析及聚类分析4.状态空间模型3.主成分分析系统分析处理的是多变量(多指标)问题。由于变量较多,增加了分析问题的复杂性。但在实际问题中,变量之间可能存在一定的相关性,因此,多变量中可能存在信息的重叠。人们自然希望通过克服相关性、重叠性,用较少的变量来代替原来较多的变量,而这种代替可以反映原来多个变量的大部分信息,这实际上是一种“降维”的思想。主成分分析的思想:由于多个变量之间往往存在着一定程度的相关性。人们自然希望通过线性组合的方式,从这些指标中尽可能快地提取信息。当第一个线性组合不能提取更多的信息时,再考虑用第二个线性组合继续这个快速提取的过程,……,直到所提取的信息与原指标相差不多时为止。这就是主成分分析的思想。主成分分析的目的压缩变量个数,用较少的变量去解释原始数据中的大部分变量,剔除冗余信息。即将许多相关性很高的变量转化成个数较少、能解释大部分原始数据方差且彼此互相独立的几个新变量,也就是所谓的主成分。这样就可以消除原始变量间存在的共线性,克服由此造成的运算不稳定、矩阵病态等问题。一般来说,我们希望能用一个或少数几个综合指标(分数)来代替原来分数表做统计分析,而且希望新的综合指标能够尽可能地保留原有信息,并具有最大的方差。变量的变异性越大,说明它对各种场景的“遍历性”越强,提供的信息就更加充分,信息量就越大。主成分分析中的信息,就是指标的变异性,用标准差或方差表示它。主成分的几何意义主成分分析数学模型中的正交变换,在几何上就是作一个坐标旋转。因此,主成分分析在二维空间中有明显的几何意义。假设共有n个样品,每个样品都测量了两个指标(X1,X2),它们大致分布在一个椭圆内如图1所示。事实上,散点的分布总有可能沿着某一个方向略显扩张,这个方向就把它看作椭圆的长轴方向。显然,在坐标系x1Ox2中,单独看这n个点的分量X1和X2,它们沿着x1方向和x2方向都具有较大的离散性,其离散的程度可以分别用的X1方差和X2的方差测定。如果仅考虑X1或X2中的任何一个分量,那么包含在另一分量中的信息将会损失,因此,直接舍弃某个分量不是“降维”的有效办法。图1主成分的几何意义

考虑两种极端的情形:一种是椭圆的长轴与短轴的长度相等,即椭圆变成圆,第一主成分只含有二维空间点的约一半信息,若仅用这一个综合变量,则将损失约50%的信息,这显然是不可取的。造成它的原因是,原始变量X1和X2的相关程度几乎为零,也就是说,它们所包含的信息几乎不重迭,因此无法用一个一维的综合变量来代替。另一种是椭圆扁平到了极限,变成y1轴上的一条线,第一主成分包含有二维空间点的全部信息,仅用这一个综合变量代替原始数据不会有任何的信息损失,此时的主成分分析效果是非常理想的,其原因是,第二主成分不包含任何信息,舍弃它当然没有信息损失。主成分分析的基本原理

假定有n个样本,每个样本共有p个变量,构成一个n×p阶的地理数据矩阵当p较大时,在p维空间中考察问题比较麻烦。为了克服这一困难,就需要进行降维处理,即用较少的几个综合指标代替原来较多的变量指标,而且使这些较少的综合指标既能尽量多地反映原来较多变量指标所反映的信息,同时它们之间又是彼此独立的。

定义:记x1,x2,…,xP为原变量指标,z1,z2,…,zm(m≤p)为新变量指标主成分分析的关键就是确定这些系数,这些系数构成了新的坐标系,将原始变量在新的坐标系下投影就可求得新坐标系下的变量值(主成分得分)。

②z1是x1,x2,…,xP的一切线性组合中方差最大者,z2是与z1不相关的x1,x2,…,xP的所有线性组合中方差最大者;…;

zm是与z1,z2,……,zm-1都不相关的x1,x2,…xP,

的所有线性组合中方差最大者。

则新变量指标z1,z2,…,zm分别称为原变量指标x1,x2,…,xP的第1,第2,…,第m主成分。

系数lij的确定原则:

zi与zj(i≠j;i,j=1,2,…,m)相互线性无关;

从以上的分析可以看出,主成分分析的实质就是确定原来变量xj(j=1,2,…,

p)在诸主成分zi(i=1,2,…,m)上的荷载

lij(

i=1,2,…,m;

j=1,2,…,p)。

从数学上可以证明,它们分别是相关矩阵m个较大的特征值所对应的特征向量。

主成分分析的计算步骤

(一)计算协方差矩阵

其计算公式为或(二)计算特征值与特征向量

解特征方程,常用雅可比法(Jacobi)求出特征值,并使其按大小顺序排列;

分别求出对应于特征值的特征向量,要求=1,即③

计算主成分贡献率及累计贡献率贡献率累计贡献率

一般取累计贡献率达85%~95%的特征值所对应的第1、第2、…、第m(m≤p)个主成分。

计算主成分载荷

各主成分的得分

主成分分析方法应用实例

下面,我们根据表1给出的数据,对某农业生态经济系统做主成分分析。

表1某农业生态经济系统各区域单元的有关数据

步骤如下:(1)将表1中的数据作标准差标准化处理,然后计算相关系数矩阵(表2)。表2相关系数矩阵

(2)由相关系数矩阵计算特征值,以及各个主成分的贡献率与累计贡献率(表3)。由表3可知,第1,第2,第3主成分的累计贡献率已高达86.596%(大于85%),故只需要求出第1、第2、第3主成分z1,z2,z3即可。

表3特征值及主成分贡献率

(3)对于特征值=4.6610,=2.0890,=1.0430分别求出其特征向量e1,e2,e3,再用公式(3.5.5)计算各变量x1,x2,…,x9在主成分z1,z2,z3上的载荷(表4)。表4主成分载荷

上述计算过程,可以借助于SPSS或Matlab软件系统实现。

(1)第1主成分z1与x1,x5,x6,x7,x9呈现出较强的正相关,与x3呈现出较强的负相关,而这几个变量则综合反映了生态经济结构状况,因此可以认为第1主成分z1是生态经济结构的代表。

(2)第2主成分z2与x2,x4,x5呈现出较强的正相关,与x1呈现出较强的负相关,其中,除了x1为人口总数外,x2,x4,x5都反映了人均占有资源量的情况,因此可以认为第2主成分z2代表了人均资源量。

分析:

显然,用3个主成分z1、z2、z3代替原来9个变量(x1,x2,…,x9)描述农业生态经济系统,可以使问题更进一步简化、明了。

(3)第3主成分z3与x8呈现出的正相关程度最高,其次是x6,而与x7呈负相关,因此可以认为第3主成分在一定程度上代表了农业经济结构。

(4)另外,表4中最后一列(占方差的百分数),在一定程度上反映了3个主成分z1、z2、z3包含原变量(x1,x2,…,x9)的信息量多少。聚类分析聚类分析(ClusterAnalysis)是研究“物以类聚”的一种多元统计方法。国内有人称它为群分析、点群分析、簇群分析等。聚类分析的基本概念研究对样品或指标进行分类的一种多元统计方法,是依据研究对象的个体的特征进行分类的方法。聚类分析把分类对象按一定规则分成若干类,这些类非事先给定的,而是根据数据特征确定的。在同一类中这些对象在某种意义上趋向于彼此相似,而在不同类中趋向于不相似。职能是建立一种能按照样品或变量的相似程度进行分类的方法。

聚类分析的基本思想是认为我们所研究的样本或指标(变量)之间存在着程度不同的相似性(亲疏关系)。于是根据一批样本的多个观测指标,具体找出一些彼此之间相似程度较大的样本(或指标)聚合为一类,把另外一些彼此之间相似程度较大的样本(或指标)又聚合为另一类,关系密切的聚合到一个小的分类单位,关系疏远的聚合到一个大的分类单位,直到把所有样本(或指标)都聚合完毕,把不同的类型一一划分出来,形成一个由小到大的分类系统。最后把整个分类系统画成一张谱系图,用它把所有样本(或指标)间的亲疏关系表示出来。这种方法是最常用的、最基本的一种,称为系统聚类分析。除此以外,还有动态聚类法、图论聚类法、模糊聚类法、有序聚类法等。聚类分析有两种:一种是对样本的分类,称为Q型,另一种是对变量(指标)的分类,称为R型。R型聚类分析的主要作用:

⒈不但可以了解个别变量之间的亲疏程度,而且可以了解各个变量组合之间的亲疏程度。⒉根据变量的分类结果以及它们之间的关系,可以选择主要变量进行Q型聚类分析或回归分析。(R2为选择标准)Q型聚类分析的主要作用:

⒈可以综合利用多个变量的信息对样本进行分析。⒉分类结果直观,聚类谱系图清楚地表现数值分类结果。⒊聚类分析所得到的结果比传统分类方法更细致、全面、合理。

在课堂上主要讨论Q型聚类分析,Q型聚类常用的统计量是距离.那么Q型系统聚类法则可以表述为:把样本看成n维空间的点,而把变量看成n维空间的坐标轴,m个样本开始时自成一类,然后规定各类之间的距离,将距离最小的一对并成一类,然后再计算距离,直到所有单位全部合并为止。距离和相似系数在进行聚类分析时,样本间的相似系数和距离有多种不同的定义,通常按特性来划分。变量特征的测度尺度有三种类型:间隔尺度(由连续的实值变量表示)有序尺度(没有明确的数量表示,只有次序关系,如产品等级)名义尺度(具有某种特性,如性别)从一组复杂数据产生一个相当简单的类结构,必然要求进行“相关性”或“相似性”的度量。在相似性度量的选择中,常常包含许多主观上的考虑,但最重要的考虑是指标的性质或观测的尺度(名义、次序、间隔)以及相关知识。课堂上主要讨论的指标测量为间隔尺度的情况。距离每个样本有p个指标,因此每个样本可以看成p维空间中的一个点,n个样本就组成p维空间中的n个点,这时很自然想到用距离来度量n个样本间的接近程度。用表示第i个样本与第j个样本之间的距离。一切距离应满足以下条件:常见的距离有:blockdistance绝对值距离:euclideandistance欧式距离squaredeuclideandistance平方欧式距离chebychevdistance切比雪夫距离minkowskidistance明考斯基距离(明氏距离)当q=1,2时,为绝对值、欧式距离;若趋近无穷时,则为切比雪夫距离明氏距离在实际的运用很多,但有一些缺点。例如观测值的单位问题;指标间的相关问题,因此改进得到以下两种距离:Lanberra

兰氏距离Mahalanobis

马氏距离以上都是样本间距离的定义。相似系数夹角余弦相关系数变量间的距离利用相似系数来定义距离利用样本协差阵来定义距离把变量Xi的n次观测值看成n维空间的点, 在n维空间中定义m个变量间的距离。两变量的相关系数定义为:

三、系统聚类法基本步骤1.选择样本间距离的定义及类间距离的定义;2.计算n个样本两两之间的距离,得到距离矩阵

3.构造个类,每类只含有一个样本;4.合并符合类间距离定义要求的两类为一个新类;5.计算新类与当前各类的距离。若类的个数为1,则转到步骤6,否则回到步骤4;6.画出聚类图;

7.决定类的个数和类。系统聚类分析的方法系统聚类法的聚类原则决定于样品间的距离以及类间距离的定义,类间距离的不同定义就产生了不同的系统聚类分析方法。以下用dij表示样品X(i)和X(j)之间的距离,当样品间的亲疏关系采用相似系数Cij时,令;以下用D(p,q)表示类Gp和Gq之间的距离。最短距离法最长距离法最长距离最短距离ABCDEF例:为了研究辽宁省5省区某年城镇居民生活消费的分布规律,根据调查资料做类型划分省份x1x2x3x4x5x6x7x8辽宁浙江河南甘肃青海7.907.689.429.1610.0639.7750.3727.9327.9828.648.4911.358.209.0110.5212.9413.308.149.3210.0519.2719.2516.1715.9916.1811.0514.599.429.108.392.042.751.551.821.9613.2914.879.7611.3510.81G1={辽宁},G2={浙江},G3={河南},G4={甘肃},G5={青海}采用欧氏距离:

d12=[(7.9-7.68)2+(39.77-50.37)2+(8.49-11.35)2+(12.94-13.3)2+(19.27-19.25)2+(11.05-14.59)2+(2.04-2.75)2+(13.29-14.87)2]1/2=11.67d13=13.80d14=13.12d15=12.80d23=24.63d24=24.06d25=23.54d34=2.2d35=3.51d45=2.21

12345D1=10211.670313.8024.630413.1224.062.200512.8023.543.512.210河南与甘肃的距离最近,先将二者(3和4)合为一类G6={G2,G4}d61=d(3,4)1=min{d13,d14}=13.12d62=d(3,4)2=min{d23,d24}=24.06d65=d(3,4)5=min{d35,d45}=2.21612560D2=113.120224.0611.67052.21

12.8023.540d71=d(3,4,5)1=min{d13,d14,d15}=12.80d72=d(3,4,5)2=min{d23,d24,d25}=23.54

712D3=70112.800223.5411.670河南、甘肃与青海并为一新类G7={G6,G5}={G3,G4,G6}G8={G1,G2}d78=min{d71,d72}=12.8078D4=70812.80河南3甘肃4青海5辽宁1浙江2G6G7G8G94.状态空间模型(数学模型)(数学)模型建模概论机理法建模(人口预测模型)拟合法建模两类系统及其相应状态空间系统方程离散系统连续系统状态空间方程实例连续系统:宏观经济模型离散系统:1人才系统;2宏观经济模型;

3人口迁移模型研究动态系统的行为,有两种既有联系也有区别的方法:输入-输出法和状态变量法。输入-输出法又称端部法,它只研究系统的端部特性,而不研究系统的内部结构。系统的特性用传递函数来表示。状态变量法在60年代才得到推广使用。它仍然是处理系统的输入和输出间的关系。但是在这些关系中,还附加另一组变量,称为状态变量。状态变量法可用于线性的或非线性的、时变的或时不变的及多输入、多输出的系统,并且更适合仿真和使用计算机的目的,故得到广泛应用。(一)系统的状态和状态变量系统的状态是指描述系统在运行时行为所需要的足够变量的最小集合。动力学状态热力学状态…状态变量就是能完整的确定系统状态所必需的变量。例如:飞行中的飞机的高度,地面位置,飞行速度,飞行方向就是飞机的状态变量。状态空间模型表示以下几种关系输入、输出之间的关系输出和系统状态之间的关系系统状态和输入之间的关系(二)系统状态模型的建立MKBF(t)状态方程及输出方程的例子Kx、Bx方向向上K:弹簧B:阻尼器x1:振动系统位移x2:振动系统速度由振动理论,可得以下方程可得与写成矩阵形式状态方程(模型)令:求状态方程和输出方程数学模型建模程序变量类型

领域类型1类型2经济外生变量内生变量控制输

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论