




版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、主成分分析法(PCA)在实际问题中,我们经常会遇到研究多个变量的问题,而且在多数情况下,多个变量之间常常存在一定的相关性。由于变量个数较多再加上变量之间的相关性,势必增加了分析问题的复杂性。如何从多个变量中综合为少数儿个代表性变量,既能够代表原始变量的绝人多数信息,又互不相关,并且在新的综合变量基础上,可以进一步的统计分析,这时就需要进行主成分分析。I.主成分分析法(PCA)模型(一)主成分分析的基本思想主成分分析是采取一种数学降维的方法,找出儿个综合变量来代替原来众多的变量,使这些综合变量能尽可能地代表原来变量的信息量,而且彼此之间互不相关。这种将把多个变量化为少数儿个互相无关的综合变量的统
2、计分析方法就叫做主成分分析或主分量分析。主成分分析所要做的就是设法将原来众多具有一定相关性的变量,重新组合为一组新的相互无关的综合变量来代替原来变量。通常,数学上的处理方法就是将原来的变量做线性组合,作为新的综合变量,但是这种组合如果不加以限制,则可以有很多,应该如何选择呢?如杲将选取的第一个线性组合即第一个综合变量记为坷,自然希塑它尽可能多地反映原来变量的信息,这里“信息”用方差来测量,即希塑尿(A)越大,表示A包含的信息越多,因此在所有的线性组合中所选取的珂应该是方差最大的,故称坷为第一主成分。如果第一主成分不足以代表原来门个变量的信息,再考虑选取均即第二个线性组合,为了有效地反映原来信息
3、,彳已有的信息就不需要再出现在均中,用数学语言表达就是要求V(,)=0,称鸟为第二主成分,依此类推可以构造出第三、四第左个主成分。(二)主成分分析的数学模型对于一个样本资料,观测7个变量无,花,A.J,个样品的数据资料阵为:丫12A叮兀21“22AMMMM2A=(还,勺,人丹)其中:xj=丿=1,2,A/?7M主成分分析就是将。个观测变量综合成为7个新的变量(综合变量:),即F=血1石+02兀2+A+aXpxpF)=211+22七+A+a2pxpn丿21必2A丿22人如_=cosO一sin。sin。cosO_X21a12X22AA其中7为坐标旋转变换矩阵,它是止交矩阵,即有1/=LTW=I.即
4、满足sin2e+cose=1。经过旋转变换后,得到下图的新坐标:图2主成分几何解释图新坐标必-少2有如下性质:个点的坐标H和少2的相关儿乎为零。-维平面上的力个点的方差大部分都归结为阴轴上,而丿2轴上的方差较小。必和少2称为原始变量无和的综合变量。由于左个点在少轴上的方差最大,因而将二维空间的点用在必轴上的一维综合变量来代替,所损失的信息量最小,由此称必轴为第一主成分,少2轴与必轴正交,有较小的方差,称它为第二主成分。II.主成分分析法(PCA)推导一、主成分的导出根据主成分分析的数学模型的定义,要进行主成分分析,就需要根据原始数据,以及模型的三个条件的要求,如何求出主成分系数,以便得到主成分
5、模型。这就是导出主成分所要解决的问题。1、根据主成分数学模型的条件要求主成分之间互不相关,为此主成分之间的协差阵应该是一个对角阵。即,对于主成分,F=AX其协差阵应为,畑5=AX)-(W=AXXAA二A=0Ld2、设原始数据的协方差阵为/,如果原始数据进行了标准化处理后则协方差阵等于相关矩阵,即有,3、再由主成分数学模型条件和止交矩阵的性质,若能够满足条件最好要求力为止交矩阵,即满足于是,将原始数据的协方差代入主成分的协差阵公式得Ua氏F)=ARA=A展开上式得aYlMM勺1MQpp22M展开等式两边,根据矩阵相等的性质,这里只根据第一列得出的方程为:Si一入hl+介如+A+p=0勺如+(金一
6、人)知+A+g”=0AAAA作】4i+2如+A+(分-入)勺,=0为了得到该齐次方程的解,要求其系数矩阵行列式为0,即心-人人2A每Z21Z22一AA仿MMMMA。-人0=0显然,入是相关系数矩阵的待征值,=(如,A气J是相应的特征向量。根据第二列、第三列等可以得到类似的方程,于是人是方程用-加|=0的农个根,人为特征方程的特征根,幻是其特征向量的分量。4、下面再证明主成分的方差是依次递减设相关系数矩阵人的门个特征根为Z,A仏,相应的特征向量为幻aanA%W、A=a2a22Aaipa2MMMMM严piapiA脣)J相对于的方差为卩a氏F訂=axXX*ax=axRax=人同样有:沁F=人、即主成
7、分的方差依次递减。并且协方差为:Cov(atXjX)=aRcija=l=SAa(gdja勺)=0,L丰Ja=l综上所述,根据证明有,主成分分析中的主成分协方差应该是对角矩阵,其对角线上的元素恰好是原始数据相关矩阵的特征值,而主成分系数矩阵力的元素则是原始数据相关矩阵特征值相应的特征向量。矩阵力是一个正交矩阵。于是,变量(五,七,A形)经过变换后得到新的综合变量F=01册+82*2+A+apXpF)=211+如兀2+A+SpXpAFp=空內+勺2七+A+Fp新的随机变量彼此不相关,且方差依次递减。二、主成分分析的计算步骤假设样本观测数据矩阵为:A12AV才22A%MMMXn2A第一步:对原始数据
8、进行标准化处理。.才亍X;=/(/=1,2,A”j=24,7)Jvag)varg)=(7=1,2,A,7)Z=1第二步:计算样本相关系数矩阵。为方便,假定原始数据标准化后仍用X表示,则经标准化处理后的数据的相关系数为:zilA勺AMMAM*2A2R=第三步:用雅克比方法求相关系数矩阵人的特征值(人,九A外)和相应的特征向量q=U1,如,Aa)=1,2Ap。第四步:选择重要的主成分,并写出主成分表达式。主成分分析可以得到&个主成分,但是,由于各个主成分的方差是递减的,包含的信息量也是递减的,所以实际分析时,一般不是选取左个主成分,而是根据各个主成分累计贡献率的大小选取前个主成分,这里贡献率就是指
9、某个主成分的方差占全部方差的比重,实际也就是某个特征值占全部特征值合计的比重。即贡献率二丄P2=1贡献率越大,说明该主成分所包含的原始变量的信息越强。主成分个数/的选取,主要根据主成分的累积贡献率来决定,即一般要求累计贡献率达到85%以上,这样才能保证综合变量能包括原始变量的绝人多数信息。另外,在实际应用中,选择了重要的主成分后,还要注意主成分实际含义解释。主成分分析中一个很关键的问题是如何给主成分赋予新的意义,给出合理的解释。一般而言,这个解释是根据主成分表达式的系数结合定性分析来进行的。主成分是原来变量的线性组合,在这个线性组合中个变量的系数有大有小,有正有负,有的大小相当,因而不能简单地
10、认为这个主成分是某个原变量的属性的作用,线性组合中各变量系数的绝刘值大者表明该主成分主要综合了绝对值大的变量,有儿个变量系数大小相当时,应认为这一主成分是这儿个变量的总和,这儿个变量综合在一起应赋予怎样的实际意义,这要结合具体实际问题和专业,给出恰当的解释,进而才能达到深刻分析的目的。第五步:计算主成分得分。根据标准化的原始数据,按照各个样品,分别代入主成分表达式,就可以得到各主成分下的各个样品的新数据,即为主成分得分。具体形式可如下。AiAFF卫A役MMMMF“AJ第六步:依据主成分得分的数据,则可以进行进一步的统计分析。其中,常见的应用有主成份回归,变屋子集合的选择,综合评价等。III.主
11、成分分析法(PCA)案例为了系统的分析某IT类企业的经济效益,选择统计了8个不同的利润指标,15家企业关于这8个指标的统计数据如下所示,试对此进行主成分分析,并进行相关评价。变净产值固定资总产值销售收产品成物耗人均利量利润率产利润利润率入利润本利润利润润率企(%)率(%)(%)率(%)率(%)率(%)(千元业序号血匕血兀兀兀/人)匕140.424.77.26.18.38.72.442225.012.711.211.012.920.23.542313.23.33.94.34.45.50.578422.36.75.63.76.07.40.176534.311.87.17.18.08.91.7261
12、5家企业的利润指标的统计数据i*(%兀20.5了2635.612.516.416.722.829.33.01726.622.07.89.910.212.617.60.84710.6848.413.410.99.910.913.91.77217.8940.619.119.819.029.739.62.44935.81024.88.09.88.911.916.20.78913.71112.59.74.24.24.66.50.8743.9121.80.60.70.70.81.10.0561.01332.313.99.48.39.813.32.12617.11438.59.111.39.512.216
13、.41.32711.61526.210.15.615.67*7t130.10.12625.9解:根据题目中的数据,利用matlab软件编程求解,对问题进行主成分分析。求解结果如下:1.标准化结果如下:1.00232.3473-0.3410-0.5714-0.3496-0.65740.90300.4483-0.22860.30720.47740.38960.28350.43091.9108-0.6218-1.1718-1.2909-1.0162-0.9244-0.8863-0.9603-0.8049-1.1617-0.4444-0.7129-0.6684-1.0421-06661-0.7805-
14、1.1732-0.79850.51480.1541-0.3615-0.3752-0.3909-0.63850.24701.18160.61870.27321.54141.50751.61601.29221.42981.0963-0.4684-0.52590.21140.23270.24220.1849-0.5584-0.47451.64180.42620.41600.17390.0083-0.16530.28910.23231.01831.39522.23711.95862.59562.26700.90941.9995-0.2446-0.49190.1910-0.02220.14590.052
15、4-0.6115-0.1702-1.2277-0.2029-0.9549-0.9440-0.8588-0.8656-0.5337-1.1323-2.0830-1.7500-1.6710-1.6304-1.3818-1.3767-1.2831-1.41700.35490.51120.1091-0.1399-0.1431-0.22210.61340.16360.8505-0.30490.49790.09540.18720.0713-0.1186-0.3763-0.1327-0.1349-0.66841.2918-0.43211.3679-1.21901.02762相关系数矩阵:std二1.0000
16、0.76300.70170.58680.59590.48960.59730.73000.76301.00000.55040.46670.51580.41960.70460.67170.70170.55041.00000.84070.97600.81610.69410.68250.58680.46670.84071.00000.86670.98230.49260.79380.59590.51580.97600.86671.00000.86670.62600.71530.48960.41960.81610.98230.86671.00000.42160.75050.59730.70460.6941
17、0.49260.62600.42161.00000.46560.73000.67170.68250.79380.71530.75050.46561.00003.特征向量(vec)及特征值(val):vec0.21820.1370-0.27810.22830.67270.31150.37880.3334-0.0745-0.1102-0.2276-0.5733-0.40160.18710.55620.3063-0.7186-0.05200.1186-0.22400.3874-0.3182-0.11480.39000.0386-0.6914-0.38080.2788-0.15470.0888-0.3
18、5080.37800.6385-0.06600.3451-0.41580.1518-0.2715-0.22540.3853-0.01230.6864-0.3738-0.0066-025540.0696-0.43370.36160.06750.10570.07160.5033-02816-0.61890.41470.3026-0.12860.04130.66920.2552-0.20550.5452-0.00310.3596val二0.0027000000000.0060000000000.1369000000000.1456000000000.2858000000000.5896000000001.0972000000005.7361特征根从大到小排序:5.736141.097230.5896340.2857910.145620.1368830.005986810.002710844根据累计贡献率,假设阈值为90%,选出主成分,计算如下:贡献率:newrate0.71700.13720.07370.03570.01820.01710.00070.0003主成分数:3主成分载荷:0.79850.39680.23920.73360.58260.14360.9340-0.1202-0.24430.9052-0.36740.06820.9228-0.2361-
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 公共政策的舆论监督机制试题及答案
- 社会保障政策中的公平问题探讨试题及答案
- 公共政策的伦理与道德思考试题及答案
- 网络设计中的用户体验考虑与试题及答案
- 增强网络安全防御技术与试题及答案
- 西方国家反对派与公民参与的关系试题及答案
- 天然气水合物开采技术设备研发效率提升预研报告
- 西方政治制度与全球经济合作试题及答案
- 软件测试的职业技能要求试题及答案
- 西方国家对经济政策的社会接受度试题及答案
- 土地整治与耕地保护考核试卷
- 2025年高中物理:《公式+思维导图》三年都有用
- 健脾补肾活血方:痛风性肾病治疗新曙光
- 2026年日历表全年表(含农历、周数、节假日及调休-A4纸可直接打印)-
- 2024年淄博高新区事业单位招聘退役大学生士兵笔试真题
- 拘留所建设标准(建标102-2008)
- 《电力系统最优潮流的数学模型计算案例》6100字
- 安全生产风险防控“六项机制”做法及经验分享
- 全国统一市政工程预算定额
- 济宁医学院《复变函数本》2023-2024学年第二学期期末试卷
- 村集体合同管理制度
评论
0/150
提交评论