已阅读5页,还剩22页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第5章 SAS多元统计分析功能教学要求:l 了解几种假设检验、线性回归、方差分析、拟合优度检验、列联表检验的原理背景l 掌握SAS语言进行多变量分析过程(princomp过程和factor过程)l 掌握SAS语言进行l 掌握SAS语言进行引言:前面介绍SAS的基本统计分析功能。本章我们讲述用SAS进行多元统计分析。SAS进行多元统计分析的过程包括:第一类:多变量分析过程,包括princomp(主成分分析)、factor(因子分析)、cancorr(典型相关分析、multtest(多重检验)、prinqual(定性数据的主分量分析)及corresp(对应分析);第二类:判别分析过程,包括discrim(判别分析)、candisc(典型判别)、stepdisc(逐步判别)第三类:聚类分析过程,包括cluster(谱系聚类)、fastclus(K均值快速聚类)、modeclus(非参数聚类)、varclus(变量聚类)及tree(画谱系聚类的结果图);本章只讲其中常用的几种过程。5.1 多变量分析5.1.1主分量分析(或叫主成分分析)1.原理简介引言:在实际中,为了全面分析问题,往往提出很多与此相关的变量(或因素),且每个变量都能在不同程度上反映这个问题的某些信息。但统计分析方法研究多变量问题时,变量个数太多容易增加问题的复杂性。人们希望变量个数减少时,也能得到较多的信息。功能:主成分析是数学上处理降维的一种方法,它设法将初始变量重新组合成一组新的互相无关的几个综合变量,同时可根据实际需要从中取出较少的几个综合变量,尽可能多反映原来变量的信息。在这里,信息的大小用离差平方和或方差来表示。主分量分析的目的是从原始的多个变量中取若干线性组合,并尽可能多地保留原始变量的信息。设有p 个指标 ,找 m个综合指标,且,使得 , 式中包含的信息最多,包含的信息次之,依次类推,则称为的第i个主成分, 为第i个主成份在第j个变量上的载荷。 性质:(1)各主成分之间互不相关,且(2)记向量X的协方差阵(或相关系数阵R)的特征值为和特征向量为,则是第i个主成分的方差,载荷;(3)p个原始指标的方差之和=p个主成分的方差之和=p(4)第i个主成分的贡献率为,前m个主成分的累计贡献率是,实际应用中,主成分的个数选取依据累计贡献率达到或超过80%,或取特征根,常常结合两者确定主成分个数。(注:累积贡献率标明的是前m个主成分提取了原始变量的多少信息)(5)前m个主成分对原始变量Xi 的贡献率为Xi与的复相关系数的平方,表明了前m个主成分包含了第i个变量的多少信息。(6)由于主分量计算中,方差越大的变量越会被优先保留,所以实际中为了消除各变量的数值大小相关较大或者是量纲的影响,通常会将原始变量进行标准化,显然,标准化后的向量X*的协方差阵即为原始向量X的相关矩阵R。实际中从相关系数阵出发进行主成分分析的较多。(7)主成分得分公式为:协方差阵出发:相关系数阵R出发:其中为第i个原始变量xi的均值. 为第i个原始变量xi减去均值除以标准差.后的标准化值。主成分分析的步骤:(1) 求协方差阵(或相关系数阵R)的特征根与特征向量(2) 提取前m个主成份,并写出其表达式(3) 对主成分进行解释(4) 计算主成分得分并分析2 .PRINCOMP过程(主成分分析过程)功能:完成主分析分析,输入数据集可以是原始数据集、相关阵、协方差阵或叉积阵。输出数据是原始数据集时,还可以选择是从协方阵还是相关阵出发进行分析。计算结果有:简单统计量、相关阵或协方差阵、从大到小排列的特征值与特征向量、累积贡献率等。可生成两个输出数据集:一个包含原始数据集及主分成分得分,另一个包含有关统计量。一般格式为:PROC PRINCOMP 选项 ;VAR 变量列表 ;WEIGHT 变量列表 ;FREQ 变量 ;BY 变量 ;RUN ;一般读者只用到PROC FACTOR和VAR 两条语句。有关说明:(1)PROC PRINCOMP 语句中的“选项”常用的主要包括:l Data=输入数据集,可以是原始数据集,也可以是type=corr(或cov)的数据集l Out=输出包含原始数据和主分成得分的数据集;l Outstat=统计量输出数据集;l Cov 要求从协方差阵出发计算主成分,默认为从相关系数阵出发的l N=要计算的主成分个数。默认为全体主成分。l Std要求在out=指定的数据集中把主分量得分标准化为单位方差,不规定时方差为相应特征值(2)Var语句指定要分析的原始变量,必须为数值型。3.案件分析国民生产状况的评价分析为了分析评价改革开放以来我国的国民生产状况,收集了从1978-1989我国的国民收入等5个经济发展指标数据,如下表。年份国民收入(亿元)劳动者人数(万人)粮食产量(万吨)能源总量(万吨)积累额(亿元)19783588.1401523044762770108719793998.1410243321264562116119804470423613205663735116519814773437253250263227110619825193452953545066778123619835809464363872871270142119846962481974073177855179619858667.6498733791185546262819869696.351282391518812429441987113015278340298912663298198813984.25433439408958014231198915788.755329407551016394674现采用主成分分析法对历年的国民生产状况进行评价分析。程序如下:本程序是默认从相关系数出发计算主成分的,输出分为五部分。第一部分是变量的基本信息,第二部分为原始变量的均值和方差等简单统计量的值。第三部分相关系数矩阵:第四部分为特征值及累积贡献率: 第五部分为特征向量:第六部分是两个输出数据集:数据集out1输出包含原始数据和主分成得分的数据集;Out2输出主成分析的各统计量。分析:(1)由第二部分相关系数矩阵知gmsr ldrs lscl nyzl jle这五个变量的相关系数都较大,最小的也有0.7751,说明相互之间相关性较强,对其进行主成分分析是必要的。(2)第一特征值,其累积贡献率为92.77%80%,因此提取这个主成分即可代表原始数据的绝大部分信息。第一主成分得分公式为(*号表示原始变量要进行标准化)(3)由第一主成分在各变量上的载荷都有近似相等的正数,代表该我国国民经济总体情况;(4)由第一主成分得分可知,从1978-1989年第一主成分呈现一定的递增趋势,说明改革开放以来,我国的国民经济生产能力逐年增加。注:为了输出各年份的原始数据及标准化变量的第一主成分得分可用如下程序段:proc sort data=out1; by prin1; run;proc print data=out1; id year; var gmsr ldrs lscl nyzl jle prin1;run;【讨论】如果要求从协方差阵进行主成分分析,怎么做?输出结果会怎样改变?提示:将原程序的proc princomp语句中加上cov选项, 结果输出中相关系数矩阵改为协方差矩阵,提取的变量倾向于方差最大的变量nrzl。5.1.2因子分析1.原理简介引言:主成分分析是对p个原始变量做的m个线性组合。这些线性组合可以很好代表原变量的信息(即降维作用),缺点是给出符合实际背景和意义的主成分解释比较困难。因子分析是主成分分析的推广,它也可以降维,同时可以进行因子旋转使得因子解释更加容易,另外两者最大区别:主成分分析不能作为一个模型来描述,它只能作为一般的变量变换,主成分是可观测的原始变量的线性组合;而因子分析需要构造一个因子模型,公共因子不一定是原始变量的线性组合。数学模型:设有p维可观测的随机向量,其均值为,协主差矩阵为,因子分析一般模型为:其中为公共因子,为特殊因子,它们都是不可观测的随机变量,为第i个原始变量在第j个公共因子上的载荷。公共因子出现在每一个原始变量的表达式中,可理解为原始变量共同具有的公共因素,每个公共因子至少对两个原始变量有作用,否则归入特殊因子。每个特殊因子仅仅出现在与这相应的每个原始变量的表达吕,这只对这个原始变量有作用。因子模型的矩阵形式为: 式中为公共因子向量,为特殊因子向量,为因子载荷矩阵。通常假定:因子模型性质:(1) X的协方差矩阵可分解为,如果X的各变量已标准化了,则就是相关系数矩阵R,即(2) 模型不受单位的影响(3) 因子载荷是不唯一的(4) 因子载荷矩阵的统计意义:llll A的元素aij原始变量xi与公共因子fj之间的协方差函数,如果X的各变量已标准化了,则表示xi与f之间的相关系数。l A的行元素平方和公共因子对原始变量xi的方差贡献,如果X的各变量已标准化了,则。l A的列元素平方和公共因子fj对所有原始变量的方差贡献,是衡量公共因子重要性的一个尺度。因子分析的步骤:l 估计载荷矩阵,即求协方差阵(或相关系数阵R)的特征根与特征向量;l 提取前m个公共因子,并对其进行解释(如果难以解释,则进行公因子旋转)l 计算因子得分并分析2.factor过程与score过程一、 factor过程1.功能:可进行因子分析、因子旋转等,对因子模型可以进行正交旋转和斜交旋转,可以用回归法计算因子得分,同是得分估计存储在一个指定数据集中,因子分析中主要统计量也能存储到指定数据集中。语句格式:PROC FACTOR 选项 ;PRIORS变量共通性的预估值 ;VAR 要分析的变量名称 ;PARTIAL 变量名称 ;FREQ 变量名称 ;WEIGHT 变量名称 ;BY 变量名称 ;RUN ;一般读者只用到PROC FACTOR和VAR 两条语句。常用选项有:1) 定义数据集有关选项有:l Data=输入数据集;l Out=输出数据集,指定输出数据集,其中包含原始输入数据集,以及因子得数,此选项要与“n=数字”合用,指定要提取几个公因子;l Outstat=输出数据集,指定用于存储因子分析结果的数据集,其中包含均数、标准差、相关系数、协方差、特征向量、因子模型等;2) 与公因子提取与旋转有关的选项有:l Method=方法,指定用于提取公因子的方法。还有可供选择的方法有: principal(主成分法,但当principal选项不与Prior= 并用,或与priors=one并用时,提取公因子方法为主成分分析法,否则为主(轴)因子分析法)、alpha(因子分析法)、ML(极大似然法)等。默认的是principal(主成分法)。l Mineigen(或min)=数字,指定提取公因子时最小的特征值,默认为1l Percent(或P)=数字,指定选择公因子时累积贡献率的阈值。系统默认的是100.l Nfactors(或N)=数字,指定要提取公因子的最大数量,默认为所有原始变量个数。l Rotate=方法,指定公因子旋转方法。默认的是varimax(方差最大正交旋转法).l Priors= ,指定变量共性方差的预估值。可取:One表示预估值为1;Max表示其预估值为每一变量与其它变量的最大相关系数的绝对值;SMC表示预估值为每个变量与其它所有变量的复相关系数的平方。3) 其它输出格式有关的选项:l Simple:显示平均数与标准差;l Corr: 显示相关系数矩阵;l Score:显示因子得分系数矩阵;l Reorder:让因子系数矩阵的这些行重新排列,使那些在第一因子上的载荷量的绝对值高的变量排在前面几列,以协助解释因子的含意,输出数据集中的变量顺序不变。二、 Score过程功能:计算因子得分,该过程与factor过程配合使用,一般放在factor过程之后,语法格式:Proc Score ; Id ;Var ;Run; 说明:其中常用选项有:data=数据集,指定用于因子分析的初始数据集;out= 数据集,指定存储因子得分的输出数据集;Id 语句用于指定对观测记录进行标识的变量;Var语句指定要进行分析的原始变量,须为数值型。3.案例分析不同地区的经济状况的比较下表为某年洛杉矶12个地区的5项社会经济指标,包括:人口总数(POP)、教育程序(SCHOOL)、就业人数(EMPLOY)、服务业人数(SERVICES)、中等房价(HOUSE)。现采用因子分析法对该城市社会经济状况进行评价分析。地区号POP人口总数SCHOOL教育程序EMPLOY就业人数SERVICES服务业人数HOUSE中等房价1570012.82500270250002100010.96001010000334008.810001090004380013.61700140250005400012.8160014025000682008.3260060120007120011.440010160008910011.5330060140009990012.534001801800010960013.73600390250001196009.63300801200012940011.4400010013000初步因子分析:输出为:第一部分为:各变量的均值与方差第二部分为:各变量的相关系数矩阵第三部分为:从相关系数矩阵出发计算特征根、累积贡献率以及提取公因子的数量第四部分为:因子载荷矩阵,也就是用公因子预报原始变量的系数第五部分为:公因子解释能力的估计分析:(1)相关系数矩阵可知,有些变量之间存在较大程度的相关性,如pop和employ的相关性为0.97245,所以做因子分析有必要。(2)根据特征根和累积贡献率确定公因子数目。前两个特征根分别为,都大于1,二者的累积贡献率达到93.4%80%,已经反映了绝大部分信息,因此可以选择两个公因子进行因子分析。(3)因子解释。由因子载荷矩阵知,第一个公因子在所有变量上都有较大的正载荷,可见这个因子反映了综合发展水平,第二个公因子在人口、就业上有大的正载荷,在教育程度和住房上有大的负载荷,因此第二个公因子数值较大表明城市人口多但教育程序和住房价格低。(4)由公因子解释能力的估计值知,原始变量对公因子的复相关系数的平方都比较大,所以我们可以认为这两个公因子很好地解释了原始变量中的信息。由于公因子解释不够清楚,所以考虑进行因子旋转进一步分析。进一步分析1:因子旋转/*因子分析,输出简单统计量及相关系数矩阵,采用主成分法,方差最大化正交旋转公因子,要求变量重新排列*/proc factor data=index simple corr rotate=varimax reorder; var POP SCHOOL EMPLOY SERVICES HOUSE;run;输出结果为:首先输出的结果与前面相同,包括初始因子载荷和方差贡献率等,结果略,注意到因子模式中变量排列顺序不同。接下来是旋转矩阵与旋转后的载荷矩阵:然后是公因子的解释能力:进一步分析:将旋转前后的载荷矩阵进行对比可知,各变量在factor1与factor2上的载荷数据差距拉大,因此命名更加容易一些。第一公因子在房价、教育水平、服务业人数有较大正载荷,反映了发达程度,因此命名为“发达程度”因子。第二公因子在人口总数和就业人数有较大的正载荷,反映了城市规模,因此命名为“城市规模”因子。进一步分析2:计算因子得分计算因子得分程序为:/*因子分析,输出简单统计量及相关系数矩阵,采用主成分法,方差最大化正交旋转公因子,要求变量重新排列,计算因子得分*/proc factor data=index simple corr cov rotate=varimax reorder score outstat=out1 ; var POP SCHOOL EMPLOY SERVICES HOUSE;run;proc score data=index score=out1 out=out2;var POP SCHOOL EMPLOY SERVICES HOUSE;run;proc print data=out2;run;/* 公因子1与公因子2的散点图 */proc gplot data=out2; plot factor1*factor2;run;输出为:其它与前类似,只增加了提取的公因子与原变量的复相关系数平方,标准化的因子得分系数以及两个输出数据集因子分析统计量和因子得分数据集。进一步分析:根据得分系数可写出公因子得分函数:由各地区的因子得分可知,按第一公因子排列前三的是地区10 、地区1、地区4,也就是这三个地区的发达程序排前三名;按第二公因子排名前三的是地区12、地区10、地区9,也就是这三个地区的城市规模排名前三。【思考1】如果要求因子分析是采用主因子法计算载荷,怎么办?结果会怎样?【思考2】如果要求因子分析是从协方差矩阵出发的,采用主因子法计算载荷,怎么办?结果会怎样?/* 思考1:主因子分析及方差最大正交旋转、计算因子得分 */proc factor data=index priors=SMC rotate=varimax reorder score outstat=out3; var POP SCHOOL EMPLOY SERVICES HOUSE;run;proc score data=index score=out3 out=out4;var POP SCHOOL EMPLOY SERVICES HOUSE;run;/* 思考2:主因子分析及方差最大正交旋转、计算因子得分,协方差矩阵出发 */proc factor data=index cov priors=SMC rotate=varimax reorder score outstat=out3; var POP SCHOOL EMPLOY SERVICES HOUSE;run;proc score data=index score=out3 out=out4;var POP SCHOOL EMPLOY SERVICES HOUSE;run;作业:P193 T15.2 判别分析引言:判别分析(discriminate Analysis)是是对已知分类的数据建立由数据指标构成的分类规则,然后用这样的规则对未知分类的样本进行分类。判别分析在科学研究各个领域中经常会遇到。如动物学家根据动物的特征,判别动物属于哪个纲、目、科的问题;经济学家研究价格指数,推断经济情况是通胀还是紧缩,以及医学上疾病的诊断、气象学中气候的分类等都属于判别分析范畴。 本章介绍SAS中如何实现判别分析的过程,主要是discrim(判别分析)。5.2.1原理简介判别分析用统计模型的语言可以描述为:设有k个总体G1、G2,。,Gk,希望建立一个准则,对给定的任意一个样本,依据这个准则能够判断它是来自哪个总体。当然所建立的准则应该是某种意义上的最优,比如使错判损失最小。按照不同的判别准则,判别分析的方法有以下几种:一.距离判别法对于新给定的样品,要判断它属于哪一类,一个最直观的方法就是计算它与各已知类别之间的距离,如果它与其中某一类距离最近,那么就可判定它属于该类。1.两总体情形设有两个总体G1、G2,若定义样品x到G1和G2的距离分别为d(x,G1)和 d(x,G2),则判别的准则如下: 当总体G1 和G2为正态总体时,距离采用马氏(Mahalanobis)距离,公式如下:,其中分别为两个总体的均值和协方差矩阵。l 当时,令,令,则判别准则变为:W(x)称为判别函数,由于它是线性函数,因此又称为线性判别函数。l 当时,则判别函数W(x)为式中W(x)是x的二次函数。2.多总体情形与两总体情况类似,计算样品x到每个总体的距离然后进行比较,如果x与总体Gi的距离最近,则把x 判归总体Gi. 二、费歇尔判别费歇尔(Fisher)判别对总体分布未提出特殊要求,它是处理概率分布未知的判别问题的一种重要方法。Fisher判别的思想是通过将多维问题转化为一维问题来处理,投影的原则是使投影后的总体与总体之间尽可能地分开,然后利用一元方差分析的思想导出判别函数,对待判样品进行分类判别。下面仍以两个总体为例,说明Fisher判别方法原理。设有两个总体 G1和G2, 均值分别为,协方差矩阵分别为,并假定 ,考虑线性组合。通过寻找合适的L向量,使得来自两个总体的样品间的距离较大 ,而来自同一总体的样品间的距离较小。可以证明当选,其中,所得投影即满足要求。当c=1时的线性函数,称为Fisher线性判别函数。其判别规则如下: 其中m为两个总体均值在投影方向上的中点,即三、贝叶斯判别此前讨论的两种方法简单直观,结论明确,但它没有考虑到各个总体会以不同的概率出现,也没有考虑误判造成的损失。贝叶斯判别就是为了弥补这两个缺陷而提出的。1.最大后验概率准则设有k个总体 ,它们的概率分布密度函数分别是,且这k个总体的先验概率分别为,且。当取了一个未知总体的样品x,要判别它属于哪个总体,可用贝叶斯判别公式计算x属于总体Gi的后验概率最大后验概率准则:特例:当都是正态总体,即时,最大后验概率准则变为:其中计算公式为 式中称为广义平方距离,为平方马氏距离。注意到:当,且时,广义平方距离准则就等价于多总体的距离判别法。2.最小平均误判代价准则当假定将原本属于总体Gi的样品错判给总体Gj,由此造成的损失为,有,使平均误判代价最小的判别准则是:其中:为误判的平均损失。注意到:当所有误判的代价都相等时(不防令),则最小平均误判代价准则等价于基本的最大后验概率准则。5.2.2discrim过程功能:SAS中的discrim过程可以进行判别分析方法有参数和非参数方法。参数方法假定每类的观测来自多元正态总体,各类的分布的均值可以不同,该方法会导出一个线性或二次的判别函数。非参数方法不要求假定总体的分布,它对每一类使用非参数方法估计该类的分布密度,包括核密度法(kernel method)和K最邻近法(k-nearest- neighbor-method),然后据此建立判别规则。虽然非参数方法一般的教科书较少提及理论,但在实际应用中具有相当重要的作用,因为很多情况下的数据并不满足正态总体要求。一般格式:Proc discrim data=输入数据集 选项;Class 分类变量;VAR 判别用自变量列表 ;WEIGHT 加权变量 ;BY分组变量 ;FREQ 频数变量 ;ID 标识变量 ;PRIORS 先验概率取值 ;TESTCLASS 检测数据集中的分类变量 ;TESTFREQ 检测频数变量 ;TESTID 标识变量 ;RUN ;1.Proc discrim语句中的“选项”说明:1).指定数据集选项:l Data=输入数据集为训练数据集,包括一个分类变量(在class语句中说明)和用来建立判别公式的自变量集合(在var语句中说明);l Testdata=检验数据集,它必须包含与训练数据集相同的自变量集合,用训练数据集产生判别规则后将对检验数据集中每一个观测给出分类值,可以不包括分类变量。l Outstast=数据集,指定输出判别函数的数据集,后面可以再次用discrim过程把这样输出的判别函数作为输入数据集读入,并用它来判别检验数据。l Out=数据集,存放训练样本及后验概率、交叉确认分类的数据集。l Outd=数据集,指定存放训练样本及分组的密度估计的数据集。l Testout=数据集,指定存放检验数据的后验概率及分类结果的数据集。l Testoutd=数据集,指定输出检验数据及分组密度估计。2). 指定判别分析方法选项:l Method=normal 或 npar,来选择参数方法或非参数方法,默认的是normal。l Pool=no 或yes 或test ,分别选择不用合并协方差矩阵、使用合并协方差矩阵,通过检验决定是否使用合并协方差矩阵, 默认的是yes。注意:当设置为test时,要求各类的协方差矩阵进行齐次性检验,如果满足齐次性,则使用合并的协方差矩阵,否则使用各类内协方差矩阵。l R=核估计半径 或 K=最近邻个数 是非参数方法中可以使用的密度估计方法。3.)规定显示结果的选项l List 选项要求对训练数据中每一观测显示判别结果;l Listerr 选项要求显示训练数据错判的观测;l crossvalidate选项是输出训练数据集中用交叉验证法各类判别结果和错判率l Crosslist 选项要求显示用交叉验证法对训练数据的判别结果l Crosslisterr 选项要求显示用交叉验证法对训练数据错判的观测;l Noclassify 选项要求取消对训练数据的分类检验;l testList 选项与”testdata=检验数据集”合用,要求对检验数据中每一观测显示判别结果;l testListerr 选项与”testdata=检验数据集”、“testclass 分类变量”合用,要求显示检验数据错判的观测l nopinrt 选项可以取消结果显示; 2.其它常用语句说明l “Class 分类变量”,指定训练数据集中的分类变量,此句不可省略,它的取值决定了判别分析的组;l “Var判别用自变量列表”,指定判别分析中所有可能用到的变量名称,它们必须都是数值型的;l “Testclass 检验用的分类变量”,指定检验数据集中的观测的真实分类;l Priors 语句指定先验概率的取值。“Priors equal” 指定等先验概率,“prior proportional ”指定先验概率与各类个数成正比,“priors 概率值列表”可以直接指定各组的先验概率值。缺省设置为“PRIORS EQUAL”。5.2.3案例分析用卫星遥感可以分辨作物的种类。Crops是训练数据集,其中包含了作物的实际种类(crops)和四种遥感指标变量(x1x4),数据步中还把的变量值作为一个字符串变量读入作为行标识。【首先采用最基本的用法】:用discrim过程产生线性判别函数(method=normal规定参数方法、pool=yes规定使用合并协方差矩阵), outstat指定判别函数输出数据集输出为:第一部分为:观测及变量的基本信息,分类变量的频数、比例及先验概率等先验概率合并后的协方差矩阵的秩以及其行列式值的自然对数第二部分:各组间的广义平方距离和线性判别函数的系数即分析:从而可以写出分类变量的各类的线性判别函数:苜蓿:玉米:甜菜:第三部分为:训练数据判别的概况,即每一类判入各类的个数及百分比,比如第一行苜蓿有11个观测,其中6个判对,占54.55%,有3个错判为cotton棉花,2个错判为sugarbeets甜菜,最后一行是各类的先验概率。紧接着是各类的错判率(即某类错判为其它类的比例)每类的错判率是上表中对应行中错判情况的和分析:除corn(玉米)外,各类的错判率挺高的,识别最好的corn(玉米),最差的是cotton(棉花),总误判率达到50%。【try】请同学们逐一尝试其它选项功能:list 、listerr、crossvalidate、crosslistl List选项是输出训练数据集中每个观测判别结果和后验概率,对应输出为: l Listerr选项是输出训练数据集中错判的观测判别结果和后验概率,对应输出为: l crossvalidate选项是输出训练数据集中用交叉验证法各类判别结果和错判率,对应输出为: l crossList选项是输出训练数据集中用交叉验证法的每个观测判别结果和后验概率,对应输出为:【try】在基本用法的程序中,请同学们尝试将选项pool=yes改为pool=no或test,比较结果?提示:判别函
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 新高考II卷 生物 2011年 名校模拟卷
- 道德与法治 2025届高考解答题版模拟试卷
- 道德与法治 2025年中考学考卷 高频考点版
- 数学 2016届高三六月押题模拟卷
- 西昌市普通高中武术开展现状与对策研究
- 强化降压策略在社区人群中效果验证的方法学研究及应用
- 基层治理视角下农村土地征收中的公民参与研究-以内蒙古H镇A村为例
- 2025年职工职业技能竞赛(综采维修电工赛项)参考试题库(含答案)
- 2025年老年人驾考三力测试题库及答案
- 2025年低压电工作业证复审考试练习题
- 2026秋人教版(新教材)小学数学五年级上册(全册)教学设计(附目录p273)
- 2024版人教版初中语文九上名著《唐诗三百首》复习题
- T∕CAGIS 20-2026 T∕CSGPC 70-2026 测绘地理信息技术服务成本要素 通则
- 2026年文物保护工程从业资格考试(责任工程师近现代重要史迹及代表性建筑)经典试题及答案
- GB/T 17623-2026绝缘油中溶解气体组分含量的气相色谱测定法
- 2026年中国时尚耳夹数据监测研究报告
- 2026年4月自考02160流体力学试题及答案含评分参考
- 广西壮族自治区梧州市2026年高三第一次模拟考试物理试卷(含答案解析)
- 2026广州医药集团有限公司春季校园招聘笔试历年典型考点题库附带答案详解
- 2026年执业医师加试院前急救考试试题与参考答案
- 2026零碳园区绿电直连系统规划建设方案
评论
0/150
提交评论