试验设计与统计分析.ppt_第1页
试验设计与统计分析.ppt_第2页
试验设计与统计分析.ppt_第3页
试验设计与统计分析.ppt_第4页
试验设计与统计分析.ppt_第5页
已阅读5页,还剩108页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、试验设计与统计分析,唐 启 义 Tel:13958168331 浙江大学农业与生物技术学院,1、 数据的基本统计分析 2、 统计检验基本原理及t检验 3、方差分析 4、相关和回归分析 5、多元统计分析(主成分分析和聚类分析),目 录,1.1 数据集中趋势 集中趋势是数据分布的中心,描述集中趋势的指标有: 算术平均数mean 中位数 median 众数等 mode,中位数 把一批数按照从小到大的顺序排列,处于数列中点的变量值就是Me 。,1.2 离散程度分析 离散程度是数据分布的又一特征,它表明各个变量值的差异,即离散程度。 意义:首先,可以衡量算术平均数的代表性。

2、 例:均值都为150的两组数 50,100,150,200,250 100,125,150,175,200 其次,进行产品质量评价、生产管理和决策。 离散程度经常用到的指标有:极差、方差和标准差等,它们也被称为变异指标。,方差与标准差 1、方差与标准差是测定离散程度最常用的指标。标准差是方差的平方根,也称均方差。 2、总体方差和标准差()计算公式: 样本方差和标准差(S)要除以n-1。 3、变异系数 4、方差分析中,均方差MSE即为处理的方差。,(总体)方差的计算,(样本)方差的计算,平均数置信区间估计,平均数差数的标准误,平均数差数置信区间估计,两平均数差异的t检验,标准误,标准误用于统计检

3、验。,标准误随重复增加而下降的曲线,2.1 参数假设检验的过程 a. 问题的提出及特征分析 b. 两个假设(原假设、备择假设) c. 选择适当的统计方法、计算统计量 d. 根据p值进行统计推断,2、统计检验基本原理及检验,某地区某水稻品种产量500kg/亩,施用某种新的肥料之后,10块试验田得到平均产量510kg/亩,标准差20。这个产量的变化,能否是施用这种肥料增产效果? 需要进行统计检验?,由于该品种标准对照是500kg/亩,因此原假设为总体均值等于500kg/亩(标准对照总放在零假设);由于样本均值大于500kg/亩,目的是推断施肥是否有效,故把备选假设定为施肥后产量大于500kg/亩(

4、这种备选假设为单向不等式的检验称为单尾检验(另一种是备选假设为不等号“”的,称为双尾检验)。即:,检验统计量计算,这里是总体方差未知,须用t检验进行检验。 公式中0通常表示为零假设中的均值(这里是500),S是样本标准差,等于20。在零假设之下,它有自由度为n-1=9的t分布。 代入公式计算计算结果是t=2.3717(也称为t值), 同时得到p-值为0.0209,因p值0.05,可认为增产效果显著。,目前几乎所有的统计软件,在给出统计量的同时,还给出了精确的p值。用P与检验水准比较, 通常取0.05, 0.01 在P时出现小概率事件,拒绝H0,接受H1,统计结论“有统计学意义”,专业结论根据实

5、际和统计量写出 在P 时没有出现小概率事件,不能拒绝H0,统计结论“无统计学意义”,简言之,p值就是传统所说的(显著水平)。p值可精确地告诉我们统计检验结果的显著水平,而不用再重复采用不同的水平。根据p值进行统计推断常用标准是:如果0.01p0.05,则结果被认为没有统计显著性(有时记为NS);但是,如果0.05p0.10,则有时注记为有倾向性的统计显著。,2.2 判断两组的总体均数是否不等,成组t检验(根据实际问题,选用双侧检验 ) H0:12,H1:12,比较两作物品种某微量元素含量差异,各品种该微量元素含量为 品种A 0.709 0.755 0.655 0.705 0.723 品种B 0

6、.617 0.608 0.623 0.635 0.593 0.684 0.695 0.718 0.606 0.618,H0:12,dfn1+n2-2,检验总体均数是否相等称成组t检验,检验公式 (1)分子:均值差异; (2)分母:方差和(离散程度)的大小; (3)样本数n大小。 显著性差异的结果不仅仅取决于均值本身的差异大小,而且还取决于试验中试验方差和样本数。 在实际农业生产中不重要的微小的差异在统计上可能显著。所以,在应用时,如果要求处理比对照(增加)显著,那么对增加幅度最好有所规定。另一方面,由于某种原因,统计上对较大的差异检验不出显著性,但这样的差异对农业生产或科研或许是很重要的。,以

7、0.01水准的双侧检验拒绝H0,接受H1;有统计学意义,可认为该元素在两品种中的含量有差异。,2.3 配对t检验,如果实验是配对设计,若两处理因素效应无差别,那么差值d的总体均数d应该为0,故可将该检验理解为样本均数与总体均数d =0作比较。,H0:d0,两方法(仪器)检验结果相同; H1:d0,两方法(仪器)检验结果不同。 双侧 =0.05。 按 = n-1=12-1=11查t值表,得t0.20,11=1.363,t0.10,11=1.796,t0.10,11tt0.20,11,则0.20P0.10,差别无统计学意义,尚不能认为两种(方法)仪器检查的结果不同。,3、多个处理的统计检验( 方差

8、分析),方差分析:检验两组以上总体均数是否全都相等。,方差分析应用理论上的条件独立性:各样本是相互独立随机的样本正态性:各样本都来自正态总体方差齐性:各样本的总体方差相等,A、B、C和D四种工艺,测量产品某指标结果如下:,均值 总均值 差值 A6260635963596164 -3 B6367716465666664+2 C6866716768686864+4 D5662606163646164 -3,3.1 单因素方差分析原理,如果处理效果相同,那么有H0:1=2=3 =4,也即组样本均数来自同一总体。 如果4处理效果完全相同,那么处理间变异等于0;整个变异都是处理内(随机误差)引起的。 如

9、果处理,每处理各次重复间没有差异,则总变异都是处理间变异,处理内(随机误差)为0; 上面是极端情况,一般情况是,处理间和处理内都有变异存在。这时计算处理间均方与处理内均方的比值: F= MS处理间 /MS处理内,方差分析表 变异来源平方和自由度 均方 F值 p值 处理间 228 3 76 13.57 0.00 处理内 112 20 5.6 总变异 340 23,根据值大小,下结论。,一般用Tukey法和LSD法。但注意:目前国内目前的农药实验要求Duncan 法。,数据转换:如数值相差几个数量级,可用对数转换;如许多小区值为0,则可用平方根转换;如指标是百分数,且大部分数值大于70或小于30,

10、可用反正弦平方根转换。,数据描述:均值和标准差是必须的,处理样本数也要说明。 方差分析:F值、自由度和P值;如P0.05则差异显著,如P0.01则差异极显著。 多重比较:均值后面跟有相同字母的就没差异。,3.2 正确理解差异显著或极显著的统计意义,“差异显著”或“差异极显著”不应误解为相差很大或非常大 ,也不能认为在专业上一定就有重要或很重要价值。 “显著”或“极显著”是指不同处理没有差异的可能性小于5%或1%,。即认为它们有实质性差异的可能性是95%或99%,99.99%。 有些试验结果虽然差别大,但由于试验误差大,也许还不能得出“差异显著”的结论;而有些试验处理间差异虽小,但由于试验误差小

11、,反而可能是“差异显著”。,两个栽培试验,不同处理A、B、C间的成活率,谁的差异大?,实验,实验,A:空白对照; B:标准对照; C:新技术处理,实验1的方差分析表,实验2的方差分析表,两实验各处理均值比较,44,方差分析的结论提供各总体均数不同的总信息,但没有提供各总体均数两两之间的不同是否有统计意义。若5个水平两两之间进行t检验,需作10次,检验水准为=0.05,则正确接受10次假设概率为0.9510= 0.5987,总的检验水准变为1-0.5987=0.4013。因此不宜再用t检验进行两两比较。必须进行多重比较 。,LSD-t法称最小显著性差异法,是十分常用的方法。,3.3 多重比较方法

12、的选择,45,如果仅控制每作一次比较犯I类错误的概率,简称为控制“比较误差率”,如LSD法。这种方法几乎可以把所有的差异都找出来(几乎不会犯第一类错误),但犯第二类错误的可能性增加(将没有差异的配对组推断为有差异)。 如果控制所作的全部比较的最大实验误差率,简称“最大实验误差率”,如TUKEY法。这种方法几乎可以保证所检验出来的差异都是正确的(几乎不会犯第二类错误),但犯第一类错误的可能性增加(增加有差异的配对被认为没有差异的可能性)。 这里的两种方法是两个极端的情形。统计学家提出了一些介于两者之间的方法,这就导致有多种多重比较方法的存在。,t0.05=3.15, t0.01=4.48 说明:

13、t临界值乘以根2。,LSD最小显著差数法,Duncans新复极差测验,Tukey 测验,自由度10时,三种多重比较法的临界值,3.4 随机区组试验设计,试验设计:重复、随机和区组 重复:提供试验误差的估计;减少标准误、增加精度, 。 随机:消除偏差;保证各个处理统计上是“独立的”。 区组:增加试验精度;处理间比较更均一。,随机区组设计:将研究对象按性质相同或相近者组成b 个区组(局部控制),每个区组中的k 个处理随机分配。 优点利用区组,进一步控制偏倚,减少实验的偏差; 但实验结果中若有数据缺失,统计分析较麻烦(目前可用一般线性模型解决)。,3.5 随机区组设计在中的实现,确定处理因素,田间划

14、分区组 DPS生成实验方案: 如5个处理,设置4个区组,共20个实验处理的实验。执行实验设计菜单下的“单因素随机区组设计”,将随机区组设计实验处理结果对号入座填入表格,得到数据方差分析格式,在菜单下执行“实验统计”-“随机区组设计”下面的“单因素实验统计分析”。,数据转换:如数值相差几个数量级,可用对数转换;如许多小区值为0,则可用平方根转换;如指标是百分数,且大部分数值大于70或小于30,可用反正弦平方根转换。,一般用Tukey法和LSD法。但注意:目前国内目前的农药实验要求Duncan 法。,结果描述及数据分析与完全随机实验设计相同,就当是区组间那一行不存在,4. 相关与回归分析,1、多变

15、量数据特征描述(相关分析) 2、变量间定量关系(回归分析) 3、复合中心试验设计及优化分析,53,4.1 数值特征描述(相关),相关系数置信区间及偏相关,基本统计(卡方图)离群值样本是否有异常,基本统计(box图指标是否有异常值),4.2 回归分析 如产量肥料反应函数,4.2.1 回归分析简介,回归(regression)建立一个描述应变量依自变量变化而变化的直线方程,并要求各点与该直线纵向距离的平方和为最小。 直线回归是回归分析中最基本、最简单的一种,直线回归方程是Y= a + bX 中,a、b 是决定直线的两个系数.,59,施肥量与产量的关系,一般有: 线性: y=a+bx 二次曲线: y

16、=a+bx+cx2 Mitscherlich方程: y=a(1-10-bx) 幂函数/Cobb-Douglas方程: y=axb 指数曲线 y=aebx,施肥量与产量的关系(多为非线性),拟合二次多项式回归模型(反应面分析),多元线性回归,4.2.2 DPS下回归分析数据格式,根据试验数据建立回归方程,在DPS里,建立回归方程数据格式: 一行一个样本 一列一个变量 因变量放在最右边。 建立回归方程,样本个数要大于总变量个数。,62,4.2.3 DPS下用户界面(一元线性回归),63,4.2.3 DPS下用户界面(非线性回归),65,4.2.3 DPS下用户界面(逐步回归),66,4.3 复合中

17、心设计及其优化建模,68,69,实验结果统计分析,左边方实验设计表,右边一列放各个处理相应的产量,然后用鼠标选中。 最后进入主菜单,选择“试验统计”中的“实验优化分析”下面的“二次多项式回归”。系统出现如下界面。,70,71,输出结果,、各个因素(试验处理水平)编码的平均值和标准差,以及相关系数矩阵; 、二次多项式回归模型; 、回归模型的F检验值及显著水平p,一般显著水平小于等于0.05时即可对该模型进一步分析,如果F太小,回归方程不显著,则不适合建立二次多项式回归模型来分析试验结果;,72,模型统计检验,73,、各个因子项的回归系数、标准回归系数、t检验值及显著水平p; 、回归模型的复相关系

18、数R剩余标准差和调整后的相关系数,一般来说,调整后的相关系数越大越好; 、各个处理的观测值、拟合值和拟合误差,以及Durbin-Watson(DW)统计量。DW统计量只当分析样本按某一顺序(如处理先后)存放时才有意义,该值要在2的附近为好;,74,、其他因子为零时单因子和两因子互作效应分析,可在DPS系统作图功能的支持下,分别作x-y曲线图和等高线图; 、其他因子为零水平时,各个因素的灵敏度分析,给出了系数灵敏度、导数、平均效应y/x和目标函数y,根据这些数据,可以进行边际分析;,75,、典型分析,求一阶偏导数方程、拟合方程的典型形式,稳定点分析; 、在试验条件的约束之下,进行模型优化,得到最

19、高产量时各个因素组合。 如果在分析时按系统的提示,输入了目标指标的价格,以及各个处理因素的价格,系统将会给出最大经济效益时的产量和产值。,76,典型分析及模型优化,对回归模型进行比较深入、直观地分析;典型分析(又称典范分析,典则分析,Canonical analysis)提供了较为理想的分析技巧。,77,应用典型方程,我们可以得到如下信息: 一是稳定点处是否是拟合模型极大值、极小值或鞍点:当典型方程的各个系数为负时,稳定点为模型的极大值;当典型方程的各个系数为正时,稳定点为模型的极小值;当典型方程的各个系数有正有负时,稳定点为鞍点。 这一点很重要,这时因为我们在寻优建模时,往往根据专业背景,指

20、定模型寻优方向。这种寻优方向可能和拟合模型本身的最优解不一致,或部分因子不一致。不一致时,采用数值寻优算法得到的最优点有可能位于实验因子取值的边界上。,78,79,同时,根据典型方程,判断各个因素在稳定点附近的变化大小。系数越大,变化越快,该点的稳定性就较差,这是在应用中需要注意的。 最后,如果通过数值优化分析和典型分析得到的最优值一致,那么模型可以认为是较好的,如果不一致,在模型应用时,需要进行更深入的分析,探明原因,且模型结果谨慎应用。,80,多因子实验优化的区组设计,多因子优化设计试验,一般试验次数较多。试验次数增加会带来量方面的问题: 一是试验时间延长。有的实验处理是依时间顺序一个接一

21、个地进行的。由于时间延而产生的对实验结果的影响叫做时间漂移,这一影响很可能增加试验误差。这种情况在工业试验中较为普遍。 另一种情况是试验区增大。在农林生物的田间试验中,因处理因子多、实验区加大、这样难以在同质的条件下进行试验,而需要进行小区控制、实行区组设计。,81,DPS提供的区组设计功能,区组设计应用与多因子优化试验是有必要的。但遗憾的是,我们以往的试验优化分析工具,都没有提供可处理区组设计功能。这里,我们增加了处理含有若干区组的二次正交回归组合(中心复合)设计试验数据分析建模功能,该功能模块在“试验统计”“试验优化分析”“区组设计二次多项式回归”里面。,82,区组设计统计分析数据格式,二

22、次正交回归组合设计或其他多因子试验,如果在实施时划分了B个区组,在试验结果的数据分析时,数据的第一列放区组的顺序编号(1,2,., B),其它列则和其它多因素实验设计一样,放各个处理因子的编码值或各个因子试验实施的水平值,最右边放试验观察指标结果值。,83,区组设计优化分析,84,实际应用的考虑,验证与搜索 稳定点是最优点时,在稳定的做验证实验; 有鞍点存在时,稳定点不是最优点时,做因子延伸的实验,其它解释目标因子的新方法,神经网络及径向基函数 支持向量机(SVM) 投影寻踪回归 随机森林,特点,5. 多元分析简介,5.1 主成分分析 5.2 聚类分析,1. 基本思想:用较少的变量表示原来的样

23、本; 2.目的:是样本数据信息损失最小的原则下,对高维变量进行降维。 3.参数估计:一般是求相关矩阵的特征值和相应的特征向量(主成分分析法),取前几个计算主成分。 4.应用:应用较少变量来解释各个样本的特征(数据降维、综合平价)。,5.1 主成分分析,主成份分析例子,一项十分著名的工作是美国的统计学家斯通(stone)在1947年关于国民经济的研究。他曾利用美国1929一1938年各年的数据,得到了17个反映国民收入与支出的变量要素,例如雇主补贴、消费资料和生产资料、纯公共支出、净增库存、股息、利息外贸平衡等等。,主成份分析起源,在进行主成分分析后,竟以97.4的精度,用三新变量就取代了原17

24、个变量。根据经济学知识,斯通给这三个新变量分别命名为总收入F1、总收入变化率F2和经济发展或衰退的趋势F3。更有意思的是,这三个变量其实都是可以直接测量的。斯通将他得到的主成分与实际测量的总收入I、总收入变化率I以及时间t因素做相关分析,得到下表:,主成分分析是把各变量之间互相关联的复杂关系进行简化分析的方法。 在研究中,为了全面系统的分析和研究问题,必须考虑许多指标,这些指标能从不同的侧面反映我们所研究的对象的特征,但在某种程度上存在信息的重叠,具有一定的相关性。,在力求数据信息丢失最少的原则下,对高维变量空间降维,即研究指标体系的少数几个线性组合,并且这几个线性组合所构成的综合指标将尽可能

25、多地保留原来指标变异方面的信息。这些综合指标就称为主成分。,(1) 基于相关系数矩阵主成分分析。 (2) 主成分分析的目的是简化变量,一般情况下主成分的个数应该小于原始变量的个数。关于保留几个主成分,应该权衡主成分个数和保留的信息。 (3) 如何解释主成分所包含的专业意义。,主成分分析数学模型 多个指标降为少数几个综合指标的过程在数学上就叫做降维。主成分分析通常的做法是,寻求原指标的线性组合Fi。,主成分分析的几何解释,平移、旋转坐标轴,主成分分析综合能力,1)贡献率:第i个主成分的方差在全部方差中所占比重 ,称为贡献率 ,反映了原来P个指标多大的信息,有多大的综合能力 。,2)累积贡献率:前

26、k个主成分共有多大的综合能力,用这k个主成分的方差和在全部方差中所占比重 来描述,称为累积贡献率。,我们进行主成分分析的目的之一是希望用尽可能少的主成分F1,F2,Fk(kp)代替原来的P个指标。到底应该选择多少个主成分,在实际工作中,主成分个数的多少取决于能够反映原来变量80%以上的信息量为依据,即当累积贡献率80%时的主成分的个数就足够了。最常见的情况是主成分为2到3个。,102,5.2 聚类分析,系统聚类分析: 直观,易懂。 快速聚类: 快速,动态。 有序聚类: 保序(时间顺序或大小顺序)。,103,聚类分析根据一批样品的许多观测指标,按照一定的数学公式具体地计算一些样品或一些参数(指标

27、)的相似程度,把相似的样品或指标归为一类,把不相似的归为一类。 样品之间的聚类即Q型聚类分析,则常用距离来测度样品之间的亲疏程度。 变量之间的聚类即R型聚类分析,常用相似系数来测度变量之间的亲疏程度。,104,样品间亲疏程度的测度,聚类距离和方法: 聚类距离:样本点之间的距离; 聚类方法:聚类过程中类间的距离的构造,因此聚类方法实质上是类间聚类的定义。,向量x=(x1, xp)与y=(y1, yp)之间的距离或相似系数:,欧氏距离: Euclidean,平方欧氏距离: Squared Euclidean,夹角余弦(相似系数1) : cosine,Pearson correlation (相似系数2):,Chebychev: Maxi|xi-yi|,Block(绝对距离): Si|xi-yi|,Minkowski:,当变量的测量值相差悬殊时,要先进行标准化. 如R为极差, s 为标准差, 则标准化的数据为每个观测值减去均值后再除以R或s. 当观测值大于0时, 有人采用Lance和Williams的距离,类Gp与类Gq之间的距离Dpq(d(xi,xj)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论