版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1、论加权回归与建模摘要:以加权回归估计方法为核心,对林业上常用模型的异方差性进展了研究,提出了能彻底消除异方差的最正确权函数。并对模型的评价指标进展了讨论,提出了评价通用性回归模型的3大指标,并分析了加权回归估计与这些评价指标之间的关系。最后对样本资料的搜集进展了讨论,提出了搜集建模样本应遵循的根本原那么。关键词:加权回归建模异方差模型评价林业数表模型是森林经营决策必不可少的计量、预测、评价根据,保证模型质量至关重要,而样本组织、模型拟合方法和模型评价是保证质量的3个重要环节。理论证明,林业数表模型所描绘的问题普遍存在异方差性,在模型拟合中假设不采取消除异方差影响的有效方法,必然导致模型有偏。为
2、此,一般可采取加权最小二乘法拟合模型,但在权函数的选择上尚存在两个有待进一步解决的问题:一是权函数的形式因模型所描绘的事物的性质不同而异,确定最正确权函数非常繁琐;二是到目前为止,尚未找出能完全消除异方差的权函数。本文旨在提出一种可以完全消除异方差影响的权函数通式,并给出正确评价模型的指标体系及组织建模样本的根本原那么。1加权回归的概念确定变量之间的回归关系,一般情况下是利用普通最小二乘法。假设随机变量y,其中,E(y)=f(x)。也就是说,随机变量y与x满足以下模型:y=f(x)+(1)式中的有3个根本假定,即“独立、正态、等方差,它们是采用普通最小二乘法建立回归模型的先决条件。3个条件中的
3、“独立与“正态在一般情况下都是根本满足的,而“等方差这一条件,那么在很多情况下都难以满足。为解决误差项的异方差性问题,应设法校正原有的模型,使校正后的模型其误差项具有常数方差,而模型的校正取决于方差2i与自变量xi之间的关系。假设i的方差与xi的函数g(xi)呈比例关系,即:2i=g(xi)2(2)这里2是一个有限常数。于是用去除原有模型,可使新模型的误差项具有常数方差。用这种方法估计模型中相应的参数,叫做加权最小二乘法(俞大刚,1987)。2权函数的选择2.1异方差性的根本概念根据回归估计理论,当建立的回归模型的误差项存在异方差时,必须采用加权最小二乘法来消除异方差对参数估计的影响。在林业上
4、所涉及的许多数学模型,如材积模型、生物量模型、生长率模型、削度模型等,其误差项的方差都不为常数,而是随解释变量的变化而变化(骆期邦等,1992;曾伟生等,1992;曾伟生,1996)。一般而言,模型预估值随解释变量的增大而增大时,其误差项的方差也随解释变量的增大而增大,如材积模型和生物量模型;模型预估值随解释变量的增大而减小时,其误差项方差也随解释变量的增大而减小,如生长率模型。在残差图上反映出来,二者都为喇叭型。另外,预估变量的变化范围愈大,异方差性一般也愈明显。因此,采用适当形式缩小预估变量的变动幅度,可在一定程度上消除异方差性。如将材积转化为形数来建模,可将预估变量的取值大致控制在0.3
5、50.65的范围,使预估值的最大相差倍数从数千倍缩小至2倍以内,从而根本上消除了异方差性。将生长量转化为生长率再建模,也在很大程度上缩小了预估值的变动幅度,可明显削弱其异方差性。2.2权函数选择的研究现状上面提到的一些常用模型,由于存在异方差,因此必须选用适当的权函数来进展加权回归估计。关于这一点,近几年已经逐步有了认识。如对材积模型V=aDbH的估计,一般认为选用权函数=1/(D4H2)可有效地消除异方差的影响(骆期邦等,1992);对生长率模型PV=aDbA的估计,取权函数=1/(D2A)效果较佳(曾伟生等,1992)。而且,还认识到了最适宜的权函数是针对某一个模型而不是某一类模型(曾伟生
6、,1992)。但是,针对一个详细的回归模型,如何确定其最适宜权函数的问题仍然没有得到圆满解决。一般情况下,假设不具有异方差性形式的信息,可通过对剩余值ei=g(xi)进展试验,以挑选出一种适宜的拟合形式(俞大刚,1987)。另外,也有人提出直接寻找方差S2Ei与自变量xi的关系式S2ei=g(xi),再以=1/g(xi)为权函数进展加权回归,新模型的误差项方差S2ei就会近似为常数1。还进一步提出了较具通用性的抛物线形式的权函数,并获得了较好的效果(曾伟生,1996)。但是这样来确定权函数,一方面比较繁琐;另一方面也难保证抛物线形式能适宜所有模型,尤其是含多个自变量的模型;再就是必须有比较大的
7、建模样本才可能得到误差项方差与变量x之间的回归关系。诚然,在此根底上还可以作些改进,如:借鉴曾伟生文(曾伟生等,1997)中可变参数模型的设计,将狭义的抛物线形式y=a+bx+x2扩展为广义的抛物线形式y=a+bxn+(xn)2(n=0.5,1,2)以更好地适应各个模型不同程度的异方差性;从自变量集中选出最主要的变量(如材积模型中的直径)来构造权函数等。即使这样,效果仍然不太理想。2.3最正确权函数确实定前面已经提到,最正确权函数是针对某个模型而不是某类模型,即同类模型中不同的回归方程式应有不同的最正确权函数。基于这一认识,我们再来对一些经典模型及其适宜权函数作进一步分析。不难发现,认为以=1
8、/(D2H)2为权函数效果较好的材积模型V=aDbH,其参数b、的估计值分别接近于2和1;以=1/(D2A)为权函数的生长率模型PV=aDbA,其参数b、的估计值分别接近于1和0.5。最近笔者还发现,形如=a(D2H)b的生物量模型,取=1/(D2H)2为权函数效果也很佳,此时b的估计值接近于1。假设定义=1/g(x)2为权函数,因为上述模型中的参数估计值与权函数中的相应参数值接近,故模型两边同时除以g(x)时,右边都近似等于参数a;假设权函数中的相应参数取模型的参数估计值,那么模型两边同除g(x)时右边就会恒等于参数a了。更进一步,假设取:=1/f(x)2(3)作为权函数,那么模型两边同除以
9、f(x)后得到的新模型,右边都等于1。可以证明,此时得到的新模型,其误差项的期望值为0,方差为常数。亦即,以模型本身构造的权函数就是要寻找的最正确权函数。这刚好应证了“不同模型有不同的最正确权函数的观点。该模型为:y=f(x)+(4)两边同时除以f(x)得新模型:y=y/f(x)=1+/f(x)=1+(5)对新模型(5)采用普通最小二乘法进展估计(相当于原有模型(4)的加权回归估计),有:(6)下面讨论新模型误差项的性质。期望值:E()=E/f(x)=Ey/f(x)-1由(6)式知,Ey/f(x)=1,故E()=0。方差:式中f(ei)为频数(董德元等,1987)。可用建模样本对上述方差D()
10、作出如下无偏估计:因此,新模型误差项的期望值为0,其方差为常数,即对所有xi来说,每个i的方差都一样;满足等方差的条件。至此可以得出结论:以模型本身构造的权函数(3)式就是要寻找的最正确权函数。(8)平均相对误差绝对值(9)预估精度(10)或,预估误差(11)式中:yi为实测值;i为预估值;n为样本单元数;t为置信程度时的t分布值;T为回归模型参数个数;为平均预估值,可由f()给出。另外,因为这类回归模型必须具有通用性质,需满足随自变量x从小到大时模型的上述指标应根本保持一致,所以还需分段对上述指标作出评价。应特别强调的一点是,因为相对误差公式一般表示为:从而在林业应用上对(7)9式过去几乎都
11、是写成(预估值-实测值)/实测值,即习惯性地将实测值当成了真值。将实测值当真值正确与否,需视详细情况而定。如某一株D=20、H=15的杉木,经实测其材积为0.243。假设用于立木材积的目测训练,正确的做法自然是将0.243作为该树的材积真值来检测每个人的目测程度;假设是用于立木材积表的编制,那么0.243只是满足D=20、H=15这一条件的某株杉木的材积实测值,在这种情况下不存在真值的概念,而只有实测值与预估值(或期望值)之分。误差计算在林业数表领域的应用根本上都是后一种情形,因此一般应采用前面给出的(7)(9)式。预估精度(10)式或预估误差(11)式是笔者提出的评价通用性模型的新指标,从后
12、面的讨论将看到,它是反映模型预估效果的最重要的评价指标。它的成立需满足条件总体为正态分布这一前提条件。对于林业消费应用中的绝大多数情况,这一条件都是根本满足或近似满足的。3.2模型评价与加权回归为了说明加权回归方法对建立通用性模型的重要性,现以一组实测数据为例,来对普通最小二乘法和加权最小二乘法得出的模型进展评价。所用数据为杉木地上部分干物质生物量,采集自江西省德兴市的人工杉木林中。共计50株样木,来自6个样地,样地按幼、中、成3个龄组和中、好两个立地等级各分布1块。假设从建立立木生物量模型这一目的考虑,所用数据严格讲并不符合建模要求(后面将讨论到),但用作不同方法结果的比照是可以的。表1给出
13、了常规生物量模型=a(D2H)b两种回归估计方法的比照结果,表2列出了(7)(10)式的评价指标值,其中包括将整个建模样本按胸径D的大小以株数平分为5段所算出的评价指标值。从表1、表2可以明显看出,尽管加权回归(特指按前面的最正确权函数(3)式加权,下同)的残差平方和为普通回归的2.1倍,剩余标准差为1.4倍,但按(7)(10)式所给指标进展分段检验的结果,加权回归模型明显优于普通回归模型。普通回归模型随自变量x从小到大各评价指标从劣到优,即主要只照顾绝对值大的样点,而对绝对值小的样点很少考虑。但是,加权回归模型却各段的检验结果根本一致,而且加权回归模型还有一个很好的特性,即总系统误差为0,这
14、从(6)式可以推知。表1普通回归与加权回归估计的拟合结果Tab.1FittingresultsfrdinaryregressinandEightingregressinestiatin方法Regressinethd参数估计值(变动系数%)Paraeterestiates(effiientsfvariatin%)统计指标StatistialindiesabQSRR*普通回归rdinaryregressin0.029074(22.72%)0.94180(2.68%)2455.237.15200.991440.99126加权回归eightingregressin0.069923(11.01%)0.8
15、3353(1.92%)5137.9110.34600.982010.98163表2普通回归与加权回归估计的检测结果Tab.2Testresultsfrdinaryregressinandeightingregressinestiatin样本范围Saplesize普通回归rdinaryregressin加权回归eightingregressinRSERAPRSERAP全部Ttal1.26958.0025.5994.364.200.0014.1892.30第1段SetinN.143.35543.4554.3538.36-2.86-4.8610.4783.60第2段SetinN.233.05400.
16、1241.8461.384.1575.8222.9277.67第3段SetinN.35.7465.248.1491.45-6.79-72.349.8891.54第4段SetinN.4-4.67-58.4116.0386.10-6.87-91.6716.3585.71第5段SetinN.50.497.607.6191.7210.7693.0611.2885.564搜集建模样本的根本原那么要建立一个好的通用性模型,对建模样本是有一定要求的。如林业上一些通用性数表的编制,对样本资料的要求在部颁技术规定(林业部,1990)中都作了详细规定。但是也不难发现,其中对建模样本的要求仍然不是很明确,还有必要再
17、作进一步讨论。4.1样本单元数作为建模样本,首先涉及样本单元数的问题。文(中华人民共和国林业部,1990)中提到了一条原那么:“样本单元数应根据各项因子的变动范围和精度要求按数理统计原理确定,但是对精度要求都是用“系统误差这一指标来规定的,如“蓄积量计量数表的系统误差不超过3%。这里的系统误差是(7)式的总相对误差还是(8)式的总系统误差或其它什么含义,并未明确。根据数理统计原理,表达精度要求的误差概念应该是(11)式所表示的预估误差,这样才可据此确定样本单元数。作为通用性模型,预估精度是针对每一个预估值而言,因此必须落实到与每一个自变量xi所对应的预估值i。对于林业上的常用模型,xi为连续变
18、量,因此应该在其取值范围内确定个能反映因变量yi的变化规律的点,再分别根据与这个xi所对应的yi的变动系数及精度要求,确定各点的子样本单元数,个子样本单元数之和即为整个建模样本的单元数。只有当各点的变动系数一样,其对应的子样本单元数才要求相等。上面只是考虑一个自变量的情况。假设有多个自变量,那么情况要复杂一些,但原那么一样。以二元立木材积表的编制为例,首先需定出个直径值,再针对每个直径值定出k个树高值,最后按一定要求搜集k个子样本,合起来形成整个建模样本。假定每个子样本有一样的变动系数(如10%),按5%的预估误差要求(置信程度95%),那么各需16个样本单元(取t0.05=2,实际操作时应随
19、n作调整)。按最低限度取=5、k=3,那么共需240个样本单元。假设要求预估误差为3%,且其它条件不变,那么共需667个样本单元。一般情况下,材积变动系数会随D、H的增大而增大,因此,假设建模样本中对应较大D、H组合的点所取子样本单元数较少,那么必然会造成大径级立木的材积估计值达不到预定的精度要求。4.2样本构成样本构成指样本单元数随自变量的分布情况。仍以二元立木材积模型为例,样本构成涉及上述、k确实定及每一个子样本中详细建模样木的选龋关于径级数和每个径级中的树高级数k,文(中华人民共和国林业部,1990)中建议分别在1015左右和不少于3个。因为、k的大小直接影响搜集样本的工作量,提供一个最
20、低限度指标是必要的。对于材积模型,因为其曲线变化趋势比较单一,故取=58、k=35即可。假设是变化趋势比较复杂的模型(如“S型生长曲线),可适当增加至=710。在确定、k之后,详细选取哪些径级和树高级时,应掌握如下原那么:最孝中等和最大者必选,然后再在其间适当增选;目的变量变化规律未知时考虑等距均匀分布,变化规律时宜典型选取,其中变曲点处必眩由于树高级确实定是在已定径级根底上进展的,故应考虑影响树高变动的各种因素。详细针对某一径级和树高级组合的子样本,其样木的选取必须考虑影响材积变动的各种因素,在根据各种影响因素划分的类型中去典型选样。因为异方差性的存在,笔者认为各子样本样木的D、H应尽可能地
21、一致,以正确地估计其平均数的方差和变动系数。尽管整个样本看起来呈现离散性,但不会影响建模效果。相反,因为各子样本的搜集都到达了建模要求,只要模型选获得当,其预估精度是肯定可以到达预定要求的。样本资料的搜集是建模的首要环节,其质量好坏直接影响建模效果。通过模拟数据的比照检验结果可以发现,一套理想的建模样本数据,不管是采用普通回归还是加权回归估计方法,其结果几乎是一致的。也即由一套好的样本资料所建立的模型,其总相对误差和总系统误差都应该接近于0。因此可以说,2种估计方法得出的回归模型的差异大小,在一定程度上反映了建模样本的质量好坏。4.3检验样本与精度检验建立通用性回归模型时,一般要求在搜集建模样
22、本的同时,还另收一套检验样本。如文(中华人民共和国林业部,1990)中提到搜集编表资料的另一条原那么:“要同时搜集编表和检验两套样本,用编表样本编表,用检验样本检验所编数表的精度。检验样本的搜集原那么和方法类似于建模样本,此处只着重讨论检验方法及这一检验的必要程度。利用检验样本进展所谓“适用精度检验,必须分别径级进展。正确的方法应是先按(7)式算出总相对误差E,然后判断它是否超过公式:(12)的计算结果。式中,V为检验径级的预估材积的变动系数,n为该径级检验样本单元数,t为置信程度时的t分布值(自由度为n-T,T为模型参数个数)。假设不超过,那么认为模型是可以承受的。由(11)式知,(12)式
23、中的变动系数V可表示为:(13)式中Ep为检验径级的材积预估误差,n为该径级的建模样本单元数,t为置信程度时的t分布值(自由度为n-T)。将(13)式代入(12)式,可得到承受模型的条件为:(14)假设n=n,那么只要检验样本的总相对误差不大于建模样本的预估误差就行了。另外,(14)式还反映出了一条信息,即各径级检验样本单元数必须满足nT。从上述检验方法可看出,整个检验行为并不能提出一个反映所建回归模型预估精度的指标值,而只是作出一个可否承受模型的断定。可以推断,只要建模样本的搜集符合要求,就根本上能以(1-)的概率作为承受模型的断定,也即作出否决模型的断定只是一个小概率事件。万一真是出现此种情况,也只能按要求去完善样本资料重新建模。因此,与其花费一部分工作量去搜集检验样本,还不如在搜集建模样本时多花点功夫以确保其质量。真正表达回归模型预测精度的,还是预估误差这一指标。5结论样本资料搜集、回归估计方法和模型评价是建立回归模型的3个重要环节。建模样本单元数必须根据预定精度要求和目的变量的变动系数及变化规律综合确定。样本的构成关系到样本的质量,而样本的质量好坏将直接
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026电信公司笔试题目及答案
- 行业基础水知识测试卷及答案
- 2026电器装配考试题及答案
- 2026电气初级考试题及答案
- 2026电力施工操作考试题目及答案
- 2026电竞编导考试题及答案
- 财务会计-权威理解:税务总局发布40个增值税抵扣问答
- 国企招标采购异议答复处理细则
- 手术室标本管理操作细则
- 施工现场噪声监测实施方案
- 射箭裁判知识培训内容课件
- DB65T 4353-2021 风力发电机组塔筒倾斜度测量方法
- 2025年教师选调进城考试试题小学语文含参考答案
- 丙类仓库管理制度
- 机械设备安装施工部署
- 2025年工程监理企业发展策略及经营计划
- 纸护角生产工艺培训资料
- 延长石油社会招聘试题
- 装饰装修工程施工方案(完整版)
- 新浙教版 九年级科学上 第一章复习
- 2024年广西中考道德与法治试卷真题(含答案)
评论
0/150
提交评论