已阅读5页,还剩59页未读, 继续免费阅读
(系统分析与集成专业论文)气象灾害数据挖掘及管理系统设计.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 本文首先回顾了数据库,数据挖掘的相关背景及发展过程,对目前的气象 灾害数据处理技术进行了分析。通过分析气象部门对灾害数据处理弊端,提出 本文的研究工作。 通过分析国内外研究中已有的数据挖掘技术,选择了决策树技术和神经网 络技术进行研究。决策树分类算法是数据挖掘研究中的一个以样本数据集为基 础的归纳学习方法,它着眼于从一组无次序、无规则的样本数据集中推理出决策 树表示形式的分类规则。在论述分类挖掘的基础上分析了决策树分类挖掘系统 的建立思想、步骤及i d 3 算法和c 4 5 算法,并把这两种算法应用到优化气象灾 害统计的实验中,实验结果证明了该方法的可行性,决策树算法可应用于气象 灾害导致的直接经济损失的评估。针对病虫害农业经济损失的预测具有较强的 复杂性和非线性特性,设计了一种新型的g r n n 预测模型,对农业病虫害经济损 失进行预测。该模型基于人工神经网络捕捉非线性变化独特的优越性,在神经 网络技术和江苏省气象局提供的数据的基础上,利用m a t l a b 人工神经网络工具 箱及g r n n 广义回归神经网络建立预测模型来提高病虫害农业经济损失预测的精 度。预测结果表明,该方法建立的模型可以实现对病虫害经济损失的预测,且 其预测精度较高。 从江苏省气象局的实际情况出发,为其开发了一个符合气象部门实际需求 的气象灾害数据库管理系统。从设计一个m i s 出发,到建立数据库,再到实现 气象灾害数据分析和数据挖掘。在技术角度,全面详细介绍了气象灾害数据库 系统的建设;在实际应用中解决了数据量大,不易处理等多年困扰江苏省气象 局的问题。当前大多数地区的气象部门存在着类似的问题,相信本文的研究, 对改进他们的决策支持管理系统也有可借鉴之处。 关键词:气象灾害数据库,数据挖掘,决策树,神经网络,m a t l a b a b s t r a c t f i r s t ,i nt h i sp a p e r , i tr e v i e w st h eb a c k g r o u n da n dd e v e l o p m e n to fd a t am i n i n g , a n da n a l y s e st h ec u r r e n td a t ap r o c e s s i n gt e c h n o l o g yo fm e t e o r o l o g i c a ld i s a s t e r s r 玎1 ep a p e rr e s e a r c h e so nd a t ap r o c e s s i n go fm e t e o r o l o g i c a ld i s a s t e r sb a s e do n d e c i s i o nt r e ea n dn e u r a ln e t w o r k , a f t e ra n a l y s i so fs o m ed e t e c t i o nt e c h n o l o g i e si nt h e i n t e r n a la n do v e r s e a sr e s e a r c h e s d e c i s i o nt r e ea l g o r i t h mf o c u s e so nd e d u c i n gt h e c l a s s i f i c a t i o nr u l e sf r o mag r o u po fr a n d o m ,i r r e g u l a rs a m p l ed a t as e t s ,a n dd r a w i n g t h ed a t am o d e lw h i c hc a nd e s c r i b et h es a m p l ed a t as e t s i d 3a l g o r i t h ma n dc 4 5 a l g o r i t h ma r ea n a l y z e di nt h i sp a p e r ,n l eb a s i cc o n c e p ti sf i r s t l yd i s c u s s e d ,t h e nt h e i d e a s ,s t e p sa n da l g o r i t h m sf o re s t a b l i s h i n gc l a s s i f i c a t i o nm i n i n gs y s t e ma r ea n a l y z e d a n dt h ef e a s i b i l i t yo ft e c h n i q u ei sp r o v e dw h e nc l a s s i f i c a t i o nm i n i n gs y s t e mi s a p p l i e dt ot h ee x p e r i m e n to fo p t i m i z i n gm e t e o r o l o g i c a ld i s a s t e r ss t a t i s t i c an e w d e s i g no fm o d e lf o rp r e d i c t i o no fl o s sa f f e c t e db yp e s t sh a sb e e na c c o m p l i s h e db y g r n nn e u r a ln e t w o r ka i m e dt os o l v et h es t r o n gq u a l i t yo fc o m p l e x i t ya n dn o n l i n e a r p r e d i c t i o n i ti sa p p l i e dt op r e d i c te c o n o m i cl o s s b e c a u s eo fi t sg o o dq u a l i t yo f n o n l i n e a rp r e d i c t i o n a n df o rt h ep u r p o s eo fi m p l e m e n t i n gt h ep r e d i c t i o na c c u r a c y , t h ef a c t o r sa f f e c t i n ge c o n o m i cl o s sa r ea n a l y z e db yu s i n gt h em 埝t l a bn e u r a l n e t w o r kb o xt oe s t a b l i s hg r n nn e t w o r kb a s e do nn e u r a ln e t w o r kt e c h n o l o g ya n d t h ed a t u mg i v e nb yj i a n g s um e t e o r o l o g i c a lb u r e a u t h em o d e li se s t a b l i s h e d ,a n dt h e p r e d i c t i o no fe c o n o m i cl o s sa f f e c t e db yp e t si sf u l f i l l e d ;i t sp r e d i c t i o np r e c i s i o ni s v e r ye f f e c t i v e 。 t h ep a p e rd e s i g n sf r o mam i st oe s t a b l i s had a t a b a s et h e nt od a t aa n a l y s i sa n d d a t am i n i n g i nt e c h n o l o g i c a l l y , i tc o m p l e t e l yi n t r o d u c e sac o n s t r u c t i o no fd i s a s t e r d a t a b a s es y s t e m i n a p p l i c a t i o n ,i th a s s o l v e dt h ep r o b l e m st h a tt r o u b l et h e d e v e l o p m e n to fj i a n g s um e t e o r o l o g i c a lb u r e a u a n d i tc a l lb eb e l i e v e dt h a tt h es t u d y o ft h ep a p e rw i l lg i v em a n yb e n e f i t st ot h ei m p r o v e m e n to ft h eo t h e rm e t e o r o l o g i c a l b u r e a u s k e y w o r d s :m e t e o r o l o g i c a ld i s a s t e r sd a t a b a s e ,d a t am i n i n g ,d e c i s i o nt r e e ,n e u r a l n e t w o r k ,m a t l a b u 学位论文独创性声明 本人郑重声明: 1 、坚持以“求实、创新刀的科学精神从事研究工作。 2 、本论文是我个人在导师指导下进行的研究工作和取得的研究 成果。 3 、本论文中除引文外,所有实验、数据和有关材料均是真实的。 4 、本论文中除引文和致谢的内容外,不包含其他人或其它机构 已经发表或撰写过的研究成果。 5 、其他同志对本研究所做的贡献均已在论文中作了声明并表示 了谢意。 作者签名:童4 监 日 期:迎2 - :矗: 学位论文使用授权声明 本人完全了解南京信息工程大学有关保留、使用学位论文的规 定,学校有权保留学位论文并向国家主管部门或其指定机构送交论 文的电子版和纸质版;有权将学位论文用于非赢利目的的少量复制 并允许论文进入学校图书馆被查阅;有权将学位论文的内容编入有 关数据库进行检索;有权将学位论文的标题和摘要汇编出版。保密 的学位论文在解密后适用本规定。 作者签名: 日期: 右班 知o ,6 p 一 关于学位论文使用授权的说明 本人完全了解南京信息工程大学有关保留、使用学位论文的规定,即:学校有权保留 送交论文的复印件,允许论文被查阅和借阅;学校可以公布论文的全部或部分内容,可以 采用影印、缩印或其他复制手段保存论文。 ( 保密的论文在解密后应遵循此规定) 作者签名:导师签名:= ;乏趁 e t 期:立! :至:芝 第一章前言 尽管数据挖掘技术已经有了很大的发展,并且应用子社会生产的各个方面,但是鉴于 气象灾害数据的特殊性,一直未能应用到气象灾害数据统计分析中。本文针对气象灾害数 据的特点,建立气象灾害数据库并把决策树分类方法和神经网络方法运用于气象灾害数据 挖掘,得出了丰富的决策信息,用于指导气象灾害数据分类和预测。下面就论文的研究背 景、研究意义以及论文的整体结构作一介绍。 1 1 研究背景 在数据库技术迅猛发展的今天,人们产生和收集各种类型数据的能力迅速提高,造成 数据的大量堆积。其中包括条码在商品中的广泛使用,商务、科学和行政事务的计算机化, 以及由文本和图像扫描平台到卫星遥感系统的数据收集工具的进步。此外,作为全球信息 系统的万维网的流行,更是将我们淹没在数据和信息的汪洋大海中。存储数据的爆炸性增 长激起了对新技术和自动工具的需求,以帮助我们将海量数据转换成信息和知识。尽管很 早就出现了简单的数据统计技术,能够对数据进行一定的分析,但这远远不够,我们需要 更为先进的智能数据分析工具对海量的数据信息进行更为深入的理解和分析。因此,在商 业领域和科学研究领域都迫切要求发展这样的技术,能够从如此海量的数据中抽取出非平 凡模式,找出数据变化的规律和数据之间的相互依存关系,使人们能够从宏观的高层次的 角度来审视数据,充分发掘数据的潜力,指导人们的行为,为决策和科学发展提供有力的 支持。于是,数据挖掘可由大量数据中,用非平凡的方法发现有用的知识,就成了一种自 然而迫切的社会需求。正是这种广泛的社会需求引起了人们的关注,导致了数据挖掘研究 的蓬勃开展和数据挖掘技术的不断进步。数据挖掘任务一般可以分为两类:描述和预测。描 述性挖掘刻画数据库中数据的一般特性:预测性挖掘是在当前数据上进行推断,以进行预 测。数据挖掘主要有以下功能:对概念和类进行描述:利用关联分析发现关联规则t 分类和预 测;聚类分析:孤立点分析;演变分析,描述行为随时间变化的对象的规律或趋势,并对其建 模型。 简单地说,数据挖掘是提取或“挖掘”知识。目前,数据挖掘可以从统计学,数据库 和机器学习等三个角度进行深入研究。数据挖掘过程可以与用户或知识库交互,将有趣的 模式提供给用户,或作为新的知识存放在知识库中。 1 2 研究现状 当今时代是飞速发展的信息时代。在各行各业中离不开信息处理,这正是计算机被 广泛应用于信息管理系统的环境。计算机的最大好处在于利用它能够进行信息管理。使 用计算机进行信息控制,不仅提高了工作效率,而且大大的提高了其安全性,尤其对于 复杂的信息管理,计算机能够充分发挥它的优越性。计算机进行信息管理与信息管理系 统的开发密切相关,系统的开发是系统管理的前提。本系统就是为了管理好气象数据信 息而设计的。 气象局作为一种信息资源的集散地,气象数据资料繁多,包含很多的信息数据的管 理,现今,有很多的气象单位基本是初步开始使用数据库管理系统,甚至有些还尚未使 用计算机进行信息管理。根据调查得知,他们以前对信息管理的主要方式是基于文本、 表格等纸介质的手工处理,对于大量数据查询情况的统计和核实等往往采用人工检查进 行。数据信息处理工作量大,容易出错:由于数据繁多,容易丢失,且不易查找。总的 来说,缺乏系统,规范的信息管理手段,资源闲置比较突出,这就是管理信息系统的开 发的基本环境。工作量大,出错率高,出错后不易更改。对气象数据进行人工管理,由 于信息比较多,气象数据的管理工作混乱而又复杂;内容记录在文件中,气象局的工作 人员和管理员也只是当时对它比较清楚,时间一长,如再要进行查询,就得在众多的资 料中翻阅、查找了,造成查询费时、费力。如要对很长时间以前的数据进行更改就更加 困难了。 事实上,气象数据库中含有丰富的数据和信息,是自然界和人类活动的共同产物, 专家系统所需的许多知识就隐含在这些数据和信息之中。所以,如果能将数据挖掘技术 用于气象数据库中自动生成专家系统所需的知识,无疑将会给知识获取问题的解决带来 无限生机。 1 3 研究目的及意义 目前气象部门对于气象灾情只是简单的分为了:一般性气象灾害,重大气象灾害和特 大气象灾害。倘若在对气象灾害分类的同时对灾情用数据挖掘中的决策树算法进行分类统 计,可以发现灾情与经济损失和人口受灾及农作物受灾都有着紧密的联系,其中有规可循。 气象灾害数据库中积累了大量的数据,这些数据的背后隐藏着许多重要的规律和知识。 面对海量数据,传统的查询或分析工具无法有效地识别出其中有价值的信息,从而形成了 “数据丰富而知识贫乏”的现象。 病虫害经济损失评估系统作为社会经济系统的一个子系统,在受外界因素影响和作用 的同时,对外部经济系统也具有一定的反作用,使其受到来自系统内外两方面因素的影响。 同时作为气象基础设施建设投资决策的基础,病虫害造成的损失不仅是农林牧降低产量的 2 问题,且与整个国民经济密切相关,所以它在国家和区域经济发展规划中具有十分重要的 地位。因此,病虫害农业损失预测成为经济发展研究中的一个重要问题,对其研究和分 析具有较强的实际意义。本文提出一种有效的数据挖掘系统,能较直观地反映气象灾害预测 规律。 1 4 研究内容和目标 微软公司的v i s u a lb a s i c 6 0 是一个功能强大、方便实用的程序开发环境,主要表现 在:风格多样的界面设计,面向对象的设计方法,较短的软件开发周期以及编程简单的 数据库操作能力。 根据气象数据库管理系统的特点和需求,考虑到系统开发的时间,并主要为满足气 象局原有系统的兼容性,本系统使用微软公司的v b 6 0 作为前台开发工具,微软公司的 s q ls e r v e r2 0 0 0 作为后台数据库。v b 前台通过a d o 技术和d a t ae n v i r o n m e n t 数据环境 来访问s q l 数据库。 数据挖掘用于气象数据库管理系统,可使该系统在以下几个方面得到较大的进展或 突破: ( 1 ) 使有限数据的气象数据库系统成为具有无限知识的气象数据库系统。尽管气象数据 中存储了大量的数据,但其容量总是有限的,总是对客观世界的不完全描述。而数据挖 掘利用机器学习技术,能从这些有限的数据库发现新的知识,将这些知识反作用于已有 的数据,就可得到更新的数据和知识,这样循环下去,气象数据库不仅是一个信息系统, 而且是一个数据源和知识源,也就使有限的气象数据库系统变成了无限的气象数据库系 统,也使静态的数据变成了动态的数据和知识。 ( 2 ) 可使气象数据库的数据精练。现有的气象数据库中存储了大量的数据。其中有些数 据是必需的,有些数据是冗余的,有些数据是最基本的,有些数据是可导出的。利用数 据挖掘,可以寻找出数据间的相互依赖性,得到数据间的层次和层次间的相互关系。因 而,数据库中就可只存储那些必需的数据和关系,而不必存储其它的数据,就可将气象 数据库进行精练。这样不仅可以节省存储空间,而且可以提高数据库的管理效率和整个 系统的运行速度。 ( 3 ) 可便于气象数据库的数据更新。现有的气象数据库中存储了描述客观世界的大量数 据,而客观世界在人类活动的影响下是时刻变化的,如何将这些变化在气象数据库中进 行快速地更新,也是一个十分棘手的问题。气象数据库的更新通常是利用新的航空或航 天遥感数据,但这时需要解决的问题是哪些数据需要更新。用d m 中的空间分析方法可以 解决此问题,它通过对不同时域的数据进行比较,得到事物随时间变化的规律,并找到 影响此变化的主要因子。这样,在以后的分析中,只要检查这些主要的因子是否变化, 若有变化,就进行数据更新,否则就不予考虑。 3 ( 4 ) 使气象数据库成为真正的“智能”空间信息系统。在气象数据库中引入专家系统技 术,使气象数据库具有了一定的自动性和智能性,但它远不能称为一个真正的“智能” 系统。因为它不具备自动学习的功能,只能利用已有的知识进行推导。可数据挖掘技术 的引入,使得气象数据库系统能自动地获取知识而可能成为真正的“智能”系统。完全 可以说,数据挖掘与气象数据库管理系统的结合,使气象数据库成为了一个空间咨询和 决策支持系统。 4 第二章数据挖掘概述 2 1 数据挖掘的概念 数据挖掘就是从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含 在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程,是通过仔细分析 大量数据来揭示有意义的新关系、趋势和模式的过程。其出现于2 0 世纪8 0 年代后期,是 数据库研究中一个很有应用价值的新领域,发现了的知识可以被用于信息管理、查询优 化、决策支持、过程控制等,还可用于数据自身的维护。因此数据挖掘是一个交叉的学 科领域,包括了数据库技术,统计学,机器学习,可视化和信息科学,是当今信息技术 学科最前沿的领域之一。 2 2 数据挖掘的任务 数据挖掘模型在本质上可分为预测模型与描述模型两类。预测型建模是基于使用其他 的历史数据,其能够完成的数据挖掘任务包括分类,回归,时间序列分析和预测。描述型 模型对数据中的模式或关系进行辨识,与预测型模型不同,其提供了一种探索被分析数据 的性质的方法,而不是预测新的性质,挖掘任务包括聚类,汇总,关联规则和序列发现。 【2 5 】 2 3 数据挖掘的系统结构 典型的数据挖掘系统如图2 1 所示,具有如下组成结构: ( 1 ) 数据库,数据仓库或其他信息库:这是一个或一组数据库,数据仓库,电子表格 或其他类型的信息库。可以在此数据集上进行数据清理和集成。 ( 2 )数据库或数据仓库服务器:根据用户的数据挖掘请求,数据库或数据仓库服务器 负责提取相关数据。 ( 3 ) 知识库:存放领域知识,用于指导搜索,或评估结果模式的兴趣度。这种知识可 能包括概念分层及用户确信度方面的知识。 ( 4 )数据挖掘引擎:数据挖掘的基本组成部分,由一组功能模块组成,用于特征化, 关联,分类,聚类分析以及演变或偏差分析。 ( 5 ) 模式评估模块:通常使用兴趣度来测试,并与数据挖掘模块交互,以便将搜索聚 焦在有趣的模式上。可以使用兴趣度阈值过滤所发现的模式。模式评估模块也可 以与挖掘模块集成在一起,其不同在于所用的数据挖掘方法的实现。但是,有效 5 的数据挖掘应将模式评估集成到数据挖掘的一定过程之中,从而可使搜索限制在 感兴趣的模式上。 ( 6 ) 图形用户界面:本模块在用户和数据挖掘系统之间通信,允许用户与系统交互, 指定数据挖掘查询或任务,提供信息,帮助搜索聚焦,根据数据挖掘的中间结果 进行探索式数据挖掘。此外,该模块还允许用户浏览数据库和数据仓库模式或数 据结构,评估挖掘的模式,以不同的形式对模式进行可视化。 数据清 图2 - i 典型的数据挖掘系统的结构 2 4 数据挖掘技术的主要方法 数据挖掘任务有很多实现方法,目前几种典型的数据挖掘研究方法是关联规则,分类, 聚类,w e b 挖掘和智能计算方法。 2 4 1 关联规则挖掘 关联规则挖掘是发现大量数据中项集之间有趣的关联或相关联系,是数据挖掘研究的 一个重要内容,是一种简单却很实用的分析规则。它经常被表达为如下形式的蕴含或规则 6 形式:x ? y ,可以解释为满足x 的数据库元组也很可能会满足y 。关联规则广泛用于交易数 据分析,通过分析结果来指导销售、目录设计及其它市场决策的制定,关联规则挖掘的一 个经典例子是购物篮分析。关联分析算法主要有a p r i o r i 、a p r i o r i t i d 、f p _ g r o w t h 等。 2 4 2 分类挖掘 数据挖掘的另一个重要应用是对大量数据的分类能力,又定义为挖掘分类规则。分类 问题也是机器学习,模式识别,专家系统,统计学和神经生物学的研究领域,并已开发出 许多相应的算法,如决策树方法,统计学方法,贝叶斯网络,神经网络,粗糙集,基于数 据库的方法及其它的分类方法等。 2 4 3 聚类挖掘 聚类与分类不同,对于聚类来说,需要划分的类是未知的,聚类将数据对象分组为多 个类或簇,使同一个簇中的对象之间的相似度最高,而不同簇中的对象其相似度最低。由 于大型数据库中存放了大量的数据,聚类分析已经成为数据挖掘研究领域一个非常活跃的 研究课题。常用的聚类方法有统计学方法,模式识别,机器学习和数据库的方法。 2 4 4w e b 挖掘 i n t e r n e t 上存储了许多复杂数据类型的数据,用户有充分的自由,可以随意链接到 i n t e r n e t 的任意站点上。大量存储的非结构化数据,网络搜索的性能,效率及最优的信息 获取( 即知识获取) 是影响i n t e r n e t 成功应用的瓶颈。在庞大的i n t e r n e t 信息资源上, 发现知识,进行数据挖掘是快速获取有用信息的一种有效方法。w e b 挖掘分为w e b 内容挖 掘,结构挖掘和用法挖掘。 2 4 5 智能计算方法 继人工智能之后,计算智能犹如异军突起,吸引着众多研究开发者投身于这一新领域 的开拓。尽管关于模糊逻辑,神经网络,进化程序设计的研究开发历史可以追溯到五六十 年代,但它们却在计算智能共识的启示下获得了新的内涵。所使用的计算智能方法大体上 包括神经计算,进化计算,免疫克隆计算和模糊计算与模糊推理。 7 第三章数据挖掘技术 3 1 决策树技术 决策树( d e c i s i o nt r e e ,d t ) 是一种用于分类,聚类和预测的预测型建模方法,采用 “分而治之”的方法将问题搜索空间分为若干子集,即采用自顶向下的递归方式从无次序、 无规则的样本数据集中推理出决策树表示形式,在内部节点进行属性值的比较并根据不同 的属性值判断从该节点向下的分支,在决策树的叶节点得到结论。决策树作为数据挖掘中的 核心技术之一,已在很多领域中得到广泛的应用。在求解分类问题的方法中,决策树是最有 用的一种方法。应用这种方法需要构建一棵树对分类过程进行建模。一旦建好了树,就可 以将其应用于数据库中的元组并得到分类结果。利用决策树进行分类易于理解并且高效, 同时由于树的规模独立于数据库规模,所以决策树对于大型数据库具有很好的扩展性。 大多数决策树算法都要面对下列问题: ( 1 ) 选择分裂属性:在构建决策树的过程中,哪个属性作为分裂属性会影响算法性能。有 一些属性作为分裂属性要优于其它属性。属性选择不仅涉及检验训练集中的数据,而且还 涉及从专家得到的输入。 ( 2 ) 分裂属性的次序:选择属性的次序也很重要,选择错误会增加不必要的比较。 ( 3 ) 分裂:与分裂属性的次序相应的是确定分裂的数目。有些属性的定义域比较小,所以 分裂的数目要根据定义域来确定。但是,如果定义域是连续的或者具有大量的值,则分裂 的数目就不容易确定。 ( 4 ) 树的结构:为了改进应用树进行分类的性能,总是希望得到具有最少层次的平衡树。 然而在这种情况下,需要与多路分枝进行更加复杂的比较,有一些算法智能产生二叉树。 ( 5 ) 停止准则:当训练数据被正确分类时,树的产生过程就应该停止。为了防止产生过大 的树,有时也希望提前停止。另外,提前停止还可以防止过拟合。在分类精度和性能之间 需要一个折中。甚至可以设想,如果己知在训练数据中有不可能被表达的数据分布,则可 以在树中建立更多的层次。 ( 6 ) 训练数据:产生的决策树的结构取决于训练数据。如果训练数据集太小,则产生的树 由于没有足够的特殊性,而不能很好地应用于更加通用的数据。如果训练数据集太大,则 产生的树可能发生过拟合。 ( 7 ) 剪枝:一棵树被构建之后,还需要对树进行修剪以提高在分类阶段树的性能。剪枝阶 段可能会删除过多的比较或者删去一些子树,以获得更好的性能。 下面介绍几种流行的决策树算法。 8 3 1 1i d 3 算法 i d 3 是基于信息熵的决策树分类算法,该算法是根据属性集的取值选择实例的类别,它 的核心是在决策树中各级结点上选择属性。用信息增益作为属性选择的标准,使得在每个非 叶子结点测试时,能获得关于被测试例子最大的类别信息。使用该属性将训练样本集分成子 集后,系统的熵值最小,期望该非叶结点到各个后代叶结点的平均路径最短,使生成的决策 树的平均深度较小,从而提高分类的速度和准确率。啷1 i d 3 算法的目标是通过一系列的划分,将训练集迭代地划分为多个子集,使得每个子集 中的对象尽量属于同一个类。算法的核心是构建决策树的过程,其中,树的非终端节点对应 着单个属性的测试,终端节点即叶节点对应的是数据集最终被分类后所得的子集。该算法的 效率就体现在对测试属性的选择上。 给定概率p z ,m ,p 。其中p i = 1 ,则熵的定义为: h ( p l p 2 ,p ,) = ( p t l o g ( 1 p t ) ) ( 1 ) 信息增益为: g a i n ( d ,s ) = h ( d ) 一p ( d i ) h ( d 1 ) ( 2 ) d 为样本集合,其中增益是指在分类进行正确分类所需要的信息与分类后进行正确分 类所需要的信息的差。 3 1 2c 4 5 算法 c 4 5 算法是i d 3 算法的后继。i d 3 算法采用信息增益作为分裂属性的度量标准,选择分 裂属性时倾向具有较多不同值的属性,因而可能导致决策树过分拟合。在极端情况下,如果 某个属性对于训练集中的每个元组都有唯一的一个数值,i d 3 算法则认为该属性是最好的分 裂属性,因为根据该属性划分之后的每个子集都只有一个样本,因此每个子集里面只有一个 类别。c 4 5 采用增益比率代替信息增益,样本集合d ,属性a 的增益比率g a i n r a t i o 被定义 为: g a i n r a t i o ( a ) = g a i n ( a ) s p l i t l n f o ( a ) ( 3 ) 其中g a i n ( a ) 为属性a 的信息增益,s p l i t i n f o ( a ) 为属性a 的分裂信息,如果属性a 由v 个不同的取值,把d 分为v 个子集,d j 为样本在属性a 上取值为a j 的子集,l d j l 为子集d j 中的 样本个数。属性a 的分裂信息定义为: s p l i t l n f o ( a ) = 一 ( i d j i l d i ) * l 0 9 2 ( i d j i i d i ) ( 4 ) 通过增益比率克服了信息增益偏袒取值较多的属性的缺陷。 9 3 1 3c a r t 算法 分类与回归树( c l a s s i f i c a t i o na n dr e g r e s s i o nt r e e s ,c a r t ) 是一种产生二叉决策 树的技术。与i d 3 一样,熵也被用来作为选择最佳分裂属性和标准的度量。但与i d 3 不同 的是,在每个子类产生子节点的地方,只产生两个子节点。分列是围绕如何确定最佳分裂 点进行的。在每一步,通过穷尽搜索来确定最佳分裂,其中“最佳”被定义为 o ( s t ) = 2 p l p r ip ( c jit l ) 一p ( c ilt r ) l ( 5 ) 这个公式用来评价当前结点t 和每个可能的分裂属性和标准s 。其中l 和r 是指树中当 前结点的左子树和右子树。p 。和p e 分别指在训练集中的一个元组在树的左边和右边的概率, 具体定义为p l = 左子树的元组数训练集中的元组数,右分支的定义与此类似。p ( c jit l ) 和 p ( c ji t 。) 分别指在左子树和右子树中的一个元组属于类别c j 的概率,定义为在子树中属于 j 类的元组数在目标结点处的元组数。在每一步中,仅从所有可能的标准中选择一个作为最 佳标准。唧1 3 2 神经网络技术 人工神经网络( a r t i f i c i a ln e u t r a ln e t w o r k s ,a n n ) 是由大量简单的基本元件一神经 元相互连接,通过模拟人的大脑神经处理信息的方式,进行信息并行处理和非线性转换的 复杂网络系统。由于神经网络具有强大的学习功能,可以比较轻松地实现非线性映射过程, 并且具有大规模计算的能力。因此,它在自动化,计算机和人工智能领域都有着广泛的适 用性,实际上也确实得到了大量的应用,解决了很多利用传统方法难以解决的问题。 3 2 1 神经网络模型 神经网络是由大量的处理单元( 神经元) 互相连接而成的网络。为了模拟大脑的基本 特性,在神经科学研究的基础上。提出了神经网络模型。但是,实际上神经网络并没有完 全反映大脑的功能,只是对生物神经网络进行了某种抽象,简化和模拟。神经网络的信息 处理通过神经元的相互作用来实现,知识与信息的存储表现为网络元件互连分布式的物理 联系。神经网络的学习和识别取决于各神经元连接权系数的动态演化过程。 ( 1 ) 生物神经元 神经元模型是基于生物神经元的特点提出的。人脑由大量的生物神经元组成,数量级 为l o l 2 ,神经元之间互相有连接,从而构成一个庞大而复杂的神经元网络。 神经元是大脑处理信息的基本单元,结构如图3 1 所示。神经元主要由3 部分组成: 细胞体,树突和突触( 也叫神经键) 。 细胞核,细胞质和细胞膜组成细胞体。细胞体的作用是接受和处理信息。树突是细胞 1 0 体向外延伸的纤维体,它是神经元接受其他神经元信息的通道。神经元的信息输出通道是 轴突,神经末梢是神经元信息的输出端,用于输出神经元的动作脉冲。 图3 - 1 生物神经元 ( 2 ) 神经元结构模型 生物神经元传递信息的过程,可以看出神经元一般表现为一个多输入,单输出的非 线性器件,通用的结构模型如图3 2 所示。 x 3 x 1 x 5s j y i 图3 - 2 神经元结构模型 神经元模型常用一阶微分方程来描述,它可以模拟生物神经网络突触膜电位随时间变 化的规律。 神经元的输出由函数f 表示,一般利用以下函数表达式来表现网络的非线性特征。 阈值型,为阶跃函数: f ( u i ) 2 i( 6 ) 一 l0u l 0 线性型: l 厂1 u l 孔 f ( u i ) 。 j a u _ i + bu i o u 2 ( 7 ) 一 i 取消 i 帮助 i 图6 - 1 4 憾飘一雌蝴 查龉自瞰 凰 辫 。 兰塑皇些婴i 堑璺i! 塑| 1 i 玻诮i 帮助i 图6 1 9 一一一一 卧热黥黜咖黼。 查诲酮i ) f d 日咖l $ = 、9 口、t = l = r 黼房屋_ l ,s $ 士色点, 、 嚣 l “e , 皑* a 口g i o 黔 m 语铺效- 。盎匹面i 墼l , i 查谭生疏回一1 分岢越i l - _ q 宽吼卜、善 、 : , ,_ 、,二。 - 矗i & f l a g = t r u e e n d i f i fc o m b 0 4 t e x t t h e n i ff l a g = t r u et h e n t m p = t m p ”a n d e n di f i fc o m b 0 6 t e x t = t h e nc o m b 0 6 t e x t = 0 i = c o m b 0 6 t e x t 牛1 0 0 + c o m b 0 4 t e x t 事1 0 0 0 0 i m p = t m p ”结束日期 ”i ” f l a g = t r u e e n di f i fc o m b 0 8 t e x t ”t h e n i ff l a g = t r u et h e n t m p = t m p ”a n d 。 e n d i f i m p = t m p 县= c o m b 0 8 t e x t & ”。 4 7 f l a g = t r u e e n di f a d o d c l r e c o r d s e t f i l t e r = t m p e n di f c o m b 0 1 t e x t = 。 c o m b 0 2 t e x t = c o m b 0 3 t e x t = 。 c o m b 0 4 t e x t = 。 c o m b 0 5 t e x t = 。 c o m b 0 6 t e x t = c o m b 0 8 t e x t = t m p = e n ds u b ( 3 ) 添加部分主代码: p r i v a t es u bc o m m a n d l _ c l i c k ( ) a d o d c l 。r e f r e s h a d o d c l r e c o r d s e t a d d n e w i ft e x t l t e x t = t h e n a d o d c l r e c o r d s e t f i e l d s ( 灾害类别”) = 1 1 e 1 s e a d o d c l r e c o r d s e t f i e l d s ( 灾害类别4 ) = t e x t l t e x t e n di f ( 4 ) 绘制图表( 柱状图和曲线圈) 部分主代
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 缝纫品整型工安全文化能力考核试卷含答案
- 重冶浸出工岗中协同综合考核试卷含答案
- 水工闸门运行工核心管理知识考核试卷含答案
- 幼儿园食堂从业人员食品安全培训制度
- 【2026年度】乡村学校德育工作经验总结课件-德育工作的精细化管理
- 智能传感器安装安全交底
- 检验科(实验室)消毒液配制与使用记录
- 护理咬伤查房
- 消防支队灭火救援指挥岗位任职资格考试题及答案
- 2026年工业互联网APP开发指南
- 蓄热式热力焚化炉阀门切换时序检查作业指导书
- 社会工作者礼仪基础培训社工培训讲座课件
- 信息系统适配验证师创新方法测试考核试卷含答案
- 2026年上半年教师资格证考试信息技术学科真题及解析附答案
- 世界十大最著名建筑师惊艳绝伦的经典作品
- 隐翅虫皮炎防控科普
- 模拟政协提案范文
- 涉氨考试题(ABC及答案)
- 水果安全问题课件
- 设备点检制度规范
- 数据库原理与应用快速入门 课件 第4章 查询数据
评论
0/150
提交评论