(基础数学专业论文)id3算法的模糊扩展研究.pdf_第1页
(基础数学专业论文)id3算法的模糊扩展研究.pdf_第2页
(基础数学专业论文)id3算法的模糊扩展研究.pdf_第3页
(基础数学专业论文)id3算法的模糊扩展研究.pdf_第4页
(基础数学专业论文)id3算法的模糊扩展研究.pdf_第5页
已阅读5页,还剩38页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要摘要决策树算法是对一组已知示例进行归纳学习,并生成一棵决策树的方法。该算法已被广泛的应用于自动知识获取领域。i d 3 算法是一种舆型的决策树归纳算法,这种算法在假定示例的属性值和分类值是确定的前提下,使用信息熵作为启发式建立一棵清晰的决策树。随着示例模糊表示的出现,清晰的决策树已不能满足不精确知识获取的嚣要。模糊决策树归纳是从具有模糊表示的示例中学习模糊规则的一种重要方法,从符号值属性类分明的数据中提取规贝g 可视为模糊决策树归纳的一种特殊情况。模糊决策树算法是清晰决策树算法的一种扩展。由于构建最优的模糊决策树是n p h a r d ,因此,针对启发式算法的研究是非常必要的。本文主要是对经典的决策树启发式算法一i d 3 算法进行分析研究,在示例模糊表示的基础之上,将其进行扩展成为模糊i d 3算法,并与其它的决策树归纳算法进行比较。i d 3 算法原有的模糊扩展可视为本文的一个特例。通过实验与理论分析,发现本文的模糊i d 3 算法应用于符号值属性类分明的数据库时从训练准确度、测试准确度和树的规模等方面都要优予其它的模糊扩展例妻口m i n a m b i g u i t y 算法。关键词机器学习;归纳学习;模糊表示;模糊决策树归纳a b s t r a c ta b s t r a c td e c i s i o nt r e ei n d u c t i o nh a sb e e na p p l i e dt ot h ea r e ao fa u t o m a t i ck n o w l e d g ea c q u i s i t i o n ,w h i c hi sl e a r n e df r o mas e to fc a s e st og e n e r a t ed e c i s i o nt r e e s i d 3i st h et y p i c a ld e c i s i o nt r e ei n d u c t i o na l g o r i t h m i tu s e st h ei n f o r m a t i o ne n t r o p ya sh e u r i s t i ct ob u i l dac r i s pd e c i s i o nt r e e ,w h i c hi sb a s e do na s s u m p t i o nt h a tt h ea t t r i b u t e sv a l u e sa n dc l a s s i f i c a t i o na r ec r i s pa 1 1 b u t ,f u z z yd e c i s i o nt r e ei n d u c t i o ni sa ni m p o r t a n tw a yf o rl e a r n i n gf r o me x a m p l e sw i t hf u z z yr e p r e s e n t a t i o n i ti sas p e c i a lc a s eo ff u z z yd e c i s i o nt r e ei n d u c t i o ne x t r a c t i n gr u l e sf r o mt h ed a t a - w h i c hh a v es y m b o lf e a t u r e sa n dc r i s pc l a s s e s b e c a u s eb u i l d i n go p t i m a lf u z z yd e c i s i o nt r e e si sn p h a r d ,i ti sn e c e s s a r yt os t u d yt h eh e u r i s t i c s i nt h i st h e s i s ,w em a i n l yr e s e a r c ho ni d 3a l g o r i t h ma n de x t e n di tt of u z z yi d 3b a s e do nt h ef u z z yr e p r e s e n t a t i o no fe x a m p l e s t h e nw ec o m p a r ef u z z yi d 3w i t ho t h e rf u z z yd e c i s i o nt r e eg e n e r a t i o na l g o r i t h m s t h ea l r e a d ye x i s t i n gf u z z ye x t e n s i o no fi i ) 3a l g o r i t h mc a nb er e g a r d e da sas p e c i a lc a s eo ft h i st h e s i s b o t ht h et h e o r e t i c a la n a l y s i sa n dt h ee x p e r i m e n t a lc o m p a r i s o ns h o wt h a tt h ef u z z yi d 3a l g o r i t h mg i v e ni nt h i st h e s i si sb e t t e rt h a nt h ee x i s t i n gf u z z yd e c i s i o nt r e eg e n e r a t i o na l g o r i t h m ss u c ha sm i n a m b i g u i t ya l g o r i t h mi nt h ea s p e c t so ft r a i n i n ga c c u r a c y , t e s t i n ga c c u r a c ya n dt r e es i z e k e y w o r d sm a c h i n el e a r n i n g ;i n d u c t i v el e a r n i n g ;f u z z yr e p r e s e n t a t i o nf u z z yd e c i s i o nt r e ei n d u c t i o ni i河北大学学位论文原创性声明本人郑重声明:所呈交的学位论文,是本人在导师指导下进行的研究工作及取得的研究成果。尽我所知,除了文中特另, j :o i l 以标注和致谢的地方外,论文中不包含其他人已经发表或撰写的研究成果,也不包含为获得河北大学或其他教育机构的学位或证书所使用过的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说明并表示了致谢。作者签名:主丝学位论文使用授权声明本人完全了解河北大学有关保留、使用学位论文的规定,即:学校有权保留并向国家有关部门或机构送交论文的复印件和电子版,允许论文被查阅和借阅。学校可以公布论文的全部或部分内容,可以采用影印、缩印或其他复制手段保存论文。本学位论文属于1 、保密口,在年月日解密后适用本授权声明。2 、不保密口。( 请在以上相应方格内打“4 ”)作者签名:森我1日期:巫上月l 日日期:2 唑年丘月l 臼第1 章绪论_ ii i ii i i i _ -l 。1 机器学习简要回顾第1 章绪论机器学习是人工智能的一个研究领域,它研究如何让机器具有学习能力。机器学习的核心是“学习”,它通常被认为是提高机器智能的最本质途径。学习是一个有特定目的知识获取过程,其内在行为是获取知识,积累经验。发现规律;外在表现是改进性能,适应环境,实现系统的自我完善。机器学习的发展就其研究目标和研究方法来划分为如下三个阶段:( 1 ) 神经元模型的研究。这一阶段始于5 0 年代中期,其主要研究工作是研制可适应环境的自组织学习系统。此期间代表性工作为1 9 5 8 年er o s e n b l a t t 提出的感知机模型,它试图模拟人脑的感知与学习能力【l l 。这一时期最有影响的成果是s a m u e l 的下跳棋程序1 2 1 ,该程序通过学习能够达到大师级水平。然而,自从1 9 6 9 年m i n s k i 和p a p e r t 揭示感知机的严重局限性【3 1 以后,神经元的人工模拟研究受到严重挫折而转入低潮。这一阶段的工作,还有f r i e d b e r g 等人的模拟随机突变和自然选择过程的程序”】,h u n t 的决策树归纳程序c l s 等早期符号学习1 6 8 】。( 2 ) 符号学习的研究。这一阶段始于7 0 年代初期。当时专家系统的研究已取得了成功,迫切需要解决获取知识这一难题,主要目标是模拟人的概念学习过程。这个阶段是机器学习发展的困难时期,很多人不知道它与线性感知器的区别,对m a c h i n el e a r n i n g一词不大理解,甚至不知道这一名词是向机器学习还是让机器学会学习掣9 1 。但这一时期,s i m o n 曾提出了一个学习的双空间模型,把机器学习的过程描述灼非常透彻,易于理解( 图4 - 1 ) 。这个阶段的代表工作有w i n s t o n 的结构学习系统【1 0 _ l ,该系统能够从例子中学习积木世界的结构;m i c h a l s k i 的a q l l t l 2 1 ,a q l l 产生的大豆疾病诊断系统的诊断正确率甚至超过大豆病理专家的水平,在当时引起很大反殉;q u i n l a n 的决策树归纳程序i d 3 t 1 3 l ,用来学习国际象棋规则获得很大成功。这些学习系统虽然取得很大成功,但大部分都处于理论研究和建立实验模型阶段。( 3 ) 多概念学习研究。从7 0 年代后期开始各种各样的学习系统相继出现,进入了机1 河北大学理学硕士学位论文一ii _器学习研究的高潮阶段。这一阶段,机器学习的研究领域从学习单个概念扩展到学习多个概念以及各种各样的学习方法上。讲授学习、观察与发现学 - jr ”l 、分析学习【1 6 1 等方法都相继建立起来。学习过程一般都建立在大规模知识库上。学习系统已和各种应用系统紧密结合起来,在实际应用中发挥了重要作用 1 7 q 8 l 。其它学科的研究者也都对机器学习这一新兴学科产生了浓厚的兴趣,使机器学习领域不断扩大,许多人工智能的重要会议都设有机器学习分会场,有关机器学习的研究论文和成果报告发表于各种计算机杂志及相关领域的杂志中,如1 9 8 0 年著名的国际杂志i n t e r n a t i o n a lj o u r n a lo f p o l i c y a n a l y s i sa n dh a f o r m a t i o ns y s t e m s 连续三版刊登了第一届机器学习讨论会的论文;1 9 8 3 以来,一些机器学习的专著相继出版如m a c h i n el e a r n i n g :a r t i f i c i a li n t e l l i g e n c ea p p r o a c h1 1 9 ,f o u n d a t i o no f k n o w l e d g ea c q u i s i t i o n :m a c h i n el e a r n i n g 【2 。1 ,国内出版的许多人工智能方面的书也都将机器学习作为其中的一个重要章节 2 1 - 2 4 1 。1 9 8 6 创刊了第一个机器学习专业杂志m a c h i n e l e a r n i n g ,每年出刊四期,为机器学习的研究交流发挥了重要作用。自8 0 年代后期以来,各种学习算法均得到极大发展,理论与应用研究也有新的突破,在归纳学习方面的发展尤其突出显著。q u i n l a n 在其i d 3 系统中使用了信息熵,从而使决策树归纳得到很大的改进;吴信东的改进算法h c v t 2 5 1 引起了普遍的关注。l a n g l e y 等的科学发现系统b a c o n t 26 1 、m i e h a l s k i 的概念聚类系统c l u s t e r 2 2 7 1 开辟了无导师学习的两个重要领域;此外,知识发现研究近年来得到飞速的发展1 2 8 - 3 1 1 。计算机硬件的突飞猛进的发展,使神经网络的硬件实现成为现实,并在声音识别、图象处理等诸多领域获得很大成功1 3 2 - 3 8 】。美国学者v a l i a n t 提出基于概率近似正确性的学习理论【3 9 】,在学习的计算理论研究方面产生了重要影响【4 3 1 。应用研究成为机器学习的焦点。例如,a q l 5 已经达到实用化,并成功地应用于三种疾病的诊断【1 4 1 ;扩张矩阵a e 类规则学 - - j 算法应用于模式识别领域4 4 。9 1 ;1 1 3 3 的应用越来越广泛 4 8 - 4 9 。最近几年,将遗传算法、人工神经网络与机器学习相结合的系统也不断出现。应特别注意的是存在于人脑中的认识上的模糊性也开始被吸收进了学习过程中,使得学习方法的研究出现了迅猛发展的形式。1 2 归纳学习的知识背景自从人工智能成为一个独立的学科以来。机器学习已经成为该领域的中心研究课题。学习能力是智能的一个必要的组成部分它已经成为智能计算机系统的一个主要特征。t , m i t c h e l l 在他的书中3 为机器学习作了如下的定义:机器学习是通过测试属于某一类的任务的性能,从而改进计算机程序的研究。机器学习是研究如何使用机器来模拟人类学习活动的- - f l 学科,它的目的是能够使计算机系统学会创建新的知识,更新现有的知识并且提高他们的性能,以避免干扰和重复编程。整个学习系统就是为了确定来自于一个概念例子集合以及其背景知识的特定概念的描述。这里概念通常是指定义在一个较大的论域集合上的对象的予集,或者是定义于此集合上的一个布尔值函数e s i ,任何研究智能现象的工作必须包含对学习的理解,进一步说,学习能力为构建高性能系统提供了潜在的( 必要的) 方法论。机器学习是使计算机具有智能的根本途径它可以完成自动获取新的示例及产生新的推理算法。在机器学习领域,一个学习过程本质上是学习系统把导师( 或专家) 提供的信息转换成能被系统理解并应用的形式。目前,最为流行的机器学习范例有三种,包括归纳学习,近似推理阻及基于解释的学习。近似推理包括学习新概念或通过使用相似概念和它们的解决方案来提取新的方法。例如g r e i n e r 的n l a g 系统”2 1 接受一个不完整领域理论的输入,根据已有的类似推理摊断出新的解决方案。基于案例推理( c b r ) 是近似推理的一种形式,最近被专家系统开发者们深入研究。在基于解释的学习中,通过解释为什么所给定事例是将要学习的概念的一个例子,便可以从一个简单的训练例子得到所要学习的知识。基于解释的学习的详细介绍可参见 53 。归纳学习是研究擐广的一种符号学习方法,它是从许多的某一概念的正例子和负例子中学习概念。换言之,在进行归纳学习时。学习者从所提供的事实或观察到的假设进行归纳推理,获得某个概念( 一个知识结构) 用来解释或预测待定事件的行为可用例子集含被分为学习集( 训练集) 和测试集。训练集和测试集包含有序对 ( z ,c ) ,其中- x子集合被分为学习集( 训练集) 和测试集。训练集和测试集包含有序对 ( z ,c ) ,其中- z河北大学理学硕士学位论文- i ii,i i i i ii _ _ _是属性空间爿里的事例向量,c 表示事例所属类别。属性空间包括用于描述将被分类的对象的属性集合。这些属性通过它们的属性值来描述对象。训练集是学习系统的输入,用来抽取知识。然后再使用测试集来测试系统的准确度和性能。归纳学习系统的输出通常是分类或是决策规则。分类或者决策规则d ( 功是一个函数,它将x 中的每一个x 映射到分类的集合c 中的一些c 。通常,分类规则将一个事例映射到一个概率分布( 月,只,只) ,其中异是向量x 属于类i 的概率。归纳学习技术包括决策树技术( q u i n l a n 的i d 3 5 们,b r c i m a ne ta 1 的c a r t t 55 1 ,c e s m i k的a s s i s t a n t 5 6 1 ) ,译文空间搜索( m i t c h e l l 的候选删除算法啪1 ,c l a r k 和n i b l e t t 的c n 2 啪1 ) ,概念聚类技术( m i e h a l s k i 的c l u s t e r 2 t 5 9 1 ) 。进化方法( f o r s y t h 的b e a g l e鲫,g o l d b e r g1 6 1 1 jh o l l a n d 呲1 ) ,以及连接方法。归纳学习成功的应用包括预测零售连锁店的销售额的工具,帐目清单的管理以及保险业的规则学习和自动对讲机的特征识别。归纳推理是个从部分到全体,从特殊到一般的推理过程。从应用角度看,归纳学习可分为概念学习、概念聚集和启发式学习3 种。决策树归纳是归纳学习的一种主要方法。构建决策树的过程就是使用某种启发式算法从候选属性中选取扩展属性,对整个假设空间迸行完全搜索自顶向下构建决策树,从而获取知识的过程。决策树把数据集的输入空间( 又称为特征或属性空间) 划分成互斥区域,每个区域赋予一个标识,一个值或者一个表示该区域内数据点特色的动作。决策树机理透明,便于我们按照树结构解释如何做出一个决策。因此,决策树的方法已广泛应用于机器学习、专家系统、和多变量分析;它是把样本数据划分为决策规则集最有发展的技术。1 3 决策树算法规则并不是表示有关以分类为目的的概念的属性值信息的唯一方法,决策树也是构建这种信息的可选方法之一,并且已有了许多根据数据构建决策树的有效算法。在过去3 0 年里,学习系统的家族体系已经逐渐出现,例如,c l s ( h u n te t a l ,1 9 9 6 ) ,i d 3 ( q u i n l a n ,1 9 7 9 ) ,a c l s ( p a t e r s o na n dn i b c r t t ,1 9 8 2 ) ,a s s i s t a n t ( k o n o n e n k oe ta 1 ,1 9 8 4 ) 以及i n d( b u n t i n e ,1 9 9 0 ) a c l s ( i d 3 的概括) 已经出现了许多商业版本第1 苹绪论决策树是一种离散函数的计算模型【6 3 1 。这种模型表示一种逐步计算过程,在计算的每一步要确定一个变量的值根据这次确定的值决定下一次的选取。这种计算模型提出了一种构造决策树的一般方法即决策树自上而下归纳算法( t d i d t a l g o r i t h m ) 。决策树表示一种特定的方法能够将数据集中的数据划分进不同的类。树的根节点包含将要被分类的所有的数据,叶子则表示分类以后最终的类。中间节点表示选择点或是数据属性的测试点,以便于在那一节点进一步分割数据。因此,q u i n l a n ( 1 9 9 3 ) 定义决策树的结构为:8 ) 叶子节点,表示一个类;b ) 决策节点,指定对单个属性值所要执行的测试。决策树的另一种形式是每个节点表示将被分类的对象的属性,而分支则对应这些属性的可选值。如图1 一l 所示。圈1 1图1 一l 的树中天气属性o u t l o o k ,h u m i d i t y 和w i n d y 作为非终端节点。叶子上由两类p 或n 作为标志。我们可以将p 类看作是正例子的类,n 类看作是负例子的类。例如,p 可能代表“户外活动”,而n 则表示“不活动”或者“户内活动”。尽管决策树是一种与产生规则明显不同的表示形式,但是我们也可以将它看作一种规则:即决定任何一个对象是属于p 类还是n 类的分类规则。因此,可以直接地将圈1一l 中的决策树转换成这样的规则集。使用决策树而不是规则是因为从训练集中提取决策树的算法相对简单并能将未知事例正确分类。i d 3 算法执行这一任务从概念上说是很简单的。它的计算效率也很高,构建决策树的时间只是随问题的大小线性的变化。表1 1 中是用于归纳产生图1 1 中决策树的训练集合。可以注意到属性t e m p e r a t u r e 并没河北大学理学硕士学位论文一i _ _ _ - _有在树中出现,可见它对于分类事例并不必要。属性分类编号o u t l o o kt e m p e r a t u r eh u m i d i t yw i n d yls u n n yh o th i 窖hf a l s en2s u n n yh o th i g hm m fn3o v e r c a s th o th i g hf “s ep4r a i n,m i l dh i g hf a l s ep5r a i nc o o ln o r t r l a lf a i s ep6r a i nc e e ln o r m a lt r u en7o v e r c a s tc e e ln o r m a l1 m ep8s u n n ym i l dh i g hf a i s en9s u n n yc o o ln o l i n a lf a l s ep1 0r a i nm i l dn o r m a lf a l s epl ls u n n ym l i dn o r m a lt m ep1 2o v e r e a s tm i l dh i g h1 h ep1 3o v e r c a s th o tn o r l i l a lf a l s ep1 4r a i nm i l dh i g ht n i en第2 章模糊集概述2 1 模糊集合的基本概念第2 章模糊集概述经典集合是现代数学最基本的概念之一,它不仅自身已成为一门独立的数学分支,而且集合的概念已广泛渗透到数学的各个领域。下面考察几组对象:所有不大于5 的自然数;所有身高1 6 5 以上的人;某地区所有的食品商店;( 1 ) 1 0 以内所有近似于5 的自然数;( 2 ) 所有高个子的人;( 3 ) 某地区所有效益好的食品商店比较上述几组对象,前三组是经典集合。集合中的元素是确定的,即元素与集合之间的关系只有“属于”或“不属于”两种。二者必居其一,而且只居其一。而对于后三组,显然并非是经典集合。哪些自然数属于“近似于5 的自然数”;哪些人属于“高个子的人”:哪些商店属于“效益好的食品商店”,这些都难以说清楚,即元素与集合之间的关系不再是“属于”或“不属于”这种绝对情形。究其原因,关键在于像“近似于5 ”、“高个子”、以及“效益好”这些概念,并非是清晰明确的。诸如上述这些概念,我们称之为“模糊概念”;这些模糊概念所反映的现象,称之为“模糊现象”。一般说来,模糊集合是对模糊现象或模糊概念的刻划。所谓模糊现象就是没有严格的界限划分而使得难用精确的尺度刻划的现象,而反映模糊现象的概念称之为模糊概念。例如“高个子的人”。我们既不能认为身高1 6 5 的人是“高个子”,也不能认为身高1 9 5 的入是“高个子”,因为“高个子”是没有严格界限划分的,因而很难只根据身高( 即精确的尺度) 断然认定某个人是或不是“高个子”。事实上,模糊现象( 模糊概念) 处处存在于我们的周围。例如,“拂晓”,天气“很河北大学理学硕士学位论文l _ _ - _ l _ _ _ - - _ _ _ _ _ ii一i _ _ _冷“,空中降着“大雪”,行人穿着“厚棉衣”商场人“非常少”,“老人”坐在“温暖”的房间里,“青年人”喝着“热茶”等等。其中“拂晓”、“很冷”、“大雪? 、“厚棉衣”、“非常少”、“老人”、“温暖”、“青年人”、“热茶”,都是一些模糊现象( 模糊概念) 。经典数学很难对上述这些模糊现象( 模糊概念) 进行处理,但是1 9 6 5 年,美国加利福尼亚大学自动控制教授扎德( l a z a d e h ) 首次提出了“模糊集合”,从而实现了对模糊现象( 模糊概念) 进行有效的的定量描述,标志着模糊数学的诞生。模糊数学是以模糊集合为基础,对模糊现象( 模糊概念) 进行研究和处理的一门学科。目前其应用已涉及到国民经济的各个领域及部门,并且在经济管理、自动控制、系统分析、知识描述、图象识别、医学诊断等不确定、非线性系统决策方面有了明显的实际效果。例如,现代人工智能研究的一个领域就是如何使机器像人脑那样分析和处理模糊性问题:不妨举一个形象的例子。一天,我们在路上行走,远处走来一个人。尽管与那人相距一段较远的距离,一般情形下,我们仍然可以判断此人是否为自己熟悉的人。其实。我们对此人只掌握一些模糊信息,例如走路姿势、速度( 快慢) ,年龄大小( 老或年轻) ,体型( 瘦弱、中等、肥胖) 等等。这说明人脑具有分析和处理模糊信息的能力。模糊数学的诞生,搭起了人与机器之间的桥梁,使机器的智能化成了一种可能。模糊数学是具有强大生命力的学科,相信其在2 l 世纪会有更大的进展。模糊集合是对模糊现象或模糊概念的刻划,那末它是如何刻划呢? 这是本节研究的一个重要闻题。我们知道经典集合有多种表达方式,例如,列举法、描述法等等。其中特征函数法是其中的一种表达方式。设a 为论域u 中的一个子集,即a c _ u ,u e u 。则集合a 的特征函数可表示为r1u e a( u ) = l0u 芒a由于元素u 与集合a 的关系只有u e a 、“萑彳两种情形,则特征函数取值只为0 与1 ,即值域为 0 ,1 另外,特征函数有下述三个运算性质:( 1 ) 加( x ) = 1 - 加( x ) ,其中j 是a 的补集。( 2 ) z 。8 ( x ) 。m a x ( z 月( x ) ,z 日( x ) )8 第2 章模糊集概述1 i i i i ii i i i i i _( 3 ) z 口( x ) = m i n ( 以( x ) ,舶( x ) )仿照用特征函数表示经典集合的方法,扎德提出用隶属函数表示模糊集合,即把特征函数的值域由 0 ,l 扩大到 o ,1 。定义如下:定义2 1 给定论域u ,a 是论域【,到 o ,1 的一个映射,即a ;_ 0 ,1 u _ a ( 曲则称a 是上的模糊集,a ( ) 称为模糊集彳的隶属函数a ( 称为c ,对彳的隶属度。在不混淆的情况下模糊子集也称为模糊集合。此后为讨论方便,经典集合用月,局a 等表示;而模糊集合用一,b c ,等表示。例2 。l 设“表示“青年人集合”,其隶属函数如下一r 学2 三:相应曲线如图1 1图2 - 1按上式计算一( 2 0 ) = = o 5 ,一( 3 5 ) = 0 2 ,故可认为2 0 岁的人属于青年人的程度为0 5 ,3 5 岁的入属于青年入的程度为0 2 。显然这种表述方式比经典集合更合乎实际。注意:1 ) a ( “) 的值越接近于1 ,表示u 属于一的程度越高 当一( = 1 时,表示u完全属于a 。a ( “) 的值越接近于0 ,表示u 属于爿的程度越低;当爿( = 0 时,表示u完全不属于么。若对于任一材u 都有爿( 炉l 或a ( 炉o ,则模糊集合么退化为清晰集。由此可表明经典集合是模糊集合的特例,模糊集合是经典集合的推广。2 ) 模糊集合完全由其隶属函数来描述。正由于隶属函数的引入,才使我们有可能利用糟确的数学方法去分析和处理模糊信息。模糊集合通常的表达方式有以下几种。当论域,为有限集合时,即【,_ “j ,u 2 ,如 ,有如下三种方式扎德表示法,即o 河北大学理学硕士学位论文_ i i i i ii ii - _ _ - - _ _ _ - _ i - - _ _ _ _ _ _ l _ - _ _ _ _ l _ _ i - - _ - l _ _ _ _爿;盟+ 盟+ + 绁“lu 2”月其中右端并非分式求和,只是一个记号。盟表示论域u 中的元素玑与其隶属度u ta ( 嘶) 之间的对应关系。此外隶属度为0 的项可以略去不写。例2 2 设论域u = f 1 , 2 3 。1 0 ) 。讨论“大”、“小”这两个模糊概念。根据经验。我们定量地给出它们的隶属函数,模糊集“大”、“小”分别表示为0 2 0 4 0 50 70 911a = 一十十一+ 一+ 一+ + 一4567891 0。10 90 60 40 20 1岸= 一+ 一+ 一+ 一+ + 123456由上式可知a ( 4 ) = o 2 ,b ( 4 ) = o 4 ,这说明4 属于“大”的程度小于4 属于“小”的程度。但不能说4 属于曰,不属于一。序偶表示法a = ( ,a ( u i ) ) ,( “2 ,a ( u 2 ) ) ,( ”。,a ( u 。) ) )采用此法,例2 2 中的j 、否可分别写成4 = ( 4 ,0 。2 ) ,( 5 ,0 4 ) ,( 6 ,0 。5 ) ,( 7 ,0 7 ) ,( 8 ,0 9 ) ,( 9 ,1 ) ,( 1 0 ,1 ) b = ( 1 ,1 ) ,( 2 ,0 9 ) ,( 3 ,0 6 ) ,( 4 ,0 4 ) ,( 5 ,0 _ 2 ) ,( 6 ,0 1 ) )向量表示法a = ( a ( u l ,a ( u 2 ) ,a ( u 。) )注意。此时隶属度为0 的项不能略去。例2 2 中的彳、茸, - - f 表示如下a 一 o ,0 。0 。0 2 ,0 4 ,0 5 , 0 7 。0 9 ,1 ,1 )b = ( 1 ,0 9 ,0 6 ,0 4 ,0 2 ,0 1 0 ,0 ,0 ,o )有时也将上述三种方式综合起来表示。a = ( 4 “1 ) u l ,a ( u 2 ) u 2 ,。,a ( u 。) u 。)当论域u 为无限集时,扎德给出其表达方式如下彳:ia ( u - - - 2第2 章模糊集概述r o l li i i ii_-这里的“j ”只是一种记号,表示无限多元素合并的一种缩写。例如“青年人”此模糊集合彳可表示为一= 鼬x + 成1 0 0 【1 + ( 华2 】_ l x今后,论域u 上的全体子集所构成的集合记为段;全体模糊子集所构成集合记为f 0 - 0 。显然以以l 口。2 2 模糊环境下的示例学习模糊集理论是研究和处理模糊性现象的理论。所谓模糊性主要指客观事物的差异在中间过渡对所呈现的“亦此亦彼”性。对立的事物似乎是“非此即彼”的,但绝对的突变是不存在的。在自然和社会现象中,差异往往要通过一个中介过渡的形式。处于中介过渡的差异便具有“亦此亦彼”的性质。例如高个子与矮个子、稳定与不稳定、健康与不健康等这样一些对立的概念之间都没有绝对的分明的界限。这种中介过渡性造就出划分上的不确定性即为模糊性。一个带有模糊性的概念即模糊概念。模糊概念不能用普通集合论来刻划。从而产生了模糊集合论,它是由美国人l ,a z a d e h 【删于1 9 6 5 年刨立的。z a d o h 利用隶属程度来描述差异的中介过渡,它是用精确的数学语言对模糊性的一种描述。例如,“年轻人”、“中年人”、“老年人”是三个模糊概念,一个3 0 岁的人应属于那一种昵? z a d e h 提出使用0与l 之间的数表示该成员属于某模糊集的程度,比如可认为3 0 岁的人属于“年轻人”的程度为0 8 ,“中年人”为0 2 ,而“老年人”为0 。对绝大多数系统来说,其最重要的信息来源有两种。提供测量数据的传感器、记录器等和提供系统性能描述韵专家。我们称来自传感器的信息为数据信息,来自专家的信息为语言信息。数据信息通常可以用数字( 如o 1 2 ,0 8 等) 表示,而语言信息则用文字或称模糊术语( 如大、小、很大等) 来表示。数字信息在传统的学习过程中已被广泛使用,但语言信息通常是作为符号值处理的,这种处理过程中并没有将这些术语作为一种模糊子集而是作为一种起替代意义的符号。如何在一个学习系统中有效地使用这些术语的模糊特征自然是一个重要的研究课题。河北大学理学硕士学位论文模糊理论已广泛应用于计算机科学、自动控制、地震工程、系统工程、土木工程、环境保护、机械、管理科学、思维科学、社会科学、医疗卫生、气象预报以及文学艺术、体育、心理等领域,但模糊技术最成功的应用领域应该说是模糊控制。特别是日本率先将模糊技术大量用到工业界和家用电器上如模糊洗衣机、模糊空调机、模糊控制的地铁运行系统等等,由于其良好的性能,在国际上受到广泛关注。另外特别需要指出的是由于智能作为人脑思维的模拟而带有明显的模糊性,模糊理论的应用正逐步渗入人工智能的各研究领域,并已取得了很大进展,国际模糊系统协会创立了f u z z ys e t sa n ds y s t e m s :i n t e r n a t i o n a lj o u r n a lo f s o f tc o m p u t i n ga n di n t e l l i g e n c e 的软计算与智能国际杂志;i e e e每两年召开一次模糊理论及应用的专门会议,在其大部分会刊杂志中,都刊登关于模糊应用的成果。通过学习产生模糊规则是模糊控制领域和模糊专家系统发展的瓶颈。产生模糊规则的方式早期是由专家凭经验给出的。近十余年人们开始研究如何从训练数据中自动抽取模糊规则,这种类型的模糊学习研究目前大体上以下面的三类学习方法为代表:( 1 ) 模糊回归方法1 6 5 - 6 9 。回归按其参数模糊变量实值、变量模糊参数实值和二者都是模糊数分为三种【1 9 】。这类方法将模糊规则的获取通过其模糊回归参数的变换得到,代表性工作见n a t h e r 的可能性推断模型1 2 0 。( 2 ) 模糊神经网络方法1 7 0 - 7 3 】。这是一种目前较为流行的方法,训练方式一般采用3层的前馈神经网络( 模糊b p 网络) ,大量关于这种研究的文献除从应用角度的区分外可按权和输入量分为:输入量为实值权为模糊、权为实值输入量模糊、二者都模糊三类,代表性工作有b u c k l e y 的模糊b p 网。这类方法的主体思想依然是误差逆传播,与传统的比较理论上没有新的突破,训练速度慢和可能坠入局部极小仍是这类网络的主要缺陷。( 3 ) 基于相似性的启发式算法【7 4 1 。相似性除使用统计方法度量外,还可以用模糊数来度量。这种方法使用相似性作为基础,针对具体问题往往能取得好的效果,但方法对相似性的度量有着较强的依赖性。上述三类方法的研究目前仅限于对数字信息,它们仅能够对精确描述出的示例集抽取模糊规则。科学的深化意味着研究对象的复杂化,而复杂的对象又难予精确化t 当考虑的示饲集不能精确描述时上述三种模糊学习方法就显的无能为力。本书正是为了弥补第2 章模糊集概述这种缺陷而写的。它讨论了另外一类模糊学习问题即模糊环境下的示例学习问题( 不能精确描述的示例集上模糊规则的抽取间题) 。2 3 模糊集合中的不确定性2 3 1 第一类不确定性定义2 2 设x 是一个固定的空间。称映射a :x _ 【o ,l 】为x 的一个模糊子集( 简称模糊集) 。称a ( x ) 为x 隶属于a 的程度,简称为隶属度。a ( x ) 又称为隶属函数特别,x是有限空间时,x = x l x 2 ,x 。) ,x 的一个模糊子集a = ( r l ,r 2 ,r n ) ( o s 吒s 1 ,f - 1 , 2 ,n ) 简称一个模糊向量。定义2 3 设a 是x 的一个模糊子集,口是一实数0 0而且i 表示口= 一时a 的口一截集的元素个数。( 2 ,2 ) 式变形可写为另外一种形式:u ( ,) = 妻仙g z 击( 2 3 )进一步,( 2 2 ) 又可写为c ,( 州) = 壹川ll 0 9 2i( 2 4 )其中m = ( 州,m 。,m 。) 为相对于r 的一种基本概率指定。例2 4 考虑如下的可能性分布r = 记第2 章模糊榘概述m ,= 一,f + 1 则有m = ,于是u ( r ) =0 1 0 9 2 1 + 0 2 1 0 9 2 2 + 0 1 l 0 9 2 3 + 0 1 0 9 2 4 + o l 0 9 2 i + 0 1 0 9 2 5 + 0 3 1 0 9 2 6 + 0 i i 0 9 2 7 + 0 1 l 0 9 2 8 + o l 0 9 2 9 + o2 1 0 9 2 1 0 = 2 1 s将一个正规模糊子集视为一种可能性分布,( 2 2 ) 一( 2 4 ) 提供了计算其不确定性的很方便的计算公式。文 7 6 ,7 7 在对这种可能性分布的不确定性讨论中。给出了一个很深刻的结果:对一个可能性分布来说,这种u 不确定性是满足可展性、可加性、可分性、正规性等9 条要求的唯一存在的函数。从可能性分布r 的u 不确定性定义可见【,( ,) 总是非负的。如果,2 = 0 则u ( ,) = 0 它表明没有不确定性。因只有一个元素对应的可能性为1 而其它均为os 如果= l 则u ( ,) = l 0 9 2h 它表示不确定性达到最大,也就是说,取值任何一个元素的可能性都为l ,从而具有最大的不可指定性。2 3 2 第二类不确定性一模糊熵设= x l 。x 2 ,x 。) 为一有限空间,我们经常将x 的经典子集表示成b i t 向量形式。例x = x 1 ,x 2 ,x 3 ) 则x = 1 ,l ,1 ) ,空集= ( 0 ,0 ,o ) ,子集a 一 x 1 ,x 3 可表示为a = ( 1 ,0 ,1 ) 。习惯上,用p 【嗣表示x 的经典子集全体。例如,p ( 的= ( 0 ,0 ,o ) ,( 0 ,1 ,o ) ,( o 0 ,1 ) ( 1 ,0 ,0 ) ,( 1 ,i ,0 ) ,( o ,l ,1 ) ( 1 ,0 ,1 ) ,( 1 ,l ,1 ) )z 的模糊子集可写成l i t 向量形式,“f i t ”是与b i t 相对比产生的,b i l 对应着二进制单位而f i t 对应着一种模糊单位,因为一个l i t 值实际上代表着一个元素x 隶属于模糊子集a 的程度。例如,z = ( x l ,x 2 ,x 3 ) ,a = ( 0 9 ,0 。o ,8 ) 和a c = ( 0 1 ,i ,0 2 ) 就是两个f i t 向量。每一个模糊子集可分解为一组非模糊子集的加权和,这就是著明的z a d e h 分解定理。例如a = ( 0 2 ,0 ,0 6 ,1 ,o 6 ) ,则a 有如下的分解形式:a = 0 ( 1 。1 ,1 。1 ,1 ) v 0 2 ( 1 ,0 ,l ,l ,1 ) v 0 6 ( 0 ,0 ,l ,l ,1 ) x 1 ( 0 ,0 ,1 。0 ,0 )它可解释为a = x 具有0 的权重,x = ( x 3 ,x 4 ,x 5 ) 具有0 , 6 权重,而x = x 3 ) 具有最大的权重l 。一般来说。权重越大相应的信息越可信。对一个f t 向量a 而言,我们仍使用前面的符号 l u ) 表示着一个模糊子集爿的大小,z a d c h 在 n - 7 9 将其称之为s i g m a 和。下面我们对有限空间上的模糊子集( f i t 向量) 引入模糊熵的概念( d el u o a 和t e r m i n i s 0 1 ) ,它代表着另外一类不确定性,文献1 1 1 将其称之为模糊性( f u z z i n e s s ) 。河北大学理学硕士学位论文定义2 5 设e 是一个集值映射:e :f ( x ) 呻 o ,1 ,其中f ( x ) 表示有限空间x 上的m 向量全体。如果b 满足下面的4 条d el u c a - t e r m i n i 公理:( d t l ) 风一) = 0 当且仅当一是b i t 向量即a 是一非模糊的;( d t 2 ) e ( a ) = l当且仅当a ( x i ) ;o 5 对所有的i 成立;( d t 3 ) e ( a ) 联且) 当一b s 0 5 或a ( x ) 丑o 5 即a 的模糊程度比口小;( d t 4 ) 剐) = e ( a c )则称e 是一种模糊熵。满足( d t i ) 一( d t 4 ) 的集函数可能有很多种形式,下面列举出较常用的几种:d el u c a 和t e r m i n i 8 0 ,文 8 1 1 对e d ( a ) 的性质作了详细讨论:,( 1 ) e d ( a ) = 一二;。【a ( x i ) l 0 9 2 a ( x i ) + ( 1 - a ( x i ) ) i 0 9 2 ( 1 一a ( x i ) ) 】n( 2 ) y a g e r :e r 以) = l 一,( a ,a ) l i t ( a ,驴) 】( p 1 )( 3 ) k a u f f n a n n :e k 0 ) = 2 n “i p ( 爿,a )( p 1 )( 4 ) k o s k o :日( 一) = i p ( 爿,a ) h 9 ( 彳,4 )e :( 4 ) = m ( a n a 。) m ( a u a ) 其中函数m 表示集合的大小1曰3 ( 彳) = 二墨l ( 1 一1 2 a ( x f ) 一1 1 )n可直接验证,上述列举的集函数均满足( d t l ) 一( d t 4 ) 。例2 4 考虑例2 1 中指出的模糊子集a ,应用k o s k o 定义的模糊熵耶有岛0 ) = ( 1 ,l 匀岛( 1 - 1 2 a ( , ) - 1 1 ) = l 一( 1 1 5 ) ( o ,8 + 0 8 + 0 4 + 0 2 + 0 2 + 0 4 + 0 8 + 1 + 1 + 1+ o 8 + 0 4 + 0 2 + 0 2 + 0 8 ) = 0 4一个模糊子集4 = ( 口j 毋2 ,d k ) 不可指定性的度量可由( ,( 由= t o :一口) l o g :f 定o z义,其中 a :l i = 1 ,”) 是 n 。l i = 1 ,竹) 从大到小的顺序排列,。= o 它的直观意义可解释如下:设x = l ,2 ,3 ,4 ) 表示4 个类一个待分类的对象不能确定为那一类且属于任一类都有一定的可能性,记为a = ( a l ,a 2 ,a 3 ,a 4 ) 。如果a 一( 1 ,i ,0 ,0 ) 说明无法确定为第一类还是第二类但一定不是第三四类,若a = ( 1 ,l ,1 ,1 ) 说明具有最大的不可指定性,若a = ( 1 ,0 ,0 9 ,o ) 卫= ( 1 ,0 ,o i ,0 ) 则a 的不可指定性要比b 大;如果a 。( 1 ,0 ,0 ,o )说明爿的不可指定性为0 而是确切可指定的,它为第1 类。1 6 第2 章模糊集概述一个模糊子集的模糊性度量由d el u c a - t e r m i n i 公理来定义,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论