(计算机应用技术专业论文)可视化数据挖掘在网络报警中的应用研究.pdf_第1页
(计算机应用技术专业论文)可视化数据挖掘在网络报警中的应用研究.pdf_第2页
(计算机应用技术专业论文)可视化数据挖掘在网络报警中的应用研究.pdf_第3页
(计算机应用技术专业论文)可视化数据挖掘在网络报警中的应用研究.pdf_第4页
(计算机应用技术专业论文)可视化数据挖掘在网络报警中的应用研究.pdf_第5页
已阅读5页,还剩58页未读, 继续免费阅读

(计算机应用技术专业论文)可视化数据挖掘在网络报警中的应用研究.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要数据挖掘是- - f - j 将人类的探索能力和计算机的强大处理能力结合在一起,发掘海量数据背后隐藏的知识的新兴技术。可视化是- - i - j 涉及计算机图形学、图像处理、计算机辅助设计、计算机视觉、用户界面方法学、系统设计、信号处理及人机交互技术等多个领域的新兴交叉学科。而应用于大型数据集探索与数据挖掘可视化技术更是最近几年开始研究的一个领域,拥有广阔的应用前景。本文分别介绍了可视化技术和数据挖掘技术的基本概念、作用、及应用的情况和目前存在的问题,在综合研究各种可视化方法以及各种数据挖掘方法的特点的基础上,对可视化与数据挖掘两者的整合以及应用进行了专题研究,分析了数据挖掘可视化的出现的背景意义,探讨了数据挖掘可视化的应用现状。本文的研究工作主要有以下几个方面:1 介绍了网络报警的概念、可行性、发展空间和前景,并对网络报警系统的报警方式、接警方法和报警系统的安全性进行了详细的介绍。2 设计并实现了可视化数据挖掘在网络报警系统中应用的模型,详细解析了留言报警信息。3 对贝叶斯分类器进行了改进,条件概率权重值修订。4 实现了贝叶斯分类结果和过程的可视化,而且有很好的界面进行人机交互。关键词:可视化;数据挖掘;贝叶斯分类;网络报警分类号: 请输入分类号( 1 - 2 ) ,以分号分隔。】a bs t r a c td a t am i n i n gi san e wt e c h n o l o g yw h i c hc a l li n t e g r a t et h eh u m a nm i n d se x p l o r a t i o na b i l i t i e sw i t ht h ee n o r m o u sp r o c e s s i n gp o w e ro fc o m p u t e r st of o r map o w e r f u lk n o w l e d g ed i s c o v e r ye n v i r o n m e n tt h a tc a p i t a l i z e s0 1 1t h eb e s to fb o t hw o r l d s v i s u a l i z a t i o ni sa ni n t e r s e c t e ds c i e n c ew h i c hi sb a s e do l lc o m p u t e rg r a p h i c s ,p i c t u r ep r o c e s s ,c a d ,c o m p u t e rv i s i o n , u s e ri n t e r f a c em e t h o d ,s y s t e md e s i g n , e t c d a t am i n i n ga n de x p l o r a t i o no fl a r g ed a t a s e t si san e wb r a n c hw h i c hi sd e v e l o p e di nr e c e n ty e a r sa n dh a sap r o m i s i n gf u t u r e i nt h i sa r t i c l e ,f i r s t l yt h ea u t h o ri n t r o d u c e ss o m eb a s i cc o n c e p t i o n s ,i m p a c t s ,a p p l y i n ga n dp r o b l e m sa b o u tt h ev i s u a l i z a t i o na n dd a t am i n i n gt e c h n o l o g i e s b a s e do nt h e s er e s e a r c h i n g , t h e ng i v e sas p e c i a le m p h a s i so nt h ec o m b i n a t i o no ft h e m ,a n di t sg r e a tm e a n i n g , a p p l y i n ga n dt e n d e n c y a n dt h e nf i xe y e so nt h ef r a m e w o r ko fv i s u a l i z a t i o n a ld a t am i n i n gs y s t e m t h em a i nr e s e a r c hw o r k sa r ef o l l o w i n g :1 i n t r o d u c e dt h ec o n c e p t ,f e a s i b i l i t y , d e v e l o p m e n ta n dp r o s p e c t so fn e t w o r ka l a r m a n dt h en e t w o r ka l a r ms y s t e ma l a r mw a y , j i e j i n gm e t h o da n dt h es e c u r i t ya l a r ms y s t e mw e r ed e s c r i b e di nd e t a i l 2 d e s i g n e da n di m p l e m e n t e dav i s u a l i z a t i o no fd a t am i n i n gi nt h en e t w o r ka l a r ms y s t e mi nt h ea p p l i c a t i o no ft h em o d e l a n a l y s i si nd e t a i l e dt h ea l a r mm e s s a g e si n f o r m a t i o n 3 i m p r o v e db a y e s i a nc l a s s i f i e r , t os t r i k eac o n d i t i o n a lp r o b a b i l i t yt oj o i ni nt h ew e i g h to fa m e n d m e n t s 4 i m p l e m e n t a t i o no ft h eb a y e s i a nc l a s s i f i e rr e s u l t sa n dp r o c e s sv i s u a l i z a t i o n , a n dav e r yg o o dh u m a n - c o m p u t e ri n t e r f a c e k e y w o r d s :v i s u a l i z a t i o n ;d a t am i n i n g ;b a y e s i a nc l a s s i f i c a t i o n ;n e t w o r ka l a r mc l a s s n o : 请输入分类号,以分号分隔。】学位论文版权使用授权书本学位论文作者完全了解北京交通大学有关保留、使用学位论文的规定。特授权北京交通大学可以将学位论文的全部或部分内容编入有关数据库进行检索,并采用影印、缩印或扫描等复制手段保存、汇编以供查阅和借阅。同意学校向国家有关部门或机构送交论文的复印件和磁盘。( 保密的学位论文在解密后适用本授权说明)学位论文作者签名:i 习忠,编签字日期:w 。g 年月三日导师签名:签字日期:伽g 年6 月弓日独创性声明本人声明所呈交的学位论文是本人在导师指导下进行的研究工作和取得的研究成果,除了文中特别加以标注和致谢之处外,论文中不包含其他人已经发表或撰写过的研究成果,也不包含为获得北京交通大学或其他教育机构的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均已在论文中作了明确的说明并表示了谢意。学位论文作者签名:签字日期:年月日5 9致谢本论文的工作是在我的导师胡俊副教授的悉心指导下完成的,胡俊副教授严谨的治学态度和科学的工作方法给了我极大的帮助和影响。在此衷心感谢三年来胡俊老师对我的关心和指导。胡俊副教授悉心指导我们完成了实验室的科研工作,在学习上和生活上都给予了我很大的关心和帮助,在此向胡俊老师表示衷心的谢意。胡俊教授对于我的科研工作和论文都提出了许多的宝贵意见,在此表示衷心的感谢。王志海教授、魏明源老师在学习和生活中也给予了极大的关心和帮助,在此一并表示衷心的感谢。在实验室工作及撰写论文期间,褚国嫘、李渊、雷琴琴等同学对我论文中的可视化研究工作给予了热情帮助,在此向他们表达我的感激之情。另外也感谢家人我的父母,他们的理解和支持使我能够在学校专心完成我的学业。1 引言1 1 研究背景网络报警是利用快速发展的互联网作为普通公民向公安局报告普通民事、刑事等案件的信息通信方式,是以1 1 0 语音电话报警系统为主的报警系统的子系统。网络报警不同于电话1 1 0 语音报警系统和其它报警方式,有其自身的特点:1 非实时性电话报警是在报警人和接警员实时互动的情况下实现的,网络报警系统中留言报警和邮件报警可以在报警人和接警员非实时互动的情况下将报警信息提供给公安部门。2 不会产生排队阻塞现象电话报警受到接警电话服务器和接警电话台数的限制,会产生报警排队阻塞现象,网络报警在通常状况下不会产生报警排队阻塞现象。一般的网络最小可以承受1 0 0 个用户并发同时访问,如果提高服务器的性能和软件优化,可大大提高网络的同时并发访问的承受能力,其并发访问数量可以达到万人以上。这是网络报警所具有的优点,但是网络报警也有其不足之处,这就是如何保证报警人在网络报警系统中提供的报警信息是真实的,可靠性有多高,如何实现机器自动对报警信息分类,自动过滤没有利用价值的网络报警信息,减少网络接警端接警压力,提高接警端对有用的应急报警信息的处理效率,这是本文所要论证研究的主题。在本文中,作者将把数据挖掘和可视化技术结合起来,选取网络报警中的留言报警信息作为可视化数据挖掘分类的讨论对象,严格遵循实际电话语音1 1 0 报警系统的5 w 原则,对网络报警中的留言报警信息进行分类,根据实际要求对数据挖掘的贝叶斯分类算法作了适当的调整和改进,并利用可视化技术,将数据挖掘的过程和结果以直观的图形图像方式展现出来,实现挖掘过程中人和数据挖掘机器的互动。1 2 网络报警网络报警定义为网络安全报警和网络应急报警两个部分,网络报警不仅仅局限于网络安全的网络报警系统,还应该作为以1 1 0 语音电话的为主报警系统的子系统网络应急报警系统,即普通的民事、刑事案件等案件也因该可以通过网络报警系统向警方发送报警信息。网络作为信息发布,收集的一个重要渠道,已经走进了人们的日常生活,所以网络作为一种信息的传递的方式,也应该作为一种警情信息的传递方式,而应用到警方的报警系统中,作为普通民众向警方报警的一种方式和渠道。报警方式应该是多样化的,可以作为警情信息传递的方式都应该作为一种报警方式。口头报警,电话报警等等这些传统的报警方式已经为人们所熟知。随着互联网的快速发展和普及,网络报警作为传统报警方式的延续和重要补充,也将会为民众所熟知,并得到广泛运用。1 3 数据挖掘近年来,数据挖掘引起了信息产业界和整个社会的极大关注,其主要原因是存在可以广泛使用的大量数据,并且迫切需要将这些数据转换成有用的信息和知识。获取的信息和知识可以广泛用于各种应用,包括市场分析、欺诈检测、顾客保有、产品控制和科学探索等。数据挖掘可以看作是信息技术自然演化的结果。自2 0 世纪6 0 年代以来,数据库和信息技术已经系统地从原始的文件处理演变到复杂的和功能强大的数据库系统。自2 0 世纪7 0 年代以来,数据库系统的研究和开发已经从早期的层次和网状数据库系统发展到开发关系数据库系统、数据建模工具以及索引和存取方法。此外,用户通过查询语言、用户界面、查询处理优化和事务管理,可以方便灵活地获取数据。联机事务处理( o l t p ) 的有效方法将查询看作只读事务,对于关系技术的发展和关系技术作为大量数据的有效存储、检索和管理的主要工具得到广泛认可作出了重要贡献。自2 0 世纪8 0 年代中期以来,数据库技术的特点是广泛接受关系技术,研究和开发新的、功能强大的数据库系统。这些推动了诸如扩充关系模型、面向对象模型、对象一关系模型和演绎模型等先进的数据模型的发展。包括空间的、时间的、多媒体的、主动的、流的、传感器的和科学与工程的数据库、知识库、办公信息库在内的面向应用的数据库系统百花齐放。同数据的分布、多样性和共享有关的问题被广泛研究。异构数据库系统和基于因特网的全球信息系统( 如万维网) 也已出现,并成为信息产业的生力军。2数据丰富加上对强有力的数据分析工具的需求可描述为数据丰富,但信息贫乏。快速增长的海量数据收集、存放在大型和大量数据储存库中,没有强有力的工具,理解它们已经远远超出了人的能力。结果,收集在大型数据储存库中的数据变成了“数据坟墓一难得再访问的数据档案。这样,重要的决策常常不是基于数据储存库中信息丰富的数据,而是基于决策者的直觉,因为决策者缺乏从海量数据中提取有价值知识的工具。此外,当前的专家系统技术通常依赖用户或领域专家人工地将知识输入知识库。遗憾的是,这一过程常常有偏差和错误,并且耗时和费用高。数据挖掘工具进行数据分析,可以发现重要的数据模式,对商务策略、知识库、科学和医学研究做出巨大贡献。数据挖掘是指从大量数据中提取或“挖掘知识。数据挖掘基本步骤组成包括:数据清理( 消除噪声和不一致数据) ,数据集成( 多种数据源可以组合在一起) ,数据选择( 从数据库中提取与分析任务相关的数据) ,数据变换( 数据变换或统一成适合挖掘的形式,如通过汇总或聚集操作) ,数据挖掘( 基本步骤,使用智能方法提取数据模式) ,模式评估( 根据某种兴趣度度量,识别表示知识的真正有趣的模式) ,知识表示( 使用可视化和知识表示技术,向用户提供挖掘的知识) 。典型的数据挖掘系统具有的主要成分:数据库、数据仓库、万维网或其他信息库;数据库或数据仓库服务器;知识库;数据挖掘引擎;模式评估模块;用户界面。数据挖掘常用技术:人工神经网络,决策树( 判定树) ,遗传算法,近邻算法,规则推导,贝叶斯分类。1 4 可视化技术随着各种先进计算技术、测量手段以及仪器设备( 如超级计算机、电子显微镜、医学扫描系统、地质探测系统等) 的广泛应用,人们需要对科研和生产中信息源产生的大规模数据集进行分析和解释,对建立的数学模型和模拟模型进行理解和判断。大量信息因人们无法理解或来不及理解而搁置或消失,从而阻碍了科学研究和工程技术的进展,影响了科学发现和工程计算的交流。为此,美国科学基金会( n s f ) 于1 9 8 6 年1 0 月专门召开了一次研讨会,会上提出了”科学计算可视化”这一全新的解决方案,简称v i s c ( v i s u a l i z a t i o ni ns c i e n t i f i cc o m p u t i n g ) 或s v ( s c i e n t i f i ev i s u a l i z a t i o n ) 。次年形成了正式的v i s c 报告,一门崭新的交叉学科应运而生。v i s c报告认为:“可视化是一种特殊的计算方法,它把数字符号转换为几何图像或图形,使研究者能够观察它们的模拟和计算过程,并进行交互控制。科学计算可视化为人们提供了一种发现不可见信息的方法,丰富了科学发现的过程,给予人类深刻与意想不到的洞察力,从而使科学家们的研究方式发生了根本变化。一3人脑的左半球擅长处理逻辑分析思维,适于利用文字符号“串行地处理数据的输入与输出:右半球用于形象分析思维,适用于以“并行”方式处理诸如空间几何关系这类可视信息。解决复杂问题,主要是依靠右脑的形象思维。人类一直在探索充分发挥人脑两半球的思维作用。由于人类接受数字信息的能力很差,由人工处理数据十分冗繁,所花费的时间往往是计算时间的十几倍甚至几十倍,有时还会丢失大量信息,这已经成为提高科学计算及工程设计质量和效率的主要瓶颈。人接受图像信息的能力较强,在人脑大约1 0 0 亿条神经元中,有一半是为视觉系统服务的。将复杂的数据以图像的形式表现,把原来没有空间属性的数据形象化,为视觉系统接受,人脑很易理解。可视化技术把原来难以直接解决的问题,变换到另一个领域中,成为容易理解和解决的问题。它是图像理解与图像合成的综合。其目的在于以视觉方法为科学研究和工程设计领域提供新的科学灵感,充分发挥人的右脑识别与构造几何图像的特殊机能。可视化的实现,无论在科学上、工程上、还是在技术经济上或社会效益上都具有重大的意义【6 】。可视化( d a t av i s u a l i z a t i o n ) 技术指的是运用计算机图形学和图像处理技术,将数据换为图形或图像在屏幕上显示出来,并进行交互处理的理论、方法和技术。可视化的方法有多种,分类原则也有多种。常用表示方法有:几何线条表示法,基于图标( i c o n ) 技术,面向像素技术,基于图形的技术,变形技术,色彩表示法,多媒体表示法。一般可视化的工作过程可分为:数据获取,数据理解与分类,特征描述,数据重建,视觉化造型,图像合成及动画处理。1 5 本章小结本文首先介绍了网络报警、数据挖掘和可视化技术的相关概念,随后详细介绍了网络报警的可行性和发展前景,数据挖掘的主要方法和一些基本技术,重点介绍了数据挖掘中的一个重要问题分类和分类中的贝叶斯分类器,可视化技术的基本方法,及其发展的重要意义,将上述两个方向的交叉课题即数据挖掘的可视化作了详细介绍,并将可视化数据挖掘应用到网络报警。论文的组织结构如下:第1 章为本文的引言部分。介绍了本文的研究背景,网络报警、数据挖掘和可视化技术的相关概念,并论述了本文的研究内容及论文的组织结构。第2 章我们首先详细地介绍了数据挖掘的基本概念、主要方法,以及数据挖掘中的一个重要问题分类的概念,并重点介绍了贝叶斯分类器。第3 章详细介绍了可视化技术,并详细列举了3 种常用的数据可视化方法及其优缺点,随后讨论了可视化的工作过程、可视化建模与绘制和发展可视化的重4要意义。第4 章着重讨论了可视化数据挖掘,并详细介绍了数据挖掘结果的可视化、数据挖掘过程可视化、交互式的可视化数据挖掘,及发展可视化数据挖掘的重要意义。第5 章我们详细讨论了网络报警的概念、及其整体设计、报警方式和接警方法。为我们下文深入探讨可视化数据挖掘在网络报警中的应用问题奠定基础。第6 章将交叉课题数据挖掘和可视化技术应用到了网络报警,对网络报警的留言报警信息进行了重点分析,将留言报警信息的内容离散化,并将留言报警信息的挖掘映射到树结构图中实现可视化,而且实现了人机交互,在人机交互过程中修改条件概率权重值。52 数据挖掘随着计算机技术的飞速发展,特别是i n t e m e t 技术的不断应用,人们利用信息技术生产和搜集数据的能力大幅度提高,各种巨型数据库不断应用于各个领域,而且这一势头仍将持续下去,人们处于数据的汪洋大海中。而在知识经济时代知识被赋予了新的意义。面对海量的数据,我们怎样才能对其进行分析、推理,发现数据间的关系,提取有用的特征;找出有效的、新颖的、易于理解的关系和模型;发现能够为人所理解的知识,能够较少或完全不依赖于外部专家的主观知识。面对这样的挑战,数据挖掘( d m ) 技术应运而生,并得以蓬勃发展,越来越显示出其强大的生命力。2 1 数据挖掘的发展和研究现状研究知识发现( k d d ) 和数据挖掘( d m ) 技术的重大意义己经被人们广泛的认识,并且被列为数据库研究领域中最重要的课题之一。许多公司也充分认识到了深层次地分析本公司业务数据库中的数据能够带来更多的商业机会,例如银行和零售商店通过分析它们的业务数据,进一步掌握和了解顾客的信誉、习惯和消费心理,从而相应地调整它们的市场策略,以拓宽更广泛的市场。国际上第一次关于数据挖掘与知识发现的研讨会于1 9 8 9 年8 月在美国底特律召开,知识发现一词是在此学术会议上正式形成的,当时仅有数十人参加,此后发展很快,1 9 9 5 年提升为国际学术大会( i n t e r n a t i o n a lc o n f e r e n c eo nd a t am i n i n g &k n o w l e d g ed i s c o v e r yi nd a t a b a s e ) ,即在加拿大召开的第一届知识发现和数据挖掘国际学术会议。这次会议上明确定义了知识发现的概念,并确定了知识发现过程和数据挖掘的关系。此后,数据挖掘开始流行,它是知识发现概念的深化,知识发现与数据挖掘是人工智能、机器学习与数据库技术相结合的产物。此外,还有这一主题的地区性国际大会,包括相关的学科领域,特别是机器学习、归纳逻辑程序设计( i l p ) 、医药数据处理、分布式人工智能、基于实例的推理( c b r ) 等。目前,数据库中的知识发现和数据挖掘技术己成为研究热点和焦点。机器学习和数据分析的理论及实践成为知识发现研究的铺垫。广阔的商业应用前景则是推动知识发现和数据挖掘研究的又一主要因素。知识发现是把数据库作为知识源,综合统计学、数据库、机器学习、可视化、数据分析等技术进行从数据库中发现知识的研究。数据挖掘方法的提出,让人们有能力最终认识数据的真正价值,即蕴藏在数6据中的信息和知识。数据挖掘引起了学术界和工业界的广泛关注,一些国际上高级别的工业研究实验室,例如i b ma l m a d e n 和g t e 等众多的学术单位都在这个领域开展了各种各样的研究计划。研究的主要目标是发展有关的方法论、理论和工具,以支持从大量数据中提取有用的和让人感兴趣的知识和模式。当今,数据挖掘技术方兴未艾,数据挖掘技术所表现出的广阔应用前景吸引了众多的研究人员和商业机构。一批数据挖掘系统被开发出来,并在商业、经济、金融、管理等领域都取得了应用性成果,其中比较有代表性的有q u e s t , k d w e x p l o r e ,i m a c s ,1 n l e n ,d b m i n e r 。这些系统基本上代表了自2 0 世纪8 0 年代以来的数据挖掘技术的发展。采用的发现方法综合了数据库、专家系统、模式识别、机器学习、统计学、科学发现和数据分析等领域的研究成果。但总的来说,这些系统基本上还停留在实验阶段,在适用性,系统效率方面还不尽人意。知识发现的发展经历了短短的十年时间,虽然还未达到实用化的程度,但探索者们己从各自的背景出发做了大量的工作。数据挖掘和知识发现的概念和理论自1 9 9 5 年提出以来,得到了很大的发展。现有的数据挖掘方法和技术可以分为六个大类:归纳学习方法、仿生物技术、公式发现、统计分析方法、模糊数学方法、可视化技术。从国内外目前的研究进展来看,各学科的研究自成一派,没有突破各个领域的技术界限;没有融合各领域的不同方法;尤其是未将并行优化的诸方法集成用于数据库中的数据挖掘,从而提高实时性,并解决随机的、动态、不完全的及混沌数据的数据挖掘,即所谓智能数据挖掘。由于i n t e m e t 的迅速发展与广泛应用,出现了基于异构数据源的数据挖掘,如文档数据挖掘、时间序列数据挖掘、电子商务系统中的数据挖掘。伴随数据库技术的发展,多媒体数据库的数据挖掘、时态数据库的数据挖掘、空间数据库的数据挖掘等也引起了许多人的关注。近来,移动计算作为第三代通信手段的数据挖掘也在研究之中。显然,计算机、网络、通信的三合为一,产生了数据挖掘新的研究方向。2 2 数据挖掘的主要方法和技术数据挖掘以人工智能、统计学、机器学习等技术为基础,涉及多个学科领域。其中人工智能是以自动机为手段,通过模拟人类宏观外显的思维行动,从而高效解决现实世界问题的技术。数据挖掘利用了人工智能中一些较成熟的算法和技术,如人工神经网络( a r t i f i c i a ln e u r a ln e t w o r k s ) 、遗传算法( g e n e t i ca l g o r i t h m s ) 、决策树( d e c i s i o nt r e e s ) 等。机器学习可以细分为:归纳学习方法( 决策树、规则归纳等) 、基于范例的学习、遗传算法等。下面介绍数据挖掘的几种常用方法。71 统计根据严格的定义,统计和统计技术不是数据挖掘,但是数据挖掘过程中却使用了很多统计技术和概念,如概率、独立性、偶然性和过适应等。统计方法可以细分为回归分析( 多元回归、自回归等) 、判别分析( 贝叶斯判别、费歇尔判别、非参数判别等) 、聚类分析( 系统聚类、动态聚类等) 、探索性分析( 主元分析法、相关分析法等) 等。以回归分析为例,非线性回归在预定的函数的基础上,寻找目标度量对其它多种变量的依赖关系,这种方法在金融市场和医疗诊断的应用中有比较好的结果。当要进行预测的仅仅是两个可能的值时( 例如,顾客是否购买了产品) ,为了得到一个更好的预测模型,可以将预测属性值进行变换,进行逻辑回归分析。2 最近邻和聚类聚类和最近邻预测技术是数据挖掘中使用最早的技术,使用这些技术预测一个记录的预测值是什么时,在历史数据库中寻找有相似预测值的记录,并使用未分类记录中最接近的记录值作为预测值。最近邻算法基本上是聚类的一种改进,但它一般用于预测并且是有导师学习技术,而聚类被称为无导师学习技术。3 决策树在知识工程领域,决策树是一种简单的知识表示方法,它将事例逐步分成不同的类别。由于分类规则是比较直观的,因而比较易于理解,在机器学习领域内,多年来己研究出不少实施决策树的有效算法( 如i d 3 及其改进算法等) ,它们可以在多种多样的商业问题中用于探究和预测,目前己经应用于信用卡损失预测、国际流通货币兑换率的时序预测问题等。4 神经元网络人工神经元网络具有分布式存储信息、并行地处理信息和进行推理、自组织学习等特点,可以用于建立基于多种不同问题的正确率很高的预测模型,但是神经元网络在易用性和应用扩展能力方面有一定的限制。目前神经元网络己经用于分类、聚类、特征采掘、预测和模式识别。神经网络模仿生物神经网络,本质上是一个分布式矩阵结构,它通过对训练数据的采掘逐步计算网络连接的权值。神经网络可分为以下三种:a 前馈式网络,它以感知机、反向传播模型、函数型网络为代表,可用于预测、模式识别等方面;b 反馈式网络,它以h o p f i d d 的离散模型和连续模型为代表,分别用于联想记忆和优化计算;c 自组织网络,它以a r 7 ,模型、k o h o l o n 模型为代表,用于聚类。5 规则归纳规则归纳是数据挖掘的一种主要形式。进行规则归纳时,数据中所有可能的模式都要被系统地抽取出来,然后再估计它们的正确性和重要性,以判断模式令人信服的程度有多高,再次出现的可能性有多大。规则归纳系统可以得到数据库中所有可能的有趣模式,但是为了得到真正有价值的规则有可能要对有趣规则再进行一次数据挖掘。6 遗传算法遗传算法模仿人工选择培育良种的思想,从一个初始规则集合( 知识基因) 开始,逐代地通过交换对象成员( 杂交、基因突变) ,产生群体( 繁殖) ,评价并择优复制( 适者生存,不适应者淘汰) ,逐代积累计算,最终优化知识集。可以用于分类、关联规则挖掘等。在数据挖掘中应用的还有集合论中的粗糙集合方法、模糊逻辑等。显然,当实现一个数据挖掘系统时,最困难的是决定什么时候使用哪种技术。每种技术的优点都是有限的,但是现实世界中数据是不断变化的,可以使用试错法中的一些标准来决定使用什么技术。分类是数据挖掘中的一个重要问题,也是一种重要的数据分析形式。分类是一种有指导的学习过程,可以用于从数据库中提取重要数据类的模型或预测未来的数据趋势。在商业、金融、电讯、d n a 分析、科学研究等诸多领域具有广泛的应用。统计学、机器学习、神经网络等领域的研究者对分类问题进行了大量的研究。本文的研究课题属于可视化数据挖掘,侧重点是可视化分类,因此我们首先简要介绍有关数据挖掘的背景知识。在本章,我们将详细介绍有关分类的问题,包括分类的概念、分类的基本技术一贝叶斯分类。2 3 分类的概念能够学习如何把一个对象划分到预定义的类被认为是智能的一个重要特征,在人工智能、机器学习和神经网络等方面都有广泛的应用,这类任务被称作分类。分类是一种有指导的学习,即学习过程是在被告知每一个训练样本属于哪个类的“指导 下进行的。分类问题可以描述为:数据是一张标准关系表,它包含n 个记录,这些记录通常称作实例( i n s t a n c e ) 或样本( e x a m p l e ) 。每一个实例用固定数目的度量标准描述,这种度量标准称作属性( a t t r i b u t e ) 。每一个属性都有一个合法的取值范围,称作该属性的域( d o m a i n ) 。如果属性域是实数域,那么则称该属性为数值属性( n u m e r i c a la t t r i b u t e ) 或连续属性( c o n t i n u o u sa t t r i b u t e ) 。如果属性域是有限的,那么则称该属性为分类属性( c a t e g o r i c a la t t r i b u t e ) 或离散属性( d i s c r e t ea t t r i b u t e ) 。这些属性中有一个区别于其他的称作类标号( c l a s sl a b e l ) ,类标号指示元组所属的类。除了类标号之外的其他属性是预测未知样本类型的依据,因此也称作预测属性( p r e d i c t o ra t t r i b u t e s ) 。9在分类研究中,数据集通常被分成训练集和测试集。训练集用来构造分类器,测试集用来评估分类器的预测准确度。因为学习算法可能对数据的过分特化,所以使用训练数据构造分类模型,然后用同样的数据集评估分类模型可能导致过于乐观的估计。因此,通常采用测试集来评估分类模型。在分类研究中,通常采用u c i 机器学习库【z l j ( u c i m a c h i n el e a r n i n g r e p o s i t o r y ) 中的数据集评估不同的分类模型。这些数据集来自广泛的应用领域,并且不同数据集的规模、目标类的个数和属性个数变化很大,能够比较全面的反映算法的分类性能。分类过程可以描述为如下两个步骤:第一步,是建立一个模型,描述预定的数据类或概念集。训练阶段的目的是建立分类器,即从训练数据集中获取可以进一步指导未知数据分类的专家知识。不同的分类模型可能用不同的形式描述用于指导分类的知识,如分类规则、决策树或数学公式等。这些分类模型以不同的形式描述了某个类区别其他类的特征概念集。从另一个角度来看,也可以认为分类模型是以某种特定的形式描述了训练集的数据分布特征。如果训练集能够代表整体数据分布特征,那么由训练集获得的特征概念集就可以用来指导对未知数据的预测。第二步,使用模型进行分类。在使用分类模型对未知类标号的实例或对象分类之前,首先要使用测试集评估分类模型的分类准确率。如果分类准确率是可以接受的,那么我们才可以真正把该模型用于指导未知元组的分类。有多种技术用来评估分类模型的准确性,关于模型的评估的问题。由于分类技术在不同领域的广泛应用,统计学、机器学习、神经网络等领域的研究者提出了很多分类方法。这些算法来自不同的领域、工作原理差别很大,但是都在相应的领域取得了很大的成功。现有的分类技术主要有:贝叶斯分类、基于决策树的分类、源自关联规则挖掘概念分类、神经网络、遗传算法、模糊集和粗糙集方法等。本文主要讨论了基于贝叶斯分类的可视化数据挖掘,所以,下面将详细介绍一下数据挖掘中的贝叶斯分类用到的统计学公式和基本原理。2 4 贝叶斯分类贝叶斯分类是统计学分类方法,它基于贝叶斯定理,使用后验概率预测类成员关系的可能性,如给定样本属于某一特定类的概率。基于贝叶斯的分类过程可以这样描述:假定有k 个类c 1 ,c 2 c k ,给定未知数据样本x 可以用一个n 维向量描述为x - - - x l ,x 2 x n ) ,分类器将预测未知样本x 属于在各属性取值为x 条件下的后验概率最高的类。即选择能够使p ( c ii 均l o因最大化的c i 作为未知样本所属的类p ( c iix ) p ( c jx ) ,1 i kj i依据贝叶斯定理p ( c ilx ) = p ( xc i ) p ( c i ) p ( 姆( 2 1 )( 2 2 )其中,p ( x ) 对于所有的类都是常数,只需p ( xlc i ) p ( c i ) 最大,而如果类的先验概率未知,通常假定这些类是等概率的,即p ( c 1 ) = p ( c 2 ) = = p ( c k ) 。类的先验概率也可以用p ( c i ) = i s i v l s l ,其中l s i t 是训练集中c i 类的样本数,i s l 是训练集的样本总数。因此,如何获得p ( xlc i ) 成为基于贝叶斯的分类算法的关键问题。朴素贝叶斯分类算法( n a i v eb a y e s i a n , n b ) 1 2 】做了一个简单的假定:对于给定的c i 类,所有属性是相互独立的。在属性值相互条件独立的前提下,p ( xlc i ) 的计上1 l p ( x j l g )算可以简化为:p ( xc i ) :了_ -。概率p ( x ljc i ) ,p ( x 2 lc i ) ,p ( x n ic i ) 可以通过训练集估算。尽管朴素贝叶斯分类算法很简单,但是在很多应用领域取得了巨大的成功,分类准确度可以与决策树和神经网络等复杂的算法媲美。应用于大型数据库,贝叶斯分类表现出了高准确度与高速度。当条件独立性假设成立时,朴素贝叶斯分类是最精确的,然而朴素贝叶斯分类算法的条件独立性假设在现实数据集上通常是不成立的。由于朴素贝叶斯分类算法取得的巨大成功,衍生出许多基于贝叶斯的分类算法,如贝叶斯信念网络幽( b a y e s i a nb e l i e f n e t w o r k ) 允许在变量的子集间定义类条件独立性,通过因果关系图来体现属性之间的依赖关系。l a z yb a y e s i a n s 算法则是采用懒散学习来弱化对条件独立性的假设的要求。这些算法大部分是针对朴素贝叶斯的条件独立性假设提出的,旨在通过采用相应的策略放松朴素贝叶斯分类算法对条件独立性假设的要求。与数据挖掘中的其他知识表示的方法如规则表示、决策树、人工神经网络等相比,贝叶斯网络在知识表示方面具有以下优点:贝叶斯网络能够很方便地处理不完全数据。贝叶斯网络能够学习变量间的因果关系。贝叶斯分类与其他模型相结合,通常可以有效的避免了数据的过分拟合【2 4 】。分类有规则分类和非规则分类,贝叶斯分类是非规则分类,它通过训练集训练而归纳出分类器,并利用分类器对没有分类的数据进行分类。贝叶斯分类具有如下特点:1 贝叶斯分类并不把一个对象绝对地指派给某一类,而是通过计算得出属于某一类的后验概率,具有最大后验概率的类便是该对象所属的类;2 一般情况下在贝叶斯分类中所有的属性都潜在地起作用,即并不是一个或几个属性决定分类,而是所有的属性都参与分类;3 贝叶斯分类对象的属性可以是离散的、连续的,也可以是混合的。贝叶斯定理给出了最小化误差的最优解决方法,可用于分类和预测。理论上,它看起来很完美,但在实际中,它并不能直接利用,它需要知道证据的确切分布概率,而实际上我们并不能确切的给出证据的分布概率。因此我们在很多分类方法中都会作出某种假设以逼近贝叶斯定理的要求。1 239 视化数据挖掘v is u a l d m作为d a t a m i n i n g 的一个重要手段,可视化数据挖掘( v i s u a ld a t am i n i n g ) 是当前d a t a m i n i n g 的研究重点之一。知识发现( i c o n ) 的核心技术是数据挖掘( d a t am i n i n g ) 。它是从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。人们把原始数据看作是形成知识的源泉,就像从矿石中采矿一样。原始数据可以是结构化的,如关系数据库中的数据,也可以是半结构化的,如文本、图形、图像数据,甚至是分布在网络上的不同构型数据。数据挖掘的方法可以是数学的,也可以是非数学的;可以是演绎的,也可以是归纳的。通过数据挖掘可以发现多种类型的知识,包括反映同类事物共同性质的广义型知识:反映事物各方面特征的特征型知识;反映不同事物之间属性差别的差异型知识;反映一个事物和其它事物之间依赖或关联的关联型知识;根据当前历史和当前数据推测未来数据的预测型知识;揭示事物偏离常规出现异常现象的偏离型知识。为了发现这些不同类型的知识。要采用多种发现知识的工具。为了使发现知识的过程和结果易于理解和在发现知识过程中进行人机交互,要发展发现知识的可视化方法。为了了解数据之间的相互关系及发展趋势,人们可以求助于可视化技术。信息可视化不仅用图像来显示多维的非空间数据,使用户加深对数据含义的理解,而且用形象直观的图像来指引检索过程,加快检索速度。在科学计算可视化中,显示的对象涉及标量、矢量及张量等不同类别的空间数据,研究的重点放在如何真实、快速地显示三维数据场。而在信息可视化中,显示的对象主要是多维的标量数据,目前的研究重点在于,设计和选择什么样的显示方式才能便于用户了解庞大的多维数据及它们相互之间的关系,其中更多地涉及心理学、人机交互技术等问题。这是一个前所未有的信息时代,我们每天都处在各种信息的包围之中。需要一种快捷有效的方式帮助我们发现隐藏在庞杂信息当中的模式和知识,帮助我们决策。这就是数据挖掘可视化的意义所在。可视化数据挖掘是数据挖掘走向实用阶段的一个必不可少的前提。数据挖掘不能仅局限于专业分析,还应该面对所有对数据挖掘有需求的数据挖掘者,而可视化将会辅助那些非专业人员利用数据挖掘从大量数据中提取出有意义的信息【引。可视化数据挖掘,依据可视化的侧重点不同和可视化的对象不同,可视化数据挖掘可以分为数据可视化、数据挖掘结果的可视化、数据挖掘过程可视化、交互式的可视化数据挖掘。3 1 数据可视化的方法数据可视化的方法有多种,分类原则也有多种,本小节将介绍几种常用的数据可视化方法。传统的数据可视化方法多用于低维数据,包括条形统计图、柱状图、折线图、饼图、锯齿图、分位数图、散点图、局部回归曲线图、等高线图、时序图、核曲线、盒图、颜色编码、数据立方体。数据立方体是将数据按多个维度组织形成的一种多维结构。用户通过采取切片、切块、旋转、钻取等各种分析动作,可以灵活地多角度、多侧面地观察数据库中的数据,从而深入了解包含在数据中的信息、内涵。3 1 1 色彩表示法用色彩或灰度来描述不同区域的数值的方法。由于人们对色彩的接受能力更强,根据人的视觉系统对彩色色度的感觉和亮度的敏感程度不同来描述数值特性,这种方法的主要优点是:直观、形象、醒目,主要用于反映表面或截面上的信息。应用实例如:区域填充法表示云雨分布、医学c t 图等;阴影图法表示几何形体的几何特性等;实物化法表示火山喷射温度、物体裂纹扩展特性等。3 1 2 圆饼图圆饼图是由数据块构成的圆饼状图形组成。仅排列在工作表的一列或一行中的数据可以绘制到饼图中( 数据系列:在图表中绘制的相关数据点,这些数据源自数据表的行或列。可以在图表中绘制一个或多个数据系列。圆饼图只有一个数据系列) 。圆饼图显示一个数据系列中各项的大小与各项总和的比例。圆饼图中的每个数据系列具有唯一的颜色或图案并且在图表的图例中表示,相同颜色的数据标记组成一个数据系列。在圆饼图中,连到字段后的所有圆饼值构成圆饼百分之百的整体,再按各个圆饼值所占的比例分配圆饼中的图块大小。所以圆饼图最适合表现每个单一数据项占数据总量百分比类型的应用。在绘图时,先算出一个数据类在数据系列中的百分比:数据类数据数据系列数据半1 0 0 ;再根据数据类在数据系列中的所占的百分比计算出数据类在圆饼图中所占的角度:a n g l e = 3 6 0 * 数据类在数据系列所占的百分比。图3 1 圆饼图,在绘图过程中随机的产生与类数据相对应的颜色,却并不影响我们通过圆饼图分辨数据大小的对比。1 4= e 塞交垣厶:羔亟土堂位诠塞豆迎丝数握挖塑堑坠垒! 旦丛图3 1 圆饼图f i g 3 1ar o u n dp i e c h a r t使用圆饼图的要注意的情况:仅有一个要绘制的数据系列;要绘制的数值没有负值;要绘制的数值几乎没有零值;数据类别数目不超过七个;各类别分别代表整个圆饼图的一部分;在圆饼图中我们所见的只是数据之问的相对大小,而不是数据的实际大小;在圆饼图中我们可以不必在意数据在圆饼图中占居的相对位置,圆饼图所反映的仅是数据间的大小对比结果。圆饼图具有下列图表子类型:1 圆饼图和三维饼图圆饼图以二维或三维格式显示每。数值相对于总数值的大小。您可以手动拖出圆饼图的扇面来强调它们。2 复合圆饼图和复合条圆饼图复合圆饼图或复合条圆饼图显示将用户定义的数值从主饼图中提取并组合到第二个圆饼图或堆积条形图的饼图。如果要使主饼图中的小扇面更易于查看,这些图表类型非常有用。3 分离型圆饼图和分离型三维饼图分离型圆饼图显示每一数值相对于总数值的大小,同时强调每个数值。分离型圆饼图可以以三维格式显示。由于不能单独移动分离型圆饼图的扇面,您可能要考虑改用圆饼图或三维饼图。这样就可以手动拖出扇面了。3 1 3 树图树图( t r e m e p a ) 是可视化层次结构数据的一- 个主要方法【3 0 】,适合于观察大数量的层次数据集。数据库系统中具有层次结构的数据信息包括人事组纵、文件目录、人口调查等等。树图的基本思想是根据数据的层次结构将屏幕空间划分成一个个矩形子空间,子空间大小由节点大小决定。树图层次则依据由根节点到叶节点的顺序,水平和垂直依次转换,开始将空间水平划分,下一层将得到的子空间垂直划分,再下一层又水平划分,依此类推。对于每一个划分的矩形可以进行相应的颜色匹配或必要的说明。图3 2 是一个树图结构的示意图。图3 2 a 显示了树图中各元素的结构。各元素以节点的形式表示,每个节点有一个名称和大小。叶节点大小由变量的大小决定,非叶节点的大小是其子节点大小的总和。图3 2 b 是根据节点的树状结构对叶节点的显示。开始时屏幕是一个整体,代表根节点。根据第二层三个节点的大小将屏幕水平划分为相应的三部分。对于每一部分再根据其子节点的数目和大小垂直划分,如b l o 被划分为两部分,d l o 被划分为三部分。到下一层时再对每一部分水平划分,如此往复直到达到叶节点。a )b )图3 2 一个层次结构的树图f i g u r e 3 2ah i e r a r c h i c a ls t r u c

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论