WEB数据挖掘资源综述_第1页
WEB数据挖掘资源综述_第2页
WEB数据挖掘资源综述_第3页
WEB数据挖掘资源综述_第4页
WEB数据挖掘资源综述_第5页
已阅读5页,还剩4页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

WEB数据挖掘资源综述摘要:Internet技术的发展和普及使得信息的发布和获取的方式发生了根本性的变化,Web成为了当前信息传播的主要载体之一。如何在Web这个全球最大的数据集合中发现数据已成为了数据挖掘研究的热点。本文综述了Web数据挖掘的基本概念、分类、应用,介绍了相应领域的可用资源,分析了Web挖掘的发展趋势。关键字:数据挖掘;Web数据挖掘;分类;资源SurveyofWebdataminingresourcesAbstract:ThedevelopmentandthepopularizationofInternettechnologymadethewayoftheinformationacquisitionandtheissuehavethehugeleapandtheessentialchange.WWWbecameoneofthemaincarriersoftheinformationdissemination.Howtominedataintheworld’slargestcollectionofdatahasbecomeahotresearch.Thissummarizedthebasicconcept,theclassificationandtheapplicationofWebdatamining,describedtheresourcesavailabletothecorrespondingfield,paperanalyzedthetrendofdevelopmentofWebdataminingKeywords:Datamining;Webdatamining;Classification;Resources1.引言近年来Internet正以令人难以置信的速度在飞速发展,越来越多的机构、团体和个人在Internet上发布信息、查找信息。虽然Internet上有海量的数据,但由于Web是无结构的、动态的,并且Web页面的复杂程度远远超过了文本文档,人们要想找到自己想要的数据犹如大海捞针一般。信息检索界开发了许多搜索引擎[1],但其覆盖率有限,因此查全率低,一般的搜索引擎是基于关键字的查询,命中率较低,另外不能针对特定的用户给出特殊的服务,因为每个人感兴趣的东西是不一样的,因此不具有个性化。解决这些问题的一个途径,就是将传统的数据挖掘技术和Web结合起来,进行Web挖掘[2-6]0Web挖掘就是从Web文档和Web活动中抽取感兴趣的潜在的有用模式和隐藏的信息。Web挖掘可以在很多方面发挥作用,如对搜索引擎的结构进行挖掘,确定权威页面,Web文档分类,WebLog挖掘、智能查询,建立Meta-Web数据仓库等。万维网目前是一个巨大、分布广泛、全球性的信息服务中心,它涉及新闻、广告、消费信息、金融管理、教育、政府、电子商务和许多其它信息服务。Web还包含了丰富和动态的超链接信息,以及Web页面的访问和使用信息,这为数据挖掘提供了丰富的资源。然而从以下的分析可以看出,对Web进行有效的资源和知识发现具有极大的挑战性。对有效的数据仓库和数据挖掘而言,数据量太大。Web页面的复杂度超过任何传统的文本文档。Web是一个动态性极强的信息源。Web面对的用户群体是广泛而多样的。Web上的信息只有极少一部分是相关的或者是有用的。这些挑战已经推动了如何高效且有效地发现和利用因特网上资源的研究工作。Web挖掘是一个更具挑战性的课题,它实现对Web存取模式、Web结构、规则和动态的Web内容的查找。2.Web挖掘的分类根据对Web数据的感兴趣程度不同,Web挖掘一般可以分为三类:Web内容挖掘(WebContentMining)Web结构挖掘(WebStructureMining)Web使用挖掘(WebUsageMining)图1给出了Web挖掘的分类图:图1Web挖掘的分类随着Web2.0的发展,又出现了一种新的Web用户性质挖掘。Web内容挖掘web内容挖掘主要包括文本挖掘和多媒体挖掘两类,其对象包括文本、图像、音频、视频、多媒体和其他各种类型的数据。这些数据由非结构化的数据(如文本)、半结构化的数据(如HTML文档)和结构化的数据(如表格)构成。对非结构化文本进行Web挖掘,称为文本数据挖掘或文本挖掘,是web挖掘中比较重要的领域。web文本挖掘的一般处理过程如图2所示。目前,关于Web内容挖掘的研究大体以web文本内容挖掘为主。Web内容挖掘一般从资源查找和数据库两个不同的方面进行研究。从资源查找的方面来看,Web内容挖掘的任务是从用户的角度出发,着重提高信息质量和帮用户过滤信息。主要是对结构化文档和半结构化文档进行挖掘。从数据库的观点进行Web内容挖掘主要是试图建立web站点的数据模型并加以集成,以支持复杂查询,两不只是简单的基于关键词的搜索。这要通过找到Web文档的模式、建立Web知识库来实现。对文本数据进行挖掘的文档分类和模型质量评价方法与传统的数据挖掘方法相类似,分类方法主要应用朴素贝叶斯(NaiveBayesClassifier)0对模型的质量评价主要有分类的正确率(ClassificationAccuracy)、准确率(Precision)和信息估值(InformationScore)oWeb结构挖掘Web结构挖掘是指挖掘Web潜在链接结构模式,即通过分析页面链接和被链接数量以及对象来建立Web自身的链接结构模式。Web数据不同于文本或者数据库,有用的知识不仅在Web页面的内容中存在,而且也在Web页面间的链按结构和Web页面内部结构中包含。所以,Web结构挖掘可以分为外部结构挖掘、内部结构挖掘以及URL挖掘。Web结构挖掘的基本思想是将Web看作一个有向图或者无向图的形式,把Web页面抽象作为图的顶点,而页面间的超链接就是图的边。然后利用图论对Web的拓扑结构进行分析研究。常见的算法有PageRank、HITS,(HypertextInducedTopicsearch),二次方程推断法(QuadraticExtrapolation)、分块矩阵排序算法(B10ckRankA190rithm)、发现虚拟社区(Cyber—community)的算法,发现相似页面的算法等。Web结构挖掘的算法一般可分为查询相关算法和查询无关算法两类:(1) 查询相关算法需要为每一个查询进行一次超链分析从而进行一次值的指派。(2) 查询独立算法则为每个文档仅进行一次值的指派,对所有的查询都使用此值。Web使用挖掘Web使用挖掘是从用户存取模式中获取有价值的信息,即通过分析Web日志数据及相关数据,来发现访问者访问Web页面的模式,分析日志记录中的规律,从而识别访问者的兴趣、频率、满意度,可以发现潜在用户,增强站点的服务竞争力。Web内容挖掘、Web结构挖掘的对象是Web上的原始数据,而Web使用记录挖掘则面对的是在用户和网络交互的过程中抽取出来的第二手数据。这些数据包括:网络服务器访问记录、代理服务器日志记录、浏览器端日志记录、用户简介、注册信息,用户对话或交易信息,cookie中的信息、用户查询、等一切用户与站点之间可能的交互记录。一般可分为一般访问模式分析以及分析特制Web站点。Web使用挖掘的基本流程包括数据预处理、模式识别和模式分析。Web用户性质挖掘Web2.0是从2005年直到现在一直都很流行的名词。web2.0是以Flickr、Craigslist、Linkedin、Tribes、Ryze、Friendster、Del.icio.us、43T等网站为代表,以Blog(博客/网志)、TAG(网页书签)、SNS(社会网络)、RSS(站点摘要)、wiki(百科全书)等应用为核心,依据六度分隔、xml、Ajax等新理论和技术实现的互联网新一代模式。Web2.0时代的显著特征是个性化、互动性、大众化和去中心,旨在给用户提供更人性化的服务,同时不再像Web1.0时代用户只能被动的接受各网站“填鸭”式的信息轰炸。在Web2.0时代,每个普通用户既是信息的获取者,也是信息的提供者。面对Web2.0的诞生,Web数据挖掘技术又面临着新的挑战[7]。如果说Web使用挖掘是通过挖掘网站访问者在网站上留下的痕迹来获取有用的信息,那么Web用户性质挖掘则是要去Web用户的老巢去探寻究竟。在web2.0时代,网络彻底个人化了,Web用户可以用自己的方式、喜好来个性化定制自己的互联网。Web2.0赋予Web用户最大的自由度,同时给予有心商家有待发掘的高含金量信息数据。通过对Web用户自建的Blog、RSS等Web2.0功能模块下客户信息的统计分析,能够帮助运营商以较低成本获得准确度较高的客户兴趣倾向、个性化需求以及新业务发展趋势等信息。有关Web2.0下的数据挖掘正在进一步研究中。3常见Web与可视化数据挖掘工具通常情况下,数据挖掘工具一次一般只能解决一个问题或者任务,例如分类、估计、预测、关联分析、聚类和细分。通过解决不同类型的任务,可以将数据挖掘工具分成两大类:有监督和无监督的学习。3.1有监督的学习工具有监督的学习工具包括:(1)决策树和规则集模型(2)用于分类的神经网络模型(3)线性回归模型(4)Logistic回归3.2无监督的学习工具无监督学习把一组记录的集合作为输入,然后试图从中发现一些模式。各个工具之间的差别在于发现的模式和搜索的过程,主要包括以下三种:(1)关联规则(2)聚类(3)SOM

(Kohonen自组织映射)4常见数据挖掘工具对比不同的数据挖掘工具能够解决不同的数据挖掘任务,如表1所示。同样,不同的数据挖掘工具具有不同的优点和缺点,如表2所示。表1数据挖掘工具功能对比数据挖掘工具分类估值预测相关分组聚类和细分解释决策树VVV神经网络VV线性回归VVVIjOgistie回归VVV关联规则VV聚类VVVSOMVV'表2中效力:对于有监督学习来说,判断效力的标准就是工具的准确率;对于无监督学习来说,判断有效性的标准就是数据挖掘工具发现的模型的有用程度。表2数据挖掘工具优缺点对比数据挖掘工}1效力可解释性易于实施产生模是否能否适合概型时间可信任可视化念证明决策树(湖ExcellentFastY郴YesYes全体决策树ExcellentNot(ktorJNot(krtdSlowY馅NoNo神经网络ExcellentNot(Mkk]Not(khO<JSlowY郴NoNo线性回归ExcelleniEKcellftniFastNoNoYesLogistic回归(5EbccellentEKcellftniFgY郴NoYes美联规则ExcellentSlowY珞YesYes聚类ExcellentFastY郴YesYesSOMNot(^oodSlowNoNoNo可解释性:指的是一个领域专家或者一个不具有数据挖掘相关知识的人员理解数据挖掘模型的难易程度。易于实施:指的是在生产和测试环境中部署模型的难易程度,直接和模型的复杂程度相关。产生模型时间:数据挖掘工具通过搜索模式来形成最后的模型,不同工具的搜索速度不同。是否可信任(可信程度):对于有监督学习任务来说通过利用可信程度,可以对预测结果进行排序,从而可以使用其中最准确的一部分结果;对于无监督学习任务来说,比如聚类,相关的可信程度表示是否能够计算出记录隶属于一个聚类的程度或者到某聚类的距离。能否可视化:可以了解模型对未知例子打分的过程,对于模型部署之后的监督尤为重要。适合概念证明:用于证明数据挖掘是否能带来利润,从而展示在特定问题上数据挖掘的价值。常用Web数据挖掘软件资源对应于每一个Web挖掘分类都有其相应的资源。5.1文本信息挖掘工具通常文本挖掘工具主要完成两方面的工作:信息检索和对文本的分析。文本挖掘工具的主要设计目标是使用户用于理解文档内容或用于收集相关文档所花费的时间最少。IBM公司推出的Web文本挖掘工具IntelligentMinerforText,它是IBM开发的IntelligentMiner家族的一成员,它主要包括三部分:高级搜索引擎TextMiner,其最大特点是具有在线更新的能力,即它在执行索引任务的同时无须将搜索进程挂起,可获得较高的效率;Web访问工具包括一个优化的搜索引擎NetQuestion和WebCrawler,WebCrawler是一个可以在一个或多个Web站点启动的自动机,它可以监视Web页的活动并可以变更检索使之更优化;文本分析工具,这部分完成的才是对文本信息的挖掘,这部分工具可以独立使用,但将它与文本搜索工具结合使用将能发挥更强大的作用。该软件主要是由信息提取器工具组成,该工具提供了高效的文本信息挖掘,可以实现全文搜索、文本分析Web文档查询和检索。5.2用户访问模式挖掘工具用户模式挖掘工具通常实现的方法是对ServerLogs、ErrorLogs和CookieLogs等日志文件分析挖掘出用户访问行为、频度和内容等信息,从而找出一定的模式和规则。由StephenTurner博士编制的免费个人软件Analog,是一个用来分析服务器日志文件的工具,它适用于Windows及Unix等操作系统中,由于它的使用较简单,可以直接在服务器上运行,也可以将日志文件下载到客户端,在客户端运行。比较适用于个人和小规模分析应用,是一个实用性很强的日志文件分析工具。从/上可免费获得该软件。5.3用户导航行为挖掘工具主要是对用户访问时留下的IP地址、访问日期和时间等信息进行挖掘,以找出对公司企业有用的信息。用户导航行为挖掘工具WUM(WebUtilizationMiner)是一种序列挖掘器。它主要用来分析用户导航行为的发现,它适用于从任何类型的日志文件中发现用户导航信息°WUM是一个对日志文件进行集成处理、查询及分析的工具,它的核心是MINT处理器,主要是对从web日志文件中提取的集成信息进行分析,从而发现导航模式。MINT是用于用户和挖掘器接口的语言,这种语言为用户提供了更为强大、灵活和全面的功能,它可以根据用户输入的语法标准进行以用户为前提的分析工具。正是因为WUM能提供较强大和灵活的功能,所以对用户也提出了较高的要求。要求用户掌握MINT语言,并具有能对挖掘结果进行分析处理所具备的知识°MINT语言语法是一个包含了SQL查询语句中变量和通配符的模板,它与SQL查询语言有类似的语法结构,对用户而言比较容易掌握和使用。可从网上免费获得软件MINT5.0的演示版本,其网址为:http://wum.wiwi.hu-berlin.de/。5.4综合性的Web数据挖掘工具综合性的Web数据挖掘工具主要是综合前面的挖掘工具功能,利用多种Web数据收集方法,包括高级网络收集、服务器收集器和服务器日志。AccrueInsight5是Accrue公司的主打产品。它是一个综合性的Web分析工具。常用Web数据挖掘平台资源MALLET[8]MALLET是一个机器学习的语言工具包,来自UMASS的AndrewMcCallum。用JAVA写成,除了支持CRF外,还支持topicmodel(可以用于LDA模型)和graphicalmodel。MinorThird[9]“一个用于存储文本收集的Java类,注释文字,学习以提取实体和分类文本”文档似乎是不错的:全面的Javadoc文档,教程,常见问题…有“频率频距”的概念(词频),可以用于基于内容的提取和分类存储的文件可以通过使用TextLabels进行独立的注释(标记,说,部分的语音和语义信息)Weka[10]Weka的全名是怀卡托智能分析环境(WaikatoEnvironmentforKnowledgeAnalysis),是一款免费的,非商业化(与之对应的是SPSS公司商业数据挖掘产品--Clementine)的,基于JAVA环境下开源的机器学习(machinelearning)以及数据挖掘(datamining)软件。它和它的源代码可在其官方网站下载。有趣的是,该软件的缩写WEKA也是NewZealand独有的一种鸟名,而Weka的主要开发者同时恰好来自NewZealand的theUniversityofWaikatc。WEKA作为一个公开的数据挖掘工作平台,集合了大量能承担数据挖掘任务的机器学习算法,包括对数据进行预处理,分类,回归、聚类、关联规则以及在新的交互式界面上的可视化。而开发者则可使用Java语言,利用Weka的架构上开发出更多的数据挖掘算法。读者如果想自己实现数据挖掘算法的话,可以看一看weka的接口文档。在weka中集成自己的算法甚至借鉴它的方法自己实现可视化工具并不是件很困难的事情。CLUTO[11]“一个用于聚类低维和高维数据集和分析各种群组特点的软件包’分割式的,凝聚的和图形分区算法各种相似性/距离度量许多选项/工具用于可视化和概括聚类结果wCluto:基于Web的应用程序CLUTOgCluto:跨平台图形化应用MG4J[12]MG4J是另一个搜索engine。与Lucene主要区别是,它提供了cluster功能,具有更OO的设计方式。MG4J可以让你为大量的文档集合构建一个被压缩的全文本索引,通过使内插编码(interpolativecoding)技术。虽然MG4J(ManagingGigabytesforJava)不是一个像Lucene、Egothor和Xapian那样的信息检索库,但是我们相信正在读这本书的每一位软件工程师都应该知道它,因为它对构建Java信息检索库提供了低水平的支持。MG4J是在一本很流行的书问世之后被命名的,这本书是由H.Witten,AlistairMoffat和Timothy所写,名字是《管理十亿字节:压缩并且索引文档和图片》。在使用他们的分布式、可容错的网页爬虫UbiCrawler收集到大量的网页数据后,它的作者需要一个软件来解析那些收集来的数据,由于这个需求,MG4J诞生了。MG4J的库提供了优化的类来处理I/O,转化索引文件的压缩等等。Web数据挖掘相关应用及技术前瞻7.1Web挖掘在搜索引擎方面的应用通过对网页内容的挖掘,可以实现对网页的聚类和分类。实现网络信息的分类浏览与检索。运用Web挖掘技术改进关键词加权算法。提高网络信息的标引准确度,改善检索效果。参与搜索服务市场的有多家实力企业,如Google、雅虎(Yahoo!以微软(Microsoft)等巨头企业,以及若干规模较小但有特定市场区隔或技术者如dTSearch、Copemic等。近期全力开发搜索技术的还包括IBM。7.2Web挖掘在电子商务方面的应用电子商务方面的Web挖掘功能主要是如下几个方面:首先,客户分类和客户聚类。◊其次是找到潜在的客户。◊最后保留客户的驻留时间7.3技术前瞻在未来一段时间内,Web挖掘研究的焦点可能会集中到以下几个方面:◊高性能Web搜索引擎。Web数据的特征描述与监控。Web数据的获取与集成。Web数据流挖掘。安全与非法访问检测。◊个性化与安全隐患。◊基于Web的模式分析技术和工具。Web挖掘的算法改进与质量评估。Web挖掘在社会领域的应用。此外,分布式Web挖掘、语义Web挖掘、无线网络下的Web挖掘、Web2.0时代的Web挖掘、多语言环境下的Web挖掘等是值得研究的方向。同时,Web挖掘技术应用于具体领域的研究将持续受到关注,例如,银行证券、企业ERP、医疗卫生、农业、电子商务、网络教学、BLOG等。结语Web挖掘技术是一个新兴的研究领域,对它的研究和应用正在成为一个热点。伴随着Internet的快速发

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论