已阅读5页,还剩86页未读, 继续免费阅读
(管理科学与工程专业论文)基于Crawler的Web服务搜索研究.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
、 、 i 、 e 少 r e s e a r c ho nw e bs e r v i c ed i s c o v e r yb a s e d at h e s i ss u b m i t t e dt o d a f i a nm a r i t i m eu n i v e r s i t y i np a r t i a lf u w f l l m e n to ft h er e q u i r e m e n t sf o r m a s t e ro fe n g i n e e r i n g b y x u d o n g f i ( m a n a g e m e n ts c i e n c ea n de n g i n e e r i n g ) t h e s i ss u p e r v i s o r :p r o f e s s o rc a oy a n m a y 2 0 1 1 , , l , i 。 l t 大连海事大学学位论文原创性声明和使用授权说明 原创性声明 本人郑重声明:本论文是在导师的指导下,独立进行研究工作所取得的成果, 撰写成博硕士学位论文 “基王! 型! 丛的盟盘腿丕建塞研究 。除论文中已经 注明引用的内容外,对论文的研究做出重要贡献的个人和集体,均已在文中以明 确方式标明。本论文中不包含任何未加明确注明的其他个人或集体已经公开发表 或未公开发表的成果。本声明的法律责任由本人承担。 学位论文作者签名:熔盔函 学位论文版权使用授权书 本学位论文作者及指导教师完全了解大连海事大学有关保留、使用研究生学 位论文的规定,即:大连海事大学有权保留并向国家有关部门或机构送交学位论 文的复印件和电子版,允许论文被查阅和借阅。本人授权大连海事大学可以将本 学位论文的全部或部分内容编入有关数据库进行检索,也可采用影印、缩印或扫 描等复制手段保存和汇编学位论文。同意将本学位论文收录到中国优秀博硕士 学位论文全文数据库( 中国学术期刊( 光盘版) 电子杂志社) 、中国学位论 文全文数据库( 中国科学技术信息研究所) 等数据库中,并以电子出版物形式 出版发行和提供信息服务。保密的论文在解密后遵守此规定。 不保密( 请在以上方框内打“ ) 论文作者签名:徐泵丽导师签名:嗜 日妇:7 矿1 1 年6 月巧日 一 。 i j t , 一 更 i 参 i 鼻 t 中文摘要 摘要 随着w e b 服务技术的不断发展,企业,组织或个人都可以根据w e b 服务规范 将某个商业应用或实现某个功能的应用程序发布为w e b 服务,并可选择发布方式, 规定允许被调用的用户范围等,从而被互联网中的用户发现并使用。但是随着目 前几个公用的u d d i 注册中心的关闭,最常用的基于u d d i 注册中心的w e b 服务 发现方式的弊端越来越明显。用户想要找到提供某个功能的w e b 服务经常要查找 多个u d d i 或代理中心,这些u d d i 或代理中心通常是提供分类浏览的查找方式, 因此查找过程需要花费大量的时间,甚至找不到需要的w e b 服务,具有较低的查 全率。基于通用搜索引擎的w e b 服务搜索虽然查全率高,但是往往搜索到大量无 用的信息,查准率比较低。因此w e b 服务搜索和发现成为w e b 服务发展的一个瓶 颈。 本文借助搜索引擎技术在w e b 资源搜索上强大的优势,设计了一个基于 c r a w l e r 的w e b 服务搜索模型,该模型利用专用的网络爬虫来搜索互联网上的w 曲 服务描述文档( w s d l ) ,通过筛选,从而提供一个w e b 服务信息库,供用户进行二 次检索和匹配。在设计专用搜索引擎时,首先设计网络爬虫,并对网页抓取和 w s d l 文档提取过程遇到的关键问题进行分析和设计;其次对w e b 服务信息库的 二次检索和匹配的策略进行分析和设计;最后主要实现专用搜索引擎模块来搜索 互联网上的w e b 服务。通过对搜索引擎中关键问题的分析和设计如基于二叉树存 储的u r l 消重策略的设计,基于十六叉树存储和遍历的d n s 缓存策略的设计等 提高了网络爬虫抓取网页的速度和效率;通过设计基于网页重要度的信息库更新 策略保证了w s d l 文档抓取的覆盖率和成功率,通过设计基于w o r d n e t 语义网和 最小生成树的w 曲服务聚类和匹配策略使用户检索w c b 服务时更方便,更准确。 通过对模型实现部分的w e b 服务抓取结果进行分析,表明该模型中设计的专用搜 索引擎在搜索w e b 服务时是有效的,并且具有较高的覆盖率。 关键词:w e b 服务发现;c r a w l e r ;w s d l ;网页重要度 囊 1 暑 曩 p 英文摘要 a b s t r a c t w i t ht h ec o n t i n u o u sd e v e l o p m e n to fw e bs e r v i c e s ,e n t e r p r i s e ,o r g a n i z a t i o no r i n d i v i d u a lc a np u b l i s hb u s i n e s sa p p l i c a t i o n so ra p p l i c a t i o np r o g r a m sa sw e bs e r v i c e s b a s e do nw e bs e r v i c e ss p e c i f i c a t i o n s ,t h e ya l s oc a nc h o o s et h ep u b l i s hw a y ,l i m i tt h eu s e r s c o p e a n ds oo n t h e nt h ei n t e m e tu s e r sc a nd i s c o v e r a n du s et h e s ew e b s e r v i c e s h o w e v e r w i t ht h ec l o s e do fs e v e r a lc o m m o nu d d ir e g i s t r yc e n t e r , t h e d r a w b a c k so fd i s c o v e rw e bs e r v i c e sb a s e do nu d d ii sb e c o m i n gm o r ea n dm o r e o b v i o u s t h eu s e r su s u a l l yn e e db r o w s em a n yu d d ir e g i s t r yc e n t e r st of i n dt h ew e b s e r v i c et h e yn e e d ,t h i sp r o c e s sc o s tal o to ft i m e ,a n dm a y b et h e yc a n tf i n di t t h i sw a y h a sl o w e rr e c a l lr a t e t h ew a yo fw e bs e r v i c e ss e a r c hb a s e do ng e n e r a ls e a r c he n g i n eh a s g o o dr e c a l lr a t e ,b u tb a dp r e c i s i o nr a t e s ow e b s e r v i c es e a r c ha n dd i s c o v e r yb e c o m e sa b o t t l e n e c kt ow e bs e r v i c e sd e v e l o p m e n t t h i sp a p e rd e v i s e saw e bs e r v i c es e a r c hm o d e lb e c a u s eo ft h ea d v a n t a g e so fs e a r c h e n g i n eo ns e a r c h i n gw e br e s o u r c e s t h i sm o d e ls e a r c ht h ew s d ld o c u m e n t so nt h e i n t e m e tu s i n gd e d i c a t e dw e bc r a w l e r ,t h e np r o v i d eaw e bs e r v i c ed a t a b a s et h r o u g h f i l t e r i n g t h eu s e r ss e a r c ha n df i n dw e bs e r v i c e f r o mt h i sd a t a b a s e w h e nd i v i s et h e d e d i c a t e ds e a r c he n g i n e ,t h i sp a p e rf i r s t l yd i v i s et h ew e bc r a w l e r ,a n a l y z ea n dd e s i g nt h e k e yi s s u e so fw e b c r a w la n dw s d lf i l t e r ;t h e na n a l y z ea n dd e s i g nt h es e c o n d a r ys e a r c h a n dm a t c h i n gs t r a t e g y ;f i n a l l y ,t h i sp a p e ri m p l e m e n t st h ed e d i c a t e ds e a r c he n g i n et o s e a r c hw e bs e r v i c e s t h i sp a p e rd e s i g nt h es t r a t e g i e sf o rr e m o v i n gd u p l i c a t eu r lb a s e do n b i n a r yt r e e ,c a c h i n gd n s b a s e do ns i x t e e nt r e ee t c t h i ss t r a t e g i e si n p r o v et h es p e e da n d e f f i c i e n c yo fw e bc r a w l e r ;t h es t r a t e g yf o rd a t a b a s eu p d a t i n gb a s e do np a g ei m p o r t a n c e e n s u r et h ec o v e r a g ea n ds u c c e s sr a t eo fc r a w l i n gw s d ld o c u m e n t s ;t h es t r a t e g yf o rw e b s e r v i c e sc l u s t e r i n ga n dm a t c h i n gc a nh e l pu s e r sf i n dw e bs e r v i c e sm o r ec o n v e n i e n ta n d m o r ea c c u r a t e ,t h i ss t r a t e g yi sb a s e do nw o r d n e ta n dm i n i m u ms p a n n i n gt r e e t h e a n a l y s i so fr e s u l t so fc r a w lw s d l d o c u m e n t sd e c l a r et h a tt h ed e d i c a t e ds e a r c he n g i n e i se f f e c t i v eo ns e a r c h i n gw e bs e r v i c e s ,a n dh a v eg o o dc o v e r a g er a t e k e yw o r d s :w e bs e r v i c es e a r c h ;c r a w l e r ;w s d l ;p a g ei m p o r t a n c e t ; t j | - 、 目录 目录 第1 章绪论1 1 1 研究背景及选题意义1 1 2w e b 服务搜索与发现研究现状l 1 3 研究内容及论文框架4 第2 章相关理论及技术6 2 1w e b 服务概述6 2 1 1w e b 服务的体系结构6 2 1 2w e b 服务标准描述语言( w s d l ) 7 2 2 搜索引擎8 2 2 1 搜索引擎基础8 2 2 2 基于网络爬虫的搜索引擎概述9 2 3 基于h t m l 网页的信息提取1 0 第3 章基于c r a w l e r 的w e b 服务搜索模型的研究与设计1 2 3 1 模型框架1 2 3 1 1 模型设计1 2 3 1 2 流程分析1 4 3 2 网络爬虫关键问题的分析与设计1 5 3 2 1 爬虫爬行策略设计1 5 3 2 2d n s 缓存设计2 0 3 2 3r o b o t 协议与蜘蛛陷阱分析2 6 3 2 4u r l 消重策略设计2 8 3 2 5 信息库更新策略设计3 3 3 3w s d l 文档的筛选4 1 第4 章w e b 服务的二次检索与匹配的设计4 2 4 1 基于w o r d n e t 语义网的w e b 服务聚类4 2 4 1 1w o r d n e t 语义网4 2 4 1 2 词语相似度的计算4 3 4 1 3 基于相似度构造特征词集合的最小生成树4 6 目录 4 1 4w c b 服务聚类4 7 4 2w c b 服务二次检索与匹配的设计4 9 4 2 1w e b 服务二次检索与匹配的策略设计4 9 4 2 2w e b 服务二次检索的流程5 0 第5 章基于c r a w l e r 的w e b 服务搜索模型的实现与评价5 2 5 1 开发环境5 2 5 2 数据库设计5 3 5 3 基于多线程的网络爬虫的设计与实现5 5 5 3 1 网络爬虫c r a w l e r 及多线程的设计与实现5 5 5 3 2 网页抓取模块6 0 5 3 3 网页解析模块6 4 5 3 4u r l 消重模块6 4 5 3 5w s d l 解析模块6 6 5 4 模型评价6 7 第6 章总结与展望6 9 参考文献7 1 、 攻读学位期间公开发表论文7 6 致谢7 7 矗 鲁 - j j 气 基丁c r a w l e r 的w e b 服务搜索研究 第1 章绪论 1 1 研究背景及选题意义 w e b 服务与其他技术的出现方式不同,它是由很多大中型企业用户发起的, 是应大多数企业在网络时代和网络经济中的需求而产生的。w 曲服务的应用范围 非常广泛,特别在软件重用,应用程序集成,b 2 b 集成,跨越防火墙的通信等领 域,发挥着与众不同的作用【i 】。随着w e b 服务技术的快速发展,各组织和企业纷 纷开发w e b 服务,并发布到网络上,于是出现了越来越多的w e b 服务。这些w e b 服务形式和复杂程度各不相同,它们有的被发佰到公共注册中心,所有网络用户 都可以使用;有的只发布到了某个局域网上,但是并没有限制用户;有的却规定 了用户范围等等。如何发现互联网上分散分布的形式各异,功能各异的w e b 服务, 并从中匹配得到最适合用户需求的w e b 服务是制约w e b 服务广泛应用和继续发展 的一个瓶颈,也是当今有关w e b 服务的一个研究热点。 w e b 服务的搜索和发现是w e b 服务调用的前提,而服务的调用又是依托服务 的描述文档w s d l ( w e bs e r v i c e sd e s c r i p t i o nl a n g u a n g e ,w e b 服务描述语言) 的, 因此w e b 服务的搜索和发现主要是搜索和发现w s d l 文档。搜索引擎技术是目前 w e b 资源搜索的一个最具优势的技术,因此本文将建立一个基于爬虫搜索引擎的 w e b 服务搜索和发现模型来搜索w e b 上的w s d l 文档,以此来研究如何更快速, 更准确地进行w e b 服务搜索和发现。希望通过本文的研究,能对w e b 服务的发展 起到推进作用。 1 2w e b 服务搜索与发现研究现状 目前,人们提出了很多w e b 服务搜索和发现的方式方法,例如基于u d d i 注 册中心的发现方式,基于w e b 服务代理中心的发现方式,通过建立专用搜索引擎 的搜索方式,使用通用搜索引擎的搜索方式等等。人们基于这些方式提出了很多 w e b 服务搜索和发现的模型和机制,它们有的使用了空间向量模型技术,有的使 用了语义技术,有的使用了分类技术等等,很多模型和机制也只是被理论上提了 第1 章绪论 出来,但是却不具有可操作性。尽管这些方式方法都有自己的优势,但是它们的 缺点却也严重地阻碍了w e b 服务的搜索和发现。 目前在实际当中应用最广泛的就是基于u d d i 注册中心的w 曲服务查找和发 现。u d d i 注册中心根据商业目的,对w e b 服务进行预先分类,然后w e b 服务提 供者在注册w e b 服务时,根据u d d i 中的分类标准将w e b 服务注册到不同的种类 中【2 1 。因此,用户在u d d i 注册中心查找w e b 服务时必须非常了解该u d d i 注册 中心的分类标准,并需要人工过滤掉大量不需要的w e b 服务。每个u d d i 注册中 心中的w e b 服务数量有限,用户想找到符合需求的w e b 服务往往需要在多个u d d i 注册中心中查找,需要花费大量的时间。u d d i 注册中心只提供了分类查找和简单 的基于关键字的查找,查询能力非常有限。因此,基于u d d i 注册中心w e b 服务 搜索和发现存在很多缺陷,查全率和查准率都不高。目前,微软,i b m ,s a p 提 供的u d d i 服务都已经停止了。 w e b 服务代理中心的w e b 服务发现方式与u d d i 注册中心的发现方式比较接 近,w e b 服务代理中心主要是指一些专门提供w e b 服务的网站,如x m e t h o d s 3 1 , w e b s e r v i c e l i s t 4 1 ,r 舢t e m e t l l o d s 【5 1 ,x i g n i t e 等。这些代理中心没有像u d d i 注册 中心那样需要遵守一定的规范和标准,因此这些代理中心的很多w e b 服务都是不 可用,它们有些是公司出于宣传的目的只是提供了一些描述信息,并没有提供实 际的功能。并且有些代理中心长期没有更新,存储的都是一些过期的不可用的信 息。w o o g l e 6 】和b i n d i n g p o i n t t 7 】开放了几年就关闭了。x m e t h o d s 只是提供一个w e b 服务的列表,用户需要逐一查找每个w e b 服务,需要耗费大量的时间。 w e b s e r v i c e l i s t 提供的w e b 服务虽然可以根据目录分类和关键字查询,但是已经 有5 年没有更新过了。可见,基于代理中心的w e b 服务搜索和发现仍旧存在很多 弊端。 一种借助v s m ( v e c t o rs p a c em o d e l ,空间向量模型) 进行w e b 服务发现与搜索 的方式被很多人提出。这类方法大部分都是将一个w e b 服务的描述文档w s d l 文 档进行解析,提取关键字,将每个w e b 服务或服务的元素看做一个向量,通过计 算两个向量夹角余弦值来判断两个向量的相似度。这类方法大都针对u d d i 注册 月 善 _ l 基于c r a w l e r 的w e b 服务搜索研究 中心的w e b 服务进行搜索。例如,文献 8 】提出了一种基于v s m 的搜索引擎架构。 该架构中的w e b 服务来源主要是来自u d d i 注册中心,还有来自用户注册的。文 献【9 】提出了一种基于方法分类的w e b 服务搜索模式,该模式根据w e b 服务的描 述信息,提取出w e b 服务提供的功能。然后将网络中所有w e b 服务映射为一个空 间向量组,其中每个向量是一个功能,并根据这些功能的相关性进行聚类。当用 户搜索w e b 服务时,只需要输入功能需求关键字,系统根据功能相关性与空间向 量组中的功能进行匹配,从而搜索出需要的w e b 服务。这类方法的前提是已经拥 有所有的w e b 服务,因此怎么得到这些w e b 服务仍是一个难题。 目前也有很多人提出了基于搜索引擎技术的w e b 服务搜索。例如w s c e ( w e b s e r v i c ec r a w l e re n 西n e ) 系绀1 0 】就是一个基于搜索引擎的w e b 服务发现系统,该系 统从各个分散的u d d i 注册中心中获取w e b 服务,利用元搜索的思想对这些u d d i 注册中心中的w e b 服务实现元搜索,建立统一访问和查询接口。这种方法相对来 说具有了较高的查全率,因为它集成了u d d i 注册中心的w e b 服务,比起一个一 个的浏览要方便很多,但是很多w e b 服务并没有被发布到u d d i 注册中心,因此 w s c e 也错失了很多w e b 服务。与w s c e 比较类似的w 曲服务搜索系统s o u s u o 【l i i 也是采用了元搜索的思想,但是该系统的w e b 服务来源不仅仅是u d d i 注册中心, 还通过搜索引擎中的爬虫对本体,科学文献中的w e b 服务描述文档进行搜索,从 而也把语义概念引入其中。该系统相对来说,在一定程度上提高了查全率,但是 仍然有很多在互联网上分散发布的w e b 服务没有被搜索的机会。 s d 2 s 搜索引擎原型系统【1 2 】中通过手工上传u r l 链接作为种子站点,然后利 用搜索引擎技术搜索g o o s e 网页和w s i l ( w e bs e r v i c e si n s p e c t i o nl a n g u a g e ,w e b 服务查询语言) 文档,提取网页和文档中的链接,并筛选出w e b 服务的描述文档 如w s d l 、o w l s 、w s m l w s m o 、w s c d l 等类型的文档。然后利用w s i l 将 属于同一w e b 服务的不同文档找出来形成一组,并与该服务的w s i l 文档对应起 来,从而实现将w s i l 文档作为索引来检索所有w e b 服务。该种方法的w e b 服务 来源也仅限于g o o g l e 和w s i l 文档,虽然在很大的程度上提高w e b 服务的覆盖率, 但是仍然不够全面。 第1 章绪论 m e r o b a s e 搜索引擎【1 3 】是对g o o g l e 网页源码进行w e b 服务描述文档w s d l 进 行抓取,并对抓取到w s d l 文档进行验证,看其描述的w e b 服务是否可用,从而 通过搜索引擎技术提供一个w e b 服务信息库。之后利用基于名字和基于接口的关 键字检索方式对该信息库中的w e b 服务进行匹配。该w e b 服务搜索系统在查全率 和查准率上都有极大的提高。 目前已经有很多考虑语义的w e b 服务搜索和发现的模型和思想,例如文献 1 4 】 就提出了一种基于q o s 的语义w e b 服务搜索系统,该系统中将w e b 服务描述文档 进行解析,得到其功能部分和相关的q o s 信息,这些q o s 信息有的来自该服务提 供商保证的q o s 标准,有的来自用户的评价信息,有的来自第三方的监督检测信 息。在用户从该系统查询w e b 服务时,首先将用户需求与w e b 服务进行语义匹配, 匹配过程主要考虑功能和q o s 两个方面【l 5 1 。 目前基于语义的w e b 服务检索与匹配技术主要有两种方式,一种是基于本体 的技术,一种是基于分类的技术。基于本体的方式由多种多样,但主要有两种, 一种是从现有本体中获取语义信息,给自己的w e b 服务添加标识【1 铊0 1 。目前,已 经成型的本体也并不完善,本体技术还不成熟。另一种是根据w e b 服务的相关信 息进行分析与理解后,自己建立本体,自建本体是一个相当复杂的工程,而且要 耗费大量的资源和时间【2 1 , 2 2 】。所以,基于本体的语义w e b 服务发现与匹配的方式 虽然能极大的提高w e b 服务的查准率,但是比较难以实现。另一种基于语义聚类 的技术大多借助w o r d n e t 语义网,根据w o r d n e t 计算w e b 服务的语义距离进行聚 类。这种方式相对本体具有可操作性,并且查准率也得到了很大提高。 最后还有基于通用搜索引擎的w e b 服务搜索方式,这种方式主要是通过像百 度,g o o g l e 等通用搜索引擎直接搜索w e b 服务,这种方式虽然具有很高的覆盖率, 但是往往搜索到大量无关的信息,查准率相当低。 1 3 研究内容及论文框架 通过对w e b 服务的搜索和发现现状的研究得知,尽管目前出现的w e b 服务搜 索和匹配方法各有优缺点,但是基于搜索引擎技术的w e b 服务搜索具有明显的优 膏 i _ , 基于c r a w l e r 的w e b 服务搜索研究 势,能扩大w e b 服务的覆盖率。基于语义的w e b 服务匹配在从大量的w e b 服务 中匹配出最符合用户需求的w e b 服务时具有较大优势,能更准确地找出与用户需 求最接近的w e b 服务。 本文首先对搜索引擎技术和w e b 服务相关技术展丌研究,最终建立了一个基 于爬虫搜索引擎的w e b 服务搜索和发现模型。本文的论文研究内容框架如图1 1 : 研究背景与现状分析 理论及技术研究 。、擎) o ( 基丁爬虫搜索引擎的w e b 服务搜索模型) u ( 模型框架分析与设计) ( 专用搜索引擎设计 ) ( 网络爬虫设( d n s 缓存设计 ( u r l 消重策略设i 叼 ( 信息库重访策略设计) ( w e b 服务筛选 ) u w e b j j l i 务的次检索与匹配研究 ( w e b 服务聚类 ) ( w e b 服务匹配 ) u 模型实现 ( 数据库设计 1 ) f 专用搜索引擎实现 ( w e b 服务信息库 ) ( 模型评价 1 ) 1 l 总结 图1 1 论文框架图 f i g 1 1f r a m e w o r k o ft h et h e s i s 第2 章相关理论和技术 2 1w e b 服务概述 第2 章相关理论及技术 2 1 1w e b 服务的体系结构 w e b 服务的体系结构的基本原理是基于i n t e r n e t 协议和s o a ( s e r v i c e o r i e n t e d a r c h i t e c t u r e ,面向服务架构) 的,该体系结构是一个基于标准的和采用这些标准的 技术的可集成应用程序解决方案。由于w e b 服务采用通用标准和协议,并且实现 w e b 服务的技术又是遵守这些标准和协议的,这就确保了w e b 服务应用程序的实 现方案和标准规范的兼容,从而为w e b 服务应用程序与其他兼容应用程序的互操 作奠定了基础。 典型的w e b 服务体系结构模型中有三个核心的组件,这些组件通过角色和操 作来完成w e b 服务的工作。其中,角色指不同类型的实体,操作则是指这些实体 完成的功能。w e b 服务的模型如图2 1 所示: 图2 1w e b 服务模型 f i g 2 1w e b s e r v i c em o d e l w e b 服务体系结构主要有三种角色,即服务提供方,服务代理方和服务请求 方。其中服务提供方负责创建w e b 服务,将w e b 服务应用程序发布为基于s o a p 的接口,使其可被网络上的其他用户访问,并将w e b 服务部署到服务容器。服务 容器充当w e b 服务的运行时环境,用来部署和管理w e b 服务。服务提供方采用基 - l 鲁 1 基于c r a w l e r 的w 曲服务搜索研究 于w s d l 的文档来描述w e b 服务,使用统一的方法来标识w e b 服务所在位置, 提供的功能操作和通信模式等。服务代理方提供已发布的w e b 服务,负责存储和 管理由服务提供方提供的服务描述,并将这些描述存储为w s d l 的u r l 。服务代 理方充当代理,为服务请求方提供查找w e b 服务的统一访问入口,通常为他们提 供一种易于查找的访问机制。服务请求方又称服务消费者,通过查询w e b 服务代 理中心查询所需要的w e b 服务,通过u r l 定位w e b 服务的描述文档w s d l ,并 获得绑定信息。然后通过绑定信息激活服务提供器,创建客户端代理应用程序, 实现基于s o a p 的通信。 2 1 2w e b 服务标准描述语言( w s d l ) w s d l 是由m i c r o s o f t ,i b m ,a r i b a 等公司发布的w e b 服务的描述语言,w e b 服务提供商使用w s d l 文档来描述提供的w e b 服务,w e b 服务使用者根据w s d l 文档调用w e b 服务。w s d l 文档是一份平台无关的x m l 文档,用于描述、定位 网络上提供的w e b 服务,它详细定义了w e b 服务的位置,该w e b 服务所提供的 操作( 或方法) ,以及调用这些操作( 或方法) 的方式【2 3 】。w s d l 是w e b 服务的 描述语言之一,每个w e b 服务都有一个w s d l 文档用来描述该w e b 服务。w s d l 文档中s e r v i c e 元素定义了一个服务访问点的集合,包含了w e b 服务四个方面的重 要信息:可公开使用的全部功能的描述信息;上述功能操作的输入输出消息及其 数据类型;调用该w e b 服务的绑定类型和绑定信息:该w e b 服务所在地址信息。 一个w s d l 文档定义了一个w e b 服务,服务由不同的端口组成( p o r t ) ,一 个端口由个网络地址和一个绑定( b i n d i n g ) 组成,绑定定义了服务请求者连接 该端口时具体的传输协议和编码协议,通常是h t t p 和s o a p 两种通用的协议1 2 4 1 。 一个w s d l 文档通常包含以下几个元素【2 5 】: ( 1 ) d e f i n i t i o n s :该元素是w s d l 文档的根元素,它定义w e b 服务的名称,并 声明w s d l 文档的命名空间。 ( 2 ) t y p e s :该元素描述了w e b 服务和服务使用者交换的消息的数据类型,一 般都是符合x m ls c h e m a 规范。 第2 章相关理论和技术 ( 3 ) m e s s a g e :该元素代表所传输数据的逻辑定义,由一个或多个 构成, 每个 代表一个请求或响应的单向消息。 ( 4 ) p o r t t y p e :该元素描述w e b 服务可被调用的操作 和相关的抽象 消息。每个 均为输入消息和输出消息。 ( 5 ) b i n d i n g :该元素为p o r t t y p e 元素所定义的操作和消息指定需要绑定的具体 的网络传输协议,其中, 元素用于完成操作和具体实现之间的绑定。 ( 6 ) s e r v i c e :该元素用于描述w e b 服务的访问入口,一个s e r v i c e 元素可以包 含多个 子元素,每个 p o 胗元素描述了一个访问入口点。 其中,m e s s a g e 元素定义操作的交互方式,而p o r t t y p e 元素则代表了允许远 程调用的操作的集合,这两个元素一起进行抽象定义服务接口;b i n d i n g 元素定义 了使用的通信协议,底层通信协议和数据编码模型,而s e r v i c e 元素则将绑定机制, 服务访问协议和端点地址结合在一起,这两个元素一起定义了服务实现【2 6 】。 2 2 搜索引擎 2 2 1 搜索引擎基础 搜索引擎是一种搜索工具,它以一定的策略在互连网上搜集、发现资源,并 对所收集到的资源进行理解、提取、组织和整合,并为用户提供检索服务,是帮 助用户在互联网上找到所需信息与资源的一种有用的工具【2 7 1 。 搜索引擎系统按照信息搜集方法和服务提供方式的不同,可以分为三大类 2 s , 2 9 : ( 1 ) 目录式搜索引擎:该类搜索引擎提供基于目录浏览信息的检索方式,信息 大多面向网站,这些网站按照一定的分类标准和分类体系被人为分类,并且这些 信息的搜索也大量的依赖人力,有人工方式或半自动方式,所以目录式搜索引擎 加入了人的智能。因此具有信息准确,分类清晰等优势,但是需要耗费的人力, 资源更新不及时,更新周期长。y a h o o ,l o o k s m a r t 等就是典型的目录式搜索引擎。 ( 2 ) 爬虫搜索引擎:该类搜索引擎利用网络爬行器( c r a w l e r ) 从互联网上自动爬 取,收集,下载网页等资源,并将这些资源自动存储到索引数据库中供用户查询。 l | - , 4 基于c r a w l e r 的w e b 服务搜索研究 网络爬行器又叫网络蜘蛛,机器人等,它采取的爬行策略决定了爬行效率和质量, 索引数据库采取的索引策略极大的影响着用户查询信息的准确度和效率。这种搜 索引擎很少依靠人力干预,提供的资源丰富,并且更新及时,但是由于信息量过 大,也给用户检索带来了定的困扰,往往得到很多无用的信息。g o o g l e ,百度, 北大天网等就是典型的机器人搜索引擎。 ( 3 ) 元搜索引擎:该类搜索引擎所做的工作只是提供一个统一的检索界面,它 的资源来自多个其他搜索引擎搜索的结果,自己并没有去互联网上搜索资源。元 搜索引擎将多个搜索引擎的搜索结果进行排除重复信息,重新排序等处理,返回 给用户。这类搜索引擎的优点是资源覆盖率高,不用自己维护庞大的索引数据库, 节省资源,但是后期结果处理也是一项庞大复杂的工作。例如,w e b e r a w l e r 、 i n f o m a r k e t 等就是元搜索引擎。 2 2 2 基于网络爬虫的搜索引擎概述 基于爬虫的搜索引擎一般由爬行器,索引数据库和用户查询接口三部分组成, 其中爬行器负责从互联网上搜集资源,它依据网页链接在网络上爬行,从特定的 页面开始,读取网页文本内容,提取其中的其他链接,然后继续访问这些链接对 应的网页,一直循环下去,直到满足停止条件为止。理论上,网络爬虫似乎可以 抓取互联网上的所有网页,但是这几乎是不可能的,受到抓取技术的限制,网络 爬虫是无法遍历所有网页的,因为许多网页的链接是无效的。 网络爬虫将网页下载下来以后,采取一定的策略和技术将网页的文本文档分 析处理后建立索引数据库,采用的什么样的方式建立索引直接影响到用户查询的 时间和效率。索引数据库的格式是一种依赖于索引机制和算法的特殊数据存储格 式。一个好的索引模型应该易于实现和维护,检索速度快,空间需求低。搜索引 擎普遍借鉴了传统信息检索中的索引模型,如倒排索引,矢量空间模型等。 最后,搜索引擎程序将用户输入的查询关键字词与索引数据库中的文档采取 某种技术进行匹配,并将匹配结果按一定的优先算法或检索算法排序后呈现给用 户【3 m 。基于爬虫的搜索引擎的框架如图2 2 所示: 第2 章相关理论和技术 厂资源存储- n 信息采集、 用户检索 信息处理 建立索引 1 八 检索、1 网络爬虫排序 弋_ 矽 图2 2 爬虫搜索引擎框架 f i g 2 2c r a w l e r s e a r c he n 舀n e 丘a m e 、釉d 【 网络爬虫在互联网中沿着网页的链接并按照某种遍历策略来抓取网页,通常 网络爬虫有以下几种爬行策略【3 l 】: ( 1 ) 深度优先策略:是指网络蜘蛛从起始页开始,沿着链接纵向一层一个链接 地访问下去,直到这条线路的叶子结点,处理完一条线路之后再从另一个起始页 开始纵向跟踪链接。深度优先策略能使网络爬虫访问到较深层次的链接,但是容 易陷入链接深层出不来。 ( 2 ) 广度优先策略:是指网络爬虫从起始页开始,沿着横向访问完一层的所有 链接后才会访问下一层次的链接,即先将起始页包含的所有链接都访问完后再选 择其中一个链接对应的h t m l 文档包含的链接进行逐一访问。这种方法的特点是容 易实现,并且可以采用并行处理的方式,以提高网络爬虫的抓取速度。 ( 3 ) 启发式搜索策略:这种策略的思想来自人工智能,即先通过在线获得的领 域知识来评价待访问链接,从而推断出信息资源的价值,然后按一定的原则选择 价值最大的链接进行下一步的搜索,从而找到到达目标结点的最佳路径,删除不 好结点,保留那些好的结点,该算法主要用于主题爬虫【3 2 1 。 2 3 基于h t m l 网页的信息提取 w e b 的快速发展使得w e b 上的信息呈现指数级增长,由于w c b 文档大多采 用超文本标记语言( h y p e rt e x tm a r l 唧l 觚g u a g e ,简称h t m l ) 来描述,方便浏览, 鼻 f - , l 膏 _ 基于c r a w l e r 的w e b 服务搜索研究 但是缺乏对数据本身的描述,不具有语义信息,使得人们利用w e b 上信息变得相 当困难。如何去除w e b 上的噪音内容从而提高w e b 信息的利用率和检索准确性成 为w e b 信息提取的重要环节。w e b 信息提取是信息抽取的一种,它将w e b 作为信 息源,从w e b 文档中采取一定策略抽取出相关数据,并将这些数据处理后组织为 更结构化,语义更清晰的数据结构。w e b 信息提取是信息检索,数据挖掘,机器 翻译等的基础【3 3 1 。 w e b 上的信息具有如下特剧蚓: ( 1 ) 数据的非结构化与半结构化:h t m l 页面集声音、图片、文本等数据为一 体,数据与结构混合在一起,因此是一种非结构化的数据,但是h t m l 文档又按 照一定的规则将数据或链接组织成具有层次和结构的文档,虽然没有结构化数据 那样严谨,但是又有一定的结构,所以h t m l 文档又是半结构化的。 ( 2 ) 数据源多样性:w e b 上的信息既有存储在h t m l 页面中的,也有来自后台 数据库的。通过查询,可以用h t m l 页面将后台数据库中的数据显示出来,从而 实现数据的共享。 ( 3 ) 信息的动态性:网站上的信息经常发生变动和更新,这些变动正是通过w e b 页面的内容变化和组织结构变化体现出来的,因此w e b 上的信息是动态的。 网络爬虫在互联网上爬取到大量的w e b 文档,这些文档大多是h t m l 格式的 文档,如何从这些h t m l 文档中提取出继续爬行需要的u r l 链接也是w e b 信息 提取的范畴。 h t m l 是基于标准通用标记语言(
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年黑龙江省虎林市高三数学下册期末考试模拟检测卷附参考答案(研优卷)
- 2026年黑龙江省讷河市高三数学下册期末考试模拟卷附答案(典型题)
- 2026年黑龙江省铁力市高三数学下册期末考试模拟卷含答案【B卷】
- 2026年黑龙江省铁力市高三数学下册期末考试模拟测试卷附完整答案(易错题)
- 保险经纪人从业资格考试保险市场风险管理重点难点模拟试卷
- 南京鼓楼区2026-2027学年五年级上册语文10月月考质量检测卷
- 保险代理人资格考试科目一保险基础知识模拟试卷
- 物业社区活动组织与管理方案
- 物业社区绿化维护可持续发展方案
- 雪亮乡村建设实施方案
- 中国电信湖南校招笔试题
- 托育食品安全课件
- 人工智能与未来 课件 8.2 计算机视觉概述
- 2025 初中一年级语文下册《台阶》细节描写作用课件
- 彩票合伙合同协议书
- 企业管理-采购腹腔镜训练器的申请报告
- 自动化技术规范
- T-CICC 35007-2025 金属材料 疲劳试验小样本数据统计分析方法
- HJ 169-2018建设项目环境风险评价技术导则
- 机械表维护知识培训课件
- GJB1406A-2021产品质量保证大纲要求
评论
0/150
提交评论