(计算机应用技术专业论文)垂直搜索引擎技术的研究和应用.pdf_第1页
(计算机应用技术专业论文)垂直搜索引擎技术的研究和应用.pdf_第2页
(计算机应用技术专业论文)垂直搜索引擎技术的研究和应用.pdf_第3页
(计算机应用技术专业论文)垂直搜索引擎技术的研究和应用.pdf_第4页
(计算机应用技术专业论文)垂直搜索引擎技术的研究和应用.pdf_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 摘要 互联网的信息量呈爆炸趋势增长,增强了人们对搜索技术的依赖性。搜索引 擎是开启网络知识殿堂的钥匙,获取知识信息的工具。但随着网络技术的飞速发 展,获取更加准确、更加详细、更加深层的专业信息,成为对搜索引擎提出的新 要求。因此,面向主题的垂直搜索引擎系统应运而生。 本文主要的研究工作分为两个部分:第一部分通过理论研究分析,揭示垂直 搜索引擎的现实意义;第二部分通过对垂直搜索擎的核心技术进行剖析,结合对 奥运信息的需求,设计并实现一个垂直搜索引擎的原型系统。主要内容为: ( 1 ) 详细介绍了垂直搜索引擎技术的研究意义,国内外发展现状、基本原 理。提出了目前搜索引擎所面临的问题以及解决问题的途径,即本文所研究的方 向:垂直搜索引擎。通过和搜索引擎在信息服务和关键技术上的比较分析,指出 垂直搜索引擎的巨大优势。重点论述了垂直搜索引擎的基本原理和工作流程。 ( 2 ) 垂直搜索引擎的关键问题研究,重点论述垂直搜索引擎设计与实现时 的关键问题:信息采集技术,信息预处理技术等。 作为主题网络蜘蛛搜索策略的核心部分,主题相关性判断算法是网络蜘蛛能 够围绕设定主题进行聚焦检索的关键。对于网页的主题相关性判别,使用目前较 为常用的向量空间模型进行判别。网络机器人在爬行时要不断地计算当前网页的 主题相关度数值,并根据数值评价网页的主题相关度,因此,它可以有效地避开 大量无关主题区域,搜索出特定主题领域内的相关网页。所以,垂直搜索引擎的 准确率、召回率和效率都远胜于通用搜索引擎。 ( 3 ) 具有垂直搜索引擎功能的奥运信息系统的设计与实现,根据前文的理 论分析和当前搜索引擎技术的发展现状,按照软件工程的方法,研究并实现奥运 信息搜索引擎的原型系统。设计过程重点论述了系统主要功能模块和关键技术的 实现。 关键词垂直搜索引擎;网络机器人;主题相关;奥运信息 a b s t r a c t a b s t r a c t w i t ht h ei n c r e a s i n go fi n t e r n e ti n f o r m a t i o n ,p e o p l eb e c o m em o r ea n d m o r ed e p e n d a b l eo nt h ei n t e r n e ts e a r c he n g i n e ,w h i c hb e c o m et h ek e yt o o p e nt h ek n o w l e d g ep a l a c ea n dt h et o o lt og e tt h ek n o w l e d g e b e c a u s et h e i n t e r n e ti n f o r m a t i o ni sp l e n t y ,a n du s e r so f t e nf i n di t d i f f i c u l tt o s e a r c hf o ru s e f u la n dh i g h q u a l i t y i n f o r m a t i o no nt h ew e b u s i n g g e n e r a l p u r p o s es e a r c he n g in e s ,e s p e cia llyw h e ns e a r c h in gf o rs p e clf ic i n f o r m a t i o no nag i v e nt o p i c s ot h ev e r t i c a ls e a r c he n g i n e se m e r g ea s t h eti m e sr e q u i r e t h ep a p e ri n c l u d e st w op a r t s :t h ef i r s tp a r ts h o w ss i g n i f i c a n c eo f t h ev e r t i c a ls e a r c h i n ge n g i n e :t h es e c o n dp a r tc o n s t r u c t sap r o t o t y p e s y s t e mo fo l y m p i cg a m ei n f o r m a t i o ns e r v i c ev e r t i c a l s e a r c he n g i n eb y t h e o r e t i ca n a l y s i sa n da c c o r d i n gw i t ht h er e q u i r e m e n tf o ro l y m p i cg a m e i n f o r m a t i o n t h ef o l l o w i n gc o n t e n t sa r er e s e a r c h e di nd e t a i l : ( 1 ) i th a si n t r o d u c e dt h er e s e a r c hs i g n i f i c a n c e ,t h ep r i n c i p a l ,b a s i cw o r k p r o c e s s , i nw h i c hh a sp o i n t e do u tt h e p r o b l e ma tp r e s e n tt h a th e c o m p r e h e n s i v es e a r c he n g i n ef a c e sa n dt h er o u t et os o l v et h i sp r o b l e m t h a ti st h ed i r e c t i o no ft h ed i s s e r t a t i o ns t u d i e s :v e r t i c a ls e a r c he n g i n e t h r o u g ht h ec o m p a r a t i v ea n a l y s i sw i t hc o m p r e h e n s i v es e a r c he n g i n ei n i n f o r m a t i o ns e r v i c ea n dk e yt e c h n o l o g y ,i tp o i n t so u tt h a tt h ev e r t i c a l s e a r c he n g i n ei sp r o v i d e dw i t he n o r m o u sa d v a n t a g e t h ep r i n c i p a la n dw o r k f l o wo fv e r t i c a l s e a r c he n g i n ei sd e t a i ld i s c u s s e d ( 2 ) t h ek e ya r i t h m e t i cm e t h o d so fv e r t i c a ls e a r c h e n g i n ea r ed e t a i l d i s c u s s e de s p e c i a l l yp a g ea n a l y s i sa n d1 i n ka n a l y s i st e c h n o l o g y a st h ek e yc o m p o n e n to fs e a r c hs t r a t e g yi nt o p ic o r ie n t e dw e bs p i d e r , t h et o p i cr e l a t i v i t yj u d g i n ga l g o r i t h m se n s u r et h ef o c u s e dw e bc r a w l i n g p r o c e s so ft h es p i d e r t h ep o p u l a rv e c t o rs p a c em o d e li su s e dt oc l a s s i f y h t m lp a g ef r o md i f f e r e n tt o p i c s s p i d e rc a l c u l a t e st h et o p i cr e l a t i v i t yv a l u ew h e nc r a w l i n g ,a n de v a l u a t e t h et o p i cr e l a t i v i t yo ft h ep a g e s oi t sc r a w la v o i d si r r e l e v a n tr e g i o n s o ft h ew e b a so n l yr e l a t e dp a g e sa r ec r a w l e d ,a c c u r a c ya n de f f i c i e n c y o fv e r tic a ls e a r c he n g i n e sh a v ei m p r o v e dr e m a r k a b l y ( 3 ) t h ed e s i g na n dr e a l i z a t i o no fo l y m p i cg a m ei n f o r m a t i o ns e r v i c e i i i 北京丁业火学t 学颀:i j 学位论文 p r o t o t y p es y s t e m t h es y s t e m isd e s ig n e da c c o r d in gt ot h es o f t w a r e e n g i n e e r i n g t h ed e s i g nc o n t e n ti n c l u d e sm a i nf u n c t i o nm o d u l e t h e nt h e r e a l i z a t i o nt e c h n o l o g yi sd i s c u s s e di nd e t a i l k e y w o r d sv e r t i c a ls e a r c he n g i n e :s p i d e r :t o p i cr e l a t e d :o l y m p i cg a m e i n f o r m a t i o n i v 独创性声明 本人声明所呈交的论文是我个人在导师指导下进行的研究工作及取得的研 究成果。尽我所知,除了文中特别加以标注和致谢的地方外,论文中不包含其他 人已经发表或撰写过的研究成果,也不包含为获得北京工业大学或其它教育机构 的学位或证书而使用过的材料。与我一同工作的同志对本研究所做的任何贡献均 已在论文中作了明确的说明并表示了谢意。 签名: 关于论文使用授权的说明 本人完全了解北京工业大学有关保留、使用学位论文的规定,即:学校有权 保留送交论文的复印件,允许论文被查阅和借阅;学校可以公布论文的全部或部 分内容,可以采用影印、缩印或其他复制手段保存论文。 ( 保密的论文在解密后应遵守此规定) 签名:砰洫导师签名:日期:型 第l 章绪论 第1 章绪论 1 1 垂直搜索引擎的研究意义 随着网络与通信技术的迅速发展,w e b 信息爆炸性的增长,互联网已经成为 一个巨大的海量信息空间。如何快速、准确、方便的从如此庞大的信息库中获取 自己需要的信息,是互联网用户面临的一个重要问题。 搜索引擎的出现,整合了众多网站信息,极快的查询起到了信息导航的作用, 信息的价值得到众多商家的普遍认可,成为互联网中最有价值的领域。大家熟知 的搜索引擎g o o g l e 、百度、雅虎等都是搜索引擎的杰出代表,为互联网的发展 做出了重要的贡献。c n n i c 第十四次互联网调查显示,搜索以7 1 9 的绝对优势 成为用户从互联网上获得信息的主要方式,是互联网上使用程度仅次于电子邮箱 的服务。该中心2 0 0 6 年9 月发布了2 0 0 6 年中国搜索引擎市场调查报告,报告 显示搜索引擎用户对搜索引擎的依赖性很高,每次上网都要用到多次搜索的比例 达到4 4 2 ,接近一半乜1 。互联网的信息量呈爆炸趋势增长,几年前全球式搜索 引擎收录的网页量只有几千万页,而现在已经达到几十亿页,数量增加带来的是 搜索服务的品质下降,查询的结果集就是海量的,经常是几十万笔的资料,结果 里存在大量的重复信息和垃圾信息,用户迅速地找到符合自身的信息越来越难, 现在经常使用搜索引擎可以感觉到很难在短时间内准确的筛选出需要的内容,因 此,如何对通用搜索引擎技术进行改进,使查询的结果集更加贴近用户的要求, 成为搜索引擎行业近期的研究热点,这时垂直搜索应运而生。 所谓垂直搜索,是针对某一特定领域、某一特定人群或某一特定需求提供的 有一定价值的信息和相关服务。其特点就是专、精、深,且具有行业色彩。它是 与通用搜索引擎截然不同的引擎类型。垂直搜索引擎专注具体、深入的纵向服务, 致力于某一特定领域内信息的全面和内容的深入,这个领域外的闲杂信息不收 录。普通的网页搜索以综合搜索、横向搜索为主要特点,在满足搜索信息量大的 同时却难以兼顾搜索的准确度与相关度的质量,很难满足追求精准的个性化、专 业化搜索需求。总的来说,垂直搜索( v e r t i c a ls e a r c h ) 是针对某一个行业的 专业搜索引擎,是搜索引擎的细分和延伸,是对网页库中的某类专门的信息进行 一次整合,定向分字段抽取出需要的数据进行处理后再以某种形式返回给用户 :日 1 2 垂直搜索引擎的发展现状 目前,市场上众多的搜索引擎,有着很多分类方法,这里按照信息搜集方法 和服务提供方式的不同,把它们分为三大类h 一1 。 ( 1 ) 目录式搜索引擎( d i r e c t o r ys e a r c he n g i n e ) 以人工方式或半自动方式搜集信息,由编辑员查看信息之后,人工形成信息 北京工业人学工学顾j f j 学位论文 摘要,并将信息置于事先确定的分类框架中。信息大多面向网站,提供目录浏览 服务和直接检索服务,该类搜索引擎因为加入了人的智能,所以信息准确、导航 质量高,缺点是需要人工介入( 维护工作量大) 、信息量少、信息更新不及时。 这类搜索引擎中最具代表性的是y a h o o 雅虎。国内的搜狐、新浪、网易搜索也都 属于这一类。 ( 2 ) 全文搜索引擎( f u l lt e x t s e a r c he n g i n e ) 全文搜索引擎是名副其实的搜索引擎,国外具代表性的有g o o g l e 、 f a s t a l i t h e w e b 、a l t a v i s t a 、i n k t o m i 、t e o m a 、w i s e n u t 等,国内著名的有百 度( b a i d u ) 。它们都是通过从互联网上提取的各个网站的信息( 以网页文字为主) 而建立的数据库中,检索与用户查询条件匹配的相关记录,然后按一定的排列顺 序将结果返回给用户,因此他们是真正的搜索引擎。 从搜索结果来源的角度,全文搜索引擎又可细分为两种,一种是拥有自己的 检索程序( i n d e x e r ) ,俗称“蜘蛛 ( s p i d e r ) 程序或“机器人”( r o b o t ) 程序, 该机器人程序以某种策略自动地在i n t e r n e t 中搜集和发现信息,由索引器为搜 集到的信息建立索引,由检索器根据用户的查询输入检索索引库,并将查询结果 返回给用户。服务方式是面向网页的全文检索服务。该类搜索引擎的优点是信息 量大、更新及时、无需人工干预,缺点是返回信息过多,有很多无关信息,用户 必须从结果中筛选,本文中提到的搜索引擎主要指这一类。另一种则是租用其他 引擎的数据库,并按自定的格式排列搜索结果,如l y c o s 引擎。 ( 3 ) 元搜索引擎( m e t as e a r c he n g i n e ) 这类搜索引擎没有自己的数据,而是将用户的查询请求同时向多个搜索引擎 递交,将返回的结果进行重复排除、重新排序等处理后,作为自己的结果返回给 用户。服务方式为面向网页的全文检索。这类搜索引擎的优点是返回结果的信息 量大,缺点是不能够充分使用原搜索引擎的功能,用户需要做更多的筛选。著名 的元搜索引擎有i n f o s p a c e 、d o g p i l e 、v i v i s i m o 等( 元搜索引擎列表) ,中文元 搜索引擎中具代表性的有搜星搜索引擎。在搜索结果排列方面,有的直接按来源 引擎排列搜索结果,如d o g p i l e ,有的则按自定的规则将结果重新排列组合,如 v i v i s i m o 。目前,商业的搜索引擎站点正在结合各种搜索引擎的优点。在类型上 有逐渐融合的趋势,例如,y a h o o 在保持人工分类的同时,使用g o o g l e 的机器 人搜索引擎,用户查询时,如果选择“网站搜索”便搜索人工分类库,选择网页 搜索,便搜索机器人搜索引擎的索引库。一些传统的机器人搜索引擎也增加了人 工分类的内容,以提供高精度的导航信息。 目前,垂直搜索引擎的发展非常迅速,如供求信息搜索引擎,工作搜索引擎, 博克搜索引擎等。占了百度几乎一半以上流量的m p 3 搜索,其实也可以说是专业 搜索m p 3 的垂直搜索引擎。目前许多门户网站也纷纷推出了自己的垂直搜索引擎 2 第1 章绪论 系统。2 0 0 5 年3 月,微软推出购物搜索,并宣称购物以及一系列其他垂直搜索 引擎,是他们最为希望扩大的搜索领域。2 0 0 5 年l o 月,雅虎发布了为用户提供 个性化的旅游搜索引擎,即t r i pp l a n n e r ( 旅行策划员) 测试版。2 0 0 5 年1 0 月 底,g o o g l e 推出能使用户迅速的得到航班信息的垂直搜索引擎。 国外,垂直搜索引擎的研究正在成为一个新的热点,当前具有代表性的系统 主要有以下几个哺1 。 ( 1 ) e l s e v i e r 的s c i r u s 系统 s c i r u s 科学搜索引擎是一种专为搜索高度相关的科学信息而设计的搜索引 擎,获得2 0 0 1 搜索引擎观察授予的“最佳专业搜索引擎奖”。s c r i u s 是目前 互联网上最全面、综合性最强的科技文献门户网站之一。s c i r u s 是面向科技文 献的一个垂直搜索引擎,它的信息源主要包括网页和期刊两部分。它首先对网络 中所搜索到的结果进行过滤,然后只列出包含有科学信息的成分,方便了科研人 员的使用。 ( 2 ) b e r k e l e y 的f o c u s e dp r o j e c t 该系统由一个印度裔的科学家 s c h a r k r a b a r t i 带头研究开发,通过两个程序来指导,爬行器:一个是分类器 c l a s s i f i e r ) ,用来计算下载文档与预定主题的相关度;另一个程序是净化器 ( d i s t i l l e r ) ,用来确定那些指向很多相关资源的页面。 ( 3 ) n e c 研究院的c i t e s e e r c i t e s e e r 是一个非常有名的针对计算机科学领域论文的检索系统。c i t e s e e r 的核心是a c i ( a u t o m a t i c a l l yc i t a t i o ni n d e x ) ,它可以自动地对网上的电子 文件( p o s t s c r i p t 和p d f 等格式) 进行索引并分类。 ( 4 ) 美国国家科学数字图书馆的c o l l e c t i o nb u i i d i n gp r o g r a m ( c b p ) 这个项目旨在为科学、数学、工程和技术创建大规模的在线数字图书馆,试 图研究在某一主题上资源自动建设的可能性。 在国内,赛迪“i t 罗盘”i t 罗盘是中文领域首个真正意义上的垂直搜索引 擎。赛迪i t 罗盘( h t t p :i t s e a r c h c c i d n e t c o m ) 是由赛迪网推出的国内第一 个中文i t 垂直搜索引擎 1 。目前收录了2 0 0 0 0 多条i t 网址和数百万i t 网页数 据,涵盖了i t 领域的绝大多数网络信息资源。可向用户提供网站目录浏览搜索、 网页搜索、新闻搜索、赛迪网站内各频道全文检索、赛迪媒体全文检索等多种搜 索服务。同以往搜索引擎不同的是,赛迪“i t 罗盘”提供经过人工加工和精选的 网页检索功能,而且网站目录也全部经过人工分类、整理,并提供星级评定功能, 能够从站点描述中得到充分的信息;全天2 4 小时,采用机器智能抓取与人工加 工过滤相结合的方式更新资源;在检索功能方面支持布尔逻辑检索;搜索速度快, 平均响应间低于o 1 5 秒。其他垂直搜索引擎还有比价购物类搜索引擎,供求信 息类搜索引擎、工作类搜索引擎、博客类搜索引擎等。 3 北京工业人学工学顶二f j 学位论文 根据c n n l c 的调查结果:2 0 0 5 年使用百度和g o o g l e 的用户达到总量的9 0 , 而2 0 0 6 年随着垂直搜索的兴起,这一数值下降到8 7 4 。易观国际分析师黄渭 涛指出未来搜索引擎将从单一化走向多样化,从水平化走向垂直化,从大众化走 向行业化啊1 。而能满足大家特定需求的垂直搜索将成为未来的市场增长点。可见, 垂直搜索引擎正在对综合搜索引擎产生巨大的威胁,搜索引擎行业百花齐放的机 会已经来临。 但是,垂直搜索引擎构建也同样需要很高的技术门槛,而且还需要行业经验 的积累,需要大量专家领域的知识。不同于g o o g l e 等综合性搜索引擎,使用垂 直搜索引擎的用户一般对需求信息的领域已经具备相当的了解和经验,可以说是 半专业甚至专业人士,因此,要让这些客户满意查询的结果,就必须深入了解这 个行业的政策环境、从业人员的习惯偏好等。而目前国内的垂直搜索引擎无论是 在技术层面还是在行业经验上都还有很多不足之处,并且由于这些不足,大大的 限制了垂直搜索引擎的发展,使得专业化搜索服务还无法在社会的各个领域得到 广泛发展,这在一定程度上也反映了我国垂直搜索引擎尚不成熟的现状。 1 3 搜索引擎的基本原理 对于搜索引擎,其基本的工作原理如下:首先执行信息采集模块,通过人工 或自动采集,定期在网上收集相关的新网页;然后利用自动标引模块,对网页进 行标引,建立索引,信息检索模块执行检索操作,对检索词与索引词进行匹配运 算,检索出包括检索词的网页,进行相关性排序,然后呈现给用户。其主要可以 分为三个部分: ( 1 ) 信息采集 通过网络爬行器或者人工的方式来遍历w e b 站点,依照某种策略下载w e b 信 息地,网络爬行器沿着网页的出链接前进,下载目标网页,循环往复的这样工作, 以此建立、更新网页数据库来保障网络资源的有效性和及时性。 ( 2 ) 建立索引 信息采集系统将网页信息存放到本地之后,为了加快检索速度,提高查询性 能,对网页库建立高效的索引,现行最有效的数据结构是“倒排文件”凹1 ( i n v e r t e d f i l e ) ,倒排文件是用文档中所含关键词作为索引,文档作为索引目标的一种结 构。 ( 3 ) 查询服务 系统在网页信息建立好索引以后就可以对用户的查询进行响应,该响应过程 就是查询服务完成的,其目标是要为用户提供高质量的搜索结果。 搜索引擎是对计算机科学与技术的极大发挥,它将理论研究和工程开发完美 结合创造了非凡的用户体验和文化。尽管目前已经有许多成功的商业搜索引擎, 但搜索引擎的核心技术并未完全成熟,也存在着一些缺点,例如,目前绝大多数 4 第l 章绪论 网站仍然采用人工分类手段,需要投入大量的人力和物力,给网站建立、维护和 运行带来极大的工作量和经济成本;查询结果还是不够精炼,用户经常得不到满 意的查询结果;对网页评价主要还是主观的评价,对用户的参与行为考虑的不多。 由于w e b 信息的多样性,对大多数用户来说,w e b 上的大部分信息是不感兴趣的。 因此,面向特定领域的搜索引擎将成为搜索引擎未来发展的重要方向之一。专业 搜索引擎与综合性通用引擎相比,技术难点更多,技术要求更高,其突出技术难 点是面向特定主题网页动搜集和索引。 1 4 本文的组织结构 根据奥运信息搜索的需求,本文的主要目的,在于利用当前较为先进的垂直 搜索引擎技术,建立一个奥运信息结构化抽取和检索为主要服务内容的搜索系统 原型,可以根据用户输入的检索项,返回符合条件的奥运相关信息。为了实现这 一目的,本文将按照如下结构开展以下几个方面的具体研究。 第1 章绪论,主要论述课题的研究背景,垂直搜索引擎发展现状以及搜索引 擎的基本原理。 第2 章论述垂直搜索引擎的相关内容。尽管垂直搜索引擎有自己的独特之 处,但毕竟也是搜索引擎的种,本章将重点论述搜索引擎的基本工作过程。 第3 章介绍垂直搜索引擎的关键技术,重点论述垂直搜索引擎搜索策略和主 题相关判别算法。 第4 章介绍了垂直搜索引擎系统的体系结构和主要功能模块。 第5 章设计垂直搜索引擎系统各个模块,包括初始化模块,网络机器人模块, 信息过滤模块,索引模块。 结论主要对论文的研究工作进行总结,提出今后的研究工作方向。 第2 章垂直搜索引擎 第2 章垂直搜索引擎 2 ,1 垂直搜索引擎定义 对垂直搜索引擎定义的表述有以下几种:( 1 ) 垂直搜索引擎,即专业化搜索 引擎,就是专门为查询某一学科或主题的信息而产生的查询工具,对解决实际查 询问题要比搜索引擎门户有效得多n 训。( 2 ) 垂直搜索是针对某一个行业的专业搜 索引擎,是搜索引擎的细分和延伸,是对网页库中的某类专门的信息进行一次整 合,定向分字段抽取出需要的数据进行处理后再以某种形式返回给用户。( 3 ) 相 对通用搜索引擎的信息量大、查询不准确、深度不够等提出来的新的搜索引擎服 务模式,通过针对某一特定领域、某一特定人群或某一特定需求提供的有二定价 值的信息和相关服务a 其特点就是“专、精、深”,且具有行业色彩,相比较通 用搜索引擎的海量信息无序化,垂直搜索引擎则显得更加专注、具体和深入1 。 ( 4 ) 垂直搜索就是针对专业特定的领域或行业的内容进行专业和深入的分析挖 掘,精细分类,过滤筛选,信息定位更精确的专业搜索。( 5 ) 所谓专业搜索引擎 就是以构筑某一专题或学科领域的i n t e r n e t 网络信息资源库为目标,智能地在 互联网上搜集符合这一专题或领域需要的信息资源,能够为包括学科信息门户、 专业信息机构、特定行业领域、公司信息中心、行业专家等在内的信息用户,提 供整套的网络信息资源开发方案n 引。 2 2 垂直搜索引擎与通用搜索引擎的区别 2 2 1 垂直搜索引擎和通用搜索引擎在信息服务上的异同 垂直搜索引擎和通用搜索引擎虽然都是帮助网络用户进行网络信息定位和 查找的工具,但是二者在进行信息服务的时候还是有很大的不同,这些不同可以 从信息服务的对象、内容等方面加以比较。 ( 1 ) 信息服务对象的比较 通用搜索引擎提供整个互联网上与用户提问相关各种网页信息,然后由用户 自己判断结果中的信息哪些是相关的,哪些是不相关的。使用垂直搜索引擎的用 户通常都有明确的信息需求,同时这种信息需求可以界定在某一个特定范围内, 并且满足其信息需求的信息产品是特定形式的结构化的信息,它提供的结果都是 与用户需求相关的,用户不用自己再进行分析和判断。 另外,从对关键字的选择上可以看出两者的差异。垂直搜索引擎对用户关键 字的选择要求很简单,直接输入要查找的产品名称即可得到相关度很高的结果; 而通用搜索引擎则要求用户对自己的信息需求很明确,并且完整、准确的表达在 搜索栏中,搜索引擎才能够提供一定的相关信息,并且要求用户自行对每一个信 息的相关度进行判断。一般说来,通用搜索引擎对用户的要求相对较高,在搜索 7 北京t 业大学t 学颂十学位论文 的过程中,需要有用户对自己需求的不断调整的过程;垂直搜索引擎对用户的要 求较低,直接输入产品名称即可。 ( 2 ) 信息服务内容的比较 对于搜索引擎来说,它所提供的信息服务的内容就是用户搜索的结果。通用 搜索引擎提供的搜索结果仅仅是网页链接和关于该网页的简单描述,其中匹配的 原则是网页描述与关键字的相关度。而垂直搜索引擎提供的搜索结果是结构化的 数据,几乎不需要用户具体打开网页就可以断定是否是自己需要的结果。 通用搜索引擎是按照系统设定的排序算法,自动根据相关性将网页排列,它 的用户不能自主选择排列方式,只能被动的接受搜索引擎的排列顺序。垂直搜索 引擎的排列方式可以由用户设定,自主的选择按照相关度的高低、按照价格的高 低、价格的范围或网上商店等多种方式进行排序。这一点对用户更好的找到所需 的内容是非常有帮助的。 通过通用搜索引擎所查询的结果往往是数量巨大的,结果覆盖面比较广。而 垂直搜索引擎因为检索的网站数目有限,所以检索结果的数量也维持在几百个左 右。但是,从查准率的角度看,垂直搜索引擎的准确率很高,几乎可以达到9 0 以上。因为这些特定的信息都是在特定的相关网站上查找的,所以可以保证它的 准确性。但是对于综合搜索引擎而言,因为搜索引擎在广泛的互联网上查找,另 外用户也不可能准确的表达信息需求,所以准确率相对比较低。 通用搜索引擎在搜索结果中提供描述的内容包括标题、描述、u r l 链接三个 部分。其中对网页的描述是非人工干预的( 除了参与了竞价排名广告的网页描 述) ,所以这些描述更多的是当前u r l 链接上的网页整体内容的介绍,而不是针 对用户检索的特定信息的介绍。垂直搜索引擎在搜索结果的描述针对性很强,从 多个角度描述用户查找的特定信息。比如对某个产品信息的产品名称、价格、图 片、规格参数等等都在搜索结果中实时体现。这样,用户几乎不需要点击链接就 可以直接判断哪条检索结果是最需要的信息。 2 2 2 垂直搜索引擎和通用搜索引擎在关键技术上的异同 由于垂直搜索引擎在信息服务方面的自身特点,因此在技术实现上也与通用 搜索引擎有很多不同之处。通过比较,可以总结出在关键实现技术上垂直搜索引 擎与通用搜索引擎四个方面的不同。 ( 1 ) 聚焦、实时和可管理的网页采集技术 通用搜索引擎面向全网信息,采集的范围广、数量大,但往往由于更新周期 的要求,采集的深度或者层级比较浅,采集动念网页优先级比较低,因而常被称 为水平搜索引擎。水平搜索引擎通常以被动方式进行信息采集,搜索引擎和被采 集的网页既没有事先的约定、也没有标准的格式。而垂直搜索引擎带有专业性或 行业性的需求和目标,所以只对局部来源的网页进行采集,采集的网页数量适中。 第2 章垂直搜索引擎 但其要求采集的网页全面,必须达到更深的层级,采集动态网页的优先级也相对 较高。在实际应用中,垂直搜索引擎的网页采集技术能够按需要控制采集的目标 和范围,并且支持深度采集以及复杂的动态网页采集。垂直搜索引擎采用被动和 主动相结合的方式,通过主动方式,有效采集网页中标引的元数据信息,整合上 下游网页资源或者商业数据库,提供更加准确的搜索服务。 ( 2 ) 从非结构化内容到结构化数据的网页解析技术 通用搜索引擎仅能对网页的标题和正文进行解析和提取,但不提供其时间、 来源、作者及其他元数据的解析和提取。由于垂直搜索引擎服务的特殊性,往往 要求按需提供时间、来源、作者及其他元数据解析,包括对网页中特定内容的提 取。比如:在论坛搜索、生活服务、订票服务、求职服务、风险信用、竞争情报、 行业供需、产品比较等特定垂直搜索服务中,要求对于作者、主题、地区、机构 名称、产品名称以及特定行业用语进行提取,才能进一步提供更有价值的搜索服 务。 ( 3 ) 精、准、全的全文索引和联合检索技术 通用搜索引擎并不能提供精确和完整的检索结果,只是给出预估的数量和排 在前面部分的结果信息,但响应速度是综合搜索引擎所追求的最重要因素;在文 本索引方面,它也仅对部分网页中特定位置的文本而不是精确的网页正文全文进 行索引,因而其最终检索结果是不完全的。而垂直搜索由于在信息的专业性和使 用价值方面有更高的要求,因此能够支持全文检索和精确检索,并按需提供多种 结果排序方式,比如按内容相关度排序( 与水平检索的p a g e r a n k 不同) 或按时 间、来源排序u 引。另外,一些垂直搜索引擎还要求支持结构化和非结构化数据联 合检索,比如结合作者、内容、分类进行组合检索等。 ( 4 ) 高度智能化的文本挖掘技术 垂直搜索引擎与通用搜索引擎的最大区别是它对网页信息进行了结构化信 息抽取加工乱婚1 ,也就是将网页的非结构化数据抽取成特定的结构化信息数据, 好比网页搜索是以网页为最小单位,基于视觉的网页块分析是以网页块为最小单 位,而垂直搜索引擎是以结构化数据为最小单位。基于结构化数据和全文数据的 结合,垂直搜索引擎才能为用户提供更加到位、更有价值的服务。整个结构化信 息提取贯穿从网页解析到网页加工处理的整个过程。同时面对上述要求,垂直搜 索引擎还能够根据实际需要提供智能化处理功能,比如自动分类、自动聚类、自 动标引、自动排重、文本挖掘等等。这部分技术目前是垂直搜索引擎乃至信息处 理的前沿技术,虽然尚不够成熟,但有很大的发展潜力和空间,属于国内外科研 机构的研究热点。 综上所述,垂直搜索引擎可以针对专业特定的领域或行业的内容进行专业和 深入的分析挖掘,精细分类,过滤筛选,信息定位,更精准的提供有一定价值的 9 北京t 业人学工学坝i j 学位论文 信息和相关服务,有效地弥补了通用搜索引擎对专门领域及特定主题信息覆盖率 过低的问题。同时,能够把具有相同兴趣点的人们集中在一个“主题社区”内, 不仅集中提供各种专业资源,而且给大家提供了一个相互交流、共享经验和教训、 展望行业发展前景的机会和场合。相比较通用搜索引擎的海量信息无序化,垂直 搜索引擎则显得更加专注、具体和深入。 2 3 通用搜索引擎的工作流程 搜索引擎的工作流程如图2 - i 所示。 ( 1 ) 抓取网页 每个独立的搜索引擎都有自己的网页抓取程序( s p i d e r ) 。s p i d e r 顺着网页 中的超链接,连续地抓取网页。由于互联网中超链接的应用很普遍,理论上,从 一定范围的网页出发,就能搜集到绝大多数的网页。 ( 2 ) 处理网页 搜索引擎抓到网页后,还要做大量的预处理工作,才能提供检索服务。其中, 最重要的就是提取关键词,建立索引文件。另外还包括去除重复网页、分析超链 接、计算网页的重要度。 ( 3 ) 提供检索服务 用户输入关键词进行检索,搜索引擎从索引数据库中找到匹配该关键词的网 页;为了用户便于判断,除了网页标题和u r l 外,还会提供一段来自网页的摘要 以及其它信息。 信息采集i_ i,l 信息处理 分析查询式 i i 建立索引 、用 l jl 、一 斥:二 弋 户 r 互联网 i 索引数据库l 、 i 结果排序i 图2 - l 通用搜索引擎系统的体系结构 f i g u r e2 一ls t r u c t u r eo fs e a r c he n g i n es y s t e m 2 4 本章小结 本章首先介绍了垂直搜索引擎的定义,接着介绍了垂直搜索引擎与通用搜索 引擎的异同,最后介绍了通用搜索引擎的工作流程,包括通用搜索引擎系统模块 的组成和功能描述。基于垂直搜索引擎技术的奥运信息搜索系统与通用搜索引擎 技术在服务对象,页面采集范围,索引标识算法以及用户查询信息的显示方面存 在着很大差别,但基本的功能框架和原理大致相同。 l o 第3 章垂直搜索弓i 擎的关键技术 第3 章垂直搜索引擎的关键技术 在基本原理和主要功能组件方面,垂直搜索引擎与通用搜索引擎基本相同主 要的区别在于s p i d e r 爬行范围和网页信息处理深度两方面。垂直搜索引擎与通 用搜索引擎的网页爬行策略的一个本质的区别是:普通搜索引擎采取逐页爬行的 原则,对所有的网页全部进行分析,然后对网页进行索引放入数据库。垂直搜索 引擎则根据系统对网页与主题相关性的计算,采取一定的策略预测相关网页的位 置,动态的调整网页爬行方向;使系统尽可能的在与主题相关的网页集中的地方 爬行,对网页进行分析。这一点是垂直搜索引擎的优势所在,它节约了系统运行 的硬件和网络资源开销。相关网页的预测策略实际上就是算法所实现的内容,所 以选则一个高效率的搜索算法将会决定整个系统的运行效率。 3 1 垂直搜索引擎的搜索策略 鉴于搜索内容的分散性,传统的基于宽度或深度优先的搜索策略在w e b 信 息搜集的效率上难以达到垂直搜索引擎期望的要求,因此,有必要对传统的信息 搜索策略进行改进,以完成信息的采集。目前比较成熟的解决思路有基于内容评 价的搜索策略和基于链接结构的搜索策略n 6 。1 9 】。 ( 1 ) 基于内容评价的搜索策略 这类搜索方式是传统的信息检索技术的延伸。它的主要方式就是在搜索引擎 内部建立一个针对主题的词表,搜索引擎的爬行器根据其内设的词表对网上的信 息进行索引。各个不同的系统词表建设的复杂度也大不相同。现在这种词表的建 设越来越多的引入了知识表示的方法。基于本体论( o n t o l o g y ) 的搜索引擎开始 出现。一个本体强调相关领域的本质概念,同时也强调这些概念间的本质联系。 以o n t o l o g y 为基础建立的词表能更好的显示一个领域主题中各个概念( 即搜索 系统的检索词) 之间的关系,能更好的表现一个主题。在w w w 的智能信息检索应 用中,o n t o l o g y 通常作为用户感兴趣领域的领域模型,同时还作为文档统一注 释的知识表示语言。一些学者也提出了概念空间的理论,用概念空间来实现语义 索引。所谓概念空间是某个领域中一组抽象概念的集合,并且这组概念之i 日j 存在 一定的语义上的关联。基于概念空间的文本检索系统也较好地解决了信息检索过 程中的词汇不匹配问题以及信息过载问题,大大提高了信息检索的效率和质量。 b e s t f i s h 算法是一种基于内容的搜索算法,它很巧妙的采用了一种启发机制引 导搜索引擎的网页爬行器优先检索与主题最相关的网页。 ( 2 ) 基于链接结构评价的搜索策略 基于链接结构的搜索策略,其理论基础是w e b 页面的半结构化的思想,即利 用网页页面之间的引用关系确定链接的重要性,进而决定访问顺序。9 0 年代术 期,国外信息检索界开始以s o c i a ln e t w o r k 为模型对互联网进行模拟。一些学 北京工业人学工学硕i 学位论文 者认为网页之间的链接指引关系同社会网络中的关系有相似之处,特别的与传统 的引文索引非常相似。通过对链接进行分析,可以找出各个网页之间的引用关系, 由于引用网页与被引用网页间内容上一般都比较相关,所以就可以很容易地按照 引用关系将大量网页分类。在美国,很多基于这种超链分析的检索系统原形己经 产生,应用于他们的数字图书馆系统中。其经典算法是h i t s 算法。 这里先对页面分析技术进行概述,然后研究决定爬行方向的超链分析算法和 页面内容加工的结构化分析算法。 3 2 页面分析技术 在页面分析( 页面解析) 中所做的工作主要包括对h t m l 页面进行语法分析, 提取出正文、链接、链接的扩展元数据及其它相关内容;再把这些内容进行简单 的加工和一致性处理;最后将处理结果保存在中间信息记录库中以供u r l 过滤处 理和页面过滤处理比0 1 。 3 2 1h t m l 语法分析 采集到页面的语法分析基于h t m l ( h y p e r t e x tm a r k u pl a n g u a g e ) 协议 r f c 1 8 6 6 r “龆1 。整个语法分析过程可以看作两个层次,即s g m l ( 标记文法) 层和h t m l 标记层。文法层将页面分解成正文、标记、注释等不同的语法成分,再调用标记 层处理正文和标记。同时标记层维护着当前正文的各种状态,包括字体、字型等, 这些状态由特定标记产生或改变。 在系统中使用的标记文法分析器的基本原理是:由标记文法构造状态转换 表,根据输入流中的当前字符( 无需向前看) 切换状态,当到达特定状态时执行 相应语义操作。下面先介绍几个概念,然后分别讨论对主要语法成分的处理: ( 1 ) 文本。文本是页面的初始状态,此状态下的所有字符( 除了导致切换 到其它状态的) 都构成页面正文的一部分交由标记层根据当前正文状态处理和保 存。 ( 2 ) 标记。标记是出现在工f 文中以字符“ ”结尾的一个 字符串。语法分析器在遇到“ ”表示标记结束,将分析出的标记结构传递给标记层。标记层在根据标记名 和参数做相应动作,包括修改j 下文状态等。若在“ ”后紧跟着字符“”,则表 明此标记是结束标记,分析器区分开始和结束标记,但两者的配对由标记层实现。 对标记的处理在后面讨论标记层时会进一步论述。 ( 3 ) 注释。分析器判断“ ! ”打头的标记并统计模式“一的个数从而识 别页面中的注释,注释直接被忽略而不作任何处理。 ( 4 ) 转义字符。文本中出现的形如“& # n n n ”或“& x x x ”( 末尾可能有附加 1 2 第3 章垂直搜索引擎的关键技术 的字符“:”) 的,分析器将其作为转义字符处理,查找相应对照表后将对应字符 添加入正文中。 3 2 2 页面中正文的提取 尽管u r l 已经被预测为和主题相关,但此u r l 所指向的实际页面却可能与预 测结果相差甚远,这就导致了采集到的页面有相当大一部份与主题无关,因此, 需要对页面进行主题相关性判断,通过判断结果过滤掉无关页面,从而提高整个 数据集中页面与主题的平均相似度值,或者说提高基于主题的w e b 信息采集的准 确率。 为此,需要在页面分析时提取出页面中的正文。页面的正文提取方法较简单。 正文和标记都作为独立的语法成分传递给标记层,标记层根据标记区分出页面标 题和内容,并根据系统需要合并出页面的正文。目前还未考虑不同字体或字型的 正文的差别。也就是说,在读取页面时,找到标记 和 ,将这两个 标记中间的内容去除其中的所有标记即可。 3 2 3 页面中链接的提取 对抓取到的页面需要分析其中的链接,并对链接中的u r l 进行

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论