毕业设计(论文)-面向丝绸领域的垂直搜索引擎关键算法研究.doc_第1页
毕业设计(论文)-面向丝绸领域的垂直搜索引擎关键算法研究.doc_第2页
毕业设计(论文)-面向丝绸领域的垂直搜索引擎关键算法研究.doc_第3页
毕业设计(论文)-面向丝绸领域的垂直搜索引擎关键算法研究.doc_第4页
毕业设计(论文)-面向丝绸领域的垂直搜索引擎关键算法研究.doc_第5页
已阅读5页,还剩55页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

面向丝绸领域的垂直搜索引擎关键算法研究 摘要 I 摘要 垂直搜索引擎是搜索引擎的细分和延伸,是对网页库中的某类专门的信息进行 一次整合,定向分字段抽取出需要的数据进行处理后以某种形式返回给用户。垂直 搜索引擎与传统的网页搜索引擎最大的区别就是将网页中的信息进行结构化的抽取。 使得信息在抽取的时候就建立了分类,更好的适应查询需求。近几年来,垂直搜索 引擎已经被应用到某些专业的领域(如化学、科技文献)。 本文从研究和设计的角度对垂直搜索引擎的相关技术作了详细的分析和讨论, 论述了目前搜索引擎的国内外发展现状和趋势。分析了搜索引擎的工作原理及其各 部分主要功能,抓住如何评价页面的主题相关性和设计高效的爬行策略这两个关键 问题,提出一个基于丝绸信息的定题搜索器,它是垂直搜索引擎的核心。在文章的 主体部分,以搜索引擎的设计流程为主线,重点论述垂直搜索引擎设计与实现时一 些独特的信息识别方法,包括pagerank和HITS算法。从HTML页面解析的一般概念 入手,结合网页之间的超链接分析,按照搜索引擎系统的要求,采用深度优先的搜 索策略设计具有垂直搜索引擎功能的丝绸信息网站。并按照软件工程的方法,研究 了丝绸信息搜索引擎的总体设计过程和实现过程,设计过程重点论述了需求分析、 网站的功能规划和总体结构、数据库设计等内容,并通过编码实现设计阶段的各种 算法和具体功能。 最后的软件功能测试表明,此搜索引擎算法准确、确定、不会引起本地资源耗 尽;它支持按指定站点搜索,按给定URL范围进行搜索的搜索策略。可以完成指定信 息的自动搜索和下载。 关键词:关键词: 垂直搜索引擎 网页信息抽取 抽取规则 索引库 作作 者:者:张小莉 指导老师:指导老师:姚建民 Abstract 面向丝绸领域的垂直搜索引擎关键算法研究 Abstract The Vertical Searching Engine is a typical type of searching engine, which can classify information in certain field from those websites, Directional mark of syllable takes out the data needing carrying out treatment and analyze those data, then return them to users. The major difference between Vertical Searching Engine and traditional searching engine is thtat the vertical one select information from website in a structural way classify the information while selecting it to be better satisfy the searching requirements. In this paper it does detailedly some analying and discussing the technology of the Vertical Searching Engine from the studying and designing angle, has discussed home and abroad present situation and trend searching for an engine at present. The operating principle having analysed searching engine and their every main part function, grasp the two key problems about how to appraising pages subject correlativity and designing the high-effect crawlling tactics, Suggest a directional question Searching machine based on Silk Information,it is the core of a Vertical Searching Engine. In the article main body part, we regarded the Serching Engines designing flow as the main clue, and focused on discussing the designing and carrying out some typical informations identification method about Vertical Seraching Engine, Including PageRanks and HITS s algorithm.Starting with the HTML page analysis s average concept,combine the Hypertext analysis among the Webs,According Searching Engine System requirements ,adopt the depth- first searching tactics to design a silk information website which has Vertical Searching Engine function. And according to the software engineering method, we have studied the silk information Searching Engines overall designing and realizing process, during this process we discussed with an emphasis on requirement analys 、web functions design and total structure 、database design etc. and realized designing stages all kinds of algorithms and specific function by code. The results of software function test show that the algorithm of Vertical Searching Engine is accurate and steady without the risk of local information resource exhaustion. It supports the searching strategy of searching on fixed site or in a given URL circle.It can also do automatic searching and downloading according to the given information. KeywordsKeywords:Vertical Searching Engine; Web Information Extraction; Extraction rules; Index Database Written by Shally Zhang Supervised by James Yao 目录 目录 摘要 .I Abstract.II 第 1 章绪论.1 1.1课题的背景及意义.1 1.2垂直搜索引擎现存的问题.1 1.2.1 垂直搜索引擎的产生.1 1.2.2 存在的问题.2 1.3国内外垂直搜索引擎的发展.3 1.4垂直搜索引擎的发展前景.4 1.5课题的主要研究内容.6 第 2 章搜索引擎实现原理.7 2.1 通用搜索引擎的工作流程.7 2.2 网页信息采集技术和软件.8 2.2.1 网页信息采集软件的工作方式.9 2.2.2 网页采集软件的组成模块.10 2.3索引器.12 2.3.1 实现原理.12 2.3.2 索引数据组织.13 2.3.3 索引文件导出过程.14 2.4 网页存储器与分析索引器.14 2.5查询器和用户接口的设计.15 2.5.1 查询器.15 2.5.2 用户接口.16 2.6 搜索引擎的性能评价指标.16 2.7 小结.18 第 3 章垂直搜索引擎的关键技术.19 3.1页面分析技术.19 3.2超链接分析算法.20 3.2.1PageRank 算法.20 3.2.2HITS 算法.22 3.3网页信息的结构化抽取.23 3.3.1 网页信息的结构化抽取方式.24 3.3.2 结构化信息抽取系统的结构.24 3.3.3 中文网页结构化信息抽取的难点.25 3.4 暗藏网页的信息抽取.26 3.5 小结.27 第 4 章面向丝绸领域垂直搜索引擎的总体设计.28 4.1基本功能需求.28 4.2丝绸产品信息搜索引擎系统的体系结构.29 目录 4.3系统开发环境.30 4.4垂直搜索引擎的主要数据库设计.30 4.5 系统功能特点.31 第 5 章面向丝绸领域的垂直搜索引擎的具体实现.33 5.1 丝绸信息网页自动搜索算法的具体实现.33 5.1.1 元搜索算法.33 5.1.2 自动搜索过程的实现.35 5.1.3 网页爬行的控制模块实现.37 5.1.4 HTML 标准化与页面解析.38 5.1.5 网页爬行的控制模块的性能测试.39 5.2 页面分析与丝绸产品信息的自动抽取.41 5.3 Lucene 倒排文件索引结构.44 5.4 用户查询功能的实现.45 5.4.1 网页形式的丝绸产品信息查询与返回.46 5.4.2 站内数据库中的丝绸产品信息查询与返回.48 5.5 小结.49 结论.50 致谢.52 参考文献.53 攻读学位期间公开发表的论文.55 面向丝绸领域的垂直搜索引擎关键算法研究 第 1 章绪论 1 第 1 章绪论 1.1课题的背景及意义 随着网络与通信技术的迅速发展,Web信息爆炸性的增长,互联网已经成为一个 巨大的海量信息空间。如何迅速、准确、方便的从如此庞大的信息库获取自己需要 的信息,是互联网用户面临的一个重要问题。 搜索引擎的出现,整合了众多网站信息,极快的查询起到了信息导航的作用, 信息的价值得到众多商家的普遍认可,成为互联网中最有价值的领域。大家熟知的 搜索引擎Google、百度、雅虎等都是搜索引擎的杰出代表,为互联网的发展做出了 重要的贡献。CNNIC第十四次互联网调查表示,搜索以71.9%的绝对优势成为用户从 互联网上获取信息的主要方式1,是互联网上使用程序仅次于电子邮箱的服务。 互联网的信息量呈爆炸趋势增长,几年前全球式搜索引擎收录的网页量只有几 千万页,而现在已经达到几十亿页,数量增加带来的是搜索服务的品质下降,查询 的结果集就是海量的,经常是几十万笔的资料,结果里存在大量的重复信息和垃圾 信息,用户越来越难迅速找到符合的信息,现在经常使用搜索引擎可以感觉到很难 在短时间内准确的筛选出需要的内容。因此,如何对通用搜索引擎技术进行改进, 使查询的结果更加贴近用户的要求,成为搜索引擎行业近期的研究热点。 1.2垂直搜索引擎现存的问题 1.2.1 垂直搜索引擎的产生 所谓通用搜索引擎,并不能够囊括所有的网页,据 google 的人说,也就猜测覆 盖了 40%不到的网页,也就是说,更多的网页是没有被通用搜索引擎收录的,也就 谈不上被搜到了。那些没有机会收录的网页,有些是需要身份验证等之后才可以看 到,有些是根本未被通用搜索引擎的蜘蛛爬到。这些信息却往往是宝贵的,更有价 值的。 每一个行业都是复杂的,从目前计算机技术来讲,还是遵循冯.诺依曼的体系, 也即是说还是依靠图灵未实现的人工智能之下的计算机逻辑来处理信息,在搜索收 录的分析过程中,如果不加上行业特点和特性 进行分析,很难说会更准确分析到网 页的重要性和分析的准确。这个也是垂直的意义所在2。当然,这里面也需要注意 到,并非你垂直了,你的搜索收录和搜索结果就一定比通用搜索更准确3。 第 1 章绪论 面向丝绸领域的垂直搜索引擎关键算法研究 2 垂直搜索引擎和普通的网页搜索引擎的最大区别是对网页信息进行了结构化信 息抽取,也就是将网页的非结构化数据抽取成特定的结构化信息数据,好比网页搜 索是以网页为最小单位,基于视觉的网页块分析是以网页块为最小单位,而垂直搜 索是以结构化数据为最小单位。然后将这些数据存储到数据库,进行进一步的加工 处理,如:去重、分类等,最后分词、索引再以搜索的方式满足用户的需求。 整个过程中,数据由非结构化数据抽取成结构化数据,经过深度加工处理后以 非结构化的方式和结构化的方式返回给用户。 垂直搜索引擎的应用方向很多,比如企业库搜索、供求信息搜索引擎、购物搜 索、房产搜索、人才搜索、地图搜索、mp3 搜索、图片搜索几乎各行各业各类 信息都可以进一步细化成各类的垂直搜索引擎。 搜索由通用到专业目前来看是一趋势,都分了什么图片搜索、mp3 搜索之类, 这也好理解,用户输入关键字的时候,可能并不需要其他行业的内容,仅仅一个关 键字不结合其他补充信息,是无法准确分析用户的搜索要求的,但是通用搜索引擎 只能够一股脑给你信息。从这个角度讲,信息多了会造成一部分搜索结果是垃圾, 而这垃圾会影响用户的感受,以及继续试用搜索的兴趣。而垂直搜索引擎应该可以 更好的做到理解垂直用户的需求,从而给出更好的结果。 举个例子来说明会更容易理解,比如购物搜索引擎,整体流程大致如下:抓取 网页后,对网页商品信息进行抽取,抽取出商品名称、价格、简介甚至可以进 一步将笔记本简介细分成“品牌、型号、CPU、内存、硬盘、显示屏、”然后对 信息进行清洗、去重、分类、分析比较、数据挖掘,最后通过分词索引提供用户搜 索、通过分析挖掘提供市场行情报告。 从搜索信息的结果来看,除了上面的垃圾会过多外,还会存在信息不符合要求 的情况,有时候用户搜索某类事物,并以此作为关键字,他需要的是关于这个事物 的数量、价格等 甚至相关比较信息,而通用搜索引擎只能给你线索,给你网页。通 用搜索引擎由于自身巨大,他做不到更深入分析后给出更符合行业、用户需求的结 果。一个内容提供商所能担当的,应该是知识导航和知识集成的角色。它所提供的 内容,说到底是深加工后的而不是粗放的信息。4-6 由此我们可能得出垂直搜索引擎的定义:能够满足某一特定领域,某一特定人 群或者说是某一特定需求,提供内容集中而深入的信息与服务的网站。 1.2.2 存在的问题 垂直搜索引擎作为提供专业、集中的内容服务网站,必须首先考虑到为用户提 供专业的信息及围绕专业展开的服务。由此看来,要保证一个垂直搜索引擎的生命 面向丝绸领域的垂直搜索引擎关键算法研究 第 1 章绪论 3 力,还应为信息工作人员考虑如何确保在尽可能短的时间内的找到最需要的信息内 容,进行专业处理、深度加工,及时更新内容。 然而经过我们的细致研究,发现现有的多数垂直搜索引擎尚不能达到上述的要 求。主要存在以下四个问题:(1)没有为用户和信息人员提供一个合适的专业检索 服务、专业搜索引擎,查找所需的信息并不方便。常常是用户找了几千甚至上万条 记录出来,根本无法从中再细找。或者找到的内容和要找的内容不是一个专业领域 内的,信息无效;(2)信息工作不得不花费大量时间在收集、编辑和发布信息上, 工作枯燥且大都属于重复性劳动,还有较高的技术要求,而对信息内容的关注反而 少了;(3)信息更新不够及时,或者提供一些过时、不适当的信息;(4)虽然已 有足够大的信息量,但由于存储或者管理不适当,难以去检索所需信息,更加无法 分析、挖掘数据,从中提炼规则或做判断、预测。 这些问题的存在有其技术背景和人为因素的。过去比较落后的技术不能跟上用 户的要求,对信息管理人员的要求较高。但随着技术的发展和日益成熟,垂直搜索 引擎现存的问题也将得以解决与改善。(1)提供合适的专业搜索引擎,查找专业的 信息内容。(2)为信息工作人员提供界面友好、适用的信息管理系统。(3)为信 息建立关系型数据库,为今后的进一步发展提供基础。 1.3国内外垂直搜索引擎的发展 与以前的通用搜索引擎不同,垂直搜索引擎并不求大求全,而是力求做到一个 特定领域内容的全面,这个领域之外的信息并不收集,也不提供这个领域外的服务, 这种特定的服务可以有效地把对某一特定领域感兴趣的用户与其他网民区分开来, 并能长期久地吸引住这些用户,这就为电子商务的发展提供了一个理想的平台。美 国垂直搜索引擎的发展已经充分说明了这种经营模式的正确。M 公司 通过发布有关疾病和治疗的详细内容,每月赢得高达 2500 万次的点击,有 260 万患 者和 100 万医生浏览。Yahoo 也从一个单纯的互联网目录发展成为一个垂直搜索引 擎总汇,它上面即有保健信息及服务的内容,拍卖、购物、开设网上商店也做得很 出色。W 的网站其对象只是水和废水处理工程师,这个站点上有聊天 室、论坛、就业机会等。内容非常具体丰富。今天,它已发展成为水处理行业的网 上交易所,水资源领域的厂商非常愿意在这里投放广告。与此同时,以 W 起家的这个网站,现在已发展成面向 50 多个特定领域的垂直搜索 引擎社区,从机械制造到医务护理。从食品包装到垃圾处理品,应有尽有,可能最 说明问题的还是它的销售额,1998 年只有 310 美元,1999 年成功实现 IPO(Initial Public Offering)以后,骤升到 19 亿美元,另外还有一个紧随其后的垂直搜索引擎 第 1 章绪论 面向丝绸领域的垂直搜索引擎关键算法研究 4 社区也已囊括 26 个行业广告领域的 , 等也正在走向互联网 经济的前台7-8。可见,专业化,垂直化已成为未来搜索引擎发展的一个潮流和方向。 继 2007 年 1 月 10 日对 2006 年度互联网市场数据进行系统发布之后,2007 年 7 月 9 日,2007(上半年)中国互联网市场数据发布会暨 2007 中国互联网大会发布 会在京隆重举行。由中国互联网协会作为指导单位,DCCI 互联网数据中心与中国互 联网协会交流与发展中心作为主办单位共同实施的 2007 年度互联网调查,在发布会 现场和主网站 阶段性的发布了总体市场、网络广告、网络视频、 搜索引擎等四个方面的部分数据和分析。 DCCI 互联网数据中心发布的最新分析表明,2007 下半年垂直搜索依然稳步发展, 垂直搜索凭借细分领域的定位,在搜索引擎广告市场赢得一定盈利的空间。但是垂 直搜索目前仍处于广告主投放尝试的阶段,离广告主形成投放习惯的阶段还有距离。 垂直搜索得到大量广告主的认可尚需时日。一方面,需要积累更多的用户群。 另一方面,对广告主的教育需要时间。而垂直搜索盈利的挑战并不来源与综合搜索。 搜索门户(综合类搜索引擎)由于其发展重点不在于特定行业、领域的搜索,因此, 搜索门户对垂直搜索的威胁不大。但垂直搜索需要建立符合垂直搜索的算法,才能 提高进入直接或间接竞争者的进入门槛。 产业的分工、细分领域的发展是不可避免的产业发展规律。同时,用户的需求 也是驱动垂直搜索发展的动力,垂直搜索引擎能够有效解决未来信息过载的问题, 有利于用户针对某一特定领域搜索相关信息。反过来,垂直搜索的用户群也相对清 晰,基于垂直搜索清晰的用户群定位,广告相对定向,有利于相应行业的广告主投 放广告。 国内生活资讯类垂直搜索酷讯、旅行类垂直搜索去哪儿、招聘类垂直搜索职友 集和搜职网等垂直搜索引擎稳步发展,相应地带动了生活、旅游、招聘等传统行业 广告主投放垂直搜索引擎广告。国外 healthline 垂直搜索获得了 1400 万美元的融 资,强力刺激了广告主对垂直搜索广告的认可和期待。垂直搜索引擎广告将会在未 来几年借助垂直搜索引擎的发展迎来更大的发展空间和机遇9。 但是,与美国方兴未艾的垂直搜索引擎发展相比,国内明显还处于落后状态, 国内众多网站虽然在自己的发展过程中做了许多有益的探索,但在内容垂直化、服 务集中化、访问经常化方面还有很长的路要走。 面向丝绸领域的垂直搜索引擎关键算法研究 第 1 章绪论 5 1.4垂直搜索引擎的发展前景 搜索作为网民面对互联网海量信息的最有效途径,已经成为网民的基础网络应 用。不管网民对什么内容产生好奇或者求知欲,“到网上搜一下”已经成了网民下 意识的第一反应。而作为网民个体而言,其关注的领域、感兴趣的内容是有限的, 也就是说网民在网上搜索的内容在很大程度上是有一定关联的,这种关联可能是娱 乐爱好、职业领域、地理区域、行业分类等等。而这些关联造就了一个搜索领域的 细分市场,那就是垂直搜索。 已经过去的 2007 年被称之为“搜索年”,进入 2008 年,搜索引擎依然持续走热。 2008 年伊始,华尔街对互联网行业的第一份预测出炉。根据摩根大通的研究团队预 测,被公众广泛关注的互联网发布者、门户、商业站点和搜索引擎在 2008 年仍然会 以较高的边际回报率超越整体股票市场的表现。摩根大通的分析师 Imran Khan 和他 的团队认为,尽管其收入增长率可能会稍微降低,但互联网公司的收入增长仍然要 比整体股票市场的增长快 4 倍以上。 Khan 在 1 月 2 日公布的报告中写到:“我们预测 2008 年收入增长率会减缓至 21.2%,2007 年这一比例为 25.6%。 ”2008 年最大的实惠将来自搜索引擎领域。Khan 预计全球搜索引擎收入将从 2007 年的 262 亿美元升至 2008 年的 305 亿美元。 相对全球搜索引擎的逐步成熟,中国搜索引擎市场仍然处于早期阶段,和美国 在 1997-2002 年的发展类似。而今,搜索引擎已经成为中国数字市场中当之无愧的 明星,在历经连续 18 个季度的高速增长后,搜索引擎正在进入一个相对平稳的发展 期。搜索引擎在快速增长中充满各种变数,培养用户粘性至关重要,更佳的用户体 验是种不错的选择。 百度、谷歌等在搜索领域占的比重更大,但这并不意味着搜索市场已经形成垄 断,中国市场上并不缺乏搜索领域的“新生儿”,相对百度、谷歌的强大,更多的“新 生儿”实行垂直化、细分化来角逐搜索市场,类似的有锣鼓网商业搜索、去哪儿旅游 搜索等垂直搜索。 搜索引擎本身的性质不同,使用人群、以及对用户体验的粘性把握上采用的方 式也就不同。百度在市场细分方面投入很大,尽力从客户使用的角度去挖掘产品更 大的市场空间。因此百度的客户群体数量大,以年轻群体为主,对于偏重时尚娱乐 产品的企业可能是一个比较好的选择,而同是搜索引擎的锣鼓网,与百度不同的是, 锣鼓网面向的是商业领域,商业型的企业是锣鼓网偏重的市场。 中国现有 4000 万家中小企业,作为商业搜索引擎,面向的用户群体更集中,相 对来说培养企业用户的粘性需要提供更广、更深、更细的服务。中国电子商务协会 第 1 章绪论 面向丝绸领域的垂直搜索引擎关键算法研究 6 秘书长陈震认为, “随着技术的发展和用户需求的不断提高,对信息的准确性、有效 性和公正性越来越被重视,这势必引发服务的变革,从大而全发展为精准和高效, 但企业必须要有强大技术研发实力,以及独特的模式才能在竞争中脱颖而出”。锣鼓 网商业搜索在服务提供上,推出“贸易直通车”产品,利用搜索+电子商务的形式,逐 步教育企业用户,形成企业人群对锣鼓网商业搜索的使用粘性。 有业内人士在预测 2008 年垂直搜索发展情况时,对“锣鼓网商业搜索、去哪儿 旅游搜索等”做了重点推荐10。 1.51.5课题的主要研究内容课题的主要研究内容 根据我国丝绸行业的发展现状和信息搜索的需求,本文的主要目的,在于利用 当前较为先进的垂直搜索引擎技术,建立一个由丝绸信息结构化抽取和检索为主要 服务内容的丝绸产品搜索网站,主要的信息来源于当前网页中发布信息的自动识别, 并可以根据用户输入的检索项,返回符合条件的丝绸产品信息。这了实现这一目的, 课题将按照如下结构开展以下几个方面的具体研究。 第一章,绪论。主要论述课题的研究背景,垂直搜索引擎发展现状、存在的问 题、发展趋势以及发展前景。 第二章,搜索引擎的基本原理。尽管垂直搜索引擎有自己的独特之处,但毕竟 也是搜索引擎的一种,本章将重点论述搜索引擎的基本工作过程,各个过程中所采 用的关键技术和信息处理方法,为后文丝绸信息搜索引擎的设计建立一个基本框架。 第三章,垂直搜索引擎的关键算法,重点论述垂直搜索引擎设计与实现的一些 独特的信息识别方法,提出丝绸信息搜索引擎所采用的一些关键算法。 第四章,面向丝绸领域的垂直搜索引擎的总体设计,根据前文的理论分析和当 前搜索引擎技术的发展现状,按照软件工程的方法,重点论述丝绸信息搜索引擎的 总体设计过程,包括需求分析、网站的功能规划和总体结构等内容。 第五章,面向丝绸领域的垂直搜索引擎技术的具体实现,在前面总体设计的基 础上,选定系统的开发环境和开发工具,通过编码实现设计阶段的各种算法和具体 功能。 结论。主要对论文的研究工作进行总结,提出系统的创新之处存在的问题。 针对以上几点,本课题做了大量的工作,开发的平台具有较好的通用性,可扩 展性。 面向丝绸领域的垂直搜索引擎关键算法研究 第 2 章搜索引擎实现原理 7 第 2 章搜索引擎实现原理 由于垂直搜索引擎是通用搜索引擎的细分和延伸,因此,在基本原理和工作过 程方面,与通用搜索引擎基本相同。本章将在重点论述通用搜索引擎的基本原理, 作为开发丝绸信息搜索引擎的基础。 2.12.1 通用搜索引擎通用搜索引擎的工作流程的工作流程 尽管当前对于各种搜索引擎的分类不同,但从原理上看,搜索引擎主要是指那 些使用网页爬行软件,按照一定的策略将 Web 文档采集到本地数据库,然后对这些 网页进行自动分析并建立索引数据库,进而对用户提出的检索请求在数据库中进行 搜索,找出匹配的文档或者链接,返回给用户的网络软件。 搜索引擎系统一般由蜘蛛(也叫网页爬行器) 、切词器、索引器、查询器几部分 组成。蜘蛛负责网页信息的抓取工作,一般情况下切词器和索引器一起使用,它们 负责将抓取的网页内容进行切词处理并自动进行标引,建立索引数据库。查询器根 据用户查询条件检索索引数据库并对检索结果进行排序和集合运算,如并集、交集 运算,再抽取网页简单摘要信息反馈给查询用户11。 搜索引擎从功能上同样分为三大部分:网页爬行、标引入库和用户查询12。网 页爬行主要负责网页的抓取,由 URL 服务器、爬行器、存储器、分析器和 URL 解析 器组成, 爬行器是该部分的核心;标引入库主要负责对网页内容进行分析,对文档 进行标引并存储到数据库里,由标引器和分类器组成,该模块涉及许多文件和数据, 有关于桶的操作是该部分的核心;用户查询主要负责分析用户输入的检索表达式, 匹配相关文档,把检索结果返回给用户,由查询器和网页级别评定器组成,其中网 页等级的计算是该部分的核心。其总体系统结构图 2-1 所示。 第 2 章搜索引擎实现原理 面向丝绸领域的垂直搜索引擎关键算法研究 8 图 2.1 搜索引擎的工作流程 搜索引擎的主要工作流程是:首先从蜘蛛开始,蜘蛛程序每隔一定的时间(象 google 一般是 28 天)自动启动并读取网页 URL 服务器上的 URL 列表,按深度优先 或广度优先算法,抓取各 URL 所指定的网站,将抓取的网页分配一个唯一文档 ID(DocId),存入文档数据库。一般在存入文档数据库之前进行一定的压缩处理。并 将当前页上的所的超连接存入到 URL 服务器中。在进行抓取的同时,切词器和索引 器将已经抓取的网页文档进行切词处理,并按词在网页中出现的位置和频率计算权 值,然后将切词结果存入索引数据库。整个抓取工作和索引工作完成后更新整个索 引数据库和文档数据库,这样用户就可以查询最新的网页信息。查询器首先对用户 输入的信息进行切词处理,并检索出所有包含检索词的记录,通过计算网页权重和 级别对查询记录进行排序并进行集合运算,最后从文档数据库中抽取各网页的摘要 信息反馈给查询用户。 2.22.2 网页信息采集技术和软件网页信息采集技术和软件 当前的网页信息采集技术,主要依赖自动采集软件,也称机器人 robot,蜘蛛 spider 或者爬虫 crawler,利用 Web 文档内的超级链接递归

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论