已阅读5页,还剩39页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要 电子书目数据( 又称书目数据信息) 指的是以数字化形式存在的有关图书资料的元数据,它 的建设是数字图书馆资源建设中一个重要的组成部分。传统上,书目信息的建设需要人工逐条录 入,这不但需要繁重的人力劳动,还给书目信息的准确性和及时性带来了问题。其实,互联网上 有许多现成的书目信息可以被利用:图书作者和读者的博客、出版商的业务网、数字图书馆的检 索系统,所有这些地方都有可能提供现成的书目信息。一个基于w e b 的书目信息自动搜集和服务 系统可以自动地从w e b 上搜集书目信息,通过加工整理、分析、存储、索引后,可以集中对外提 供元数据服务。 本文研究了基于w e b 的书目信息自动搜集和服务系统所涉及到的关键技术和系统的相关实 现,具体包括如下内容: 如何在w e b 中发现包含书目信息的目标网站和页面:如何将目标页面中的书目信息抽取出 来;怎样将抽取到的书目信息转换为m a r c 元数据:怎样利用这些m a r c 元数据为用户提供服 务。 本系统是根据网络上书目信息展现的特点,建立了一个书目主题的知识库,结合现有的主题 网络爬虫、网页去噪、信息抽取等计算机技术,将互联网上半结构化的书目主题信息抽取出来存 放到结构化的数据库中,再通过m a r c 生成技术将这些抽取到的结构化书目信息生成m a r c 格 式信息,利用已有的w e b 技术和全文检索技术为各类用户提供书目m a r c 信息检索和下载服务。 本课题的研究与开发为解决目前封闭式图书编目提供了一个可行的解决方案。充分利用互联网 上丰富的书目信息和现代计算机技术,使得图书编目更加开放化,有利于数字图书馆的进一步发 展。 关键词:数字图书馆m a r c 主题爬虫信息抽取全文检索 a bs t r a c t d i g i t a lb o o kd a t a ( f o ro t h e ri sb o o kd a t ai n f o r m a t i o n ) m e a n st h em e t a d a t ao ft h eb o o k d a t aw h i c he x i s ta sd i g i t a lf o r m ,t h ec o n s t r u c t i o no fb o o kd a t ai so n eo ft h em o s ti m p o r t a n t p a r t so ft h er e s o u r c e sb u i l d i n go fd i g i t a ll i b r a r y i nt r a d i t i o n a l l y , t h i sw o r kn e e dp e o p l e i n p u tt h eb o o kd a t ao n eb yo n e ,i ti sah a r dw o r ka n dn e e d sm u c hm a n p o w e r , i ta l s ot a k e s o m ep r o b l e m sf o rt h ev e r a c i t ya n dt h et i m e l i n e s so fb o o kd a t a i nf a c t ,t h e r ea r eal o t0 f r e a d yb o o kd a t ao nt h ew e bw h i c hc a nb eu s e d ,s u c ha st h ea u t h o r sa n dr e a d e r s b l o g ,t h e p u b l i s h e r s w e b s i t e s ,t h es e a r c hs y s t e mo fd i g i t a ll i b r a r y , e a c ho ft h e mi sl i k e l yt op r o v i d ea l o to fr e a d yb o o kd a t a w e b b a s e da u t oc o l l e c t i o na n ds e r v i c es y s t e mo fb o o ki n f o r m a t i o n c a nc o l l e c tb o o ki n f o r m a t i o na u t o m a t i c a l l y , t h r o u g hp r o c e s s i n g , s o r t i n g , a n a l y z i n g , s a v i n g a n di n d e x i n gi tc a ns u p p l yam e t a d a t as e r v i c ef o rt h eu s e r s t h i sp a p e rr e s e a r c h e st h ek e yt e c h n o l o g i e sa n dt h er e a l i z a t i o no ft h ew e b - b a s e da u t o c o l l e c t i o na n ds e r v i c es y s t e mo fb o o ki n f o r m a t i o n ,t h ec o n c r e t e l yc o n t e n t sa r ea sf o l l o w : h o wt of m dt h et a r g e tw e b s i t e sa n dw e bp a g e sw h i c hi n e l u d et h eb o o kd a t a ;h o wt o e x t r a c tt h ed a t af r o mt a r g e tw e bp a g e s ;h o wt ot r a n s f o r i l lt h e s eb o o kd a t at o 瞰c m e t a d a t a ;h o wt ou s et h e s em e t a d a t at os e r v ef o rt h eu s e r s t h i ss y s t e mc o n s t r u c tak n o w l e d g el i b r a r yo fb o o ks u b j e c t ,b a s e do ft h ec h a r a c t e r i s t i c o ft h eb o o k s i n f o r m a t i o nw h i c he x h i b i to nt h ew e b i n t e g r a t ew i t hs o m ec o m p u t e r t e c h n o l o g i e s ,s u c ha sf o c u sw e bs p i d e r , n o i s er e d u c t i o n ,i n f o r m a t i o ne x t r a c t o ra n ds oo n , e x t r a c ts e m i s t r u c t u r e db o o k s i n f o r m a t i o nw h i c ho nt h ew e ba n dp u tt h e mi n t os t r u c t u r e d d a t a b a s e t h e ng e n e r a t et h e s es t r u c t u r e db o o ki n f o r m a t i o na sm a r ct h r o u g h 瞰c - g e n e r a t et e c h n o l o g y u s et h ew e bt e c h n o l o g i e sa n df u l lt e x ts e a r c h t o s u p p l y i n f o r m a t i o ns e a r c ha n dd o w n l o a ds e r v i c ef o r t h eu s e r t h er e s e a r c ha n dd e v e l o p m e n to ft h i sp r o j e c th a ss u p p l yau s e a b l es o l u t i o nt os o l v et h e c l o s e db o o kc a t a l o g m a k eu s eo f r i c hb o o k s i n f o r m a t i o no nt h ew e ba n dl a t t e r - d a y c o m p u t e rt e c h n o l o g i e st om a k eb o o kc a t a l o gm o r eo p e n e d ,a n dd e v e l o p m e n to fd i g i t a l l i b r a r yc a nb e n e f i tf r o mi t k e y w o r d s :d i g i t a ll i b r a r y ,m a r c , f o c u ss p i d e r , i n f o r m a t i o ne x t r a c t i o n ,f u l lt e x ts e a r c h 学位论文独创性声明 本人郑重声明: 1 、坚持以求实、创新的科学精神从事研究工作。 2 、本论文是我个人在导师指导下进行的研究工作和取得的研究成 果。 3 、本论文中除引文外,所有实验、数据和有关材料均是真实的。 4 、本论文中除引文和致谢的内容外,不包含其他人或其它机构已经 发表或撰写过的研究成果。 5 、其他同志对本研究所做的贡献均已在论文中作了声明并表示了谢 意。 作者签名:盔:主。磊 日 期:丞垄:圭2 学位论文使用授权声明 本人完全了解南京师范大学有关保留、使用学位论文的规定,学校 有权保留学位论文并向国家主管部门或其指定机构送交论文的电子版和 纸质版;有权将学位论文用于非赢利目的的少量复制并允许论文进入学 校图书馆被查阅;有权将学位论文的内容编入有关数据库进行检索:有 权将学位论文的标题和摘要汇编出版。保密的学位论文在解密后适用本 规定。 作者签名: 日期: 第一章绪论 1 1 引言 书目信息资源是图书馆建设中的最重要资源之一,传统的图书馆的书目信息都是通过卡片的 形式来表现的,卡片存在易磨损、易损坏、易丢失等缺点。随着计算机和网络的普及,目前书目 信息更多是以电子资源的形式存在,以供读者检索查阅,这样就克服了卡片形式的一些缺点,但 是书目信息向计算机中的录入和编制又需要花费大量的人力和时间。 目前数字图书馆的书目信息主要是由服务提供者提供,如各大图书馆或者图书发行商等。这 些书目信息的采集大多数是由工作人员向计算机中录入、编目的【l 】当然也不乏存在着一些其他 的采集手段。这种书目信息采集与编目需要花费大量的时间和人力,且存在很多的问题,如录入 和编目的内容很多是其他编目者做过的工作、速度和效率低、编目人员容易产生疲劳等。 针对以上问题和现象,“基于w e b 的书目信息自动搜集与服务”项目旨在构建一个基于w e b 的书目信息自动搜集和服务的平台,本文主要介绍了该项目所涉及的一些概念和相关实现技术。 1 2 研究背景及意义 电子书目数据( 又称书目数据信息) 指的是以数字化形式存在的有关图书资料的元数据,它 的建设是数字图书馆资源建设中重要的组成部分。传统上,书目信息的建设需要人工逐条录入。7 这不但需要大量的人力资源,也给书目信息的准确性和及时性带来了问题。其实,随着i n t e m e t 的迅猛发展,尤其是w w w ( w b r l dw i d ew 曲) 的全球普及,互联网上有很多现成的书目信息可 以被利用:图书作者和读者的博客、出版商的业务网、数字图书馆的检索系统,所有这些地方都 有可能提供现成的书目信息。 网络上的信息主要以非结构化或半结构化的形式存在【2 1 ,如何能够发现我们所需要的书目元 数据信息,并将这些非结构化或半结构化的信息转换成结构化的信息,这将是我们面临的重要问 题。 书目信息的自动发现和搜集需要从大量的异构、分布、动态的w e b 源以较高的准确率和召回 率抽取多种w e b 信息,全面、准确、高效地生成书目元数据,可以有效避免目前分布式人工编目 所存在的缺陷。从w w w 上自动发现和抽取出书目信息,并将抽取到的书目信息生成m a r c 元 数据信息,供与各大图书馆和众多读者进行下载和使用,那么必能大火缓解广大书目编目者的工 作压力,提高其工作效率,对数字图书馆的资源建设具有重要的现实意义。 一个基于w e b 的书目信息自动搜集和服务系统可以自动地从w e b 上搜集书目信息,通过加 工整理、分析、存储、索引后,可以集中对外提供元数据服务。因此,构建一个具有自动性、智 能性、灵活性等优良特性的w e b 书目信息自动搜集与服务的平台,可以及时、迅速地搜集和抽取 w w w 上的书目元数据信息,对于数字图书馆书目资源建设的自动化和开放化具有重要的意义和 应用前景。 1 3 研究现状 一1 随着i n t e r n e t 的快速增长,w 哪已经发展成为包含多种信息资源站点遍布全球的巨大信息服 务网络,为用户提供了一个极具价值的信息源。自诞生以来,它已经发展为拥有上亿用户,上百 亿页面的巨大分布式信息空间,而且这个数字仍以每4 至6 个月翻一倍的速度增加,互联网已经 成为一个巨大的海量信息空间。如何快速、准确、方便的从如此庞大的信息库中获取自己需要的 信息,是互联网用户面临的一个重要问题。 搜索引擎的出现,整合了众多网站信息,极快的查询起到了信息导航的作用,信息的价值得 到众多商家的普遍认可,成为互联网中最有价值的领域。大家熟知的搜索引擎g o o g l e 、百度、雅 虎等都是搜索引擎的杰出代表,为互联网的发展做出了重要的贡献。c n n i c 第十四次互联网调查 显示,搜索以7 1 9 的绝对优势成为用户从互联网上获得信息的主要方式,是互联网上使用程度 仅次于电子邮箱的服务。互联网的信息量呈爆炸趋势增长,几年前全球式搜索引擎收录的网页量 只有几千万页,而现在已经达到几十亿页,数量增加带来的是搜索服务的品质下降,查询的结果 集就是海量的,经常是几十万笔的资料,结果里存在大量的重复信息和垃圾信息,用户越来越难 迅速的找到符合的信息,现在经常使用搜索引擎可以感觉到很难在短时间内准确的筛选出需要的 内容,因此,如何对现有的搜索引擎相关技术进行改进,并结合信息抽取等技术,使查询的结果 集符合用户的要求,成为信息处理领域近期的研究热点。 1 3 1 信息搜集与服务的现状 信息服务工作包括信息收集、检索与提供等。信息收集是信息工作的一个重要环节,其主 要任务是根据用户的信息需求,将w e b 中处于分散状态下的各种信息加以集中和整理,以满足 不同用户的需求。 i n t e r n e t 尤其是嗍的飞速发展,给人们带来了前所未有的信息共享和交流。但是, i n t e r n e t 上信息的特点导致了人们在越来越依赖它的同时面临着在庞大的信息空间中迷失方向 的困惑皿。如何在海量的信息中获取用户所关注的信息,如何将用户关注的信息提供给用户,成 为信息服务工作亟待解决的问题之一。目前,用户获取网上资源主要存在以下问题: 1 信息过量。网上资源内容广泛,通用搜索引擎返回的大量信息过多过杂,专业性不强 使用户淹没在海量信息里,筛选信息需要耗费大量的精力。 2 信息准确度低。由于通用搜索引擎强调通用性,检索范围广,对资源没有筛选分类,资 源索引库十分庞杂,很难满足特定用户群的特定需求; 3 获取信息速度低。多数用户需要经常获取固定的某个方面的信息,为此需要经常重复浏 览固定的站点或者利用搜索引擎进行重复的检索与结果筛选,浪费了大量时间,获取资源信息的 时效性较低。 4 信息服务缺乏针对性,缺少用户交互。通用搜索引擎检索结果完全依赖于用户的关键词, 即对于不同的用户,同一个关键词返回的结果相同,没有与用户联系起来,难以满足用户的个性 化需求。 1 3 2 信息抽取的发展现状 搜索引擎是开启网络知识殿堂的钥匙,获取知识信息的工具。搜索引擎为人们提供了检索 2 w e b 上相关信息的方法,搜索引擎对w e b 上的文档进行索引并进行分类,为人们提供一个w e b 内容的层次化的目录结构:有的搜索引擎对w e b 上的页面进行全文索引,提供基于关键词的检索。 但随着网络技术的飞速发展,获取更加准确、更加详细、更加深层的专业信息,成为对广大网络 用户提出的新需求。 信息抽取( i n f o r m a t i o ne x t r a c t i o n ,m ) 研究就是在这种背景下产生的,信息抽取是信息搜索 的进一步发展,是指从非结构化和半结构化的文本中抽取出用户所感兴趣的信息,形成结构化的 信息并存入数据库,供用户查询和使用的过程。它是一种应用技术,研究指定信息的查找、理解 和抽取,并以适当的方式输出所指定的信息。它的主要功能就是从这些非结构化或者半结构化的 信息中提取出有用的信息,并以结构化的形式描述,或者直接存入数据库,供用户使用以及进一 步的分析利用。 m 的前生是文本理解口1 ,在正出现之前,已经有大量的关于自然语言处理的研究和系统。 但这些系统通常只能处理一个很狭窄领域的文本,而且很难移植到新的领域1 。随着w e b 的出 现和繁荣,研究人员逐渐将兴趣转移到w e b 信息抽取的研究上。网页可以看成一种特别的语言 文本,从这种语言文本中获取结构化信息的研究最早开始于2 0 世纪6 0 年代中期,美国纽约大学 开展的l i n g u i s t i cs t r i n g 项目是较早的成果之一,开始于6 0 年代中期并一直延续到8 0 年代。其主 要研究内容是建立一个大规模的英语计算语法,与之相关的应用是从医疗领域的x 光报告和医院 出院记录中抽取信息格式( i n f o r m a t i o nf o r m a t s ) ,这种信息格式实际上就是现在我们所说的模板 ( t e m p l a t e s ) 。 另一个相关的长期项目是由耶鲁大学r o g e r s c h a n k 及其同事在2 0 世纪7 0 年代开展的有关故 事理解的研究。由他的学生g e r a l dd ej o n g 设计实现的f r u m p 系统是根据故事脚本理论建立的 一个信息抽取系统。该系统从新闻报道中抽取信息,内容涉及地震、工人罢工等很多领域或场景。 该系统采用了期望驱动( t o p - d o w n ,脚本) 与数据驱动( b o t t o m u p ,输入文本) 相结合的处理方 法,这种方法被后来的许多信息抽取系统采用。 从2 0 世纪8 0 年代末开始,信息抽取研究蓬勃开展起来,这主要得益于消息理解系列会议 ( m u c ,m e s s a g e u n d e r s t a n d i n g c o n f e r e n c e ) 的召开,它由美国国防高级研究计划委员会( d a r p a , t h ed e f e n s e a d v a n c e dr e s e a r c hp r o j e c t s a g e n c y ) 资助。m u c 系列会议使信息抽取发展成为自然语 言处理领域一个重要分支,并一直推动这一领域的研究向前发展。m u c 定义的信息抽取任务的 各种规范以及确立的评价体系已经成为信息抽取研究事实上的标准。 近几年,信息抽取技术的研究与应用更为活跃。在研究方面,主要侧重于以下几方面:利用 机器学习技术增强系统的可移植能力、探索深层理解技术、篇章分析技术、多语言文本处理能力、 w e b 信息抽取( w r a p p e r ) 以及对时间信息的处理等等。在应用方面,信息抽取应用的领域更加 广泛,除自成系统以外,还往往与其他文档处理技术结合建立功能强大的信息服务系统。至今, 已经有不少以信息抽取技术产品为主的公司出现,比较著名的有:c y m f o n y 公司、b h a s h a 公司、 l i n g u a m a t i c s 公司、r e v s o l u t i o n s 公司等。 中文信息抽取方面的研究起步较晚,主要的研究工作集中在对中文命名实体的识别方面,在 设计实现完整的中文信息抽取系统方面还处在探索阶段。其中,国立台湾大学( n a t i o n a lt a i w a n u n i v e r s i t y ) 和新加坡肯特岗数字实验室( k e n tr i d g ed i g i t a ll a b s ) 参加了m u c - 7 中文命名实体 3 识别任务的评测9 1 。i n t e l 中国研究中心的z h a n g y i m i n 和z h o uj o e f 等人在a c l - 2 0 0 0 上演示了 他们开发的一个抽取中文命名实体以及这些实体间相互关系的信息抽取系统,该系统利用基于记 忆的学习( m b l ,m e m o r y b a s e dl e a r n i n g ) 算法获取规则用以抽取命名实体及它们之间的关系。 近年来国内外涌现了多种信息提取方法,根据自动化程度可以分为人工方式的信息抽取、 半自动方式的信息抽取和全自动方式的信息抽取三大类;根据提取原理和提取方式的不同可以大 致分为以下5 类 7 1 :基于自然语言处理方式的信息抽取、包装器归纳方式的信息抽取、基于 o n t o l o g y 方式的信息抽取、基于h t m l 结构的信息抽取和基于w e b 查询的信息抽取,这5 种方 式我们在第三章将作进一步的介绍。这些方法各有侧重地解决了上述w e b 信息抽取中面临的问 题,总体上取得了良好的效果,但在某些方面存在不同程度的局限或缺陷。因此,为了更好地解 决从w e b 上进行获取书目元数据信息,有必要对w e b 信息抽取问题作进一步研究。 1 4 本文的研究思路和主要工作 本文研究思路的核心是利用基于w e b 的书目自动搜集与服务系统实现基于网络图书信息的自 动编目,并为各类用户提供书目元数据信息的检索与下载服务。围绕该研究思路,本文的主要工 作概括如下: 1 数字图书馆中的元数据研究。元数据的格式有很多,选择一个比较常用的元数据并对其格 式进行一定的研究,对于系统后期的服务具有一定的参考。 2 w e b 书目信息自动搜集的关键技术研究。为了能够实现w e b 书目信息自动搜集,必须 通过主题爬虫从互联网上采集到相关的目标网页,然后通过网页净化对目标页面进行适当的处理, 最后通过信息抽取技术从这些处理后的目标页面中抽取出书目信息。这些关键技术是系统正常运 行的基础。 3 提高信息抽取的准确性和完整性的策略研究。针对网络信息不准确性和不完整性的特点, 提出了对应的解决方案。使得抽取到的信息具有较高的准确性和完整性,从而提高抽取信息的可 信度。 4 原型系统的设计。基于本文的研究思路,我们设计并开发了一个基于w e b 的书目信息自动 搜集和服务系统原型,以验证本文所提出的各种方法的在实际运用中的效果。 1 5 本文的研究成果 本研究理论与实践相结合,主要取得了如下一些成果: 1 数字图书馆中常用的m a r c 元数据的组成格式的研究,设计实现了对m a r c 元数据的处理, 利用抽取到的书目元数据信息生成一条新的m a r c : 2 基于w e b 的书目信息自动搜集系统实现的关键技术研究,设计实现了具体完整的主题网站 发现、目标页面处理和抽取的算法,以及提高信息准确性、完整性的策略; 3 基于w e b 的书目信息自动搜集与服务原型系统的设计和开发源代码; 4 基于s o l r 的全文检索服务,为用户提供了更加精细化的检索,提高用户检索的准确性和 响应速度。 1 6 本文的组织结构 一4 一 本文共分六章,文章的组织结构如下: 第一章“绪论”,主要介绍了本文的研究背景、研究意义和研究现状进行了描述,并对本文的 研究思路、主要工作和研究成果进行了简单的介绍。 第二章“数字图书馆中的元数据”,主要介绍了数字图书馆的建设、元数据的基本概念和作 用,并着重介绍了数字图书馆中常用的m a r c 元数据的产生和发展以及它的格式结构。 第三章“w e b 书目信息自动搜集的关键技术”,主要介绍了书目信息自动搜集所涉及到的关 键性的技术,具体包括:( 1 ) 主题爬虫,介绍了主题爬虫的模块组成以及每一个模块的功能;( 2 ) 网页净化,介绍了网页中噪音的分类和网页净化的具体算法;( 3 ) w e b 信息抽取,首先介绍了现 有的信息抽取方法,然后介绍了本文中使用的基于主题知识库的信息抽取算法;( 4 ) 提高书目信 息准确性、完整性的策略,针对网络信息不可靠、不完善的特性提出了一系列的应对策略。 第四章“书目信息自动搜集原型系统的设计”,介绍了书目信息自动搜集原型系统的框架流 程图,并给出了系统中部分类的类图设计和系统运行界面图。 第五章“基于w e b 的书目信息服务的相关实现”,主要介绍了服务部分的具体实现,具体包 括:( 1 ) g a r c 自动生成服务,详细介绍了类的识别、类的定义和自动生成m a r c 的实现;( 2 ) 基 于s o l r 的全文检索服务,详细介绍了数据模型的设置、中文分词、索引管理和全文检索的实现。 第六章“总结与展望”,对本文的工作进行了总结,并从理论研究和系统功能两个方面对以一 后的工作进行了规划和展望。 5 第二章数字图书馆中的元数据 面临当前信息技术和计算机网络的飞速发展所提出的实现五个w 的个人通信目标:即任何人 ( w h o e v e r ) 可以在任何时间( w h e n e v e r ) 任何地点( w h e r e v e r ) 都可以和任何一个其他人 ( w h o m e v e r ) 通过网络进行通信,以传递任何信息( w h a t e v e r ) ,数字图书馆的建设已成为全球 信息化过程中不可或缺的重要组成部分。数字图书馆中资源的数量十分庞大,在数字图书馆中主 要片j 元数据来表示其中的资源。本章主要介绍数字图二传馆的一些基本概念和数字图书馆中常用的 资源表示形式m a r c 元数据。 2 1 数字图书馆 目前学术界关于数字图书馆比较统一的界定为:任何利用数字技术和计算机网络获取、存储、 存取、发布信息的图书馆和信息机构。它是数字化系统,究其实质,它与传统图书馆几乎具有相 同的工作流程,只不过采用现代技术手段为同样的工作环节服务。数字图书馆需要搜集和创建数 字化馆藏并利用建立在各种关系数据库或面向对象数据库系统上的有关数字对象的组织、管理、 查询技术帮助用户便捷地查找信息,并将信息按照用户期望的格式发送。在安全保护、访问许可 和记账服务等完善的权限管理之下,数字图书馆内经授权的信息能够利用i n t e m e t 的发布技术, 实现全球信息共享。 数字化资源、网络化存取和分布式管理是数字图书馆的三个基本要素。数字图书馆建设的基 本内容主要包含数字化资源的建设和网络信息资源的搜集和整理。 2 1 1 数字化资源的建设 数字化资源的建设包括馆藏书资源的数字化和各类数字资源的收藏。一方面对馆藏书目和相 关文献按支持7 _ , 3 9 5 0 标准下的远程异构系统透明检索,支持扩展m a r c 格式对数字化文献和网 络资源的编目和建多要求进行加工,以支持数字化文献的传递服务:另一方面,大量采购各种数 字化资源,如:联机或网络数据库、电子图书、电子期刊等。 2 1 2 网络信息资源的搜集和整理 由专业人员对因特网上相关主题或类型的信息进行搜索、分类、整理,把分布在世界各地的 近百万的w w w 服务器上的资源组织起来,建立资源链接中心,利用图书馆内与馆外方便接入的 o p a c ,建立w e b 接口( w e b p a c ) ,使读者可以通过因特网访问。除提供用户有关借阅信息、预 约、续借等功能外,提供增强型检索能力,即提供专题全文检索、提供查询结果的超链接、进行 模糊检索、词表辅助和自动映射等智能化检索。 2 2 元数据 计算机技术、网络技术、通信技术的飞速发展使人类社会步入了知识经济时代。知识对个人、 企业、国家发展的作用越来越受到人们的重视。呈几何级数增长的信息在给人类带来财富的同时, 也使人们陷入信息的无序和混乱中。对知识的管理在当今显得尤其重要。虽然人类对知识的管理, 自有知识起就存在,知识经济时代的数字化环境正对人类的知识管理技术和水平提出挑战。元数 6 据,这一人类管理知识的新工具就应运而生了。 元数据是专门用来描述数据的特征和属性的,能用来支持电子资源的定位、发现、评估、选 择等,它对于搜索引擎的搜索效果将起到不可估量的作用。好的元数据方案应同时具有互操作性 ( i n t e r o p e r a b i l i t y ) 、可扩展性( e x t e n s i b i l i t y ) 、独立句法结构( s y n t a xi n d e p e n d e n c e ) 、可选择。 生( o p t i o n a l ) 、 可重复性( r e p e a t a b i l i t y ) 及可修改性( m o d i f i a b i l i t y ) ,并且它是实现各种灵活查询功能( 即资源内容 挖掘) 的基础。因此,元数据是实现信息存储、传播、检索等工作的重要基础,元数据的选择和 实现是数字图书馆信息资源管理与组织的核心问题。 2 2 1 元数据的概念 关于元数据,迄今为止还没有完全统一的定义。根据国际图联“元数据资源”的主页和学术 界较统一认定的定义是:元数据是关于数据的数据( d a t aa b o u td a t a ) ,即指任何关于帮助网络电 子资源的识别、描述和定位的数据。 2 2 2 元数据的发展 2 2 2 1 传统元数据 传统的基于手工及印刷的元数据著录,一般来说是将对文献资料的描述,按照一定的规则或 摘要形式记录在另外的手写或印刷载体中,这些载体的形式可以是卡片、书本式目录或索引等, 因此当时元数据的管理也是基于传统的手写或印刷的媒介。一般而言,元数据与其所描述的对象 之间是分离的。而到了2 0 世纪六七十年代后,计算机系统进入实用阶段,开始大量应用计算机来 进行元数据的处理,也因此产生了许多依赖于计算机处理的元数据体系,比如m a r c ( 机器可读 目录) 等。对于m a r c 类型的基于计算机处理的元数据,是由计算机将元数据作为单独的数据库 或文件形式进行管理,元数据与其所描述的对象( 例如,印刷型文献) 本身仍然是分离的。 。 2 2 2 2 现代元数据 随着网络信息资源成倍增长和信息的多元化发展,世界各国都在制定特定使用对象的元数据 格式,用以揭示数字化文献的特征。如d u b l i nc o r e 、v r a c o r e 格式、c d w a ( 艺术作品著录类目) 。 我们将d c 等新产生的元数据体系称为现代元数据,它们在著录与管理方法上与传统的元数据体 系的不同,受到三个方面因素的影响: ( 1 ) 它们所描述的对象发生了变化。现代元数据描述的对象往往已经是数字化的对象,比如电 子书、w e b 网页、数字多媒体资料等。其描述重点往往更注重描述对象的内容、内部结构或标准 以及应用与管理方面,而不是像传统的元数据( 如m a r c ) 有很多外形特征的描述。 ( 2 ) 网络环境的影响。现代元数据体系往往应用于i n t e r n e t 网络的环境中,它们所描述的对象 往往不再是本地的资源,也不一定是制作元数据的机构或个人拥有的资源。同时元数据本身也有 着分布式管理与应用的需求。 ( 3 ) 标记语言的兴起。进入2 0 世纪8 0 年代以来,计算机应用跨入网络化及标准化的时代, 作为一种管理与应用各种资源的有效方法,标记语言也就是在这样的背景中得到了大量应用。现 代元数据很多是直接利用标记语言或电脑数据库等进行制作,使用标记语言制作的好处是保证了 7 元数据的结构化,易于被计算机处理和交流,对人来说也有很好的可读性。 2 2 3 元数据的作用 元数据具有传统目录的“著录”功能。目的在于使数字资源的管理维护者和使用者可以通过 元数据了解并辨别资源,进而管理和利用资源,为由形式管理转向内容管理奠定必要的基础。它 在数字资源组织方面的主要作用如下: 描述:对数字对象的内容和位置进行描述,从而为信息对象的存取和利用奠定必要的基础; 定位:根据元数据包含的数字资源位置方面的信息,可以确定资源位置之所在,可促进网络 环境中非实体信息对象的发现和检索; 搜寻:在著录的过程中,将信息对象中的重要信息抽出并加以组织,赋予语义,并建立相关 关系,将使检索结果更加准确,从而更有利于用户识别资源的价值,发现其真正需要的资源; 评估:根据元数据提供的有关信息对象的名称、内容、年代、格式、制作者等基本属性,用 户在无需浏览信息对象本身的情况下,就能够对信息具备基本的了解和认识,参照有关标准即可 对其价值进行必须的评估,作为存取和利用的参考; 选择:根据元数据所提供的描述信息,参照相应的评估标准,结合使用环境,用户便能够做 出对信息对象取舍的决定,选择适合自身需要的资源。 2 3m a r c 元数据 m a r c 是m a c h i n er e a d a b l ec a t a l o g 的英文缩写,简称机读目录,是以代码形式和特定结构 记录在计算机存储介质( 磁带、磁盘、光盘) 上的、用计算机识别和阅读的目录。制定m a r c 标 准的目的是为了实现书目数据的规范和统一,充分开发和利用文献资源,从而推动国际图书情报 部门之间的书目信息交流与共享。m a r c 也是数字图书馆中比较常用的元数据格式,下面本文简 单介绍一些关于m a r c 的概念。 2 3 1m a r c 元数据的产生与发展 机读目录6 0 年代产生于美国国会图书馆,称为s m a r c 或l c m a r c 。1 9 7 3 年通过国际标准 化组织颁布的国际标准文献目录信息交换用磁带格式( i s 0 2 7 0 9 1 9 7 3 ) 。m a r c 的成功,引起 了世界各国图书馆界的关注,许多国家纷纷研究、试验、着手建立本国的机读目录系统。1 9 7 7 年 国际图书馆协会联合会为了解决机读书目数据和内容标识符的不统一,方便在国际范围内交换书 目,制定了通用机读目录格式,即u n i m a r c 。该格式可接受任何m a r c 格式的数据,因此任 何一种m a r c 格式的数据都可以被转换为u n i m a r c ,然后再转换为任何其它m a r c 格式。这 样,每个需要进行数据转换的机构,只需完成两个转换程序,即转入u n i m a r c 和转出u n i m a r c 程序,便能实现m a r c 格式的转换。u n i m a r c 的出现,得到许多国家的认可,并以u n i m a r c 为基础,产生各国自己的m a r c 格式。例如,u k m a r c ( 英国) 、u s m a r c ( 美国) 、i n t e r m a r c ( 法国) 、c a m a r c ( 加拿大) 、j m a r c ( 日本) 、c n m a r c ( 中国) 等等。 近几年,为了适应数字化信息的发展,美国国会图书馆对m a r c 进行了修订。调整增补了“3 0 7 文献检索或获取时间”、“8 5 6 电子信息位置及提取方式”、“5 1 6 计算机文档或数据类型注释”、“5 3 8 系统细节附注等字段”,尤其是8 5 6 字段的增加,使m a r c 具备描述电子资源的特征、连接方式 8 和提取要求的能力,即可以对网上资源进行编目,也可以将常规馆藏同网上的数据资源连接起来。 2 3 2 我国机读目录的建设及使用现状 1 9 8 6 年,我国翻译出版了国际图联的u n i m a r c ,并于1 9 9 2 年正式出版了适应中文文献的 中国机读目录通讯格式( c h i n a m a r c f o r m a t 或称c n 眦c ) ,即中国国家标准机读目录。 在全国得到了广泛的推广和应用。 但是,我国传统图书馆由于历史的原因首先把文献按语种分类,一般分为中文、西文、日文 和俄文,然后再在各语种中按学科分类著录。目前国内图书馆界中文图书一般使用c n m a r c 著 录,西文图书一律用u s m a r c 格式著录。这就使得中外文图书的格式著录分成了两个系统,索 取号也分成了两个系统,导致各地馆藏排架策略无法统一,流通管理也不得不分成两个系统。并 且同一学科内容的图书分散典藏于各个不同的书库,各个藏书点的排架方式、借阅规则都不一样, 给读者使用带来极大的不便。c n m a r c 与u s m a r c 在机内格式、字段设置方面的差别,使图书 馆最主要的中西文编目数据库分立,尽管系统开发人员在考虑系统兼容性时绞尽脑汁,但最终也 难以实现两种m a r c 格式的数据兼容及其在各业务模块中的高度集成化。中西文文献两种m a r c 编目并行成为制约我国图书馆自动化系统发展水平的重要因素之一。 2 3 3m a r c 元数据的地位、作用 m a r c 元数据为现代元数据的产生和发展提供了重要的思想和实践经验,对图书馆自动化、 数字化建设作出了重要的贡献,具有不可替代的作用。m a r c 作为一种机读目录国际标准,在图 书馆界已得到了广泛的应用,可以通过z 3 9 5 0 协议建立联合图书目录、联合编目中心等,实现馆 际资源共享。经过3 0 多年的实践与发展,m a r c 已成为目前图书馆的主要发布信息源。 2 3 4m a r c 的格式结构 m a r c 的格式是i s o2 7 0 9 及g b2 9 0 1 的一个特定形式。标准记录结构见表2 1 : 表2 1 标准记录结构表 ( 1 ) 记录头标 记录头标的重点是:长度为2 4 个字符;o - - 4 位是记录长度:1 2 1 6 位为数据基地址。当原 始m a r c 被修改后,记录头标的n 4 位和1 2 1 6 位也必须做相应的修改。 ( 2 ) 地址目次区 地址目次区的重点是:其款目与数据字段区的字段依次以一一对应;每个款目长度为1 2 位, 分别是:三位数表示字段号( 0 - - - 2 位) ,四位数表示数据字段长度( 3 - - - 6 位) ,五位数表示的字段 起始字符位置( 7 _ 1 1 位) ;其结尾有一个字段分隔符。 ( 3 ) 数据字段区 数据字段区的重点是:字段分为控制字段( 0 0 ) 和变长字段( 0 1 0 至9 9 9 ) ,它们的结构不同; 控制字段由数据和字段分隔符组成;变长字段的结构见表2 2 : 9 表2 - 2 变长字段结构表 i指示符子字段其他子字段字段分隔符 2 位子字段标示( 2 位)子字段数据1 位 ( 4 ) 分隔符 分隔符的重点是:每种分隔符在i s o i e c1 0 6 4 6 中的位置编码。分隔符是读取字段和子字段 值的依据。 2 3 5m a r c 格式的优点 m a r c 的诞生规范了图书馆书目信息,推动了图书馆自动化的发展。 ( 1 ) m a r c 元数据格式提供了严谨、系统、完备规范化的标识,且具有成熟的结构。m a r c 数据格式符合图书期刊的著录要求,能够提供多种检索途径,检索速度快、效果好,并且有格式 统一、自动排列、节省空间等特点。尤其是它作为机读目录的通讯格式能够做到对同一种m a r c 来说,可以一家著录、大家共享,为图书馆各项业务的开展带来了极大的便利,用途广阔。使用 m a r c 记录格式不仅能提高图书馆的工作效率,方便用户检索信息,而且也为实现文献信息共建 共享打下了基础。 ( 2 ) 机读目录的特点之一是一次输入、可生成多种形式输出。数据越完整,检索点越多,利 用的范围就越广。m a r c 作为一种书目数据交换格式,提供了充分全面的检索点,并且通过款目 连接块字段的连接功能,可提供定向性的检索点。各图书馆可根据自己的需要选择这些字段,以 确定自己系统的检索点。m a r c 的一次输入、多项检索从实质上把编目工作者从繁琐的手工著录 和目录组织方式中解脱出来。 ( 3 ) m a r c 的使用加强了文献的记录功能,加深了文献的标引深度,使读者可以充分利用 书目数据资源,同时便于计算机对书目进行处理。 第三章w e b 书目信息自动搜集的关键技术 w e b 书目信息自动搜集主要是针对互联网上丰富的书目信息,这些信息分布在不同的站点中, 且结构各不相同,这给书目信息自动搜集带来了一定的困难。 借鉴并运用已有的计算机技术发现互联网上的目标页面,并抽取出目标页面中的书目信息是 我们的研究出发点。因此,本章主要研究了信息自动搜集所涉及到的主题爬虫、网页净化和信息 抽取技术。 3 1 主题爬虫 3 1 1 主题爬虫概述 目前的爬虫大多数是面向所有信息的,可以称之为综合性爬虫,但随着信息多元化的增长, 适用于所有信息的综合性爬虫显然已经不能满足特定用户更深入的信息查询需求,他们对信息的 需求往往是针对受限领域和面向特定主题的,综合性爬虫的更新效率和爬行效率都很低。 主题爬虫的设计是以普通爬虫为基础的,实际上它是对一个普通爬虫进行功能上的扩充,其 模块结构图如图3 - 1 所示在对网页的整个处理过程中需要增加模块:主题确立模块、优化初始种 子模块、主题相关度分析模块。主题确立模块用于确立爬虫面向的主题;主题相关度分析模块用 来进行网页主题相关度计算;初始种子模块用于生成面向特定主题的较好的种子站点,使爬行模 块能够顺利展开爬行工作;主题相关度分析模块是主题爬虫的核心模块,它直接决定页面的取舍。 图3 - 1 主题爬虫的模块结构图 其中,初始种子模块和主题确立模块是两
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 学习银行员工违反规章制度处理办法的心得体会
- 黑龙江省哈三中2025-2026学年度下学期高二学年期末考试 地理答案
- 学生辱骂他人检讨书
- 行政公文行文规范及管理制度
- DB43∕T 3264-2025 洞庭湖区棉花间作甜瓜栽培技术规程
- 城市亮化设施安装工艺与质量验收手册
- 冷链物流管理规范与操作手册
- 电子商务行业趋势分析工作手册
- 高铁动车专项安保防控工作手册
- 驾校车辆试驾路线规划管理手册
- 父母房屋转赠协议书
- 中建钢筋集中加工场专项施工方案2020
- 低空经济产业园项目环境影响评估
- 小学汉字书写规范与教学策略研究
- 大型会议承办工作手册
- DB32T 4842-2024耕地土壤中水溶性硒的测定 氢化物发生-原子荧光光谱法
- 使用单位特种设备安全风险管控清单
- 中建EPC工程总承包项目全过程风险清单(2023年)
- 纽卡斯尔护理满意度量表(NSNS)
- 国考历年行测真题-常识判断
- 市值管理简述课件
评论
0/150
提交评论