医学文献领域本体的构建及其关键技术分析_第1页
医学文献领域本体的构建及其关键技术分析_第2页
医学文献领域本体的构建及其关键技术分析_第3页
医学文献领域本体的构建及其关键技术分析_第4页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、本文以构建医学文献领域本体模型为例,阐述了构建医学情报领域本体的基本方法、流程框 架和使用工具,并对本体构建过程存在的几个关键问题进行了分析,为医学情报领域本体的 建设进行了可借鉴的尝试。本体(ontology)源于哲学范畴,指的是客观存在的一个系统的解释和说明。1993年Gruber 为本体下了这样的定义,即“本体是概念模型的明确的规范说明后来Studer等对前人的 定义进行深入研究后给出了另一个定义:“本体是共享概念模型的明确形式化规范说明”。 虽然诸多学者对本体概念的定义描述到目前为止还没有达成共识,但是这些概念都包涵了本 体的四个共性特征,即:概念化、明确、形式化和共享。“概念化”指的

2、是通过抽象出客观 世界中一些现象的相关概念而得到概述模型;“明确”指所使用的概念及使用这些概念的约 束都有明确的定义;“形式化”指本体是计算机可读的(即能被计算机处理的);“共享”指 本体中体现的是共同的认可和知识,反映的是相关领域中公认的概念集,即本体针对的是社 会范畴而非个体之间的共识。同时,N.Guarino提出将本体划分为顶级本体(top-level ontology)、领域本体(domain ontology )、任务本体(task ontology)和应用本体(application ontology )。领域本体是指描述 特定领域中的概念以及概念之间的关系,是用于描述指定领域知识

3、的一种专门本体。它给出 了领域实体概念及其相互关系,是领域话动以及该领域所具有特性和规律的一种形式化描述。一个领域本体包括一套关于某一领域概念的规范而清晰的描 述,称为类(classes)或概念(Concepts);描述了有关概念的各种特征的属性(properties)和属性 插件(slots),还包括属性插件的限制条件(restrictions)和分面(facets),以及一系列与某个类相 关的实例(这些实例组成了一个知识库)。类是本体的核心,它描述了某一领域的概念。属性 插件描述了类的属性和实例。目前,本体模型的研究已经进入了一个新阶段,许多研究领域 都在建立自己标准的本体。1学科领域常用

4、本体构建方法和建设工具1.1学科领域常用本体的构建方法由于本体工程到目前为止仍处于探索阶段,领域本体的 建设还处于探索期,构建过程中存在着很多问题。中科院的李景博士在本体理论及在农业 文献检索系统中的应用研究-以花卉学本体建模为例中对目前常见的7种本体构建方法的 成熟性进行了排序,即七步法、METHONTOLOGY法 IDEFS TOVE法 骨架法 SENSUS法、KACTUS法。本文大部分过程借鉴了七步法的思路和流程。1.2学科领域本体常用建设工具到目前为止,已经出现了许多本体建设工具。根据这些工 具所支持的本体描述语言,大致可以分为2类。第1类包括Ontolingua,OntoSaurus

5、,WebOnto 等。这3个工具的共同点是,都基于某种特定的语言,并在一定程度上支持多种基于AI的 本体描述语。第2类包括Protege系列、WebODE、OntoEdit、Oi1Ed等。这些工具最大的 特点是独立于特定的语言,可以导入/导出多种基于Web的本体描述语言格式(如XML、 RDF(S)、DAML+OIL等)。它们都是基于组件的结构,很容易通过添加新的模块来提供更多 的功能,具有良好的可扩展性。本文之所以选择Protege作为构建工具,是因为Protege与其他本体创建工具相比,有很多 其独特的优势:Protege作为开源工具,目前拥有最多注册用户;不断有新的版本推出; 可扩展性好

6、;以多种方式存储本体、互操作性强;图形化的用户界面,简单友好; 支持DAML+OIL,OWL,RDF,RDFS等本体表示语言。正是这些优点,使得Protege成 为各种领域本体构建的首选工具。2.1医学文献领域本体的构建规划在真正开始构建领域本体之前,要首先明确需求分析和 计划制定阶段主要几个问题:在哪个领域构建本体?在医学文献领域,主要侧重图书情报界 对医学文献的分类和处理。构建本体的目的什么?从概念之间关联的角度,深层次地揭示 领域的信息,实现该领域文献集的基于知识结构的导航。选择什么样的本体描述语言?采 用OWL描述该领域本体,标注XML文档。选择什么样的构建工具?本体的构建工具选择 P

7、rotege作为本体创建工具。2.2医学文献领域本体的构建过程2.2.1列出医学文献领域本体中的重要概念根据分类法、中图法和我国数字图书馆标准与规范建设项目(CDLS)的相关标准,并且在请教解放军医学图书馆相关馆员的基础上, 确定了与“医学文献”最为相关的11个子概念,即:图书、期刊、期刊论文、会议论文、 学位论文、科技成果、科技报告、专利文献、标准、政府出版物、网络资源。2.2.2确定类及其类之间的等级关系 上一步提取出来的“医学文献”的11个密切相关的子 概念,可以直接作为“医学文献”这个本体的顶层根类的11个子类,即医学文献为该本体 的顶层类,在其下根据文献类型具体划分为图书、期刊等共1

8、1个子类。该本体的类和层次 关系的定义如图1所示。安排好本体的类层次结构之后,在Protege中创建类、子类非常方便明了。图2是医学文献 类及其子类在Protege编辑器中的界面图:图2医学文献本体类定义界面图2.2.3定义类的属性及其子属性属性在类中是很重要的一个部分,它将一个概念与其他概 念和对象联系起来,起到一定的知识联通的作用。本文参照DC元数据的相关标准和借鉴了 CDLS的有关规范,对“医学文献”类及其下11 个子类,分别设置了如下主要属性:医学文献的15个主要属性 题名(Title)、创建者(Creator) 日期(Date)、主题(Subject)、出版者(Publisher)

9、类型(Type)、描述(Description)、 其他责任者(Contributo r)、格式(Format)、来源(Source)、权限(Rights)、标识符(Identifier)、 语种(Language)、关联(Relation)覆盖范围(Coverage)。根据DC元数据的相关规范,笔者 对于描述、日期、格式、关联和覆盖范围5个属性设置了相关的子属性,具体如下:说明 (Description)属性的子属性:目 次(table of Contents)、摘要(abstract);日期(Date)属性的 子属性:创建日期(created)、生效日期(valid)、可获得日期(avai

10、lable)、发行日期(issued)、修 改日期(modified)接受日期(date Accepted)、赋予版权日期(date Copyrighted)、提交日期(date Submitted);格式(Format)属性的子属性:范围(extend)、媒体(medium);关联(Relation)属性 的子属性:版本继承(is Version of)、版本关联(hasVersion)、被替代(isReplacedBy)、替代 (replaces)、被需求(isRcquircdBy)、需求(r equires)、组成(isPartOf)、部分为(hasPart)、被参照 (isRefere

11、ncedBy)、参照(references)、格式转换于(isFormatOf)、格式转换为(hasFormat)、遵循 (conformsTo);覆盖范围(Coverage属性的子属性:空间范围(spatial)、时间范围(temporal)。 根据Protege中类继承性,“医学文献”的11个子类,自动继承了 “医学文献”根类的 全部属性,由于11个子类中某些文献的特殊性,笔者也对应增加了相应属性,比如,为“会 议论文”子类增加了 “会议”属性,包括“会议论文集名称、“会议日期”、“会议地点”和 “会议名称”等子属性;“标准”子类从“医学文献”根类继承到的“其他责任者”属性下 增加了 “批

12、准机构”子属性,等等。图3给出了 Protege工具编辑“医学文献”本体的界面。图3 医学文献本体属性及其分面定义界面图2.2.4定义属性的分面每一篇医学文献对应文献类型下的一个实例,其属性值就是该文献相应的著录和标引项。利用“关联”属性还可以实现不同文献之间的连接,例如某一“期刊 论文”实例可以“部分为(has Part)”某一 “期刊”实例;不同版本的图书也可以通过“版本 继承(is Version of)属性来关联。相对应地,在Protege中,可以创建多种类型的属性,包 括data type属性、object属性、annotation属性,上述属性又可以定义其Sub property属

13、性。 根据属性类别不同,对属性的分面也不同,如“摘要”属性,为object属性,其所属领域 (Domains)为“说明”,范围(Range)为医学文献类中的某个类。annotation属性必须要么是一 个数据字符串 (data11teral)或一个 URI 引用(URLreferenee),要么是一个 individual。 rdfs:comment来规定属性的显示名称和解释属性的含义。2.2.5创建实例 根据前面建好的类、属性及其允许值,可在Individuals editor中添加具体 实例。创建实例时,首先输入实例名称,之后输入实例所属类定义的各个属性值(图4)。3医学文献本体构建过程中

14、的几个关键问题3.1本体关键概念抽取 目前来讲,学科领域本体构建时用到的核心概念的获取有两种方 式:通过知识挖掘技术从现有的学科数据库中提取专业术语;将传统的知识组织体系如 分类法和主题词表转换改造为初始核心本体。正是因为概念系统是领域本体的基础,而分 类法/主题词表也是分类概念和主题概念及关系的集合,其基本功能和领域本体具有一致性。 通过对“医学文献”本体的实际构建,将传统分类法/主题词表中的分类概念和主题概念进 行适当改造,是获得学科领域本体初始核心概念集的科学方法。3.2建立概念关联通过本次实践,构建本体最难的是在其语义关系的定义上。它要求要 充分考虑各概念之间除了等级关系以外的,更多的

15、考虑概念之间的逻辑关系,包括其定义域、 值域、必要条件,充要条件等,这一点与面向对象编程有些类似。但由WL有限的建模 原语,所以必须仔细阅读、认真领会每个建模原语所能表达的逻辑含义。3.3 OWL的表达问题 OWL的表达能力OWL具有对属性的取值范围(all Values From, some Values From)以及取值个数(has Cardinality, min Cardinality, max Cardinality的 限制,而对取值 的限制不够。目前OWL对属性的取值限制只有一个hasValue,即某一属性的值等于hasValue 所给出的值,而不能表达大于、大于等于、小于或小于等于。此外,与传统分类法不同, OWL子类会继承父类的所有属性,在

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论