医学数字资源语义互联模式研究_第1页
医学数字资源语义互联模式研究_第2页
医学数字资源语义互联模式研究_第3页
医学数字资源语义互联模式研究_第4页
医学数字资源语义互联模式研究_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、医学数字资源语义互联模式研究摘要在充分复用丰富的医学知识组织体系基础上,构建以umls为主导的多本体融合的医学数字资源语义互联模式,即一种基于全局本体统控、多种本体融通的模式框架。以umls为主导的多本体融合模式由三个基本层和两个链接层构筑。从umls本体的全局统控、多本体融合的语义标引机制、多本体融合的语义检索模式、多本体融合的信息集成构架这4个方面详细阐述医学数字资源语义互联的机理。从自然语言处理、智能检索、本体学习、知识发现和专业知识聚类等方面分析医学数字资源语义互联的功能。关键词语义互联本体全局本体umls1引言语义提取、语义分析、语义检索、语义集成和语义互操作已经成为当前语言学、逻辑

2、学、图书馆学情报学、计算机科学等领域的研究热点。各领域从不同角度进行理论探讨和技术挖掘,力图进一步推动数字资源的语义互联和语义互理解。随着本体理论的日趋深入和本体技术的渐臻发展,本体作为一种蕴含知识间语义关系且能在知识层提供知识共享和复用的工具已经得到共识,以本体为知识组织核心的语义检索成为主要研究方向,并已积累了一定的研究成果。在此基础上,专家学者开始探讨本体在知识管理、语义互操作、决策支持和推理中的应用,并探讨本体促进数字资源语义互联的模式、机制并构建实验性系统。在医学领域,由于美国国立医学图书馆长期的积累,已经形成世界范围公认的知识组织体系,包括科学的叙词表、各种本体、医学术语标准、国际

3、分类标准等。这为医学领域的数字资源进行语义互操作奠定了基础,为整合分散的、异质的各类生物医学数据源提供了保障。本文整合各种领域本体,集成各领域本体中的概念、术语和概念之间的语义关系,提出了医学数字资源语义互联模式以umls为主导的多本体融合模式。本文的研究意义在于促进各种知识本体在医学信息领域中的有效共享,为建立智能化的医学临床科研融合系统提供基础性研究,为进行深层次的医学数据挖掘与服务提供理论支持。2医学数字资源语义互联模式umls(the unified medical language system)是美国国家医学图书馆(national library of medicine,nlm)

4、设计和维护的一体化医学语言系统。umls词表已成为词典标准在生物医学知识中共享,并被应用于生物医学数据库的信息提取和集成、本体的语义集成等。鉴于此,在构建医学数字资源语义互联方面,充分利用专家对umls在描述概念方面已取得的研究成果不失为一个捷径。医学数字资源语义互联模式是以umls为主导的多本体融合模式,其充分考虑了umls在描述概念和语义集成方面的优势地位,为生物医学用户提供了统一的语义空间。在该语义空间中,异构数字资源通过语义标引实现语义互理解,用户可以对生物医学文献、生物医学数据库、临床数据进行数据挖掘、数据集成、决策支持、自然语言处理和知识发现,实现对知识的智能服务和共享。该模式是一

5、种基于全局本体统控、多种本体融通的数字资源语义互联模式框架,见图1。在该模式中,每一种本体发挥他们各自在数据挖掘、语义分析、语义检索方面的作用,充分体现出本体的复用以及对现有知识组织体系的再利用;另外,该模式将提供词典标准的umls作为全局本体,形成共享的词汇集,从而保证本体之间的语义互理解。3医学数字资源语义互联的结构以umls为主导的多本体融合模式由三个基本层和两个链接层构筑。3.1基本层·用户层。该层是系统与用户的交互接口,用户通过应用接口层对异构数据源进行语义查询、数据挖掘等操作。·语义层。该层是系统的核心层,是以umls为主导的多本体融合数字资源互联模式的关键所在

6、,该层以umls为全局本体,通过本体映射和本体集成方法与工具复用医学生物学领域本体。·数据源层。该层集成异构数据,包括临床数据、实验数据、基因(蛋白质)数据、文献数据和网页数据。3.2链接层·知识管理层。该层位于数据源层和语义层之间,在该层上,本体作为一种词汇来源支持对数据和资源的标引注释、检索和跨医学信息资源和本体的映射,反映数据资源层与语义层的交互。·决策支持与推理层。该层位于用户层与语义层之间,在该层上,本体作为一种语义核心集支持对自然语言的处理、数据的集成、决策支持以及知识发现。三个基本层是医学数字资源语义互联的根本和目的所在,两个链接层是数字资源语义互联

7、功能和智能的体现。4医学数字资源语义互联的机理4.1umls本体的全局统控医学知识本体为用户、资源和服务提供了信息交互的理解平台,为信息共享提供了可能性。目前,国际上开源的生物医学领域本体大体分为4种:基于医学信息检索的本体类型(umls、mesh),基于生物医学数据的本体类型(obo系列本体、go),基于临床医学的本体类型(opengalen、转化医学本体tmo),基于医学调查的本体类型(obi)。这些医学领域本体或者建立了临床术语,或者为关联、集成和转化以患者为中心的数据提供了框架,或者定义一套结构化的通用的受控词表,都已经应用于自然语言处理的各个方面,如在词义冲突消除、语义冲突化解、语义

8、检索、机器理解等方面,这些本体库各具特色,而umls在描述概念、术语、概念间关系、语义类型和语义关系方面更为全面和成熟。医学数字资源语义互联模式框架中,umls起全局本体的作用,利用umls融合语义互联框架中的局部本体,诠释用户、资源的语义,为两者之间的语义互联提供纽带。4.2多本体融合的语义标引机制在医学领域,最重要的三种数据资源是:生物(医学)文献、临床文献和基因产物。目前对这三种数据资源进行标引都有通用的标引词表和本体,这些现有的知识组织体系是信息组织专家多年研究的成果,已被广泛接受而且拥有大量的研究型用户,对这些知识组织体系的继承有助于促进数字资源语义互联的快速实现。·生物(

9、医学)文献。生物(医学)文献数据库是已广泛为医学领域学者和研究者使用的数字资源,对于这些商品化的数字资源,已经进行了标引(注释大多采用人工标引方法),标引采用mesh词表和基因本体(go)。·临床文献。对于临床文献,目前世界上通常使用国际疾病分类(icd)系统进行编码,另外,snomedct正在被越来越多的国家作为电子健康档案的标准术语,除此之外可以使用mesh进行注释。·基因产物。在生物学中,需要对实验数据的功能性描述进行注释。如使用基因本体对实验中基因产物的功能注释,复用snomed ct和美国国家癌症研究所发布的nci叙词表的owl版本对组织微序列数据库中的数据进行注

10、释,利用mesh对基因表达库中的人类疾病进行注释。在以umls为主导的多本体融合模式中,底层的数据源由各种医学知识本体进行语义标注,再借助于umls这一全局本体对已经进行了语义标引的数据进行语义互联。umls与各种叙词表、开源本体之间的映射借助于lexical grid(词汇网格)。lexical grid是美国梅奥医学中心生物医学信息学部设计的,旨在利用公共的工具、数据格式以及读取(更新)机制来弥补格式、配套工具以及编程接口方面的互不兼容问题,从中发挥桥梁和纽带的作用。lexical grid对有关资源的表达由一个单独信息模型实现,该信息模型可通过一套公共的应用编程接口(applicatio

11、n programming inter-faces,apis)加以访问(存取),这些apis则是借助于共享型的索引加以联合,并且,这些索引可以在线下载、松散耦合、本地扩展、全局修订以及在网络空间和网络时间范围内现成可用,且彼此相互交叉链接。如图2所示:4.3多本体融合的语义检索模式以umls为主导的多本体数字资源语义互联系统的语义检索子系统运用umls本体对各种数字资源进行检索和浏览之后,对产生的检索结果进一步进行知识挖掘。用户提交检索词或检索式后,系统接受返回的检索结果,利用umls本体对检索结果进行词串鉴别、术语提取,最终到概念识别,通过数据挖掘,使检索结果成为进一步检索的候选检索词。&#

12、183;将检索结果对应的概念转换成umls本体的类,并将检索结果与umls类对应起来,形成检索结果的可视化数据,此时的检索结果不仅仅是字符匹配,而是基于umls概念的检索结果分析。·在检索结果导航中,根据umls本体概念之间的11种关系(如直接上位关系、直接下位关系等)提供扩检和缩检功能。·在检索结果导航中,根据umls概念的语义关系(54种语义关系),提供概念与概念之间在语义关系上的反馈式检索方式。通过用户积极性反馈式的进一步选择与确认,进行检索结果的扩检与缩检,当然这一步需要用户具有相关知识。·umls作为一种全局本体,通过概念映射到各个局部本体,进而形成检索

13、结果导航模型。根据检索结果导航模型,检索结果被统计并对应到相应的umls分类导航目录和各本体的分类导航目录,用户可利用该导航目录快速找到自己所需要的文献。该语义检索模式,提供以umls为主导的多本体检索结果分类概览,帮助用户实现基于概念的检索结果快速导航;自动提供与检索提问相关的术语;自动提供与检索提问相关的上位概念、下位概念和同位概念;自动提供与检索提问相关的概念之间的语义关系;自动提供与检索提问相关的准确的生物实体,从而提高检索的准确率和召回率。4.4多本体融合的信息集成构架信息集成分为:结构集成、语义集成和智能集成。以umls为主导的多本体融合模式以全局本体umls为中心纽带,在结构化集

14、成的基础上,对信息间语义的关系实施深度挖掘和充分利用,进而完成语义级信息集成。一方面,通过提供医学领域的全局本体umls,为数据集成所需要的标准化提供支持,可将要集成的数据源转换成一种通用格式并将其转换为通用词汇。另一方面,围绕umls本体,可以定义数字资源语义互联全局架构,可根据全局框架进行语义查询,并在全局性架构和本地架构(要集成的数据源架构)之间进行映射。参考基于本体的信息集成系统tambis,biomediator、ontofusion、ariane和masboi,结合基于语义模型的信息抽取概念模型,设计信息集成框架,如图3所示:各组件的功能和作用如下:·原始信息。包括临床数

15、据、文献数据库、基因(蛋白质)数据库等结构化信息和半结构化信息数据源。·信息抽取。从原始数据中经过自然语言处理(如metamap)抽取出词串和术语组织成元数据库。·局部映射。将元数据中的词串和术语匹配到各个局部本体中。·全局映射。一方面,以umls全局本体为标准。将局部本体映射到全局本体解决局部本体问的语义异构性问题,满足彼此间相互查询的需求;另一方面,umls提供了全局框架,将已匹配到局部本体中的元数据映射到umls概念中,满足对原始数据的语义标引需求。·概念关系分析器。对数据管理、本体学习、语义检索和知识发现的数据进行自然语言处理,对处理结果进行概念

16、关系分析,分析后依据全局映射匹配到umls中的概念和语义关系,匹配后交由推理机和查询接口。·查询接口。一方面,是为用户提供的统一语义查询界面,用户借此提交查询关键词,提出查询请求;另一方面,将经过概念关系分析的查询,提供给umls概念及概念间关系的可视化检索结果导航,再提供给用户。·推理机。将经过概念关系分析的术语进行umls概念匹配并建立概念矩阵,以发现新的概念间关系和新知识,新的概念间关系用于本体进化,新知识将被写入知识库。5医学数字资源语义互联的功能医学数字资源语义互联不仅仅致力于为医学工作者提供基于语义的检索,更重要的是为用户、数字资源和程序之间建立理解一致的信息交

17、互结构。医学数字资源语义互联模式的构建为医学信息处理提供了可共享的平台,使得针对临床工作者、医学科研人员和医疗保险的数据之间具有了语义互通的可能性。基于此,其功能不仅限于智能检索,还包括自然语言处理、本体学习、专业知识发现等。5.1自然语言处理自然语言处理(nlp)能自动识别文本中所感兴趣的实体名称,将数据库中的信息转化成人类可读的语言,自然语言处理将扩展互联的医学数字资源范围,从而使互联模式更机智能化。从自然语言处理系统处理的文本及处理技术两个角度来考虑,在生物医学领域,临床医学和分子生物学是两个最重要的内容子域。在临床的内容子域中,重点是疾病、解剖学、病因和治疗以及这些现象之间的互动。因此

18、,语义处理对概念和关系识别后,还需将所处理的文本内容映射到一定的知识结构。利用生物医学本体所提供的丰富词源可开发出许多自然语言处理系统。以umls为主导的多本体数字资源语义互联系统为满足大规模文本处理的需求,利用了美国国家医学图书馆(nlm)研发的在线工具语义知识表征。·skr是由美国国家医学图书馆研发的项目,该项目致力于在图书馆现有资源基础上建立生物医学自由文本上可用的语义表达。skr系统的核心组件是metamap,如图4所示:skrmetamap对自由文本进行语义层次的分析且是基于语境的语义分析。metamap使用知识密集型的方法,包括符号、自然语言处理和计算语言学等技术,是一个

19、把生物医学文本与umls超级词表中的概念匹配起来的程序,metamap的自动文本映射可将文本解析成名词短语,形成词串,对词串按照阈值形成meta映射候选集。skrsemrep也是为了发现生物医学研究文献中的语义命题而开发的,通过语法分析和umls的领域知识识别出自由文本中的实体,用来提取生物医学文献中的语义假设。·以umls为主导的多本体语义互联系统的自然语言处理系统,读入metamap处理后的数据,将形成的meta映射候选匹配到全局本体umls概念上,之后对自由文本进行基于概念的语义标注,供语义检索子系统使用。5.2智能检索医学数字资源语义互联模式能够实现不同程度的智能检索功能:以umls为主导的多本体融合模式,提供了概念关系级别的知识组织体系,全局本体与局部本体的映射融合,易实现概念级别的扩检与缩检,易进行概念组合的描述,易梳理出概念关系,从而不断逼近检索;语义互联模式提供了反馈式检索方式,能加深人机互理解程度;数据存储形式为rdf的三元组形式,这种形式方便推理,支持概念语义的查询。5.3本体学习本系统中的知识发现涉及到本体准备、本体扩充、事例选择、本体挖掘和本体进化几个阶段。知识发现通过主成分分析、独立成分分析、神经网络和统计学方法等数据分析技术以及二维、三维和散点图等可视化方法,能够帮助用户发现概念

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论