已阅读5页,还剩60页未读, 继续免费阅读
(计算机应用技术专业论文)不确定语义检索在专利智能服务平台中的应用.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
不确定语义检索在专利智能服务平台中的应用中文摘要 不确定语义检索在专利智能服务平台中的应用 中文摘要 专利信息是人类智慧的结晶,它几乎囊括了一切应用领域中的技术成果,涉及经 济发展、科技创新和战略决策等最重要的信息资源。在当今国际市场竞争极为激烈的 形势下,专利信息是各国发展经济技术不可缺少的重要资源。 本文将不确定语义检索和专利信息检索相结合,在传统基于关键字检索的基础上 给专利检索赋予语义含义,以提高检索的查准率和查询效率。本文主要工作包括如下 几点: ( 1 ) 对国内外知名专利检索系统的数据结构进行分析,并着重研究了当前专利检 索中存在的专利检索数据异构分散、专利检索准确率不高等问题,同时还对数据集成 和信息检索的研究现状、相关技术进行了综述; ( 2 ) 从我国及七国两组织专利数据结构分析入手,提炼出各国各组织异构专利数 据组织结构的共性,设计了通用数据转换模型( c d t m ) ,同时考虑专利信息的海量需 求,为提高查询速度,减轻服务器压力,对数据库集群技术进行研究,并且采用o r a c l e 数据库集群技术将专利数据集成结果本地化; ( 3 ) 对不同用户的个性化专利检索需求进行研究,构建用户兴趣本体。首先,从 用户静态和动态特征中获取用户兴趣关键字,计算关键字权重,筛选出用户关心的关 键字,构成用户兴趣文本,然后根据用户兴趣文本构建用户兴趣本体。用户兴趣本体 中描述了用户感兴趣的检索词及词与词之间的关系,结合领域本体进行检索,以提高 检索效率,同时用户兴趣本体在信息的推送过程中也起着重大作用; ( 4 ) 以上述技术为基础,构建了一个专利信息服务平台,并依据该平台,实现了 对专利信息的有效查询,同时专利数据的本地化给用户专利分析提供了便利,实验证 明,异构专利数据的有效集成和用户兴趣本体的加入使得专利检索效率在一定程度上 得到提高。 关键字:异构信息,信息集成,语义检索,用户兴趣,专利检索 作者:储振华 指导教师:孙涌 a b s t r a c t a p p l i c a t i o no f u n c e r t a i ns e m a n t i cr e t r i e v a li np a t e n ti n t e l l i g e n ts 堕p l a t f o r m a p p l i c a t i o no fu n c e r t a i n s e m a n t i cr e t r i e v a li np a t e n t i n t e l l i g e n ts e r v i c ep l a t f o r m a b s t r a c t p a t e n ti n f o r m a t i o ni st h ec r y s t a l l i z a t i o no fh u m a ni n t e l l i g e n c e i tc o n t a i n st h em o s t i m p o r t a n tt e c h n o l o g ya c h i e v e m e n to fa l m o s te v e r ya p p l i c a t i o nf i e l d s u c ha se c o n o m i c d e v e l o p m e n t ,t e c h n o l o g yi n n o v a t i o n ,a n ds t r a t e g i cd e c i s i o n n o w a d a y s ,p a t e n ti n f o r m a t i o n h a sb e c o m et h em o s tn e c e s s a r yi n f o r m a t i o nr e s o u r c ei ne v e r yc o u n t r y se c o n o m i c d e v e l o p m e n t t h i sp a p e rc o m b i n e du n c e r t a i ns e m a n t i cr e t r i e v a lw i t hp a t e n ti n f o r m a t i o nr e t r i e v a l , g a v es e m a n t i cm e a n i n gt op a t e n tr e t r i e v a lb a s e do nt r a d i t i o n a li n f o r m a t i o nr e t r i e v a l ,w h i c h w a ss e a r c h e db yk e yw o r d s ,i no r d e rt oi m p r o v er e c a l la n dp r e c i s i o nr a t i o t h em a i nw o r k so ft h i sp a p e ri n c l u d e df o u rp o i n t sa sf o l l o w s : ( 1 ) a n a l y z e dp a t e n t s d a t as t r u c t u r eo ff a m o u sp a t e n tr e t r i e v a ls y s t e md o m e s t i ca n d a b r o a da n dl a i das t r o n ge m p h a s i so nt w op r o b l e m s :d i s t r i b u t e da n dh e t e r o g e n e o u sp a t e n t d a t aa n dl o wr e t r i e v a lp r e c i s i o n t h ep r e s e n tr e s e a r c ha n dr e l a t i v et e c h n o l o g yo fd a t a i n t e g r a t i o na n di n f o r m a t i o nr e t r i e v a lw e r es u m m a r i z e da tt h es a m e t i m e ( 2 ) t h i sp a p e rs u m m a r i z e dt h ec o m m o nc h a r a c t e r so fh e t e r o g e n e o u sp a t e n td a t af r o m d i f f e r e n tc o u n t r i e sa n do r g a n i z a t i o n sb yt h ew a yo fd i s c u s s i n gd a t as t r u c t u r eo fc h i n a , s e v e no t h e rc o u n t r i e sa n dt w oo r g a n i z a t i o n s a n dt h e nd e s i g n e dc o m m o nd a t at r a n s f o r m m o d e lt oi n t e g r a t ep a t e n td a t a b e c a u s et h ep a t e n ti n f o r m a t i o ni sv e r yl a r g e ,w es t u d i e do n d a t a b a s ec l u s t e rt e c h n o l o g ya n du s e do r a c l er a ct os t o r ed a t aw h i c hc a ni m p r o v et h e r e t r i e v a le f f i c i e n c y ( 3 ) r e s e a r c h e do np e r s o n a l i z e dr e t r i e v a lr e q u i r e m e n t s o fd i f f e r e n tu s e r sa n d c o n s t r u c t e du s e ri n t e r e s to n t o l o g y f i r s t l y , f o u n dt h eu s e ri n t e r e s t i n gk e yw o r d sf r o mu s e r s l o g i ni n f o r m a t i o na n dv i s i tt r a c e s ,c a l c u l a t e dt h ew e i g h to fk e yw o r d s ,c h o s et h eh e i g h t w e i g h tk e yw o r d st of o r mt h eu s e rp r o f i l et e x t a n dt h e nc o n s t r u c t e du s e ri n t e r e s to n t o l o g y b a s e do nu s e rp r o f i l et e x t ( 4 ) b a s e do nt h et e c h n o l o g i e sm e n t i o n e da b o v e ,w ec o n s t r u c t e dap a t e n ti n f o r m a t i o n a p p l i c a t i o no fu n c e r t a i ns e m a n t i cr e t r i e v a li np a t e n ti n t e l l i g e n ts e r v i c ep l a t f o r m a b s t r a c t s e r v i c ep l a t f o r ma n dr e a l i z e de f f i c i e n tr e t r i e v a lo np a t e n ti n f o r m a t i o n i tw a sp r o v e dt h a t t h er e t r i e v a le f f i c i e n c yw a si m p r o v e da f t e rh e t e r o g e n e o u sp a t e n td a t a si n t e g r a t i o na n du s e r i n t e r e s t i n go n t o l o g y sa d d i t i o n k e yw o r d s :h e t e r o g e n e o u si n f o r m a t i o n ,i n f o r m a t i o ni n t e g r a t i o n ,s e m a n t i cr e t r i e v a l ,u s e r p r o f i l e ,p a t e n tr e t r i e v a l w r i t t e nb y :c h uz h e n h u a s u p e r v i s e db y :s u ny o n g i i i 苏州大学学位论文独创性声明及使用授权声明 学位论文独创性声明 本人郑重声明:所提交的学位论文是本人在导师的指导下,独立 进行研究工作所取得的成果。除文中已经注明引用的内容外,本论文 不含其他个人或集体已经发表或撰写过的研究成果,也不含为获得苏 州大学或其它教育机构的学位证书而使用过的材料。对本文的研究作 出重要贡献的个人和集体,均已在文中以明确方式标明。本人承担本 声明的法律责任。 研究生签名:雌日 学位论文使用授权声明 苏州大学、中国科学技术信息研究所、国家图书馆、清华大学论 文合作部、中国社科院文献信息情报中心有权保留本人所送交学位论 文的复印件和电子文档,可以采用影印、缩印或其他复制手段保存论 文。本人电子文档的内容和纸质论文的内容相一致。除在保密期内的 保密论文外,允许论文被查阅和借阅,可以公布( 包括刊登) 论文的 全部或部分内容。论文的公布( 包括刊登) 授权苏州大学学位办办理。 研究生签名:龇日 导师签名:猡皿日 期:_ 兰咀2 不确定语义检索在专利智能服务平台中的应用 第一章结论 第一章绪论弟一早三百下匕 本章首先阐述了专利信息在当今世界经济和技术竞争中的重要性,然后对国内外 几个著名的专利检索系统进行分析,并对异构数据集成和信息检索的研究现状进行了 综述,提出了本文研究的内容和意义,最后给出了论文的组织结构。 1 1 专利信息的重要性 专利文献是世界上反映科学技术发展最迅速、最全面、最系统的信息资源,其出 版量约占世界每年各种图书期刊总出版量的四分之一,但是内容却包含了9 0 以上的 科技成果【l 】。针对某一技术领域专利数量和时间分布的检索分析,可以反映该技术的 发展现状和趋势。随着世界科技竞争的日益激烈,各国企业越来越重视专利战略研究, 通过对专利说明书、专利公报中大量零碎的专利信息进行加工、组合,将这些信息转 化为具有总揽全局及预测功能的竞争情报,从而为企业的战略决策提供信息支持。 文献【2 中阐述了对专利信息分析的价值所在: ( 1 ) 从国家或地区的总体上看,通过专利信息分析,可以了解各国技术研发的总 体能力,判断与其他国家相比的产业基础的发展与变化趋势,透视各国政府在技术创 新等方面的政策导向及投资方向。 ( 2 ) 从行业技术领域角度来看,通过专利信息分析,可以了解行业技术的总体发 展状况,发现技术发展的生命周期与阶段性变化,研究技术领域间的关联和转化,判 断具有明显优势的技术,预测行业技术未来的发展方向。 ( 3 ) 从企业主体角度来看,通过对所处行业专利申请与授予的专利信息分析,了 解行业内技术的分布、拥有核心技术的企业、判断行业内竞争态势和确定主要的竞争 者。通过对竞争对手或合作者的专利信息分析,比较这些企业的技术创新研发背景和 能力,评估其新技术和新产品开发的实力,技术重点、技术壁垒的强弱、技术贸易和 技术转让的能力,研究竞争对手在不同国家或地域的专利技术分布,推断其技术路线 和意欲控制的市场,掌握对手专利策略。在技术研发或新产品立项前,对专利信息进 行分析,以避免重复研究,提高研究起点和研发计划的新颖性和先进性,制定合理的 专利模仿创新和源头创新战略。 ( 4 ) 通过对专利保护信息专利技术所处的法律状态( 公开申请状态、处于已经 第一章绪论不确定语义检索在专利智能服务平台中的应用 获取专利状态、处于被宣布无效状态和处于自动放弃状态) ,受法律保护的有效时间 和地域范围的分析,获取有效的法律信息,避免侵权行为,减少法律纠纷和经济损失。 作为企业间竞争博弈的重要信息源,对专利信息进行有效组织和管理,实现隐性 知识发现是当今研究的热点问题1 3 1 。 1 2 目前专利信息检索存在的问题 我国国家科技部把专利战略作为科技强国的战略之一,但是,比起发达国家,我 国专利战略的科学定制还有很大的差距【4 】。我国目前专利信息的利用主要局限于专利 检索,并且由于下述两大原因的制约,检索出来的专利结果往往不能够很好的满足用 户的需求。 1 2 1 专利信息的异构 专利文献是由一系列可表达专利信息内容的外部特征和内容特征构成的,这些特 征可用结构化数据或非结构化数据以文本或图像的形式表示【5 】。专利技术信息的表现 形式是面向用户的直接阅读和处理的,而没有提供机器可读的语义信息,这给计算机 直接处理带来困难。这样就引出专利描述一致性的问题。一般专利描述必须有一定的 格式,如在撰写专利申请书时,在用户需要专利保护的国家进行专利申请,与审查员 进行沟通,按照一定格式对专利描述进行处理并产生一个印刷形式的报告,最终提供 p c t 申请号下载。针对这一繁琐的申请过程,很多系统如a l p h a p a t e n t 、p a t e n t p r o 、 p a t e n t w i z a r d 等,都提供标准专利格式,让用户完成对文件的书写,这在简化了申请 流程的同时,还使得专利信息的组织结构变得清晰明了。虽然专利说明书文件格式一 致,但是不同国家、组织对于专利属性定义标准并不完全统一,这在一定程度上造成 专利信息的异构。 现有大部分专利检索系统中,由于专利信息的异构,各国各组织间专利信息不能 互相通信,往往采取按照国别存储专利信息的方法设计系统架构,这样在检索入口上 就体现为每次在检索前需要选中检索的国别范围,如用户输入“电脑”,则只能在中 文检索数据库中检索,相关“c o m p u t e r ”字样的专利就不会被检索出来,相反用户输 入“a u t o m a t i cd o o r ”,则相关“自动门”字样的专利也不会出现。这给检索用户造成 一些被动,检索信息总是不能完全的显示出来,给用户的检索增加了难度。 2 不确定语义检索在专利智能服务平台中的应用 第一章绪论 1 2 2 专利信息的检索 专利信息检索是为了帮助各类用户在浩瀚的专利信息中找到满足用户需求的部 分信息。目前因特网上专利检索系统很多,国外的如:欧洲专利局专利检索系统 e s p e c n e t t 6 1 、美国专利商标局专利检索系统u s p t o t 7 1 、世界知识产权组织专利数据 库w i p o t 8 1 、英国d e r w e n t 专利数据库 9 1 、日本专利局数据库j p o t l o l ,国内的如:中 华人民共和国国家知识产权局专利检索系统s i p o 1 1 】、中国知识产权网专利检索系统 【1 2 】、中国专利网【1 3 】等等。这些系统几乎收录了全球最具有影响力的所有专利文献, 在检索方式、检索规则、结果显示等方面都各有特点。 文献 1 4 1 1 1 5 中对上述国内外著名专利检索系统进行了分析比较,可以看出,各 大检索系统数据库中存储的专利数据均比较全面,各个检索系统都提供了多种检索方 式和检索入口,并且支持多种复杂逻辑运算,而且有些系统还提供二次检索、专利分 析等服务。在当前条件下,从公共或专业专利数据库中获得专利信息比较容易,但是 面对各专利数据库的海量数据和大量繁杂信息,如何才能从如此大量充斥着冗余的数 据中提取出真正满足用户需求的有价值的专利信息,这给检索提出了很高的要求,而 且现行专利检索系统均未考虑检索用户特性的特点,对于检索用户,并不是每个专利 检索人员都是专利专家,因此专利检索系统对于检索专业性要求过高的缺陷也暴露无 遗。 目前主流的信息资源管理和检索系统主要采用以下方法【1 6 】:以搜索引擎和专业数 据库系统为代表的基于关键词的检索;以主题网关为代表的以元数据为基础的检索; 基于数据库字段和数据模式的模糊匹配检索;正在发展的利用x p a t h 路径语言和 x q u e r y 检索语言的基于文献内容结构的检索等。专利检索系统则多采用基于关键字 的检索方式,这样的检索能够给用户提供快速的检索结果,但是结果显示单调,往往 用户对于返回的大量检索结果不知所措,并且完全没有考虑用户本身的兴趣差别,对 所有人提供一致的结果,这给信息的有效区分带来很大的不便。 因此考虑用户兴趣度的,带有语义推理的,提供满足用户要求结果的新型专利检 索系统呼之欲出。 第一章绪论不确定语义检索在专利智能服务平台中的应用 1 3 异构数据集成 1 3 1 异构数据概述 异构数据是一个含义丰富的概念,它不仅指不同的数据库系统之间的数据是异构 的,而且还包括不同结构的数据之间的异构,如结构化的关系数据库和半结构化的 x m l 数据及w e b 数据,还有其他的非结构化数据,如p d f 文档、m p 3 音频、r m v b 视频等多种格式。具体来说,数据的异构可以分为下面四类【1 7 】: ( 1 ) 结构异构,是指各个系统使用不同的数据模型。从这一角度,异构数据可以 分为三类:结构化数据、半结构化数据和非结构化数据。 结构化数据:结构化的数据有统一的数据模式。典型的结构化数据就是存储在各 种数据库系统中的关系数据,通常用标准的关系模型来描述,数据以属性的方式表现, 有具体的数据类型。 非结构化数据:非结构化数据没有统一的数据模式,不能用结构化的数据模型来 描述,也没有统一的操作方式。典型的非结构化数据通常就是所说的文件系统中的各 种文件数据,如w o r d 文档文件、e m a i l 、j p g 图片等。 半结构化数据:就是介于完全结构化数据和完全无结构化数据之间的数据,它可 以方便地表示不规则、不完整、不断变化的数据。x m l 是典型代表,它是自描述的, 数据的结构和内容混在一起,没有明显的区分。 ( 2 ) 语法异构,同结构的数据也可能有不同的数据表示语法,主要是指不同的语 言表示或数据表示。 ( 3 ) 系统异构,包括硬件和操作系统的不同。例如,硬件、操作系统和通信系统 之间的差异。 ( 4 ) 语义异构,不同数据源的设计者对于现实世界的事物的看待角度不会完全一, 样,这样就会产生语义异构。语义异构主要分为以下几种情况:不同的信息源使用多 种术语( 词汇) 表示同一概念;同一概念在不同的信息源中表达不同的含义;各种信息 源使用不同的结构来表示相同( 或相似) 的信息;各信息源中的概念之间存在着各种联 系,但因为各信息源的分布自治性,这种隐含的联系不能体现出来。 数据的异构使得信息的共享异常困难,通过异构数据集成可以将各种相关异构数 据资源进行整合,为建立在数据之上的应用提供更广泛的数据基础。因此,异构数据 集成技术受到越来越多人的重视,对这方面的研究一直没有停止过。 4 不确定语义检索在专利智能服务平台中的应用 第一章绪论 1 3 2 异构数据集成研究现状 数据集成在国外的起步较早,取得的成果也比较明显。国外的很多研究机构都有 信息集成研究项目,比较著名的有t s i m m i s 、t h eg a r l i cv r o j e c t 、i m 等。国内主要 有东南大学、华中科技大学和东北大学等院校的研究。 t s i m m i s t 墙1 是斯坦福大学的一个研究多数据库系统的实验室产品。它采用自描 述对象模型,在t s i m m i s 中,这种模型被称为对象交换模型o e m ( o b j e c te x c h a n g e m o d e l ) 。o e m 是一个信息交换模型,它并不关心对象是如何存储的,而是指明对象 是如何发送和接收的。在t s i m m i s 中,没有模式和对象类的概念,每个对象实例本 身就已包含了它自己的模式。信息并不用o e m 存储,o e m 用于处理逻辑查询,然 后返回查询结果。o e m 采用一种称为m s l ( m e d i a t o rs p e c i f i c a t i o nl a n g u a g e ) 的查询语 言。中间件和封装器用m s l 描述,而且这些组件可以通过m s l 规格说明自动生成。 t s m m i s 不提供数据的概念表示法,中间件在信息源上计算视图。t s i m m i s 提出信 息访问与集成是缠绕在一起的,在未看到样本前,系统可能并不清楚怎么合并信息, 而且碰到某个意外的数据,集成策略可能会改变。t s i m m i s 需要较多的人工干预, 自动化集成程度低。 t h eg a r l i cp r o j e c t t l 9 】,是i b m 开发的一种联邦数据库系统( f d b s ) ,由半自治数据 库系统构成,相互之间分享数据,联邦各数据源之间相互提供访问接口。对于联邦数 据库中的任何数据,用户可以按照d b 2 的方式来进行操作。目前g a r l i c 项目展现了 拓展这一思想来构建联邦数据库系统的可行性,该系统可以有效地使用各种不同的、 可能是非关系型数据源的查询能力。在此系统中,中间件查询处理器促进了优化执行 方案,弥补了各数据源可能缺乏的功能。 i m 【2 0 】采用一种称为c a r i n 的描述逻辑,这种逻辑是一阶逻辑的一部分。i m 采 用知识表示法来集成各种信息源,这一点与s i m s 相同。i m 的体系结构基于一个知 识库,这个知识库包含一个能够描述信息资源属性的域模型。域模型包含信息主题的 描述、与信息员物理特性有关的属性。数据被描述为w o r l d v i e w 上的一个视图。所有 查询、视图都是根据一组全局谓词描述的。由于每一个应用和所有其他应用一样有一 个中间件,中间件所有的查询处理算法也一样,所以在某种程度上,i m 不需要自动 生成中间件。 v e r s a t i l e 2 l j 是东南大学研制的一个基于c o r b a 的分布式异构数据源集成系统原 第一章绪论不确定语义检索在专利智能服务平台中的应用 型。它使用对象集成模型( o i m ) 作为数据集成的公共模型,在s q l 语句的基础上增加 了一些构造符,形成一种对象集成查询语言作为其查询语言。同时引入模版和动态字 典的概念统一描述各种异构数据源的模式,不通过扫描数据库,而是利用局部动态字 典的模板构造集成系统全局动态字典,为查询的分解和优化奠定了基础。 p a n o r a m a 2 2 1 是华中科技大学的扩展多数据库原型系统,该系统具有模式集成,查 询处理和事务处理功能,能够提供对o r a c l e 、s y s b a s e 和d b 2 等成员数据库系统的透 明互操作。提出了一种以多数据库系统为主要技术路线的分布异构数据系统集成方 法。该方法采用c o r b a 中间件作为集成系统的物理模型框架,采用基于a g e n t 的逻 辑模型框架和基于x l v i l 的公共数据模型。通过融合c o r b a 和a g e n t 技术,实现对 各类数据源的封装,使集成系统的结构更适合分布式环境,增加了业务流程的灵活性, 同时也简化了集成系统的设计。 但是数据的更新速度远远超过了人们的想象范围,各种类型的数据每天都在充斥 着这个世界,因此,异构数据集成每天都会被赋予新的内容,随着数据变化的多样, 数据查询能力要求的不断提高,数据集成技术也在探索和发展中不断前进。 1 4 信息检索 1 4 1 信息检索概述 信息检索( i n f o r m a t i o nr e t r i e v a l ) 是指将信息按照一定的方式组织和存储起来,并 针对用户的需求找出所需信息的过程,也称为“信息存储与检索 1 2 3 】。其过程如图 1 1 所示。 文文 文献献 献 分析信标引 形成信 输入 信息著录息 文 息 特 信 标 献 征 息 识 信 匹配 检 检 息 输出-索 索检结 检 语 检 索果 检索 吉 系口 索 索分析 题 选用形成提检索 统 课词问 题 信标 息识 图卜1 信息存储与检索过程 6 不确定语义检索在专利智能服务平台中的应用第一章绪论 从这个定义可以看出,信息检索实际分为信息存储和信息查找两个阶段。信息存 储就是将信息进行特征分析处理,并按照一定格式进行组织的过程;信息查找则是针 对存储信息进行匹配的过程,是信息存储的逆操作。 在信息存储过程中,信息标引人员或者信息自动标引程序对需要存储的信息进行 分析,提取所需要的内容,形成能代表信息的概念或者关键表达,归入检索工具;而 信息检索过程相反,首先对信息需求进行主题分析,形成能代表检索需求的概念,并 将这些概念转换成信息检索词语,然后在检索工具中进行匹配运算,从而找到所需的 信息。信息存储是为信息检索服务的,是信息检索的基础,如果检索结果不能满足需 求,那么存储就失去了意义【2 4 】。, 在这里,还有一个概念也值得关注,那就是数据检索。对于数据检索的条件一般 具有清晰的定义,要求检索结果严格满足条件,它对准确率的要求相当高。而信息检 索对于条件描述本身就是一个研究的难点,因为检索条件一般是普通的自然语言,而 自然语言没有很好的结构,并且一词多意、一意多词的现象很普遍,这对于检索器的 理解具有不确定性,也可称为语义上的模糊性。因此信息检索需要尽可能准确地理解 检索条件所真正要表达的含义,然后通过数据检索查找存储数据,对于结果,需要将 相关度计算值极高的尽可能排在前面。 信息检索作为一门科学,其历史可以追溯到2 0 世纪中期。在此之前,信息存储 和传播主要以纸质为载体,信息检索活动也围绕文献获取和控制展开,这段时期的信 息检索也可以称之为“文献检索。2 0 世纪5 0 年代计算机得到了应用,人们开始使 用虬隋报检索 这个概念。当时的信息检索更接近于数据库检索。随着通讯技术与计 算机技术的紧密结合,信息载体类型的多元化以及传播手段的改进,情报检索研究和 文献检索的研究逐渐归于信息检索研究这一具有兼容性的概念,形成了今天的“信息 检索 。 文献 2 5 中介绍了信息检索历史,从早期的手工检索到如今的计算机化检索,信 息检索主要经历了手工检索( 2 0 世纪5 0 年代以前) 、脱机批处理检索( 1 9 5 4 。1 9 6 5 ) 、联 机检索( 1 9 6 5 1 9 9 1 ) ,w 曲信息检索( 1 9 9 1 至今) 几个阶段。从初步的没有网络连接,也 没有远程终端装置,到如今的广域网检索;从开始的定题检索和回溯性检索到现在的 实时检索;检索数据从规范结构化形式到如今的非结构化;检索系统从单纯的仅仅提 供检索结果到为用户提供个性化服务,信息检索已经发生了翻天覆地的变化。 7 第一章绪论不确定语义检索在专利智能服务平台中的应用 1 4 2 信息检索研究现状 信息检索的对象包括文本、图片、声音等,而对文本的检索是应用最广泛的。文 本检索也称为全文检索( f u l l t e x tr e t r i e v a l ) 主要研究对整个文档信息的表示、存储、 组织和访问方法。其检索对象为全文文本信息。全文检索技术的出现,导致了信息检 索领域的一场革命。当前在全文检索领域,对语义信息检索和超文本信息检索的研究 最为活跃。 语义信息检索【2 6 】【2 7 】,也称为基于概念的信息检索,其基本方法是通过对文献中 的原文信息进行语义上的处理,析取各种概念信息,由此形成一个知识库,然后根据 对用户的提问的理解,在知识库中的相关信息的帮助下,发掘用户需要的信息。它具 有分析和理解自然语言的能力以及自动获取用户查询概念实现知识库自动更新和补 充的能力。语义检索较强的理解原文内容及用户提问信息的能力使得该方法备受青 睐。本文第二章还将详细介绍语义检索相关内容。 超文本信息检索技术【2 8 】是以超文本为基础的文献检索技术。超文本信息是一种能 够包含多种元素( 文字、图像、音频、视频) 的高级文本,表达方式多种多样,是i n t e r n e t 上最为丰富的数据源。关于超文本检索,主要有两种检索模式:基于导引浏览的检索 模式和基于提问的检索模式。前者主要是将信息按照类别进行归类,跟导航类似,用 户首先找到欲查找资料所属的大类别,然后选择相关小类别,最终检索到自己所需的 结果;后者根据用户的输入,通过搜索引擎,按照一定的检索模型,直接向用户返回 检索结果。它主要是建立在主题标引的基础上,用关键词匹配来检索信息。这两种方 法,各有优缺,前者检索过程繁琐,但是检索精度相对较高;后者检索过程简单,但 是对于准确率较难保证。 专利检索可以看作是信息检索的一个子集,信息检索中各种技术、思想、方法均 适用于专利检索,将信息检索思想方法应用于专利检索是本文的思路,包括从专利信 息的组织到专利信息的检索。 1 5 本文研究的内容和意义 1 5 1 本文研究的内容 本文的研究工作是结合苏州大学智能信息研究所开发的基于v l d b 集群计算 的智能专利信息服务系统项目展开的。该系统从2 0 0 6 年开始,在多方专家学者的 8 不确定语义检索在专利智能服务平台中的应用 第一章绪论 共同努力下,经过一年多时间,进行开发,测试,己于2 0 0 7 年1 2 月通过了江苏省科 技项目鉴定。该系统平台为用户提供中国及七国两组织( 美国、英国、法国、瑞士、 德国、日本、俄罗斯、国际专利合作条约组织和欧洲专利局) 专利查询,为检索用户 提供了申请专利号、专利名称、申请日、分类号等2 0 多个检索入口,同时还为企业 用户提供创建个性化数据库,网络硬盘等人性化服务。 本文详细讨论了系统运行的数据基础异构专利数据集成研究以及大数据量 数据库集群存储策略,然后在传统关键字检索方式基础上,结合本体和个性化技术实 现专利系统的语义检索。本文工作对整个系统的运行起着举足轻重的作用,对专利异 构数据源的合理集成,集群计算,以及用户兴趣本体的应用在一定程度上优化了查询, 提高了系统的服务性能和服务质量。 本文的主要研究内容如下: ( 1 ) 分析了专利信息的重要性和当前专利使用过程中的局限性,结合语义检索, 围绕已有平台提出将语义检索方法引入到专利服务平台中,并且对数据集成和信息检 索进行了综述: ( 2 ) 对异构专利信息格式进行分析,找出其组织形式的共性,提出了一种公共的 专利数据集成模型( c d t m ) ,通过该模型完成对多国异构专利数据的集成;集成结果 本地化采用数据库集群( r a c ) 技术以提高数据库的检索性能和数据访问并发性,增加 专利平台运行的容灾性; ( 3 ) 搜集用户特征创建用户兴趣文本,结合个性化技术和本体技术构建用户兴趣 本体,将用户兴趣本体应用于专利信息检索中以进行用户兴趣扩展查询和个性化推荐 等功能; ( 4 ) 通过实验数据对比得出公共数据转换模型的适应度,对加入用户兴趣本体前 后专利检索结果进行分析比对,总结采用公共数据模型进行数据采集和加入用户兴趣 本体检索的优越性。 1 5 2 本文研究的意义 在2 0 0 7 年年初的全国科技大会上,提出了增强自主创新能力的目标。增强自主 创新能力需要营造一个良好的环境氛围,专利信息作为科技创新的重要资源需要在增 强自主创新的过程中得到充分的利用。 9 第一章绪论不确定语义检索在专利智能服务平台中的应用 虽然对专利检索的研究起步较早,国内外也有很多成熟的专利检索系统,但是, 本文从分析多国异构专利数据结构组成做起,将我国及七国两组织异构专利数据通过 通用转换模型集成,并实现本地化存储,不仅为用户的全文查看下载提供便利,更考 虑为后续专利分析提供数据基础;在专利检索过程中加入用户兴趣本体对检索结果进 行约束,让用户能获得更符合自己需要的专利信息,这在以往的关键字检索过程中也 很少见,同时该平台还为用户提供个性化数据库定制,专利统计分析等功能,真正体 现服务理念。 1 6 论文的组织结构 本文共分为五章,每一章的具体内容如下: 第一章为绪论部分。介绍了专利信息在当今经济和科技建设中的重要意义,然后 通过国内外专利检索系统的对比,分析了当前专利检索中存在信息异构和检索效率不 高等问题,并对信息集成和语义检索进行综述,最后提出了本文的研究内容和意义, 给出了论文的组织结构。 第二章为本论文所用相关技术。本章首先介绍了语义检索的两个方面,信息语义 组织和信息语义查找,论述了本体含义及其在语义检索过程中的作用,接着还谈到了 语义检索过程中存在的语义理解、语义推理的不确定性,最后介绍了数据库的实时应 用集群( g a c ) 技术。 第三章描述了异构专利数据源语义集成过程。从异构专利信息数据结构分析入 手,提出了一个通用的数据集成模型( c d t m ) ,该模型有效将专利概念从文本中提取; 专利集成数据采用数据库集群技术进行本地化,最后通过实验验证该模型对异构专利 数据具有较高的适应度。 第四章为用户兴趣本体在专利信息服务平台中的应用。本章研究了用户兴趣的收 集过程,通过收集的用户兴趣特征形式化用户描述文件,然后结合本体技术构建用户 兴趣本体,将用户兴趣本体应用于专利检索过程中,以提高查询的准确率,最后,通 过实验证明用户兴趣本体在专利检索过程中所起的作用。 第五章为总结和展望。本章对本文所做的工作与贡献进行了总结,并且指出了进 一步完善该系统需要解决的若干问题以及今后的发展方向。 1 0 不确定语义检索在专利智能服务平台中的应用第二章相关技术 第二章相关技术 本章重点介绍了异构信息集成和语义检索相关技术,语义检索实质上属于信息检 索范畴,分为信息语义组织表示和信息语义查找两个部分;阐述了本体在语义检索过 程中所起到的重要作用;随后讨论了在语义检索过程中语义理解的不确定性因素;最 后探讨了大数据量情况下集群计算存储技术。 2 1 信息语义集成技术 2 1 1 语义信息提取 语义提取是指从某一领域相关的非结构化信息( 文本、图片、声音、视频) 、半结 构化信息和结构化信息( d b m s ) 中进行语义实体和语义关系的实例抽取,并将结果储 存到语义信息库中f 2 6 j 。对于结构化和半结构化的信息,通过建立原有结构和语义类以 及属性之间的映射关系,可以进行批处理。对于非结构化的信息,常见方法是将视频 和音频转化为相应的文字,然后再进行提取,因而处理的核心问题最后落在了自然语 言处理上。 语义提取通常有两种思路可以考虑:第一种是建立在浅层句法分析基础上,旨在 抽取出主要的语义实体及其关系,成为浅层语义提取;第二种则是建立在完全句法分 析的基础上,要求提取出所有的语义实体及其关系,成为深层语义提取。按照是否保 留原始信息来划分,可以将语义信息提取划分为语义标注和知识抽取两种类型。语义 标注在抽取实体及其关系的同时,保留原始信息,将实体及其关系作为索引的重要手 段加以存储,和语义标注所对应的通常是浅层语义提取。对于知识提取,则不再保留 原始信息,只存储提取的语义实体与语义关系,与之相对应的可能是浅层语义提取, 也可能是深层语义提取。 语义提取过程中应该遵循以下原则: ( 1 ) 一致性( c o n s i s t e n c y ) ,即语义类实例、语义属性实例以及语义关系实例应该 与给定语义类、语义属性和语义关系定义相吻合; ( 2 ) 适当的参考性( p r o p e rr e f e r e n c e ) ,对于实例( 例如人、组织或者事件) 的标记应 该是唯一的,不能出现同一个人有多个身份i d ,尽管这个人可能有曾用名; ( 3 ) 尽量避免冗余( a v o i dr e d u n d a n c y ) ,当不同的语义提取工具或者工作人员相互 1 l 第二章相关技术不确定语义检索在专利智能服务平台中的应用 协作时,应该尽量识别那些已经提取过的资料,从而避免重复劳动以及由此带来的冗 余数据; ( 4 ) 可维护性( m a i n t e n a n c e ) ,所提出的语义类实例、语义属性实例以及语义关系 实例应该易于被维护。通常提取出的数据被转化为r d f 或者o w l 文件,对于大型 的数据,底层数据通常借助于关系数据库进行存储; ( 5 ) 易用性( e a s eo f u s e ) ,语义提取的环境应该易于用户进行操作,对于提取出的 结果,应该尽量提供可视化界面以方便用户操作; ( 6 ) 高效。 生( e f f i c i e n c y ) ,语义提取的过程应该尽量自动化( a u t o m a t i c ) 或者半自动 化( s e m i a u t o m a t i c ) ,尤其是对于海量的语义信息提取而言,如果仅仅只能通过人工 方式进行语义实例提取,工作量往往让人望而止步。 应该说明的是,语义信息的提取和语言的种类是密切相关的。比如英文语义信息 提取,从2 0 0 3 、2 0 0 4 年开始,虽然起步较晚,但是发展速度比较快。文献【2 6 对s m o r e 、 o n t o m a ta n n o t i s e r 、a e r o d a m l 等语义标注原型系统进行分析,这些原型系统都具有 语义信息提取功能,工作模式包含客户服务器( c l i e n t s e r v e r ) 模式或浏览器服务器 ( b r o w s e r s e r v e r ) 模式,同时也有单机模式,标注语言基本采用r d f 描述。而对于中 文语义信息提取难度则相对较大,因为汉语的基本构成单位是汉字而不是字母;英文 单词与单词间用空格隔开,而汉语词与词间没有间隔标记;汉语没有时态的变化,过 去时和现在时词语表现方式完全相同;汉语句子没有形式上的谓词中心词。这些难点 使得对于汉语的分析相对于英文语系来说难度更大。在词语分析方面,我国在1 9 8 3 年研制成功了第一个自动分词系统c d w s ,从这往后,国内外学者在汉语分词方面 进行了广泛的研究,提出了很多行之有效的方法。 2 1 2 语义信息表示 语义信息的描述主要是指对语义实体、语义属性、语义关系以及语义规则的定义, 这些都依赖于一定的语义描述语言。本体( o n t o l o g y ) 作为知识表示工具,与语义网络 非常相似,它们都是表示知识的形式,均可通过带标记的有向图来表示,适合用于逻 辑推理【2 9 1 。本体在语义信息系统中具有非常重要的作用,因为本体是语义信息的描述 基础,是语义检索的重要辅助手段,是语义输出的主要形式,语义信息提取是本体实 例化的一种重要形式。 1 2 不确定语义检索在专利智能服务平台中的应用 第二章相关技术 本体本来是属于哲学范畴,用来描述世界本原,后来被人工智能学者借用了这一 概念,在开发知识系统时用于领域知识的获取。虽然本体在2 0 世纪6 0 年代就为计算 机领域所使用,但是对于本体的理解和定义一直缺乏统一的看法。现在人们普遍接受 的本体定义是“本体是共享概念模型的明确的形式化规范说明”( s t u d e re ta 1 ,1 9 9 8 ) , 它包含四层含义1 3 0 】: ( 1 ) 概念模型,通过抽象出客观世界中的一些现象的相关概念而得到的模型,概 念模型表现的含义独立于具体的环境状态; ( 2 ) 明确,概念和概念的约束都有明确的和无歧义的定义; ( 3 ) 形式化,本体能通过本体语言编码,使得计算机可读,并可以被计算机处理; ( 4 ) 共享,本体体现的是共同认可的知识,反映的是相关领域内公认的概念集。 目前有很多语言和框架
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 汽车定位参数相关试题及答案解析
- 2026年双重预防机制培训考试试卷及答案
- 2026年实验室质量管理题库(含答案)
- 高企相关考试试题及参考答案
- 2025年下半年软考(中级)网络工程师真题+答案及解析解析下午案例
- 2026年慢性病心理健康筛查与疏导高级职称题库
- 2025年下半年教师资格考试真题和答案解析
- 2026年呼吸内科副高职称考试题库及答案
- 2026年二级建造师法规高频模拟试卷及答案
- 2025年体育冷知识题库及答案
- TZWEIA 002-2023 水利水电工程接地用铜绞线技术条件
- 郝万山教授要求必背的112条《伤寒论》论原文
- 河南省新乡市第二十二中学2023-2024学年九年级上学期10月月考数学试题
- 部编版六年级语文上册教学计划及教学进度表
- 值班水手英语听力与会话汇总
- 工程制图习题及答案
- 压铸模具保养规定
- 2023年公务员体检表
- 日立HPM电梯故障检测说明(高速)
- 新发传染病流行病学
- 瑶药浴知识课件
评论
0/150
提交评论