已阅读5页,还剩66页未读, 继续免费阅读
(图书馆学专业论文)抑郁症相关基因和蛋白质数据库的构建.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
独创性声明 y7 2 7 3 4 8 秉承学校严谨的学风与优良的科学道德,本 声明所呈交的论文是莪 个八在导师指导下进行的研究工作及取得的研究成果。尽我所知,除了文 中特别棚以标注和致谢豹地方外,论文中不包含其他人已经发表或撰写过 的硼究成果,不包含本人或他八已申请学位或其他用途使用过的成果。与 我一同工作的同志对本研究所馓的任何贡献均已在论文中作了明确的说明 并表示了致谢。 申请学们论文与资料若有不宴之处,本 承翅一切相关责任。 论文作者签名:,基盔! :日期:至竺苎! :! 保护知识产权声明 本人完全了解第四军医大学有关保护知识产权的规定,即:研究生在校 攻读学位期间论文工作的知识产权单位属第四军医大学。本人保证毕业离 较后,发表论文或使用论文工作成果对署名单位仍然为第四军医大学。学 校可以公布论文的全部或部分内容( 含屯子顾,保密内容除9 ) ,可以采 用影印,缩印或其他复制手段保存论文。学较有权允许论文被查闻和借阋, 并在校园网上提供论文内容的溯览柳下载藤务。 论文作者签各:立i 3 导师签名: 专7 恕 日期 m f ;。;6 第四军医大学硕上学位论文 缩略语 f t p g o p h e r b b s u s e n e t k b m s c a d c a m c i m d b m s d s s a s p a d 0 缩略语表 英文全称中文全称 f i l et r a n s f e rp r o t o c o l文件传输协议 g o p h e r 菜单式检索 b b s电子公告栏 u s e n e t新闻讨论组 k n o w l e d g e b a s e m a n a g e m e n ts y s t e m 知识库管理系统 c o m p u t e r a i d e d d e s i g n计算机辅助设计 c o m p u t e r a i d e d m a n u f a c t u r i n g 计算机辅助制造 c o m p u t e ri n t e g r a t e dm a n u f a c t u r i n g 计算机集成制造 d a t ab a s em a n a g e m e n t s y s t e m 数据库管理系统 m a n a g e m e n t i n f o r m a t i o ns y s t e m 管理信息系统 d i s t r i b u t es e r v i c es y s t e m分布式服务系统 a c f i v e xs e r v e r p a g e 活动服务器页面 a c t i v e xd a t ao b j e c ta c t i v e x 数据对象 第朋军医大学硕士学位论史 c g i p c r w h o d d b j n i h c o m m o ng a t ei n t e r g a c e通用网关接口 p o l y m e r a s e c h a i nr e a c t i o n聚合酶链反应 w o r l dh e a l t h o r g a n i z a t i o n 世界卫生组织 d n ad a t ab a n k o f j a p a n 日本核酸数据库 n a t i o n a li n s t i t u t e so fh e a l t h 美国国立卫生研究院 e b i e u r o p e a n b i o i n f o r m a t i c si n s t i t u t e 欧洲生物信息研究所 e m b l e u r o p e a n m o l e c u l a r b i o l o g yl a b o r a t o r y 欧洲分子生物学实验室 l s 0i n t e m a t i o n a lo r g a n i z a t i o nf o rs t a n d a r d i z a t i o n 国际标准化组织 2 第四军医大学颂士学位论文 抑郁症相关基因和蛋白质数据库的构建 硕士研究生:王栋 导师:李广德研究馆员 第四军医大学图书馆,西安7 1 0 0 3 2 中文摘要 构建抑郁症相关基因和蛋白质数据库是为了促进抑 郁症医学生物信息学的研究。利用目前通用的计算机和 网络环境,操作系统选用w i n d o w s2 0 0 0s e r v e rf a m i l y , 在内部构建了数据库建设环境。从g e n b a n k 、s w i s s - p r o t 中搜集抑郁症相关基因和蛋白质数据。并在此基础上, 对数据进行分类和整理,建立了抑郁症相关基因和蛋白 质数据库,以g e n es y m b o l 作为联系数据库中各表的枢 纽,在后台数据库方面,选用m i c r o s o f t a c c e s s 作为后台 数据库,以m i c r o s o f tw i n d o w s2 0 0 0s e r v e rf a m i l y 作为服 务器系统,完成o d b c 数据连接,实现了数据共享。数 据库应用方面,采用w e b 方式作为输出方式,利用 m i c r o s o f tf r o n t p a g e2 0 0 2 并结合a s p 技术进行页面开发 和数据库查询编写。数据库主要包括基因表( g e n e 第四军医大学颂士学位论文 t a b l e ) 、蛋白质表( p r o t e i nt a b l e ) 、序列库( s e q u e n c e ) 表等。共收录抑郁症相关基因8 8 条,以及相关蛋白质和 有关序列。经过测试,数据库的可靠性、实用性、易用 性以及响应速度基本达到了预期目的,实现了网络化检 索的目的。 关键词抑郁症基因数据库生物信息学 第四军医大学硕士学位论文 t h ec o n s t r u c t i o no ft h ed a t a b a s eo f d e p r e s s i o nr e l a t e dg e n e a n d p r o t e i n c a n d i d a t ef o rm a s t e r :w a n g d o n g s u p e r v i s o r :l ig u a n g d e l i b r a r y , f o u r t hm i l i t a r ym e d i c a lu n i v e r s i t y , x i a n7 1 0 0 3 2 c h i n a a b s t r a e t t oco n s t r u c tad a t a b a s eo f g e n ea n dp r o t e i nt h a tre l a t e d w i t hd e p r e s s i o na n dt op r o v i d eau s e f u lq u e r yt o o lt h a tm a d e u s e se a s i l ya c c e s st ot h eb i o m e d i c a li n f o r m a t i o nt h a tr e l a t e d w i t hd e p r e s s i o n w i t hw i n d o w s2 0 0 0s e r v e rf a m i l yb e i n g u s e da so p e r a t i n gs y s t e m , c o m p u t e ra n dn e t w o r kw e r eu s e d a sh a r d w a r et ob u i l dac o n d i t i o n b a s e do nt h a tc o n d i t i o n , w ec o n s t r u c tad a t a b a s e ag r e a td e a ld a t ao fg e n e sa n d p r o t e i n s t h a tr e l a t e dw i t h d e p r e s s i o n w a sc o l l e c t e df r o m g e n b a n ka n ds w i s s - p r o t t h ed a t ao fg e n e sa n dp r o t e i n s t h a tr e l a t e dw i t hd e p r e s s i o nw a sc l a s s i f i e da n dad a t a b a s eo f g e n ea n dp r o t e i nr e l a t e dw i md e p r e s s i o nw a sc o n s t r u c t e d t a b l e soft h eda t a b a s ew e r ec o n n e c t e db y “s y m b o l ”w i t h m i c r o s o f ta c c e s s b e i n g u s e da st h eb a c k g r o u n d ,w eu s e dt h e m i c r o s o f tw i n d o w s2 0 0 0s e r v e r f a m i l y a st h es e r v e r s y s t e m t or e a l i z et h ec o n n e c t i o no fo d b cw i t hd a t as o u r c e 第四军医大学碗士学位论文 t oe a s i l yg e ti n f o r m a t i o nf r o mi n t e r n e t ,t h ew e bm o d ew a s c h o u s e da so u t p u tm o d e ,a n dm i c r o s o f tf r o n t p a g e2 0 0 2a n d a s pw e r eu s e da sw r i t et o o lo fw e b p a g e a sw e l la sd a t a b a s e q u e r y t h ed a t a b a s ei n c l u d e sg e n et a b l e 、p r o t e i nt a b l ea n d t h e i rs e q u e n c e n o wt h ed a t a b a s eh a sc o n t a i n e d8 8e n t r i e s o fg e n et h a tr e l a t e dw i t hd e p r e s s i o na n ds o m ep r o t e i na s w e l la ss e q u e n c et h a tr e l a t e dw i t h d e p r e s s i o n p r i m a r ys t u d y s h o w e dt h a tt h ed a t a b a s ew ec o n s t r u c t e dh a do f f e r e du sa n e wa p p r o a c ht ob i o m e d i c a li n f o r m a t i o nt h a tr e l a t e dw i t h d e p r e s s i o n ,a n d h a v es o m e g o o d c h a r a c t e r ss u c ha s r e l i a b i l i t y , p r a c t i c a l i t y , f a c i l i t ya n dq u i c kr e s p o n s e i no t h e r w o r d ,t h ed a t a b a s eh a dm e t t h et a r g e t sw ed e s i r e d k e yw o r d s :d e p r e s s i o n g e n ed a t a b a s e b i o i n f o r m a t i c s 6 1 前言 抑郁症是危害全人类身心健康的常见疾病,也是影 响到社会公共健康的严重疾病。其病因较复杂,至今尚 未完全阐明。按照目前研究情况,抑郁症起病原因可分 为原发性和继发性。原发性抑郁一般查不出明确病因, 是精神医学中研究的重点。随着分子生物学和分子遗传 学的发展,医学界普遍认为抑郁症是一个多基因参与的、 环境和遗传因素相互作用引起的主要精神卫生问题,同 时研究也发现了一些与抑郁症发生相关的候选基因和致 病基因,如在分子遗传学的研究中发现抑郁症的易患基 因与人类的5 、1 0 号染色体连锁。3 。目前国内外对与抑 郁症相关基因和蛋白质的研究分析主要针对不同人群、 不同年龄、不同性别等患者患病的机理分析研究以及单 个基因和蛋白质的作用机理研究,对与抑郁症相关的基 因和蛋白质的数据缺乏系统的整理和分析;同时由于目 前通用的生物信息数据库的信息量十分庞大,数据量增 长迅速,数据格式复杂,对研究人员来说利用起来十分 困难。所以运用生物信息学的原理和技术,收集、整理、 分析既往关于抑郁症研究的所有资料,建立与抑郁症相 关的基因和蛋白质数据库,从而探索其中的规律和特点, 是进一步研究抑郁症的病因和防治的基础。 第旧军医大学顺上学位论文 2 文献回顾 2 1 因特网信息资源的组织 2 1 1 因特网信息资源及组织方法 因特网信息资源,是指以数字化形式记录的,以多 种媒体形式表达的,分布式存储在因特网不同主机上的, 并通过计算机网络通讯方式进行传递的信息资源的集 合,是计算机技术、通讯技术、多媒体技术相互融合而 形成的在因特网上可查找、利用到的资源口1 。因特网信息 资源的类型多样,一般按照信息的时效性、内容范围、 发布形态、学科领域、交流方式和组织形式等标准进行 分类。其内容涉及人类面对和从事的各个领域、行业, 及社会公用服务领域。从2 0 世纪9 0 年代开始,伴随着 因特网信息资源的网络化、数字化的发展,因特网信息 资源从数量到内容高速增长,具有文本、数据、图形、 声音和视频等多种载体形式,全球性的分布式网络结构, 呈现出大容量、多类型、多媒体、非规范、跨时间、跨 地域、跨行业、多语种等特点。但从另外角度来看,信 息资源显得分散、无序、随机变化大。从整体上看,因 特网信息资源尚处于一种纷繁、复杂而且无序的状态。 信息分布和构成缺乏规范的、标准的结构和组织,信息 发布具有很大的自由性和任意性,信息质量缺乏必要的 控制,网络信息资源管理的复杂性和多样性空前增加。1 。 与传统信息资源相比,因特网信息资源具有传统信 息资源无法比拟的优势,主要表现为:信息资源丰富 多样;利用不受时空限制;信息传送快捷;信息 查询方便;信息利用的平等性;信息利用的交互性; 信息资源的共享性;能够获取最新资料。同时因特 网信息资源也并非是“人间净土”,些不健康的东西以 及过多的垃圾信息充斥因特网,使得对因特网信息资源 的利用受到了极大的影响;除此之外,因特网信息资源 的数量巨大,增长迅速,结构复杂,分布广泛也是影响 因特网信息资源利用的一个主要原因。所以需要针对 因特网信息资源进行有效地组织管理,进而提高因特网 信息资源的利用效果。 因特网信息资源的组织管理是指人们借助因特网, 根据因特网信息资源本身的特点( 或属性) ,运用各种工 具和方法,对因特网信息进行加工、整理、排列、组合, 使之有序化、系统化、规律化,从而有利于因特网信息 的存储、传播、检索、利用,以满足人们对因特网信息 需求的活动过程。如网页、电子邮件、f t p 、g o p h e r 、b b s 、 u s e n e t 等,其中以网页为主要存在形式1 。 因特网信息资源的组织同其他信息资源的组织一 样,需经过序化阶段和优化阶段两个过程对信息进行整 第四军医人学硕上学位论文 理。其组织方法主要有语法信息组织方法、语义信息组 织方法、语用信息组织方法。其中语法信息组织方法主 要有字顺组织法( 形序、音序) ;代码组织法;地 序组织法;时序组织法;其他组织法。语义信息组 织法主要有元素结构组织法;逻辑组织法;分类 组织法:主题组织法;超链接组织法。语用信息组 织法主要有权值组织法;概率组织法;个性组织 法;数据库组织法;重要性递减组织法。在上述方 法中数据库组织法和超链接组织法是传统信息组织方法 分类体系中所没有的。上述方法只是对组织方法的理论 分类,在实际应用中,为了把因特网信息资源组织得更 加有序,更加符合人们的认识规律,通常是将多种方法 综合应用。所以,可以认为因特网信息资源的组织方法 是一种综合的组织方法,是主题法、分类法、字顺法等 多种方法共同作用的结果。 2 1 2 因特网信息资源组织形式 通过应用上述各种方法对因特网信息资源的组织和 序化,将因特网信息资源有效、合理地组织成不同的形 式,方便使用。因特网信息资源的组织形式主要有: 网页网站:搜索引擎;专业导航系统;虚拟图书 馆。 第p u 军医大学颇1 1 学位论文 网页( h o m e p a g e ) 是因特网信息的基本单元和信息 载体。从网页中所包含的内容来看,信息的条理性、快 捷性以及用户界面的美观直接关系到网页制作成功与 否;网站( w e b s i t e ) 是应用超媒体技术将众多网页链接 在一起的网页集合,是因特网信息资源的基本单位,是 因特网信息资源的节点,通过网站可将因特网的资源进 行组织集成。网页和网站是目前因特网信息资源应用最 为广泛的组织形式,以网页和网站的形式组织因特网信 息资源主要是应用超链接组织法和超媒体技术。利用超 链接组织法和超媒体技术构建的网站中网页的链接是多 层次的,通过点击网页中不同的链接,用户可以以线性 顺序浏览信息,或者是在不同的信息单元之间实现跳跃 浏览,从而实现对因特网信息资源的漫游。但是利用网 页网站形式组织因特网信息资源也有一定的不足,由于 因特网信息的复杂和多样,单纯利用网页网站形式组织 的因特网信息资源无法使用户迅速而准确的查找到真正 需要的信息内容,用户通过浏览方式对因特网信息的访 问,在很大程度上是在碰运气,效率较低,无法满足用 户进一步的需求。所以为了在因特网信息资源中准确地 查找到需要的信息,需要对网页网站形式的因特网信息 资源进行进一步的组织管理,这就推动了搜索引擎的产 生。 第四军医人学颅i :学位论文 搜索引擎( s e a r c he n g i n e ) 是指对因特网资源进行组 织、标引和检索的一类检索系统机制和工具。使用时, 用户只需在检索框中输入检索词及其相应的逻辑组配 符,或者依据系统所给定的分类结构选择浏览,就可以 得到相应的包含有相关信息的网页或网站,网页和网站 以超级链接的形式提供,点击链接就能够访问网页或网 站。搜索引擎在一定程度上减少了用户访问网络的盲目 性,提高了在网络上获取信息的效率。目前搜索引擎已 经成为因特网信息资源利用的有效工具。根据“搜索引 擎”所基于的搜索技术原理,一般把它们分成三大主要类 型:基于r o b o t 的搜索引擎、目录搜索引擎和元搜索引擎 7 】 基于r o b o t 的搜索引擎是一个自动搜索网页程序, r o b o t 启动后自动访问w e b 站点,提取站点上的网页, 并根据网页中的链接进一步提取其他网页或转移到其他 站点上,然后r o b o t 将搜集的网页加入到搜索引擎的数 据库中,供用户查询使用。基于r o b o t 的搜索引擎通常 i 由r o b o t 程序、i n d e x 和搜索软件等三个部分构成。由 于基于r o b o t 的搜索引擎利用r o b o t 程序自动寻找网络资 l 源并编制索引摘要,减少了人工作业,更新速度快,网 页中任何内容的变化情况都会及时反映到用户查询的结 果中,所以收录资源多而且更新频繁是其显著特点。同 时由于基于r o b o t 的搜索引擎收录的资源多,所以收录的 资源良莠不齐,查询结果精确度低。因特网上最早出现 的搜索引擎就是利用r o b o t 来建立数据库的,“搜索引 擎”这个词的原义也只是指这种狭义上的基于r o b o t 的 “搜索引擎”。目前常用的百度、g o o g l e 等搜索引擎就 属于这一类型。 目录搜索引擎( d i r e c t o r y s e a r c he n g i n e ) 的目录数据 库是用程序软件自动搜索和积累并依靠一群专职编辑来 建立和维护的。专职编辑人员在访问了某个w e b 站点后撰 写一段对该站点的描述,并根据站点的内容和性质将其 归为一个预先确定的类别,把站点的u r l 和描述放在这 个类别中。当用户查询某个关键词时,搜索软件只在这 些描述中进行搜索。目录搜索引擎也接受用户提交的网 站和描述,但必须在得到认可后,才会将其添加到合适 的类别中去。由于目录搜索是依靠人工进行整理,而且 只在已保存的对站点的描述中进行搜索,因此站点本身 l3 第四军医人学碗卜学位论文 的动态变化不会反映到搜索结果中来,其网站信息的更 新速度受到一定影响。这是目录搜索与基于r o b o t 的 “搜索引擎”之问的区别之一。目录搜索引擎的用户界 面基本上都是采用分级结构,访问者通过目录搜索引擎 首页提供的最基本的几个大类作为检索入口,逐级向下 访问,直至找到自己感兴趣的类别。同时,访问者也可 以利用目录提供的搜索功能直接查找一个关键词。由于 目录搜索引擎是依靠人工来评价一个网站的内容,因此 用户从目录搜索得到的结果往往比从基于r o b o t 的搜索 引擎中得到的结果更具参考价值。 元搜索引擎( m e t a s e a r c he n g i n e ) 是一个要调用其他 “搜索引擎”的搜索引擎。一个真正的元搜索引擎由三 部分组成,即:检索请求提交机制;检索接口代理机制 和检索结果显示机制。检索请求负责实现用户特色化的 检索设置要求,包括调用哪些搜索引擎、检索时间限制、 结果数量限制等。接口代理负责将用户的检索请求“翻 译”成满足不同搜索引擎个性化要求的格式。结果显示 负责将所有源搜索引擎返回的结果加以去重、合并、格 式规范等处理,以符合“本地化”的要求。多数元搜索引 1 4 擎在处理其他搜索引擎的返回结果时,只提取出每个搜 索引擎检索结果中的前l o 一5 0 条,并将这些条目合并在 一起返回给用户。所以利用元搜索引擎检索得到的最后 结果的数量可能会远少于直接在一个搜索引擎上进行查 找所得到的数量。元搜索引擎也有一定的局限性,例如 元搜索引擎通常不支持独立搜索引擎所提供的高级搜索 功能,在处理逻辑查询时也常常会出现错误;利用元搜 索引擎进行检索时处理查询的时间会比独立搜索引擎长 一些;由于独立搜索引擎检索的结果很多,一般来说元 搜索引擎都要利用某种标准来删除它认为无用的结果, 因此,势必会有一些有用的信息被丢弃了。所以在利用 元搜索引擎时,应该根据其提供的一个检索清单上所列 举的有关元搜索引擎是如何分析检索查询,并如何对某 个工具提交查询等细节说明来进一步使用特定的检索工 具进行检索。 搜索引擎是以网络信息搜寻为目的的,它的出现在 一定程度上满足了网络访问者在网络信息查询上的需 求,减少了信息查询的盲目性,使因特网信息资源的组 织达到了初步的序化。但由于搜索引擎在标引、控词等 ls 第四军医人学硕i 学位论文 方面的不足,导致搜索引擎在检索中检准率和检全率都 不高,难以满足用户对信息查询的进一步要求。为了进 一步提高因特网信息资源的有序化程度,弥补搜索引擎 的不足,改善搜索引擎检索的效率,所以产生了对网站 网页内容信息再组织的专业导航系统和虚拟图书馆。 专业导航系统是指在所建立的专业导航系统数据库 中,把因特网上与某一或某些主题相关的网页网站进行 集中、分类、整理,按照方便用户检索的原则,使用用 户熟悉的语言以主题树的形式组织起来,从逻辑上将国 内外有关信息资源联系起来,向用户提供这些资源的分 布情况,并且通过各种导航手段,为用户方便地定位、 迅速获取所需信息资源提供引导,指引用户到特定的地 址获取所需信息3 。专业导航系统是因特网信息资源组织 发展到一定阶段的产物,其主要形式有专业指引库、专 业导航库等。专业导航系统中的信息资源主要采用主题 树浏览方式进行组织,树浏览方式是将信息资源的索引 按照主题分级加以组织,用户可以通过浏览的方式,逐 级浏览,找到所需要的信息线索阳1 。按照这种方式组织信 息,需要对信息进行标引、分类、设计主题树的结构等, t 6 第阳军医大学颁| :学位论文 工作量比较大,但是其检索方式是由人按类逐级进行的, 因此目标性强、查准率高,可以弥 b i n t e m e t 检索工具的 不足,同时可以充实信息资源建设不发达国家的信息资 源,探索出一条建设专业信息资源的新途径。因特网上 的各种信息资源中,有相当一部分不太稳定,变动较多, 这种情况如不能及时反映到专业导航系统中,即对专业 导航系统及时进行更新,则必然会不同程度地影响用户 检索的效果。专业导航系统包含的内容非常丰富,数据 量很大,更新的任务是非常重的。数据更新主要采用手 工方式和利用自动跟踪技术。对于数据更新如此繁重的 工作,用手工方式完成困难很大,更新周期会很长,势 必影响专业导航系统的质量。利用自动跟踪技术对信息 资源进行自动跟踪主要是为了解决因特网上信息资源变 动的跟踪问题,用于及时地更新专业导航系统,增加新 出现的节点地址,删去已经从网上消失的节点地址,修 改发生改变的节点地址。专业导航系统数据更新的自动 跟踪程序都由专业导航系统建设人员设计和编写,分成 两个部分,一部分负责资源变动的跟踪,另一部分负责 跟踪结果的分析。一般采用参照搜索引擎中的网络机器 1 7 人建立自动跟踪程序或利用搜索引擎的检索结果来更新 数据。利用搜索引擎的检索结果来建立专业导航系统可 以提高专业导航系统的自动化水平,减少投入,降低成 本,加快专业导航系统的更新周期,提高专业导航系统 的质量。 虚拟图书馆是根据特定的目标,选定信息资源的学 科领域,对有关的网站网页进行搜索和收集,加以鉴定 核实,并对核实后的网址进行合理组织,使之能够提供 检索、浏览和链接的信息集合“。虚拟图书馆就是一种 知识管理实体,它将传统图书馆范畴与远程通讯和计算 技术的应用有效地结合起来,通过将图书馆自身拥有的 资源、图书馆母体机构专有的信息、外部世界范围内的 信息资源无缝地整合,促进每个用户快速地存取和有效 地使用信息“。虚拟图书馆的主要功能,就是在因特网 信息资源中搜索某一学科、某一领域的相关信息,并将 这些信息进行深度加工和系统性组织,提供给用户浏览 或查询。其搜集信息的方式主要有人工搜集和自动化搜 集两种。虚拟图书馆的信息组织通常采用主题树方式和 数据库方式。 1r 第四军医大学硕 学位论文 主题树方式就是将虚拟图书馆所选定的学科领域的 所有已获得的信息资源按照某种事先确定的概念体系结 构( 专业性的分类表) ,分门别类地加以组织,用户访 问时通过浏览方式进行选择,查找相应的信息线索,并 通过信息线索找到相应的网络信息资源。其优点在于简 单易用,目的性强,但其体系结构不能过于复杂。这对 于大型虚拟图书馆来说,会降低类目的专指性,影响检 索效果。数据库方式就是将虚拟图书馆所包含的学科领 域所有已获得的信息资源以固定的记录格式存储,并提 供相应的检索入口查询信息线索,通过信息线索找到相 应的网络信息资源。其实现的前提是关键词的标引。其 优点是信息规范,操作灵活,但要求用户必须有一定的 检索技巧。 虚拟图书馆和专业导航系统都是在对因特网信息资 源进行有序化组织的基础上形成的,两者有很多的相同 之处,但也存在一定的差异。从信息资源组织的方式上 看,专业导航系统多采用主题树的方式组织信息资源, 虚拟图书馆多采用主题树和数据库并用的方式组织信息 资源。在词汇控制方面,虚拟图书馆要优于专业导航系 1 9 统。 综上所述,因特网信息资源的组织管理是一项复杂 的工作,可以使因特网信息资源有序化,提高因特网信 息资源的利用效果,减少信息资源无序、不稳定、信息 污染等情况,实现因特网信息资源利用效率的最大化。 2 2 数据库技术的发展趋势 数据库是以一定的组织方式存储在一起,相互关联 而独立于应用程序之外,并能为多个用户所共享的数据 集合“。其特点是有序性、共享性、独立性、完整性、 最小冗余性。按照数据库提供数据的类型,可将数据库 分为文献数据库、数值数据库、事实数据库和多媒体数 据库。其中文献数据库是指报道各类文献及文献信息的 数据库,包括书目数据库和全文数据库。数值数据库是 一种以自然数值形式表示、计算机可读的数据集合,主 要记录和提供特定事物的性能、数量特征等信息。事实 数据库是存储有关事物( 如人物、机构、事件等) 的一 般指示性描述的参考数据库。多媒体数据库是相对于传 统的仅支持单一媒体的数据库而言,将图像、图形、文 字、动画、声音等各种媒体数据合为一体,并统一地进 行存取、管理和应用的数据库“。 数据库按照结构模型可分为层次模型数据库、网状 模型数据库、关系模型数据库、面向对象模型数据库。 从用户角度看,数据库可分为单用户结构、主从式 结构、分布式结构、客户机服务器结构。数据库从不同 的角度来分析可以分为多种类型,但不论其分类情况如 何,其实质都是一样的:数据库是一个有穷的集合体; 数据之间有较复杂的逻辑关系,数据库不仅存储数据, 还存储数据之间的逻辑关系;数据库具有数据共享和 数据独立等特征“。 经过数十年的发展,数据库系统从2 0 世纪6 0 年代 诞生,已经经历了第一代、第二代数据库系统的开发与 广泛应用,第三代数据库系统的开发速度加快。因特网 技术的发展加速了数据库技术的开发与利用。特别是近 几年基于网络的数据库技术在许多方面取得了很大的进 步。 2 2 1 分布式数据库 分布式数据库( d i s t r i b u t e dd a t a b a s e ,d d b ) 是一组 数据集,数据在逻辑上属于同一系统,但在物理上却分 散在用计算机网络连接的多个结点上。分布式数据库系 统是数据库技术与计算机网络技术相结合的产物“。分 布式数据库一改集中式数据库的缺点,较好地解决了通 第四军医大学硕士学位论文 讯网络负担、数据维护和管理等问题。分布式数据库针 对数据实施分片技术,具体有水平分片、垂直分片、混 合分片等,将数据合理地分散在计算机网络中的多个结 点上,同时保证数据的逻辑一致性。分布式数据库的特 点主要有:数据分布性好,应用结构合理;可靠性 和可用性强;经济性能好:数据透明性好;可扩 充性与数据共享性好“。 2 2 2 数据仓库与数据挖掘 数据仓库是集成的面向对象的数据库集合,它是用 来支持决策功能的,其中每一个数据单位都与时间相关。 数据仓库是在数据库概念下进行的再构造过程,建立数 据库的目的就是把一个机构的内部数据和外部数据进行 有效地集成,为各级决策者提供信息资源,其数据量应 足够支持数据分析、查询和报表等“。数据仓库一般由 五个部分组成:数据源的确定与采集;数据的转换; 数据的载入与存储;数据的查询与分析;元数据 1 8 0 数据挖掘也称知识发现,是从数据库中获取人们感 兴趣的知识,这些知识是隐含的、潜在的。获取的知识 2 第四军医大学硕士学位论史 表示为概念、规则、规律、模式等形式,可用于信息管 理、决策支持和过程控制“。数据挖掘是数据仓库技术 中的一个重要程序,具有相对的独立性。数据挖掘涉及 数理统计、模糊理论、神经网络和人工智能等技术。目 前数据库的应用已从信息检索发展到知识发现阶段,要 在数据中发现知识,建立数据仓库是基础,进行数据挖 掘是关键。 2 2 3 知识库和智能数据库系统 将数据库与人工智能相结合是数据库系统发展的方 向之一。将数据库的思想方法应用于人工智能领域就产 生了知识库,将人工智能应用于数据库就产生了智能数 据库。 知识库管理系统( k b m s ) 是对知识库进行管理、控 制,完成对知识库的各类操作,并向用户提供检索、查 询手段的软件系统,它包括系统的维护与诊断、日常的 系统事务管理、各种实用程序的管理、出错处理、知识 库系统的安全控制和用户的使用权限管理等瞳“。知识库 系统的核心组成部分是知识库和推理过程。知识库是以 一致的形式存贮知识的机构,推理机构则是为了使用知 2 3 第四军医大学顾l 学位论文 识库库藏的知识执行推理的控制机构。 知识库是人工智能的基础,在专家系统、知识工程 等人工智能应用领域具有极其重要的地位。智能数据库 在信息检索、辅助决策支持、办公室自动化等应用系统 中发挥着重要的作用。“。 2 2 4 工程数据库 工程数据库是适合于c a d 、c a m 、c i m 、地理信息 处理、军事指挥、控制通信等工程应用领域所使用的数 据库。 工程数据库是面向对象的数据库系统。它的主要特 点:( 1 ) 具有独特的数据模型,支持复杂的数据结构和 复杂的数据类型;( 2 ) 支持动态的版本管理和集成管理; ( 3 ) 具有丰富的语义关联:( 4 ) 支持日常事务管理;( 5 ) 具有友好的用户接口和良好的相容性支持。 工程数据库中的数据模型主要分为三类:( 1 ) 传统 的层次数据库和网状数据库数据模型的扩展( e r 模 型) ;( 2 ) 基于语义的数据模型;( 3 ) 面向对象的数据 模型。 2 2 5 并行数据库 2 4 招阴军医人学硕卜学位论文 并行数据库是以原有的一个客户服务器结构的数 据库管理系统( d b m s ) 为基础,基于一定假设的无共享 硬件结构而设计实现的并行数据库系统。系统由一个主 控机和n 个处理结点上的所有d b m s 软件构成整个并行 d b m s ,客户应用程序通过网络或其他途径与并行d b m s 建立联系,并通过主机系统上的应用通讯接口直接与主 机通信。 并行数据库系统要求将关系元组划分到各处理结点 上进行存储,以充分利用并行i o 的能力。在并行数据 库系统中通过指定划分属性将关系划分成小的片段存储 到各处理结点上,主控机上不保存实际的数据,但进行 s q l 解释和任务划分等操作,主控机上保存模式信息的 副本2 。 2 2 6 主动数据库 主动数据库是相对于传统数据库的被动性而言的。 在各种管理信息系统( m i s ) 或决策支持系统( d s s ) 中, 传统数据库在数据的存储与检索等方面已为各种用户提 供了良好的服务。用户可以通过相应的命令或操作来实 现其对数据的需要。但各种传统数据库本身是被动的, 2 s 篇四军医大学顾l :学位论文 用户给什么命令,系统就做什么动作,它丝毫不会根据 数据库的内部状态等情况主动做些什么。而在许多实际 的应用领域,如管理信息系统、计算机集成制造系统、 办公自动化系统中常常希望数据库系统在紧急情况下能 根据数据库的当前状态,主动适时地做出反应,执行某 些操作,向用户提供有关信息心“。主动数据库的主要目 标就是提供对紧急情况及时反应的能力,同时提高数据 库管理系统的模块化程度。一个主动数据库系统在功能 上由一个传统数据库系统和一个事件驱动的知识库和相 应的事件监视器组成。 2 2 7 w e b 数据库 w e b 数据库是在传统的关系数据库技术的基础上,将 网络技术、数据库技术、存储技术和检索技术合为一体, 完全基于因特网应用的数据库结构和数据模型的新型数 据库2 ”。 典型的w e b 数据库系统有一个w e b 浏览器作为用户 界面,一个用于存储信息的数据库服务器和一个连接两 者的w e b 服务器。( 如图1 所示心7 3 ) 。 w e b h t t p 请求y c 6 服擎 数 、 浏 li 据 览 曲挲: 度 器服 一 数据库 h t m l 页面 务 、 图1w e b 数据库系统的基本结构 由于w e b 数据库采用了许多新技术,所以其具有其它 传统数据库所不具备的特点。可以容纳一切信息资源, 结构化的或非结构化的信息资源;结构灵活,支持多 种标准以及元数据方案;支持多种编程工具和应用程 序,简化开发的难度;扩展了数据类型,可以处理图 形、声音、视频、动画等多媒体信息;改进了索引机 制,提高了查询速度、查准率和查全率。 w e b 数据库技术中最关键的就是w e b 服务器与数据 库服务器之间的连接技术。目前比较常用的是a s p 技术, a s p ( a c t i v e xs e r v e rp a g e ) 技术,采用网页嵌入服务器脚 本( v b s c r i p t 或j a v a s c r i p t ) 机制,并应用a s p i 勾置的数据 库存取组件a d o ( a c t i v e x d a t ao b j e c t ,a c t i v e x 数据对象) 实现对数据库表直接访问,从而实现网上w e b 信息系统的 数据发布。a d o 简单易行、应用广泛,所以是a s p 访问 数据库所采用的最佳选择。a s p 技术与a d o 的结合使得 w e b 开发变得更加简单、快速、高效。a d o 对数据库的 访问方式是由i n t e m e ti n f o r m a t i o ns e r v e r 来完成的“。 其工作原理如图2 所示1 。 客户端浏览器 一k h t t p 请求标准h t m l 页而 、, w i n d o w sn t i l s ( w e b 服务器) a s p 引擎 a s p a d o 其它组件脚本引擎 y 数据库服务器 厂、 卜 ,一 io d b c 产 fd b m sl 。id b 、 , 图2a s p 技术工作原理 第叫军医大学硕士学位论文 除了a s p 技术,w e b 服务器与数据库服务器之间的 连接技术还有c g i 技术、w e b a p i 技术、j a v a j d b c 技术、 j s p 技术、p h p 技术等。 2 3 抑郁症相关基因数据库研究现状 抑郁症通常指的是情绪障碍,是一种以心境低落为主 要特征的综合症。这种障碍可能从情绪的轻度不佳到严 重的抑郁,它有别于正常的情绪低落。抑郁性障碍的病 因涉及生物、心理和社会因素多方面。值得注意的是遗 传因素有着重要的影响作用,研究表明:家族中有患病 者的人群发病率是一般人群的1 0 3 0 倍,血缘关系越近, 患病几率越高。抑郁症是危害全人类身心健康的常见 疾病,是影响到公共健康的严重疾病。其病因较复杂, 至今尚未完全阐明。按起病原因可将抑郁症分为原发性 和继发性。原发性抑郁一般查不出其明确病因,是精神 医学中研究的重点。随着分子生物学和分子遗传学的发 展,医学界普遍认为抑郁症是一个多基因参与的、环境 和遗传因素相互作用引起的主要精神卫生问题,同时研 究也发现了一些与抑郁症发生相关的候选基因和致病基 第叫军医大学硕l 学位论文 因。 从国内情况看,抑郁症相关基因的研究主要集中在 某些致病基因或高度相关基因的功能研究方面。例如高 树贵等以中国汉族人群中的7 2 个情感性精神障碍核心家 系作为研究对象,应用聚合酶链反应( p c r ) 和限制性片 段长度多态性分析方法,检测其5 - - h t t 基因启动子区 ( 5 h t t l p r ) 、第2 内含予 数目可变的顺向重复 ( v n t r ) 和37 端非编码区( 3 7 u t r g t ) 基因多态 性,并进行连锁不平衡( t d t ) 分析,得出5 一h t t 基因 在情感性精神障碍的遗传病因中可能起着一定作用的结 谢“1 。蔡军等验证了5 一羟色胺2 a 受体基因多态性与抑郁 症的关联m 3 。通过利用万方数据库、中国学术期刊全文 数据库、c b m d i s c 等检索工具进行检索也未得出专门研究 抑郁症相关基因数据库的文献。通过百度、g o o g l e 检索 网络信息也未发现专门研究抑郁症相关基因数据库的网 站信息。但国内目前已有高血压相关基因和蛋白质数据 库、心力衰竭相关基因和蛋白质数据库并提供网络使用 ( h t t p :c a r d i o b j m u e d u c n ) 。中国协和医科大学甘戈博 士利用生物信息学原理整理了精子发生相关基因数据, 3 0 第四军医大学硕七学位论史 并建立一套完整的有关精子发生相关基凶数据库“3 1 。 从国外情况看,除了在p u b m e d 、s w i s s p r o t 等基因 蛋白质数据库中可以枪索到与抑郁症相关的基因外,尚 无专门的抑郁症相关基因数据库,在一些文献数据库如: 美国生物学文摘( b i o l o g i c a la b s t r a c t s ,b a ) 、美国化学文 摘( c h e m i c a l a b s t r a c t s ,c a ) 、荷兰医学文摘( e x c e r p t a m e d i c a e m ) 等中可以检索到报道抑郁症相关基因的文 献,另外在精神医学或抑郁症研究网站上可以得到部分 抑郁症相关基因的信息( 见表1 ) 。 第网军医大学 0 i fl 学位论丈 表1 国外收录抑郁症信息的网站 名称链接地址 d e p r e s s i o n t o m h t t p :w w wd e p r e s s i o nc o m n i m h dr i v a n s d e p r e s s i o n d e p r e s s i o n a l l i a n c e h t t p :w w wn i m h n i hg o v p u b l i c a t d e p r e s s i o n ,c f m h t
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 高中语文 长恨歌(二)教学设计 新人教版选修《中国古代诗歌散文欣赏》
- 七年级地理下册 第六章活动课 认识欧洲教学设计 (新版)商务星球版
- 五年级信息技术下册 第十三课 身边的交通标志教学设计 龙教版
- 河北能悦新能源科技有限公司介绍企业发展分析报告模板
- 西师大版五年级下册分数的基本性质教案设计
- 人美版七年级下册11.旅行团的标志和旗帜教案
- 一年级道德与法治下册 第三单元 我有许多好朋友 第7课《谁的朋友多》教案4 教科版
- 学雷锋精神做时代青年 教案2023-2024学年高二下学期“雷锋精神”主题班会
- 2026职业技能鉴定-海洋石油-海洋石油技能鉴定吊车司机历年参考题库含答案详解
- 2026职业技能鉴定-人工智能训练师-人工智能训练师职业技能鉴定(中级)历年参考题库含答案详解
- 2025年上海师范大学辅导员笔试试题附答案
- 护理三基理论全书
- 上甘岭战役课件
- 2026年高考数学二轮复习专题06 三角函数的图象与性质(热点)(天津)(原卷版)
- 红领巾讲解员培训课件
- 团的纪律培训课件
- 大炮介绍教学课件
- 2025年工会经费使用情况自查报告
- 小学午睡应急预案(3篇)
- 村干部廉洁自律课件
- 第1章 建筑火灾概述
评论
0/150
提交评论