版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
生物信息学(中译本)
目录
译者序
编者序
1.因特网与生物学家
1.1因特网基础
1.2与因特网连接
1.3电子邮件
1.4文件传输协议
L5GOPHER
1.6万维网
参考文献
2.GenBank序歹ll数据库
2.1简介
2.2一级和二级数据库
2.3格式与内容:计算机与人
2.4数据库
2.5剖析GenBankFlatfile
2.6小结
参考文献
附录:数据库文件格式
附录2.1GenBank(DDBS)记录例子
附录2.2一个ASN.1记录例子
附录2.3一个EMBL记录例子
附录2.4一个GenBank浏览文件
3.结构数据库
3.1简介
3.2PDB:Brookhaven国家实斗佥室蛋白质数据库
3.3MMDB:NCBI的分子建模数据库
3.4结构文件格式
3.5结构信息显示
3.6数据库结构浏览器
参考文献
专题论文
4.应用GCG进行序列分析
4.1简介
4.2Wisconsin软件包
4.3Wisconsin使用的数据库
4.4SeqLab环境
4.5用操作和Wisconsin程序分析序列
4.6观察输出
4.7监视程序执行过程并解决问题
4.8给序歹ll力/注样并在SeqLabEditor中图形化显示注样
4.9在SeqLabEditor中保存序列
4.10在SeqLab中可以实现的分析实例
4.11弓|入非Wisconsin组件的程序扩展SeqLab
参考文献
附录
5.生物数据库的信息检索
5.1检索数据库条口:检索服务器(Retrieve服务器)
5.2集成信息检索:ENTREZ系统
5.3集成的信息访问:查询服务器
5.4NCBI之外的序列数据库
5.5医学数据库
参考文献
6.NCBI数据模型
6.1简介
6.2出版物
6.3SEQIDS:名称中包含了什么?
6.4BIOSEQ:生物序列
6.5BIOSEQSETS:序列集合
6.6Seq-annot:序列的注释属性
6.7SEQ-DESCR:序列的描述
6.8模型的使用
6.9结论
参考文献
7.序列比对和数据库搜索
7.1引言
7.2序列比对的进化基础
7.3蛋白质的模块性质
7.4最佳比对方法
7.5取代分和空位处罚
7.6比对的统计学显著性
7.7数据库中的相似性搜索
7.8FASTA
7.9BLAST
7.10低复杂度区域
7.11重复元件
7.12小结
参考文献
8.多序列比对的实际应用
8.1渐进比对方法
8.2模体和样式
8.3演示方法
参考文献
9.系统发育分析
9.1系统发育模型的组成
9.2系统发育数据分析:比对,建立取代模型,建立进化树
以及进化树评估
9.3建立数据模型(比对)
9.4决定取代模型
9.5建树方法
9.6进化树搜索
9.7确定树根
9.8评估进化树和数据
9.9系统发育软件
9.10一些简单的实际的考虑
9.11第九章所涉及到的因特网资源:
致谢
参考文献
10.利用核酸序列的预测方法
10.1框架
10.2遮蔽重复序列
10.3数据库搜索
10.4密码子偏好的检测
10.5探查DNA中的功能性位点
10.6复合的基因语法分析
10.7搜寻tRNA基因
10.8未来的展望
参考文献
11.利用蛋白质序列的预测方法
1L1基于组成的蛋白质辨识
11.2基于序列的物理性质
1L3二级结构和折叠类
11.4特殊结构或结构特征
11.5三级结构
参考文献
12.鼠类和人类公用物理图谱数据库的使用
12.1物理图谱的类型
12.2大型公用数据库中的基因组范围图谱
12.3个体来源的基因组范围图谱
②恃定人类染色体图谱
12.5鼠类图谱来源
参考文献
13.ACEDB一个基因组信息的数据库
13.1ACEDB的•般特点
13.2ACEDB中的序列分析
13.3多种分析功能
14.提交DNA序列到数据库
14.1提交到哪儿?
14.2提交什么内容?
14.3如何提交到互联网
14.4如何用Sequin提交
14.5EST/STS/GSS
14.6基因组中心
14.7更新
14.8结论性的评价
参考文献
附录1词汇表
译者序
随着人类基因组计划的实施,通过基因组测序,蛋白质序列测定结构解
析等实验,分子生物学家提供了大量的有关生物分子的原始数据,需要
利用现代计算技术对这些原始数据进行收集、整理、管理以便于检索使
用。而为了解释和理解这些数据,还需要对数据进行比对、分析,建立
计算模型,进行仿真、预测与验证,因而出现生物信息学,它的出现,
极大的促进了分子生物学的发展。
现在人类基因组计划接近完成,人们的注意力已从基因组测序转向对基
因组表达的分析,转向对蛋白质组结构与功能的预测。这也是生物信息
学面临的主要课题。人们注意到无论是基因的表达还是蛋白质的功能,
在很多情况下,都是多个基因、多种蛋白质相互作用的结果,要对它进
行分析与预测,必然涉及数学、物理、计算科学、系统科学、控制科学、
信息科学与生物学的综合应用,因而生物信息学是一门多学科交叉的学
科,它需要多个领域的专家通力合作,不仅如此,由于它涉及面是如此
广泛,而难度又是如此之大,它更需要全国、全世界的科学家的通力合
作。
近年来,由于国际互联网的迅速发展,为这种世界性的合作提供了网络
基础,从而大大地促进了世界上生物信息学家之间的交流,他们共享已
有的数据、资源,相互交流各自提出的分析方法,相互交流、共同协作
形成了生物信息学界的一股新风气。
人们已经意识到,生物信息学的发展将对我们了解生命,了解人类自身,
对于医药,保健,农业等都将起极大作用,因而生物信息学已引起世界
各国的高度重视,纷纷加大投入,发展十分迅速。同样的,生物信息学
在我国也正在兴起。生物信息学是门崭新的学科,目前国内已有大学招
收本科生班,硕士研究生和博士研究生都在日益增多的培养中,但国内
尚无一本完好的生物信息学的读本。99年美国国家人类基因组研究所和
国家生物技术信息中心的两位教授出版的这本生物信息学专著,是一本
难得的讲述生物信息学的好书,我们将其介绍给中国读者。我们期望通
过本书的翻译出版,对我国生物信息学的发展有所裨益。
本书有下列同志参加翻译工作,具体分工如下,第1,2章卢欣,第3
章蔡军,第4章闻芳,第5章胡驰峰,第6章李萍,第7、8、9章季新
来,第10、11章过涛,第12章廖心清,第13章罗霄,第14章李泽。
李衍达孙之荣
1999年11月
生
物
信
息
学
朝
样
就
邮
的
霜
幅
上一页下一页返回目录返回茶庄
编辑
AndreasD.
Baxevanis
GenomeTechnologyBranch
NationalHumanGenome
ResearchInstitute
NationalInstitutesofHealth
Bethesda,Maryland
B.F.Francis
Ouellette
NationalCenterfor
BiotechnologyInformation
NationalInstituteofHealth
Bethesda,Maryland
ADB将本书奉献给他的母亲Anastasia,并纪念他的父亲Demetrios,他们的智
慧和爱是守护他一生的力量。
BFFO以本书纪念AngelosKalogeropoulos,一位朋友和生物信息学科学家,他
的风采令人深深怀念。
序言
过去十年中,全世界的分子生物学家们所收集的原始信息不断激增。在不太久之
前,这些信息的分析整理工作只有不情愿的研究生去做,因为他们对摆弄试管比
敲击键盘更有兴趣,而现在有很多人已全身心地投入了这个领域。生物信息学正
处于新兴萌芽中,它可以不严格地定义为分子生物学和计算生物学的交叉,这个
领域中已经产生了大量重要的发现,并有希望揭示更多大自然的奥秘。对大多数
人而言,生物信息学的吸引力在于它是生物学中崭新和有待开垦的领域;而对其
他人,其吸引力蕴藏在简化论者对化学层次上的细节的热爱和系统遗传学家对了
解各物种体系之间内在关系的兴趣之中。
生物信息学的好处早已作为谈资得以广泛宣扬,它被宣称是能解决一切痼疾的仙
丹,或是肢解序列数据的强大工具,或简称之为搞科学一条迷人途径。而实际上,
生物信息学是在艰难而有意义工作中的•一种新的方法。这一领域中,研究方法大
多在不断变化并有待发展和完善,与当年生物化学的黄金年代并无不同,那时人
们选择各种能溶解和分析目标分子的手段,不象如今生化实验室中所用技术要成
熟和精巧得多。然而,在生物信息学被推向前进的竞赛中,一些人曾企图将其从
科学分支降级为购买了合适工具包就完成的功能。而维护了生物信息学在科学领
域中地位的正是学术用户群体本身,无论他们是在私立大学里还是在政府赞助的
研究中心里。生物信息学中已取得的卓越进展就蕴藏在从收集整理原始数据,到
开发更新更强的数据处理方法的工作之中,而且一切均处于信息和技术自由共享
的环境里。生物信息学群体的独特之处在于,在商业部门之外,其“团体精神”
比生物学中许多竞争性领域要开放得多。由此想法,本书试图能让那些想了解更
多序列分析方法的科学家跳进书中,来体验令人着迷的科学旅途。通过这本书,
我们希望读者能认识到这些方法的严格性,并且明白,与实验并无不同,控制器
的运转和弄清哪种方法能解决或不能解决何种问题,是至关重要的。总之,我们
鼓励读者不妨一试。
这里,我们要共同感谢许多同仁,若非他们的帮助本书就难以实现。首先要感谢
的是分别完成此书各章节的诸位作者。他们专业的见解与专家的观点,以及他们
在巨大时间压力下仍友善地配合,使我们感到与这些女士和先生们一同合作十分
愉快。
本书中极大部分内容均得益于在NIH的国家生物技术信息中心(NCBI)所开发的
工具和数据库,我们要感谢NCBI的全体成员,为他们辛勤的工作,也为了他们
耐心负责地维护着这些公共数据库,更重要的是为他们使这些数据库具有最高的
质量和更方便地被科学工作者们访问。那些从事计算生物学的科学家们一贯对他
们的成果十分慷慨,制作了自由访问的工具和专门数据库。否则,连最基本的序
列分析研究也是无法做到的。我们要感谢参与这些项目的所有成员,包括这里未
曾特别提及的,因为是他们造就了这个以序列为基础的新生物学时代的许多辉煌
成就。
我们还要感谢本书编辑AnnBoyle的耐心帮助、鼓励和支持。这本书也包含了我
们的很多第一次,因而在学习出书的里里外外过程中,我们与她建立起了深厚的
友谊。我们期待着未来能与她的再次合作。
以下来自BFF0:我要向一贯支持、热爱和信任我的妻子NancyRyder致谢。她
对这项工作的尊重,以及她给予了我这项工作所需的空间已超越了任何誓言,我
只有以更多的爱作为回报。我还要感谢MarkBoguski在四年前将我介绍至NCBI。
Mark还不断引导我留意各种新鲜有趣的项目,这种持续的热情和兴趣将不断赋
予我更多灵感。
以下来自ADB:我诚意地感激DavidLandsman的极大支持和鼓励。我与David
的交情已有多年,那时他作为一个物理化学家接受作博士后,而当时他对一门称
为生物信息学的领域几乎一无所知。我认为1992年的我们都无法猜到我们在教
学和研究中的合作会最后会导致一本专著的产生。如果不是他在如何认识计算生
物学的问题上,更加强调了生物学对我产生了强烈影响,就不会有这本书。
AndreasD.Baxevanis
B.F.FrancisOuellette
上一页卜一页返回目录返I可茶庄
第一章因特网与生物学家
随着研究者可用的序列与结构信息的爆炸式增长,生物信息学领域,或更精确地
说是计算生物学领域,在基础生物医疗问题的研究中起着越来越大的作用。计算
生物学家面临的挑战,尤其是由人类基因组计划以及其它测序工作生成的大量数
据带来的挑战,将对发现基因和设计分子模型、定点突变,以及其它有可能发现
基因与蛋白质的结构与功能的未知关系的实验有所帮助。
在开始实际讨论解决生物问题的计算方法之前,必须先明确一个共同的背景,从
而使用户可以访问和使用本书中讨论的算法和工具。我们首先回顾了因特网及其
有关术语,并讨论了四种主要的因特网协议族,但不深入涉及协议的技术细节。
关于这些协议的内部处理过程的详细描述可以参考(Falk,1994;Krol,1994),
这是给外行人看的好书。
因特网基础
尽管“因特网”听起来象一个单独的实体,但它实际上是一个网络的网络,由超
过20,000个分布在100多个国家中的相互连接的本地网或地区网构成。虽然有
关远程通讯的工作在六十年代初就已经开始,但因特网的真正起源还是1969年
美国国防部远景研究规划局(AdvancedResearchProjectsAgency,ARPA)的
网络研究计划ARPANET。ARPANET最初连接了美国西海岸的四个节点,其直接目
的是在实验室之间传输有关国防的研究信息。随后又开展了一系列的网络研究项
目,并在10年后达到了另一个里程碑式的阶段。1981年引入的BITNET(Because
It'sTime)在大学之间提供点对点的电子邮件和文件传输,1982年ARPA引入
了传输控制协议(TCP)以及因特网协议(IP),TCP/IP使得不同的网络可以连
接起来并进行通讯,从而形成了现在的系统。很多文献详细介绍了因特网的发展
历程和通讯协议,但大多数用户关心的只是因特网在工作,而非具体的工作原理。
当网络中的计算机连接在一起的时候,需要有一种方法来明确表示每一台计算
机,从而使消息和文件真正找到它们的接收者。为此,所有与因特网直接相连的
计算机都必须有一个IP地址,IP地址是唯一的,标识且只能标识一台计算机。
IP地址由四个以点号分隔的数字构成,如美国国立健康研究院(NIH)生物技术
信息中心(NCBI)的主文件服务器的IP地址是130.14.25.1。从左到右这些数
字表示的是:主域(130.14表示NIH)、子网(.25表示NIH的国家药物实验室),
以及这台计算机(.1)。虽然采用数字式的IP地址可以帮助计算机定位数据,
但用户记忆起来却非常困难,所以IP地址通常都有相对应的正式域名(FQDN),
由域名服务器在后台将其动态翻译成IP地址。回到前面NCBI的例子,用户更愿
意用ncbi.nlm.nih.gov而不是130.14.25.1来访问NCBI的那台计算机。必须注
意的是,从左向右IP地址的定位范围由大到小,而FQDN的定位范围则由小到大。
因此,任意指定的计算机的名称都可以看成是具有如下的格式:计算机.域,其
中顶级域名(FQDN中最后一个点号后面的部分)分为六个大类(见表1.1)。在
美国之外的国家,顶级域名则是用两个字符表示的计算机所在国家(例如,.ca
表示加拿大,.uk表示联合王国)。
表1.1顶级域名
对因特网规模(即因特网的成功程度)的最具体度量,就是计算物理上接入因特网
的计算机的数量。网络Wizards通过运行一个探测器去尽可能地寻找主机,并把
探测结果返回到运行探测器的计算机上,从而定期地计算这些计算机(或主机)
的数量。主机数量的增长速度非常显著,大约每12个月增加一倍,目前主机总
数已经超过了12,000,000台。这一增长的绝大部分来自商业部门,例如万维网
等投资于日益大众化的新多媒体广告与通讯平台(图1.1)。由于可能有许多探
测器找不到的主机,这一统计数字的绝对数目不会很精确,它只适用于考察因特
网的发展趋势,以及和其它数据进行比较研究。例如:有许多计算机被设置在防
火墙后面,出于安全的考虑而阻止了公司内部与外部的通讯;其它一些计算机,
尤其是家用计算机,只通过调制解调器与因特网短暂相连。所以最好把网络
Wizard的搜索结果只看成是代表某一时刻因特网的最小规模。
与因特网连接
那些不能将他们的计算机通过以太网,lOBaseT或类似方式连接到因特网的用户
可以有两种主要的方式访问网络:在线服务(OnlineService)或因特网提供商
(InternetServiceProvider,ISP)。在线服务,例如美国在线(AOL)、CompuServe
以及Prodigy,提供了大量的交互式数字服务,包括信息提取、电子邮件
(E-mail)、公告牌,以及“聊天室”。在聊天室里同时上线的用户可以就任何
话题进行交流。虽然现在在线服务也可以访问万维网,但大多数在这一系统中提
供的信息服务依然是通过独占的、封闭的网络进行的。一旦在用户计算机和在线
服务器之间建立了连接,用户就可以不离开在线系统的主机而访问系统中特定的
信息资源。特定的内容可以包括从访问在线旅游预定系统到经常更新的大百科全
书,这些项目对于那些没有订购在线服务的用户是无法得到的。服务的内容随价
格而异,大多数这些服务都是按小时记费,即使正常的使用也可能会积累很高的
费用。
因特网提供商采用相反的方式。ISP注重的不是提供内容,而是提供给用户必要
的工具以发送和接收邮件,上载和下载文件,以及浏览万维网,发现远程的信息。
尽管象AT&T和MCI这样的大公司占据了ISP的主要角色,但不要求提供内容导
致了家庭手工业式企业的快速发展,许多小的本地公司也提供与因特网的可靠连
接,位于马里兰州巴尔的摩郊外的ClarkNet就是其中之一。从一个500英亩农
场的谷仓中的一组调制解调器开始,ClarkNet现在无论从规模还是服务质量上
都已发展成为了这个国家最好的地区服务提供商之一。ISP的最大优势在于连接
速度,通常小的提供商可以提供比在线服务还快的连接速度。一般ISP按月收费,
可以无限使用。
现在在线服务与ISP之间的界限已经逐渐模糊,并向在线服务倾斜。A0L最近更
改了其收费策略,变为按月而不是按小时收费。使得用户花费和大多数ISP相等
的开销,就可以得到全部A0L的专有内容,以及通过ISP所能得到的全部因特网
工具。在美国的大多数州,A0L网络的密集程度已经使得访问A0L变得象打本机
电话一样方便,用户无论在哪里都可以方便地访问电子邮件,这是本地小ISP
不能比拟的。象这样的发展趋势,加上本地电话和电缆公司也开始通过新的高速
光纤网提供访问因特网的服务,使得将来终端用户访问因特网将越来越便宜,而
.且性能将越来越好。
电子邮件
许多用户是通过使用电子邮件(E-mail)认识因特网的。电子邮件是一个方便快
捷的发送、接收及回复消息的媒介,在许多地方实际上已成为不可或缺的工具。
它的优势主要有:
・比邮政服务快得多。
・传送消息比传统电话或面对面交谈要更为清晰明确。
•接收者可以有很大的自由度来决定是马上回复、过•会回复还是根本不回复,从而
更好地控制自」的工作流程。
・提供了一种方便的整理、保存消息的途径。
・发送电子邮件的成本很低,或根本不需花费。
虽然这些优势已经使得电子邮件成为了工业界和科学界一种十分重要的个人通
讯手段,但用户也必须清楚它的两个主要缺点。第一是安全性问题。邮件在传递
到接收者的过程中,可能经过一系列远程节点,在其中任何一处邮件都可能被有
较高权限的人(例如系统管理员)所截取和阅读。第二是保密问题。在工业界中,
电子邮件通常被认为是只用于办公室通讯的公司财产,因此就必须在管理者的监
控之下。而在学院、准学院及研究领域则相反。例如,NIH鼓励个人在公布的准
则范围内使用电子邮件,这里的关键是“公布的准则”。无论在什么情况下,电
子邮件系统的用户都应该了解本机构的电子邮件使用规则,从而正确有效地使用
这一工具。我们强烈推荐一本关于如何有效使用电子邮件的杰出指南。(Lamband
Peek,1995)
发送电子邮件
电子邮件地址的格式一般为:用户@计算机.域。其中“用户”是个人用户名,''计
算机•域”指向电子邮件帐号所在的计算机。和普通邮件一样,电子邮件消息包
括“信封”(或称为“信头”)和“正文”。信头的内容包括:收发信人的地址、
电子邮件主题行、以及邮件如何从发信人到收信人的信息。信头下面是真正的消
息(或“正文”),如同普通信件信封里的内容一样。图1.2显示了一个电子邮
件消息的全部组成部分。
电子邮件程序千变万化,随使用平台以及用户的需求而不同。通常局域网的属性
决定了可以使用哪些邮件程序,而且这一决定往往是由系统管理员而非个人用户
做出的。最广泛使用的带有图形用户界面的电子邮件软件包有:用于Macintash
的Eudora和用于Mac、Windows和UNIX平台的MicrosoftExchange。基于文本
的电子邮件程序有Elm和Pine,这通常需要注册到UNIX帐号来使用。
新闻组
在图1.2的例子中,电子邮件被发给一个单独的收信人。电子邮件系统的一大优
点就是可以把一封电子邮件发给很多人。可以通过使用“别名”来实现这一目的。
用户可以在邮件程序中定义一组人,并给这个组一个名字(“别名”)。用户把
电子邮件发给这个别名后,邮件程序就会自动地把消息广播给组中的每个人,而
不是逐一发送。即使在小规模组中设立别名也可以节省大量时间。这样也可以保
证组中的每个人都能真正接收到发到组里的每一封信。
“新闻组”则是广播电子邮件消息的另一种方法。和“别名”方法不同的是,订
阅新闻组时电子邮件地址列表由远端计算机编排维护,就象杂志维护一份订阅者
名单一样。例如,BIOSCI新闻组是流通量最大的新闻组之一,提供了一个在相
当大的生物学主题范围内讨论和交换思想的论坛。要开始接收发表在BIOSCI的
自动测序讨论组的邮件,用户需要发送一个消息给
biosci-server@net.bio,net,并在正文中写上subscribeautoseq。新闻组中
的全部文章就会发送到新的订户手中,该用户就可以参与讨论了。用户想要退出
新闻组时,只需要给相同地址发送消息unsubscribeautoseq就可以了。要得到
包括的讨论组完整列表在内的BIOSCI的更多信息,给
biosci-server@net.bio.net发一封邮件,清空邮件主题行,并在消息正文中写
上infofaq。BIOSCI服务器会发送一份常见问题表作为回复,其内容包含了
BIOSCI管理下的每个新闻组的详细信息。
就象邮政信件一样,电子邮件中最近也有一股“垃圾邮件”的浪潮,这些邮件来
自某些公司出于商业宣传的目的而编排的大量邮件地址列表。大多数这样的列表
都是从联机注册或相似渠道得来的,所以避开这种邮件列表的最好办法就是有选
择地给出你的电子邮件地址。大多数新闻组的电子邮件地址是保密的,如果你有
疑问的话,不妨先询问一下。
电子邮件服务器
无论接收者是一个还是很多,到此为止的讨论仅限于发送消息。电子邮件还可以
用于从生物数据库中进行预测或读取记录。用户可以用电子邮件给远端的服务器
发送消息,以预先定义的格式说明希望进行的操作,服务器就会执行这些操作,
并将结果用电子邮件返回给用户。图L2显示的是电子邮件查询结果的示例,其
中服务器是NCBI的查询电子邮件服务器。虽然这种方式不是交互式的,但它将
硬件维护和软件升级的工作交给了维护服务器的管理员,使用户更专心于结果而
非程序本身。后面章节中将有一些电子邮件服务器的详细论述。日内瓦大学的
AmosBairoch维护着一个优秀的最新电子邮件服务器列表,此列表可以通过匿
名文件传输协议(下文介绍)的方式得到。具体做法是:访问expasy.hcuge.ch
站点,进入/database/info目录,下载文件serv_ema.txt。对于大多数这样的
服务器,给服务器的电子邮件地址发送一个help消息就可以得到服务器的详细
指令集,其中包括查询的正确格式。
文件传输协议
虽然电子邮件传送消息存在很多优点,有经验的用户在传输附加文件时都曾遇到
麻烦。问题在于仅仅将文件附加在邮件上并发送出去,并不意味着接收者能真正
得到、解码并使用这个文件。虽然已经开发了许多跨平台电子邮件软件(例如
MicrosoftExchange),但不同地点的人使用不同的电子邮件软件使得通过邮件
发送文件并非有效、安全的方法,至少在近期内如此。对此问题的解决方法之一
是使用文件传输协议(FTP)。FTP的使用十分简单,在用户计算机(客户)和
远端服务器之间建立起连接,并在整个FTP任务过程中保持连接。文件的传输速
度很快,大约每秒5~10千字节。这一速度随一天中的不同时一间、客户与服务器
之间的距离,以及网络流通量不同而有所变化。
为了建立FTP连接并传输文件,用户必须在远端服务器上有帐号。科研界免费提
供了许多文件和程序,访问这些文件并不要求拥有这些程序所在的机器上的帐
号,而是用一种称为匿名FTP的系统建立连接。在这个系统下,用户与远端服务
器连接时并不输入用户名/口令,而是在用户名中输入“anonymous”,在口令中
输入个人电子邮件地址。服务器系统管理员用这些电子邮件地址进行访问统计,
这可能会对那些提供文件和程序的人有所帮助。一个UNIX匿名FTP对话的例子
如图1.3所示。
虽然FTP实际上是在UNIX环境中产生的,但Macintosh和PC用户也可以用基于
图形用户界面(GUI)的程序浏览FTP服务器上的UNIX目录。用户不需要了解
UNIX指令就可以卜.载文件,他们可以从弹出式菜单上选取,或在UNIX文件结构
中用鼠标移动和点击选取要下载的文件。Fetch是Macintosh上最流行的FTP程
序,图1.4给出了Fetch窗口的一个例子,图中显示了基于图形用户界面的程序
和图1.3所示的UNIX下FTP的区别。AmosBairoch同样也维护了一份详细的分
子生物学FTP服务器的列表,此列表可以从expacy.houge.ch获得,具体方法为:
进入/database/info目录,下载serv_ftp.txt文件。
GOPHER
FTP用户进入一个特定的目录后,只能看到当前目录下的子目录和文件的名称。
要想真正看到文件的内容,用户必须把文件下载到本地计算机。为了节省时一间,
明尼苏达大学的研究者开发了一个系统,使得不必下载就能阅读文本文件。这一
程序按照学校的吉祥物被命名为Gopher,这也是分布式文档发送系统这一类特
殊的交互式客户-服务器程序的最早的实例之一。
Gopher很容易使用,它不要求用户知道所寻找信息的物理位置或地址。所有不
同Gopher站点存贮的信息都以一个固定的层次结构组织起来,用户用鼠标点击
就可以浏览这一切。同样用鼠标点击的方法用户还可以在互连的Gopher站点(称
作Gopherholes)中从一个站点转到另一个站点。Macintosh上的主要Gopher
浏览程序叫做TurboGopher,如图1.5所示。
万维网
尽管Gopher解决了很多信息传输的问题,但只能用于发布文本。Gopher还从概
念上启发了一个重要的思想,从而导致了下一代可以传送图象、声音以及影象的
文档传送系统的开发。欧洲原子能研究委员会1989年开始的研究提供了万维网
的基础,从此一种新的可以处理多种非文本材料的媒体诞生了。
漫游
和Gopher相比,在网页中漫游不需要用户知道有关所查找信息的详细地址。只
要单击特定的文本、按钮或图片就可以进行漫游,这些可点击的元素总称为超文
本链接。一旦点击了一个超文本链接,用户就会被带到其它的网点。与Gopher
不同的是,这个新的地点不一定是一个层次结构的上一个或下一个地点,超文本
链接可以将用户带到同一个网站的其它地方或世界另一边的网点。WEB上的每一
个文档称作一个网页,一个专门的服务器上的所有网页总称为一个网站。严格地
用超文本链接进行漫游也被称为WEB冲浪。
用户可以通过键入地址来更为直接的找到信息。WEB的一大特点就是:用户用来
浏览网页的程序(浏览器)也可以同样的用于访问Gopher和FTP站点,从而在
一定程度上避免了对专门的Gopher和FTP应用程序的需求。为此引入了一个统
-的命名规则,它不仅可以告诉浏览器远距离站点的位置,更为重要的是可以告
诉浏览器远距离站点信息的类型,使得浏览器可以正确显示。这种标准格式的地
址就称为统一资源定位器(简称URL),其一般格式为:协议:〃计算机.域。
其中协议表示站点的类型,计算机.域表示站点的位置(见表1.2)。网站URL
中的http代表超文本传输协议,是主机向客户传送网络文件的方法之一。
浏览器之战
浏览网页的浏览器是连接远距离站点的客户服务器应用程序,它从所连接的站点
中下载用户请求的信息,并显示在用户监视器上,然后断开连接。从远距离主机
上所获得的信息以一种与平台无关的格式存在,这种格式称为超文本标识语言
(简称HTML)。HTML代码是纯文本代码,文档中所有的图形和声音都以单独的、
通用的文件格式存在(例如:图形以GIF格式保存和传送,GIF是CompuServe
开发的用于快速有效地传送图形的格式)。正因为如此,浏览器才可以显示任何
类型(Macintosh、PC或UNIX)计算机上的所有网页。浏览器总是先显示网页的
文本内容,然后再显示正在下载的页面的其它内容。只要这些平台使用的是同一
个公司的浏览器,同样的网页就会以大体相同的模样显示,很少有例外。
“浏览器之战”的主角是网景公司的航海家(Navigator),目前占据了大约80%
的浏览器市场。网景是MarcAndreesen和其同事开发出来的,它是NCSATelnet
(第一个被广泛使用的网络浏览器)的派生产品。网景开发队伍中的大多数人来
自NCSA,他们在意识到开发WEB技术的重要商业意义之后离开了NCSA。通过多
年来让客户免费使用浏览器,只是依靠WEB服务器和其它产品赢利的战略,网景
获得了现有的市场占有率。现在网景还可以从其站点免费下载,但新版本只能免
费使用90天,而且用于教育机构时可以免费。网景有一些公认的缺点,例如笨
拙的书签系统、难以显示和定位采用框架结构的网页、经常性的停止或崩溃,但
是它已经可以满足大多数用户浏览页面的要求。
网景最主要的竞争对手来自微软公司,微软的浏览器产品IE(InternetExplorer)
正在挑战网景市场份额第一的地位。微软的战略是把IE作为免费的软件让用户
直接从其网站下载。IE在取代目前的A0L专利浏览器后也会获得一些份额。A0L
专利浏览器已经被公认为毫无是处、缺陷多多,A0L宁愿把IE给自己的用户,
也不愿意重新设计新的浏览器,这使得IE立即获得了一千万用户。另外,IE已
经和Windows95操作系统捆绑起来,微软进一步计划将IE集成到操作系统中去,
从而使得Windows95用户实际上将IE作为他们的桌面。相比网景,IE有一些主
要的优点:页面装入较快、浏览器更加稳定、处理多框架页面效果更好。随着这
两种浏览器版本的提高,用户将会发现两个程序中有很多相同的功能,最终的胜
负将取决于成本和个人的嗜好。
值得一提的是,尽管WEB被定义为视觉媒体,它同样可以在不传送相关图形的情
况下传送并显示文档。局限于行终端的用户可以使用Lynx浏览器(见表1.6)。
Lynx是堪萨斯大学开发的,它允许用户通过键盘上的箭头键高亮显示并选中超
级链接,用回车键来取代网景和IE中必须使用的鼠标。Lynx可以用于DOS和UNIX
两种平台。
因特网(Internet)和企业内部网(Intranet)
WEB通常被认为是一种与远方联系的渠道,其实同样的机制也可以用于同一机构
内部的相互联系,如:企业内部网。企业内部网利用WEB的简单界面,提供了一
个容易使用的相关信息库,还提供了另一个广播或机构内部秘密联系的途径。当
机构的成员离开到不同的建筑或城市时,企业内部网就非常有用了。企业内部网
是受保护的,非机构网络的用户禁止访问内部网页,另外使用口令保护也很常见。
查询信息
很多用户用老式方式在WEB上查询信息:按照单词的读音,使用如本书各章中的
参考文献似的列表,或使用网页中作者放置的超文本链接。即使是要寻找有明确
目标的信息,通过单击在页面之间跳转来寻找的方式也往往事倍功半。查询虚拟
图书馆可以解决这一问题,虚拟图书馆将网络资源按照不同的科目有组织地列
出。有关生物学的虚拟图书馆有:哈福大学KeithRobison维护的WWW虚拟图书
馆;衣阿华洲PedroCouninho编辑的Pedro's分子生物学研究工具;欧洲生物
信息学研究所的EBI生物目录,在本章结尾的列表中可以找到这些网站的URL。
用搜索引擎也可以直接查询WEB。搜索引擎是一种在网页内容目录数据库中执行
全文或关键字查询的专门程序,其查询结果是满足条件的超级链接网站列表,用
户可以访问列表中的任何一个站点。不同的搜索引擎在编辑数据库的方法上有些
细微区别,这些区别既表现在访问网站上,也表现在阅读网站的数据上。有些搜
索引擎只是将网页标题编成目录,而非网页全文;有些引擎将短语看作一个单词
来查找,而其它则只是将相邻的单词挑选出来。由于搜索引擎算法中的这些差异,
相同的查询请求用不同的搜索引擎返回的结果可能会有很大差别。从表1.3中可
以看出,同样是查询“genetic”,雅虎(Yahoo)的返回结果为1,而其它引擎
返回的结果都超过几千甚至达几万。另外表1.3中的数值很多都非常大,这也反
映了万维网的巨大规模。因此只有引擎将搜索结果按重要性分级(例如,单词出
现在标题中比在网页正文中更为重要),获得的查询结果才会真正有用。
为了实现这个功能,研究者开发出了新一类的搜索引擎变换引擎
(meta-searchengine)»变换引擎采用更为智能化的途径搜索网站,轮流用五
到十种传统的搜索引擎执行用户的请求,然后聚集查询结果,删除重复项,最后
返回给用户一个无重复的有注释列表。变换引擎的一大优点在于注重相关统计,
使得结果列表更简短(见表L3)。虽然列表变短了,但所包含的站点却更为直
接地反映了原查询要求。由于变换引擎必须轮流使用多个不同的搜索引擎,所需
要的执行时间就会更长,但是查询结果的较高可用性比多用的几分钟(有时候只
是几秒钟)查询时间更重要。可靠且容易使用的变换引擎有SavvySearch和
MetaCrawlero
减少返回结果的另一途径是减少查询集的大小,一些搜索引擎正是由于只覆盖某
-专门领域的网站而脱颖而出。本文写作时尚无生物学方面的专门引擎,(译者
注:现在已经有了一个生物学专业检索引擎,名为NEEH0W,是一个中国人自己
设计维护的专业检索引擎,URL:http:〃biology.neehow.org及
http://biology,neehow.)比较受欢迎的搜索引擎还有LookSmart,这是
《读者文摘》杂志的一项服务,它将该机构的浓缩诀窍应用在了网络上的相关领
域。
图1.1因特网上各域名主机数量的增长。因特网上主机的总数已经超过
12,000,000台,商业站点数量(.com)在1994年首次超过教育站点(.edu)□[Data
NetworkWizards{http://www.nw.corn)]
图1.2剖析一个电子邮件(e-mail)消息(各部分已经标示出来)。这是一个NCBI
帮助服务器对求助消息的自动答复。
图1.4用Fetch来下载一个文件。在Indiana大学的分子生物学FTP服务器(上
图)建立一个匿名FTP进程来下载ClustalW序列比对程序(下图)。注意基于
GUI的程序与图1.3所示UNIX下程序的区别。
图1.5用TurboGopher来阅读一个文本文件。窗口标题显示了寻找图中文件的
浏览路径,从Minnesota大学的"HomeGophern开始到JohnsHopkins大学的
Welch医学图书馆结束。这种浏览不需要知道所寻找的信息的地址或位置,搜索
在一系列层次结构的菜单中进行。
图1.6比较一个基于Web的图形用户界面浏览器(MicrosoftInternet
Explorer)和一个纯文本Web浏览器(Lynx)。两个浏览器都指向Stanford大
学的Sacc力aro加yces基因组数据库主页。
上一页下一页返回目录返回茶庄
第二章GenBank序列数据库
简介
一级蛋白质和核酸数据库在分子生物学界是如此的司空见惯,以致于我们很少会
去考虑这些普遍存在的工具是如何建立的。但是如果我们能够了解这些序列是如
何汇集到一起的,这将有助于我们加深对生物学的理解,并且能够更加充分地发
掘这些记录中蕴藏的信息。
GenBank是美国国立卫生研究院维护的基因序列数据库,汇集并注释了所有公开
的核酸以及蛋白质序列。每个记录代表了一个单独的、连续的、带有注释的DNA
或RNA片段。这些文件按类别分为几组:有些按照系统发生学划分,另外一些则
按照生成这些序列数据的技术方法划分。目前GenBank中所有的记录均来自于最
初作者向DNA序列数据库的直接提交。这些作者将序列数据作为论文的一部分来
发表,或将数据直接公开。GenBank由位于马里兰州Bethesda的美国国立卫生
研究院下属国立生物技术信息中心建立,与日本DNA数据库(DDBJ)以及欧洲生
物信息研究院的欧洲分子生物学实验室核甘酸数据库(EMBL)-起,都是国际核
甘酸序列数据库合作的成员。所有这三个中心都可以独立地接受数据提交,而三
个中心之间则逐日交换信息,并制作相同的充分详细的数据库向公众开放(虽然
格式上有细微的差别,并且所使用的信息系统也略有不同)。
这一章描述GenBank数据库是如何构成的,它如何与蛋白质数据库相衔接,以及
如何解释其中的数据成分。关于序列数据库,前人已经作了大量的工作,具体可
参见(Schuleretal.,1996;BairochandApweiIler,1997;Bensonetal.,
1997;Georgeetal.,1997;Stoesseretal.,1997;Tatenoetal.,1997)。
所有这些论文都指出了数据库快速增长的趋势,并对如何利用这些生物学资源提
出了建议。出于科学研究的考虑,以及由于历史的原因,序列数据被分别存放在
核甘酸和蛋白质数据库中。核甘酸序列是查询核甘酸数据库以及蛋白质数据库时
的主要出发点,并且目前有一种趋势,将核甘酸数据库介入到蛋白质数据库的管
理之中(正如我们下面将要看到的那样)。这并不奇怪,因为数据库维护者与数
据提交者之间的直接通讯将有利于保证数据的真实性与准确性(提交者需要一个
检索号,并且他们想要得到他们添加到数据库中的新记录)。在很多情况下,这
种对数据的关注意味着提供适当的信息来注释CDS(codingsequence:编码序
列),并告诉我们如何得到翻译产物。这种对蛋白质和核酸序列统一管理的倾向
也明显地体现在NCBI的Entrez之中,在GenBank的管理之中,以及在GenPept
格式记录的生成过程之中。在欧洲,EBI的工作人员统一维护管理Swiss-Prot
和TREMBL,这些工作人员也负责EMBL核甘酸数据库的管理工作。还有Amos
Bairoch和他在日内瓦大学的研究组。(见本章后的列表)。尽管如此,建立核
甘酸和蛋白质数据库的初衷还是有区别的。本章还初步讨论了将在第六章详细描
述的数据模型。这一章主要是从GenBankflatfile的角度介绍序列数据,但必
须明确的是,“flatfile"(不论是GenBank,EMBL,Swiss-Prot或PIR),都
只是ASN.1报告的一个方面。而ASN.1才是代表了NCBI数据模型的语言。GenBank
以DNA为核心,包含了许多计算生物学资源。
历史上,蛋白质数据库先于核甘酸数据库。在60年代初,Dayhoff和他的同事
们收集了所有当时已知的氨基酸序列,这就是“蛋白质序列与结构图册”(Dayhoff
etal.,1965)o这一蛋白质数据库后来成为PIR(Georgeetal.,1997)o
这本书为今天整个生物信息学界日常工作所依赖的计算生物学资源播下了种子。
这个在1965年可以很容易地存放在一张软盘上的数据集(尽管那时并不存在软
盘这种存储介质),是一小群人多年的工作成果。今天,任何一个DNA或蛋白质
数据库每天增加的数据量都数倍于此。最早的DNA序列数据库于1982年在欧洲
分子生物学实验室诞生,随即就开始了一个数据库爆炸的时代。(见图2.1)。
R.Cook-Deegan(1993)在《基因战争》中详细描述了这一时期人类基因组计划的
历史。此后不久因一项NIH与洛斯阿拉莫斯国家实验室的合同而诞生了GenBank。
两个中心都致力于发展输入方式,这主要是将学术刊物上公开发表的论文转换为
更适合计算机使用的电子格式。日本的DNA数据库(DDBJ),在几年后加入了数
据收集的合作。在1988年一次三方会议之后(现在称之为“国际DNA序列数据
库合作计划”)达成了一项协议,对数据库的记录采用共同的格式,并且每个数
据库只负责更新提交到这一数据库的那些数据。现在三个中心都收集直接提交的
数据,并在三者之间发布。这样,任何一个中心都拥有并发布所有的序列数据。
这种方式下每条记录只被生成这条记录的数据库所拥有,也就是说只有生成这条
记录的数据库可以对记录进行更新,这就防止了“更新冲突”。否则如果每个数
据库都可以修改任一条记录,并覆盖其他数据库的数据,就必定会发生错误。近
年来的安排保证了没有一个数据库可以覆盖其他数据库更新的记录。所有的序列
数据库也都是计算生物学中心,并且越发表明序列数据不能简单地由自动化方式
来生成。每个数据库都成为了一个中心,在那里生成序列数据,并由生物学家进
行验证,同时还开发一些利用这些信息的工具(例如NCBI的Entrez,见第5章,
以及EBI现在正在开发的SRS)。很明显的一点是一些专职的,介入到收集数据、
提供发现与检索工具,并且作为研究机构来研究新算法、发掘公共数据库并在最
高水平进行科学活动的机构将能够最大限度地服务于用户群体。在这一环境下,
知识被最高效率地获取与共享,并且新的研究与理解这样大量数据的方法也不断
涌现。
这一章的着重介绍GenBank核甘酸数据库,GenBank是包含了三个重要蛋白质数
据库(Swiss-Prot,PIR和PDB)的一系列数据库中的一个。这一系列数据库中
的每一个都对数据库现在和将来的使用方法产生了或产生过重大影响。PDB是关
于核酸和蛋白质结构的数据库,将在第三章中详细介绍。Swiss-Prot和PIR可
以称为二级数据库,它比已经存在于一级数据库中的数据提供了更多的信息。
Swiss-Prot和PIR中的蛋白质序列主要来源于核甘酸数据库,另外一小部分是
直接向Swiss-Prot提交的(这些蛋白质是直接测序的)或者是从公开发表的论
文中搜索到的。这里没有详细讨论这些情况,我们建议读者通过其他途径了解更
多的详情(BairochandApweiller,1997;Georgeetal.,1997)。
需要注意的是,如同在第六章和第十四章中一样,这里的“GenBank”指的是
DDBJ/EMBL/GenBank0DDBJ和EMBL核甘酸数据库与GenBank紧密合作,逐日交
换数据。他们从不同的地点,用不同的格式发布同样的信息。他们也都是提供其
他数据、工具和服务的研究机构。这些虽然从理论上是无关的活动,但实际上很
难分开。例如,Entrez(见第5章)是NCBI的一个计划,它包含了GenBank数
据在其中。但Entrez和GenBank(都是NCBI的产品)从本质上是不同的,前者
是一个信息检索系统,而后者是一个Entrez从中进行检索的数据库。
一级和二级数据库
一级和二级数据库之间存在着本质的差别。序列数据库对科学界最重要的贡献就
是这些序列本身。一级数据库记录了实验结果,以及一些初步的解释。而更进一
步分析工作的结论只能从二级数据库中查找到。一级数据库中的核甘酸序列记录
是从直接实验得到的,这些记录是对存在于某个实验室的试管中的生物分子测序
的结果。它们不代表共有序列(虽然是多次读取同一克隆,或相同的基因来源),
它们也不代表一些计算机生成的字符串。这在序列分析的解释中很重要,也意味
着在大多数情况下一个给定的序列就是研究者所需要的全部。每…个这样的DNA
或RNA序列都将被注释以描述对实验结果的分析,这一分析阐明了为什么这一序
列会被这样确定。
在DNA序列记录中的一种常见的注释是编码序列(CDS)。大多数蛋白质序列都
不是直接由实验确定的,而是通过DNA序列得到的。这在实验、计算以及相似性
比对工作中占有很大的比重。这并行于赋予一个产物名称,或者功能说明(通过
对相似性比对的分析)。这一方法很有效,但也有误导的可能。DNA,RNA和蛋
白质序列都是计算分析工作的对象,它们是一级数据库中有价值的成分。
那些在DNA序列记录的基础上进行计算、分析或其他工作的研究者通常认为他们
所处理的是原始信息。但是在很多情况下,氨基酸序列从某种程度上说是解释的
结果,而并非是直接测序得到的。这样,在使用和说明由这些序列得到的结果时
就需要格外小心。由mRNA序列数据推导出蛋白质序列通常并不难,但必须选择
正确的启始编码子。对于原核生物或低等真核生物序列的注释通常相对简单,但
研究者同样需要注意避免缺少注释或增加不必要的注释。(见第10章以及Cannon
etal.,1997)o将序列标记为CDS通常需要格外小心,因为这是蛋白质数据库
全自动或半自动生成的开始步骤。
格式与内容:计算机与人
数据库被用来存放原始数据,以及一系列附加的注释。不同的检索工具和程序利
用了这些信息中的不同部分。纵观各种格式,我们可以发现其中应用了一些共同
的规则,以使得多种情况下在不同格式之间生成和交换数据成为可能。最便于人
阅读的格式对计算机程序来讲很可能并非是最有效率的(例如GenBank
flatfile,见附录2.1和2.2,这是一种人可以阅读的ASN.1版本)。这些记录
还有二进代码版,更加紧凑,计算机处理也更快。但不幸的是,由于历史的原因,
对一种固定格式的频繁使用使得引入另一种格式极为困难,尽管新的格式可能更
加富含信息,更加准确,易于复制和计算,易于抽取信息,易于使用。(但我们
并未放弃尝试,见第3、6、14章)。GBFF的简单性,使我们都可以获得易用的
工具,这也是EMBL和GBFF极大通用性的重要原因。
作为最简单的格式,-个DNA序列可以表示为一个带有一些标记的核甘酸字符
串。这里是一个以FASTA(或Pearson格式)文件表示的核甘酸序列数据:
>L04459
或同样的,一个蛋白质记录:
>P31373
FASTA格式广泛应用于许多分子生物学软件包之中。作为最简单的情况(正如上
面所显示的),大于号(>)表示一个新文件的开始。标记符;上面第一
个例子开始部分的L04459后面是大写或小写字母的DNA序
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 注册造价师试题和答案分享
- 自然资源领域遴选试题及详细答案
- 农民工培训工作总结
- 木板重叠问题专项试题及答案分享
- ps教程试题及答案
- 乐理试题及答案
- 音乐职高试题及答案
- 勤工助学面试问答题目及答案
- 2025-2026学年齐齐哈尔市依安县数学三年级第二学期期末教学质量检测试题(含答案解析)
- 建筑法典型试题与答案呈现
- 电工四级练习题库(含参考答案)
- 牛结节病的症状和治疗方法
- 企业违反纪律检讨书范文(8篇)
- 《非遗手工技艺(拓印)》课件-第一章 拓片的由来和历史
- 工程量清单及招标控制价编制服务采购实施方案
- (高清版)JTGT 5440-2018 公路隧道加固技术规范
- (正式版)QBT 2821-2024 金属晾衣架
- 施工方案设计的经济性与可行性分析
- 汽车钢管激光打标自动化产线课件
- 国际红十字运动的基本知识
- 中药注射剂合理应用手册
评论
0/150
提交评论