讲核苷酸数据库文档_第1页
讲核苷酸数据库文档_第2页
讲核苷酸数据库文档_第3页
讲核苷酸数据库文档_第4页
讲核苷酸数据库文档_第5页
已阅读5页,还剩111页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

讲核苷酸数据库你选择的基因是___。为什么选它?请查找该基因的核苷酸序列?找到几条与该基因同源的核苷酸序列。

生物信息学数据库内容提纲生物信息学数据库基础知识核苷酸算数据库如何读懂核苷酸数据库中的数据:生物信息数据存储格式如何找到同源序列:生物信息数据库的相似性搜索核苷酸序列的提交数据库(Database)用于收集、整理、储存、加工、发布和检索数据的系统生物类的数据库种类很多(序列、结构、生物分子互作、其他)投稿文章首先要将核苷酸序列或蛋白质序列提交到相应的数据库中一个数据库记录(entry)一般由两部分组成:原始序列数据(sequencedata)+描述这些数据生物学信息的注释(annotation)。注释中包含的信息与相应的序列数据同样重要和有应用价值。

(1)时间性新的数据可以及时在互联网获取(2)注释对每个序列有一致的、详细的说明信息

(3)支撑数据相关的研究背景,原始数据,文献支持(4)数据质量数据库管理者对数据质量进行核查(5)集成性三种基本数据(核酸、蛋白、蛋白结构)的集成。有效提高研究者的研究效率生物信息数据库的特征分子生物数据库的分类一级数据库:数据直接来源于实验获得的原始数据,只经过简单的归类整理和注释。包含:二级数据库:对原始生物分子数据进行整理、分类的结果,是在一级数据库、实验数据和理论分析的基础上针对特定的应用目标而建立的。包含:种类繁多:真核生物启动子序列库EPD;功能模体(motif)数据库PROSITE数据库名称数据来源核酸序列数据库直接来源于实验数据蛋白质序列数据库主要是非实验来源数据结构数据库X射线衍射和核磁共振生物信息学数据库工具染色体核酸蛋白质基因组图谱DNA序列蛋白质序列蛋白质结构基因组数据库核酸序列数据库蛋白质序列数据库蛋白质结构数据库二级数据库复合数据库基因组作图序列测定结构测定生物信息数据库构建流程序列数据库主要核酸序列数据库:GenBank、EMBL、DDBJ主要蛋白质序列数据库:Swissprot,PIR核酸序列数据库世界三大核酸序列数据库

GenBank:美国国家生物技术信息中心(NationalCenterforBiotechnologyInformation,NCBI)

/Web/Genbank/index.html

ENA(EuropeanNucleotideArchive):

欧洲分子生物学实验室http://www.embl-heidelberg.de

DDBJ(DNADataBankofJapan):

日本遗传研究所

(NationalInstituteofGenetics,NIG,1984)http://www.ddbj.nig.ac.jp/国际核苷酸数据库网络(InternationalNucleotideSequenceDatabaseCollaboration,INSDC)1988年3个数据库达成协议,组成合作联合体。它们每天交换信息,并对数据库DNA序列记录的统一标准达成一致。每个机构负责收集来自不同地理分布的数据(EMBL负责欧洲,GenBank负责美洲,DDBJ负责亚洲等),将所有信息汇总在一起,共同享有并向世界开放,故这3个数据库又被称国际核苷酸数据库网络。美国国立卫生研究院(NationalInstitutesofHealth,NIH)Bethesda,MD131988,美国马里兰州的贝塞斯达美国国家生物技术信息中心(NationalCenterforBiotechnologyInformation,NCBI)建立了公共数据库:GenBank,人类基因组开展计算生物学研究研发用于序列分析的软件工具:BLAST,Entrez,免费MEDLINE(PubMed)NCBI数据库基础数据库(一级)

由实验人员原始提交和修订,数据库技术人员组织但不增添任何附加信息

例如:GenBank,SNP,GEO,PubChemSubstance派生数据库(二级)

由专业人员或第三方管理、编辑和修订数据

例如:NCBIRefSeq,UniGene,TPA,RefSNP,Protein,Structure,ConservedDomain,PubChemCompound

15

1979年开始建设,1982年正式运行美国国家生物信息中心负责维护GenBank数据库的数据来源有三种:直接来源于测序工作者提交的序列与其它数据机构协作交换的数据美国专利局提供的专利数据GenBank数据库

GenBank分类码与GenBank子库GenBank分类码:由三个字母组成,分类码将GenBank数据库分为17个分支1980年开始建设,1982年正式运行欧洲主要的核酸序列收集单位欧洲分子生物学实验室(EuropeanMolecularBiologyLaboratory,EMBL,1974,德国海德堡)的欧洲生物信息研究所(EuropeanBioinformaticsInstitute)负责维护EMBL数据库

EMBL数据库的数据来源有三种:直接来源于测序工作者提交的序列(Sanger测序中心)与其它数据机构协作交换的数据欧洲专利局提供的专利数据ENA,EuropeanNucleotideArchive

ENA由原EMBL-Bank核酸序列数据库基础上发展起来,是欧洲最重要的核酸序列资源.ENA数据统计ENA数据统计日本1984年开始建立,并于1987年正式服务。亚洲唯一的核酸序列数据库生物信息学中心和日本国家遗传研究所的DNA数据库共同组建。

DDBJ数据库

DDBJ数据库的数据来源有二种:90%直接来源于日本研究者提交的序列与其它数据机构协作交换的数据生物信息的存贮格式FASTA格式又称Pearson格式:将一个DNA或者蛋白质序列表示为一个带有一些标记的核苷酸或氨基酸字符串。最常用、最简单的序列注释格式只存储了最少量的信息它将所存储的信息转化为简单的字符串人和计算机对其存储的信息都具有极大的可读性FASTA格式广泛应用于许多分子生物学软件包之中FASTA格式规则

1、以大于号“>"起始2、标题行(asingle-linedescription)位于文件的第一行。3、序列行随后,序列行中不允许有空间,每行文字不超过80个字符4、组成序列信息字符串的符号应为IUPAC(国际纯化学和应用联合会,InternationalUnionOfPureAndAppliedChemistry)核苷酸或氨基酸的符号5、核苷酸字符大小写均可,氨基酸字符应大写6、"-"单个连字符表示一个空位“gap”7、序列中不允许有数字、不明确的核苷酸用N表示,氨基酸用X表示8、氨基酸序列中“*”表示终止9、常保存为.TXT文档IUPAC碱基代码表

IUPAC氨基酸代码表

FASTA文件格式示例FASTA格式示例错误FASTA格式示例正确数据库中FASTA格式序列命名标题行相关部分用“|”分隔;命名的顺序:gi号|Accesionnumber|相对应的英文名称,“[]”相应物种的拉丁文名称GenoInfoIdentifier的简写,指的序列标识号。序列的任何改变都会被分配一个新的GI号;一条核苷酸序列翻译成蛋白质序列,也会分配一个新的GI号

giGBFF:GenBankflatfileGenBank纯文本文件格式(GenBankflatfile,DBFF)GBFF是GenBank数据库的基本信息单位是最广泛地用以表示生物序列的格式之一三大数据库交换数据采用的格式:是从GenBank到DDBJ和EMBL数据库,以及EMBL、DDBJ之间或向其他数据库交换数据时所采用的格式DDBJflatfile格式与GBFF格式是相同的EMBL格式则每行都带有前缀,以表明本行的信息类型,在内容上与其他数据库相同所有这些格式实际上都是由更结构化的ASN.1生成的,但是主要由于历史的原因,许多用户(专家或非专家)在工作中使用GBFF(或EMBLflatfile格式)

GBFF的格式第一部分:描述符(头)包含了关于整个记录的信息第二部分:特征表(中)包含了注释这一记录的特性第三部分:核酸序列本身(尾)在最后一行以“//”结尾。LOCUSSCU498455028bpDNAlinearPLN21-JUN-1999DEFINITIONSaccharomycescerevisiaeTCP1-betagene,partialcds;andAxl2p(AXL2)andRev7p(REV7)genes,completecds.ACCESSIONU49845VERSIONU49845.1GI:1293613KEYWORDS.SOURCESaccharomycescerevisiae(baker'syeast)ORGANISMSaccharomycescerevisiae

Eukaryota;Fungi;Ascomycota;Saccharomycotina;Saccharomycetes;Saccharomycetales;Saccharomycetaceae;Saccharomyces.REFERENCE1(bases1to5028)AUTHORSTorpey,L.E.,Gibbs,P.E.,Nelson,J.andLawrence,C.W.TITLECloningandsequenceofREV7,agenewhosefunctionisrequiredforDNAdamage-inducedmutagenesisinSaccharomycescerevisiaeJOURNALYeast10(11),1503-1509(1994)PUBMED7871890

......FEATURESLocation/Qualifiers

CDS<1..206/codon_start=3/product="TCP1-beta"/protein_id="AAA98665.1"/db_xref="GI:1293614"/translation="SSIYNGISTSGLDLNNGTIADMRQLGIVESYKLKRAVVSSASEAAEVLLRVDNIIRARPRTANRQHM"

gene687..3158/gene="AXL2"......ORIGIN1gatcctccatatacaacggtatctccacctcaggtttagatctcaacaacggaaccattg61ccgacatgagacagttaggtatcgtcgagagttacaagctaaaacgagcagtagtcagct......4981tgccatgactcagattctaattttaagctattcaatttctctttgatc//描述符(包含整个记录的信息)

特征表(注释这一纪录的信息)序列信息LOCUSSCU498455028bpDNAlinearPLN21-JUN-1999DEFINITIONSaccharomycescerevisiaeTCP1-betagene,partialcds;andAxl2p(AXL2)andRev7p(REV7)genes,completecds.ACCESSIONU49845VERSIONU49845.1GI:1293613KEYWORDS.SOURCESaccharomycescerevisiae(baker'syeast)ORGANISMSaccharomycescerevisiae

Eukaryota;Fungi;Ascomycota;Saccharomycotina;Saccharomycetes;Saccharomycetales;Saccharomycetaceae;Saccharomyces.REFERENCE1(bases1to5028)AUTHORSTorpey,L.E.,Gibbs,P.E.,Nelson,J.andLawrence,C.W.TITLECloningandsequenceofREV7,agenewhosefunctionisrequiredforDNAdamage-inducedmutagenesisinSaccharomycescerevisiaeJOURNALYeast10(11),1503-1509(1994)PUBMED7871890

..........................FEATURESLocation/Qualifiers

CDS<1..206/codon_start=3/product="TCP1-beta"/protein_id="AAA98665.1"/db_xref="GI:1293614"/translation="SSIYNGISTSGLDLNNGTIADMRQLGIVESYKLKRAVVSSASEAAEVLLRVDNIIRARPRTANRQHM"

gene687..3158/gene="AXL2"........................................ORIGIN1gatcctccatatacaacggtatctccacctcaggtttagatctcaacaacggaaccattg61ccgacatgagacagttaggtatcgtcgagagttacaagctaaaacgagcagtagtcagct4981tgccatgactcagattctaattttaagctattcaatttctctttgatc//GBFF格式头部:基因座GBFF格式头部:定义行accessionACCESSION(编号,检索号):是序列记录的唯一指针,具有唯一性和永久性,在文献中引用这个序列时,应该以此编号为准。通常由一个字母加5个数字(U12345)或者由两个字母加6个数字(AF123456)组成。检索号在数据库中是唯一而且不变的,即使数据的提交者改变数据的内容。在ACCESSION行中可能出现多个检索号,可能是因为数据提交者提交了一条与原记录相关的新记录,或者新提交的记录覆盖了原有的旧记录。第一个检索号为主检索号,而其余的统称为二级检索号。GBFF格式头部:检索号GBFF格式头部:版本号GBFF格式头部:关键词GBFF格式头部:来源行GBFF格式头部:参考文献GBFF格式中部:序列特征表按表单的方式设计的,包含三个部分:第一,特性关键词(Featurekey);第二,特性位置(Location);第三,限定词(Qualifiers)。GBFF格式中部:序列特征表格式第一,特性关键词(Featurekey),是一个简要说明功能组的关键词,允许加入新的或未定义的特性;第二,特性位置(Location),指明在特性表中的什么地方找到相关特性,在位置特性中可以包含操作符(Operator)和功能性描述符(Descriptor)以指明序列需经过怎样的处理才能得到相应的特性;第三,限定词(Qualifiers),相关特性的辅助信息,限定词使用一组标准化的对照词汇表以利于计算机从中提取信息。GBFF格式中部:序列特征表格式GBFF格式中部:序列特征表:特性表关键词CDS指的是编码区序列(Codingsequence)

序列功能区域的表示方法:1.确定的功能区,直接写作n........m2.<表示partialonthe5'end3.>表示partialonthe3'end

CDS特性位置(Location):用来描述在序列中的什么区域能够找到相关的特性,位置特性可以包含Complement、Join、Order等三个操作符(Operator)。467指明序列中的单个碱基340..565指明包括起始和中止碱基在内的一段连续序列<345..500指明序列起始于起始碱基号之前的某个位置,但起始碱基号之前的特性边界未知GBFF格式中部:序列特征表:特性位置<1..888指明特性起始于第一个已测序的碱基之前(102.110)指明正确位置未知,但包含在102和110号碱基之间(23.45)..600指明序列特性起始碱基在23和45碱基之间,终止于600号碱基(122.133)..(204.221)指明序列特性起始于122和133碱基之间,终止于204和221号碱基之间123^124指明123和124号碱基之间的位点,如限制性酶切位点145^177指明145和177碱基之间的某个位点GBFF格式中部:序列特征表:特性位置join(12..78,134..202)12至78碱基及134至202碱基之间序列相应连以构成一段连续序列complement(join(2691..4571,4918..5163))纪录中的特性处于2691至4571碱基以及4918至5163碱基之间的序列相连构成的连续序列的互补链上join(complement(4918..5163),complement(2691..4571))将4918至5163碱基之间序列的互补链与2691至4571间序列的互补链结合以构成一段连续序列GBFF格式中部:序列特征表:特性位置限定词(Qualifier):为进一步说明特性表关键词和特性位置提供的信息给出了一个通用机制。格式:在“/”后跟上限定词名称,加上“=”,其后是限定词的值

次黄嘌呤磷酸核糖转移酶/product="hypoxanthinephosphoribosyltransferase"GBFF格式中部:序列特征表:限定词常见的特性表关键词所使用的限定词

限定词含义限定词含义/allele=给定基因的等位基因/anticodon=tRNA反义密码子的位置及它所编码的氨基酸/bound_moiety=嵌合范围/cell_line=获得序列的细胞系/cell_type=获得序列的细胞类型/chromosome=获得序列的染色体/citation=已被引用的参考文献数/clone=获得序列的克隆子/clone_lib=获得序列的克隆文库/codon=指出与参考密码子不同的密码子/codon_start=相对于序列第一个碱基,编码序列密码子的偏移量/cons_splice=区分内含子剪切位点和“5'-GT.AG-3'”剪切位点/country=DNA样本的来源国/cultivar=所获序列植物的栽培变种/db_xref=其它数据库信息的交叉索引号/dev_stage=序列来源于某种生物的特定发育阶段/direction=DNA复制方向/EC_number=序列产物的酶学编号/environmental_sample=序列直接从环境材料中获得而没有指明来源物种/evidence=序列特性来源于实验还是推理/exception=指明DNA序列未按通常的生物学规律翻译,如RNA编辑/focus指出在纪录中的来源特性在其它物种中还有不同的来源特性/frequency=在种群中发生变异的频率/function=序列所代表的功能/germline如果序列是DNA并来源于免疫球蛋白家族,则表示该序列来源于未重排DNA/haplotype=序列来源于某种物种的单倍体/insertion_seq=序列来源于某种插入元件/isolation_source=描述序列来源物种的生理、环境和地理信息/isolate=序列来源的生物个体/label=序列特性的俗名常见的特性表关键词所使用的限定词(续)

/lab_host=为扩增序列来源物种所用的实验室宿主/map=相关特性在基因图谱上的位置/macronuclear指明DNA来源于染色体分化的大核期/mod_base=被修饰碱基的简写/note=评论及附加信息/number=从5’→3’注明遗传元件的顺序/organelle=获得序列的细胞器/organism=提供测序用遗传物质的物种的科学名称/PCR_conditions=描述PCR的反应条件/phenotype=序列特性所导致的表型/pop_variant=获得序列的群体变异种名称/plasmid=获得序列的质粒名称/product=序列编码产物的名称/protein_id=蛋白质的检索号/proviral整合在基因组中的前病毒/pseudo假基因/rearranged如果序列是DNA并来源于免疫球蛋白家族,则表示该序列来源于重排DNA/replace=表明特性间的间隔序列已被替换/rpt_family=重复序列/rpt_type=重复序列的组织方式/rpt_unit=指明重复区域的重复元件构成/sequenced_mol=获得序列的分子类型/serotype=同一物种的不同血清学特征/serovar=同一原核生物的血清学特征/sex=获得序列的物种性别/specific_host=获得序列的天然宿主/specimen_voucher=指明来源物种保存于什么地方/standard_name=特性的通用名称/strain=获得序列的菌株/sub_clone=获得序列的亚克隆/sub_species=获得序列的来源物种的亚种/sub_strain=获得序列的来源微生物亚种/tissue_lib=获得序列组织库/tissue_type=获得序列组织类型/transgenic指明物种的来源特性是否是转基因受体/translation=按通用或指定的密码子表翻译的氨基酸序列/transl_except=标明序列中未按指定密码子表翻译的氨基酸的位置/transl_table=描述在翻译中与通用密码表不同的密码表/transposon=转座子/usedin=表明该特性在其它检索中也被使用/variety=获得序列的生物变种/virion病毒颗粒GBFF:FEATURES例1KeyLocation/QualifiersCDS23..400/product="alcoholdehydrogenase"/gene="adhI"特性表含义:该编码序列(CDS)起始于第23碱基,终止于第400碱基产物是乙醇脱氢酶基因名称是“adhI”。GBFF:FEATURES例2KeyLocation/QualifiersCDSjoin(544..589,688..1032)/product="T-cellreceptorbeta-chain“特性表含义:它表示记录中所存储的序列为部分编码序列,表达产物“T-细胞受体beta链”由序列内两个片段结合生成指明两个片段在序列中所处的位置。GBFF格式尾部GBFF格式尾部NCBI参考序列计划NCBI参考序列计划提供了校正的序列数据和相关的信息,给同行提供使用的标准。GenBank是一个序列的存储池,RefSeq数据库将是一个参考序列的非冗余集合,包括构建的基因组、mRNA、蛋白和在未来整个染色体。RefSeq记录是有三种可以获得的状态:预测的,临时的和检查过的。检查过的记录代表了我们目前关于一个基因和它的转录子的知识的汇编。EMBLFormat与GBFF类似仅字符的标识符是两个字的简写EMBL:酵母菌TCB1-β生物信息数据库的相似性搜索生物序列的相似性相似性(similarity):

是指一种很直接的数量关系,比如部分相同或相似的百分比或其它一些合适的度量。比如说,A序列和B序列的相似性是80%,或者4/5。这是个量化的关系。当然可进行自身局部比较。同源性(homology):指从一些数据中推断出的两个基因或蛋白质序列具而共同祖先的结论,属于质的判断。就是说A和B的关系上,只有是同源序列,或者非同源序列两种关系。而说A和B的同源性为80%都是不科学的。生物序列的同源性相似性和同源性关系序列的相似性和序列的同源性有一定的关系,一般来说序列间的相似性越高的话,它们是同源序列的可能性就更高,所以经常可以通过序列的相似性来推测序列是否同源。正因为存在这样的关系,很多时候对序列的相似性和同源性就没有做很明显的区分,造成经常等价混用两个名词。所以有出现A序列和B序列的同源性为80%一说。序列相似性比较和同源性分析序列相似性分析:

就是用来计算待研究序列与某序列之间的相似性程度,常用的软件包有BLAST、FASTA等;序列同源性分析:

是将待研究与来自不同物种的序列中进行进化分析,以确定该序列与其它序列间的亲源关系。常用的程序包有Phylip及Mega。全局比对与局部比对全局比对:寻找序列在全长范围内最佳比对局部比对:寻找序列在局部区域的最高比对打分局部比对往往比整体比对对这些功能区段具有更高的灵敏度,因此其结果更具生物学意义

BLASTBLAST是“局部相似性基本查询工具”(BasicLocalAlignmentSearchTool)的缩写。BLAST是由美国国立生物技术信息中心(NCBI)开发的一个基于序列相似性的数据库搜索程序。BLAST能告诉我们什么?可以获取以下一些信息:1.查询序列可能具有某种功能2.查询序列可能是来源于某个物种3.查询序列可能是某种功能基因的同源基因4.未知新序列的鉴定BLAST的基本步骤滤去低复杂度区域将待检索序列分割成长度为w的连续子串快速找出数据库中所有与固定长度w完全配对的位置以此位置为起点进行延伸比对,并计算出最高分数(Score)将最高分标准化,并按此分数进行排序换算成期望值(E-VALUE)显示出符合Score及E-value的序列低复杂度区域(LowComplexityRegion,LCR)

(LowComplexityRegion,LCR)低复杂度区域,即这些区域的组成有某些偏好,比如DNA中的简单重复序列。在蛋白质中一些残基过多表现。在进行BLAST比较时,将会把LCRs屏蔽掉,防止它们过高评价匹配的显著性。在核酸中用n,在蛋白质中用X代替。主要包括一些基因序列的固定结构,如:PolyA尾;

Alu序列;

分值(Score):是衡量查询序列同命中序列间相似性的测度。分值越高,命中序列与查询序列越相似。E值:又称期望值。是随机产生一个比所得分值高的对位排列的概率,即分值可靠性的测度。E值越小,所命中序列越可靠。BLAST程序常用的两个评价指标BLAST常用参数设置

E-value的设置

如果检索的序列较短,可适当的提高E值,否则可能会找不到目的序列,反之如果序列较长可适当提高E值。

通常无论是从DNA水平,还是蛋白质水平进行检索,E值设为1通常可满足要求。

Wordsize的选择

BLAST算法将查询序列分割成一系列具有字段长度的小的序列段进行数据库搜索,因此当此值越小得到的搜索结果越多,但假阳性也越多,服务器负担也越重。

对于蛋白质搜索,窗口大小可设置为3或2,默认为3;对于核酸搜索,默认的字段长度是11,可选择7,11或15。

因此如果你对搜索的结果不满意时可以试着降低Wordsize的值。基本BLAST程序程序名查询序列数据库搜索方法Blastn核酸核酸用核酸序列搜索核酸数据库Blastp蛋白质蛋白质用蛋白质序列搜索蛋白质数据库Blastx核酸蛋白质用核酸序列搜索蛋白质数据库(核酸序列框翻译成蛋白质序列后和蛋白质数据库中的序列逐一搜索Tblastn蛋白质核酸用蛋白质序列搜索核酸序列据库(先将核酸数据库中的序列按照框翻译为蛋白序列然后逐一比对)TBlastx核酸核酸将查询序列和数据库中的序列都按照个可读框翻译为蛋白序列后再比对如何获得BLAST服务

NCBI主站点:

/BLAST/(网络版)

/blast/(单机版)两种版本的BALST比较(1)网络版本:包括NCBI在内的

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论