DNA、RNA和蛋白质序列信息资源_第1页
DNA、RNA和蛋白质序列信息资源_第2页
DNA、RNA和蛋白质序列信息资源_第3页
DNA、RNA和蛋白质序列信息资源_第4页
DNA、RNA和蛋白质序列信息资源_第5页
已阅读5页,还剩26页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

BioinformaticsResourcesDNA、RNA和蛋白质序列信息资源生物信息学核心数据库与检索技术Contents课程目录生物信息学核心知识体系与数据库资源导览01生物信息学概述与研究范畴02全球生物信息中心:NCBI与EBI03核酸序列数据库体系04蛋白质序列与结构数据库05检索工具与数据应用实践Chapter01生物信息学概述与研究范畴从学科定义到数据库体系的全景认知DisciplineOverview生物信息学的定义与学科定位生物信息学是分子生物学与计算机信息处理技术深度交叉的新兴学科,以计算机为核心研究工具,对生物信息进行全生命周期管理,已成为后基因组时代生命科学研究的关键基础设施。01学科定义生物信息学(Bioinformatics)由分子生物学与计算机技术交叉融合而成,以计算机为研究工具对生物信息进行获取、处理、储存、传播、分析、模拟和解释02发展驱动力学科发展驱动力源于高通量测序技术的快速普及,全球生物数据量呈指数级增长,传统人工分析方法已无法应对海量序列数据的处理需求03应用领域作为后基因组时代的核心支撑学科,生物信息学已渗透到疾病诊断、药物开发、精准医疗和农业育种等广泛的生物医学应用领域生物信息学·高通量测序数据分析研究场景BIOINFORMATICS生物信息学的核心研究内容生物信息学利用数据库与软件技术对生物大分子序列数据进行系统比较分析,从序列层面揭示分子结构、功能与进化关系,进而解析基因组构成与基因表达对生命活动的深层影响。序列数据管理利用数据库技术对核酸和蛋白质序列进行系统化管理,支持全球研究者高效检索、比对和注释已知的生物大分子序列信息Database进化关系分析通过多序列比对与系统发育分析,揭示不同物种间生物大分子的结构保守性、功能域分布和进化关系,构建生命之树Phylogenetics调控机制解析整合基因组构成信息与基因表达数据,解析转录调控网络、信号传导通路等生物学事件对细胞功能和生命活动的调控机制Regulation智能计算预测发展机器学习与深度学习方法,实现蛋白质结构预测、基因功能注释和药物靶点筛选等高精度计算预测任务ML/DLDATABASETAXONOMY生物信息学数据库分类体系生物信息学数据库体系覆盖生命科学各领域,按存储内容可分为基因组数据库、序列数据库、结构数据库和综合数据库四大类,彼此交叉引用形成全球生物数据共享网络。基因组与序列数据库基因组数据库存储完整基因组的组装信息、基因注释和物理图谱,如Ensembl、UCSCGenomeBrowser核酸序列数据库(GenBank、EMBL、DDBJ)存储DNA和RNA一级序列,三大数据库每日同步交换数据蛋白质序列数据库(UniProt、RefSeq)提供蛋白质氨基酸序列及功能注释信息3大核酸库结构数据库蛋白质三维结构数据库(PDB)通过X射线晶体学和冷冻电镜实验获得的蛋白质空间坐标数据核酸结构数据库存储DNA/RNA的二级和三级结构信息,支持RNA折叠预测和适配体设计多糖与复合物结构数据库涵盖糖类分子和蛋白质-核酸复合物的空间构象数据PDB综合与专题数据库文献数据库(PubMed、CNKI)整合生物医学文献资源,支持序列与文献的交叉检索通路数据库(KEGG、Reactome)描述代谢通路和信号传导网络中分子的相互作用关系表观遗传学数据库(HEP、HHMD)记录DNA甲基化、组蛋白修饰等调控信息KEGGChapter02全球生物信息中心:NCBI与EBI深入认识两大国际生物数据枢纽的核心使命与资源体系BIOINFORMATICSNCBI:美国国家生物技术信息中心NCBI作为美国国家级分子生物学信息资源中心,肩负开发信息技术以理解健康与疾病基本分子过程的使命,其建立的GenBank、PubMed、BLAST等资源已成为全球生物医学研究者的日常必备工具。美国国立卫生研究院(NIH)园区01NCBI隶属于美国国立卫生研究院(NIH)下的国家医学图书馆(NLM),是全球最重要的生物信息学数据中心之一,日均访问量达数百万次02核心使命是开发新型信息技术,帮助理解控制健康和疾病的基本分子与遗传过程,推动生物医学研究从数据到知识的转化03四大职能:建立存储分析分子生物学知识的自动系统;提供便捷的数据库和软件工具;协调搜集全球生物技术信息;开发先进的分子结构与功能分析方法04维护的核心资源包括GenBank核酸序列库、PubMed文献库、RefSeq参考序列库、dbSNP变异库及BLAST比对工具等GLOBALBIOINFORMATICSINFRASTRUCTUREEBI:欧洲生物信息学研究所EMBL-EBI作为欧洲分子生物学实验室的重要组成部分,维护着全球最广泛的分子数据库体系,是国际生物数据共享网络中与NCBI并列的核心枢纽,其资源覆盖从序列到通路的多层次生物信息。EMBL-EBI园区·英国剑桥EMBL-EBI隶属于欧洲分子生物学实验室(EMBL),总部位于英国剑桥,是全球搜集和传播生物学数据的欧洲核心节点维护世界上最广泛的分子数据库体系,涵盖核酸序列(EMBL-Bank)、基因组(Ensembl)、蛋白质序列(UniProt)等核心资源特色数据库包括InterPro(蛋白家族与结构域)、Reactome(生物通路)、ChEBI(小分子化合物)和ArrayExpress(基因表达数据)新一代资源致力于从系统层面揭示分子部件的组合方式,推动从"零件清单"到"系统蓝图"的研究范式转变GlobalDataInfrastructureNCBI与EBI核心数据库资源对照NCBI与EBI在全球生物数据资源体系中形成互补格局,两者在核酸序列、蛋白质、基因组、结构和文献等维度各有特色数据库,通过国际协作机制实现数据同步与交叉引用。两大生物信息中心核心资源对照资源类别NCBI核心资源EBI核心资源特色与定位核酸序列GenBankEMBL-Bank(ENA)与日本DDBJ组成INSDC联盟,每日同步蛋白质序列RefSeq/ProteinUniProtUniProt整合Swiss-Prot人工注释与TrEMBL自动注释基因组Genome/AssemblyEnsemblEnsembl提供高质量基因组自动注释管线三维结构MMDB/StructurePDBe均属全球PDB联盟(wwPDB)成员基因表达GEOArrayExpress存储芯片和RNA-seq等高通量表达数据文献检索PubMedEuropePMCPubMed收录超3500万条生物医学文献NCBI与EBI在核酸序列、蛋白质、基因组、结构、表达和文献六大维度形成互补的全球数据共享网络Chapter03核酸序列数据库体系从GenBank到ENA:国际核酸序列数据库的架构与使用GlobalDataInfrastructure国际核酸序列数据库合作组织(INSDC)INSDC由GenBank、ENA和DDBJ三大数据库组成,通过每日数据交换机制保持全球核酸序列信息的同步更新,构成了国际核酸序列数据共享的核心基础设施。01三方权威架构:INSDC由美国GenBank、欧洲ENA(原EMBL-Bank)和日本DDBJ三方组成,是全球核酸序列数据的权威来源3Parties02每日同步机制:研究者向任一数据库提交的序列信息会在24小时内同步至其他两个数据库,确保全球数据一致性24hSync03海量数据覆盖:截至2024年累计收录超30亿条核酸序列记录,数据总量突破数十PB,覆盖已知所有物种的基因组与转录组3B+Records日本DDBJ数据库所在研究机构DATABASEOVERVIEWGenBank:全球最大的核酸序列数据库GenBank作为全球最大的综合性核酸序列数据库,每条记录包含序列基本信息、参考文献、特征表注释和序列数据,其登录号系统为全球研究者提供了标准化的序列引用标识。全球协作维护GenBank由NCBI维护,收录来自全球研究者提交的DNA和RNA序列数据,包含完整的注释信息和参考文献链接。NCBI标准化记录结构每条记录包含LOCUS、DEFINITION、ACCESSION、FEATURES和ORIGIN五大核心字段,结构清晰完整。5大字段特征表精准注释FeatureTable精确标注基因的编码区(CDS)、外显子、内含子、启动子和调控元件等功能区域。CDS版本可追溯登录号采用"主登录号.版本号"格式,确保序列版本可追溯,便于注释更新和引用管理。NM_001234.5NucleotideDataInfrastructureENA:欧洲核苷酸档案全球三大核苷酸数据库之一,与NCBI、DDBJ形成国际协作网络核心功能数据存储原始测序数据与组装结果数据检索多维度查询与批量下载数据提交Webin工具与程序化接口数据共享开放获取与DOI引用数据类型覆盖基因组Genome转录组Transcriptome宏基因组Metagenome靶向测序Targeted表观遗传Epigenetic时序数据Time-series访问统计40PB+数据总量2亿+序列记录50万+月活用户国际协作网络(INSDC)ENA欧洲核苷酸档案欧洲分子生物学实验室(EMBL-EBI)DDBJ日本DNA数据库国立遗传研究所(NIG)NCBI美国国家生物技术信息中心国立卫生研究院(NIH)每日数据同步,确保全球一致性官网:API:REST&SOAPFTP:ftp.sra.ebi.ac.ukReferenceSequenceRefSeq:NCBI参考序列数据库RefSeq是NCBI维护的高质量、非冗余参考序列集合,为每个基因提供唯一的代表性序列,通过标准化的登录号前缀系统区分不同类型的分子序列,已成为基因组注释和功能研究的标准参考。01核心区别GenBank是含冗余提交的原始序列档案库,RefSeq是经人工校审和计算整合的非冗余参考序列集合02标准化命名NM_(mRNA)、NP_(蛋白质)、NC_(染色体)、NR_(非编码RNA)四类前缀体系03双重校审每条记录经NCBI计算管线和人工专家双重校审,广泛用于变异分析和功能注释的基准参考04持续更新整合文献、实验数据和计算预测的最新证据,为临床基因组学提供权威序列变异解读依据RefSeq登录号前缀与序列类型对照前缀序列类型示例主要用途NM_mRNA参考序列NM_001234.5基因表达分析、引物设计NP_蛋白质参考序列NP_001234.2蛋白质功能注释、变异效应预测NC_染色体参考序列NC_000017.11基因组定位、变异坐标参照NR_非编码RNA参考序列NR_002345.1lncRNA/miRNA功能研究RefSeq通过标准化前缀体系区分mRNA、蛋白质、染色体和非编码RNA四类参考序列GenomicReferenceDatabasedbSNP:单核苷酸多态性数据库dbSNP是NCBI维护的全球最全面的遗传变异数据库,通过rs编号系统为每个变异位点提供唯一标识,已成为GWAS研究、群体遗传学和精准医疗中引用基因组变异的标准基础设施。多类型变异收录收录人类及模式生物的遗传变异信息,涵盖单核苷酸多态性(SNP)、小片段插入缺失(Indel)和短串联重复序列(STR)等多种变异类型。SNP·Indel·STRrs编号标识系统每个变异分配唯一rs编号(如rs12345678),这一标识系统已被全球遗传学研究广泛采用为变异位点引用的标准格式。rsIdentifier人群频率整合整合1000Genomes、gnomAD等项目的人群频率数据,支持研究者评估变异在不同人群中的分布和稀有程度。1000Genomes·gnomAD临床致病性联动与ClinVar临床变异数据库联动,提供变异的致病性评估信息,为精准医疗中的基因检测报告解读提供关键参考。ClinVarLinkageTranscriptomicsDatabases转录组数据库:GEO与非编码RNA资源转录组数据库体系覆盖基因表达谱数据和非编码RNA序列两大维度,GEO和ArrayExpress存储海量表达谱数据支持差异表达分析,NONCODE等专题数据库则聚焦非编码RNA的功能注释与调控网络解析。01·GeneExpressionDatabase基因表达数据库(GEO)GEO(GeneExpressionOmnibus)由NCBI维护,是全球最大的高通量基因表达数据归档库,存储芯片和RNA-seq数据支持GEOProfiles快速查询单个基因在多种实验条件下的表达模式,GEODatasets支持整组数据集的下载与再分析与GEO2R在线分析工具集成,研究者无需编程即可对存储的表达数据进行差异表达分析和可视化02·Non-codingRNADatabase非编码RNA数据库NONCODE收录多物种的长链非编码RNA(lncRNA)序列及其表达模式、功能注释和疾病关联信息miRBase是microRNA序列和注释的权威数据库,收录了所有已知物种的成熟miRNA和前体miRNA序列Rfam数据库基于RNA家族分类,利用协方差模型(CM)对非编码RNA进行家族归类和二级结构注释基因表达芯片微阵列实验CHAPTER04蛋白质序列与结构数据库从UniProt到PDB:蛋白质多层次信息资源的系统解析PROTEINDATABASEUniProt:通用蛋白质资源数据库UniProt由EBI、SIB和PIR联合维护,是全球最全面的蛋白质序列数据库,其人工注释的Swiss-Prot部分和自动注释的TrEMBL部分互补,为蛋白质研究提供从序列到功能的完整信息链条。蛋白质组学质谱分析实验室01三方联合维护:UniProt(UniversalProteinResource)由EMBL-EBI、瑞士生物信息学研究所(SIB)和蛋白质信息资源(PIR)联合维护,是蛋白质序列数据的全球权威来源02Swiss-Prot人工注释:每条记录由领域专家逐条审核,包含精确的蛋白质功能、亚细胞定位、翻译后修饰和疾病关联等信息03TrEMBL自动注释:利用计算管线对基因组翻译产物进行批量注释,收录尚未人工审核但具有潜在价值的蛋白质序列04完整注释体系:每条记录涵盖序列、名称、功能、结构域、变异、相互作用和参考文献,是蛋白质功能研究的首选入口STRUCTURALBIOLOGY·DATABASEPDB:蛋白质三维结构数据库PDB是全球唯一的生物大分子三维结构数据库,存储通过X射线晶体学、NMR和冷冻电镜等实验方法测定的空间坐标数据,为药物设计、分子对接和功能机制研究提供了不可替代的结构信息基础。01PDB(ProteinDataBank)由全球蛋白质数据库联盟(wwPDB)统一管理,成员包括美国的RCSB、欧洲的PDBe和日本的PDBjwwPDB02收录通过X射线晶体学(占比约85%)、核磁共振NMR(约8%)和冷冻电镜Cryo-EM(约7%,增长最快)测定的生物大分子三维结构85%X-Ray03每条记录包含原子坐标文件(PDB格式/mmCIF格式)、实验方法参数、分辨率信息和结构验证报告,支持多种三维可视化软件直接加载mmCIF04截至2024年已收录超过20万个结构,AlphaFold等AI预测结构的大规模加入进一步扩展了蛋白质结构覆盖范围200,000+冷冻电镜(Cryo-EM)实验室设备·结构生物学核心实验平台PROTEINFAMILYDATABASES蛋白质家族与结构域数据库蛋白质家族数据库从进化和功能域维度对蛋白质进行分类,InterPro作为综合性平台整合了Pfam、PROSITE等多个成员数据库,为蛋白质功能预测和进化分析提供多层次的结构域注释。InterPro:综合性蛋白家族数据库由EBI维护,整合Pfam、PROSITE、PRINTS、SMART等13个成员数据库,提供统一的蛋白质家族、结构域和功能位点注释。通过InterProScan工具,研究者提交蛋白质序列即可获得所有成员数据库的结构域匹配结果和功能注释。13个数据库Pfam:蛋白质结构域家族库基于隐马尔可夫模型(HMM)构建蛋白质结构域家族,收录近2万个结构域家族,覆盖绝大多数已知蛋白质序列。每个家族提供多序列比对、HMM模型、家族描述和与PDB结构的交叉引用,是蛋白质域分析的标准工具。近2万个家族PROSITE:功能位点模式库使用正则表达式模式和Profile方法描述蛋白质的功能位点、活性位点和结合位点的序列特征。ScanProsite工具可对提交的蛋白质序列进行功能位点扫描,帮助快速识别酶的催化残基和配体结合基序。ScanPrositeSYSTEMBIOLOGY蛋白质相互作用与生物通路数据库蛋白质相互作用数据库和通路数据库从系统生物学视角揭示分子间的功能协作网络,DIP和STRING记录蛋白质互作关系,KEGG和Reactome将这些关系组织为生物学通路。蛋白质相互作用检测实验蛋白质相互作用数据库DIP(DatabaseofInteractingProteins)收录经实验验证的蛋白质-蛋白质相互作用数据,提供互作证据等级和实验方法信息STRING整合实验验证、文献挖掘、共表达和基因组上下文等多维度证据,为蛋白质互作网络提供可信度评分生物通路数据库KEGG(京都基因与基因组百科全书)整合代谢通路、信号传导通路和疾病通路,提供通路图和药物靶点注释Reactome由EBI维护,以物种特异性方式详细记录生物反应的分子事件,支持通路富集分析和跨物种通路比较EPIGENETICDATABASES表观遗传学数据库表观遗传学数据库记录了DNA甲基化、组蛋白修饰和染色质可及性等"超越序列"的调控信息,HEP和HHMD等专题数据库为理解基因表达的表观调控机制提供了系统性的数据支撑。人类表观基因组计划HEP旨在全面绘制人类基因组中DNA甲基化、组蛋白修饰和染色质可及性的全景图谱HEP组蛋白修饰数据库HHMD系统收录不同细胞类型和组织中的组蛋白修饰模式(如H3K4me3、H3K27ac等),支持跨细胞类型比较HHMDENCODE可视化ENCODE计划产生的表观遗传学数据通过UCSCGenomeBrowser可视化,可直接查看基因组任意区域的表观修饰状态ENCODE癌症数据整合表观遗传学数据库与TCGA等癌症基因组数据整合,揭示了肿瘤特异性表观遗传改变在癌症发生发展中的关键驱动作用TCGACHAPTER05检索工具与数据应用实践从Entrez到BLAST:掌握生物序列数据的检索与分析技能NCBIDATABASEEntrez:NCBI综合检索系统Entrez是NCBI开发的基于文本的综合检索系统,将文献、序列、结构、表达、基因组和分类学等多维度数据整合为紧密链接的统一检索平台,实现跨数据库的一站式信息发现。综合检索引擎整合PubMed文献库、核酸与蛋白质序列库、结构与基因组数据库等多个子数据库40+子库跨库知识链接搜索一个基因可同时获取序列、蛋白质产物、相关文献、三维结构和变异信息知识网络精确检索策略支持布尔逻辑AND/OR/NOT和字段限定检索,帮助研究者精确定位目标数据Boolean编程接口集成E-Utilities支持批量数据检索和自动化工作流,集成到生物信息学分析脚本中E-UtilitiesGeneRetrievalEntrezGene:基因信息检索核心工具EntrezGene为每个已知基因分配唯一标识符(GeneID),通过关键链接将基因的图谱定位、序列信息、表达模式、蛋白质结构、功能注释和相关文献整合为统一的基因信息中心。标准化基因标识符EntrezGene为每个基因分配特有的GeneID标识符,在NCBI全部数据库中通用,是跨库检索和追踪的标准化锚点。该标识符贯穿基因组、转录组和蛋白质组数据,确保信息的一致性与可追溯性。GeneID多维度数据整合每条基因记录整合了基因组定位(染色体位置与坐标)、参考序列(RefSeqmRNA和蛋白质)、表型信息和同源基因等多维度数据,形成完整的基因信息视图。多维度RefSeq深度整合与NCBI参考序列深度整合,通过GeneID可直接跳转到该基因的所有参考序列、SNP变异和表达谱数据,实现数据的无缝衔接。SNP灵活多维检索支持按物种、染色体区域、基因功能关键词和表型特征进行灵活检索,是基因功能研究和临床遗传学分析的常用入口,覆盖人类及模式生物数据。多物种SequenceAlignmentBLAST:基本局部比对搜索工具BLAST是生物信息学中最核心的序列比对工具,通过启发式算法快速搜索数据库中与查询序列相似的同源序列,其多种变体覆盖了核酸与蛋白质之间的所有比对组合。01启发式快速比对—BLAST采用启发式算法实现快速序列比对,在保证灵敏度的同时大幅提升搜索效率02blastn核酸比对—用于核酸序列间比对(DNA↔DNA),适用于引物特异性验证、序列注释和物种鉴定03blastp蛋白比对—蛋白质序列间比对,是蛋白质功能注释和同源基因识别的首选工具04blastx翻译比对—将核酸翻译为六阅读框蛋白后与蛋白库比对,适用于新基因功能预测与编码区识别05E值统计量—表示随机匹配产生同等比对的期望次数,E值越小匹配越可靠,是结果评估的核心指标BLAST主要变体与适用场景程序查询序列目标数据库典型应用场景blastn核酸核酸物种鉴定、引物验证、序列注释blastp蛋白质蛋白质蛋白功能注释、同源基因搜索blastx核酸(翻译)蛋白质新基因功能预测、编码区识别tblastn蛋白质核酸(翻译)在未注释基因组中搜索蛋白同源区BLAST五种变体覆盖核酸与蛋白质之间的全部比对组合,满足不同研究场景的序列搜索需求DATABASESYSTEM生物医学文献数据库体系生物医学文献数据库与序列数据库形成互补的知识网络,PubMed作为全球最大的生物医学文献检索系统收录超3500万条记录,其MeSH主题词系统和与Entrez的深度整合使其成为序列研究不可或缺的文献支撑。国际核心文献数据库01PubMed由美国国立医学图书馆(NLM)维护,收录超3,500万条生物医学文献摘要,通过MeSH主题词实现精确检索02EMBASE(荷兰医学文摘)在药物和药理学文献覆盖上优于PubMed,是系统评价和药物研发的重要文献来源03WebofScience和Scopus提供引文追踪功能,支持研究者追踪关键序列数据库论文的

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论