版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第1章基因组学数据分析1全套可编辑PPT课件第1章基因组学数据分析第2章Bulk转录组学数据分析第3章单细胞转录组学数据分析第4章空间转录组学数据分析第5章质谱蛋白质组学数据分析第6章代谢组学数据分析第7章医学影像处理与分析第8章R语言在生物信息学中的应用课程教学目标了解基因组学基本原理与方法体系了解主流比对算法及工具的原理和应用场景掌握如何使用BWA完成标准DNA比对流程掌握如何使用HaplotypeCaller完成变异检测2第1章学习内容基因组学基本原理与方法体系DNA序列比对流程变异检测流程3基因组学的发展背景随着人类基因组计划(HGP)的逐步完成,人类成功构建出较为完整的人类参考基因组序列,完成了遗传图谱绘制及相关遗传信息的系统性解析,为基因组学发展奠定坚实基础。大量变异数据库、基因—疾病关联数据库的建立,为深入研究基因组结构、变异类型以及重大疾病的预测与治疗提供了关键技术支持。多种模式生物的基因组研究计划,如小鼠、果蝇等,极大地推进了人类对遗传、进化与代谢等生命机制的理解,使基因组学逐渐成为生命科学领域的重要研究方向。4基因组学的重要意义在医学领域,基因组学有助于疾病的早期诊断、个性化治疗以及药物研发。在农业方面,基因组学可用于改良作物品种,提高农作物的产量和抗逆性。在生物进化研究中,基因组学可以帮助我们了解物种的进化历程和亲缘关系。通过比较不同物种的基因组序列,科学家能够揭示物种之间的进化关系,追溯生物的演化历史。5基因组学的基础-测序技术第一代测序技术:Sanger测序法Sanger测序法作为最早被广泛应用的DNA测序方法,其原理是利用双脱氧核苷酸(ddNTP)终止DNA链的延伸,通过电泳分离不同长度的DNA片段,从而读取DNA序列。在人类基因组计划中,Sanger测序法发挥了重要作用。然而,它通量较低、耗时较长且依赖大量人力。例如,完成首个人类基因组测序耗时15年、耗资约30亿美元。6基因组学的基础-测序技术新一代测序技术(NGS):高通量测序NGS依赖DNA聚合酶在合成过程中将荧光标记的脱氧核糖核苷酸三磷酸盐(dNTPs)掺入DNA模板链。每个测序循环中,新加入的核苷酸可通过其荧光信号被识别和记录。与传统方法的关键区别在于,新一代测序实现了高通量并行测序,可同时完成数百万个DNA片段的读取,大大提高了测序效率。例如,Illumina公司的测序技术可一次性并行测序数十万至数百万条DNA分子。7高通量测序技术的流程测序文库制备:将提取的DNA或cDNA样本随机打断为小片段,并在片段两端连接特定序列的接头,构建成可用于后续PCR扩增的测序文库。8测序技术的发展趋势2000年开始每年的测序成本和数据产生量9高通量测序技术的流程簇生成:将文库加载至流动池(flowcell)中,池表面固定的寡核苷酸可与文库适配器互补结合,使DNA片段锚定于表面。通过桥式扩增反应,每个片段被独立扩增形成单克隆簇,作为后续测序的模板。10高通量测序技术的流程测序反应:Illumina的SBS技术采用可逆终止化学法,在每个循环中加入带荧光标记的核苷酸。通过扫描捕获每个簇的光信号,并根据信号的波长与强度识别碱基类型。重复该过程n次即可获得长度为n的短读长(read)11高通量测序技术的流程序列比对与数据分析:将测序所得短读长与参考基因组(ReferenceGenome)进行比对,进而实现多种类型的变异检测,例如单核苷酸多态性(SNP)和插入/缺失突变(Indel)的识别。12参考基因组:生命密码的蓝图参考基因组(ReferenceGenome)是某一物种经过高质量测序和组装后获得的标准化DNA序列,作为该物种遗传学研究的基准框架。它通常基于来自多个个体的高精度测序数据拼接构建而成,并经过严格的质量控制与生物学注释,包含染色体结构、基因位置、功能元件及其他重要遗传信息。13参考基因组:生命密码的蓝图以人类参考基因组GRCh37为例,它来源于13个不同地区匿名志愿者的数据,经系统拼接与分析后形成。随着测序技术的飞速发展和成本显著下降,越来越多高质量个体基因组数据为参考基因组的完善提供了丰富证据,持续提升其准确性、完整性及人群代表性。2022年发布的T2T-CHM13版本更是实现了首个“端粒到端粒”的完整无间隙人类基因组组装,标志着参考基因组构建进入新阶段。14参考基因组的功能与应用遗传分析的坐标系统:通过将个体测序数据与参考基因组进行比对,可识别突变、发现致病位点。疾病机制解析:通过分析参考基因组与疾病相关基因的关系,可以揭示疾病的遗传基础,为开发新的治疗方法提供思路。物种鉴定和发现:通过跨物种基因组比较,可揭示进化关系、鉴定新物种。15基因组序列比对基因组序列比对(Alignment)是指利用计算方法将高通量测序所产生的短序列片段定位至参考基因组上相应来源位置的过程。它是变异检测(VariantCalling)等后续基因组学分析的基础步骤。16基因组变异检测变异检测是指将测序得到的DNA片段(reads)比对到参考基因组之后,利用统计模型和计算算法识别下列三类主要变异:单核苷酸变异(SNP)插入/缺失变异(Indels)结构变异(SVs)对SNP和Indel长度较小的变异类型的识别通常称为VariantCalling。17VariantCalling分析流程图18单核苷酸变异(SNP)SNP指基因组中某个位点的单个碱基发生变异,是最常见的基因组变异类型,广泛分布于人类基因组中,每千碱基约有1个。大多数SNP是中性的,但某些SNP可导致氨基酸改变或剪接错误,进而影响蛋白功能。19单核苷酸变异(SNP)SNP指基因组中某个位点的单个碱基发生变异,是最常见的基因组变异类型,广泛分布于人类基因组中,每千碱基约有1个。大多数SNP是中性的,但某些SNP可导致氨基酸改变或剪接错误,进而影响蛋白功能。20插入/缺失变异(Indels)Indels指在参考序列中某些位置出现了短片段(通常<50bp)的插入或缺失,Indels尤其在编码区中影响较大,可能导致移码突变并产生提前终止密码子。21结构变异(SVs)SVs指大于50bp的大片段基因组重排,包括:删除、插入、重复、倒位、易位、拷贝数变异。22序列比对概述序列比对(SequenceAlignment):通过比较DNA、RNA或蛋白质序列之间的相似性,揭示它们在进化、结构或功能上的关系。通过插入缺口(gap)来调整序列之间的位置,使得尽可能多的碱基或氨基酸在相对位置上匹配,从而最大化序列间的相似性评分。ACTAAGAC
TAG匹配匹配Gap错配匹配匹配23比对方法分类全局比对(GlobalAlignment)
全局比对尝试比对整个序列,适用于长度相近且整体相似的序列。代表算法为Needleman-Wunsch算法局部比对(LocalAlignment)局部比对着重寻找序列中最相似的片段,适用于结构或长度差异较大的序列。代表算法为Smith-Waterman算法24Needleman-Wunsch算法详解1.全局比对要求对两条序列(A与B)进行从头到尾(end-to-end)的整体比较。2.目标是找到一种对齐方式(包括插入、删除和替换),使得两条序列在整体长度上达到最大程度的相似性。3.适用于比较完整度较高、长度和功能相近的同源序列,如全长蛋白质或基因序列的比对。25Needleman-Wunsch算法详解由SaulNeedleman和ChristianWunsch于1970年提出,首个采用系统化动态规划(DynamicProgramming,DP)解决全局比对问题的方案。核心思想是将序列比对问题归结为在一个二维得分矩阵(称之为M)中进行最优路径搜索的问题。263.分解子问题:最优对齐路径经过矩阵的每一个单元格M[i][j]的得分,仅依赖于它之前的部分对齐状态(即该单元格左、上、左上三个方向邻居的状态)。4.递推关系:通过对三种可能的“前一步”对齐方式(字符匹配/错配,在序列A中插入Gap,在序列B中插入Gap)的得分进行比较,选择最优得分写入当前单元格M[i][j],建立递推公式。5.最优解构建:最终,右下角单元格M[len(A)][len(B)]的值即为两条序列整体比对的最佳得分。通过回溯矩阵找到取得这个最佳得分的对齐路径,即可重建出最优的全局对齐结果。27定义打分机制在进行序列比对时,必须首先定义打分机制,即当两字符匹配、错配或引入空位(gap)时应赋予的得分。匹配得分设定为2(如A对A)错配得分为-5(例如A对G为-5)空位(gap)罚分设为-528构建得分矩阵以序列AAG和AGC为例,分别长为3,构建一个(3+1)×(3+1)大小的得分矩阵,即4×4的矩阵。其中第一行和第一列代表空位的引入,其余部分将用于记录比对过程中的最优得分。-AGC-AAG29初始化得分矩阵初始化表格,设左上角起始点M[0][0]=0,第一行和第一列用空位罚分进行初始化,即M[i][0]=i*空位罚分,M[0][j]=j*空位罚分。-AGC-0-5-10-15A-5A-10G-1530递推填表
31递推填表从左上角开始,按照递推公式逐格填写矩阵内容,每一格都记录当前的最优得分。-AGC-0-5-10-15A-52-3-8A-10-3-3-8G-15-8-1-632回溯路径对得分矩阵从右下角(终点)回溯至左上角(起点),即可获得全局最优比对路径。每次选择得分来源最大值的路径,即确定两个序列在该位置的比对情况。-AGC-0-5-10-15A-52-3-8A-10-3-3-8G-15-8-1-6-AGC-0-5-10-15A-52-3-8A-10-3-3-8G-15-8-1-6AAG--AGCAAG-A-GC33结果分析两种结果都代表两个序列之间在考虑缺失与错配情况下的最优比对关系,二者均获得相同的比对得分,说明在本示例中存在二个全局最优解。-AGC-0-5-10-15A-52-3-8A-10-3-3-8G-15-8-1-6-AGC-0-5-10-15A-52-3-8A-10-3-3-8G-15-8-1-6AAG--AGCAAG-A-GC34Smith-Waterman算法详解Smith-Waterman算法由TempleF.Smith和MichaelS.Waterman于1981年提出。Smith-Waterman算法在Needleman-Wunsch算法的基础上,在打分规则中引入对负得分的截断处理,使得算法能够聚焦于局部高相似性区域;在回溯机制上,从得分最高的单元格出发,沿着得分上升路径回溯,从而准确找到局部最优比对的区段。35定义打分机制在进行序列比对时,必须首先定义打分机制,即当两字符匹配、错配或引入空位(gap)时应赋予的得分。匹配得分设定为2(如A对A)错配得分为-5(例如A对G为-5)空位(gap)罚分设为-536构建得分矩阵以序列AAG和AGC为例,分别长为3,构建一个(3+1)×(3+1)大小的得分矩阵,即4×4的矩阵。其中第一行和第一列代表空位的引入,其余部分将用于记录比对过程中的最优得分。-AGC-AAG37初始化得分矩阵初始化表格,设左上角起始点M[0][0]=0,第一行和第一列使用0进行初始化。-AGC-0000A0A0G038递推填表
39递推填表从左上角开始,按照递推公式逐格填写矩阵内容,每一格都记录当前的最优得分。-AGC-0000A0200A0200G004040回溯路径首先找到表中的最大值,最大值是4,位于M[3][2]。回溯从M[3][2]开始,沿着产生最大值的路径回溯,如果存在多个可能得路径,优先选择对角线,直到遇到0。M[3][2]来自M[2][1]+匹配(G,G),M[2][1]来自M[1][0]+匹配(A,A),M[1][0]为0,回溯停止。-AGC-0000A0200A0200G0040AGAG41DNA序列比对流程-环境准备安装Minicondawget/miniconda/Miniconda3-latest-Linux-x86_64.shbashMiniconda3-latest-Linux-x86_64.sh
source~/.bashrc创建环境
condacreate-nGenomic_analysispython==3.8condaactivateGenomic_analysiscondainstallsra-toolsbwasamtoolsfastqcfastptrimmomatic-cbioconda42DNA序列比对流程-获取参考基因组访问NCBIDatasets并选择基因组/使用精准搜索词进行查询:Escherichiacolistr.K-12substr.MG165543DNA序列比对流程-获取参考基因组筛选和确认结果,通常,最标准、最完整的参考基因组会排在前面并带有标记44DNA序列比对流程-获取参考基因组下载参考基因组文件,点击名为“ASM584v2”的记录,进入如图所示的下载方式选择界面,点击“FTP”选项,进入该数据所在的FTP站点。45复制名为GCF_000005845.2_ASM584v2_genomic.fna.gz的文件的下载链接。在终端中执行以下命令下载文件至当前工作目录:
wget/genomes/all/GCF/000/005/845/GCF_000005845.2_ASM584v2/GCF_000005845.2_ASM584v2_genomic.fna.gz使用gunzip解压下载的.gz压缩文件:
gunzipGCF_000005845.2_ASM584v2_genomic.fna.gz解压后将得到GCF_000005845.2_ASM584v2_genomic.fna。为便于后续使用,可将其重命名:mvGCF_000005845.2_ASM584v2_genomic.fnaEcoli_MG1655.fasta46DNA序列比对流程-获取测序数据选择合适的公共数据库,最常用的公共数据库是NCBI的SRA(SequenceReadArchive)数据库47下载SRA登录号为ERR15362082的单端测序数据:
fastq-dump--gzipERR15362082下载SRA登录号为SRR25783718的双端测序数据:
fastq-dump--split-files--gzipSRR25783718该命令会生成两个文件:SRR25783718_1.fastq.gz和SRR25783718_2.fastq.gz。这两个文件分别代表双端测序的两个方向。48DNA序列比对流程-比对到参考基因组测序数据质量控制
fastqcSRR25783718_1.fastq.gzSRR25783718_2.fastq.gz-t4-o./qc_report/执行命令后,FastQC
会在当前./qc_report/目录下生成两份.html报告文件和两份.zip压缩包,分别对应输入的两个文件:49HTML报告供研究者快速浏览和判断,而ZIP压缩包则是为机器和自动化流程准备的“原材料”。将两份HTML报告下载到本地,使用浏览器打开,以SRR25783718_1_fastqc.html为例,打开后页面如图所示。绿色对勾:指标通过,符合高质量数据标准;橙色感叹号:指标存在异常,需结合具体背景解读;红色叉号:指标严重偏离标准,需优先处理。50使用FastP进行质量修剪、接头去除、读段过滤、长度筛选等预处理fastp-iSRR25783718_1.fastq.gz-ISRR25783718_2.fastq.gz-oSRR25783718_1.clean.fastq.gz-OSRR25783718_2.clean.fastq.gz--htmlfastp_report.html--jsonfastp_report.json-w8--qualified_quality_phred20--unqualified_percent_limit40--length_required50--cut_front--cut_tail--detect_adapter_for_pe--trim_poly_g--trim_poly_x--overrepresentation_analysis51为参考基因组构建索引bwaindexEcoli_MG1655.fnabwaindex命令运行成功后,参考基因组文件所在目录中会出现一系列新生成的文件。这些文件是索引的各个部分,它们的名称都以参考基因组文件名作为前缀。例如:Ecoli_MG1655.fna.amb、Ecoli_MG1655.fna.ann、Ecoli_MG1655.fna.bwt、Ecoli_MG1655.fna.pac、Ecoli_MG1655.fna.sa等。这些就是BWA比对所需的索引文件。在后续进行比对时,BWA会自动识别并使用这些文件。52确保所有文件已准备就绪参考基因组索引文件:Ecoli_MG1655.fna.amb,Ecoli_MG1655.fna.ann,Ecoli_MG1655.fna.bwt,Ecoli_MG1655.fna.pac,Ecoli_MG1655.fna.sa;质控后的测序数据文件:SRR25783718_1.clean.fastq.gz,SRR25783718_2.clean.fastq.gz53执行BWA比对命令bwamem-t8-R"@RG\tID:SRR25783718\tSM:SRR25783718\tPL:ILLUMINA"GEcoli_MG1655.fnaSRR25783718_1.clean.fastq.gzSRR25783718_2.clean.fastq.gz>align.sam将SAM文件转换为BAM并排序samtoolsview-b-h-Saligned.sam>aligned.bamsamtoolssort-osorted.bam-@8aligned.bamsamtoolsindexsorted.bam54SAMtools不仅用于转换和排序,还可以用来快速查看BAM文件的摘要统计信息:samtoolsflagstatsorted.bam55变异检测流程环境准备condainstallpicardgatk4bcftoolssnpeffannovarigv-cbioconda数据准备所用数据与序列比对流程中所用数据相同56去除PCR重复序列picardMarkDuplicatesI=sorted.bamO=sorted.dedup.bamM=metrics.txtREMOVE_DUPLICATES=true建立索引文件samtoolsindexsorted.dedup.bam执行变异检测gatkHaplotypeCaller-REcoli_MG1655.fna-Isorted.dedup.bam-Osample.vcf.gz57变异质量过滤gatkVariantFiltration-REcoli_MG1655.fna\-Vsample.vcf.gz-Osample.filtered.vcf.gz\--filter-expression"QD<2.0||FS>60.0||MQ<40.0"\--filter-name"LOW_QUAL“安装变异功能注释参考数据库snpeffdatabases|grep-i"MG1655“snpeffdownload-vEscherichia_coli_str_k_12_substr_mg165558执行功能注释snpeff-vEscherichia_coli_str_k_12_substr_mg1655\-statssample.filtered.annotated.html\sample.filtered.vcf.gz>sample.filtered.annotated.vcf59哈尔滨工业大学
第2章bulk转录组学数据分析60转录组学与RNA-Seq1.绪论:转录组学与BulkRNA-Seq2.原始数据预处理与质量控制3.比对与表达定量4.差异表达分析(重点)归一化与批次效应统计建模与DESeq2流程差异基因结果与可视化5.功能富集与通路分析GO功能富集KEGG/Reactome通路富集GSEA基因集富集分析6.差异可变剪接分析7.共表达网络分析(WGCNA)8.BulkRNA-Seq展望61转录组学与RNA-Seq转录组学研究细胞内全部RNA转录本的组成及其表达水平RNA测序(RNA-Seq)是现代转录组分析的核心技术,相比传统基因芯片可检测新转录本、具有更宽动态范围和更高灵敏度BulkRNA-Seq指对群体细胞样本(如组织匀浆)进行测序,获取总体平均表达;相对地,单细胞RNA-Seq解析单细胞层面的表达差异BulkRNA-Seq分析关注总体基因表达变化,流程相对简捷;本课程聚焦常规BulkRNA-Seq数据分析流程62BulkRNA-Seqvs单细胞RNA-SeqBulkRNA-Seq每个样本包含多个细胞RNA的混合信号,反映总体平均表达,适合比较组织或群体水平差异单细胞RNA-Seq将样本分解到单细胞,捕获细胞间异质性,可识别不同细胞类型或亚群的表达特征BulkRNA-Seq分析流程较为成熟,注重总体差异的检测;单细胞RNA-Seq分析更复杂,包括降维聚类、去除批次效应等步骤Bulk适用于宏观生物学效应(如疾病组vs正常组)研究;单细胞适用于深入探索细胞类型特异变化和稀有细胞群本课程聚焦BulkRNA-Seq流程,单细胞分析为不同专题63BulkRNA-Seq实验设计要点良好实验设计和足够生物学重复是可靠结果的基础:每组至少3个生物学重复,重复越多统计效力越高样本处理需随机化并平衡批次,尽量减少批次效应等技术偏差;采集完整元数据(样本来源、处理条件、批次信息等)设定清晰的对照组与处理组方案(如疾病样本vs健康样本),以便通过差异分析回答具体的生物学问题数据分析前先检查测序结果质量,如发现个别样本质量远低于其他样本,考虑重测序或在分析中单独处理64BulkRNA-Seq分析流程概览BulkRNA-Seq典型分析流程:原始数据质量控制(QC)与预处理→比对或定量得到表达矩阵→差异表达分析→功能富集与通路分析→深度分析(可变剪接、共表达网络等)每一步涵盖数据处理方法、使用的软件工具、参数选择建议及结果解读方式BulkRNA-Seq流程侧重于总体表达变化检测,与单细胞RNA-Seq流程有所不同(无需考虑细胞分群等)该流程主要针对人类、小鼠等基因组注释完善的物种,分析工具和参考资源相对成熟65主要分析步骤及常用工具原始数据QC与预处理:FastQC生成质量报告,MultiQC汇总样本;Trimmomatic/Cutadapt/fastp剪除接头和低质量序列比对/定量:STAR、HISAT2将reads比对到参考基因组;Salmon、Kallisto跳过比对直接进行转录本pseudoalignment定量表达矩阵构建:featureCounts或HTSeq-count将比对结果汇总为基因count矩阵;tximport将转录本层面定量汇总到基因层次差异表达分析:DESeq2、edgeR、limma-voom等R包对计数矩阵归一化并进行统计检验,输出差异表达基因列表功能富集分析:clusterProfiler等R包或DAVID/Enrichr在线工具用于GO/KEGG通路富集;BroadGSEA软件进行基因集富集分析高级分析:rMATS检测差异剪接事件;WGCNA构建基因共表达网络模块(Cytoscape可用于网络可视化)66原始测序数据与FASTQ格式高通量测序平台(如Illumina)输出原始数据为FASTQ文件,包含每条reads的碱基序列及其测序质量值FASTQ质量值采用Phred33编码(如Q30表示测序错误概率0.1%),质量值越高表示碱基测序越可靠分析起点是收集每个样本的原始FASTQ文件(双端测序每个样本有一对FASTQ,单端测序有一个FASTQ),确保文件完整无损在分析前应确认测序平台和读长等信息,并检查文件完整性(大小符合预期、无截断),为后续分析选择适当参数做好准备67原始测序数据与FASTQ格式FASTQ文件中每四行成为一个独立的单元,称之为read。具体的格式描述如下:以‘@’开头,是这一条read的名字,这个字符串是根据测序时的状态信息转换过来的,中间不会有空格,它是每一条read的唯一标识符,同一份FASTQ文件中不会重复出现,甚至不同的FASTQ文件里也不会有重复测序read的序列,由A,C,G,T和N这五种字母构成,这也是真正关心的DNA序列,N代表的是测序时那些无法被识别出来的碱基以‘+’占行,一般无意义测序read的质量值,这个和第二行的碱基信息一样重要,它描述的是每个测序碱基的可靠程度,用ASCII码表示68质量值和Phred33FASTQ文件中每个read的第四行,是序列的每个碱基的质量值,也就是每个碱基被测错的概率,错误率越低,质量值就越高。假定碱基的测序错误率为p_error,质量值为Q,它们之间的关系如下:
Q=-10log(p_error)p_error的值和测序时的多个因素有关,体现为测序图像数据点的清晰程度,并由测序过程中的basecalling算法计算出来;公式左边的Q称之为Phredqualityscore。比如,如果该碱基的测序错误率是0.01,那么质量值就是20(Q20),如果是0.001,那么质量值就是30(俗称Q30)。Q20和Q30的比例常常被我们用来评价某次测序结果的好坏,比例越高就越好。
PhredQualityScoreProbabilityofincorrectbasecallBasecallaccuracy101in1090%201in10099%301in100099.9%401in10,00099.99%501in100,00099.999%69质量值和Phred33为了格式存储以及处理时的方便,质量值这个数字被直接转换成了ASCII码,并与第二行的read序列构成一一对应的关系不过,ASCII码虽然能够从小到大表示0-127的整数,但是并非所有的ASCII码都是可见的字符,比如所有小于33的ASCII码值所表示的都是不可见字符,比如空格,换行符等,因此为了能够让碱基的质量值表达出来,必须避开所有这些不可见字符。最简单的做法就是加上一个固定的整数。
测序平台ASCII码范围下限质量值类型质量值范围备注Sanger,Illumina(版本1.8及以上)33-12633(Phred33)Phredqualityscore0-93现在沿用Solexa,Illumina早期版本(<1.3版本)59-12664(Phred64)Solexaqualityscore5-62除了已测序数据之外,不再使用lllumina(版本1.3-1.7)64-12664(Phred64)Phredqualityscore0-62除了已测序数据之外,不再使用70原始数据质量评估要点碱基质量分布:检查每个测序循环的碱基Phred值是否稳定,如读长末端质量下降则考虑后续剪切GC含量分布:随机片段的GC含量理论上呈正态分布,若观察到异常双峰或偏移,可能提示污染或文库偏差接头序列:FastQC报告富集序列,如高丰度接头(adapter)序列残留需在下步处理中去除序列长度:reads长度应接近测序设计,如出现大量异常短序列提示样品RNA降解或测序截短序列重复:FastQC序列重复率高意味着文库复杂度低或PCR偏倚,需要谨慎解读或采用降重处理综合QC判定:多数碱基质量≥Q30且无严重接头/污染问题则数据质量理想;若QC报告出现红色警告(如接头污染),需在预处理时解决
71序列剪切与过滤(Trimming)根据初始QC结果,对reads进行必要的修剪和过滤,可使用Trimmomatic、Cutadapt、fastp等工具接头去除:如FastQC提示reads中残留建库接头序列,提供已知接头序列文件让工具匹配并剪除,避免干扰比对和定量低质碱基剪切:采用滑动窗口策略剪除reads末端低质量区域(如4碱基窗口平均质量<Q20则截断),以提高后续分析准确性最低长度过滤:设定剪切后reads的最短保留长度阈值(如30bp),过短reads信息量低且比对不可靠,应予以过滤双端测序需确保成对reads同步处理:若一端read被完全过滤,其配对read也需丢弃或标记为单端修剪过滤后建议重新运行FastQC/MultiQC,确认接头序列已去除、质量分布改善,为下游分析提供高质量cleanreads72序列剪切与过滤(Trimming)发现质量值经过过滤后,明显升高73参考基因组与注释准备在比对reads前需准备对应物种的参考基因组序列(FASTA)和基因注释文件(GTF/GFF)人类、小鼠等常用物种可从Ensembl、NCBI、UCSC下载最新版本基因组(如GRCh38)及对应注释,使用最新注释涵盖完整基因信息比对前使用工具构建参考索引:STAR或HISAT2构建基因组索引确保索引用的基因组版本与注释文件一致,以免比对后基因归属错位若需发现新转录本或新剪接形式,应选择基因组比对方案;若仅关注已知转录本的定量,转录组pseudoalignment亦可胜任74RNA-Seq比对特点比对(alignment)指将测序reads序列定位到参考基因组上;RNA-Seq比对的特殊性在于cDNAreads可能跨越外显子-内含子边界需要采用可变剪接比对算法(splicedalignment)处理跨内含子reads,STAR、HISAT2等工具可识别剪接位点以正确比对拆分reads比对结果以SAM/BAM格式存储,每条read记录定位坐标、CIGAR串(匹配/缺失/插入模式)以及比对质量分等信息比对允许一定错配以容忍测序错误或等位变异,一般限定每条read最多错配数或错配率上限75比对工具:STARvsHISAT2STAR:高性能RNA-Seq比对工具,采用缀合矩阵和双通道索引算法,每分钟可比对上百万reads;支持两次比对(pass2)模式以发现新的剪接位点,提高novel剪接检测灵敏度STAR重要参数示例:--outFilterMismatchNoverLmax(错配比例阈值),--alignSJoverhangMin(跨剪接比对的最小外显子匹配长度),--sjdbOverhang(构建剪接位点索引用的序列长度,一般设为读长-1)STAR通常需要较高内存,但比对速度快、结果准确,在大规模数据中应用广泛HISAT2:高效比对工具,采用FM-index压缩索引,占用内存较小;提供预构建的人、小鼠基因组索引,默认参数下比对率可达70-80%HISAT2支持利用已知剪接位点信息(参数--known-splicesite-infile),输出BAM文件较小,对低配置计算机更友好两者准确度相当:STAR更快而HISAT2更省内存。一般比对率>70%视为正常,若显著偏低应检查样本质量或参考版本匹配问题76构建基因表达矩阵完成比对或转录本定量后,需要将结果汇总为基因表达矩阵(行=基因,列=样本,值=readcount),供差异分析使用若采用基因组比对方法:利用HTSeq-count或featureCounts对比对结果进行read计数,统计每个基因的reads覆盖总数使用featureCounts时需提供BAM文件和基因注释GTF,设定-texon-ggene_id等参数汇总基因层次counts;可设定比对质量阈值(如-Q10过滤低质量比对),一般默认不计入多重比对reads构建矩阵后可对极低表达基因进行过滤(如在多数样本中counts接近0),以减少噪声并降低多重检验负担77样本间一致性检查在进入差异分析前,评估多样本整体表达的一致性是良好质控实践,可通过样本聚类或主成分分析(PCA)检查重复样本是否聚在一起如发现同组样本未能聚类在一起,或出现某异常样本远离其它样本,需要调查原因(技术失误、批次效应或生物变异)通过聚类/PCA可确认数据无显著异常后再进行差异分析;若发现批次效应,可在后续模型中纳入批次协变量校正执行PCA/聚类时通常使用经过归一化且对数转换的数据,以获得更可靠的样本分组可视化78数据归一化方法不同样本测序深度和组成偏差不同,需对原始counts进行归一化以保证可比性最简单的库大小归一化是将counts转化为CPM(每百万reads中的counts),但更常用的是稳健的规模因子校正:DESeq2采用中位数比值法计算每个样本相对规模因子基因长度校正指标如FPKM、TPM在样本内用于比较基因相对丰度,但不适合作为差异分析的直接输入,因为长度标准化会丢失计数的离散度信息差异表达统计模型以原始counts为基础(考虑测序深度因素),内部完成归一化校正;因此建议使用未经长度校正的count矩阵进行差异分析,TPM/FPKM值仅供展示79数据归一化方法方法全称公式(简化)是否校正基因长度是否校正测序深度是否可跨样本比较是否可跨基因比较CPM每百万计数CPM=(count/总reads)×1e6×√√×FPKM每kb外显子每百万片段FPKM=count/(基因长度kb×总fragments百万)√√×√TPM每百万转录本先除以基因长度→再归一到1e6√√√√80批次效应校正与数据变换如样本分属不同批次测序或处理,可能存在系统性偏差;可在差异分析模型中加入批次作为协变量(~batch+condition)以调整批次对基因表达的影响或者在归一化后应用去批次算法(如ComBat)对表达矩阵进行调整,但需确保批次与实验条件独立,避免过度校正掉真实效应为便于可视化和满足模型假设,常对归一化counts进行对数或方差稳定变换:如DESeq2提供vst(方差稳定变换)和rlog(正则化对数),使数据更接近正态分布且不同丰度基因的变异性可比注意这些变换主要用于探索性分析和绘图,差异检验仍在原始计数(经过内部归一化)上完成,不直接使用变换后的值做显著性检验81探索性分析:PCA与聚类在正式差异统计之前,先对数据进行探索性分析(EDA),可以帮助了解样本间全局关系并发现潜在异常使用归一化并适度转换(对数)的表达矩阵进行主成分分析(PCA),将高维数据降维到2-3个主成分,以图形化观察样本分布若实验处理有明显效应,同组样本应在PCA图上聚集在一起,不同条件样本间拉开距离;如第一主成分即可区分疾病组和对照组,则说明处理效应占主要变异PCA还可揭示批次效应(如样本按测序批次聚集而非实验组聚集)或存在离群样本,为后续分析提供警示发现经过PCA降维后,两个条件下的样本被明显的分开82实验设计与模型构建差异表达分析利用广义线性模型框架建模,每个基因的原始count假定服从负二项分布(允许方差大于均值,以适应RNA-Seq数据的过度离散)设计矩阵定义实验比较和混杂因素:如两组比较可用~condition,配对设计用~subject+condition,多因子实验可加入交互项(~factor1*factor2)在每个基因上拟合负二项模型,估计各效应系数及基因特异的离散度参数,离散度反映该基因表达的生物变异度该模型框架下,差异表达检验即检验条件效应系数是否显著不为0,相当于比较不同条件下该基因表达均值是否存在统计学差异83假设检验与多重校正对每个基因进行假设检验:原假设H0为不同条件下基因表达无差异(模型中条件系数=0),备择假设Ha为存在差异DESeq2对每个基因计算Wald统计量进行显著性检验(多因子复杂设计可用似然比检验LRT比较有无条件效应模型RNA-Seq同时检验数千基因,需进行多重假设校正以控制总体假阳性率;常用Benjamini-Hochberg方法计算假发现率FDR差异分析结果报告每个基因的原始p值和调整后p值,通常以FDR<0.05作为显著差异基因筛选标准样本数较少时检验功效有限,部分真实差异因未达显著而漏检,因此结果解释要结合生物学意义,不能仅依赖p值大小84差异表达分析常用工具DESeq2:R/Bioconductor包,实现负二项广义线性模型,自动完成归一化(中位数比值法)、离散度估计和Wald检验等步骤,广泛用于各类RNA-Seq差异分析edgeR:R包,基于负二项模型,采用TMM归一化,允许灵活模型设计;提供exacttest适用于极小样本,准似然方法适用于常规多重复实验,与DESeq2结果通常相近limma-voom:将count数据的方差-均值关系转换后应用线性模型和经验贝叶斯方法,适合样本量较大的实验,计算效率高,并方便实现复杂设计和多重比较其他:如baySeq、EBSeq等贝叶斯方法对小样本数据有一定稳健性但应用较少;Cuffdiff(Cufflinks套件)可用于转录本水平差异分析但现已渐少使用,实际工作中常用DESeq2或edgeR即可满足需求,可选用多种工具交叉验证结果一致性,但须注意不同工具的归一化方式差异,不应混用处理85差异分析流程(DESeq2举例)准备基因表达count矩阵,在R中使用DESeq2构建数据对象(DESeqDataSet),指定实验设计公式(如~condition)执行DESeq()函数,一键完成归一化因子计算、离散度估计、模型拟合和差异显著性检验提取结果:调用results()获取结果表,包含每基因的对数2倍数变化(log2FC)、p值和padj等信息,按padj<0.05筛选显著差异基因列表edgeR分析流程:calcNormFactors()计算TMM归一化因子→estimateDisp()估计离散度→glmQLFit()拟合广义线性模型→glmQLFTest()进行差异检验,最后用topTags()提取结果表差异分析前通常会先滤除在几乎所有样本中表达极低的基因,以提高检验效率并减轻多重校正负担(DESeq2提供独立过滤自动完成此步骤)86低表达过滤与比较设置过滤低表达基因:在差异分析前剔除在绝大多数样本中count值极低的基因,以减少统计噪声和多重检验罚则;DESeq2的独立过滤会根据均值自动滤除信息量不足的基因比较方案设置:对于多组实验,需要明确希望比较的组别组合。例如三组实验(A、B、C)可设置结果提取contrast为BvsA、CvsA等;DESeq2通过results(…,contrast=…)指定比较,edgeR使用makeContrasts定义对比倍数变化阈值:在统计显著基础上可增加生物学意义门槛,如要求|log2FC|>1;DESeq2支持设置lfcThreshold并提供shrinkage方法对log2FC进行收缩,以降低低表达基因的foldchange夸大效应结果输出解读:差异分析产生结果表列出每个基因的log2FC、p值、padj,可筛选出显著基因名单用于后续富集分析;同时建议保留全基因结果用于无需阈值筛选的分析(如GSEA)87差异基因结果解读上调/下调基因概览:统计显著上调和下调基因各有多少,了解总体趋势(如疾病组大量免疫相关基因上调,可提示免疫激活)显著性与变化幅度:结合p值和倍数变化(log2FC)综合评估基因的重要性。警惕大样本下微小变化也可显著,重点关注显著且变化幅度较大的基因关键基因识别:查看最显著或log2FC最大的基因列表,可能发现潜在的关键调控基因或疾病标志基因功能初步解析:对差异基因进行功能注释,观察上调基因是否富含某类功能(如细胞因子、免疫通路),下调基因涉及的生物过程(如正常皮肤功能相关)结果验证与比较:将DEG名单与已有文献或数据库中的已知基因列表比较,寻找一致性以增强可信度;对于重要基因,可设计qPCR等实验验证其表达差异88差异结果可视化:火山图火山图(Volcanoplot)将每个基因的log2倍数变化(横轴)与其显著性(-log10p值,纵轴)绘制为散点,用于直观呈现差异基因分布大部分基因在火山图中位于靠近横轴的位置(不显著或低foldchange),显著差异基因出现在图的上方两侧区域右上方象限聚集显著上调基因,左上方象限聚集显著下调基因;点距纵轴越高表示显著性越强,距原点越远表示倍数变化越大火山图能够快速传达差异基因数量及变化幅度整体情况,常在图中标注若干关注的基因名称以突出重点信息在图中,发现IL36G在疾病样本相较于健康样本中,差异表达倍数最高,显著性最强。89聚类热图、基因表达图聚类热图对显著差异基因进行双向层次聚类(基因和样本),显示基因表达在不同样本间的模式柱状图或箱线图比较两组中某关键基因的表达量差异:柱状图展示两组平均表达及误差线,标注统计学显著性;箱线图展示表达分布差异90功能富集与通路分析概述差异表达基因列表本身难以直接解读,需要进一步归纳总结其生物学意义功能富集分析通过统计检验,判断DEG列表是否显著集中于某些功能类别(如GO术语),揭示这些基因共同参与的生物学过程通路分析检测DEG是否富集在特定分子信号通路中(如KEGG、Reactome通路),从系统层面了解哪些信号通路受影响富集分析通常采用超几何检验或Fisher精确检验计算富集p值,并对多重测试进行FDR校正进行富集分析需选择恰当的背景基因集(如实验中检测到的基因全集),以避免由测序偏好等技术因素导致的假富集通过富集和通路分析,可将数百上千的差异基因浓缩为若干生物学主题,帮助解释实验条件下发生了哪些主要的生物学变化91基因列表准备与背景设定进行富集分析前,需确定输入的基因列表(通常是显著差异表达基因集,可分别考虑上调和下调基因)以及背景基因集合背景集指本实验中有检测证据的所有基因,一般取差异分析中表达量达到一定水平的基因全集;选择合理背景可避免富集结果的偏差若背景选取过大(如全基因组)而实际测不到所有基因,可能低估技术偏倚带来的影响;过小则可能高估富集显著性92GO功能富集分析(ORA)基因本体论(GeneOntology,GO)提供标准化的基因功能分类体系,包括生物学过程(BP)、分子功能(MF)、细胞组分(CC)三大领域GO富集分析常采用过度表示分析(ORA):检验给定基因列表在某个GO术语下出现的频率是否高于随机预期(通常用超几何分布检验)常用工具:在线平台如DAVID、Enrichr、Metascape,或R包如clusterProfiler(enrichGO函数)、topGO等,可输入基因列表和背景集,输出显著富集的GOterm列表及p值、FDR富集结果需进行FDR校正,筛选显著GO项(如FDR<0.05);解读时关注术语的具体含义和层级结构,较具体的GOterm往往更贴近生物学机制例如银屑病上调基因可能富集于“免疫反应”、“炎症因子活性”等GOBP术语,下调基因富集于“表皮细胞分化”等过程,与疾病特征相符93通路富集分析(KEGG/Reactome)通路富集分析利用KEGG、Reactome等通路数据库,检验差异基因是否聚集在某些分子通路中,例如免疫信号通路或代谢途径clusterProfiler的enrichKEGG函数可针对KEGG执行富集分析(需提供物种代码和基因ID);Reactome分析可用ReactomePA包或Enrichr等富集结果输出通路名称、富集基因数、p值、FDR等指标,同样需要FDR校正筛选显著通路结果解读着重关注显著富集的关键通路名称及其生物学意义:例如银屑病上调基因可能富集于“TNF信号通路”、“IL-17信号通路”等已知致病通路94基因集富集分析(GSEA)GSEA(基因集富集分析)无需预先筛选基因,使用所有基因根据差异表达统计量排序,检测预定义的基因集是否在排序顶端或底端富集经典GSEA算法:将基因按如log2FC或统计检验值降序排列;对于每个给定基因集计算累加和曲线,观察其成员基因是否总体集中在排序前列或后列,通过置换检验评估富集显著性GSEA结果以归一化富集分数(NES)衡量富集强度,并给出p值和FDR以判断显著性。NES>0表示基因集整体上调,<0表示下调优势:GSEA可发现变化一致但幅度较小的协同信号。例如多种免疫相关基因均小幅上调,则“免疫反应”基因集可表现出显著整体富集上调95差异可变剪接概述除了基因整体表达水平改变,可变剪接(AlternativeSplicing)也是转录组重要调控层次:同一基因前体mRNA经不同剪接可产生功能不同的转录本在比较两种条件时,可能出现差异剪接事件:即某些外显子在条件A中更常被保留,而在条件B中更常被跳过,导致两条件生成的转录本构成比例不同BulkRNA-Seq数据可用于检测剪接模式差异,但相较基因整体表达分析需要更精细的方法和更高测序深度支持差异剪接分析提供基因调控的另一视角:即使总表达无变化,不同条件下转录本构型改变也可能影响功能96可变剪接事件类型外显子跳读(SkippedExon,SE):某外显子在一种条件下包含于mRNA,在另一条件下被剪掉(最常见的可变剪接形式)互斥外显子(MutuallyExclusiveExons,MXE):一对外显子互相排斥,mRNA只保留其中一个;条件差异可改变偏好包含哪一个外显子替代5’剪接位点(Alternative5’SpliceSite,A5SS):某外显子5’端存在两个可用剪接位点,选择不同位点会改变外显子起始位置和长度替代3’剪接位点(Alternative3’SpliceSite,A3SS):类似A5SS,在外显子3’端有多个剪接选择,使用不同终止位点导致外显子长度不同内含子保留(RetainedIntron,RI):在一种条件下内含子未被剪出而保留在成熟mRNA中,在另一条件下该片段被剪接掉作为内含子这些剪接模式的变化可能影响蛋白质产物:如外显子跳读删除关键结构域,内含子保留引入终止密码子导致mRNA被NMD途径降解97可变剪接事件类型98差异剪接分析方法与工具分析思路一:事件层面分析。直接鉴定并比较特定类型的剪接事件在两组中的包含率差异。工具如rMATS可检测SE、MXE、A5SS、A3SS、RI等事件,计算每组的PSI值(PercentSplicedIn)及组间ΔPSI,并给出统计学显著性rMATS支持生物学重复样本,采用贝叶斯模型估计组内变异和技术不确定性,输出每类事件的列表(包括平均PSI、ΔPSI、p值、FDR),可根据FDR<0.05且|ΔPSI|达到阈值筛选显著差异事件分析思路二:转录本层面分析。先重建或定量所有可能转录本,然后比较同一基因在不同条件下的转录本表达比例变化。可用Salmon/Kallisto得到转录本TPM,再用Sleuth、DRIMSeq或edgeR的diffSplice等方法检测异构体使用差异转录本层分析能发现基因总体表达不变但剪接构成变化的情况,但因转录本数量庞大且相互高度相似,分析复杂、结果解释困难,一般在事件层面发现显著剪接基因后才深入转录本层验证99差异剪接分析实施(rMATS)输入数据:每个样本的比对结果BAM文件、样本分组信息,以及参考基因注释文件(GTF,用于定位基因外显子位置)rMATS通过解析BAM的CIGAR和Junction信息,识别reads跨越的剪接位点和外显子覆盖情况,从而量化每种剪接事件在各样本的包含水平运行参数:指定测序类型(单端/双端)、读长和片段长度分布;双端数据提供插入片段长度平均和标准差,可提高PSI估计精度;要求每组至少有2个重复样本以估计组内变异输出结果:rMATS生成各类型事件的结果表(如SE事件输出SE.MATS.JC.txt),列出事件具体信息(基因名、外显子坐标等)、两组平均PSI、ΔPSI、p值和FDR分析完成后根据设定阈值筛选差异剪接事件列表,如FDR<0.05且|ΔPSI|>0.1的事件,并结合基因注释确定是哪一个基因的哪个外显子发生剪接改变100差异剪接结果解读确定发生显著差异剪接的基因,并分析这些剪接变化可能带来的功能影响功能影响:查阅受影响外显子编码的蛋白区域是否为关键功能域。例如某激酶基因缺失一个外显子导致丧失催化位点,可能使蛋白活性下降或消失调控因素:如果观察到广泛的剪接模式变化,可考虑是否由剪接因子表达改变所致。查看差异表达结果中是否有已知剪接调控因子显著变化(如SF系列蛋白)表达与剪接的关系:有些基因既是差异表达基因又发生剪接变化,需要分开解读:表达量改变影响该基因整体产物水平,剪接改变则影响其产物的变体构成101共表达网络分析(WGCNA)概述基因共表达网络分析根据基因在不同样本中的表达相关性构建网络,识别协同表达的基因模块,揭示潜在的调控机制核心思想:若一组基因在各样本中的表达起伏高度相似(共表达),则可能受相同调控或参与同一生物过程,可视为一个共表达模块常用方法是加权基因共表达网络分析(WGCNA),可将上千基因按表达相似度分组,构建无尺度网络并划分模块WGCNA为每个模块计算模块特征基因(ME),即模块内基因表达矩阵的第一主成分,用单一值代表模块在各样本中的表达水平通过将模块特征基因与表型数据相关联,可以识别与感兴趣性状相关的模块,提供从系统水平理解复杂表型的手段共表达网络分析拓展了差异表达的视角,可发现多个基因协同变化的模式,有助于挖掘关键调控网络和核心基因102WGCNA网络构建基因筛选:选择表达数据质量较高且具有变异的基因集进行网络构建(如方差最高的前5000基因),减少噪声干扰相关矩阵:计算所选基因两两之间的Pearson相关系数矩阵,取绝对值作为共表达相似度软阈值β选择:使用pickSoftThreshold函数测试多个β值对相关性矩阵进行加权后的无尺度网络拟合度,选择使相关性分布接近无尺度特性(R^2>0.8)的β(通常在4~12范围)根据选定β将相关系数按指数权重计算加权邻接矩阵,强化强相关(如r=0.8权重接近1)并弱化弱相关(如r=0.1权重接近0)基于邻接矩阵计算拓扑重叠矩阵(TOM),衡量任意两基因共同邻居的程度。TOM综合考虑间接连接,提高模块检测稳健性103WGCNA模块识别对TOM矩阵进行层次聚类,得到基因聚类树状图(dendrogram)使用动态剪切算法(dynamictreecut)按树状图分支将基因划分为不同模块,可设置最小模块大小(如30)避免模块过于细碎计算各模块的模块特征基因(ME),即模块基因表达第一主成分,代表模块在每个样本中的整体表达模式模块划分后,进一步计算模块间相关性。如发现部分模块的ME彼此高度相关(例如Pearson相关>0.8),可用mergeCloseModules函数按设定阈值合并这些相似模块模块数取决于数据结构和参数选择,一般得到数个至数十个模块,每个模块对应一组潜在共调控的基因基因聚类树状图(dendrogram)104模块-性状关联分析获得共表达模块后,通过关联分析寻找与表型性状显著相关的模块计算每个模块特征基因(ME)与外部性状的相关系数及p值,汇总绘制模块-性状相关性热图(模块为行,性状为列,单元格填相关系数并以星号标注显著水平)查看哪些模块与研究关注的性状高度相关。例如银屑病数据中,可能发现某模块ME与“疾病vs正常”二分类高度正相关(r≈0.9),表示该模块基因在疾病组一致上调通过模块-性状关联,可将共表达结果与具体生物学问题联系起来,锁定最相关的功能模块模块-性状相关性热图105模块功能注释为解读模块的生物学含义,提取模块内基因列表进行功能富集分析(类似差异基因富集),寻找模块显著关联的GO术语或通路基于富集结果可以给模块贴标签:例如一个模块富集角质形成相关基因,可称为“角质形成模块”;另一个模块富集免疫应答基因,可称为“免疫模块”模块功能注释表明不同模块对应不同生物学过程,说明疾病状态下多个通路发生改变通过这些注释,研究者可将复杂的共表达网络简化为若干具有生物学意义的功能模块,为进一步研究提供方向106枢纽基因识别(Hubgenes)枢纽基因是指在共表达模块中连接度最高的基因,即与模块内多数基因高度相关的核心基因计算每个基因与所在模块ME的相关性(即kME值),kME越接近1表示该基因在模块中越居于网络中心一般将模块内kME排名前1-5%或设定阈值(如kME>0.8)的基因作为hub基因候选Hub基因往往在调控上举足轻重,可能是模块功能的关键调节者或标志物可检验这些hub基因在差异分析中是否也显著(如既是DEG又是hub),或查阅文献看其是否在相关生物过程中发挥关键作用对尚无文献报道的重要hub基因,值得进一步功能研究,有望成为新的疾病机制洞察或治疗靶点107BulkRNA-Seq其他应用除差异表达和剪接分析,BulkRNA-Seq数据还可用于变异检测:在转录本中发现SNP、INDEL或基因融合等,但需额外考虑测序覆盖和验证假阳性新转录本发现:利用转录组组装算法(如StringTie)将reads拼接,可鉴定未注释的转录本或基因,丰富基因注释信息RNA编辑分析:比较DNA和RNA序列,寻找RNA水平的核苷酸编辑(如A-to-I编辑)事件,揭示转录后修饰层面的变异表达模式聚类:在时间序列或剂量梯度实验中,对基因进行聚类可识别不同动态表达模式,为共调控基因组提供线索调控网络推断:结合表达数据与先验知识,尝试重建基因调控网络(如转录因子与靶基因关系),但因因果关系难确定,通常需配合实验验证108组学整合与未来展望多组学整合:将转录组数据与蛋白质组、代谢组、表观遗传组等结合分析,可交叉验证发现并提供全局视角。例如验证DEG在蛋白水平是否变化,或关联转录变化与染色质可及性改变单细胞与空间转录组:新兴单细胞RNA-Seq和空间转录组技术提供细胞异质性和空间组织结构信息,未来可能与bulk数据互补使用,以多尺度揭示生物学机制机器学习应用:越来越多研究使用机器学习从高维转录组数据中提取模式,用于疾病分类、预后预测和药物靶点发现等,提升数据驱动的发现能力公共数据库与大数据:海量公共转录组数据(如TCGA、GEO)的共享推动了Meta分析和再利用,通过云计算等手段,可整合不同研究以获得更具统计力的结论转录组学分析方法不断发展,未来将涌现更自动化、智能化的分析流程,使科研人员能更高效地从数据中获取生物学洞见109谢谢!110哈尔滨工业大学
第3章单细胞转录组学数据分析111课程教学目标了解单细胞转录组测序原理、技术背景及实验流程了解单细胞转录组数据的构成、数据格式掌握完整的单细胞转录组数据分析流程了解常用的单细胞数据整合方法HowtoThinkLikeaBioinformaticianHowtoAnalyzeSingle-cellData112第1章学习内容单细胞转录组测序简介与相关技术单细胞转录组数据结构单细胞转录组基础分析流程单细胞数据整合113第一节:单细胞转录组测序简介与相关技术什么是转录组?什么是单细胞转录组?转录组是一个生物体、组织或细胞内所有RNA分子的集合。单细胞转录组是指对单个细胞内的全部RNA分子进行测量和量化的结果。为什么同一个体内的不同细胞拥有完全相同的DNA基因组,但功能和形态却截然不同?
这是由于转录了不同的RNA从而合成不同的蛋白质,即中心法则:114第一节:单细胞转录组测序简介与相关技术为什么进行单细胞转录组测序?为了更精确(在单细胞水平)地理解细胞的功能差异和多样性。单细胞转录组测序流程单细胞的分离与捕获样本扩增与文库制备测序与数据分析。115第一节:单细胞转录组测序简介与相关技术10xGenomicsChromium平台测序技术组织解离制备单细胞悬液构建GEMs制备cDNA构建文库高通量测量数据分析116第一节:单细胞转录组测序简介与相关技术单细胞转录组测序技术分类与对比根据测序策略技术类型技术说明代表技术全长转录本测序捕获整个mRNA转录本的信息,适用于可变剪接分析、等位基因特异表达等精细结构研究SMART-seq、SMART-seq2、SMART-seq3标签式测序仅测定转录本的3'或5'端,提高通量,适合大规模细胞测序Drop-seq、inDrop、10xChromium117第一节:单细胞转录组测序简介与相关技术单细胞转录组测序技术分类与对比根据分离方式技术类型技术说明代表技术基于细胞捕获平台通过微流控芯片、纳米井等方式进行细胞封装10xGenomics、FluidigmC1、Seq-Well基于流式分选(FACS)借助荧光标记抗体对细胞进行高通量分选SMART-seq2(常与FACS结合)基于液滴微流控将单个细胞和条形码微珠共同包裹进油滴Drop-seq、inDrop、10xChromium基于空间原位测序不进行细胞分离,在组织切片中原位测序Slide-seq、MERFISH、SeqFISH118第一节:单细胞转录组测序简介与相关技术单细胞转录组测序技术分类与对比根据分辨率分辨率技术说明代表技术单细胞水平以完整单个细胞为基本单位,提取其全部或大部分RNASMART-seq2、10xGenomicsChromium、Drop-seq、inDrop单核水平以单个细胞核为提取对象,仅测定核内RNA(尤其是未剪接的pre-mRNA)snRNA-seq(singlenucleusRNA-seq)亚细胞水平不仅识别出RNA分子属于哪个细胞,还可定位其在细胞内具体位置SeqFISH、MERFISH
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026江西省残疾人文体中心招聘残疾人运动队教练员运动员考试备考试题及答案详解
- 2026浙江金华武义县口腔医院招聘护理人员、消毒供应室清洗工、消控室工作人员3人笔试备考题库及答案详解
- 2026年甘肃省天水市武山县洛门镇中心幼儿园见习生招聘笔试模拟试题及答案详解
- 2026年云南睿城建设项目管理有限公司、云南朗锐工程咨询服务有限公司招聘(6人)考试备考题库及答案详解
- 2026年交口县中小学幼儿园教师招聘考试参考题库及答案解析
- 2026年永昌县事业单位人员招聘考试参考题库及答案解析
- 2026杭州市富阳区卫健系统事业单位编外招聘48人笔试模拟试题及答案详解
- 2026年芜湖市水务局所属事业单位招聘编外工作人员笔试模拟试题及答案详解
- 2026年开阳县网格员招聘考试参考题库及答案解析
- 2026年湖南北师大版高一英语必修一第四章阅读理解专项训练习题
- 实验动物与动物实验
- 眼的胚胎发育课件
- 临床执业医师第四单元
- 工会职工运动会活动方案设计
- GB/T 18910.41-2024液晶显示器件第4-1部分:彩色矩阵液晶显示模块基本额定值和特性
- 医学统计学:第一章-医学统计学绪论
- 新媒体视觉设计介绍课件
- 介入手术室患者安全转运
- 第2章 CR400AF动车组司机室设备操作《复兴号动车组司机操作及整备》教学课件
- 《组装作业指导书》
- 围棋启蒙教程
评论
0/150
提交评论