生物信息学分析专题方法技术课件_第1页
生物信息学分析专题方法技术课件_第2页
生物信息学分析专题方法技术课件_第3页
生物信息学分析专题方法技术课件_第4页
生物信息学分析专题方法技术课件_第5页
已阅读5页,还剩31页未读, 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

BIOINFORMATICS生物信息学分析方法与技术专题序列比对·基因组·转录组·结构预测·智能平台2026年课程导览01基础方法分析框架与数据质控意识02序列比对核心算法与BLAST工具实战03基因组分析测序技术与变异检测流程04转录组分析RNA-seq定量与差异表达05结构预测AlphaFold与AI结构预测06平台前沿智能平台与最新进展CHAPTER基础方法从数据到结论的完整路径六大步骤串联起生物信息学分析的全流程01生物信息学的学科定位生物信息学是计算机科学、统计学与生物学的交叉领域,核心任务是处理、分析和解释大规模生物数据。任何生信分析都围绕三个问题展开:质量是否可靠、来自基因组哪个位置、生物学意义何在先回答这个问题,整个分析流程才不会走偏。质控、比对与注释三大环节,本质上就是在逐一回答这三问。三大支柱生物学提供问题与数据计算机科学提供算法与算力统计学提供检验与推断方法数据对象基因组序列蛋白质序列表达谱与多组学数据六大步骤串联全流程生物信息学分析可概括为六大步骤,环环相扣1数据预处理清洗原始测序数据,去除噪音与接头,进行格式转换2序列比对将序列与参考数据库比对,识别相似性与同源性3基因组注释预测基因位置、结构与功能,识别调控元件4基因表达分析定量与差异表达分析,揭示表达模式与调控网络5蛋白质结构预测从序列推断二级、三级结构,探索功能6数据可视化以图表、热图、网络图直观呈现结论分析环节核心工具序列比对BLAST、BWA表达分析DESeq2、edgeR可视化ggplot2、Cytoscape理解步骤间的

输入输出关系

,是掌握流程的关键。数据质控是第一道关测序数据到手后,第一步不是分析,而是判断数据本身质量是否可靠四类质控检查指标质控CHECKLIST碱基质量分布:各位置碱基质量是否随测序延伸而下降GC含量:是否存在明显偏离预期的核酸组成接头污染:是否有未去除的测序接头序列重复率:序列重复是否异常,是否存在技术偏差常用工具组合TOOLKITFastQC:可视化展示数据质量,快速生成质控报告fastp/TrimGalore:批量清洗数据、去除接头与低质量碱基MultiQC:汇总多样本质控结果工具生态总览分析环节主流工具核心用途数据质控FastQC、fastp质量评估与清洗序列比对BLAST、BWA、Bowtie2序列定位与同源搜索转录组比对STAR、HISAT2RNA-seq剪接感知比对差异表达DESeq2、edgeR差异基因识别功能富集clusterProfiler、DAVIDGO/KEGG通路分析结构预测AlphaFold、SWISS-MODEL蛋白质三维结构预测可视化ggplot2、Cytoscape热图、网络图绘制先明确环节,再匹配工具——同一环节往往有多款工具可选,理解各自算法特点才能做出合适决策。CHAPTER序列比对寻找序列间的相似与同源从全局比对到局部比对的算法演进02序列比对算法演进脉络这一演进的核心逻辑是从追求最优转向兼顾效率1970Needleman-Wunsch全局比对动态规划求解完整序列首次用动态规划求解两条完整序列的最优比对1978DayhoffPAM置换矩阵氨基酸替换打分依据为氨基酸替换提供打分依据1981Smith-Waterman局部比对聚焦高相似片段聚焦高相似片段而非全序列1990AltschulBLAST种子-延伸启发式提速用种子-延伸启发式策略大幅提速数据库搜索BLAST的核心原理E-value越小越可靠E-value表示随机匹配出现在数据库中的概率,E-value越小,比对越可靠,通常以小于

1e-5

作为显著阈值。Step1种子匹配种子匹配将查询序列切分为短词(蛋白默认k=3三肽,DNA默认k=11),在数据库中快速定位完全匹配区域。Step2种子扩展种子扩展用类似

Smith-Waterman

的动态规划向两侧延伸,计算匹配得分。Step3HSP筛选HSP筛选保留

高得分片段对,过滤低质量比对。Step4统计评估统计评估计算

BitScore

与

E-value,评估匹配的统计显著性。Step5结果输出结果输出按显著性排序输出比对报告。五种程序覆盖双向搜索程序查询序列目标数据库典型场景blastn核酸核酸库DNA序列同源搜索blastp蛋白质蛋白质库蛋白功能注释blastx核酸(自动翻译)蛋白质库核酸编码序列功能预测tblastn蛋白质核酸库(自动翻译)在基因组中找蛋白同源区tblastx核酸(翻译)核酸库(翻译)跨物种翻译区比对blastn与blastp使用频率最高。选型关键是明确查询序列类型与搜索目标,翻译型程序会自动按六种读码框翻译,适用于编码区功能探索。本地与在线两种模式BLAST提供在线版与本地版两种使用模式,各有适用场景两种模式的适用选择探索公共数据用在线版,自有私有数据用本地版。本地版尤其适合处理成百上千条序列的批量任务。A在线版比对直接访问

NCBI官网,与大型公共数据库比对范围可限定物种范围(如人

taxid9606),减少无关结果溯源适合确定未知序列的来源与同源基因B本地版流程两步走:先

makeblastdb

建库,再执行比对命令私有适合在未发表基因组库中寻找同源基因脱网不依赖网络,安全性与可控性更高在线版:探索公共数据本地版:自有私有数据CHAPTER基因组分析解读生命遗传密码从测序技术到变异检测的完整链条03测序技术的历史沿革基因组测序技术经历了三代变革,深刻改变了分析范式基因组测序技术经历三代变革1977桑格测序奠基2001人类基因组草图2005高通量测序仪2016单分子实时测序技术主线:短读长高通量长读长高准确性二代测序擅长变异检测,三代测序擅长复杂基因组组装,二者常需结合使用双脱氧末端终止法,奠定测序技术基础发布首个草图,中国团队完成

1%

测序任务测序效率实现数量级提升PacBio应用,长读长跨越重复序列区域从头测序与重测序根据是否有参考基因组,基因组测序分为两大类从头测序无参考基因组测定全序列针对无参考基因组的物种鸟枪法+高质量组装依赖鸟枪法与高质量组装策略新物种解析适用于新物种基因组解析重测序有参考基因组识别遗传变异基于已知参考基因组,识别个体间遗传变异SNP/CNV/结构变异检测SNP、CNV、结构变异等群体与疾病研究适用于群体遗传与疾病机制研究重测序工具链四件套全基因组重测序核心流程由四款开源工具构成,均可通过conda一键安装:FastQC质控fastp清洗BWA比对Picard去重GATK4变异检测结果过滤构建BWA索引生成的文件不可删除,ReadGroup参数直接影响后续GATK分析。工具核心功能注意事项BWA序列与参考基因组比对C语言编写,需编译支持SamtoolsBAM/SAM文件排序索引与Picard功能互补Picard标记重复序列、格式处理需Java1.8以上环境GATK4变异检测、基因型推断全开源,适配集群变异检测各环节耗时四环节计算耗时占比对比序列比对与变异检测合计占计算耗时约七成以上;质控与过滤耗时短却必不可少,比对与变异检测是算力核心四类变异检测算法四类算法横向对比,每类标注代表工具与核心思路MutScank-mer匹配型直接扫描原始序列,适合靶向区域快速分析LoFreq局部重比对型构建错误模型,提高低频变异灵敏度FreeBayes贝叶斯统计型概率模型处理复杂测序特征DeepVariant机器学习型神经网络提升检测准确性基因组分析的临床应用“从单一变异检测走向多组学整合,是基因组分析临床应用的核心趋势。”“基因组分析已从研究走向临床应用,三个典型方向正在落地。”遗传病分子诊断全外显子测序获澳洲临床实验室认证,用于不明原因遗传病的分子诊断。感染病病原检测宏基因组测序(mNGS)无偏倚检测细菌、病毒、真菌,2023年获中国专家共识推荐。多组学联合测序Illumina5-碱基方案一次检测同步获得基因组与甲基化组信息,文库制备约

6小时。CHAPTER转录组分析捕捉基因表达的动态从原始数据到差异基因的九环节流程04RNA-seq建库策略与类型RNA-seq按建库策略分为四类,决定转录组研究对象。建库策略富集方式适用对象PolyA+富集捕获带polyA尾的mRNA编码基因表达分析rRNA去除去除核糖体RNA后测全转录本非编码RNA分析单细胞RNA-Seq每个细胞单独建库细胞异质性与图谱时序转录组多时间点采样测序发育与药物动态研究“转录组分析对象不限于mRNA,还包括lncRNA、miRNA、circRNA等非编码RNA。建库策略决定了能看到什么。”上游定量经典工具链从原始数据到表达矩阵的标准四环节路径。注意:经典流程速度快,适合大多数场景;升级版用TrimGalore+STAR,趋势一致但数值略有差别。1质量控制fastp处理下机数据生成

Cleandata2序列比对HISAT2Cleandata比对到参考基因组3基因定量featureCounts统计每个基因的reads数4结果汇总MultiQC汇总质控FPKM/TPM/CPM计算器完成标准化最终输出为表达量矩阵——每一行是基因、每一列是样本的计数表。从这一刻起,数据才真正变成可以被统计、比较和建模的数字。差异表达分析的核心拿到表达矩阵后,差异表达分析回答"哪些基因在不同条件下显著变化"常用工具

DESeq2

与

edgeR

均基于负二项分布建模统计检验结合多重比较校正,有效区分真实变化与随机波动关键提醒:DESeq2必须输入原始count,而非TPM或FPKM,否则会破坏其内置的统计假设标准筛选阈值通常为

FDR小于0.05

且

|log2FoldChange|大于1FoldChange实验组表达量相对对照组的倍数变化,取log2便于对称处理测量变化幅度FDR/P-adj校正后的P值,控制同时对两万个基因检验产生的假阳性控制假阳性无参转录组与批次控制PCA结果是下游一切差异结论可信度的前提保障,这一步不能省略。无参考基因组怎么办?转录本直接定量Kallisto基于k-mer假比对的快速定量Salmon无需比对的准确定量,速度更快如何验证样本分组有效?PCA质控同一组的样本应在主成分空间中聚在一起不同组的样本应明显分开若分组无法区分,说明存在批次效应或生物学差异不足功能富集与可视化富集分析回答“这些基因共同在做什么”,是差异表达走向机制解释的关键一步。功能富集分析GO·KEGG·工具链GO富集基因参与的生物学过程、分子功能与细胞组分KEGG富集基因所在的代谢与信号通路常用工具clusterProfiler、DAVID、Metascape,支持

GSEA

基因集富集结果可视化表达模式·样本验证火山图横轴

log2FoldChange、纵轴显著性,直观呈现上下调基因聚类热图展示差异基因在样本间的表达模式PCA图与箱线图补充样本层面的验证CHAPTER结构预测AI破解蛋白质折叠难题从实验解析到智能预测的范式变革05蛋白质折叠的历史难题序列决定结构,反推却无解核心难题蛋白质功能完全由其三维结构决定:酶的结构决定催化活性,抗体的结构决定识别特异性。从20世纪60年代起,科学家就知道氨基酸序列决定三维结构,但从序列反推结构却成了无解难题。难题所在计算难点一条普通蛋白质链的可能折叠方式数量堪比宇宙中的原子总数,传统计算方法无法穷尽。传统手段的局限实验瓶颈过去的实验手段——X射线晶体学、冷冻电镜、核磁共振——不仅成本高昂、耗时数月甚至数年,还需要极高的实验技巧。半个多世纪的差距现实鸿沟已解析全球解析出的蛋白质结构:不过几十万种自然界已知蛋白质数量:已超过

2亿AlphaFold2的诺奖级突破92.4分AlphaFold2得分将预测精度从近60%提升,真正解决蛋白质折叠问题。+32.4较AlphaFoldv1提升版本CASP竞赛GDT中位得分AlphaFoldv1CASP13(2018)77.4AlphaFold2CASP14(2020)92.42020年AlphaFold2在CASP14竞赛中预测精度达原子级别,被《科学》评为

2020年十大科学突破之首。2024年,核心开发者哈萨比斯与詹珀因此荣获诺贝尔化学奖,这是人工智能首次登上自然科学诺奖领奖台。AlphaFold两代模型CASP竞赛GDT得分对比AlphaFold3与开源生态DeepMind与欧洲分子生物学实验室(EMBL)合作建立开放结构数据库,已提供超过

2亿个预测结构,被全球数百万研究人员广泛使用,极大加速了生命科学研究与药物发现进程。AlphaFold的核心价值不仅在于算法突破,更在于通过开源开放让结构预测能力惠及整个科研界。复合物预测2024从蛋白质单体扩展到蛋白质-DNA、蛋白质-RNA、蛋白质-配体复合物端到端预测2024首次实现生物分子互作的端到端预测Nature登顶2024覆盖生命活动绝大多数分子交互场景国产模型与混合策略AlphaFold之外,结构预测领域呈现出多元技术路径:Protenix-v14项发布方字节跳动

2026年2月发布方法特点全原子预测蛋白质、核酸及小分子配体开源Apache2.0

开源关键性能多项基准测试达到或超越AlphaFold3开源ESMFold2项方法特点基于大语言模型直接推断残基接触图关键性能预测速度较AlphaFold快约

60倍大语言模型D-I-TASSER3项研发方南开大学研发方法特点整合深度学习与蒙特卡洛模拟关键性能多结构域蛋白预测精度提升

2.8%混合策略同源建模与结构预测应用同源建模的适用边界当目标序列与已知结构蛋白的序列相似度达到一定阈值时,可采用传统同源建模:≥30%

可用MODELLER结构叠合优化,70%

时模型可直接用于分子对接研究01典型案例AlphaFold3的典型应用:STING机制解析闫楠团队在《Cell》发表研究成功预测SEC24C与STING二聚体的复合物结构成功解析STING从内质网输出的分子机制展现AI结构预测在解析传统实验难以攻克的无序肽段结合构象上的独特优势CHAPTER平台前沿智能平台重塑分析范式从人跑数据到数据追人的新生态06智能分析平台的崛起2026年9月9日,华大集团推出

DCSCloud

生物智能分析平台,代表生信分析的新范式。推动高质数据生产、标准数据治理、生命科

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论