生物信息学初步‑序列比对 + 期中复习_第1页
生物信息学初步‑序列比对 + 期中复习_第2页
生物信息学初步‑序列比对 + 期中复习_第3页
生物信息学初步‑序列比对 + 期中复习_第4页
生物信息学初步‑序列比对 + 期中复习_第5页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

生物信息学初步‑序列比对+期中复习一、序列比对基础概念1.什么是序列比对将两条/多条核酸(DNA/RNA)或者蛋白质氨基酸序列,按照碱基/氨基酸位置对齐,找出序列之间的相似区域、保守位点、插入缺失,判断同源关系。同源(homology):来自共同祖先;相似是观测结果,同源是进化推论。相似性(similarity):序列之间匹配程度,可量化。一致性(identity):对应位置字符完全一样。空位(gap,‑):代表插入/缺失(indel)。2.比对分类按序列数量双序列比对pairwise:两条序列多序列比对MSA:3条及以上,找保守结构域按比对范围全局比对Global:从头到尾完整比对整条序列,适合长度接近、整体同源。代表算法:Needleman‑Wunsch局部比对Local:只找相似度最高片段,适合序列长短差异大、只有部分区域同源。代表算法:Smith‑Waterman✨期中高频考点:全局vs局部对比

|项目|全局比对Needleman‑Wunsch|局部比对Smith‑Waterman|

|---|---|---|

|比对范围|整条序列全部对齐|只找最优相似片段|

|矩阵初始化|第一行第一列持续扣空位罚分|第一行第一列全部置0|

|回溯起点|矩阵右下角终点|矩阵中最大分数位置|

|适用场景|整体同源、长度相近|部分片段保守,结构域比对|3.打分矩阵与空位罚分置换矩阵(打分矩阵)DNA:简单匹配/错配矩阵,匹配加分,错配减分蛋白质:PAM矩阵:基于进化距离,PAM1、PAM250;PAM250适合远缘蛋白BLOSUM矩阵:基于保守模块比对,BLOSUM62最常用;数字越大,序列越接近。BLOSUM62>BLOSUM45考点:BLOSUM62是蛋白比对默认矩阵。PAM是从近到远;BLOSUM数字越大,序列相似度越高。空位罚分gappenalty线性罚分:每一个空位扣同样分仿射空位罚分(affine):总空位分=空位开启罚分(gapopen)+空位延伸罚分(gapextend)生物学意义:一次大片段插入缺失,比多次独立单碱基空位更合理,所以开空位扣分重,延长空位扣分轻。4.算法思路(动态规划DP)动态规划:把大问题拆成子问题,构建打分矩阵,计算每个位置最优得分,再回溯得到比对结果。Needleman‑Wunsch

1)初始化矩阵;

2)逐格计算:来自上方(序列1空位)、左方(序列2空位)、斜对角(两个字符比对)取最大值;

3)从右下角回溯,得到全局比对。Smith‑Waterman

1)初始化全部为0;

2)每个格子计算出负数就置0(不允许负分片段);

3)从矩阵最大值位置回溯,遇到0停止,得到局部最优片段。⚠️注意:动态规划算法精确,但速度慢。BLAST不是动态规划,是启发式算法。二、BLAST(必考)BLAST:BasicLocalAlignmentSearchTool,启发式局部比对工具,不是完整Smith‑Waterman,牺牲一点精度换速度。BLAST家族程序输入数据库用途blastnDNA序列核酸库核酸对核酸比对blastp蛋白序列蛋白库蛋白对蛋白blastxDNA序列蛋白库DNA翻译成蛋白,搜蛋白库tblastn蛋白序列核酸库蛋白,核酸库翻译后比对tblastxDNADNA两者都翻译蛋白比对blastx:核酸查询→翻译6种阅读框,搜索蛋白数据库;常用于新测序基因找同源蛋白。BLAST核心步骤把query切分成短词(word,种子k‑mer);在数据库快速命中匹配种子;种子向两边延伸,积累打分;过滤低质量比对,输出结果。BLAST输出关键参数E‑value(期望值):随机情况下得到该比对分数的期望次数。E越小,比对越可靠。E‑value远小于1,说明不是随机匹配。E=0:极显著。bitscore比特分:和数据库大小无关,可跨项目比较。Identity一致性、Positives相似性(蛋白:匹配+理化性质相似)、Gaps空位数。期中选择常考:E‑value含义;E越小同源可信度越高。三、多序列比对MSA1.常用工具:ClustalW/X、MAFFT、MUSCLE

2.用途:识别保守结构域、保守氨基酸位点构建系统发育树输入寻找motif、保守模体

3.输出格式:fasta、aln格式。注意:多序列比对不是简单多次双序列比对,使用渐进式比对:先算所有序列两两距离,构建向导树,从相似度最高的序列逐步合并比对。四、期中常考简答题汇总Q1:全局比对和局部比对的区别,各自适用场景答:全局比对要求两条序列从头到尾全部对齐,Needleman‑Wunsch算法,适合两条序列整体同源、长度接近。局部比对只寻找两条序列内部相似度最高片段,Smith‑Waterman;适合序列长度差异大,只有局部结构域保守。Q2:BLOSUM和PAM矩阵区别PAM:基于同源序列进化模型,PAMn代表n%突变;PAM250适合远缘。

BLOSUM:从保守无空位蛋白模块统计;BLOSUM62是标准矩阵,数字越大,比对的序列相似度越高。Q3:什么是E‑value?E‑value大小代表什么?E‑value:数据库随机搜索得到该比对得分的期望次数。E值越小,说明该比对由随机产生的概率越低,同源关系越可信。Q4:BLAST为什么快?为什么不是直接Smith‑Waterman?Smith‑Waterman动态规划精确,但时间复杂度高,大数据库太慢。BLAST是启发式算法,用种子(k‑mer)快速筛选候选,再延伸比对,牺牲部分精度换取搜索速度,适合海量数据库检索。Q5:什么是仿射空位罚分?为什么生物学上更合理?仿射空位罚分区分空位开启和空位延伸。开启空位扣分大,后续延伸空位扣分小。生物中插入缺失经常一次性出现连续多个碱基,而不是一个个独立空位,该罚分更贴合真实进化。Q6:同源、相似、一致性的区别同源:进化上来自共同祖先,是定性判断;一致性:对应位置字符完全相同;相似性:包含完全匹配加上理化性质相似氨基酸。五、易混淆易错点❌BLOSUM数字越大,适合远缘蛋白→✔数字大适合近缘;BLOSUM45适合远缘。❌BLAST是全局比对→✔BLAST是局部比对启发式工具。❌E‑value越大,可信度越高→✔E越小可信度越高。❌全局比对回溯起点是矩阵最大值位置→✔全局右下角;局部从矩阵最大分数点回溯。blastx:核酸查询序列翻译为蛋白,比对蛋白数据库;tblastn蛋白查询,核酸库翻译。六、典型计算题思路(动态规划简化版)简化DNA打分:匹配+2,错配‑1,空位‑2,全局Needleman‑

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论