系统发生分析软件PAUP 和TreePuzzle 使用方法介绍_第1页
系统发生分析软件PAUP 和TreePuzzle 使用方法介绍_第2页
系统发生分析软件PAUP 和TreePuzzle 使用方法介绍_第3页
系统发生分析软件PAUP 和TreePuzzle 使用方法介绍_第4页
系统发生分析软件PAUP 和TreePuzzle 使用方法介绍_第5页
已阅读5页,还剩18页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、本文档下载自文库下载网,内容可能不完整,您可以点击以下网址继续阅读或下载:/doc/6459c42bcfc789eb172dc85e.html系统发生分析软件PAUP和TreePuzzle使用方法介绍系统发生分析软件PAUP和TreePuzzle使用方法介绍安徽农业科学,():,责任编辑金琼琼责任校对王淼系统发生分析软件和使用方法介绍王勇,陈克平,姚勤(江苏大学食品与生物工程学院,江苏镇江;江苏大学生命科学研究院,江苏镇江)摘要系统发生分析被广泛应用于研究不同生物、蛋白质序列的进化关系。和是目前使用较多的系统发生分析软件,但其使用方法较为复杂,

2、不易被初学者掌握。从序列信息模块、序列参数模块、运算命令模块个方面介绍了软件的使用方法,同时也对软件的使用和进化树的编辑与注释方法做了简单介绍。关键词系统发生分析;中图分类号文献标识码文章编号()(,),/doc/6459c42bcfc789eb172dc85e.html,;近年来,系统发生分析被广泛应用于研究不同生物蛋白质序列的进化关系,但由于系统发生分析是对、过去已经发生的进化事件进行模拟,任何软件都不能保证所得出的结论就是真实的进化历史。因此,在进行系统发生分析时,往往需要采用不同的分析方法同时进行。而只有当多种分析方法获得的结果一致时,

3、才可得出一个较为可靠的结论。和是目前使用较多的系统发生分析软件,其中更是国内外不少科技期刊都指定使用的。(,用最大简约法做系统发生分析)既能对序列做邻近归并法最大简约法(,)(,)、和最大相似法(,)分析,又能对蛋白质序列做和分析。则是专门用于构建然而,软件使用方法比较复杂,特进化树的软件。别是版,不能进行菜单操作而需要自己输入命令。;?/doc/6459c42bcfc789eb172dc85e.html;(略去);则是一个版本的软件,使用上有较大的不便之处。初学者在没人指点的情况下,往往感觉一筹莫展。为此,笔者通过研读软件的使用手册和有关资料

4、从序列信息模块、序列参数模块、运算命令模块个方面介绍软件的使用方法,之后对软件的使用和进化树的编辑与注释方法做一简要说明。(略去)(略去)(略去)(略去)(略去)序列信息模块要做分析,首先必须建立文件。文件是软件的可执行文件,后缀名为。一般来说,参数设定模文件包含以下个模块:序列信息模块、块、运算命令模块。在文件中,序列信息模块分两部分,以软件自带示例文件!为例,序列信息如下所示(为简明起见,笔者只采用了原文件中的前条序列,并且略去大多数说明文字以及具体序列,下同)。基金项目作者简介国家自然科学基金资助项目()。王勇(),男,浙江衢州人,在读博士,副研究员,从事昆虫生物信息学研究。通讯作者,研

5、究员,博士生导师,!:;第部分以开始,在后面输入序列的数目,在之后是序列名称列表。第部分以开始,在后面输入序列的长度,/doc/6459c42bcfc789eb172dc85e.html后面是对序列格式的描述,在之下是具体的序列。要注意的是,给出的具体序列要先经过多序列比对,一般可以使用在线程序(:),在比对结果输出选项()中选择“,得到的结果经过适当编排后成为符合文”件要求的序列。另外,上述序列中的点()表示与第条序列中的字母相同,的结果不显示点而显示字母,两收稿日期!卷期王勇等系统发生分析软件和使用方法介绍者是等效的。上述加了下划线的文字是

6、给出序列信息时必须具备的部分,读者在准备自己的序列模块时要注意保留。如果序列由氨基酸组成,只需将“?换成;”“?即可。;”需要说明的是,序列名称最好只由字母和数字组成,其中不能有空格、斜杠、括弧等标点符号,否则程序会报告出错信息。另外在给出序列名称时,名称的长度并没有限制,但在构建好的进化树中只能显示前个字符,所以在给出序列名称时,一定不要使用前个字符都相同的名称,否则在进化树中没办法分辨出来。;其中,第句将总共个碱基的第和第设定为编码区域,第句将序列的剩余部分设定为非编码区域,第、句分别对编码区域的第、个碱基的位置进行了设定(斜杠后面跟数字表示以个字母为与“是互相排除组),最后句分别注明“”

7、的个概念。实际应用中还应加上关于用户类型的设定,可以把“中的模块全部复制到“模块上面。”/doc/6459c42bcfc789eb172dc85e.html”蛋白质序列的参数设定由于组成蛋白质的氨基酸序列参数模块序列参数模块包含一些对序列进行的参数设定,它是有种,不同氨基酸在蛋白质中所起的作用有很大差别,因此,在进行序列间比较时需要对不同氨基酸赋予不同的分值,也就是要采用适当的记分矩阵()。蛋白质的记分矩阵有和个系列。由于和通过在文件中使用命令来实现的。由于序列与蛋白质序列是种完全不同的序列,所以参数的设定应该不同;而对于序列,又需要区分非编码

8、序列和编码序列种情形。矩阵中都含有负数,不能直接在文件中使用,所以需要进行适当的转换,做成子矩阵()。目前已经转换好的只有个,一个是,另一个是非编码序列的参数设定非编码序列参数的设定只需考虑到“转换”与“颠换”之间的差别,可以通过用户类型()进行预先设定。以文件!,个都可以在网页(:以子矩阵为例:)上下载。为例,其中的模块包含下面的内容:;这里,实际上也是定义一种,而且在模块的最后加了命令“,就是将序列中的所:”有氨基酸都按上述子矩阵赋予相应的分值后再进行系统发生分析。实际应用中可以将下载到的子矩阵复制到序列信息模块下面。如果需要使用除/doc

9、/6459c42bcfc789eb172dc85e.html和以外的子矩阵,则应按照所介绍的方法自己制作。;上述模块预先定义了种用户类型,用户类型“,”将“颠换”的权重设为“转换”的倍,用户类型“将“颠”换”的权重设为“转换”的倍。具体采用哪种类型,还需要在后面的运算命令中用命令进行指定。运算命令模块运算命令模块中包含了一系列运算命令,运算命令因;分析目的不同而异。一般而言,进行系统发生分析的目的有种,一种是想了解不同序列之间的进化距离,另一种是判断条或多条序列是否属于直系同源序列()。前者要求得到的进化树能显示树枝的相对长度,而后者需要在进化树的节点()处显示自举检验值()。从中得不到既显示

10、树枝长度又显示自举检验值的进化树,而在其他系统发生分析软件如中是可以的。为了用进行相关分析,需要编写不同的运算命令。编码序列的参数设定为编码序列设定参数时,不仅要考虑“转换”与“颠换”之间的差别,还应将编码区域与非编码区域分开。以文件!为例,其中的参数设定模块包含以下内容:在进化树中显示树枝长度下面的运算命令可以用于构建编码序列的进化树并显示树枝的相对长度(为方便描述,每行前加了数字,实际使用中应去掉):;/doc/6459c42bcfc789eb172dc85e.html;:;安徽农业科学年;和“就行了。改换;”;”过的语句使程序以方式进行搜

11、索()并做自举检验()分析,复本数,保留所有得到的进化树()。语句还是保存得到的进化树,只不过去掉了保存树支长度的选项。用“中相同的设定,将语句”和语句分别做了相应更改,执行完运算命令后得到的进化树如图。;其中,语句的作用是使运算过程中会弹出的窗口自动关闭,以便程序完成后面的运算。语句是将搜索标准()设为距离法(),也就是要构建进化树,当需要构建和进化树时只需将分别改为语句让程序对序列字母按预和即可。设的用户类型“进行赋值,语句让程序在运算中只包”括编码区域,语句让程序为编码区域的第位碱基(如果分析的是非编码序列,则不应包)赋值。含语句和。语句是为进化树设定一个外围组()序列,需要输入一个实际

12、的序列名称()。语句是让程序做启发式搜索(),使用的/doc/6459c42bcfc789eb172dc85e.html复本数()为,序列增加(语句让程序得出一棵共)的方式为随机()。有树()。语句将序列作为进化树的树根。语句将得到的共有树进行保存,保留树支长度(),文件格式为。上述运算命令编写完成后,可以全部复制到序列参数设定模块的下面。这样,一个完整的文件就建好了。执行相应分析时,只需在程序菜单中先打开()该文件,然后再执行(菜单中的)该文件。例如,作者用示例文件!中的前条序列,包含了上述“和“项中的参数设定模块,执行“项中的”运算命令后,

13、得到的进化树如图所示(设为树根)。同样,如果是要构建或进化树,就需要将语句分别改为“或“,同时中的“”要将语句中的“都改成“再是,执行分析。”的运算量要比执行的大得多,而分析又超过分析,所以如果序列数目较大(比如多于条),可将复本数降低到,即将语句中的“设为。”蛋白质序列的运算命令和“中所编写上述“”的运算命令虽然是针对序列而言,但如果分析对象是蛋白质序列的话,只需将语句、去掉即可。的使用方法在中尚不能够对蛋白质序列做分析,因此需要使用诸如或这样的专门软件对蛋白质序列做分析。是一种运算速度较快的在线分析程序(:),其使用方法较为简单,但运算结果需要通过!发送,有一个时间延迟问题。是一种版本的分

14、析软件,/doc/6459c42bcfc789eb172dc85e.html运算速度比较快,可从:!免费下载,下载到的是压缩文件!。可以将该文件保存在电脑盘的根目录下,然后用鼠标右键点击将文件解压到:!文件夹中,解压后的!文件夹中又含有个文件夹,分别是、。序列文件的准备与软件相同,也要求有自己的序列文件格式,而且蛋白质序列文件要以为后缀名(意指),序列要以为后缀名(意指)。程序设计者在文件夹中为需要注意的是,执行上述运算命令后,所保存的进化树文件位于文件相同的文件夹中,文件名默认为所执行的文件名,后缀名为。另外,建议在每完成次分析后对得到的进化

15、树文件进行重新命名。举例来说,假如所执行的文件为,那么在完成次分析后得到的进化树文件为,此时如果构建的是树,则不妨将文件重命名为,以便原文件名可以为保存后续分析(如继续构建树和树)的结果所用。用户提供了示例文件,如、等,实际应用中可用示例文件为模板来准备自己的序列文件。做法是:先将文件的后缀名改成,这样就可以在中打开该文件。例如,经过更改后缀名打开后得到如下结果(为节省篇幅,只显示其中的条序列并略去部分字母):(略去字母)(略去字母)(略去字母)(略去字母)在进化树中显示自举检验值要构建编码序列://doc/6459c42bcfc789eb172dc85e

16、.htmlar的进化树,并在分支处显示自举检验值,需要对运算命令做出相应更改。具体说来,只需要将“中的语句和”语句分别改为“(略去字母)(略去字母)第行的个数字分别表示序列的数目和序列的长度。同样,这里的序列也是经过了多序列比对的。实际上,在使用在线进行比对时,如果在选项中选择“,则得到的结果格式与上面的要求完全相”符,可直接将比对结果复制到文件中,保存后关闭该文件,之后将文件的后缀名改为,还需要把该文件复制到这样,序列文件才算准备好。文件夹中。下载并安装到机中。但由于所提供的编辑功能很弱,笔者建议使用软件(可从免费下载)。执行上述运算命令后保存得到类型的进化树可在中直接打开(选中树文件,点击

17、右键,在“打开方式”中选择)。中提供的编辑功能主要有:对外围组序列置于树根位置();对树的分支位置进行翻转();对树的分支位置进行交换();对序列名称等文字的字体进行设定(菜单里面的选项);对树枝之间的距离、整棵树的宽度、树枝长度的精确度、自举检验值显示位置等进行设定(菜单里面的选项)(图)。需要说明的是,、两项功能只是对分支的相对位置进行了改变,实际上并没有改变序列之间的系统发生关系。程序的运行程序的可执行文件位于文件夹中,文件名为!用鼠标双击该/doc/6459c42bcfc789eb172dc85e.html文件后,即可启动程序,程序等待

18、输入序。列文件名称,比如输入,按回车后出现的界面如图在出现的界面中先列出了条序列的名称,之后是一些。选项等待用户进行参数设定。其中一般需要对外围组解析的步骤数()和替换()、模型()做出设定。设定方法是:在光标处键入相应的字母。例如:设定外围组,则键入字母“,按”回车后程序等待输入的个数字。要设定解析步骤的数目,则键入字母“替,然后输入个数值,比如。”换模型的设定则是通过每次键入字母“并按回车后在预”设的种模型中转换,比如可以按下次后选择模型。有时在中进行编辑后还不能满足要求,如图就是在中做了适当编辑后得到的结果(其原始进化树如图中所示),其中有些数值所处的位置仍然与树枝重叠,此时可点击复制按

19、钮(图中的),然后粘贴到注意,在中需文件中做进一步编辑。先用鼠标右键点击图片,在弹出的菜单中选择“取消组合”后才能进行编辑。例如,图中的进化树经过在中编辑后可得到如图那样的结果。并按回车,在完成所有设定后,在光标处键入字母“”程序即开始运算,获得的进化树会自动保存到文件夹的文件中。需要将该文件复制到其他文件夹中,并将文件的后缀名改为,方可在中打开进化树。树中既显示了自举检验值,又显示了树枝的长度。进化树的编辑和注释在获得了进化树后,对其进行适当的注释也是一件很参考文献时敏基于基因片段与形态特征的矛茧蜂亚科系统发育研究膜翅目茧蜂科昆虫学报,():项贤领,席贻龙,胡好远基于序列探讨臂尾轮属轮虫的系

20、统发生关系/doc/6459c42bcfc789eb172dc85e.html动物学报,():,!,():孙啸,陆祖宏,谢建明生物信息学基础北京:清华大学出版社,:重要的工作。因为在获得的进化树中,那些序列名称超过个字符的名称会显示不完全;树枝长度的显示往往与树枝重叠在一起,而当所分析序列的数目较大(如超过条时),更需要对树枝之间的距离、序列名称的字体大小等做出适当调整,以便能把它放进刊物的一个印刷页面内。分析得到的进化树默认的浏览软件是,可从:网页(下转第页)县、南昌县的数据来自,桐庐江西南昌市统计年鉴县、淳安县的数据来自浙江省杭州市统计年鉴

21、,结语我国农村居民人均纯收入具有一定的空间依赖性,并大邑县、金堂县、新津县的数据来自成都市统计年鉴奉化县、象山县的数据来自,余姚县、浙江省宁波市,延庆县的数据来自北京市统计年统计年鉴鉴沛县、睢宁县、海安县、东海县、涟水县、响水,溧水县、且居民收入的空间差异也比较明显。通过我国农民人均纯收入的理论与实证研究,认为需要引入空间地理数据才能科学地分析农民人均纯收入。农村居民人均纯收入存在空间差异的原因主要是区域本身的空间相关性/doc/6459c42bcfc789eb172dc85e.html及由此带来的频繁的地区经济活动和科技交流,它们对中国经济、

22、社会、文化发展产生了巨大的作用,在很大程度上引起了各地区经济发展和农民收入的空间差异,使得农民收入受到当地经济和相邻区域经济的共同影响。运用空间统计有效地证明了样本县农村人均居民纯收入的空间相关性,根据这些相关性,可以对任何未知县的如想知道年江西省年农民人均纯收入进行预测。宁都县的农村居民人均纯收入,通过它的地理位置和,可以运用空间统计模型预测出它的估计值为县、盐都县、宿豫县、泗洪县的数据来自江苏省统计年鉴隆安县、马山县、横县、融安县、阳朔县、全,武鸣县、州县、龙胜县、荔浦县、藤县、合浦县的数据来自广西壮族自治区统计年鉴,霍山县的数据来自安徽统计年鉴文安县、唐县等县的数据来自于,康保县、河北省

23、统计年鉴表中经、纬度数据取自黄金易园网。基于!的农村居民收入分析运用!分析农村居民收入时发现,这些数据有东西方向趋势,表明数据不平稳。由于不能直接计算出半方差值以经度(),因此先对农村居民收入(千元)进行回归分析。()和纬度()作为自变量,以年农民人均纯收入作为因变量,用!得到传统的回归方程式为元,并计算出其置信区间为(,),可以看出,预测出来的估计值落在区间内。但是运用该文中的模型进行预测时应注意以下几点:由于以县为研究对象,所以模型也只可用来计算以县为基础的农村居民人均纯收入;由于样本县处于及,若选的县的经度、纬度超过这个范围,模型可能失效;为了简便,该文仅用了经度、纬度来作为空间线性预测的距离,而没有把经度、纬度转换为实际的距离。参考文献,/doc/6459c42bcfc789eb172dc85e.html:,:,刘进宝,刘洪农业技术进步与农民收入增长弱相关性分析中国农村经济,():张喆周雷中国农民收入增长实证研究,市场周刊:研究版,():王一兵半参数回归模型在商品房价格指数中的应用研究统计研究,():邹燕芬,陆宇海基于空间自回归模型的中国能源利用效率区域特征分析统计研究,():湖南省统计局湖南省年统计年鉴北京:中国统计出版社江西省统计局江西省年统计年鉴北京:中国统计出版社,杭州市统

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论