中国地方鸡种核酸数据库建设与功能设计_第1页
中国地方鸡种核酸数据库建设与功能设计_第2页
中国地方鸡种核酸数据库建设与功能设计_第3页
中国地方鸡种核酸数据库建设与功能设计_第4页
中国地方鸡种核酸数据库建设与功能设计_第5页
已阅读5页,还剩20页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

中国地方鸡种核酸数据库建设与功能设计报告人:白云峰副研究员单位:江苏省农业科学院第1页汇报内容研究意义与目中国地方鸡种核酸序列数据库初步建设数据获取数据库构成数据分析系统功能设计核酸序列特征一般分析核酸序列相似性搜索系统发生分析系统演示未来展望第2页研究意义中国是世界上生物多样性最丰富国家之一,地方鸡种是我国具有战略意义独特资源。亟需构建该领域拥有本身特色和自主知识产权,与国际主流生物信息数据库接轨专业二级数据库。目前,农业生物信息数据库主要集中在英、美、日等发达国家。我国大多生物学数据库只能提供镜像和索引服务,无自主知识产权,独立开发并能提供丰富资源和工具生物信息数据库平台仍很缺乏。目前国内有关医疗和制药领域生物信息数据库较多,而高质量农业生物信息数据库数量较少,尚无我国专门化地方鸡种生物信息数据库系统。生物信息数据库分布分散且格式不统一,将独立、分散农业生物信息数据库信息整合,使农业生物信息数据库集成化和标准化。第3页中国地方鸡种核酸序列数据库

初步建设数据获取方面基于Agent智能代理本地化数据获取程序;863合作单位数据提供与数据校验;数据分析数据完整性分析数据特性特性值扫描地方鸡种数据筛选第4页中国地方鸡种核酸序列数据库

初步建设数据标准化基于XML中国地方鸡种核酸序列元数据模型;自定义中国地方鸡种数据构造;数据转导与国际主流数据文献格式兼容完成中国地方鸡种核酸序列数据库构造设计第5页系统功能设计目标序列分析(以白银耳鸡1条序列AF128321作为本系统分析处理成果示例)功能设计3个层次:序列组成统计特性分析;本地化序列相同性搜索系统发生分析第6页核酸序列组成统计特性分析密码子计数核苷酸统计转换成互补序列互补统计核苷酸组成统计作图二聚体统计密码子使用偏性CpG岛短序列匹配绘制热红外分布图识别开发阅读框ORFs翻译成对应氨基酸序列序列核苷酸组成与统计核酸序列密码子使用CpG岛特征ORFs识别短序列匹配第7页待分析序列ttgttctcaactacgggaacaattttattttttaacctaactcccctactaagtgtaccccccctttcccccccagggggggtatactatgcataatcgtgcatacatttatataccacatatattatggtaccggtaatatatactatatatgtactaaacccattatatgtatacgggcattaatctatattccacatttctcccaatgtccattctatgcatgatccaagacatactcattcaccctccccatagacagttctaaaccactatcaagccacctaactatgaatggttacaggacataaatctcactctcatgctctccccctaacaagtcacctaactatgaatggttacaggacatacatttaactaccatgttctaacccatttggttatgctcgccgtatcagatggatttattgatcgtccacctcacgagagatcagcaacccctgcctgtaatgtacttcatgaccagtctcaggcccattctttccccctacacccctcgccctacttgccttccaccg第8页密码子计数成果AAA:1

AAC:5

AAG:0

AAT:2

ACA:7

ACC:3

ACG:1

ACT:6

AGA:2

AGC:1

AGG:1

AGT:2

ATA:4

ATC:2

ATG:4

ATT:5

CAA:1

CAC:5

CAG:0

CAT:8

CCA:8

CCC:10

CCG:1

CCT:1

CGA:1

CGC:1

CGG:0

CGT:1

CTA:10

CTC:2

CTG:1

CTT:2

GAA:0

GAC:0

GAG:1

GAT:1

GCA:1

GCC:3

GCG:0

GCT:2

GGA:2

GGC:1

GGG:3

GGT:2

GTA:6

GTC:2

GTG:0

GTT:2

TAA:5

TAC:4

TAG:1

TAT:9

TCA:5

TCC:3

TCG:2

TCT:6

TGA:3

TGC:2

TGG:1

TGT:2

TTA:3

TTC:4

TTG:1

TTT:4第9页密码子使用偏性由于密码子简并性,每个氨基酸最少对应1种密码子,最多有6种对应密码子。不一样物种、不一样生物体基因密码子使用存在着很大差异。多种生物体似乎更偏爱使用某些同义三联密码子(即编码相同氨基酸密码子)。高体现基因密码子使用偏性一般比较大。这些偏好也许与两个原因有关:一是避免使用类似终止密码子密码子;二是这些偏好能够有效地翻译密码子,由于这些密码子对应于生物体中非常丰富tRNA。真实外显子一般能反应出这些偏好,而随机选择三联体序列却不能。第10页密码子使用偏性研究成果表白,基因密码子使用也与基因编码蛋白构造和功能有关。mRNA中稀有密码子使用与蛋白质构造域连接区和规则二级构造单元连接区有关,翻译速率在连接区会减少,说明蛋白质折叠方式与mRNA序列之间存在一定有关性。研究成果还表白,蛋白质三级构造与密码子使用概率有密切关系,通过对密码子聚类分析,能够将具有不一样三级构造蛋白质编码基因提成不一样类,而具有相同三级构造蛋白编码基因则大体聚在同一类中。深入研究发觉,在不一样物种中,类型相同基因具有相近同义密码子使用偏性,对于同一类型基因由物种引发同义密码子使用偏性差异较小。第11页绘制热红外分布图第12页CpG岛分析在人类基因组中有二分之一左右CpGisland与已知管家基因(housekeepinggene)有关联;CpGisland很少出目前不含基因区域和那些发生数次突变基因中;CpG与一种主要化学修饰——甲基化密切有关。第13页短序列匹配在待分析序列中查找特性短片段,如TATABoxTATABox,CAATBox,终止子等第14页识别开放阅读框ORFs开放阅读框(OpenReadingFrame:ORF)是基因序列一部分,包括一段能够编码蛋白碱基序列,不能被终止子打断。开读框架预测常与第一种ATG和终止密码子确实定有关。系统以原核生物和真核生物两种模式识别待分析序列ORFs第15页中国地方鸡种基因序列比对与相同性搜索意义与目标:通过搜索序列数据库,找到与新序列同源已知序列,并根据同源性推测未知序列生物学功能;对于DNA序列,同源搜索尚有助于确定编码区域,确定基因;实现办法:中国地方鸡种核酸序列库+家禽基因组序列库比对搜索;设定全局最优比对算法+局部最优比对算法2种策略Smith-WatermanNeedleman-Wunsch第16页中国地方鸡种系统发生分析(开发中)由于国内学者对国内地方鸡种mtDNA研究较多,数据库搜集到数据较丰富特点。构建地方鸡种mtDNA系统发生专门化分析组件。线粒体DNA非常适合于系统发生分析,由于线粒体DNA从母体完全传到子代,不与父代DNA重组。线粒体DNA具有易分离、进化速度快、母系遗传、缺乏重组和无内含子等特点。使线粒体DNA成为分子系统发育学研究一类主要分子标识。mtDNA控制区即D-loop区为非编码区,不编码蛋白质线粒体DNA中,受到选择压力较小,因此积累了较多突变,如碱基替代、插入、缺失,以及众多串联反复序列等。系统采取非加权分组平均法(UPGMA,unweightedpairgroupmethodwitharithmeticmeans)构建进化树第17页系统功能实现关键技术MatlabBioinformaticToolbox引用ImportsSystemImportsSystem.ReflectionImportsMathWorks.MATLAB.NET.UtilityImportsMathWorks.MATLAB.NET.ArraysImportsComponentNameM文献编写与调试MATLAB与.NET数据类型转换第18页M文献编程示例functionHeatMap(mitochondria)forframe=1:3

figure('color',[111])

subplot(2,1,1);

codoncount(mitochondria,'frame',frame,'figure',true);

title(sprintf('阅读框%d密码子',frame));

subplot(2,1,2);

codoncount(mitochondria,'reverse',true,'frame',frame,'figure',true);

title(sprintf('阅读框%d反义密码子',frame));end第19页调用MATLAB生物信息学函数设计功能函数示例从GenBank获取1条序列密码子计数codoncountcodoncount(mitochondria)核苷酸统计basecountbasecount(mitochondria)转换成互补序列seqrcomplementseqrcomplement(mitochondria)互补统计basecount(seqrcomplement(mitochondria))统计作图ntdensityMap=ntdensity(mitochondria)二聚体统计dimercountdimercount(mitochondria)核苷酸统计2aacountAacount(mitochondria)密码子使用偏性codonbiascb=codonbias(mitochondria,'PIE',true)CpG岛cpgislandcpgisland(mitochondria,'PLOT',true)短序列匹配seqshowwordsseqshowwords(mitochondria,'TATA')第20页Matlab与.NET数据类型转换Matlab类型.NET类型数据转换类说明CellN/AMWCellArray单元和构造数组没有对应.NET类型StructureN/AMWstructArrayCharSystem.StringMWCharArrayDoubleSystem.DoubleMWNumericArray默以为Double类型SingleMWNumericArrayUint64MWNumericArray不支持Uint32MWNumericArray不支持Uint6MWNumericArray不支持引自苏金明等《Matlab高级编程》北京,电子工业出版社,2023第21页数据类型转换实例%利用MatLab构建不一样地方鸡种亲缘关系进化树;%定义数组二维data,存放鸡种名称和mtDNA序列;functionphylogenyanalysis(data,m)%data={'白银耳鸡''AF128320';'灵昆鸡''AF128330';'寿光鸡''AF512058';'丝羽乌骨鸡''AF512060';'茶花鸡''AF512078';};%forind=1:5%seqs(ind).Header=data{ind,1};%seqs(ind).Sequence=getgenbank(data{ind,2},'sequenceonly',true);%end%进化距离运算;UPGMA,非加权分组平均法(unweightedpairgroupmethodwitharithmeticmeans)Jukes-Cantor,forind=1:mseqs(ind).Header=data{ind,1};seqs(ind).Sequence=data{ind,2};enddistances=seqpdist(seqs,'Method','Jukes-Cantor','Alphabet

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论