基因编辑脱靶检测数据格式技术协议_第1页
基因编辑脱靶检测数据格式技术协议_第2页
基因编辑脱靶检测数据格式技术协议_第3页
基因编辑脱靶检测数据格式技术协议_第4页
基因编辑脱靶检测数据格式技术协议_第5页
已阅读5页,还剩5页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基因编辑脱靶检测数据格式技术协议一、范围本协议规定了基因编辑脱靶检测过程中产生的各类数据的格式标准,涵盖测序原始数据、比对数据、变异检测数据、注释数据及分析报告数据等。适用于基因编辑研究机构、测序服务提供商、生物医药企业等在基因编辑脱靶检测数据的生成、存储、共享及分析过程。二、规范性引用文件下列文件对于本协议的应用是必不可少的。凡是注日期的引用文件,仅注日期的版本适用于本协议。凡是不注日期的引用文件,其最新版本(包括所有的修改单)适用于本协议。《高通量测序数据格式规范》(GB/T34798-2017)《基因变异检测数据格式标准》(HGVSv2.0)《生物信息学数据共享规范》(GA4GHv1.0)三、术语和定义3.1基因编辑指利用CRISPR-Cas9、TALEN、ZFN等技术对生物体基因组特定目标基因进行修饰的一种基因工程技术。3.2脱靶效应指基因编辑工具在非目标位点进行了非预期的基因修饰,包括碱基替换、插入、缺失等。3.3高通量测序一种能够同时对大量DNA分子进行测序的技术,可快速获取生物体基因组的序列信息。3.4比对数据将测序得到的短序列(reads)与参考基因组进行比对后得到的结果数据,包含reads在参考基因组上的位置、匹配度等信息。3.5变异检测数据通过生物信息学分析从比对数据中识别出的基因变异信息,包括变异类型、位置、频率等。四、数据格式要求4.1测序原始数据格式测序原始数据应采用FASTQ格式存储。FASTQ格式是一种基于文本的、用于存储生物序列(通常是核酸序列)和其对应质量值的格式。每个FASTQ文件包含四个部分:序列标识行:以“@”开头,后面跟随序列的唯一标识信息,包括测序仪编号、运行编号、流动槽编号、lane编号、tile编号、x坐标和y坐标等。例如:@HWI-ST1234:123:ABC123XYZ:1:1101:12345:67891:N:0:ATCACG。序列行:包含测序得到的核酸序列,由A、T、C、G、N等字符组成,其中N表示无法确定的碱基。分隔行:以“+”开头,后面可跟随与序列标识行相同的信息,也可省略。质量值行:包含与序列行中每个碱基对应的质量值,每个质量值用ASCII字符表示,通常采用Phred质量评分体系。Phred质量评分Q与碱基识别错误概率P的关系为Q=-10log₁₀(P)。例如,质量值字符“!”对应的Phred评分为0,“I”对应的Phred评分为40。4.2比对数据格式比对数据应采用SAM/BAM格式存储。SAM(SequenceAlignment/Map)是一种文本格式,BAM是其对应的二进制格式,BAM格式具有占用存储空间小、读写速度快等优点。SAM/BAM文件主要包含以下部分:头部信息:以“@”开头,包含参考基因组信息、测序平台信息、比对软件信息等。例如:@SQSN:chr1LN:249250621,其中SN表示参考序列名称,LN表示参考序列长度。比对记录行:每一行代表一个read的比对结果,包含以下字段:QNAME:read的名称,与FASTQ文件中的序列标识行对应。FLAG:一个整数,用于表示read的比对状态,如是否比对成功、是否是成对测序中的第一个read等。例如,FLAG值为16表示read反向互补比对到参考基因组上。RNAME:参考序列的名称,如chr1、chr2等。POS:read在参考基因组上的起始比对位置,从1开始计数。MAPQ:比对质量值,反映read与参考基因组匹配的可靠程度,范围为0-255。CIGAR:一个字符串,用于表示read与参考基因组的比对方式,包括匹配(M)、插入(I)、缺失(D)、跳过(N)、软剪切(S)、硬剪切(H)、padding(P)等操作。例如,100M表示read与参考基因组有100个碱基匹配。RNEXT:成对测序中另一个read比对到的参考序列名称,若为“=”表示与当前read比对到同一个参考序列。PNEXT:成对测序中另一个read在参考基因组上的起始比对位置。TLEN:模板长度,即插入片段的长度。SEQ:read的序列,与FASTQ文件中的序列行对应。QUAL:read的质量值,与FASTQ文件中的质量值行对应。可选字段:以“TAG:TYPE:VALUE”的形式出现,可包含更多的比对信息,如NM(编辑距离)、MD(错配信息)、AS(比对得分)等。4.3变异检测数据格式变异检测数据应采用VCF(VariantCallFormat)格式存储。VCF是一种用于存储基因变异信息的文本格式,广泛应用于基因组学研究中。VCF文件主要包含以下部分:头部信息:以“##”开头,包含文件版本信息、参考基因组信息、变异检测软件信息、过滤条件信息等。例如:##fileformat=VCFv4.2,##reference=file:///path/to/reference/genome.fasta。列标题行:以“#CHROM”开头,包含以下列标题:CHROM:变异所在的参考序列名称,如chr1、chr2等。POS:变异在参考序列上的起始位置,从1开始计数。ID:变异的唯一标识,通常采用dbSNP数据库中的rs编号,若没有则用“.”表示。REF:参考碱基,即参考基因组上该位置的碱基。ALT:变异后的碱基,可包含多个变异类型,用逗号分隔。例如,A,T表示该位置可发生A到T的碱基替换。QUAL:变异的质量值,反映变异检测的可靠程度,通常采用Phred质量评分体系。FILTER:过滤状态,若变异通过所有过滤条件则为“PASS”,否则为具体的过滤原因,如“LowQual”(低质量)、“FS”(链偏倚)等。INFO:包含变异的详细信息,以“KEY=VALUE”的形式出现,多个信息用分号分隔。例如,DP=100表示该变异的测序深度为100,AF=0.5表示变异等位基因频率为0.5。FORMAT:用于定义后续样本列中各字段的含义,如GT(基因型)、AD(等位基因深度)、DP(样本测序深度)等。样本列:每个样本对应一列,包含该样本中该变异的具体信息,如基因型、等位基因深度等,各字段之间用冒号分隔。例如,0/1:20,30:50表示该样本的基因型为杂合子(0表示参考等位基因,1表示变异等位基因),参考等位基因深度为20,变异等位基因深度为30,样本测序深度为50。4.4注释数据格式注释数据应采用JSON格式存储。JSON(JavaScriptObjectNotation)是一种轻量级的数据交换格式,易于阅读和编写,同时也易于机器解析和生成。注释数据应包含以下信息:变异基本信息:包括变异类型(如SNP、Indel等)、变异位置、参考碱基、变异碱基等。功能注释信息:包括变异所在基因的名称、基因功能、变异对基因功能的影响(如无义突变、错义突变、同义突变等)、变异所在的转录本信息等。可通过与数据库(如Ensembl、NCBI等)进行比对获取这些信息。频率注释信息:包括变异在不同人群中的频率信息,如1000GenomesProject、ExAC、gnomAD等数据库中的频率数据。致病性注释信息:包括变异与疾病的关联信息,如OMIM、ClinVar等数据库中的致病性评估结果。以下是一个注释数据的JSON示例:{"variant_id":"chr1:1234567:A>G","variant_type":"SNP","chromosome":"chr1","position":1234567,"ref_base":"A","alt_base":"G","gene_info":{"gene_name":"BRCA1","gene_function":"参与DNA损伤修复","transcript_id":"ENST00000357654","exon_number":10},"frequency_info":{"1000G_AF":0.001,"ExAC_AF":0.0005,"gnomAD_AF":0.0008},"pathogenicity_info":{"OMIM_id":"113705","ClinVar_significance":"Pathogenic"}}4.5分析报告数据格式分析报告数据应采用PDF格式存储,同时可附带一份对应的Word格式文件。PDF格式具有跨平台、格式稳定等优点,适合用于报告的展示和分享;Word格式则方便用户对报告内容进行编辑和修改。分析报告应包含以下内容:报告封面:包括报告标题、检测机构名称、检测日期、委托单位名称等信息。报告摘要:简要介绍基因编辑脱靶检测的目的、方法、主要结果和结论。材料与方法:详细描述基因编辑实验的材料(如细胞系、基因编辑工具等)、实验方法(如转染方法、测序方法等)、生物信息学分析方法(如比对软件、变异检测软件、注释软件等)。结果与分析:测序数据质量评估:包括测序深度、覆盖度、碱基质量分布等信息,可通过图表(如箱线图、直方图等)进行展示。比对结果分析:包括reads比对率、比对质量分布等信息。变异检测结果分析:包括变异类型分布、变异频率分布、脱靶位点分布等信息,可通过图表(如柱状图、散点图、热图等)进行展示。同时,应列出所有检测到的脱靶位点信息,包括位点位置、变异类型、变异频率、功能注释等。脱靶效应评估:根据变异检测结果评估基因编辑脱靶效应的严重程度,如计算脱靶率、评估脱靶位点的功能重要性等。讨论:对检测结果进行深入讨论,分析脱靶效应产生的可能原因,如基因编辑工具的特异性、实验条件等,并提出降低脱靶效应的建议。结论:总结基因编辑脱靶检测的主要结果,明确基因编辑脱靶效应的情况。附录:包括测序原始数据统计信息、比对数据统计信息、变异检测数据详细列表等。五、数据存储与管理要求5.1数据存储存储介质:应采用可靠的存储介质,如硬盘阵列、磁带库等,确保数据的安全性和完整性。同时,应定期对存储介质进行检查和维护,及时更换损坏的存储介质。存储方式:数据应按照不同类型进行分类存储,建立合理的目录结构。例如,可按照测序项目名称、测序日期、数据类型等进行分类。同时,应对数据进行备份,备份数据应与原始数据分开存储,可采用异地备份的方式,防止数据丢失。存储期限:测序原始数据、比对数据、变异检测数据等应长期保存,至少保存到项目结束后5年;分析报告数据应永久保存。5.2数据管理数据访问控制:应建立严格的数据访问控制机制,对不同用户设置不同的访问权限。例如,研究人员可访问自己负责项目的数据,管理人员可访问所有项目的数据,但应禁止未经授权的人员访问数据。数据更新与维护:应定期对数据进行更新和维护,及时补充新的数据和注释信息。同时,应对数据进行清理,删除无用的数据和重复的数据,提高数据的质量和可用性。数据审计:应建立数据审计机制,记录数据的访问、修改、删除等操作,便于追溯数据的使用情况。审计记录应至少保存3年。六、数据共享要求6.1数据共享原则数据共享应遵循自愿、平等、互利、保密的原则。在共享数据前,应明确数据共享的目的、范围和方式,签订数据共享协议,保障数据提供者和使用者的合法权益。6.2数据共享格式共享的数据应采用本协议规定的标准格式,确保数据的兼容性和可操作性。同时,应提供数据的详细说明文档,包括数据的生成方法、分析方法、注释信息等,便于数据使用者理解和使用数据。6.3数据共享平台鼓励使用符合GA4GH(GlobalAllianceforGenomicsandHealth)标准的数据共享平台进行数据共享,如NCBISRA、ENA、DDBJ等公共数据库,或机构内部建立的数据共享平台。数据共享平台应具备数据存储、查询、下载、分析等功能,同时应保障数据的安全性和隐私性。七、质量控制要求7.1测序数据质量控制测序前质量控制:对测序样本进行质量检测,包括样本浓度、纯度、完整性等。样本浓度应符合测序仪的要求,纯度应通过OD₂₆₀/OD₂₈₀比值进行评估,通常OD₂₆₀/OD₂₈₀比值在1.8-2.0之间表示样本纯度较高。样本完整性可通过琼脂糖凝胶电泳或毛细管电泳进行检测。测序中质量控制:在测序过程中,实时监测测序仪的运行状态,包括测序通量、碱基质量、错误率等。若发现测序数据质量异常,应及时停止测序,排查原因并进行处理。测序后质量控制:对测序得到的原始数据进行质量评估,包括碱基质量分布、GC含量分布、序列重复率等。可使用FastQC、Trimmomatic等软件进行质量控制,对低质量的reads进行过滤和修剪。7.2比对数据质量控制比对软件选择:应选择性能稳定、比对准确率高的比对软件,如BWA、Bowtie2等。同时,应根据测序数据的特点和研究目的选择合适的比对参数。比对结果评估:对比对结果进行评估,包括reads比对率、比对质量分布、比对错误率等。通常,reads比对率应不低于90%,比对质量值应符合研究要求。若比对结果不理想,应重新调整比对参数或更换比对软件。7.3变异检测数据质量控制变异检测软件选择:应选择灵敏度高、特异性好的变异检测软件,如GATK、FreeBayes、VarScan等。同时,应根据测序数

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论