CN119452417A 识别突变与表型关联的系统和方法 (得克萨斯大学体系董事会)_第1页
CN119452417A 识别突变与表型关联的系统和方法 (得克萨斯大学体系董事会)_第2页
CN119452417A 识别突变与表型关联的系统和方法 (得克萨斯大学体系董事会)_第3页
CN119452417A 识别突变与表型关联的系统和方法 (得克萨斯大学体系董事会)_第4页
CN119452417A 识别突变与表型关联的系统和方法 (得克萨斯大学体系董事会)_第5页
已阅读5页,还剩48页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

2025.01.02PCT/US2023/0687872023.06.21WO2024/006647EN2024.01.04本发明构思的各个方面一般涉及突变处理括接收包括表型数据和突变数据的一个或多个习模型生成指示表型与突变之间关联概率的候2基于所述一个或多个输入特征,通过机器学习模型生成指示表型2.根据权利要求1所述的方法,其中所述关联的指示包括基于所述CE分数的所述关联3.根据权利要求1所述的方法,其中所述突变数据包括指示与所述突变相关联的蛋白通过使用已知的有害突变和中性突变训练的另一机器学习模型通过使用已知的对存活非必要的基因和已知的对存活必要的基因训练的另一机器学7.根据权利要求1所述的方法,其中所述一个或多个输入特征还包括与算法分数相关8.根据权利要求1所述的方法,其中所述一个或多个输入特征还包括使用自动减数分10.根据权利要求1所述的方法,其中所述一个或多个输入特征包括以下中的至少一突变的算法分数满足阈值的的表型数量,所述算法分数指示所述突变是致因的可能导致p值满足与突变相关的基因的每个等位基因的阈值的A所述突变的损伤分数,所述损伤分数指示与所述突变相关的蛋白质功能受损的可能3超系谱的AMM操作结果是否满足无效和错义等位基因超系谱的AMM操作结果是否满足无效等位基因基于所述一个或多个输入特征,通过机器学习模型生成指示表型12.根据权利要求11所述的装置,其中所述关联的指示包括基于所述CE分数的关联候13.根据权利要求11所述的装置,其中所述突变数据包括指示与所述突变相关的蛋白14.根据权利要求13所述的装置,其中所述一个或多个处理器还配置为通过使用已知示与突变相关的基因的稳健敲除等位基因的纯合子小鼠在16.根据权利要求15所述的装置,其中所述一个或多个处理器还配置为通过使用已知17.根据权利要求11所述的装置,其中所述一个或多个输入特征还包括与算法分数相18.根据权利要求11所述的装置,其中所述一个或多个输入特征还包括使用自动减数处理器还被配置为通过省略所述两个或更多突变的共享接合性实例来确定所述两个或更基于所述一个或多个输入特征,通过机器学习模型生成指示表型45[0002]本申请要求2022年7月1日提交的美国临时专利申请第63/357,803号、发明名称表型是指基因型与环境相互作用产生的一系列可观察到的特征。在一些情况下,[0009]此外,在一些情况下,一个或多个输入特征还可以包括使用自动减数分裂映射通过省略两个或更多突变的共享接合性实例,确定该两个或更多突变中哪个是表型的更稳下至少一项:突变的算法分数满足阈值的表型数量,该算法分数指示突变是致因性的可能性;导致p值满足与突变相关的基因的每个等位基因的阈值的AMM操作的平均次数;突变或6该损伤分数指示与该突变相关的蛋白质功能受损的可能性;与基因相关的超系谱示与突变相关的基因的稳健敲除等位基因的纯合子小鼠在断奶年[0013]所公开技术的某些方面提供了一种非瞬态的计算机可读介质,该介质存储有指7[0017]图3是示出根据本发明构思的某些方面的CE分数和已验证的突变一表型关联的平[0021]图6是显示根据本发明构思的某些方面的CE系统的机器学习模型的输入特征示例[0025]图10A是根据本发明构思的某些方面绘制的良好/优秀表型关联的数量与基因计[0026]图10B显示了根据本发明构思的某些方面所绘制的良好/优秀基因关联的数量与[0027]图10C显示了根据本发明构思的某些方面的必要基因和非必要基因的数量和百分本发明构思的某些方面涉及使用机器学习算法来识别导致所筛选表型的化学诱CE数据确定数量性状基因座内的致因突变。数量性状基因座是与特定表型性状相关的DNA8[0033]图1示出了根据本发明构思的某些方面的示例性计算设备100。计算设备100可以100的用户可以通过它们提供输入,还可以包括用于提供音频输出的扬声器和用于提供文器115可以包括一个或多个物理持久性存储器设备和/或一个或多个非持久性存储器设备。可用于存储所需信息并可被处理器103访问的任何[0035]通信接口111可以包括一个或多个收发器、数字信号处理器和/或附加电路和软处理器103可以从CPU缓存检索数据或向CPU缓存写入数据,而不是向内存115读取/写入数些数据缓存在与数据库分开的存储器中的单独的较小的数据库中,例如RAM中或单独的计在传输和接收数据时更快的响应时间以及对网络条件更因突变的技术。某些方面提供的技术涉及诱变雄性近交系(如C57BL/6J)小鼠(G0并在9在与否以及对具有类似效应的其他等位基因的观察,都会影响对真正致因突变的正确选[0039]可分析免疫细胞群的变化,特别是B细胞、T细胞、常规和浆细胞样树突状细胞ENU诱导突变的G3突变小鼠的外周血白细胞,可以检测和测量细胞群和亚群。在一些情况[0040]CE系统可帮助研究人员预测与AMM表型相关的突变是否是真正的致因突变。CE系[0044]图2是示出根据本发明构思的某些方面的CE系统的输入和输出特征的示意图。CE数,其指示与突变相关的基因的稳健敲除等位基因的纯合子小鼠在断奶前致死的可能性。必要性分数可以使用ML系统240生成,该系统可以使用已知对存活非必要的基因和已知对存活必要的基因进行训练。算法分数可以是根据一组与经验观察相关的规则260生成的分数,如本文更详细描述的那样。减数分裂映射数据可使用本文描述的自动减数分裂映射创建。携带靶向种系敲除或替换等位基因的小鼠可扩展形成包含参考等位基因纯合子因的变异等位基因的复合杂合子小鼠。携带CRISPR靶向等位基因的新小鼠系谱可进行表型使用训练集建立的CE预测模型的性能可以通过重复10倍交叉验证法进行评估。ROC曲线的[0049]图5A是显示了根据本发明构思的某些方面的流式细胞术表型的CE性能的表500。[0050]图5B是显示了根据本发明构思的某些方面的CE在评分共定位突变方面性能的表的多个突变_表型关联。每个突变_表型关联都可独立获得相关突变的等位基因验证概率与B6小鼠的筛选结果重叠的VAR小鼠的百分比、筛选结果与REF小鼠的筛选结果重叠的VAR平均年龄小、该基因/表型的系谱数量、该基因突变/表型的位置超系谱(position中,显著系谱指的是通过AMM对系谱或超系谱进行连锁分析,其中突变一表型关联的p值<因p值<0.00005的连锁分析器平均运行次数、该基因具有显著选择性基因超系谱结果的表型的数量、该突变p值<0.0001的Dejerine一Sottas综合征(DSS)表型数量、该突变p值<(MGI)数据库中的注释和在C57BL/6J小鼠中产生的CRISPR靶向无效突变的观察效果确定知对存活能力有影响的基因(如1041个基因)可用于测试已建立模型的性能,这可AUC为60.894的ROC曲线。[0058]对突变表型关联的评估可采用人类开发的算法进行,该算法可输出一个基于分分数都会增加或减少。算法分数计算中使用的特征与CE机器学习算法中使用的特征类似,[0062]图9是显示根据本发明构思的某些方面的流式细胞术筛选参数的表900。如图所及疑似或证实的导致流式细胞术表型的基因,都可以在Mutagenetix数据库中被指定等位免疫系统过程相关的另一个基因的序列同源性、或直系同源人类基因与免疫系统过程的关联。此外,在386个基因中,有300个基因通过RNA测序被检测到在脾脏和/或胸腺中有中等几乎所有其中可能存在导致功能缺失突变的基因都可以被高可信度[0069]CE系统除了可作为快速识别导致ENU诱导表型的突变的工具外,还对研究复杂性CE也接受人类染色体坐标作为搜索输入。通过将CE与大型人类基因组/表型数据集的分析[0071]可评估代表具有一个或多个变异等位基因的基因的突变_表型关联以及外周血白细胞的流式细胞术参数。流式细胞术分析可检测和测量具有特定功能相关性的免疫细胞[0072]在对具有至少一个良好/优秀表型关联的所有1279个基因进行广泛调查时,可以相同或相似的表型组合可表明这些基因在一个共同的分子通路中发挥作用,进行了研究。尽管在所有筛选中都进行了统一的表型测试,但良好/优秀的基因关联可能不会以相同的[0073]通过流式细胞术进行表型分析的绝大多数小鼠也在其他[0075]为了产生携带CRISPR/Cas9靶向突变的小鼠,雌性C天,从输卵管收集受精卵,将体外转录的Cas9mRNA(50ng/μL)和小碱基配对引导RNA2浓度为5%。为了生产突变小鼠,可将两细胞期胚胎移植到假孕雌性[0076]可从6周龄以上的G3小鼠颊部放血收集外周血。红细胞(RBC)可用低渗缓冲液合抗体混合物中对RBC减少的样品染色1小时,所述荧光缀合抗体针对15种细胞表面标记,用用于分析细胞仪数据的软件来分析每个G3小鼠中免疫细胞群体的比例。所得的表型数据检验并应用Bonferroni校正来计算基因型与表型之间关[0078]在一些方面,CE预测模型可以使用随机森林算法(例如,在R分类和回归训练37个预测分数可从数据库(如人类dbNSFP)中获取,包括来自以下算法的分数:SIFT、变引起表观变异的蛋白质损伤概率,计算方法如本文所述。在这38个预测分数中,来自MutPred的分数以及由小鼠突变引起表观变异的蛋白质损伤概率和phastCons100way_脊椎可以以与用于建模的数据集相同的方式创建。模型预测的分数代表突变属于损伤类的概个有害突变和1797个中性突变可用于训练和验证逻辑回归模型;第二组由剩余的666个直向同源基因的必要性:在特定条件下,受测细胞系中细胞增殖和存活的基因可被定义为必要基因,在受测人类细胞系中重要的频率可作为模型中的特征,3)外显子组聚合联盟与所述基因特征整合。由此产生的数据集可用于使用Rcaret软件包的训练函数和10倍交要的。分为两组:一组包括5608个基因(原始数据集的80%,3538个非必要基因和2070个必要基性能。训练和测试的80/20分法可随机进行多次(如10次ROC曲线产生的AUC值接近平均[0088]图11是示出根据本发明构思的某些方面的突变处理的示例性操作1100的流程[0089]在框1102,CE系统可接收包括表型数据和突变数据一个或多个输入特征。在框对存活非必要的基因和已知对存活必要的基因训练的另一机器学习模型来生成必要性分CE系统可通过省略两个或更多突变的共享接合性实例来确定两个或更多突变中哪个是表的阈值;超系谱的AMM操作结果是否满足无效等位基因的阈值;筛选结果与参考等位基因包含在本发明构思的至少一个实施方案中。在说明书的不同地方出现的短语"在一个实施方案中"并不一定都是指同一个实施方案,也不是与其他实施方案相互排斥的单独或替代[0100]在无意限制本发明构思范围的前提下,下文给出了根据本发明构思实施的仪器、

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论