CN119446253A 一种基于单细胞多组学数据进行细胞类型划分的方法 (东北林业大学)_第1页
CN119446253A 一种基于单细胞多组学数据进行细胞类型划分的方法 (东北林业大学)_第2页
CN119446253A 一种基于单细胞多组学数据进行细胞类型划分的方法 (东北林业大学)_第3页
CN119446253A 一种基于单细胞多组学数据进行细胞类型划分的方法 (东北林业大学)_第4页
CN119446253A 一种基于单细胞多组学数据进行细胞类型划分的方法 (东北林业大学)_第5页
已阅读5页,还剩34页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于单细胞多组学数据进行细胞类型本发明涉及一种基于单细胞多组学数据进的深度神经网络模型对待测数据进行细胞类型MAE模块捕捉不同组学的依赖关系,将通常被忽略的因素考虑到细胞聚类之中并借助其中的掩22.根据权利要求1所述的一种基于单细胞多组学数据进行细胞类型划分的方法,其特不同组学的编码器用于提取不同组学数据的重要特征及特征间3.根据权利要求1所述的一种基于单细胞多组学数据进行细胞类型划分的方法,其特征在于,单细胞多组学综合数据集包括scRNA_seq数据和scATAC_seq数据组成的多组学数据集和scRNA_seq数据和scADT_seq数据组成的多组学4.根据权利要求1所述的一种基于单细胞多组学数据进行细胞类型划分的方法,其特5.根据权利要求1所述的一种基于单细胞多组学数据进行细胞类型划分的方法,其特由此通过对scRNA_seq的原始数据XRNA_seq、扰乱数据xiwn-sw和掩码矩阵MRNA_seq进行组步骤三、掩码解码器中和fhers()用于从不同组学的低维表示ZRNA_seq和3""数,g和p分别表示不同组学数据的特征维度,和表示真实的掩码矩阵,将预测得到的不同组学的掩码矩阵和低维表示合并传入解码器,用公式(8)和(9)中X'RNA-seq和X'others分别表示不同组学数通过计算不同组学的重建数据与原始数据的均方误差作为重建损失LR,同时为损坏和和分别表示不同组学数据的重建损失,w""和分别表示23max(⃞)(1s)4通过将scRNA_seq数据特征Zr再次和融合,以获得信息更加丰富ma-xn习(17)pij是基于qij构建的目标分布,是通过对qij进行归一化处理得到的,计算过程如下:步骤五:获取单细胞多组学融合数据之后,通过Kmeans5scRNA_seq方法相结合,以测量基因和细胞表面蛋白的表达水平。这两种方法具有高灵敏基因表达分析,允许在单个细胞水平上同时分析RNA表达与染色质可及性的技术被提出为下游的细胞差异表达分析和复杂疾病研究提供关键支持[5]。多年来,针对单细胞RNA测序据表达模式上的差异实现聚类分析,通常未充分考虑不同组学内部特征之间的依赖关系。6[0018]优选的:单细胞多组学综合数据集包括scRNA_seq数据和scATAC_seq数据组成的多组学数据集和scRNA_seq数据和scADT_seq数据7"")和f[0037]通过使用二元交叉熵损失作为掩码预测损失LM,使得模型能够学习组学数据中[0042]公式(8)和(9)中X'RNA-seq和X'others分别表示不同组学数据的重建数据,ZRNA-seq和Zothers表示通过编码器降维之后scRNA-s[0045]和分别表示不同组学数据的重建损失,wg""和分别表示scRNA-seq数据和其他组学数据被扰乱的特征和未被8Q=ZW23[0057]Z=WV+b(16)[0064]pij是基于qij构建的目标分布,是通过对qij进行归一化处理得到的,计算过程如过与其它最新的细胞聚类模型进行比较,scDRMAE模型在多个评价指标上均表现出更优秀9声scDRMAE与其他方法相比依然能够保态调整不同组学数据的权重,类残差结构的网络是为了防止模型训练过程中信息丢失问题,将scRNA_seq这一更为重要的组学数据的低维表示重新整合到经过自注意力处理的融组学数据进行细胞类型划分的方法,单细胞多组学综合数据集包括scRNA_seq数据和scATAC_seq数据组成的多组学数据集和scRNA_seq数据和scADT_seq数据组成的多组学数了4个批次的数据;PBMC10k。其中我们根据测序机构的不同将Stephenson数据集分成Ncl和Cambridge两套数[0106]其中P表示不同细胞不同基因发生dropout事件的概率,由此通过对scRNA_seq的原始数据XRNA_seq、扰乱数据以及掩码矩阵MRNA_seq进行组合得到最终的带有掩码的[0112]其中和fgthers()分别表示不同组学的编码器,用于将xRNA_seq和xothers投影到低维空间。掩码解码器中和用于从不同组学的低维表示ZRNA_seq和[0114]其中M'RNA-seq和M'others是掩别表示不同组学数据的特征维度,和表示真实的掩码矩阵,MU-a和[0119]其中X'RNA-seq和X[0121]和分别表示不同组学数据的重建损失,和分别表示scRNA-seq数据和其他组学数据被扰乱的特征和未被Q=ZW23丰富的特征表示2,表示如下:[0132]2=[z[0133]为了进一步优化融合特征2,并使不同组学的MAE框架之间存在信息交互,我们引另外一类是scRNA_seq数据和scADT_seq数据的组合。其中第一类数据集包含10套数据集,从GEO数据库中分别下载了humancelllinemixtureζGSE126074’、mousebrain5所示。图5a是InHouse数据集的UMAP图,该数据集由6种类型的细胞组成;图5b是humancelllinemixture数据集的UMAP图,该数据集由4种类型的细胞组成。而图5c和图5d是[0159]为了证明scDRMAE的抗噪能力以及其特征间依赖关系的学习能力,我们通过将不聚类效果始终优于这两种方法。scDRMAE的优秀表现归功于scDRMAE独特的掩码预测机制,[0161]此外,为了进一步验证scDRMAE在学习特征间依赖关系方面的能力以及数据插补基因对NK细胞和CD8T细胞的细胞毒性脱颗粒,以及CD4T细胞的活化和促炎反应至关重[0164]同样我们也对InHouse数据集的表蛋白组学数据进行了秩检验分析。图9b展示了数据能够帮助我们更加准确的实现细胞类型划分。通过对scDRMAE划分的细胞簇进行差异这些差异特征可能是潜在的生物标志物。有趣的是,我们发现从簇0中筛选的差异蛋白

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论