【《GCN图分类预测模型概述》8000字】_第1页
【《GCN图分类预测模型概述》8000字】_第2页
【《GCN图分类预测模型概述》8000字】_第3页
【《GCN图分类预测模型概述》8000字】_第4页
【《GCN图分类预测模型概述》8000字】_第5页
已阅读5页,还剩10页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

GCN图分类预测模型概述目录TOC\o"1-3"\h\u11129GCN图分类预测模型概述 1275221.1图分类 1130021.1.1基于全局池化的图分类 2288611.1.2基于图塌缩池化的图分类 3157961.1.3基于边收缩池化的图分类 5153121.1.3基于TopK池化的图分类 6261521.2多层级图卷积神经网络预测模型 7158811.2.1图卷积层 789201.2.2图池化层 870491.2.3全连接层 9140271.2.4模型相关参数选择 994671.3应用于课题存在的问题 12273201.1.1忽略官能团结构 12143461.1.2缺乏足够的有效数据 13179611.1.3难以分析模型不确定性 131.1图分类图分类问题是非常重要的图层面学习任务。要对每张图有一个全局信息的认识。给定多张图,以及每张图对应的标签,图分类模型需要学习到一个从图到相应的标签的对应方式。本质上,即需要重点关注如何通过学习得到一个可表示全图的向量。类比于欧式空间中的分类任务,如视觉图像分类,其都需要对全局的信息进行融合表示。CNN的做法是通过池化(Pooling)机制提取全局信息。由于图像数据为规则的栅格结构,我们可以使用固定的池化窗口,池化步长,利用平均池化或最大值池化,很轻易的提取出我们需要的更高阶信息。然而对于非规则的图数据,这类池化操作变得难以执行。我们需要找到更加适用于图数据的池化方式,才能更好地提取高阶信息,使得图数据最终池化为一段固定长度的向量,进而成功执行图分类任务。1.1.1基于全局池化的图分类全局池化是最为简单的池化机制。早在MPNNADDINEN.CITE<EndNote><Cite><Author>Gilmer</Author><Year>2017</Year><RecNum>19</RecNum><DisplayText><styleface="superscript">[13]</style></DisplayText><record><rec-number>19</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619061457">19</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Gilmer,Justin</author><author>Schoenholz,SamuelS</author><author>Riley,PatrickF</author><author>Vinyals,Oriol</author><author>Dahl,GeorgeE</author></authors></contributors><titles><title>Neuralmessagepassingforquantumchemistry</title><secondary-title>InternationalConferenceonMachineLearning</secondary-title></titles><pages>1263-1272</pages><dates><year>2017</year></dates><publisher>PMLR</publisher><isbn>2640-3498</isbn><urls></urls></record></Cite></EndNote>[\o"Gilmer,2017#19"13]模型中,GilmerJ等人除了为图上的节点的表示学习给出了一个一般框架,还同时设计了一个读出机制(readout),对经过T轮聚合更新后的所有节点进行一次性池化聚合操作:y其中,R这种读出方式借鉴了CNN中最后一个池化层。即全局池化,GlobalPooling。二者都是通过对所有的输入进行一次性聚合得到全局的特征表达。与CNN的全局池化相同,基于全局池化的图池化方式也可使用最大值池化、加和池化、平均池化等类型的池化函数。与读出方式极为相似的是,TrangPham等人提出虚拟列网络ADDINEN.CITE<EndNote><Cite><Author>Pham</Author><Year>2017</Year><RecNum>94</RecNum><DisplayText><styleface="superscript">[71]</style></DisplayText><record><rec-number>94</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619580320">94</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Pham,Trang</author><author>Tran,Truyen</author><author>Dam,Hoa</author><author>Venkatesh,Svetha</author></authors></contributors><titles><title>Graphclassificationviadeeplearningwithvirtualnodes</title><secondary-title>arXivpreprintarXiv:1708.04357</secondary-title></titles><periodical><full-title>arXivpreprintarXiv:1708.04357</full-title></periodical><dates><year>2017</year></dates><urls></urls></record></Cite></EndNote>[\o"Pham,2017#94"71](VCN),通过引入一个虚拟节点,并与图中所有的节点建立一条虚拟的边。进而用这个虚拟节点的表示代替全图的表示。图3-1虚拟列网络示意ADDINEN.CITE<EndNote><Cite><Author>Pham</Author><Year>2017</Year><RecNum>94</RecNum><DisplayText><styleface="superscript">[71]</style></DisplayText><record><rec-number>94</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619580320">94</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Pham,Trang</author><author>Tran,Truyen</author><author>Dam,Hoa</author><author>Venkatesh,Svetha</author></authors></contributors><titles><title>Graphclassificationviadeeplearningwithvirtualnodes</title><secondary-title>arXivpreprintarXiv:1708.04357</secondary-title></titles><periodical><full-title>arXivpreprintarXiv:1708.04357</full-title></periodical><dates><year>2017</year></dates><urls></urls></record></Cite></EndNote>[\o"Pham,2017#94"71](VirtualColumnNetwork,VCN)如上图所示,左边蓝色节点(e1,e2,e3)为原图数据节点;e0为引入的虚拟节点;x1,x2,x3为节点特征;h1,h2为隐藏层;最后输出的y为整个图的标记。可以轻易的看到,读出机制与虚节点的机制放弃了图数据中丰富的结构信息。将输入的节点看做一系列平整且规则的结构数据,将每个节点等同对待,这与非欧空间数据的本质是相违背的。但是,这种方式在结构单一、图数据量较小的图中是可以接受的。因为在小图数据中,经过N轮的聚合、更新操作后,各个节点的表达会更加接近于全局表达,这时使用读出机制或虚节点机制可以很好地提取全局表达信息。并且这种方式易于理解,方便实现,从实际工程操作角度省时省力。因此读出机制也是图分类任务中的经典基准模型。1.1.2基于图塌缩池化的图分类图塌缩池化是将原图通过某种方式划分为不同的子图,将每个子图视为一个巨型节点,从而实现更高阶的信息表示。不断地进行合并子图,最终变成一个节点,将这个节点作为对全局信息的表示。图坍缩考虑一个图G,在图坍缩算法中,可以通过某种划分规则得到K个子图G(k)k=1K,NK表示子图GK中节点个数,Γ在图坍缩算法中,有两个常用矩阵。假设目前有一图,其邻接矩阵表示为A:A=簇分配矩阵:S∈RN×K,其中,Sij由定义可以看出,ST的第i行表示所有属于第i个簇的节点编号,进而我们可以使用STAij表示第i个簇内所有节点与节点我们定义:A则Acoar采样算子:C∈RN×Nk,其中,其中,Γj(k)表示列表DIFFPOOLDIFFPOOL创新性地提出了一种簇的分配方式ADDINEN.CITE<EndNote><Cite><Author>Ying</Author><Year>2018</Year><RecNum>84</RecNum><DisplayText><styleface="superscript">[66]</style></DisplayText><record><rec-number>84</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619072517">84</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Ying,Rex</author><author>You,Jiaxuan</author><author>Morris,Christopher</author><author>Ren,Xiang</author><author>Hamilton,WilliamL</author><author>Leskovec,Jure</author></authors></contributors><titles><title>Hierarchicalgraphrepresentationlearningwithdifferentiablepooling</title><secondary-title>arXivpreprintarXiv:1806.08804</secondary-title></titles><periodical><full-title>arXivpreprintarXiv:1806.08804</full-title></periodical><dates><year>2018</year></dates><urls></urls></record></Cite></EndNote>[\o"Ying,2018#84"66]。它使用GNN与图坍缩进行结合。通过一个GNN学习节点的特征表达,再通过一个GNN学习每个节点分配至各簇的概率,通过这个分配至各簇的概率,得到DIFFPOOL的簇分配矩阵。ZS其中,A(l)∈Rn(l)×n(l),S(l)在最后一步的簇分配中,我们固定矩阵的值全部为1,即可将图塌缩成一个超级节点,得到全图所表达的信息。有了Z(l)与SH即每一层后所输出的超级节点组成的图,其中的邻接矩阵,也可通过S矩阵的相作用得到:A这里的S(l)看做一个软分配器,S论文中指出,DIFFPOOL具有排列不变性,多数时候我们将GCN与DIFFPOOL操作看为同一个层,当我们对同一个图数据进行不同的任意编号,输出到下一层的特征矩阵与邻接矩阵并不会改变。有了GCN层与DIFFPOOL层,我们进行不断地堆叠组合,即可实现一种层次化地学习方式,最终得到图数据的全局表示。EigenPoolingEigenPoolingADDINEN.CITE<EndNote><Cite><Author>Ma</Author><Year>2019</Year><RecNum>95</RecNum><DisplayText><styleface="superscript">[72]</style></DisplayText><record><rec-number>95</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619580505">95</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Ma,Yao</author><author>Wang,Suhang</author><author>Aggarwal,CharuC</author><author>Tang,Jiliang</author></authors></contributors><titles><title>Graphconvolutionalnetworkswitheigenpooling</title><secondary-title>Proceedingsofthe25thACMSIGKDDInternationalConferenceonKnowledgeDiscovery&DataMining</secondary-title></titles><pages>723-731</pages><dates><year>2019</year></dates><urls></urls></record></Cite></EndNote>[\o"Ma,2019#95"72]与CNN中的池化机制相类似,它没有引入任何需要学习的池化参数,核心仍是使用图坍缩的池化机制。它实现的原理是:利用图分区算法对图进行划分。如VonLuxburg等人提出使用谱聚类算法进行图分区ADDINEN.CITE<EndNote><Cite><Author>VonLuxburg</Author><Year>2007</Year><RecNum>96</RecNum><DisplayText><styleface="superscript">[73]</style></DisplayText><record><rec-number>96</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619580570">96</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>VonLuxburg,Ulrike</author></authors></contributors><titles><title>Atutorialonspectralclustering</title><secondary-title>Statisticsandcomputing</secondary-title></titles><periodical><full-title>Statisticsandcomputing</full-title></periodical><pages>395-416</pages><volume>17</volume><number>4</number><dates><year>2007</year></dates><isbn>1573-1375</isbn><urls></urls></record></Cite></EndNote>[\o"VonLuxburg,2007#96"73]。他们将输入的图数据转换到特征空间,继而使用Kmeans等聚类算法进行聚类操作。转换到特征空间的好处是可以获得优秀的凸显度。仅需输入图的邻接矩阵数据,与待生成的簇数K,便可得到每个节点所属于的簇。不同于上文的DIFFPOOL,我们使用Kmeans对特征空间下的图数据进行聚类,得到的“分配矩阵”是一个硬分配的分配矩阵,即每个节点仅属于某一个簇。这样可以保证原始节点与聚合后超级节点间的稀疏性,从而可以大大降低模型的空间、时间复杂度。同DIFFPOOL一样,EigenPooling同样也具有排列不变形。此外,EigenPooling在进行池化操作期间,同时兼顾了节点的特征信息与图的结构信息,相比于DIFFPOOL,这种操作明显更具合理性。1.1.3基于边收缩池化的图分类上一节我们介绍了基于图坍缩池化的图分类方式,在图坍缩算法中,着眼于图中的各个节点,设计不同的簇分配矩阵将节点中的各个节点“坍缩”成一个超级节点。在基于边收缩的池化分类中,将重点更多的放在节点间的连边上。如EdgePool中ADDINEN.CITE<EndNote><Cite><Author>Diehl</Author><Year>2019</Year><RecNum>97</RecNum><DisplayText><styleface="superscript">[74]</style></DisplayText><record><rec-number>97</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619580632">97</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Diehl,Frederik</author></authors></contributors><titles><title>Edgecontractionpoolingforgraphneuralnetworks</title><secondary-title>arXivpreprintarXiv:1905.10990</secondary-title></titles><periodical><full-title>arXivpreprintarXiv:1905.10990</full-title></periodical><dates><year>2019</year></dates><urls></urls></record></Cite></EndNote>[\o"Diehl,2019#97"74]DiehlF等人将原图中每条边上的两个节点合二为一,新生成的节点继承原两个节点的所有关系。通过这种方式,不断地对图进行收缩,最终得到一个超级节点,作为图的表示。EdgePool论文中的关键在于给出边收缩的顺序,DiehlF等人对每一条边设计了一个收缩分数r:rs图数据中的各边根据s的大小进行排序,选择分数最高的边进行非重复的挑选与合并。 对于合并后的节点,合并其原始的两个节点的特征并进行一定比例的收缩,合并方式为简单的加和,收缩的比例为取sij,sji最大值(无向图中s=maxh与DIFFPOOL相同,EdgePool也是对图数据进行融合式学习,但EdgePool不需要像DIFFPOOL一样手动设置聚类后的簇数。EdgePool仅对邻居节点进行归并,能最佳化利用图的结构信息,也可一定程度上是的聚合后的图中连接的稀疏性,空间复杂度更低。EdgePool是一种端到端的池化机制,由于这种特性,它可以广泛地融入到各种GCN的模型之中,用于执行图分类任务。1.1.3基于TopK池化的图分类上文介绍的图塌缩与边收缩机制是将节点不断聚合成簇,而基于TopK池化的图分类中,是通过丢弃某些节点的方式,从而实现图在不同层次上的表达。首先,设置一个用于表示池化率的超参数k(范围在0~1之间),再通过某种算法学习出图中各节点的重要程度,最后将N个节点转化为kN个节点。在TopK算法中,如何学习节点的重要程度便成了关键。CangeaC等人ADDINEN.CITE<EndNote><Cite><Author>Cangea</Author><Year>2018</Year><RecNum>98</RecNum><DisplayText><styleface="superscript">[75]</style></DisplayText><record><rec-number>98</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619580760">98</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Cangea,Cătălina</author><author>Veličković,Petar</author><author>Jovanović,Nikola</author><author>Kipf,Thomas</author><author>Liò,Pietro</author></authors></contributors><titles><title>Towardssparsehierarchicalgraphclassifiers</title><secondary-title>arXivpreprintarXiv:1811.01287</secondary-title></titles><periodical><full-title>arXivpreprintarXiv:1811.01287</full-title></periodical><dates><year>2018</year></dates><urls></urls></record></Cite></EndNote>[\o"Cangea,2018#98"75]提出一个向量p作为基向量,将所有节点的特征向量在该基向量上的投影作为重要程度:z=使用在基向量上的投影作为重要程度评判机制,不仅简单便捷,同时,投影大小还可视为一个梯度阈值。投影较小的节点即仅有较小的梯度更新,而较大的节点可以获得更加充分的梯度信息。在DIFFPOOL中,我们欲将N个节点分配给kN个簇,所使用的模型将是kN1.2多层级图卷积神经网络预测模型在第二章与第三章第一节的介绍中,我们详细了解了图卷积神经网络中卷积算子的构建、图分类任务中的池化层的算法。本节中,我们将给出一种完整且经典的图卷积神经网络预测模型。实现图数据至图属性的端到端预测。在常见的GCN图分类任务模型中,一般分为图卷积层、池化层、全连接层。图卷积层负责学习每一个节点的信息表达,其中包括节点自身信息以及依据其结构聚合的邻居信息。池化层负责缩小图尺寸,实现图粗化,实现信息的高维表示,以至最终池化为一个超级节点,作为全图信息的表达。全连接层负责通过学习由池化层输出的超级节点特征属性,最终得到我们想要的输出。结构如下所示:图3-2GCN图分类预测模型ADDINEN.CITE<EndNote><Cite><Author>Ying</Author><Year>2018</Year><RecNum>84</RecNum><DisplayText><styleface="superscript">[66]</style></DisplayText><record><rec-number>84</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619072517">84</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Ying,Rex</author><author>You,Jiaxuan</author><author>Morris,Christopher</author><author>Ren,Xiang</author><author>Hamilton,WilliamL</author><author>Leskovec,Jure</author></authors></contributors><titles><title>Hierarchicalgraphrepresentationlearningwithdifferentiablepooling</title><secondary-title>arXivpreprintarXiv:1806.08804</secondary-title></titles><periodical><full-title>arXivpreprintarXiv:1806.08804</full-title></periodical><dates><year>2018</year></dates><urls></urls></record></Cite></EndNote>[\o"Ying,2018#84"66]从左到右分别为图卷积层、池化层、池化层、池化层、全连接层。我们用G=(A,F)代表一张完整的图,其中,A∈{0,1}n×n是图的邻接矩阵,

F∈ℝn×d是矩阵节点的特征向量矩阵。n为节点个数,d为特征维度。数据集:

D=为了完成我们的分类任务,使用卷积层与池化层不断对图数据进行处理,最终得到一个向量,ℝD作为全图表示,通过ℝ1.2.1图卷积层在这项工作中,我们建立在图形神经网络上,以便以端到端的方式学习图形分类的有用表示。特别是,我们考虑使用以下一般“消息传递”架构的GNN:H其中,H(k)∈ℝn×d是节点的嵌入型表示,k为GCN执行的轮次,θ(k)是所要训练的参数,H(k−1)为上一层所输出的结果,A为邻接矩阵。H其中:A=A+I,且经过图卷积层,最终我们得到:Z=1.2.2图池化层图池化层中,我们选择最为经典的算法DIFFPOOL。我们在上一节中介绍了DIFFPOOL基于图坍塌池化机制,简要讲解了其通过学得一个簇分配矩阵对图节点进行划分,以及DIFFPOOL算法的一些性质及优点。在此,我们仅对上一节未提到的一些细节进行补充。第l层的簇分配矩阵:S(l)∈ℝnl×nl+1,S由(3-3)、(3-4)可知,我们使用两个独立的GNN学习图节点的嵌入向量表达与图分配矩阵。唯一不同的是,在图分配矩阵的学习训练中,我们使用softmax函数,使得到的结果可表示为节点属于各簇的概率。经过图池化层的作用,我们可将卷积层得到的整个图的节点向量表达不断池化,最终坍缩为一个超级节点。通过相互堆叠的池化层,我们变得到了最终的输出:超级节点的特征向量。1.2.3全连接层全连接层被设置在整个网络的末端,目的是作为分类的判别器。在图卷积神经网络图分类模型中,全连接层从上一层接收高维数据,以平铺的形式输入到一个非线性的变换运算中。其负责对先前卷积层、池化层所提取到的特征进行解码并做最后的分类判别。1.2.4模型相关参数选择激活函数:每一层网络中的输入与相对应的权重矩阵运算均是线性的,并且我们知道,卷积运算也是线性时不变系统。因此由矩阵乘法与卷积运算组成的网络层,最终仅能表示线性可分问题。但在我们所处理的现实中的任务,大多都是线性不可分的问题。因此,我们需要使用一个非线性的函数对网络进行处理。这个非线性的函数,即为“激活函数”。本模型中采用的也是传统网络最常用的:Sigmoid函数和softmax函数。Sigmoid函数:图3-3Sigmoid函数图像为了强化特征,Sigmoid常常被应用在输出层之前的层级,其定义:S如上图3-3所示,其平滑易于求导,其导数可以由自身表示:SSoftmax函数:也被称为归一化指数函数。Softmax可以看做Sigmoid函数在多分类问题上的一种推广。其常被用在输出层,可看做对输出数据的一种变换,其通过指数归一化,获得一个概率向量。假设激活函数Softmax的输入:x1ϕ且有ϕxi损失函数:损失函数可以反映一个网络对训练数据拟合的好坏,拟合的效果越差,则损失函数值应越大且梯度越大;拟合的效果越好,则损失函数的值应当越小。交叉熵(CrossEntropy)ADDINEN.CITE<EndNote><Cite><Author>Liu</Author><Year>2016</Year><RecNum>99</RecNum><DisplayText><styleface="superscript">[76]</style></DisplayText><record><rec-number>99</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619581355">99</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Liu,Weiyang</author><author>Wen,Yandong</author><author>Yu,Zhiding</author><author>Yang,Meng</author></authors></contributors><titles><title>Large-marginsoftmaxlossforconvolutionalneuralnetworks</title><secondary-title>ICML</secondary-title></titles><pages>7</pages><volume>2</volume><number>3</number><dates><year>2016</year></dates><urls></urls></record></Cite></EndNote>[\o"Liu,2016#99"76]常被我们作为损失函数用在分类问题中。我们假设特征为x,标签为y,即使用(x,y)表示样本。样本有K个可能属于的类别。y=y1,⋯,yKTG所得到的输出G(x)为概率向量,即各个元素为单个样本的交叉熵损失函数为:L(根据定义我们可以得到:设vLvi的值越大则损失函数越小,v当a不属于第i类时损失函数为:Lvi的值越小则损失函数越小,v在式(3-18)中我们得到了单样本的交叉熵损失函数,则在模型中,输入:

X=x1,⋯,L优化器:优化器(Optimizer)可以根据计算得到的损失函数大小,自动优化网络中的参数。在我们的图卷积神经网络模型中,我们使用神经网络最常用的一种优化器算法:Adam算法。Adam充分利用矩阵的一阶矩估计mt与二阶矩估计vt,不断调整模型中参数的学习率ADDINEN.CITE<EndNote><Cite><Author>Kingma</Author><Year>2014</Year><RecNum>100</RecNum><DisplayText><styleface="superscript">[77]</style></DisplayText><record><rec-number>100</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1619581413">100</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Kingma,DiederikP</author><author>Ba,Jimmy</author></authors></contributors><titles><title>Adam:Amethodforstochasticoptimization</title><secondary-title>arXivpreprintarXiv:1412.6980</secondary-title></titles><periodical><full-title>arXivpreprintarXiv:1412.6980</full-title></periodical><dates><year>2014</year></dates><urls></urls></record></Cite></EndNote>[\o"Kingma,2014#100"77]。在第t次迭代中,mt与vt分别为:mv其中β1、β2表示参数的系数,多数情况下,令β1=0.9,β2=0.999。g再使用mt与vmv得到一阶矩估计mt与二阶矩估计vW其中Wt为更新前的参数,Wt+1为更新后的参数,ε是一个很小的值(可取1.3应用于课题存在的问题在本章中,首先介绍了GCN图分类任务。其次给出了一种经典的图卷积神经网络应用于图分类任务的模型。理论上,我们可以将整个分子结构视为一张图,将分子视为输出,应用于图分类的GCN模型,得到分子的相应属性。然而,若仅仅将经典的GCN图分类模型应用至生物化学分子属性预测,还存在着各种待改进的问题。本小节中我们将对这些问题进行简要叙述,并在下一章中给出相应的解决办法。1.1.1忽略官能团结构GCN可以通过图的拉普拉斯矩阵,自然地将节点的自身特征信息与图中的结构信息相结合。尽管有如此优势,GCN仍然缺少一个结合重要的结构特征能力,无法更好学习到结构与属性关系。我们都知道,分子不仅仅是原子的简单集合。相同的原子往往会导致不同的分子性质,这取决于它们所处的局部化学环境。例如,芳环、脂肪链和羰基的碳原子因其不同的化学环境而具有不同的性质。在化学中,决定一个分子的因素不是分子中的一个原子,而是一些官能团。有机化学反应主要发生在决定有机化合物性质的官能团之间。−X、−OH、−CHO、−COOH、−NO2、−SO3H一种常见的情况如:经典的GCN模型对于与不同的碳原子连接的氢原子,由于其在图中都简单的被视为:相邻节点、碳原子、氢原子。在对其进行特征聚合时,会以相同的操作执行每对碳氢原子。然而在现实中,甲基中碳原子相连的氢原子与苯环上碳原子相连的氢原子对整个分子属性的贡献度一定是不相同的。我们需要一种方法,使得原子可以学习到自身正处的局部化学环境。即可以自适应的改变原子间的权重值。1.1.2缺乏足够的有效数据现实的深度学习任务中,规范且数量足够的样本数据往往是很少见的。这一点在与生物、化学医药交叉领域尤为常见。例如:ImageNetADDINEN.CITE<EndNote><Cite><Author>Deng</Author><Year>2009</Year><RecNum>101</RecNum><DisplayText><styleface="superscript">[78]</style></DisplayText><record><rec-number>101</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1621181842">101</key></foreign-keys><ref-typename="ConferenceProceedings">10</ref-type><contributors><authors><author>Deng,Jia</author><author>Dong,Wei</author><author>Socher,Richard</author><author>Li,Li-Jia</author><author>Li,Kai</author><author>Fei-Fei,Li</author></authors></contributors><titles><title>Imagenet:Alarge-scalehierarchicalimagedatabase</title><secondary-title>2009IEEEconferenceoncomputervisionandpatternrecognition</secondary-title></titles><pages>248-255</pages><dates><year>2009</year></dates><publisher>Ieee</publisher><isbn>1424439922</isbn><urls></urls></record></Cite></EndNote>[\o"Deng,2009#101"78]目前包含超过1400000个带标签的图像,相比之下,关于类药物分子性质的最大公开数据集PDBBind仅有4000多个蛋白质−配体共晶结构样本和相关的结合亲和值ADDINEN.CITE<EndNote><Cite><Author>Liu</Author><Year>2017</Year><RecNum>102</RecNum><DisplayText><styleface="superscript">[79]</style></DisplayText><record><rec-number>102</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1621181930">102</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Liu,Zhihai</author><author>Su,Minyi</author><author>Han,Li</author><author>Liu,Jie</author><author>Yang,Qifan</author><author>Li,Yan</author><author>Wang,Renxiao</author></authors></contributors><titles><title>Forgingthebasisfordevelopingprotein–ligandinteractionscoringfunctions</title><secondary-title>Accountsofchemicalresearch</secondary-title></titles><periodical><full-title>AccountsofChemicalResearch</full-title></periodical><pages>302-309</pages><volume>50</volume><number>2</number><dates><year>2017</year></dates><isbn>0001-4842</isbn><urls></urls></record></Cite></EndNote>[\o"Liu,2017#102"79]。Tox21数据集中的有毒样本数量不到10000个。QM8具有大约22000个小分子和相关的电子性质;ESOL仅有1000多个小分子和相关的溶解度值。科学家为了获得更多的数据,除了增多昂贵且耗时的化学实验外,还不得不使用人工合成数据的方法增大数据量。例如哈佛清洁能源项目的数据集ADDINEN.CITE<EndNote><Cite><Author>Hachmann</Author><Year>2011</Year><RecNum>103</RecNum><DisplayText><styleface="superscript">[80]</style></DisplayText><record><rec-number>103</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1621181990">103</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Hachmann,Johannes</author><author>Olivares-Amaya,Roberto</author><author>Atahan-Evrenk,Sule</author><author>Amador-Bedolla,Carlos</author><author>Sánchez-Carrera,RoelS</author><author>Gold-Parker,Aryeh</author><author>Vogt,Leslie</author><author>Brockway,AnnaM</author><author>Aspuru-Guzik,Alán</author></authors></contributors><titles><title>TheHarvardcleanenergyproject:large-scalecomputationalscreeninganddesignoforganicphotovoltaicsontheworldcommunitygrid</title><secondary-title>TheJournalofPhysicalChemistryLetters</secondary-title></titles><periodical><full-title>Thejournalofphysicalchemistryletters</full-title></periodical><pages>2241-2251</pages><volume>2</volume><number>17</number><dates><year>2011</year></dates><isbn>1948-7185</isbn><urls></urls></record></Cite></EndNote>[\o"Hachmann,2011#103"80],正是使用了合成数据作数据量短缺的替代方案。这种方案下,人工近似采样会造成无意的误差。此外,数据固有的偏差和噪声也会损害数据的质量。再例如Tox21ADDINEN.CITE<EndNote><Cite><Author>Mayr</Author><Year>2016</Year><RecNum>104</RecNum><DisplayText><styleface="superscript">[81]</style></DisplayText><record><rec-number>104</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1621182181">104</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Mayr,Andreas</author><author>Klambauer,Günter</author><author>Unterthiner,Thomas</author><author>Hochreiter,Sepp</author></authors></contributors><titles><title>DeepTox:toxicitypredictionusingdeeplearning</title><secondary-title>FrontiersinEnvironmentalScience</secondary-title></titles><periodical><full-title>FrontiersinEnvironmentalScience</full-title></periodical><pages>80</pages><volume>3</volume><dates><year>2016</year></dates><isbn>2296-665X</isbn><urls></urls></record></Cite></EndNote>[\o"Mayr,2016#104"81]和DUD-E数据集ADDINEN.CITE<EndNote><Cite><Author>Mysinger</Author><Year>2012</Year><RecNum>105</RecNum><DisplayText><styleface="superscript">[82]</style></DisplayText><record><rec-number>105</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1621182229">105</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Mysinger,MichaelM</author><author>Carchia,Michael</author><author>Irwin,JohnJ</author><author>Shoichet,BrianK</author></authors></contributors><titles><title>Directoryofusefuldecoys,enhanced(DUD-E):betterligandsanddecoysforbetterbenchmarking</title><secondary-title>Journalofmedicinalchemistry</secondary-title></titles><periodical><full-title>Journalofmedicinalchemistry</full-title></periodical><pages>6582-6594</pages><volume>55</volume><number>14</number><dates><year>2012</year></dates><isbn>0022-2623</isbn><urls></urls></record></Cite></EndNote>[\o"Mysinger,2012#105"82],负面样本比阳性样本多得多。在各种毒性类型数据库中,阳性样品最低为2.9%,最高为15.5%。在目前,神经网络模型大多以数据为驱动,缺乏合格的数据会对神经网络模型预测的可靠性造成严重的干扰。正如Feinbergetal.曾在论文中表示ADDINEN.CITE<EndNote><Cite><Author>Feinberg</Author><Year>2018</Year><RecNum>106</RecNum><DisplayText><styleface="superscript">[83]</style></DisplayText><record><rec-number>106</rec-number><foreign-keys><keyapp="EN"db-id="zdvt9xwz529rflewvf4psws0ax9wdwaxpr00"timestamp="1621182270">106</key></foreign-keys><ref-typename="JournalArticle">17</ref-type><contributors><authors><author>Feinberg,EvanN</author><author>Sur,Debnil</author><author>Wu,Zhenqin</author><author>Husic,BrookeE</author><author>Mai,Huanghao</author><author>Li,Yang</author><author>Sun,Saisai</author><author>Yang,Jianyi</author><author>Ramsundar,Bharath</author><author>Pande,VijayS</author></authors></contributors><titles><title>PotentialNetformolecularpropertyprediction</title><secondary-title>ACScentralscience</secondary-title></titles><periodical><full-title>ACScentralscience</full-title></periodical><pages>1520-1530</pages><volume>4</volume><number>11</number><dates><year>2018</year></dates><isbn>2374-7943</isbn><urls></urls></record></Cite></EndNote>[\o"Feinberg,2018#106"83],为提高药物与靶点相互作用的预测精度,我们需要提供更多的有

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论