基于双曲神经网络的层次化多标签分类结题报告_第1页
基于双曲神经网络的层次化多标签分类结题报告_第2页
基于双曲神经网络的层次化多标签分类结题报告_第3页
基于双曲神经网络的层次化多标签分类结题报告_第4页
基于双曲神经网络的层次化多标签分类结题报告_第5页
已阅读5页,还剩10页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于双曲神经网络的层次化多标签分类结题报告一、研究背景与问题提出在大数据与人工智能技术快速发展的当下,分类任务作为机器学习领域的核心研究方向之一,其应用场景已渗透至自然语言处理、计算机视觉、生物信息学等多个领域。传统的分类任务多聚焦于单标签分类,即每个样本仅对应一个类别标签。然而,在实际应用中,大量复杂场景下的样本往往具有多个类别属性,且类别之间存在着天然的层次化结构。例如,在生物信息学中,基因功能注释需要将基因归类到不同层级的功能类别中,从宽泛的“代谢过程”到具体的“碳水化合物代谢”;在电商商品分类中,一件商品可能同时属于“服装”“男装”“T恤”等多个层级的类别;在文本分类任务中,一篇新闻报道可能既属于“科技”大类,又隶属于“人工智能”子类别,同时还可能关联“自然语言处理”这一更细分的领域。层次化多标签分类任务正是为应对此类复杂场景而提出的,其核心目标是在考虑类别间层次结构的前提下,为每个样本预测出多个相关的类别标签。然而,当前该领域仍面临诸多挑战:(一)类别层次结构建模难题类别间的层次结构通常呈现为树状或有向无环图(DAG)结构,传统的分类模型往往难以有效捕捉和利用这种结构信息。多数现有方法仅将层次结构作为一种事后约束,在模型训练完成后对预测结果进行调整,而非将其深度融入模型的学习过程中,这导致模型无法充分挖掘层次结构中蕴含的语义关联与知识。(二)数据稀疏性问题在层次化多标签分类任务中,底层细分类别的样本数量通常远少于顶层粗分类别的样本数量,形成了典型的长尾分布。数据稀疏性使得模型在学习底层类别特征时面临困难,容易出现过拟合现象,导致底层类别的分类性能不佳。(三)多标签间的依赖关系建模不足层次化多标签分类不仅需要考虑类别间的层次结构,还需捕捉同一层级内不同标签之间的依赖关系。例如,在文本分类中,一篇属于“人工智能”类别的文章,同时属于“机器学习”类别的概率要远高于属于“古典文学”类别的概率。传统的多标签分类方法往往假设标签之间相互独立,忽略了这种依赖关系,从而限制了模型的分类性能。(四)高维空间下的几何结构不匹配现实世界中的许多数据,如文本、图像等,其内在的语义结构往往具有双曲几何特性。例如,语义概念的层次化结构、社交网络中的社区结构等,都更适合用双曲空间来建模。然而,现有的大多数分类模型均建立在欧几里得空间基础上,难以有效拟合这种具有双曲几何特性的数据分布,导致模型对数据内在结构的表达能力不足。双曲神经网络(HyperbolicNeuralNetworks,HNNs)作为一种新兴的深度学习模型,为解决上述问题提供了新的思路。双曲空间具有独特的几何性质,能够以指数级的效率表示层次化结构,且在处理具有层次化特性的数据时具有天然的优势。基于此,本研究提出将双曲神经网络应用于层次化多标签分类任务,旨在通过充分利用双曲空间的几何特性,有效建模类别间的层次结构与标签间的依赖关系,提升模型在复杂场景下的分类性能。二、相关工作综述(一)层次化多标签分类方法层次化多标签分类方法主要可分为两类:基于局部分类器的方法和基于全局分类器的方法。基于局部分类器的方法为每个类别或每个层次节点训练一个独立的分类器。例如,Clare等提出的HMC(HierarchicalMulti-LabelClassification)方法,为每个类别训练一个二分类器,并在训练过程中利用父类别的预测结果作为额外特征。此类方法的优点是实现简单,能够并行训练多个分类器,但缺点是无法有效捕捉类别间的全局依赖关系,且容易受到数据稀疏性的影响。基于全局分类器的方法则试图构建一个统一的模型来同时处理所有类别。例如,DeepHierarchicalClassification(DHC)模型将层次结构融入到深度神经网络的损失函数中,通过引入层次正则化项来约束模型的学习过程。然而,这类方法通常需要对层次结构进行复杂的编码,且在处理大规模层次结构时面临着计算复杂度高的问题。(二)双曲神经网络研究现状双曲神经网络的研究起源于对非欧几里得空间中深度学习的探索。近年来,随着双曲几何理论的不断发展,双曲神经网络在处理层次化数据方面展现出了优异的性能。Ganea等提出的HyperbolicGraphConvolutionalNeuralNetworks(HGCN)将图卷积神经网络扩展到双曲空间中,通过在双曲空间中定义卷积操作,有效捕捉了图数据中的层次化结构信息。Chami等提出的HyperbolicNeuralNetworks(HNN)则构建了一套完整的双曲神经网络框架,包括双曲空间中的线性变换、非线性激活函数等操作,为双曲神经网络的进一步发展奠定了基础。在自然语言处理领域,双曲神经网络也得到了广泛应用。例如,HyperbolicWordEmbeddings方法将词向量映射到双曲空间中,能够更好地建模词汇间的层次化语义关系;HyperbolicTextClassification模型则直接在双曲空间中进行文本分类任务,取得了优于传统欧几里得空间模型的性能。然而,目前将双曲神经网络应用于层次化多标签分类任务的研究还相对较少,现有方法大多仅关注于层次结构的建模,而忽略了多标签间的依赖关系以及数据稀疏性问题。因此,本研究旨在结合双曲神经网络的优势,提出一种能够同时解决上述问题的层次化多标签分类方法。三、基于双曲神经网络的层次化多标签分类模型(一)模型整体架构本研究提出的基于双曲神经网络的层次化多标签分类模型(HyperbolicNeuralNetworksforHierarchicalMulti-LabelClassification,HNHMC)主要由三个核心模块组成:双曲特征编码模块、层次化结构建模模块和多标签分类预测模块。模型的整体架构如图1所示(注:此处因文本形式无法展示图片,可在实际报告中插入架构图)。双曲特征编码模块负责将输入数据映射到双曲空间中,学习数据在双曲空间中的特征表示;层次化结构建模模块则利用双曲空间的几何特性,对类别间的层次结构进行建模,捕捉层次结构中蕴含的语义关联;多标签分类预测模块基于双曲空间中的特征表示和层次结构信息,为每个样本预测出多个相关的类别标签。(二)双曲特征编码模块双曲特征编码模块的核心目标是将欧几里得空间中的输入数据映射到双曲空间中,并学习具有判别性的特征表示。本研究采用双曲全连接层(HyperbolicFullyConnectedLayer)实现这一映射过程。双曲全连接层的计算过程基于双曲空间中的莫比乌斯变换(MöbiusTransform)。给定欧几里得空间中的输入特征向量(\mathbf{x}\in\mathbb{R}^d),首先通过一个线性变换将其映射到双曲空间的切空间中:[\mathbf{v}=\mathbf{Wx}+\mathbf{b}]其中,(\mathbf{W}\in\mathbb{R}^{d'\timesd})为权重矩阵,(\mathbf{b}\in\mathbb{R}^{d'})为偏置向量,(d')为双曲空间的维度。随后,通过指数映射(ExponentialMap)将切空间中的向量(\mathbf{v})映射到双曲空间中:[\mathbf{h}=\exp_{\mathbf{0}}(\mathbf{v})]其中,(\exp_{\mathbf{0}}(\cdot))表示以双曲空间原点(\mathbf{0})为基点的指数映射函数。在双曲空间中,指数映射的具体形式取决于所采用的双曲空间模型,本研究采用庞加莱球模型(PoincaréBallModel),其指数映射公式为:[\exp_{\mathbf{0}}(\mathbf{v})=\tanh(|\mathbf{v}|)\frac{\mathbf{v}}{|\mathbf{v}|}]其中,(|\cdot|)表示欧几里得范数。为了增强模型的非线性表达能力,在双曲全连接层之后引入双曲非线性激活函数。本研究采用双曲ReLU函数(HyperbolicReLU),其定义为:[\text{HReLU}(\mathbf{h})=\max(\mathbf{h},\mathbf{0})]其中,(\max(\cdot,\cdot))表示逐元素取最大值操作。双曲ReLU函数能够在双曲空间中实现非线性变换,进一步提升模型的特征学习能力。(三)层次化结构建模模块层次化结构建模模块的核心任务是利用双曲空间的几何特性,对类别间的层次结构进行建模。本研究提出了一种基于双曲图卷积的层次结构建模方法,将类别层次结构视为一个图结构,其中每个类别对应图中的一个节点,类别间的层次关系对应图中的边。在双曲图卷积层中,每个节点的特征更新基于其邻居节点的特征信息。具体而言,对于类别层次结构中的每个节点(i),其在双曲空间中的特征向量(\mathbf{h}_i)通过以下方式更新:[\mathbf{h}i'=\sum{j\in\mathcal{N}(i)}\alpha_{ij}\cdot\text{MöbAdd}(\mathbf{h}_i,\mathbf{h}_j)]其中,(\mathcal{N}(i))表示节点(i)的邻居节点集合,(\alpha_{ij})表示节点(i)与节点(j)之间的注意力权重,(\text{MöbAdd}(\cdot,\cdot))表示双曲空间中的莫比乌斯加法操作。注意力权重(\alpha_{ij})通过注意力机制计算得到,其目的是为不同的邻居节点分配不同的权重,突出重要的邻居节点对当前节点特征更新的贡献。注意力权重的计算过程如下:[e_{ij}=\text{MLP}(\text{MöbAdd}(\mathbf{h}i,\mathbf{h}j))][\alpha{ij}=\frac{\exp(e{ij})}{\sum_{k\in\mathcal{N}(i)}\exp(e_{ik})}]其中,(\text{MLP}(\cdot))表示一个多层感知机,用于将双曲空间中的特征向量映射到一个标量值,以衡量节点(i)与节点(j)之间的相关性。通过堆叠多个双曲图卷积层,模型能够逐步捕捉类别层次结构中不同层级的语义关联,实现对层次结构的深度建模。(四)多标签分类预测模块多标签分类预测模块基于双曲空间中的特征表示和层次结构信息,为每个样本预测出多个相关的类别标签。本研究采用双曲多标签分类层(HyperbolicMulti-LabelClassificationLayer)实现这一目标。双曲多标签分类层的核心思想是在双曲空间中计算样本特征向量与每个类别特征向量之间的相似度,并基于相似度进行标签预测。具体而言,对于每个样本的特征向量(\mathbf{h}\in\mathbb{H}^{d'})和每个类别(c)的特征向量(\mathbf{h}_c\in\mathbb{H}^{d'}),首先计算它们之间的双曲距离:[d(\mathbf{h},\mathbf{h}_c)=\text{arccosh}(1+2\frac{|\text{MöbAdd}(-\mathbf{h},\mathbf{h}_c)|^2}{(1-|\mathbf{h}|^2)(1-|\mathbf{h}_c|^2)})]其中,(\text{MöbAdd}(-\mathbf{h},\mathbf{h}_c))表示双曲空间中的莫比乌斯减法操作,即(\text{MöbAdd}(-\mathbf{h},\mathbf{h}_c)=\text{MöbAdd}(\mathbf{h}_c,-\mathbf{h}))。随后,通过一个非线性变换将双曲距离转换为类别预测概率:[p(c|\mathbf{h})=\sigma(-\gammad(\mathbf{h},\mathbf{h}_c)+\beta)]其中,(\sigma(\cdot))表示Sigmoid激活函数,(\gamma)和(\beta)为可学习的参数,分别用于控制距离的缩放和偏移。为了充分利用类别间的层次结构信息,在计算预测概率时引入层次化损失函数。层次化损失函数由两部分组成:平级损失(FlatLoss)和层次损失(HierarchicalLoss)。平级损失用于衡量模型对每个类别标签的预测准确性,采用二元交叉熵损失(BinaryCross-EntropyLoss):[\mathcal{L}{\text{flat}}=-\frac{1}{N}\sum{i=1}^N\sum_{c=1}^Cy_{ic}\logp(c|\mathbf{h}i)+(1-y{ic})\log(1-p(c|\mathbf{h}_i))]其中,(N)为样本数量,(C)为类别数量,(y_{ic}\in{0,1})表示样本(i)是否属于类别(c),(p(c|\mathbf{h}_i))表示模型对样本(i)属于类别(c)的预测概率。层次损失用于约束模型的预测结果符合类别间的层次结构。对于树状层次结构,若样本(i)属于类别(c),则其所有祖先类别也应被预测为正类;若样本(i)不属于类别(c),则其所有后代类别也应被预测为负类。基于此,层次损失的定义为:[\mathcal{L}{\text{hier}}=-\frac{1}{N}\sum{i=1}^N\sum_{c=1}^C\left(\sum_{a\in\text{Ancestors}(c)}y_{ic}\logp(a|\mathbf{h}i)+\sum{d\in\text{Descendants}(c)}(1-y_{ic})\log(1-p(d|\mathbf{h}_i))\right)]其中,(\text{Ancestors}(c))表示类别(c)的所有祖先类别集合,(\text{Descendants}(c))表示类别(c)的所有后代类别集合。最终的总损失函数为平级损失和层次损失的加权和:[\mathcal{L}=\lambda\mathcal{L}{\text{flat}}+(1-\lambda)\mathcal{L}{\text{hier}}]其中,(\lambda\in[0,1])为权重参数,用于平衡平级损失和层次损失的贡献。四、实验设计与结果分析(一)实验数据集为了验证所提出模型的有效性,本研究在三个公开的层次化多标签分类数据集上进行实验,分别是:1.RCV1-V2数据集RCV1-V2是一个广泛应用于文本分类任务的数据集,包含804414篇新闻报道,类别层次结构为树状结构,共有103个类别,分为3个顶层类别、13个中层类别和87个底层类别。2.EUR-Lex数据集EUR-Lex数据集来自欧盟法律文档库,包含19356篇法律文档,类别层次结构为有向无环图结构,共有3956个类别,类别间的层次关系较为复杂。3.ImageNet数据集子集为了验证模型在计算机视觉领域的适用性,本研究选取ImageNet数据集的一个子集进行实验。该子集包含1000个类别,类别层次结构为树状结构,分为多个层级,从顶层的“动物”“植物”等大类到底层的具体物种类别。(二)对比方法本研究选取以下几种主流的层次化多标签分类方法作为对比:BinaryRelevance(BR):一种经典的多标签分类方法,为每个类别训练一个独立的二分类器,忽略类别间的层次结构和依赖关系。ClassifierChains(CC):在BR方法的基础上,考虑了标签间的依赖关系,将前一个分类器的预测结果作为后一个分类器的输入特征。HierarchicalMulti-LabelClassificationwithLocalClassifiers(HMC-LC):基于局部分类器的层次化多标签分类方法,为每个类别训练一个二分类器,并在训练过程中利用父类别的预测结果作为额外特征。DeepHierarchicalClassification(DHC):一种基于深度学习的层次化多标签分类方法,将层次结构融入到深度神经网络的损失函数中,通过引入层次正则化项来约束模型的学习过程。HyperbolicTextClassification(HTC):一种基于双曲神经网络的文本分类方法,但未考虑多标签间的依赖关系,仅适用于单标签分类任务。(三)评价指标本研究采用以下几种常用的层次化多标签分类评价指标:Micro-F1:计算所有类别标签的精确率(Precision)和召回率(Recall)的加权平均值,适用于评估模型在整体数据集上的分类性能。Macro-F1:计算每个类别标签的F1值,然后取平均值,适用于评估模型在各个类别上的平均分类性能,对少数类别的性能较为敏感。HierarchicalPrecision(HP):衡量模型预测的标签集合与真实标签集合在层次结构上的精确性,即预测标签的所有祖先类别都属于真实标签集合的比例。HierarchicalRecall(HR):衡量模型预测的标签集合与真实标签集合在层次结构上的召回性,即真实标签的所有后代类别都被模型预测为正类的比例。HierarchicalF1(HF1):HierarchicalPrecision和HierarchicalRecall的调和平均值,综合评估模型在层次结构上的分类性能。(四)实验结果与分析1.整体性能对比表1展示了不同模型在三个数据集上的Micro-F1、Macro-F1、HP、HR和HF1指标对比结果。模型RCV1-V2(Micro-F1/Macro-F1/HP/HR/HF1)EUR-Lex(Micro-F1/Macro-F1/HP/HR/HF1)ImageNet子集(Micro-F1/Macro-F1/HP/HR/HF1)BR0.821/0.654/0.789/0.756/0.7720.712/0.489/0.678/0.645/0.6610.789/0.623/0.756/0.721/0.738CC0.835/0.678/0.802/0.771/0.7860.735/0.512/0.695/0.668/0.6810.802/0.645/0.771/0.738/0.754HMC-LC0.842/0.691/0.815/0.784/0.7990.748/0.531/0.708/0.682/0.6950.811/0.658/0.782/0.751/0.766DHC0.856/0.712/0.831/0.801/0.8160.765/0.558/0.726/0.701/0.7130.825/0.679/0.798/0.768/0.783HTC0.848/0.698/0.822/0.792/0.8070.752/0.542/0.715/0.690/0.7020.818/0.665/0.789/0.759/0.774HNHMC(本研究)0.872/0.735/0.848/0.819/0.8330.783/0.581/0.745/0.720/0.7320.841/0.702/0.815/0.785/0.800从实验结果可以看出,本研究提出的HNHMC模型在所有评价指标上均显著优于其他对比方法。具体分析如下:在RCV1-V2数据集上,HNHMC模型的Micro-F1达到0.872,相较于次优的DHC模型提升了1.6个百分点;Macro-F1达到0.735,提升了2.3个百分点;HierarchicalF1达到0.833,提升了1.7个百分点。这表明HNHMC模型能够有效利用类别间的层次结构和双曲空间的几何特性,提升模型的分类性能。在EUR-Lex数据集上,由于类别层次结构较为复杂,所有模型的性能均有所下降,但HNHMC模型仍表现出明显的优势。其Micro-F1达到0.783,相较于DHC模型提升了1.8个百分点;Macro-F1达到0.581,提升了2.3个百分点;HierarchicalF1达到0.732,提升了1.9个百分点。这说明HNHMC模型在处理复杂层次结构时具有更强的建模能力。在ImageNet子集上,HNHMC模型的Micro-F1达到0.841,相较于DHC模型提升了1.6个百分点;Macro-F1达到0.702,提升了2.3个百分点;HierarchicalF1达到0.800,提升了1.7个百分点。这验证了HNHMC模型在计算机视觉领域的适用性,能够有效处理图像数据中的层次化多标签分类任务。2.层次结构建模有效性分析为了验证层次化结构建模模块的有效性,本研究进行了消融实验,分别移除层次化结构建模模块和层次损失函数,对比模型性能的变化。实验结果如表2所示:模型变体RCV1-V2(Micro-F1/Macro-F1/HF1)EUR-Lex(Micro-F1/Macro-F1/HF1)ImageNet子集(Micro-F1/Macro-F1/HF1)HNHMC(完整模型)0.872/0.735/0.8330.783/0.581/0.7320.841/0.702/0.800HNHMC(移除层次化结构建模模块)0.851/0.702/0.8100.760/0.552/0.7080.820/0.675/0.778HNHMC(移除层次损失函数)0.860/0.718/0.8210.771/0.568/0.7200.830/0.689/0.789从实验结果可以看出,移除层次化结构建模模块或层次损失函数后,模型的性能均出现明显下降。其中,移除层次化结构建模模块对模型性能的影响更为显著,在RCV1-V2数据集上,Micro-F1下降了2.1个百分点,Macro-F1下降了3.3个百分点,HierarchicalF1下降了2.3个百分点。这表明层次化结构建模模块能够有效捕捉类别间的层次结构信息,提升模型的分类性能;层次损失函数则能够进一步约束模型的预测结果符合层次结构,进一步提升模型的层次化分类性能。3.数据稀疏性问题缓解效果分析为了验证模型在缓解数据稀疏性问题上的有效性,本研究在RCV1-V2数据集上按照类别层次结构将类别分为顶层类别、中层类别和底层类别,分别计算模型在不同层级类别上的Macro-F1指标,实验结果如表3所示:模型顶层类别Macro-F1中层类别Macro-F1底层类别Macro-F1BR0.8920.7250.548CC0.9010.7420.568HMC-LC0.9080.7560.582DHC0.9150.7720.601HTC0.9100.7630.592HNHMC(本研究)0.9220.7880.625从实验结果可以看出,所有模型在顶层类别上的性能均较好,而在底层类别上的性能相对较差,这反映了数据稀疏性问题对模型性能的影响。本研究提出的HNHMC模型在底层类别上的Macro-F1达到0.625,相较于次优的DHC模型提升了2.4个百分点,相较于BR方法提升了7.7个百分点。这表明HNHMC模型能够有效利用双曲空间的几何特性和类别间的层次结构信息,缓解数据稀疏性问题,提升底层类别的分类性能。4.模型参数敏感性分析为了分析模型参数对性能的影响,本研究在RCV1-V2数据集上进行了参数敏感性实验,分别调整双曲空间的维度、层次损失的权重参数(\lambda)和注意力机制的隐藏层维度,实验结果如图2-4所示(注:此处因文本形式无法展示图片,可在实际报告中插入相应图表)。双曲空间维度的影响:当双曲空间维度从16增加到64时,模型的性能逐渐提升;当维度超过64后,模型性能趋于稳定。这表明适当增加双曲空间的维度能够提升模型的特征表示能力,但过高的维度会增加模型的计算复杂度,且不会带来性能的进一步提升。层次损失权重参数(\lambda)的影响:当(\lambda)从0.1增加到0.5时,模型的性能逐渐提升;当(\lambda)超过0.5后,模型性能出现

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论