CN115526236B 一种基于多模态对比学习的文本网络图分类方法 (浙江大学)_第1页
CN115526236B 一种基于多模态对比学习的文本网络图分类方法 (浙江大学)_第2页
CN115526236B 一种基于多模态对比学习的文本网络图分类方法 (浙江大学)_第3页
CN115526236B 一种基于多模态对比学习的文本网络图分类方法 (浙江大学)_第4页
CN115526236B 一种基于多模态对比学习的文本网络图分类方法 (浙江大学)_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于多模态对比学习的文本网络图分本发明公开了一种基于多模态对比学习的络图数据的拓扑结构与节点信息中文本模态的量和文本特征向量的笛卡尔积从而获取不同模任务的表现,不仅分类准确率高且具备可解释2S1:针对待分类的多模态网络图数据集中的每一个文本网络图数据,分别对图中的拓S2:针对拓扑结构模态和文本模态分别选择匹配的编码器并采用对比学习框架分别进S3:针对每一个文本网络图数据,将对应的两种模态数据的特征向量对齐至统一维度S4:针对每一个文本网络图数据,将两种模态数据的特征向量以及跨模态共同特征向图数据的拓扑结构模态数据,并根据S11对文本网络图数据的唯一标识符存储至相应图数内容文本数据按顺序进行抽取,并根据S11对文本网络图数据的唯一标识符存储至相应图对于文本模态数据,先对文本序列进行拆解分词和标准化,并根据词S21:选择图神经网络GCN作为拓扑结构模态的编码器,3S22:针对不同模态分别设置对比学习框架,其中对于拓扑结构模态数据,采用正样本,batch内其他图数据编码得到的特征向量为负样本;对于训练中使用的两个编码S31:针对每一个文本网络图数据中拓扑结构模态数据的特征向量和文本模态数据的S33:将两次最大池化获得的第一特征向量和第二特征向量拼接后利用线性映射降维S42:针对每一个文本网络图数据,根据S41计算45在人类社会中是普遍存在的,因此图数据可以用来对大量不同领域的数据进行建模和定[0003]对比学习是一种有效的自监督模型训练范式,由于其不[0007]S1:针对待分类的多模态网络图数据集中的每一个文本网络图数据,分别对图中后以字典格式保存;再对每一种模态数据进行预处理使其满足对应模态的编码器输入要[0008]S2:针对拓扑结构模态和文本模态分别选择匹配的编码器并采用对比学习框架分[0009]S3:针对每一个文本网络图数据,将对应的两种模态数据的特征向量对齐至统一6[0010]S4:针对每一个文本网络图数据,将两种模态数据的特征向量以及跨模态共同特态网络图数据集中每一个文本网络图数据的分类标网络图数据的拓扑结构模态数据,并根据S11对文本网络图数据的唯一标识符存储至相应中的内容文本数据按顺序进行抽取,并根据S11对文本网络图数据的唯一标识符存储至相[0021]S22:针对不同模态分别设置对比学习框架,其中对于拓扑结构模态数据,采用7[0026]S31:针对每一个文本网络图数据中拓扑结构模态数据的特征向量和文本模态数[0028]S33:将两次最大池化获得的第一特征向量和第二特征向量拼接后利用线性映射8[0038]图2为基于实施例的含有文本内容的多模态对比学习的文本网络图分类方法框架[0040]如图1所示,为本发明的一个较佳实施例中提供的一种基于多模态对比学习的网[0041]S1:针对待分类的多模态网络图数据集中的每一个文本网络图数据,分别对图中后以字典格式保存;再对每一种模态数据进行预处理使其满足对应模态的编码器输入要[0042]S2:针对拓扑结构模态和文本模态分别选择匹配的编码器并采用对比学习框架分[0043]S3:针对每一个文本网络图数据,将对应的两种模态数据的特征向量对齐至统一[0044]S4:针对每一个文本网络图数据,将两种模态数据的特征向量以及跨模态共同特态网络图数据集中每一个文本网络图数据的分类标取出文本网络图数据的拓扑结构模态数据,并根据S11对文本网络图数据的唯一标识符存9节点中的内容文本数据按顺序进行抽取,并根据S11对文本网络图数据的唯一标识符存储i表示图Gi的文本内容。表形式保存的节点邻接关系进行存储。在本实施例中,可使用Python工具包PytorchGeometric(下称PyG)将节点与使用有序数对列表存储的节点邻接关系转置后存储为PyG预[0054]若将针对图数据字典中不同模态数据的预处理记为函数p,则此时文本网络图数据可表示为表示用Graph类数据存储的图节性能与对多下游任务场景的兼容性得以广泛为单位进行数据输入的训练过程中,每一batch中同一图数据经两次编码得到的特征向量将同一样本输入两次编码器即可得到互为正样本的两个文[0061]将训练数据分批次构建正负样本后输入编码器中,基于定义的对比学习损失对batch内数据进行损失计算并通过神经网络的后向传递对模型参数进行更新,直至对全部[0064]S31:针对每一个文本网络图数据中拓扑结构模态数据的特征向量和文本模态数[0066]S33:将两次最大池化获得的第一特征向量和第二特征向量拼接后利用线性映射力机制对三个特征向量做权重计算,得出三个特征向量的注意力权重,记为[0074]1)采用公开的微博谣言数据集WeiboDataset,利用Python对数据进行初步分析级转发的二级转发与评论等互动节点;同时每个节点包含与原始微博信息相关的文本内[0075]2)按照前述的步骤S1,对公开微博谣言数据集WeiboDataset中的4664条微博传播树结构数据,按照谣言事件ID定义唯一标识符,将每一个图数据记为Gi,i=1,2,…,4664.结合谣言传播树中的转发信息,以有序数对列表的形式对图中每一对邻接关系进行中的文本内容进行抽取。针对抽取出的拓扑结构数据,使用Python工具包PytorchGeometric(下称PyG)将节点与使用有序数对列表存储的节点邻接关系转置后存储为PyG预定义的Graph类数据;针对抽取出的文本数据,基于HuggingFace开源社区发布的对文本向量数据使用BERT等大规模预训练语言模型作为编码器。对图拓扑结构,采用[0077]4)按照前述的S3对经过编码器编码得到的拓扑结构信息与文本信息的特征表示与文本特征向量做笛卡尔向量积实现跨模态共同特征的提取,并对跨模态特征表示做0_1[0079]将本发明的图数据分类方法命名为MMCLGC,其相比原有的经典图数据分类方法GCN(Kipf,ThomasN.,andMaxWelling."Semi_supervisedclassificationwithgraphcon

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论