CN115017299B 一种基于去噪图自编码器的无监督社交媒体摘要方法 (天津大学)_第1页
CN115017299B 一种基于去噪图自编码器的无监督社交媒体摘要方法 (天津大学)_第2页
CN115017299B 一种基于去噪图自编码器的无监督社交媒体摘要方法 (天津大学)_第3页
CN115017299B 一种基于去噪图自编码器的无监督社交媒体摘要方法 (天津大学)_第4页
CN115017299B 一种基于去噪图自编码器的无监督社交媒体摘要方法 (天津大学)_第5页
已阅读5页,还剩40页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于去噪图自编码器的无监督社交媒本发明公开一种基于去噪图自编码器的无得到的伪社交关系网络实例与帖子的初始内容残差图注意力网络编码器根据帖子的初始内容图自编码器能够学习移除帖子级别社交关系网用基于稀疏重构的摘要抽取器进行最终摘要的2S1、根据社会学理论构建帖子级别社交关系网络设置虚假关系对应的噪声函数为关系插入,设置潜通过向真实的社交关系网络中添加噪声关系的实例,构造伪社交据S4、根据步骤S3得到的帖子表示,采用基于稀疏2.根据权利要求1所述一种基于去噪图自编码器的无监督社交媒体摘要方法,其特征之间建立一条边;表达传染性关系是指具有直接交互关系的用户发布的帖子之间的关系,3关系网络时为具有表达传染性关系的帖子节点之间建3.根据权利要求2所述一种基于去噪图自编码器的无监督社交媒体摘要方法,其特征根据以下规则构建帖子级别社交关系网络S=(V,E),其中V表示节点集合,每个节点对应交关系中:如果帖子siep(un),sjEP(un),∈(y)或那么为帖子si与sj之间建立一条边eij∈ε;根据这两条规则构建出系即边集合ε={e11,e12,…,eNN};构建的帖子级别社交关系网络对应的邻接矩阵记为(102)利用预训练BERT模型获得帖子的内容编码,作为帖子的初始内容表示,具体如4.根据权利要求1所述一种基于去噪图自编码器的无监督社交媒体摘要方法,其特征残差图注意力网络编码器将节点的初始内容表示xeRNXD与帖子级别社交关系网络图注意力网络编码器的传播规则如公式(2)与公式(其中H(l)是残差图注意力网络编码器在第l层的隐表示,A是帖子级别社交关系网络对4其中hi与hj分别表示帖子si与帖子sj由残差图注意力网络编码和分别表示在第k个注意力头中帖子si与sj之间的注意力得分以及归一化后Tαij表示帖子si与sj之间最终的注意力权重;将普通图注意力网络中各层之间的连接替残差图注意力网络编码器的深度决定了帖子级别社交关系网络中信息传播的距离,残差出H(c)=即为编码得到的帖子的向量表示,其中hf"表示残差图注意力5.根据权利要求1所述一种基于去噪图自编码器的无监督社交媒体摘要方法,其特征通过设置基于两种重构目标的解码器;使解码器重构未加噪声关系的真实5对于真实的社交关系网络的重构,解码器根据两个节点的向量表示间存在社交关系的概率,其中是解码器输出的帖子级别社交关系网络对应的邻接矩阵,AY表示解码器预测的帖子si与sj之间存在社交关系的概率,n"与h"分别表示帖子si与对于文本内容重构,提出重构帖子与单词之间的关系,通过重构每个其中与baeR"是解码器的学习参数,Z是编码器得到的帖子的向量表示的E"g针对上述两种重构目标分别设计相应的损失函数,整体训练目g根据损失函数对残差图注意力网络编码器与解码器进行训练,训到融合社交关系信息与文本内容信息并移除了噪声关系的准确的帖子表示H=[h1,h2,…,给定残差图注意力网络编码器编码得到的移除了噪声关系之后的准确的帖子表示H=6帖子sj对于重构帖子si的贡献程度;为防止抽取出重复冗余的内容,引入一个相似度矩阵veRN来移除冗余信息,其中如果帖子si与帖子sj的余弦相似度高于特定阈值η,则令对重构系数矩阵V增加L21约束能够使得重构系数矩阵的每一行具有稀疏特系数矩阵中每一行的大多数元素为0,意味着每个帖子只能够由有限的若干个帖子进行重7容体量的急剧增加导致了严重的信息过载问题,为信息的高效检索提出了更加严峻的挑[0003]社交媒体文本自动摘要致力于为大量的社交媒体内容集合自动产生言简意赅的[0005]已有的社交媒体摘要研究主要基于帖子的内容对每个帖子独或者具有歧义的信息,无法提供充足的信息,导致帖子的特征存在稀疏与不准确的问题;(2)社交媒体依赖于用户通过社会接触去主动地传播与接收信息,这个过8[0006]一些工作试图通过利用社交媒体上提供的一些简单社交信号来促进对于社交媒过设置相应的噪声函数,向原始帖子级别社交关系网络中添加虚假关系与潜在关系的实时作为残差图注意力网络编码器的输入,残差图注意力网络编码器包含多头注意力机制,解码器一方面根据帖子的向量表示重构真实的社交关系网络以捕捉帖子之间的社交关系信息,另一方面同时重构帖子与其所包含单词之间的语义关系以捕捉帖子的文本内容信器与解码器能够学习排除帖子级别社交关系网络中的噪声关系,最终得到准确的帖子表9帖子级别社交关系网络时为具有表达传染性关系[0015](101)对帖子级别社交关系网络形式化地描述如下性社交关系中:如果帖子siEP(ux),s;EP(un),其中uk表示第k个用户,那么为帖子si与帖有ueN(uy)或YEW(u)那么为帖子si与sj之间建立一条边eij∈ε;根据这两条规则构建出帖子级别社交关系网络其中只包含了帖子节点集合D=S1,SZ,…,SW}以及节点之[0019]其中xi表示帖子si的初始内容表示,最终得到所有N个帖子的初始内容表示X=[0025]设置虚假关系对应的噪声函数为关系插入,设置潜在关系的噪声函数为关系丢[0030]得到伪社交关系网络与帖子的初始内容表示之后,为了建模帖子之间的社交关[0034]其中H(l)是残差图注意力网络编码器在第l层的隐表示,A是帖子级别社交关系网力权重之后的帖子级别社交关系网络对应的邻接矩阵,表示增加注意力权重之后帖子[0037]其中hi与hj分别表示帖子si与帖子sj由残差图注意力网络编码器编码得到的向量T了表示层数的上标(l),并使用上标headk来指示第k个注意力头;与操作自动选择所有子空间中最强的关系作为两个帖子节点之间的真实关系,并将K个注意的输出即为编码得到的帖子的向量表示,其中表示残差图注与buE"是解码器的学习参数,V表示词表大小;eR"是解码可得到融合社交关系信息与文本内容信息移除了噪声关系的准确的帖子表示H=[h1,阵veRNN来移除冗余信息,其中如果帖子si与帖子sj的余弦相似度高于特定阈值η,则令重构系数矩阵中每一行的大多数元素为0,意味着每个帖子只能够由有限的若干个帖子进迭代地选择得分最高的帖子加入最终的摘要集合,重复这个过程直到达到摘要的长度限[0072]3.本发明得到的社交媒体文本内容摘要相比够为同一个节点的不同邻居节点赋予不同的权重,从而提高重要邻居节点的注意力权重,空间中最强的关系作为两个节点之间的真实关系,并将K个注意力头中的注意力权重统一[0077]图1为本发明提供的基于去噪图自编码器的无监督社交媒体摘要方法整体架构示[0080]图4a和图4b显示了去噪函数中不同的去噪方式以及不同的噪声比率对结果的影帖子的发布时间都在保证在5天范围内。对于推特数据,推特中文本内容的主要语言为英下有3个标准参考摘要用于对结果进行评估。两个数据集经过预处理过后的数据统计详细uyeN(u),那么为帖子si与sj之间建立一条边eij∈ε;根据这两条规则构建出帖子级别社交关系网络s,其中只包含了节点集合D=fs1,sz,…,sw}以及节点之间的关系即边集合ε=Ae,其中Aij的TFIDF表示之间的余弦相似度作为帖子之间内容上的相关性。令子级别社交关系网络的邻接矩阵,其中Aij>0表示帖子节点si与帖子sj之间具有社交关系(即Aij>0)且他们之间的内容上的相关性Φij低于阈值θ,则认为帖子si与sj之间具有虚假i与sj之间没有社交关系相连(即Aij=[0091]其中Φij是帖子si与帖子sj之间内容上的相关性。最终对于推特和微博两个数据集上的统计结果如表2所示。结果显示了所有话题下帖子级别社交关系网络中噪声关系的系网络$,真实的社交关系网络s与对应的伪社交关系网络构成成对的训练数据[0100]其中H(l)是残差图注意力网络编码器在第l层的隐表示,A是帖子级别社交关系网力权重之后的帖子级别社交关系网络对应的邻接矩阵,表示增加注意力权重之后帖子[0103]其中hi与hj分别表示帖子si与帖子sj由残差图注意力网络编码器编码得到的向量T了表示层数的上标(l),并使用上标headk来指示第k个注意力头;与将K个注意力头中的注意力权重统一为最终的注意的输出即为编码得到的帖子的向量表示,其中hf"表示残差图注i(13)[0123]为了验证本发明方法的有效性,将本发明方法(DSNSum)分别与两类方法进行比[0126]Lexrank[4]是一种类似PageRank的图排序算法,首先通过根据帖子之间内容的相[0133]SCMGR[10]在帖子之间的社交关系网络上使用图卷积网络来编码融合了文本内容和社交结构的帖子表示,并将学到的融合表示输入到稀疏重构框架中进行重要帖子的抽中采用ROUGE-1与ROUGE-2标准来进行评估;ROUGE-L衡量输出摘要与标准摘要之间的最长46.5144.1620.7645.0242.7244.1441.689.7634.368.93掉任何一个模块都会导致性能的降低,证明了每个模块对模型整体都具有一定的促进作系网络的拓扑结构特征能够从社会学角度为[0143]为了进一步分析本发明方法中提出的去噪图自编码器模块是否具有去除噪声关例的下降幅度分别达到25.01%与37.88这说明去噪模块更加擅长去除网络中的虚假关[0147]为了验证去噪图自编码器(DGAE)学到的帖子表示是否更加优值θ的计算方式按如下公式所示:[0151]图3中x轴表示阈值δ的取值。子图(a)和(c)对应使用BERT模型编码得到的表示的种噪声关系的添加顺序是否对模型的性能有所影响,进一步调整两种噪声关系的添加顺[0153]图4a和图4b显示了去噪函数中不同的去噪方式以及不同的噪声关系添加概率对[0156][1]VaswaniA,ShazeerN,ParmarN,etal.AttentionisAllYouNeProceedingsofthe31stInternationalConferenceonNeuralInformationProcessingSystems,2017:6000–6010.Zhang.2001.ExperimentsinSingleandMulti-DocumentSummarizationUsingMEAD.InFirstDocumentUnderstandingConference.1[0158][3]YihongGongandXinLiu.2001.GenericTextSummarizationUsingRelevanceMeasureandLatentSemanticAnalysis.InProceedingsofthe24thAnnualInternationalACMSIGIRConferenceonResearchandDevelopmentinInformationRetrieval.1[0159][4]GunesErkanandDragomirRadev.2011.LexRank:Graph-basedLexicalCentralityAsSalienceinTextSummarization.JournalofArtifcialsummarizationbasedondatareconstruction.InTwenty-sixthAAAIConferenceonArtifcialIntelligence.620[0161][6]HeLiu,HongliangYu,andZhi-HongDeng.2015.Multi-DocumentSummarizationBasedonTwo-LevelSparseRepresentationModel.InProceedingsoftheTwenty-NinthAAAIConferenc[0162][7]RuifangHeandXingyiDuan.2018.TwitterSummarizationBasedonSocialNetworkandSparseReconstruction.InProceedingsoftheThirty-SecondAAAIConferenceonArtifcialIntelligence.5787[0163][8]HaoZhengandMirellaLapata.2019.SentenceCentralityRevisitedforUnsupervisedSummarization.InProceedingsofthe57thAnnualMeetingoftheAssociationforComputationalLinguisti[0164][9]BaobaoChangKexiangWangandZhifangSui.2020.ASpectralMethodforUnsupervisedMulti-DocumentSummarization.InProceedingsofthe[0165][10]HuanyuLiu,RuifangHe,LiangliangZhao,Ha

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论