CN118332101B 一种基于分层迭代的长文本抽取式摘要生成方法和装置 (中国科学院信息工程研究所)_第1页
CN118332101B 一种基于分层迭代的长文本抽取式摘要生成方法和装置 (中国科学院信息工程研究所)_第2页
CN118332101B 一种基于分层迭代的长文本抽取式摘要生成方法和装置 (中国科学院信息工程研究所)_第3页
CN118332101B 一种基于分层迭代的长文本抽取式摘要生成方法和装置 (中国科学院信息工程研究所)_第4页
CN118332101B 一种基于分层迭代的长文本抽取式摘要生成方法和装置 (中国科学院信息工程研究所)_第5页
已阅读5页,还剩23页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种基于分层迭代的长文本抽取式摘要生于分层迭代的长文本抽取式摘要生成方法和装合各个层级的隐层表示全面地对每个句子进行2其中表示第j个段落中的第m个子段;获取文本中字符的词向量、位置向量以及结构子标题向量;计算得到位置向量PEL,对于处于中的字符均有相同的i层位置向量最后的位置向量PE由各个层级的位置向量加和得到;将词向量、位置向量以及结构子标题向量相加作为语义编码的输入将语义编码之后的向量送入各个层级编码器中,将语义信息沿着文本所述长文本预训练语言模型为Longformer模型,所述Longformer所述各个层级编码器由BiLSTM搭建,针对第i层第j个段落中的隐层表示,使用Bi_所述从文档层级至句子层级再次进行分层传递,实现迭代更新,包Longformer中全局注意力的特殊字符,随后将所有字符输入Longformer中得到其隐层表34.一种采用权利要求1~3中任一项所述方法的基于分层迭代的长文本抽取式摘要生文本语义编码模块,用于将词向量、位置向量以及结构子标信息传递模块,用于将语义编码之后的向量送入各个层级编信息融合选择模块,用于通过融合各个层级的隐层表示全面地对每个句子进行评价,4[0005]序列模型是建模自然语言文本最常使用的模型结构,其中包括CNN、LSTM、单词通过Word2Vec训练得到的词向量转化为隐层表示,随后构建了一个两层的双向GRU网[0006]随着Transformer模型的火热以及大规模预训练模型的袭来,句子语义编码的效每一句话的开头和结尾分别插入[CLS]和[SEP]标识符,将[CLS]的向量作为句子的向量表5型也开始使用图神经网络建模句间关系。HeterGraphSum将文档中的单词和句子分别作为息。随后使用GAT迭代更新句子节点和单词节点(先用句子节点先聚合邻居单词节点的信[0010]HAHSum同样基于图神经网络,但是更关注于建模句子间的冗余信息。其使用ALBERT对原始文档进行语义编码,然后使用抽象层来学习不同句子间词语级别的信息交过异构图的信息传递来更加精确地建模句子间的冗余。异质图中的节点更新均使用GAT完[0012]基于特征的恶意域名检测方法由于需要抽取特征信息,因此需要相应的领域知句子成为摘要的概率综合作为强化学习的训练策略进行梯度下机采样的方式从原始文档中抽取摘要候选集,将其与人工摘要的ROUGE值作为奖励函数训67合摘要句选择任务和句子类别预测任务作为模型整[0045]1)本发明引入了长文本中的层级结构信息,在文本序列8[0050]本发明首先将抽取式摘要问题建模为经典的序列标注问题,给定一个包含N个句i先事先使用基于贪心策略的Oracle算法为其标注一个二元标签yi摘要句数量决定最终的摘要句集合。本发明提出的HISum(HierarchicalModelingandIterativeRepresentationforExtractiveSummarization)模型将针对这一问题定义对于第i层的文本段落有其中表示第j个段落中的第m个子处于中的字符均有相同的i层位置向量PEyio最后的位置向量PE将由以上各个层级的位置向量加和得到。这里使用在Transformer中使用的位置编码计算方式对训练语言模型引入本发明的模型中。但是目前绝大多数预训练模型均基于Transformer模9训练语言模型Longformer来适应任[0060]Longformer可以视为Roberta模型针对长文本的改良版本,其与后者的主要区别种注意力机制的计算。首先每个单词会对预设的窗口大小的单词进行完整的自注意力计而全局注意力的存在则可以使每个单词了解到全文字符输入Longformer中得到其隐[CLS]表示很难得到一个好的效果。因此这里引入了一种加权注意力平均机制来得到句子[0071]这里表示第i_1层中的第j个段落中的第k个子段编码过后的隐层状态,Ci表并通过一个前向神经网络(MLP)得到对应的第i层第j个第i_1层对应的隐层向量表示Hi_1(k_1)作为key(键值),计算得到BiLSTM的初始状态向量Cic以及Wd均为可学习参数,Nm为i层第m个子段对应i_1层待聚合子段[0084]在经过分层信息传递和迭代更新增强之后,能够得到各设计了一个段落归属的辅助训练目标:将文本中子结构标题名称含义相似的标题归为一[0096]通过arXiv和PubMed这两个被广泛使用的数据集来评估模型在长文本摘要中的效[0098]使用Longformer作为模型的语义编码器,具体模型参数来自于huggingface/trainsformers中的longformer_base。对于句子层级编码器和章节层级编码器中使用的[0109]本发明使用自动评价指标ROUGE对摘要生成的结果进行评判。使用开源脚本能够显著提升摘要选择的质量。Xiao等和Nallapati等均为基于循环神经网络结构的抽取[0116]为了探究模型中众多模块所扮演的的角色,选择在arXiv数据集上进行了消融实45.2240.02HISumw/ohierarchicalpos45.1839.9944.5344.3739.8444.8639.8743.9239.75并引入辅助任务让模型在ROUGE值上取得了

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论