CN115033659B 基于深度学习的子句级自动摘要模型系统及摘要生成方法 (华东理工大学)_第1页
CN115033659B 基于深度学习的子句级自动摘要模型系统及摘要生成方法 (华东理工大学)_第2页
CN115033659B 基于深度学习的子句级自动摘要模型系统及摘要生成方法 (华东理工大学)_第3页
CN115033659B 基于深度学习的子句级自动摘要模型系统及摘要生成方法 (华东理工大学)_第4页
CN115033659B 基于深度学习的子句级自动摘要模型系统及摘要生成方法 (华东理工大学)_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于深度学习的子句级自动摘要模型系统本发明公开了基于深度学习的子句级自动型和Transformer模型的编码器对经句级抽取单量表示进行初步筛选,并输出初步候选子句摘单元,能够同时平衡摘要信息的重要性和完整2所述基于BERT的编码器和基于Transformer的编码器用于对输入字句进行处理,获得所述分类器用于对经基于BERT的编码器和基于Transformer的编码器处理的向量表示所述基于BERTScore的摘要匹配器用于计算候选子句摘要和原文的语义相似度,得到所述的句级抽取单元利用基于依存句法的启发式所述基于BERT的编码器基于BERT预训练所述基于Transformer的编码器基于Transformer所述基于BERTScore的摘要匹配器基于深度学习的自动评价指标BERTSco2.基于深度学习的子句级自动摘要生成方法,使用如权利要求1所述的自动摘要模型S2.利用基于BERT预训练模型和Transformer模型的编码器对经句级抽取单元构建的S3.利用分类器对经基于BERT的编码器和基于Transformer的编码器处理的向量表示S4.最后通过基于BERTScore的摘要匹配器,计算候选子句摘要和原文的语义相似度,(4)判断连接词conj连接的是两个子句还是两个短语,当连接的两个元素之间的距离步骤S4所述的利用基于BERTScore的摘要匹配器计算候选子句摘要和原文的语义相似(2)同时BERTScore引入重要性加权,给不同的词赋予不同的权重,给定M个参考句3词w的idf得分为:4在经过基于BERT和Transformer的编码器之后,将获得包含文档级特征的子句向量表5[0002]自动文本摘要技术利用计算机对给定的源文本信息进行概括与总结,并产生简6[0012]所述基于BERT的编码器和基于Transformer的编码器用于对输入字句进行处理,[0013]所述分类器用于对经基于BERT的编码器和基于Transformer的编码器处理的向量[0014]所述基于BERTScore的摘要匹配器用于计算候选子句摘要和原文的语义相似度,[0022]S2.利用基于BERT预训练模型和Transformer模型的编码器对经句级抽取单元构[0023]S3.利用分类器对经基于BERT的编码器和基于Transformer的编码器处理的向量7[0030](4)判断连接词conj连接的是两个子句还是两个短语,当连接的两个元素之间的[0031](5)预定义最小单元长度和最大单元长度,当元素的单元长度小于最小单元长度;nac')3)[0043]在经过基于BERT和Transformer的编码器之后,将获得包含文档级特征的子句向[0046]优选的,步骤S4所述的利用基于BERTScore的摘要匹配器计算候选子句摘要和原词w的idf得分为:8[0064](1)针对现有技术存在的问题,本发明设计了基于深度学习的子句级自动摘要模[0065](2)对于整句级抽取式摘要所引入的冗余问题和单词级抽取式摘要的语义信息完[0066](3)本发明在CS-ASum中引入了基于BERTScore的摘要级匹配器,计算候选摘要和9模型)及摘要生成方法,所述模型系统包括句级抽取单元、基于BERT的编码器、基于[0072]所述基于BERT的编码器和基于Transformer的编码器用于对经句级抽取单元构建[0073]所述分类器用于对经基于BERT的编码器和基于Transformer的编码器处理的向量[0074]所述基于BERTScore的摘要匹配器用于计算候选子句摘要和原文的语义相似度,句修饰语(acl:relcl)、状语子句修饰语(advcl)、同位语修饰语(appos)和从句补语[0080](5)预定义最小单元长度和最大单元长度,当元素的单元长度小于最小单元长度时,将该元素与前一个元素合并成一个子句,否则将其视为一个独立子句,即“Ithascreatedavirtualrealityheadsetthatworkswithanyandroidandiosphone”和“iscompatiblewithhundredsofvirtualrealityappsfromtherespective31.5825.0651.47入序列;向量表示输入序列中全部单词;后者利用模型输出中[CLS]标志对应的向量表示整句的语决循环神经网络模型存在的无法并行化和较好地捕获长期依赖等问题;Transformer遵循niA(C')(3)C'本身相加后进行层标准化计算即LN(C'+MHA(C'))然后得到计算结果作为基于Transformer编码器中第二部分的输入,首先计算包含两个线性变换的前馈神经网络再与i知句子语义层面的变化,与人工评估差距较大;而基于词向量的方法使用Word2vec或[0110]BERTScore计算时,通过匹配参考句x和候选句中每个标记计算召回率[0114]同时BERTScore引入重要性加权,给不同的词赋予不同的权重,给定M个参考句词w的idf得分为:[0120]本实施例在CS-ASum模型的分类器层之后增加了基于BERTSc将经过分类器输出的5句候选子句摘要根据子句在原文的原始位置重新排序,考虑到参考[0126]S2.利用基于BERT预训练模型和Transformer模型的编码器对经句级抽取单元构[0127]S3.利用分类器对经基于BERT的编码器和基于Transformer的编码器处理的向量处理前(整句级)和处理后(子句级)的统计信息如表31.5826.7227.05791.52769.44778.453.794.113.8855.1861.4558.3351.4750.5050.47[0161]不同模型的Rouge指标对比结果如表3所示,表中R-1、R-2、R-L评分分别代表[0167]相比于A2C-RLAS模型,CS-ASum在Rouge-1、Rouge-2、Rouge-L指标上分别获得[0170]从CNN/DailyMail测试集中随机采样100篇文章,考虑到人工评测需要耗费大量[0178]从表5可以看出,相比基于整句级抽取的CS-ASum,基于子句级抽取的CS-ASum在[0179]为验证引入预训练对摘要模型性能的影响,本文对CS-ASum中的分段嵌入和位置[018

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论