版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
1基于统计的文本表示2什么是文本表示?
文本表示指的是将文本信息转化为计算机可处理的形式,以便于进行文本分析、挖掘和机器学习等任务。在自然语言处理领域,文本表示是一项核心任务,因为计算机无法直接理解和处理人类的自然语言。文本表示的目标是将文本中的语义和结构信息捕捉到数值化的表示形式中,以便于计算机进行进一步的分析和推理。3文本表示的常见形式4独热编码
——
One-hot深度学习应用于自然语言处理之前,传统的词表达通常采用one-hot方式表达。杭州[0,0,0,0,0,0,0,1,0,……,0,0,0,0,0,0,0]
上海[0,0,0,0,1,0,0,0,0,……,0,0,0,0,0,0,0]
宁波[0,0,0,1,0,0,0,0,0,……,0,0,0,0,0,0,0]
北京[0,0,0,0,0,0,0,0,0,……,1,0,0,0,0,0,0]1.向量维度取决于语料库中词数,导致维数灾难2.向量之间相互独立,看不出关联关系传统的基于规则或者基于统计的自然语言处理方法将单词看作一个原子符号。one-hot表示将词语看作一个长向量。这个向量的维度是词表大小,向量中只有一个维度的值是1,其余维度是0,这个维度就代表了当前的词;5独热编码
——
One-hot缺陷总结:1.维度过高:随着词表增大,维度会越来越大2.矩阵稀疏:one-hot表示的每一个词向量只有1维有数值,其他维度都是03.不能保留语义信息:one-hot表示的结果不能保留词语在句子中的位置信息;4.词汇鸿沟:任意两个词都是孤立的,不能提现词和词之间的关系;5.可复用性差:若任务过程中词表扩充,则相应的每个词的维度必须增加;6.错误估计:若某个词出现次数很少的话,则相应的权重会很容易就被错误估计;6BagofWords(BOW)模型BOW模型就是用一个向量表示一句话或一个文档。BOW模型忽略文档的词语顺序、语法、句法等要素,将文档看作是若干个词汇的集合,文档中每个词都是独立的。BOW模型每个维度上的数值代表ID对应的词在句子里出现的频次。BOW模型与one-hot表示相比存在的缺点如下。维数高和稀疏性:不能保留词语在句子中的位置信息,如“我为你鼓掌”和“你为我鼓掌”向量化结果依然没有区别。不能保留语义:当语料增加时,维数也会增大,一个文本里不出现的词就会增多,导致矩阵稀疏。7BagofWords(BOW)模型示例8TF-IDFTF-IDF(词频-逆文档频率)表示是用一个向量表示一句话或者一个文档,考虑到某个单词在当前文本中的重要性和在整个语料库中的普遍性,使用词频和逆文档频率的乘积作为单词的权重。通过计算文本中所有单词的TF-IDF值,构成一个向量表示文本。他的表示过程如下:1.首先TF-IDF是在BOW的基础上对词出现的频次赋予TF-IDF权值;2.其次对BOW模型进行修正,进而表示该词在文档集合中的重要程度;9TF-IDF计算过程10TF-IDF示例文本1:"Appleismyfavoritefruit."文本2:"Iloveeatingapples."文本3:"Anappleadaykeepsthedoctoraway."Step1:计算词频(TermFrequency,TF)首先,我们计算每个文本中每个单词的词频。在我们的例子中,文本1中包含单词"Apple"一次,"is"一次,"my"一次,"favorite"一次,"fruit"一次。因此,文本1的词频为:"Apple":1
"is":1
"my":1
"favorite":1
"fruit":1同样地,我们计算文本2和文本3的词频。11TF-IDF示例Step2:计算逆文档频率(InverseDocumentFrequency,IDF)然后,我们计算每个单词的逆文档频率。逆文档频率的计算公式是:IDF=log(总文档数/包含该单词的文档数)在我们的例子中,我们有3个文本。计算每个单词的逆文档频率:"Apple":log(3/2)≈0.176"is":log(3/1)≈0.405"my":log(3/1)≈0.405"favorite":log(3/1)≈0.405"fruit":log(3/1)≈0.40512TF-IDF示例Step3:计算TF-IDF最后,我们将词频和逆文档频率相乘,得到TF-IDF值。在我们的例子中,计算每个单词在每个文本中的TF-IDF值:"Apple"在文本1中的TF-IDF值为:1*0.176≈0.176"is"在文本1中的TF-IDF值为:1*0.405≈0.405"my"在文本1中的TF-IDF值为:1*0.405≈0.405"favorite"在文本1中的TF-IDF值为:1*0.405≈0.405"fruit"在文本1中的TF-IDF值为:1*0.405≈0.405以此类推,计算文本2和文本3中每个单词的TF-IDF值。13实践部分使用one-hot和TF-IDF计算文本表示基于统计的文本表示14基于Word2Vec的文本表示15文本表示方法比较离散式表示(DiscreteRepresentation):One-Hot、TF-IDF、词袋模型分布式表示(DistributedRepresentation):Word2Vec缺点:无法反映单词之间的相似程度16Word2Vec基本思想:通过训练将每一个词映射成一个固定长度的向量,所有向量构成一个词向量空间,每一个向量(单词)可以看作是向量空间中的一个点,意思越相近的单词距离越近。1.词向量中语义上相近的词距离接近2.词向量中语法上相近的词距离接近CBOW和Skip-gram如果是用一个词的上下文作为输入,来预测这个词本身,则是『CBOW模型』如果是用一个词作为输入,来预测它的上下文词,则这个模型叫做『Skip-gram模型』CBOWPineapplesarespikeyandyellow在CBOW模型中,我们用一个中心词在文本序列中的上下文词来预测该中心词。CBOW模型结构:一个具有输入层、隐藏层和输出层的3层神经网络
Skip-gram在Skip-gram模型中,我们用一个词来预测它在文本序列中周围的词。PineapplesarespikeyandyellowSkip-gram模型结构:一个具有输入层、隐藏层和输出层的3层神经网络
22词向量的应用寻找相似词信息检索查询扩展知识推演计算相似度文本分类情感分析文档主题判别作为神经网络的输入无监督句子/文档表示有监督句子/文档表示句子/文档表示23实践部分基于Word2Vec的文本表示基于Word2Vec的文本表示24基于预训练的文本表示
NLP预训练模型的发展语言模型word2vecglovefasttextelmoopenAI-GPTBERT词嵌入阶段预训练模型阶段2003年Bengio2013年Mikolov2014年Jeffrey
2018年2月Allen
2016年facebook2018年6月openAI2018年10月google+复杂网络模型+简单mlpBERT预训练-微调框架BERT训练的词向量有什么不同?在word2vec中,相同词对应的向量训练好后就固定了但在不同的场景中,‘干什么’的意思会相同吗?这俩兄弟都叫transformer:BERT预训练-微调框架Bidirectional
Encoder
Representations
from
Transformers说白了就是transformer的encoder部分并不需要标签,有语料就能训练了EncoderBERT是一个算法模型,它的出现打破了大量的自然语言处理任务的记录。在BERT的论文发布不久后,Google的研发团队还开放了该模型的代码,并提供了一些在大量数据集上预训练好的算法模型下载方式,这使得所有人都可以通过它来构建一个涉及NLP的算法模型,节约了大量训练语言模型所需的时间,精力,知识和资源BERT预训练-微调框架BERT—模型结构特点:完全的双向,每一层都是同时关乎上下文transformer可以对长句子有更强的特征抽取的能力输入词嵌入段嵌入位置嵌入BERT预训练-微调框架BERT—模型结构2个BERT的模型都有一个很大的编码器层数,(论文里面将此称为TransformerBlocks)-基础版本就有12层,进阶版本有24层。同时它也有很大的前馈神经网络(768和1024个隐藏层神经元),还有很多attentionheads(12-16个)。这超过了Transformer论文中的参考配置参数(6个编码器层,512个隐藏层单元,和8个注意头)BERT预训练-微调框架如何训练BERT方法1:MLM(MaskedLanguageModeling)当前词出现不只是单单依靠上文或者下文,其实应该是同时依赖于上下文深层的双向RNN会互相透露信息。句子中有15%的词汇被随机mask掉交给模型去预测被mask的部分到底是什么词语的可能性太多了,中文一般是字如果BERT训练的向量好,那分类自然OKBERT预训练-微调框架如何训练BERT方法2:预测两个句子是否应该连在一起[seq]:两个句子之前的连接符,[cls]:表示要做分类的向量BERT预训练-微调框架Finetuning如何设计网络呢?需要分别计算答案的起始和终止位置待分类句子A:Datawhale是一个专注于Al领域的开源组织模型输出以下各token的向量:[CLS]Datawhale是一个专注于Al领域的开源组织[SEP][CLS]表示的向量一般可以认为是句向量,用[CLS]向量对接下游文本分类任务,可得到finetuning的文本分类模型BERT预训练-微调框架33实践部分基于BERT预训练模型的文本表示基于预训练的文本表示34基于BiLSTM的文本分类35文本分类基本概念随着互联网的高速发展,海量文本数据不断产生,如何面对浩如烟海的数据进行分类、组织和管理,已经成为一个具有重要用途的研究课题,广受学术界和工业界关注。文本分类(TextClassification)根据给定文档的内容或主题,自动分配预先定义的类别标签。文本聚类(TextClustering)根据文档之间的内容或主题相似度,将文档集合划分成若干个子集,每个子集内部的文档相似度较高,而子集之间的相似度较低。应用场景:新闻自动分类、电子商务评价分类、垃圾邮件识别等。
36文本分类基本概念文本分类模型基于机器学习的分类:朴素贝叶斯(NaiveBayes)、支持向量机(SVM)、最大熵分类器基于神经网络的方法:多层感知机(MLP)、卷积神经网络(CNN)、循环神经网络(RNN)文本聚类模型基于距离的聚类:通过相似度函数计算语义关联度,然后根据语义关联度进行聚类,如K-means基于概率模型的聚类:假设每篇文章是所有主题上的概率分布,典型的主题模型包括PLSA和LDA等图为有监督分类方法的一般过程,无监督分类/聚类方法将训练部分去掉即可实践先验——长短时记忆神经网络LSTM长短时记忆神经网络(LongShort-TermMemoryNeuralNetwork,LSTM)是循环神经网络的一个变体,可以有效地解决长期依赖问题/梯度消失问题。LSTM模型的关键是引入了一组记忆单元(MemoryUnits),允许网络可以学习何时遗忘历史信息,何时用新信息更新记忆单元。在时刻t时,记忆单元ct记录了到当前时刻为止的所有历史信息,并受三个“门”控制:输入门it,遗忘门ft和输出门ot。三个门的元素的值在[0,1]之间。核心:记忆(细胞状态)和门机制门(Gate)是一种可选地让信息通过的方式。它由一个Sigmoid神经网络层和一个点乘法运算组成。Sigmoid神经网络层输出0和1之间的数字,这个数字描述每个组件有多少信息可以通过,0表示不通过任何信息,1表示全部通过细胞的状态在整条链上运行,只有一些小的线性操作作用其上,信息很容易保持不变的流过整条链。实践先验——LSTMForgetGate
遗忘门决定我们要从细胞状态中丢弃什么信息它查看ht-1(前一个隐藏状态)和xt(当前输入),并为状态Ct-1(上一个状态)中的每个数字输出0和1之间的数字1代表完全保留,而0代表彻底删除以语言模型为例,细胞状态可能包括当前主语的性别,从而决定使用正确的代词(它/他/她),当看到一个新主语时,需要忘记旧主语的性别。InputGate
UpdateMemory
OutputGate
输出门决定我们要输出什么,此输出将基于当前的细胞状态首先,通过一个sigmoid层,决定了我们要输出细胞状态的哪些部分。然后,将细胞状态通过tanh(将值规范化到-1和1之间),并将其乘以Sigmoid门的输出,至此完成了输出门决定的那些部分信息的输出。举个语言模型的例子,当看到一个主题词,考虑到后面可能出现的词,可能需要输出与动词相关的信息,比如单数还是复数,需要根据主题信息来决定具体输出什么。回顾LongShortTermMemory(LSTM)双向循环神经网络我今天不舒服,我打算____一天。只根据‘不舒服‘,可能推出我打算‘去医院‘,‘睡觉‘,‘请假‘等等,但如果加上后面的‘一天‘,能选择的范围就变小了,‘去医院‘这种就不能选了,而‘请假‘‘休息‘之类的被选择概率就会更大在Forward层从0时刻到i时刻正向计算一遍,得到并保存每个时刻向前隐含层的输出;在Backward层从i时刻到0时刻反向计算一遍,得到并保存每个时刻向后隐含层的输出;最后在每个时刻结合Forward层和Backward层的相应时刻输出的结果得到最终的输出。45实践部分基于BiLSTM的文本分类基于BiLSTM的文本分类46基于Attention机制的文本分类Seq2Seq模型存在的问题注意力机制注意力机制Ci如何计算?注意力机制Ci如何计算?注意力机制aij如何计算?通过输出端的前一个状态h’i-1,计算输入端每一个hj的attention,即aij机器翻译中的注意力机制<源语言词,目标语言词>的注意力权重基本与两个词互为翻译的情况一致给文章中每句话一个attention权重,根据问题选出最有可能包含答案的句子机器阅读中的注意力机制54基于Attention机制的文本分类Bi-LSTM+Attention就是在Bi-LSTM的模型上加入Attention层,在Bi-LSTM中我们会用最后一个时序的输出向量作为特征向量,然后进行softmax分类。Attention是先计算每个时序的权重,然后将所有时序的向量进行加权和作为特征向量,然后进行softmax分类。55实践部分基于Attention机制的文本分类基于Attention机制的文本分类56基于预训练-微调的文本分类57BERT进行文本分类58BERT进行文本分类59BERT进行文本分类60BERT进行文本分类tokenembedding层是要将各个词转换成固定维度的向量。在BERT中,每个词会被转换成768维的向量表示。61BERT进行文本分类BERT能够处理对输入句子对的分类任务。这类任务就像判断两个文本是否是语义相似的。句子对中的两个句子被简单的拼接在一起后送入到模型中。那BERT如何去区分一个句子对中的两个句子呢?答案就是segmentembeddings.SegmentEmbeddings层只有两种向量表示。前一个向量是把0赋给第一个句子中的各个token,后一个向量是把1赋给第二个句子中的各个token。如果输入仅仅只有一个句子,那么它的segmentembedding就是全0。62BERT进行文本分类BERT能够处理最长512个token的输入序列。论文作者通过让BERT在各个位置上学习一个向量表示来讲序列顺序的信息编码进来。这意味着PositionEmbeddingslayer实际上就是一个大小为(512,768)的lookup表,表的第一行是代表第一个序列的第一个位置,第二行代表序列的第二个位置,以此类推。因此,如果有这样两个句子“Helloworld”和“Hithere”,“Hello”和“Hi”会由完全相同的positionembeddings,因为他们都是句子的第一个词。同理,“world”和“there”也会有相同的positionembedding。63BERT进行文本分类64BERT进行文本分类65BERT进行文本分类66实践部分PaddleNLP接口中的BERT进行文本分类基于预训练-微调的文本分类67基于PaddleHub的低俗文本审核68任务描述社交媒体色情检测模型可自动判别文本是否涉黄并给出相应的置信度,对文本中的色情描述、低俗交友、污秽文案进行识别。在2017年之前,工业界和学术界对NLP文本处理依赖于序列模型
RecurrentNeuralNetwork(RNN).69任务描述近年来随着深度学习的发展,模型参数数量飞速增长,为了训练这些参数,需要更大的数据集来避免过拟合。然而,对于大部分NLP任务来说,构建大规模的标注数据集成本过高,非常困难,特别是对于句法和语义相关的任务。相比之下,大规模的未标注语料库的构建则相对容易。最近的研究表明,基于大规模未标注语料库的预训练模型(PretrainedModels,PTM)能够习得通用的语言表示,将预训练模型Fine-tune到下游任务,能够获得出色的表现。另外,预训练模型能够避免从零开始训练模型。70任务描述71本项目本项目将采用百度出品的PaddleHub预训练模型微调工具,快速构建方案。模型方面则选择ERNIE模型。72整体流程73ERNIEvsBERTERNIE(EnhancedRepresentationthroughKnowledgeIntegration)和BERT是两个在自然语言处理(NLP)领域中广泛应用的预训练模型,它们有以下几个区别:1.预训练数据和任务:BERT使用大规模的无标签文本数据进行预训练,主要任务是掩盖语言建模(MaskedLanguageModeling,MLM)和下一句预测(NextSentencePrediction,NSP)。MLM任务是通过掩盖输入文本的一部分来预测被掩盖的单词,而NSP任务是判断两个句子是否是连续的。ERNIE也使用大规模的无标签文本数据进行预训练,但它在预训练任务方面有所不同。ERNIE引入了实体级关系预测(Entity-levelRelationPrediction)和句子级关系预测(Sentence-levelRelationPrediction)等任务,以增强对实体和关系的建模能力。2.知识融合:ERNIE与BERT的另一个区别在于知识融合的方式。ERNIE在预训练过程中引入了外部知识,例如百科知识、博客数据、论坛数据等,以扩展模型的知识背景。通过将这些知识源融入模型的表示学习过程,ERNIE试图提高模型对于上下文和语义的理解能力。74ERINvsBERT3.任务适应:BERT和ERNIE在预训练之后都可以通过微调(fine-tuning)来适应不同的下游任务。微调是在特定任务的有标签数据上进行模型参数调整的过程。BERT和ERNIE可以用于各种NLP任务,如文本分类、命名实体识别、问答系统等,但在微调过程中,ERNIE通常能够通过其对实体和关系的建模能力,对一些涉及实体关系的任务表现更好。综上所述,ERNIE和BERT在预训练任务、知识融合和适应下游任务的方式上存在一些区别。ERNIE通过引入实体级和句子级关系预测任务以及外部知识的融合,旨在提升对实体和关系的建模能力。而BERT则更加注重句子级语言建模和下一句预测任务,以及在微调过程中的广泛适用性。75实践部分基于PaddleHub的低俗文本审核基于PaddleHub的低俗文本审核76基于表示(Representation)的文本匹配77什么是文本匹配?文本匹配技术是自然语言处理中另一个非常重要的任务。文本匹配主要进行文本对之间的相似度或者相关度计算。所谓相似度,指文两个文本是否描述相同的语义,而相关度则指两个文本之间是否存在特定的关系,例如是否可以从文本A推理出文本B(蕴含关系)。文本匹配任务的形式主要是对文本对进行关系判断,任务的最终形式包含两种,一种是相似/相关度计算,即计算两个文本的相似/相关度打分,另一种是相似/相关分类,1表示相似/相关,0表示不相似/相关(偶尔有些任务可能包含中立的情况,此时任务为三分类)。78文本匹配的常见应用范围1.搜索引擎当我们在搜索引擎输入一个问题,搜索引擎会为我们计算最相关的答案返回展示给我们2.问答系统常见的有功能型机器人,根据你的提问返回最佳的解决问题方案3.推荐系统推荐技术中,根据你个人的特征画像,为你推荐最和你匹配的信息(阅读内容、新闻、视频信息流等)4.计算广告你推荐与你个人特征画像的商品的广告,以增加广告的转化量等79基于表示的文本匹配整体流程:1.先使用编码器将两个文本进行编码,即将文本对先分别表示为两个向量;2.在匹配层计算两个向量的相似/相关度打分,得到两个文本的相似/相关度;这种方法中,对文本对的编码可以使用同一个编码器,也可以使用不同的编码器,使用同一个编码器的结构,我们称之为单塔模型,而使用两个编码器时,称之为双塔模型。回顾LongShortTermMemory(LSTM)81实践部分基于LSTM的文本匹配基于表示的文本匹配82基于交互(Interaction)的文本匹配83基于表示的文本匹配的缺陷1.表示型文本匹配对文本的抽取仅仅是最后的特征表示向量,信息损失难以衡量;2.表示型文本匹配缺乏对文本pair间词法句法信息的比较;3.基于表示的文本匹配中,两个文本之间没有任何的交互,对于问答类的任务来说并不友好,因为在问答任务中,答案可能仅仅关注问题中的某些关键词语,而两个文本互不交互的表示,容易使得编码器学不到什么词语重要,什么词语不重要,也就是说,最好的方法是“揣着问题找答案”为了改进上述问题,基于交互的匹配被提出;在文本对表示的过程中,通过尽早在文本pair间进行信息交互,然后再匹配(或者表示、匹配),这样能充分交换文本对的信息,从而使文本表示更加具有可解释性。84基于表示与交互的文本匹配——比较基于表示的文本匹配(左)与基于交互的文本匹配(右)85基于表示与交互的文本匹配——比较匹配方式:交互式文本匹配:基于文本序列之间的交互进行匹配、使用注意力机制等计算交互注意力、适用于复杂语义关系任务表征式文本匹配:将文本序列转换为固定长度的向量或矩阵表示、计算表示之间的相似度进行匹配、适用于简单文本匹配任务应用场景:交互式文本匹配:问答系统、机器翻译、句子相似度计算等表征式文本匹配:关键词匹配、信息检索、分类等联系:特征提取方式不同:交互式通过交互过程提取特征,表征式直接转换为向量表示应用领域有重叠但复杂程度不同可结合使用以发挥各自优势【结论】交互式文本匹配和表征式文本匹配是两种常见的文本匹配方法,通过不同的匹配方式和特征提取方法适用于不同的应用场景。它们可以单独使用,也可以结合使用以应对不同的文本匹配任务需求。基于交互的文本匹配——基本流程(1)嵌入层,即文本细粒度的嵌入表示;(2)编码层,在嵌入表示的基础上进一步编码;(3)交互层:将文本对的编码层输出进行交互、对比,得到各文本强化后的向量表征,或者直接得到统一的向量表征;(4)匹配层:相关性或相似度计算;(5)预测层:基于文本对融合后的向量进行文本关系的预测。基于交互的文本匹配——详细流程(1)将文本1、文本2分别经过LSTM之后,分别得到了文本1、文本2的词语的隐状态表示,即文本1、文本2的隐状态矩阵;(2)将两者的隐状态矩阵进行交互(一般为矩阵乘法、归一化),便可以得到文本1、文本2中各词语之间的相关性矩阵,如文本1第i个词语与文本2第j个词语的相关性。然后我们文本2的每一个词语的表示进行加权求和,获得文本1中每个词语基于文本2中每个词语的表示,同理可得文本2中每个词语基于文本1中每个词语的表示,这样便达到了两文本的交互目的。(3)得到交互后的表示后,与原始的隐状态再次交互(相加、相乘),既保留了原始的词表示,又加入了对方文本的交互表示,从而使各文本中各词语的表示更加丰富。(4)接下来可以再经过一个LSTM对交互后的文本表示进行再次编码,然后获得各文本的语义表示,两个文本的语义表示进行拼接等操作,构成分类向量,输入分类器进行二分类。88实践部分基于交互的文本匹配89基于预训练-微调的文本匹配90基于预训练-微调的文本匹配预训练模型(Pre-trainedModels)的出现将NLP带入了一个全新时代预训练语言模型在下游任务具有:更少的标注数据、更高的任务效果、更简单的网络结构适配等优点,使许多NLP任务获得显著的性能提升。91预训练-微调的文本匹配模型百度2019年提出预训练语言模型ERNIE(知识增强语义表示模型,EnhancedRepresentationfromkNowledgeIntEgration)ERNIE认为,BERT在NLP各个应用领域取得了不凡的成绩,主要得益于其使用了大量文本语料进行了无监督预训练:(a)MaskedLM,(b)NextSentPrediction;但BERT仍然存在以下缺点:(1)MaskedLM的建模过程中是以字为单位的,这使得模型很难学习到语义知识单元的完整语义表示
文章举例如下:
对于乒[mask]球,清明上[mask]图,[mask]颜六色这些词,BERT模型通过字的搭配,很容易推测出掩码的字信息,但没有显式地对语义概念单元(如乒乓球、清明上河图)以及其对应的语义关系进行建模。(2)训练语料单一(百科类),且除MaskedLM外只有NextSentPrediction任务,较为单一92HowERNIE(1)针对BERT模型的不足,ERNIE做了两点改进:改进一:ERNIE模型通过建模海量数据中的实体概念等先验语义知识,学习完整概念的语义表示。即在MaskedLM中通过对词和实体概念等语义单元进行mask来预训练模型,使得模型对语义知识单元的表示更贴近真实世界。93HowERNIE(2)改进二:引入多源数据语料训练ERNIE。包括百科类,新闻资讯类、论坛对话类数据来训练模型。尤其是论坛对话语料的引入。该工作认为,“对话数据的学习是语义表示的重要途径,往往相同回复对应的Query语义相似”。基于该假设,ERINE采用DLM(DialogueLanguageModel)建模Query-Response对话结构,将对话Pair对作为输入,引入DialogueEmbedding标识对话的角色,利用DialogueResponseLoss学习对话的隐式关系,通过该方法建模进一步提升模型语义表示能力。94ERNIE小结总结来说,ERNIE优势在于:
(1)通过对实体概念知识的学习来学习真实世界的完整概念的语义表示;
(2)对训练语料的扩展尤其是论坛对话语料的引入来增强模型的语义表示能力。95ERNIE2.0ERNIE2.0的预训练是持续性地多任务增量学习。实验结果表明,在16个自热语言处理任务上都超过BERT和XLNet。持续学习(Continuallearning)致力于对数个任务按顺序依次训练模型,以确保模型在训练新任务时候,依旧能够记住先前的任务。正如人类能够不断地通过学习或历史经验积累获得信息,从而有效地发展新的技能。在持续学习下,模型由于掌握了先前的历史训练任务,从而一定程度上也能够完成新任务。96ERNIE-Gram:模型结构与改进1.ERNIE-Gram模型结构:-ERNIE-Gram是基于Transformer模型的语义理解与文本生成模型。-包含多层的自注意力机制,用于建模文本中的上下文关系。2.ERNIE-Gram相对于BERT的改进:-多粒度嵌入:ERNIE-Gram采用字符、词和n-gram三个粒度的嵌入方式,以更好地建模文本信息。相比之下,BERT仅使用了词粒度的嵌入。-n-gram匹配机制:ERNIE-Gram引入了n-gram连续预测任务,通过预测n-gram序列来增强模型对上下文的理解能力。而BERT没有使用这种机制。-预训练任务设计:ERNIE-Gram结合了掩码语言建模(MLM)和n-gram连续预测任务,使模型能够学习更全面的语义表示。BERT只使用了掩码语言建模任务。97ERNIE-Gram:模型结构与改进3.ERNIE-Gram的改进意义:-更全面的文本建模:多粒度嵌入和n-gram匹配机制使ERNIE-Gram能够更好地捕捉文本的局部信息和全局关系,提升了对语义的理解能力。-适应更多应用场景:通过改进模型结构,ERNIE-Gram在文本分类和文本生成等任务中表现出更强的性能和适应能力。【结论】ERNIE-Gram通过引入多粒度嵌入和n-gram匹配机制,相对于BERT在模型结构上进行了改进。这些改进使得ERNIE-Gram能够更全面地建模文本信息,提升了对语义的理解能力,并在不同的文本任务中展现出卓越的性能和适应能力。98实践部分基于ERNIE-Gram预训练-微调框架进行文本匹配基于预训练-微调的文本匹配99基于BiLSTM-CRF的命名实体识别100信息抽取信息抽取,即从自然语言文本中,抽取出特定的事件或事实信息,帮助我们将海量内容自动分类、提取和重构。这些信息通常包括实体、关系、事件等,例如从新闻中抽取时间、地点、关键人物,或者从文本中抽取关键实体的关系,或者从技术文档中抽取产品名称、开发时间、性能指标等。信息抽取主要包括三个子任务:(1)实体抽取:也就是命名实体识别,识别出文本中的实体,比如人名、地名、机构名等;(2)关系抽取:即通常说的三元组抽取,主要用于抽取两个实体在某一特定上下文中的关系;(3)事件抽取:相当于一种多元关系的抽取,识别特定类型的事件,并把事件中担任既定角色的要素找出来。101命名实体识别一个命名实体,粗略地说,是任何可以用一个专有名称引用的东西如:一个人、一个位置、一个组织命名实体识别查找构成专有名称的文本范围,然后对实体的类型进行分类可扩展为包含本身不是实体的东西日期、时间和其他类型的时态表达式、价格等困难分割的模糊性,需要决定什么是实体,什么不是,界限在哪里另一个困难是类型模糊102CRF条件随机场模型用于解决给定一组输入的随机变量的情况下,预测另一组输出随机变量的条件分布,该模型的前提假设是随机变量构成马尔科夫随机场。该模型是解决序列标注问题的经典模型,因为该模型充分考虑了X对应的标签y,与前后文标注的关系。条件随机场实际上是定义在时序数据上的对数线性模型,具有表达长距离依赖性和交叠性特征的能力,能够较好地解决标注偏置等问题。很多工作都说明该模型对于命名实体识别技术有着很好的帮助。103LSTM长短期记忆(Longshort-termmemory,LSTM)是一种特殊的RNN,主要是为了解决长序列训练过程中的梯度消失和梯度爆炸问题。简单来说,就是相比普通的RNN,LSTM能够在更长的序列中有更好的表现。LSTM结构(图右)和普通RNN的主要输入输出区别如下所示。104BiLSTM前向的LSTM与后向的LSTM结合成BiLSTM,BLSTM可以获取到整个序列的信息,在命名实体识别任务中可以充分利用输入序列的上下文信息,从而可以更加准确的判断一个词语是否为一个实体。在处理序列数据时,BLSTM比一般的LSTM增加了一个反向计算的过程,此过程可以利用到序列的下文信息,最后把正向和反向两个方向计算的值同时输出到输出层,这样通过两个方向获取到了一个序列的全部信息。105BiLSTM-CRFBiLSTM-CRF是条件随机场(CRF)模型激活直接分类。CRF将输出层面的关联性分离出来,在预测标签时可以充分考虑上下文关联,更重要的是CRF的求解维特比算法是利用动态规划的方法求出概率最大的路径,这与命名实体识别的任务契合的更好,可以避免结果中出现“B-LOC”标签后接“I-ORG”标签这种非法序列的问题。因而序列标注模块选择CRF模型。CRF层可以通过训练语料学习得到一些基于全局的约束信息,比如句子中识别出的实体标签的起始应当是“B-”而不是“I-”;不同类的标签不会相互连接,识别出的人名、地名、组织名标签不可能混搭,从而能够识别出准确的命名实体。对于将要输出的标签序列,定义路径得分公式CRF模型通过对输出标签二元组进行建模,使用动态规划算法找出得分最高的路径作为最优路径y^*进行序列标注。整体基于字符的BiSLTM-CRF中文命名实体识别模型框架如图:106实践部分基于BiLSTM实现命名实体识别基于BiLSTM-CRF的命名实体识别107基于BiLSTM-CRF的事件抽取108事件抽取抽取文本描述中的事件任务分解:触发词识别、事件类型分类、论元识别、角色分类触发词识别+事件类型分类:可合并成事件识别任务事件识别判断句子中的每个单词归属的事件类型,是一个基于单词的多分类任务论元识别+角色分类:可合并成论元角色分类任务角色分类任务是一个基于词对的多分类任务,判断句子中任意一对触发词和实体之间的角色关系109事件抽取的术语事件指称/提及(EventMention):描述了事件的短语或句子文本,包括事件触发词和元素事件类型(EventType):发生事件的类别,描述事件的性质事件触发词(EventTrigger):触发词是表达事件发生的名词或动词,是决定事件类型核心的特征词事件元素/论元(EventArgument):事件主要属性,包括实体、非实体参与者、时间等要素论元角色(ArgumentRole):论元与其参与事件之间的关系110事件抽取小明吃了一个红色的苹果触发词抽取模块事件类型:食用触发词:吃元素模块抽取角色:执行者,元素:小明角色:食物,元素:苹果相当于识别出“吃”这个事件词,然后将其分类为“食用”类型相当于识别出“小明”这个角色词,然后将其分类为“执行者”类型NER任务抽取事件:(小明,食用,苹果)命名实体识别111事件抽取流程小明吃了一个红色的苹果触发词抽取模块事件类型:食用触发词:吃元素模块抽取角色:执行者,元素:小明角色:食物,元素:苹果小明吃了一个红色的苹果触发词抽取模块事件类型:食用触发词:吃元素模块抽取角色:执行者,元素:小明角色:食物,元素:苹果联合抽取模型流水线式模型112WhyCRF本质是一个无向图绿色点表示输入红色点表示输出点与点之间的边可以分成两类x与y之间的连线:标签与单词间的依赖性y之间的相关性:标签之间的依赖性当CRF模型收敛时,就会学到类似P-B和T-I作为相邻标签的概率非常低,从而保证了事件抽取结果的合理性113实践部分基于BiLSTM-CRF的事件抽取基于BiLSTM-CRF的事件抽取114基于BiLSTM-CRF的关系抽取115关系抽取通常我们说的三元组(triple)抽取,主要用于抽取实体间的关系。关系抽取通常在实体抽取与实体链指之后语义关系通常用于连接两个实体,并与实体一起表达文本的主要含义。常见的关系抽取结果可以用SPO结构的三元组来表示,即(Subject,Predication,Object),如:中国的首都是北京==>(中国,首都,北京)116关系抽取关系抽取是指自动识别实体之间具有的某种语义关系,根据参与实体的多少可以分为二元关系抽取(两个实体)和多元关系抽取(三个及以上实体),比如某人生活在某地,这就是两个实体间的关系;117基于BiLSTM的关系抽取实体表示实体文本具有序列属性
Lstm编码上下文表示实体所处上下文为整体完整语义文本BiLSTM编码分类特征表示实体对特征+上下文表示特征实体1实体2上下文LSTMLSTMBiLSTMFCsoftmax118基于BiLSTM-CRF的关系抽取为何还要加一个crf层呢?
softmax层的输出是相互独立的,即使BiLSTM学习到了上下文的信息,但是输出相互之间并没有影响,它只是在每一步挑选一个最大概率值的label输出。这样就会导致如B-person后再接一个B-person的问题。而crf中有转移特征,即它会考虑输出label之间的顺序性,所以考虑用crf去做BiLSTM的输出层。119实践部分基于Bi-LSTM的关系抽取基于BiLSTM-CRF的关系抽取120基于预训练-微调的关系抽取121关系抽取关系抽取的目标是对于给定的自然语言句子(输入),根据预先定义的schema集合,抽取出所有满足schema约束的SPO三元组(输出)。schema定义了关系P以及其对应的主体S和客体O的类别。例如,「妻子」关系的schema定义为:{S_TYPE:人物,P:妻子,O_TYPE:{@value:人物}}122关系抽取关系抽取是指自动识别实体之间具有的某种语义关系,根据参与实体的多少可以分为二元关系抽取(两个实体)和多元关系抽取(三个及以上实体),比如某人生活在某地,这就是两个实体间的关系;123Why预训练-微调的架构很多场景存在海量数据,其中蕴含着大量错综复杂的关系;这些关系一方面存在于这些大量的数据,只有收集足够多的数据,才能够获取;另一方面这些关系的复杂程度需要有大量训练样本,才能够使得模型有能力、有背景知识,来从数据中将其学习得到;自Bert以来,大模型、预训练-微调,海量数据,成为了NLP文本任务,尤其是关系抽取等基本重要任务的主流范式;此外,传统的关系抽取模型,在低资源情况下表现一般,泛化性不足,无法实现较好的领域迁移应用。124基于预训练-微调的关系抽取以医疗场景为例,其基本结构图如下:医疗关系抽取语料无标注医疗文献与病历预处理预训练模型神经网络大模型上的微调后处理抽取结果抽取的医疗关系反向传播125实践部分使用PaddleNLP快速完成实体关系抽取基于预训练-微调的关系抽取126基于预训练-微调的事件抽取127事件抽取目标:对于给定的自然语言句子(输入),根据预先指定的事件类型和论元角色,识别句子中所有目标事件类型的事件,并根据相应的论元角色集合抽取事件所对应的论元(输出)。任务分解:触发词识别、事件类型分类、论元识别、角色分类触发词识别+事件类型分类:可合并成事件识别任务事件识别判断句子中的每个单词归属的事件类型,是一个基于单词的多分类任务论元识别+角色分类:可合并成论元角色分类任务角色分类任务是一个基于词对的多分类任务,判断句子中任意一对触发词和实体之间的角色关系128事件抽取其中目标事件类型
(event_type)和论元角色(role)限定了抽取的范围,例如(event_type:胜负,role:时间,胜者,败者,赛事名称)、(event_type:夺冠,role:夺冠事件,夺冠赛事,冠军)。上图展示了一个关于事件抽取的样例,可以看到原句子描述中共计包含了2个事件类型event_type:胜负和夺冠,其中对于胜负事件类型,论元角色role包含时间,胜者,败者,赛事名称;对于夺冠事件类型,论元角色role包含夺冠事件,夺冠赛事,冠军。总而言之,事件抽取期望从这样非结构化的文本描述中,提取出事件类型和元素角色的结构化信息。事件抽取示意图:129Why预训练-微调的架构很多场景存在海量数据,其中蕴含着大量错综复杂的事件;这些事件一方面存在于这些大量的数据,只有收集足够多的数据,才能够获取;另一方面这些事件的复杂程度需要有大量训练样本,才能够使得模型有能力、有背景知识,来从数据中将其学习得到;自Bert以来,大模型、预训练-微调,海量数据,成为了NLP文本任务,尤其是事件抽取等基本重要任务的主流范式;此外,传统的事件抽取模型,在低资源情况下表现一般,泛化性不足,无法实现较好的领域迁移应用。在事件抽取任务上选用该架构的原因与关系抽取任务基本一致130事件抽取流程小明吃了一个红色的苹果触发词抽取模块事件类型:食用触发词:吃事件元素模块抽取角色:执行者,元素:小明角色:食物,元素:苹果小明吃了一个红色的苹果触发词抽取模块事件类型:食用触发词:吃事件元素模块抽取角色:执行者,元素:小明角色:食物,元素:苹果联合抽取模型流水线式模型131实践部分基于ERNIE模型基于预训练-微调的事件抽取132基于序列到序列的中-英机器翻译133什么是机器翻译机器翻译,又称为自动翻译,是利用计算机将一种自然语言(源语言)转换为另一种自然语言(目标语言)的过程。它是计算语言学的一个分支,是人工智能的终极目标之一,具有重要的科学研究价值。机器翻译方法通常可分成三大类:基于规则的机器翻译(RBMT)统计机器翻译(SMT)神经机器翻译(NMT)134神经机器翻译源文本:我看了一本书Target:I
read
a
book神经网络翻译近年来迅速崛起。相比统计机器翻译而言,神经网络翻译从模型上来说相对简单,它主要包含两个部分,一个是编码器,一个是解码器。编码器是把源语言经过一系列的神经网络的变换之后,表示成一个高维的向量。解码器负责把这个高维向量再重新解码(翻译)成目标语言。135序列到序列模型机器翻译是典型的seq2seq预测问题,即序列到序列的预测问题:将输入序列映射为另外一个输出序列。由于同时存在多个输入和输出时间步,这种形式的问题也被称为是many-to-many序列预测问题。对seq2seq预测问题进行建模的一个难点是输入和输出序列的长度均有可能发生变化,一种被证明能够有效解决seq2seq预测问题的方法被称为Encoder-Decoder。该体系结构包括两个部分:Encoder用于读取输入序列并将其编码成一个固定长度的向量,Decoder用于解码该固定长度的向量并输出预测序列。Seq2Seq模型翻译任务136基于seq2seq模型的机器翻译中-英机器翻译任务本质上也是一种预测任务,是一种输入输出不定长的序列任务,seq2seq模型的便捷应用和良好性能使得机器翻译任务得到迅速普及和发展;如图所示,编码阶段的RNN网络接收输入序列“ABC<EOS>(EOS=EndofSentence,句末标记)”,并输出一个向量作为输入序列的语义表示向量;之后解码阶段的RNN网络在每一个时间步进行单个字符的解码,最终模型输出“WXYZ<EOS>”,这样就实现了句子的翻译过程。137实践部分基于Encoder-Decoder的中英机器翻译基于序列到序列的中-英机器翻译138基于注意力机制的中-英机器翻译139编码器-解码器结构编码器对source进行编码对于解码器Decoder,根据中间语义向量C和当前已生成的历史信息来生成下一时刻要生成的单词:
140编码器-解码器结构存在的问题我们很难寄希望于将输入的序列转化为固定的向量而保存所有的有效信息,尤其是随着所需翻译句子的长度的增加,这种结构的效果会显著下降。除此之外,解码器只用到了编码器的最后一个隐藏层状态,信息利用率低下。
141注意力机制142注意力机制Ci如何计算?143注意力机制aij如何计算?通过输出端的前一个状态h’i-1,计算输入端每一个hj的attention,即aij144注意力机制145基于注意力机制的中-英机器翻译我们人类在翻译文章时,会将注意力关注于我们当前正在翻译的部分。Attention机制与此十分类似,假设我们需要翻译“MachineLearning”-“机器学习”这个句子对,当我们在翻译“机器”时,只需要将注意力放在源语言中“Machine”的部分;同样的,在翻译“学习”时,也只用关注原句中的“Learning”。这样,当我们在Decoder端进行预测时就可以利用Encoder端的所有信息,而不是局限于原来模型中定长的隐藏向量Context,减少了长程信息的丢失。注意力机制翻译任务146基于注意力机制的中-英机器翻译<源语言词,目标语言词>的注意力权重基本与两个词互为翻译的情况一致147实践部分基于Encoder-AttentionDecoder模型基于注意力机制的中-英机器翻译148基于Transformer的中-英机器翻译149宏观视角BERT取得成功的一个关键因素是Transformer的强大作用。Transformer由论文《AttentionisAllYouNeed》提出。Transformer改进了RNN最被人诟病的训练慢的缺点,利用self-attention机制实现快速并行。首先将Transformer看成是一个黑箱操作。在机器翻译中,就是输入一种语言,输出另一种语言。150编码器-解码器结构拆开这个黑箱,可以看到它是由编码组件、解码组件和它们之间的连接组成。编码组件部分由一堆编码器(encoder)构成(论文中是将6个编码器叠在一起——数字6没有什么神奇之处,你也可以尝试其他数字)。解码组件部分也是由相同数量(与编码器对应)的解码器(decoder)组成的。151编码器所有的编码器在结构上都是相同的,但它们没有共享参数。每个编码器都可以分解成两个子层。从编码器输入的句子首先会经过一个自注意力(self-attention)层,在对每个单词编码时关注输入句子的其他单词自注意力层的输出会传递到前馈(feed-forward)神经网络中,每个位置的单词对应的前馈神经网络都完全一样152解码器解码器中也有编码器的自注意力(self-attention)层和前馈(feed-forward)层。除此之外,这两个层之间还有一个注意力层,用来关注输入句子的相关部分(和seq2seq模型的注意力作用相似)。153编码过程输入序列中每个位置的单词都有自己独特的路径流入编码器。在自注意力层中,这些路径之间存在依赖关系。前馈(feed-forward)层是完全相同的网络,每个位置的单词没有依赖关系,因此在前馈(feed-forward)层时可以并行执行各种路径。154宏观的角度看自注意力机制回忆一下RNN(循环神经网络)是如何维持隐藏层的。RNN会将它已经处理过的前面的所有单词的表示与它正在处理的当前单词结合起来。而自注意力机制会将所有相关单词的理解融入到正在处理的单词中。Theanimaldidn'tcrossthestreetbecauseitwastootired.这个“it”在这个句子是指什么呢?它指的是street还是这个animal呢?155微观的角度看自注意力机制计算自注意力的第一步就是从每个编码器的输入向量(每个单词的词向量)中生成三个向量。也就是说对于每个单词,构造一个查询向量、一个键向量和一个值向量。这三个向量是通过词嵌入与三个权重矩阵后相乘创建的。可以发现这些新向量在维度上比词嵌入向量更低。他们的维度是64,而词嵌入和编码器的输入/输出向量的维度是512但实际上不强求维度更小,这只是一种基于架构上的选择,它可以使多头注意力(multi-headedattention)来保持计算不变。156查询向量、键向量和值向量(1)计算自注意力的第二步是计算得分。假设为第一个词“Thinking”计算自注意力向量,需要拿输入句子中的每个单词对“Thinking”打分。这些分数决定了在编码单词“Thinking”的过程中有多重视句子的其它部分。这些分数是通过打分单词(所有输入句子的单词)的键向量与“Thinking”的查询向量相点积来计算的。所以如果我们是处理位置最靠前的词的自注意力的话,第一个分数是q1和k1的点积,第二个分数是q1和k2的点积。157查询向量、键向量和值向量(2)第三步和第四步是将分数除以8(8是论文中使用的键向量,是维数64的平方根,这会让梯度更稳定。也可以使用其它值),然后通过softmax传递结果。softmax的作用是使所有单词的分数归一化,得到的分数都是正值且和为1。这个softmax分数决定了每个单词对编码当下位置(“Thinking”)的贡献。158查询向量、键向量和值向量(3)第五步是将每个值向量乘以softmax分数(这是为了准备之后将它们求和)。这里的直觉是希望关注语义上相关的单词,并弱化不相关的单词第六步是对加权值向量求和,然后即得到自注意力层在该位置的输出自注意力的另一种解释就是在编码某个单词时,将所有单词的表示(值向量)进行加权求和,而权重是通过该词的表示(键向量)与被编码词表示(查询向量)的点积并通过softmax得到。159通过矩阵运算实现自注意力机制上述得到的向量就可以传给前馈神经网络。实际中,这些计算是以矩阵形式完成的,以便算得更快。第一步是计算查询矩阵、键矩阵和值矩阵将步骤2到步骤6合并为一个公式来计算自注意力层的输出160多头注意力机制(1)它给出了注意力层的多个“表示子空间”(representationsubspaces)。对于“多头”注意机制,有多个查询/键/值权重矩阵。每一个都是随机初始化的,在训练之后,每个矩阵都被用来将输入词嵌入投影到不同的表示子空间中。Transformer使用八个注意力头,因此每个编码器/解码器有八个矩阵集合161多头注意力机制(2)162解码组件顶端编码器的输出之后会变转化为一个包含向量K(键向量)和V(值向量)的注意力向量集。这些向量将被每个解码器用于自身的“编码-解码注意力层”,该层可以帮助解码器聚焦在输入序列中的合适位置。解码器中的自注意力层表现的模式与编码器不同:在解码器中,自注意力层只被允许处理输出序列中更靠前的那些位置。在softmax步骤前,它会把后面的位置给隐去。163一层编码器164实践部分基于Transformer的中英机器翻译基于Transformer的中-英机器翻译165基于预训练-微调的中-英机器翻译166预训练+微调的范式目前绝大多数AI任务都是建立在数据的基础之上的统计学习,模型的表现效果很大程度上依赖于数据的质量和数量。利用大量较易获得的无标注语料上来预训练模型,在具体应用场景下游任务上再利用少量标注数据微调来实现实际场景可用的自监督表示学习模型,已经成为自然语言处理领域的一种新的成功范式。例如BERT在大规模纯文本上预训练后,在自然语言理解的11项任务上少量微调就能取得很好的成绩。已有的生成式预训练模型如MASS、UniLM、BART等,将MaskLM学习任务和seq2seq框架结合,在一系列自然语言生成任务上取得了SOTA的研究成果。但是这些预训练模型很少关注自然语言生成中的曝光偏差问题。167MASS/BART168MASSTransformer架构(encoder-decoder)seq2seq框架(encoder-decoder)MASS对句子随机屏蔽一个长度为k的连续片段,然后通过编码器-注意力-解码器模型预测生成该片段。如上图所示,编码器端的第3-6个词被屏蔽掉,然后解码器端只预测这几个连续的词,而屏蔽掉其它词,图中“_”代表被屏蔽的词。169BARTBART模型在微调阶段应用于机器翻译任务时,具体的做法是将BART的encoder端的embedding层替换成randomlyinitializedencoder,新的encoder也可以用不同的vocabulary。通过新加的Encoder,我们可以将新的语言映射到BART能解码到English(假设BART是在English的语料上进行的预训练)的空间。具体的finetune过程分两阶段:第一步只更新randomlyinitializedencoder+BARTpositionalembedding+BART的encoder第一层的self-attention输入映射矩阵。第二步更新全部参数,但是只训练很少的几轮。170UniLM在预训练阶段,UniLM模型通过三种不同目标函数的语言模型(包括:双向语言模型,单向语言模型和序列到序列语言模型),去共同学习一个Transformer网络;为了控制对将要预测的token可见到的上下文,使用了不同的self-attentionmask来实现。即通过不同的掩码来控制预测单词的可见上下文词语数量,实现不同的模型表征171ERNIE-GEN模型概述ERNIE-GEN是面向生成任务的预训练-微调框架,首次在预训练阶段加入span-by-span生成任务,让模型每次能够生成一个语义完整的片段。在预训练和微调中通过填充式生成机制和噪声感知机制来缓解曝光偏差问题。此外,ERNIE-GEN采样多片段-多粒度目标文本采样策略,增强源文本和目标文本的关联性,加强了编码器和解码器的交互。ernie_genmodule是一个具备微调功能的module,可以快速完成特定场景module的制作。构建三种新颖的方法来增强语言生成能力:跨度生成预训练任务:使模型能够在每个步骤而不是单词上生成语义完整的跨度。丰富的生成和噪声感知生成:减轻曝光偏差的问题。多粒度目标片段:在预训练期间增强编码器和解码器之间的相关性。具体来说,基于填充生成机制的跨跨生成任务和逐词生成任务受到精心设计的Multi-FlowAttention体系结构的增强,如下所示。172173174实践部分基于ERNIE-GEN的中-英机器翻译模型基于预训练-微调的中-英机器翻译175抽取式中文自动文摘176自动文本摘要自动文本摘要,是指对文本信息内容进行概括,提取主要内容进而形成摘要的过程。人们利用计算机对文本信息进行处理,用简明扼要的文字概括其主要内容,指明文本中概念、实体间的关系,生成基本反映文章主题的摘要信息,摘要的形式可以是文本段落或句子。自动文本摘要从实现的方法上可以分为抽取式摘要和生成式摘要两大类。文档集摘要文档理解语句重要性计算与排名语句选择摘要语句排序177抽取式文本摘要概念:从原始文本中抽取文本单元组成摘要,这里的文本单元可以是短语,也可以是句子。但是为了保证生成摘要的可读性,一般而言抽取式方法都是以句子作为抽取单元。
重点解决问题:如何对文本单元排序打分;如何抽取文本单元的一个子集生成摘要。分别对应着排序单元和抽取单元。通俗讲就是,先用排序单元把文档中的单元排序,选择排名靠前的单元,再用抽取单元去除选出来的单元之间的冗余信息,得到最后的自动摘要。一般思路:利用不同的方法对文档结构单元(句子或段落),进行打分,对每个结构单元赋予一定的权重,然后选择最重要的结构单元组成摘要。优点:实现简单,组成摘要的句子都是从原文中抽取的,也保证了句子的可读性。缺点:容易出现内容的冗余,句子之间的连贯性难以保证。178实现思路对于排序单元,有三种学习排序算法:1)pointwise排序:孤立地处理每个样本(句子或者概念),把句子的特征和标记(排序等级)输入到机器学习算法中,学习出分类器;2)pairwise排序:从一系列句子对或者概念对{(x_i,x_j)}中学习排序函数f(x_i)。考虑了两两样本之间的排序问题;3)listwise排序:所有样本之间的排序都考虑在内。一定程度上,学习排序算法(LTR)和多标记学习里的方法是类似的,一阶/二阶/高阶方法。方式:1)排序单元给句子打分,抽取单元
抽取(去除冗余)句子子集作为摘要;2)排序单元给文档集中的概念打分,抽取单元抽取一组能够最大限度覆盖重要概念的句子。179传统方法Lead-3一般来说,作者常常会在标题和文章的开始就表明主题,因此最简单的方法就是抽取文章中的前几句作为摘要。(有点类似启发式方法)。常用的方法为Lead-3,即抽取文章的前三句作为文章的摘要。Lead-3方法虽然简单直接,但是却非常有效的方法(当然,与要摘要的文本类型有很大的关系)。TextRankTextRank基于图的排序算法,来源于谷歌的PageRank算法,把文本单元分割成若干组成单元(单词或句子)作为节点并建立图模型,使用句子间相似度构造无向有权边。使用边上的权值迭代更新节点值,最后选取N个得分高的节点作为摘要(本质上就是句子排序)。利用投票机制对文本的重要成分进行排序,仅仅利用单篇文档本身的信息就可以实现关键词提取,摘录。和LDA,HMM等模型不同,TextRank不需要对多篇文档进行训练。180实践部分基于Lead-3和TextRank抽取式中文自动文摘181生成式英文自动文摘182生成式文本摘要抽取式摘要在语法、句法上有一定的保证,但是也面临了一定的问题,例如,内容选择错误、连贯性差、灵活性差等问题。
生成式摘要允许摘要中包含新的词语或者短语,灵活性高,随着近几年神经网络模型的发展,序列到序列(seq2seq)模型被广泛的用于生成式自然语言任务中,如机器翻译等,并取得一定的成果。自动文摘和机器翻译类似,都是典型的seq2seq预测问题,这两个任务的不同之处在于自动文摘没有很强的对齐性,由于自动文摘大多是将一个长文本概括成一个较短的文本,因此对齐关系较弱,在任务难度上也有所增加。183生成式文本摘要仅使用seq2seq来完成生成式摘要存在如下问题:(1)未登陆词问题(OOV),(2)生成重复。现在被广泛应用于生成式摘要的框架由See等人在ACL17中提出,在给予注意力机制的seq2seq基础上增加了copy和coverage机制,有效的缓解了上述问题。其模型pointer-generator网络如下所示:184生成式文本摘要其模型基本部分为基于注意力机制的seq2seq模型,使用每一步解码的隐层状态与编码器隐层状态计算权重,最终得到context向量,利用context向量和解码器隐层状态计算输出概率。185生成式文本摘要目前,比较主流和基础的经典的方法就是使用注意力机制和Transformer架构。186实践部分使用飞桨深度学习开源框架生成式英文自动文摘187基于预训练-微调的中文自动文摘188预训练-微调预训练模型在下游任务上微调的流程。整体流程可以分为4部分:数据加载数据预处理模型训练模型推理获取待抽取的文本并获得待抽取文本的相关关键词将所述待抽取文本输入至预训练语言模型中,得到所述待抽取文本固定维度的句向量对所述句向量进行权重计算并基于所述关键词进行权重修正,得到所述待抽取文本的文本摘要189What’s
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年AI优化效果评估
- 2023年医院医生述职报告(16篇)
- 中药健康养生讲座
- 2026年主管护师考试案例分析与试题及答案
- 2026年医疗机构废弃物处理考试真题(含答案)
- 2026年审计员工作计划
- 2026安全知识竞赛试题(附完整答案)
- 学校检委员述职报告(4篇)
- 2026年媒介内容国际传播效果分析
- 2026食品加工行业市场扩张与产业链整合研究报告
- 2026年秋季新学期新校长在班子第一次见面会上讲话:先稳底盘、再谋突破先固基础、再开新局
- 八大特殊作业监护人员安全手册
- 定制家具报价核算工作手册
- 2026秋北师大版四年级数学上册第4单元我们生活的空间(二)第1课时观察的范围课件
- 外科术后预防应激性溃疡
- 生物质循环流化床气化装置项目可行性研究报告
- 大邑社区工作者招考真题及答案2025
- 2026年扬州市市场监督管理系统事业单位人员招聘考试备考试题及答案详解
- ISO10012-2026《质量管理-测量管理体系要求》之12:“7.1资源-7.1.1总则”专业指导问答材料(雷泽佳编制-2026A0)
- ISO140012026标准解读课件
- 2026云南曲靖国金资本运营集团有限公司招聘3人笔试历年常考点试题专练附带答案详解
评论
0/150
提交评论