自然语言处理 课件 知识点5.1文本向量化表示_第1页
自然语言处理 课件 知识点5.1文本向量化表示_第2页
自然语言处理 课件 知识点5.1文本向量化表示_第3页
自然语言处理 课件 知识点5.1文本向量化表示_第4页
自然语言处理 课件 知识点5.1文本向量化表示_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

自然语言处理项目5文本分类MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304文本向量化表示什么是文本向量化计算机拥有强大的信息处理能力,但是也有一个限制,就是只能处理用二进制数表示的数字信息。因此,当我们需要计算机处理声音信息、图像信息、文字信息时,第一步要做的就是信息的数字化。一旦将文本句子向量化,就可以让句子参与数学运算了。比如我们想知道两句话的相似度,只要计算一下这两句话的向量距离即可,距离短的自然相似度高,距离长的当然相似度低。文本离散表示词袋模型(BOW)是文本离散表示的另外一种方法,BOW用一个向量表示一句话,也可以表示一篇文章,同样是把文档看作是独立词的集合,不考虑词的关联和顺序,但是在BOW中加入了词频信息文本向量化分为离散表示和分布式表示两种,离散表示基于规则和词频,常用方法有词集模型和词袋模型(BOW)。词集模型先创建一个词典,词典中是所有要用到的词,然后每一个词用一个长向量表示,向量的长度就是词典的长度,每个词对应的向量中只有一个维度的数值为1,这个维度位置就是词在词典中的位置,其它维度的数值全部为0。这种向量表示称为独热表示(one-hotrepresentation)Word2Vec与Doc2Vec模型2013年,谷歌发表了Word2Vector工具,Word2Vector工具包括两个模型,一个叫跳字模型(Skip-Gram),另一个叫连续词袋模型(CBOW)。Word2Vec将每一个词表示为一个定长的向量,起到数据降维的作用,并且向量中数据稠密,解决了效率低下问题,特别是Word2Vec可以很好表达词与词之间的相似和类比关系。Doc2Vec是Word2Vec的拓展,通过Doc2Vec工具可以计算句子、文档之间的相似度,可以用于文本聚类和文本分类。Doc2Vec也有两个模型,与Word2Vec工具的两个模型对应,一个是分布记忆(Distributed

Memory,DM)模型,对应于Skip-Gram模型,另一个是分布式词袋(Distributed

BagofWords,DBOW)模型,对应于CBOW模型。基于机器学习的文本分类KNN模型KNN法又称K近邻法(K-nearestneighbor,K-NN),是一种最基本的分类方法。所谓K近邻法,意思就是K个相邻的邻居。如果我们要对一个新的实例进行分类,它的类别要根据它最近的几个邻居来确定。在KNN算法中,距离的计算方法主要有欧式距离、曼哈顿距离、Lp距离(闵可夫斯基距离)等。KNN法给定一个训练数据集,数据集中每一个实例都是向量,并且有自己所属的类别,对于一个新实例的特征向量,我们要确定它的类别,方法就是找出离这个新实例最近的K个邻居,看看邻居属于什么类别,如果K个邻居都属于同一个类别,那么新实例就确定为与邻居相同的类别。如果K个邻居分属于不同的类别,那么就通过投票法,将多数邻居所属的类别作为这个新实例的类别。因为有可能要通过投票法确定新实例的类别,所以K一般取奇数。sklearn中的朴素贝叶斯的分类器。朴素贝叶斯分类器是一种基于概率的分类器,实现简单,学习与预测的效率都很高,即便在今天深度学习盛行,它仍然有着强大的生命力。朴素贝叶斯法是基于贝叶斯定理与特征条件独立性假设的分类方法。其中特征条件独立性假设大大降低了实际问题的复杂性,简化了计算,这也是“朴素”二字的由来。朴素贝叶斯线性可分数据集支持向量机(supportvectormachines,SVM)是一种二分类器,从这一点看,支持向量机有点像感知机,但与感知机不同的是,感知机仅仅是要求找到能够分隔两个类别的超平面,而支持向量机要求找到能够分隔两个类别的最优超平面。间隔就是离分离超平面最近的正实例和负实例到分离超平面的距离之和,通过间隔最大化求得最优超平面。SVM模型基于深度学习的文本分类深度学习工具在使用深度学习方法的过程中,需要编写大量的代码,在这些代码中,有很多是具有共性的代码,任何一个使用深度学习方法的人都需要写这些代码,所以实际上有很多代码是重复代码。为了提高工作效率,有人将这些重复代码抽取出来,写成一个框架放到互联网上,供学习和研究者使用。随着时间的推移,一些性能优良的框架逐渐流行起来。比较主流的框架:TensorFlow、Keras、PaddlePaddle、PyTorch、Caffe循环神经网络(RecurrentNeuralNetwork,RNN)是最早运用到自然语言处理中的神经网络。RNN处理的输入数据为离散序列数据,并以离散序列的形式输出,在RNN内部通过结构设计捕捉输出与输入之间的关系特征LSTM是RNN的一种变体形式,在RNN原有的结构上引入了几道门:遗忘门、输入门和输出门。循环神经网络TextRNN模型TextRNN是专门用于处理文本数据的RNN,最典型的是处理文本的分类问题。前面说过,N对1的RNN特别适合处理文本分类问题,因此可以把N对1的RNN作为TextRNN的基本结构基于Attention机制的文本分类Encoder-Decoder结构Encoder-Decoder结构又称Seq2Seq模型。深度学习中SequencetoSequence(Seq2Seq)模型的目标是将一个序列转换成另一个序列。包括机器翻译(machinetranslate)、语音识别(speechrecognition)和时间序列预测(timeseriesforcasting)等任务都可以理解成是Seq2Seq任务。RNN(RecurrentNeuralNetworks)是深度学习中最基本的序列模型。Encoder与状态向量C构成一个N对1的RNN,状态向量C是Encoder的输出,可以看做是对N个输入向量的信息概括,或者说N个输入向量的信息被压缩到一个状态向量C中,而状态向量C又作为输入信息与Decoder构成一个1对M的RNN。Decoder的M个输出向量可以看做是对状态向量C逐步解码的结果。Attention机制又称为注意力机制,顾名思义,是一种能让模型对重要信息重点关注并充分学习吸收的技术。通俗的讲就是把注意力集中放在重要的点上,而忽略其他不重要的因素。注意力机制最早用在seq2seq模型上,2015年提出的Attention机制,对Seq2Seq模型进行了改进在Seq2Seq模型中,状态变量C实际上是Encoder的最后一个隐含层状态,其它隐含层状态全部被抛弃。在Attention机制中,Encoder中的所有隐含状态被保留,用于计算Decoder在每个隐含状态下的上下文状态Attention机制基于预训练模型的文本分类Transformer模型是谷歌团队2017年在一篇《AttentionisAllYouNeed》论文中提出的。Transformer从本质上说是一个seq2seq模型,也就是前面介绍过的Encoder-Decoder模型在Transformer中使用了多层编码器和多层解码器,各层编码器结构相同,但参数不同,分别独自训练。各层编码器将输入序列编码后的结果进行拼接,相当于对各编码器的结果进行综合计算,计算结果输入各层解码器分别进行解码,最后将各解码器的输出综合处理,得到输出序列。Transformer的基本概念BERT的全称为BidirectionalEncoderRepresentationfromTransformers,是一个预训练的语言表征模型。它强调了不再像以往一样采用传统的单向语言

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论