版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
自然语言处理项目5文本分类MOBILEPHONECONFERENCE品牌介绍MOBILEPHONECONFERENCE产品介绍MOBILEPHONECONFERENCE产品设计目录01020304文本向量化表示什么是文本向量化计算机拥有强大的信息处理能力,但是也有一个限制,就是只能处理用二进制数表示的数字信息。因此,当我们需要计算机处理声音信息、图像信息、文字信息时,第一步要做的就是信息的数字化。一旦将文本句子向量化,就可以让句子参与数学运算了。比如我们想知道两句话的相似度,只要计算一下这两句话的向量距离即可,距离短的自然相似度高,距离长的当然相似度低。文本离散表示词袋模型(BOW)是文本离散表示的另外一种方法,BOW用一个向量表示一句话,也可以表示一篇文章,同样是把文档看作是独立词的集合,不考虑词的关联和顺序,但是在BOW中加入了词频信息文本向量化分为离散表示和分布式表示两种,离散表示基于规则和词频,常用方法有词集模型和词袋模型(BOW)。词集模型先创建一个词典,词典中是所有要用到的词,然后每一个词用一个长向量表示,向量的长度就是词典的长度,每个词对应的向量中只有一个维度的数值为1,这个维度位置就是词在词典中的位置,其它维度的数值全部为0。这种向量表示称为独热表示(one-hotrepresentation)Word2Vec与Doc2Vec模型2013年,谷歌发表了Word2Vector工具,Word2Vector工具包括两个模型,一个叫跳字模型(Skip-Gram),另一个叫连续词袋模型(CBOW)。Word2Vec将每一个词表示为一个定长的向量,起到数据降维的作用,并且向量中数据稠密,解决了效率低下问题,特别是Word2Vec可以很好表达词与词之间的相似和类比关系。Doc2Vec是Word2Vec的拓展,通过Doc2Vec工具可以计算句子、文档之间的相似度,可以用于文本聚类和文本分类。Doc2Vec也有两个模型,与Word2Vec工具的两个模型对应,一个是分布记忆(Distributed
Memory,DM)模型,对应于Skip-Gram模型,另一个是分布式词袋(Distributed
BagofWords,DBOW)模型,对应于CBOW模型。基于机器学习的文本分类KNN模型KNN法又称K近邻法(K-nearestneighbor,K-NN),是一种最基本的分类方法。所谓K近邻法,意思就是K个相邻的邻居。如果我们要对一个新的实例进行分类,它的类别要根据它最近的几个邻居来确定。在KNN算法中,距离的计算方法主要有欧式距离、曼哈顿距离、Lp距离(闵可夫斯基距离)等。KNN法给定一个训练数据集,数据集中每一个实例都是向量,并且有自己所属的类别,对于一个新实例的特征向量,我们要确定它的类别,方法就是找出离这个新实例最近的K个邻居,看看邻居属于什么类别,如果K个邻居都属于同一个类别,那么新实例就确定为与邻居相同的类别。如果K个邻居分属于不同的类别,那么就通过投票法,将多数邻居所属的类别作为这个新实例的类别。因为有可能要通过投票法确定新实例的类别,所以K一般取奇数。sklearn中的朴素贝叶斯的分类器。朴素贝叶斯分类器是一种基于概率的分类器,实现简单,学习与预测的效率都很高,即便在今天深度学习盛行,它仍然有着强大的生命力。朴素贝叶斯法是基于贝叶斯定理与特征条件独立性假设的分类方法。其中特征条件独立性假设大大降低了实际问题的复杂性,简化了计算,这也是“朴素”二字的由来。朴素贝叶斯线性可分数据集支持向量机(supportvectormachines,SVM)是一种二分类器,从这一点看,支持向量机有点像感知机,但与感知机不同的是,感知机仅仅是要求找到能够分隔两个类别的超平面,而支持向量机要求找到能够分隔两个类别的最优超平面。间隔就是离分离超平面最近的正实例和负实例到分离超平面的距离之和,通过间隔最大化求得最优超平面。SVM模型基于深度学习的文本分类深度学习工具在使用深度学习方法的过程中,需要编写大量的代码,在这些代码中,有很多是具有共性的代码,任何一个使用深度学习方法的人都需要写这些代码,所以实际上有很多代码是重复代码。为了提高工作效率,有人将这些重复代码抽取出来,写成一个框架放到互联网上,供学习和研究者使用。随着时间的推移,一些性能优良的框架逐渐流行起来。比较主流的框架:TensorFlow、Keras、PaddlePaddle、PyTorch、Caffe循环神经网络(RecurrentNeuralNetwork,RNN)是最早运用到自然语言处理中的神经网络。RNN处理的输入数据为离散序列数据,并以离散序列的形式输出,在RNN内部通过结构设计捕捉输出与输入之间的关系特征LSTM是RNN的一种变体形式,在RNN原有的结构上引入了几道门:遗忘门、输入门和输出门。循环神经网络TextRNN模型TextRNN是专门用于处理文本数据的RNN,最典型的是处理文本的分类问题。前面说过,N对1的RNN特别适合处理文本分类问题,因此可以把N对1的RNN作为TextRNN的基本结构基于Attention机制的文本分类Encoder-Decoder结构Encoder-Decoder结构又称Seq2Seq模型。深度学习中SequencetoSequence(Seq2Seq)模型的目标是将一个序列转换成另一个序列。包括机器翻译(machinetranslate)、语音识别(speechrecognition)和时间序列预测(timeseriesforcasting)等任务都可以理解成是Seq2Seq任务。RNN(RecurrentNeuralNetworks)是深度学习中最基本的序列模型。Encoder与状态向量C构成一个N对1的RNN,状态向量C是Encoder的输出,可以看做是对N个输入向量的信息概括,或者说N个输入向量的信息被压缩到一个状态向量C中,而状态向量C又作为输入信息与Decoder构成一个1对M的RNN。Decoder的M个输出向量可以看做是对状态向量C逐步解码的结果。Attention机制又称为注意力机制,顾名思义,是一种能让模型对重要信息重点关注并充分学习吸收的技术。通俗的讲就是把注意力集中放在重要的点上,而忽略其他不重要的因素。注意力机制最早用在seq2seq模型上,2015年提出的Attention机制,对Seq2Seq模型进行了改进在Seq2Seq模型中,状态变量C实际上是Encoder的最后一个隐含层状态,其它隐含层状态全部被抛弃。在Attention机制中,Encoder中的所有隐含状态被保留,用于计算Decoder在每个隐含状态下的上下文状态Attention机制基于预训练模型的文本分类Transformer模型是谷歌团队2017年在一篇《AttentionisAllYouNeed》论文中提出的。Transformer从本质上说是一个seq2seq模型,也就是前面介绍过的Encoder-Decoder模型在Transformer中使用了多层编码器和多层解码器,各层编码器结构相同,但参数不同,分别独自训练。各层编码器将输入序列编码后的结果进行拼接,相当于对各编码器的结果进行综合计算,计算结果输入各层解码器分别进行解码,最后将各解码器的输出综合处理,得到输出序列。Transformer的基本概念BERT的全称为BidirectionalEncoderRepresentationfromTransformers,是一个预训练的语言表征模型。它强调了不再像以往一样采用传统的单向语言模型或者把两个单向语言模型进行浅层拼接的方法进行预训练,而是采用新的maskedlanguagemodel(MLM),以致能生成深度的双向语言表征。所谓预训练模型,就是在确定特定使用场景之前,使用大量的数据进行训练BERT的目的是预训练Transformer的Encoder网络,从而大幅度提高准确率。BERT的基本概念感谢欣赏机器阅读理解概述应用场景评估指标MRC系统目录01020304机器阅读理解概述机器阅读理解(MachineReadingComprehension,MRC)的概念来源于人类对文本的理解。测试一个人是否能完全理解一篇文章的最常见方法就是要求他回答关于这篇文章的问题。就像人类语言测试一样,MRC是评估计算机语言理解能力的自然方式。机器阅读理解应用机器阅读理解中的四大任务:完形填空多项选择片段抽取(答案抽取)生成式(自由问答)机器阅读理解评估MRC模型最常用的评估指标:Accuracy:代表MRC系统准确回答的问题的百分比ExactMatch:系统生成的答案与正确答案完全匹配的问题的百分比Precision:正确答案中的单词和预测答案中的单词之间的单词重叠百分比Recall:正确答案中的单词被正确预测的百分比机器阅读理解系统阅读理解模型的网络结构主要包括:嵌入层:嵌入层是将文字与问题映射为向量的表达形式编码层:词向量模块得到的是每个单词的独立表示,并不包含上下文语义信息信息交互层:信息交互层将文本和问题的编码信息、语义信息进行融合答案预测层:答案预测层根据上一层的交互向量抽取出答案边界,最终得到预测答案感谢欣赏信息检索概述应用场景模型案例检索式文本生成目录01020304信息检索概述信息检索(InformationRetrieval)是从信息系统资源集合中获取与信息需求相关的信息系统资源的过程。信息检索可以定义为一个对文档数据库中信息进行组织、存储和检索的程序,特别是对于文本信息进行处理,检索对象是由内容集合或数据库中的信息表示的实体。信息检索应用信息检索系统最初是为了帮助管理大量信息而开发的:数字图书馆:一种特殊的图书馆,其存储的数字对象的资源可以包括文本、图片、音频、视频等,以电子媒体格式存储(与印刷或其他媒体不同),以及组织、存储和检索图书馆集合中包含的文件和媒体的方法信息过滤系统:该系统使用自动化或计算机化的方法,在将信息流呈现给用户之前,从信息流中删除多余或不需要的信息。媒体搜索:这涉及用于博客和新闻搜索以及图像、3D、音乐、语音和视频检索过程的计算机系统搜索引擎:信息检索系统用户通过搜索引擎获取他们的所需的信息。搜索引擎包括网站、桌面、企业、移动、社交和网络搜索信息检索案例模型信息检索的三个基本模型是∶布尔模型(BooleanModel):布尔检索是根据关键词检索包含该词的所有文档。并且支持多个关键词之间的“AND”,“OR”,"NOT"操作向量空间模型(VectorSpaceModel,VSM):向量空间模型是一种文档表示和相似性计算的工具,不
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 旅游服务质量与顾客满意度
- 护理管理中的质量与安全
- 建设工程合同法规解读
- 单目视频人体运动测量系统:技术、挑战与创新
- 单壁碳纳米管手性结构:高分辨宏量分离制备的关键技术与应用突破
- 单倍体相合与同胞间全相合HSCT治疗高危ALL的疗效与前景:多维度对比与展望
- 协同驱动与技术创新:徐州地区水泥稳定碎石应用的深度剖析
- 协同办公赋能锡林郭勒盟土地利用动态变化研究:实践与展望
- 列一元一次方程解实际问题yy
- 协同办公赋能十字花科黑腐病菌小RNA研究:创新模式与实践
- 期中达标测试卷(1-4单元试卷)2026-2027学年五年级数学上册人教版(含答案)
- 2026年烟花爆竹零售经营安全考试试题及答案
- 2026年新版药物GCP考试试题及答案
- 2026年人教版新版数学四年级上册第三单元《多位数乘两位数》教学设计
- 新教科版科学五年级上册1-1《研究放大镜》教学课件
- 2026-2027学年统编版九年级语文上册第一单元综合检测卷(含答案)
- 2026第三季度广西一键游数智文旅产业集团有限公司社会招聘12人笔试题库(有一套)附答案详解
- 新版 2026新教材人教PEP版五年级上册英语课文+翻译合集
- 2024 温室气体排放核算与报告要求 第21部分:铸造企业
- 第三单元《阅读综合实践》课件 2026-2027学年统编版语文九年级上册
- 乡村振兴课件模板
评论
0/150
提交评论