机器学习基础与应用 课件 第九章 基于朴素贝叶斯算法的店铺评论分类_第1页
机器学习基础与应用 课件 第九章 基于朴素贝叶斯算法的店铺评论分类_第2页
机器学习基础与应用 课件 第九章 基于朴素贝叶斯算法的店铺评论分类_第3页
机器学习基础与应用 课件 第九章 基于朴素贝叶斯算法的店铺评论分类_第4页
机器学习基础与应用 课件 第九章 基于朴素贝叶斯算法的店铺评论分类_第5页
已阅读5页,还剩17页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

第九章基于朴素贝叶斯算法的店铺评论分类目

录朴素贝叶斯算法概述朴素贝叶斯算法原理文本分类数据预处理流程010203朴素贝叶斯算法概述01朴素贝叶斯算法概述朴素贝叶斯算法(naivebayesmodel)是一种基于贝叶斯定理与特征条件独立假设的分类方法。它在假设数据特征之间相互独立的条件下,使用已知的数据概率来对未知的数据进行分类。01以水果分类为例,假设一个水果的颜色、形状、和大小三个特征分别是红色、圆形、直径4cm。当我们使用朴素贝叶斯算法判断该水果是不是苹果时,首先会假设这三个特征互相独立、没有依赖关系,然后再计算该水果是不是苹果的概率。朴素贝叶斯算法原理02朴素贝叶斯算法原理贝叶斯定理是18世纪英国数学家托马斯·贝叶斯(ThomasBayes)提出的重要概率论理论。贝叶斯定理的公式如下:02贝叶斯定理P(B|A)表示在已知特征A的情况下,事件B发生的概率,也称为后验概率;P(B|A)表示在已知事件B发生的情况下,特征A出现的概率,也称为似然度;P(B)表示事件B的先验概率,指在考虑特征A之前,事件B发生的概率;P(A)表示特征A的先验概率,指在考虑事件B之前,特征A出现的概率。朴素贝叶斯算法原理例:已知某工厂生产次品的概率为10%,同时该工厂停电的概率为1%,停电时生产次品的概率为90%,那么当该工厂生产了次品的时候,停电的概率有多大?02贝叶斯定理在该例中,首先定义事件的概率,即设P(次品)表示生产次品的概率,即P(次品)=10%;设P(停电)表示工厂停电的概率,即P(停电)=1%;P(次品|停电)表示停电时生产次品的概率,即P(次品|停电)=90%;而该工厂生产次品时,停电的概率用P(停电|次品)表示,通过贝叶斯公式计算,停电的概率为:朴素贝叶斯算法原理在许多情况下,特征与特征之间可能存在关联性,例如通过温度、湿度、气压等特征判断是否是晴天,如果温度高,湿度就可能小,他们之间是存在关联性的。在这种多特征、多类别的场景下,如果直接从有限的样本中估计类别的概率往往会比较困难。02朴素贝叶斯算法原理朴素贝叶斯算法采用了“特征条件独立性假设”,即假设样本中的各个特征之间都是相互独立的、互不关联的,忽略特征之间的关联性,使计算概率的过程更加简单。朴素贝叶斯算法还需要估计先验概率和条件概率,并利用贝叶斯定理计算后验概率,朴素贝叶斯算法通常表现出很好的分类效果。朴素贝叶斯算法原理例:朴素贝叶斯算法实现文本分类(判断是否为篮球运动)表中文本特征是文字形式的,计算机很难进行计算,通常会通过一些文本预处理的方式将文本特征转成向量形式。如词频特征矩阵将文本特征中重复的词去掉得到词频列表如[突破,扣篮,罚球,唱歌,跳舞],接着再转为词频特征02朴素贝叶斯算法原理文本特征类别突破;扣篮True罚球;扣篮True唱歌;跳舞False朴素贝叶斯算法原理如果现在有[突破,罚球]这两个特征,那么使用朴素贝叶斯算法去判断该数据是否是篮球运动时,会得出以下公式。02朴素贝叶斯算法原理属于篮球运动的概率为不属于篮球运动的概率为所以最后将拥有[突破,罚球]特征的文本分为属于篮球运动这一类型。文本分类数据预处理流程03文本分类数据预处理流程文本分类数据预处理是文本分类中比较重要且关键的过程,文本分类数据预处理的好坏直接影响着分类的效果。文本分类数据预处理可以帮助我们从原始文本分类数据中提取有用信息并去除无用信息,而不同的任务常常需要使用不同的预处理步骤和方法,来对文本分类数据进行预处理,为后续模型训练和分析打下基础。03常见的文本分类数据预处理步骤:文本分类数据预处理流程03常见的文本分类数据预处理步骤:01分词将文本拆分成一个个单独的单词或词组,以方便后续处理02去除停用词将一些常见的,但是对分析用处不大的、无意义的字词或者标点符号从文本中去除03文本特征提取从文本中提取有用的信息并将其作为模型的输入特征04文本向量化将文本转换为向量形式文本分类数据预处理流程分词是实现文本分类的第一个步骤,指将一段文本按照一定的规则或算法进行切分,切分成一个个具有实际含义的词汇单位。在英文中,单词之间以空格作为自然分界符;而在汉语中,词没有一个形式上的分界符。也就是说,相比于英文,中文没有词与词之间的分界符(如空格)。因此分词是处理中文文本的首要步骤。03分词文本分类数据预处理流程对于中文进行分词可以使用jieba库。jieba分词库是一个优秀的Python第三方中文分词库,常常用于对中文文本进行分词。jieba分词库的分词原理是利用中文词库来确定汉字之间的关联概率,并将概率大的汉字组成词组,形成最终的分词结果。jieba分词库支持3种分词模式:精确模式、全模式、搜索引擎模式。03分词文本分类数据预处理流程03分词分词模式简介特点切分结果精确模式对语句进行最精确的切分不存在冗余数据,能够完整地把文本按照中文词库的标准完成拆分,比较适合文本分析全模式将语句中所有可能是词的词语都切分出来分词速度很快,但是会存在冗余数据搜索引擎模式在精确模式的基础上,对长词再次进行切分提高召回率,适合用于搜索引擎分词例:“冰墩墩是2022年北京冬季奥运会的吉祥物”文本分类数据预处理流程停用词是指在文本分析中被忽略的一些常见词语,例如“的”“了”“是”等。这些词在文本中出现的频率非常高,但通常不携带太多的语义信息,因此这些词在文本分类中通常可以被忽略。忽略这些词可以减少文本数据量,提高文本处理效率,同时可以避免这些无意义的词对文本分类的影响。03去除停用词文本分类数据预处理流程停用词通常包括语气助词、连词、代词、介词、冠词、副词等一些无实际意义的词语。在文本分类中,常常使用停用词表来忽略这些词语。停用词表可以是自己预定义的,也可以是根据具体的文本数据集来自动生成的。目前常用的中文停用词表:03去除停用词百度停用词表哈工大停用词表中文停用词表文本分类数据预处理流程文本特征是指用于描述文本的属性或特性,可以用于文本分类、情感分析、实体识别等任务。常见的文本特征提取包括词频(TF)、TF-IDF值等。词频特征是一种比较简单文本特征,它指的是文本中每个词出现的次数。因为每个文本一般都是由单词所组成的,而每个单词出现的次数在一定程度上又可以从侧面反映该文章的内容。例:love这个词出现的比较多,则可以猜测很大可能属于情感类的文章。在处理文本类的信息时,词频特征是非常重要的信息之一。03文本特征提取文本分类数据预处理流程词频特征简单易于理解,能够从宏观角度捕获文本信息,但是词频特征往往会受到停止词汇的影响(即停用词),例如“的”“,”等,他们出现次数往往较多,容易影响文本的分析效果,所以在处理文本类型的数据时常常包含去停用词这一部分操作。03文本特征提取文本分类数据预处理流程原因:计算机系统内部以二进制来表示、存储和处

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论