【基于LDA-K-means的鸡蛋在线评论主题挖掘分析案例4300字】_第1页
【基于LDA-K-means的鸡蛋在线评论主题挖掘分析案例4300字】_第2页
【基于LDA-K-means的鸡蛋在线评论主题挖掘分析案例4300字】_第3页
【基于LDA-K-means的鸡蛋在线评论主题挖掘分析案例4300字】_第4页
【基于LDA-K-means的鸡蛋在线评论主题挖掘分析案例4300字】_第5页
已阅读5页,还剩7页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于LDA-K-means的鸡蛋在线评论主题挖掘分析案例目录TOC\o"1-3"\h\u5212基于LDA-K-means的鸡蛋在线评论主题挖掘分析案例 1229161.1实验数据 1179031.1.1实验数据介绍 1230981.1.2鸡蛋情感词典构建 1105351.2鸡蛋在线评论主题挖掘模型构建 440051.2.1主题挖掘模型框架设计 4159431.2.2LDA主题建模 5143941.2.3K-means聚类 7297711.3实验结果分析 71.1实验数据1.1.1实验数据介绍本文实验采用的数据来自第三章情感分析后得到的负向和正向评论。数据集在经过去标点符号、分词、去停用词、删除词数过少的评论等数据预处理步骤后共有82200条数据。其中数据集信息如下所示:表4-SEQ表_4-\*ARABIC1数据集信息展示评论数最长评论字数最短评论字数平均评论字数正向评论425602465120负向评论396401980801.1.2鸡蛋情感词典构建因语言的发展,一些情感词的语境已发生变化,若直接将目前的情感词典应用到情感分类中,会存在效果不理想、情感表述不全面等问题。情感词典在情感分析领域,占有重要的地位,其质量的好坏以及规模的大小将直接影响情感分析的效果。情感词的收集整理是一个一直进行的行为,需要不断积累,仅依据基础的情感词汇来辨识一个文本里的情感倾向是不全面的,尤其是在一些特殊的领域。基于以上问题,本文专构建鸡蛋领域的情感词典,如图4-1所示。图4-SEQ图_4-\*ARABIC1鸡蛋情感词典构建流程基础情感词典目前市场上使用较为广泛的中文情感词典有大连理工大学的本体库、知网的情感词典和台大的简体中文情感词典等,本文首先将以上三个词典进行合并去重,并且人工去掉了一些不常用和生僻的词语,组成了一个包含正向的情感词典和负向情感词典的基础情感词典。如下表所示。表4-SEQ表_4-\*ARABIC2基础情感词典示例基础情感词典类型个数举例正向情感词词典1865满意、喜欢、夸奖、开心、快乐负向情感词词典4631生气、讨厌、发火、臭骂、鄙视否定词词典否定词典是指情感词的前缀包含一些否定词的词语,并且去掉否定词该词的情感极性即发生了改变。例如:这次购买的鸡蛋让人很不满意,下次再也不买了。在这条评论中,若只是简单的匹配和查找情感词,该句子就被判定为肯定的积极评价,失去了评论的真实性。该评论的真实表达语义是不满意,结果出现了反转偏差。基于《知网》的否定词典,进行综合分析,并进行抽取否定义原和加以人工的梳理,得到了本文的否定词词典。最终整理得到的否定词词典如表4-3所示。表4-SEQ表_4-\*ARABIC3否定词词典否定词个数没、没有、不、从未、没什么、非、不是、不要、53程度副词词典程度副词词典对句子情感的作用是通过更改情感词的情感倾向程度来实现的。通常位于情感词的前面或者后面。例如:“这次购买的鸡蛋非常满意,物流快,包装也没有破损,鸡蛋也十分新鲜。”在这条评论中,出现有“满意”、“新鲜”两个正向情感词,“非常”、“十分”两个程度副词。尽管句子是积极的,但是非常满意和十分新鲜比满意和新鲜的情感强度更强。程度副词包含六种,根据情感倾向程度的差异赋予不同的权值。本文所用的程度副词部分示例如表4-4所示。表4-SEQ表_4-\*ARABIC4程度副词词典及其权值程度级别程度副词示例数量权值总体总体、总的来说、整体、各方面205及其十分、极其、绝对802.5很太、实在、尤其、不少302比较那样、还好451.5一般一点、稍微、稍560.8基于SO-PMI领域词典扩充获取情感词是用来构建鸡蛋情感词词典的首要条件,本文采用平滑SO_PMI算法的方法提取候选词,然后判断极性。目前判断词语褒贬性有两种方法:基于语义的计算和基于数学统计分析是较为常用的两种方法。本文采用基于统计分析的方法扩充鸡蛋领域的情感词典。基于平滑SO-PMI领域词典扩充主要分为两个任务,第一个是从原始数据中发现新词,选取新词做为种子词语。点互信息(Point-wiseMutualInformation,PMI)是目前研究人员用的较多的度量方法,计算两个词间的相关性,其计算方式如下:PMIword其中PMIword1,word2表示词word1和word2一起出现的概率,PMIword1表示word1出现的概率。pwordPMISO-PMI(SemanticOrientationPointwiseMutualInformation,SO-PMI)情感倾向点互信息算法,其算法的核心思想是通过判定基准词与陌生词的关系,来确定陌生词的情感极性ADDINNE.Ref.{F7C04852-1990-4AE4-A8D3-D0A308DE5B56}[79]。其计算方式如公式(3-3)所示。SO−PMI这里num(pos)假如SO−PMI>0假如SO−假如SO−领域词典构建步骤:Step1:分别手动选取20个褒义词和20个贬义词,作为褒义种子和贬义种子;Step2:将发现的新词加入分词词典中,进行结巴分词;Step3:分别采用拉普拉斯平滑的SO计算分词和基准情感词的相似度,选取最相似的50个正向情感词和50个负向情感词。通过对情感词典的构建分析发现,共有鸡蛋领域情感词123个,正向和负向情感词分别是70和53个;图4-2表示部分鸡蛋领域的情感词及其极性强度,由表得知这些情感词区分度较好,领域特性较强,因此可以将其加入到词典中进行合并。图4-SEQ图_4-\*ARABIC2鸡蛋领域词典1.2鸡蛋在线评论主题挖掘模型构建1.2.1主题挖掘模型框架设计本章在上一章的基础上,将LDA主题模型与K-means聚类算法结合对鸡蛋的正负向评论进行主题挖掘。主题挖掘流程图如下图所示。图4-SEQ图_4-\*ARABIC3主题挖掘流程图1.2.2LDA主题建模LDA主题提取过程中,主要是解决两个方面的问题。第一个是确定最优主题数,第二个是估计超参数。(1)最优主题数确定鉴于主题模型是无监督的,存在难以评估和选择的问题,因此对主题数的确定是尤其重要的。目前主要有经验设定、困惑度值(Perplexity)、极大似然估计以及非参数的贝叶斯等方法来确定最优主题数。本实验使用gensim工具包进行开发,用困惑度值寻找最优主题个数。一般来说,困惑度越小,表示LDA主题模型的性能越好。根据本文实验数据集,将主题的范围设置为0,200,以5作为步长不断递增,并将其作为参数输入LDA模型,进行迭代实验,观察困惑度的值,困惑度最小时的主题数即为最优主题数。本文中的正负面评论中的困惑度值随主题数变化趋势如下图所示。图4-SEQ图_4-\*ARABIC4负面和正面评论主题寻优由图4-4可知,对负面评论数据做LDA,可以选择主题数为30,对负面评论进行LDA时,可以选择主题数为30。对于正面评论数据,当主题数大于50时,LDA主题模型的困惑度有往稳定发展的趋势,同时考虑到主题数过大没用意义不大,本文选取50个主题。根据主题数寻优结果,使用Python的gensim模块对正、负面评论数据分别构建LDA主题模型。经过LDA主题分析后,每个主题下生成10个最有可能出现的词语以及相应的概率。(2)LDA超参数α和β估计各种方法被提出来估计LDA参数,如变分法(variationalmethod)ADDINNE.Ref.{711D5C9A-C87F-4B12-B633-8A7643D0802C}[38],期望传播(expectationpropagation)ADDINNE.Ref.{E1FDC334-7383-4E88-BFCE-0B561A8A2C35}[80]和吉布斯采样(Gibbssampling)ADDINNE.Ref.{07FDC0E7-E974-44CD-844B-2790BE2C26C5}[81,82]。α是主题先验分布Dirichlet的参数,β是单词先验分布Dirichlet的参数,两者分别在评论的主题中和主题的单词稀疏性中起作用。以超参数α为例:假如α>1越大,表示让同一条评论中包含的总主题数越多,每个主题的概率都比较低;假如α=1,Dirichlet概率分布化为均匀分布;假如α<1越小,Dirichlet概率分布越集中,即让同以文档包含的总主题数越少,个别主题的概率特别高,其余为0;同理词汇的先验分布参数越小,是让同一个词尽可能属于同一主题。LDA工具包默认的α=0.01,β=0.01。本文参考GriffithsADDINNE.Ref.{5EC3AA30-6C5F-4EDB-9970-EA7E71DE8AD3}[81]设置超参数α=0.1和β=0.02。Gibbs采样算法的基本过程为:Step1:将样本数据中的每条评论中的词w随机初始化为属性s和主题z赋值;Step2:重复扫描;Step3:重复以上采样过程直到Gibbs采样收敛;Step4:计算属性-主题关系矩阵和主题和单词关系矩阵。1.2.3K-means聚类本文利用LDA主题模型建模得到的鸡蛋在线评论主题信息,作为K-means聚类算法的输入数据。K-means算法的具体步骤如下所示:表4-SEQ表_4-\*ARABIC5K-means算法步骤输入:样本数据集T,聚类个数K;输出:K个簇,使平方误差准则最小。算法步骤:Step1:从样本数据中随机选择k个对象作为k-means算法的初始聚类中心;Step2:计算每个聚类对象xi到上一步所选定的k个聚类中心的距离,以距离近的归属于同一个类的原则进行划分;Step3:对于新的类别,再次计算每个聚类的中心ajStep4:重复Step2和Step3,直到达到迭代次数或达到最小误差。本研究通过手肘法确定K-means的聚类个数K值。将K值的范围设置为[1,9],则每一个K值及对应的SSE。从根据手肘法的选取原则ADDINNE.Ref.{FC3645AF-AEF4-4D66-86AB-6E8380A9A657}[83],我们选取手肘部分的值作为K值。显然,在图4-5的关系图中负面评论的手肘部分的数字为6,即K-means聚类算法的K值选为6。正面评论的手肘部分的数字为4,即K-means聚类算法的K值选为4。图4-SEQ图_4-\*ARABIC5负面和正面评论最佳K值选择图1.3实验结果分析采用LDA主题模型挖掘对鸡蛋的在线评论文本进行分析。通过LDAvis将提取的鸡蛋在线评论主题进行可视化。鸡蛋的正面评论和负面评论主题提取结果如下图所示。左边的气泡分布是不同主题,气泡的大小及编号即表示主题出现的频率。右边是当前主题内前30个特征词。浅蓝色的表示这个词在整个文档中出现的频率(权重),深红色的表示这个词在这个主题中所占的权重。右上角可以调节一个参数λ,其作用是调节词语与主题之间的相关性。如果λ越接近于1,则会显示在该主题下出现的最频繁的词语。图4-6和图4-7展示了鸡蛋正负面评论中30主题的分布情况和概率占比。点击任意一个气泡图,就会出现该气泡主题下最具有代表的30个热点词。图4-SEQ图_4-\*ARABIC6鸡蛋负面评论主题提取结果图4-SEQ图_4-\*ARABIC7鸡蛋正面评论主题提取结果为了进一步观察不同主题的特征,我们设定λ为0,观察每类主题下最独有的词语作为主题提取的结果。结果如表4-6所示。本文分别取正面和负面评论的5个主题,积对于每个主题选取10个关键词,按10个关键词的权重大小进行排列。由表4-6可知,鸡蛋的负面评论中的潜在主题。主题1鸡蛋的外包装,主题三2是不满意的体验,主题三的高频特征词是腥味、坏蛋,强调的是鸡蛋的质量。主题四高频特征词是慢、收获,强调的是鸡蛋的物流和服务,主题5高频特征词个头、小。鸡蛋的正面评论中的潜在主题。主题1中的高频特征词,即主要关注点新鲜、好吃、味道等,主要反映鸡蛋的质量,主题2鸡蛋的外包装,主题三,鸡蛋的价格,主题四高频特征词是购买体验。表4-SEQ表_4-\*ARABIC6鸡蛋正面评论主题提取结果正面评价主题负面评价主题主题1主题2主题3主题4主题5主题1主题2主题3主题4主题5新鲜完好价格物流推

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论