版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
鸡蛋在线评论主题挖掘相关技术综述目录TOC\o"1-3"\h\u15029鸡蛋在线评论主题挖掘相关技术综述 图2-2所示。SVM通过引入核函数来解决高维度空间中的内积运算,核函数的选择直接关系到SVM性能的好坏。SVM的核函数有sigmoid核函数、线性核函数、RBF核函数和多项式核函数等等,可以根据不同的数据类型选择不同的核函数。在确定核函数后,根据核函数类型的不同构建相关的参数。图2-SEQ图_2-\*ARABIC2SVM原理图(2)K近邻算法K近邻(K-NearestNeighbor,KNN)算法ADDINNE.Ref.{8EA60A40-03AA-4640-B878-C5DC071DF73E}[55]是在20世纪六十年代由Cover等人提出的一种基于距离度量的算法。其算法核心思想是根据不同特征值之间的距离既可以进行分类也可以进行回归。其原理图如图2-3所示。KNN算法的计算过程是给定一个训练集,对于新的测试集,计算两者之间的距离,在训练集中通过比较和计算,寻找与某实例最相近的k个实例,若这相邻的k个实例中的大多数都属于某个类时,则该测试实例就可以归到这个类中。其在文本数据中的主要分类步骤如表2-1所示ADDINNE.Ref.{3B34595B-E20D-4E46-B4B0-55CDC8CD19E8}[56]。图2-SEQ图_2-\*ARABIC3KNN原理图表2-SEQ表_2-\*ARABIC1KNN在文本数据中的主要分类步骤输入:训练样本集T=xi,yi输出:文本x所属的情感类别y算法步骤Step1:选择参数K;Step2:计算未知评论文本与所有已知评论文本的距离;Step3:选择最近K个已知评论文本;Step4:根据少数服从多数的投票法判断测试集的所属类别。(3)随机森林算法21世纪初BreimanADDINNE.Ref.{B9039BB9-6C1E-42B7-B0DE-679645349724}[57]提出了一种新的机器学习算法,该算法是基于多颗决策树的集成算法,即随机森林(Randomforest,RF)算法。它是一个包含多个决策树的分类器,它采用投票机制选择类别众数作为预测结果。其算法的核心思想随机有放回的抽样。表2-2为RF主要产生步骤。表2-SEQ表_2-\*ARABIC2随机森林产生的主要步骤输入:训练样本集T=xi,yii=1n输出:文本x所属的情感类别y算法步骤Step1:利用bootstrap方法随机有放回的选取m个评论文本作为训练样本;Step2:在随机抽取的训练样本中,再次随机选择部分特征构建决策树;Step3:重复步骤Step1和Step2,训练生成随机森林的T棵决策树;Step4:根据投票机制判定未知样本测试集的所属类别。随机森林分类流程如图2-4所示。图2-SEQ图_2-\*ARABIC4随机森林算法分类流程图(4)极端梯度提升算法Boosting是一种将多个弱分类器集成一个强分类器的双向随机集成学习算法。极端梯度提升(ExtremeGradientBoosting,XGBoost)是Boosting算法的其中一种。其算法思想是许多基分类器CART决策树集成一个强的分类器ADDINNE.Ref.{7E26C9CB-F199-4EDB-9E91-CF1984B0D103}[58]。XGBoost原理图如图2-5所示。图2-SEQ图_2-\*ARABIC5XGBoost原理示意图1.1.2Stacking模型融合算法Suen等人ADDINNE.Ref.{0944A36C-2585-4736-B719-66AAD6776C4A}[59]1990年提出了多分类器融合的概念。模型融合是通过训练多个模型,然后将这些模型按照一定的方法进行集成。在模型融合中,经典的集成学习方法有Bagging、Boosting和StackingADDINNE.Ref.{92DBB29D-BC6A-4299-8ECB-53502445D44C}[60]。Bagging、Boosting通常考虑的是同质弱学习器,与Bagging、Boost只能使用同质算法集成不同,Stacking融合策略是异质算法的融合,具有高泛化能力,可以使用不同质的弱学习器从而达到多样性ADDINNE.Ref.{D7E1B298-7317-4169-8738-939B7368E280}[61]。作为比较主流的组合分类方法ADDINNE.Ref.{CFE5634F-3E57-4817-AA10-783FEE3F6782}[62],其算法主要思想是训练模型来学习使用子模型的预测结果ADDINNE.Ref.{70674277-FA8C-40BA-BE19-10504AD8F044}[63]。Stacking融合策略一般要经过两层训练。第一层为mC1,C2⋯⋯Cm个基分类器,其输入数据为原始训练数据,P1,P2⋯⋯,Pm表示m个输出概率,将第一层的基分类器交叉验证后的输出结果作为第二层的输入变量,训练第二层的元分类器,P为最终分类结果。模型的训练过程如图2-6所示。图2-SEQ图_2-\*ARABIC6Stacking模型训练过程目前有许多采用不同机器学习算法在不同场景进行模型融合,如表2-3所示。表2-SEQ表_2-\*ARABIC3不同机器学习模型在不同场景下融合实例机器学习模型融合手段应用场景参考文献SVM、RF、KNNStacking(LR)情感分类ADDINNE.Ref.{B036DD7D-3E04-4F7D-AB05-39F5372D9F6D}[64]SVR、BPMNStacking(LR)能耗短期预测ADDINNE.Ref.{D098B232-C380-453C-8F81-EBE0C377DB13}[65]BP、C4.5、SVM加权投票保险顾客分类ADDINNE.Ref.{64B3C5B0-C197-468A-A174-B436E852D9FE}[65]SVM、CNN、SLTMStacking(SVM)情感分类ADDINNE.Ref.{5D56C0B6-FA54-4F7E-AC68-E245147DC6B7}[67]GBDT、RF、SVMStcaking电信客户信用度分类ADDINNE.Ref.{2BA4A03A-28A9-4D15-B4FC-34B3D746F9BE}[68]1.3主题挖掘相关技术1.3.1K-means聚类算法K-means算法,又可称为动态聚类法、逐步聚类法,在1967年由J.B.MacQueen提出ADDINNE.Ref.{EAEC3818-1DE0-48D4-8934-981AA8DB2A5B}[69],是最为广泛应用的数据聚类算法之一ADDINNE.Ref.{5BAC4572-10E8-4703-8DE3-1E3EE6BE960E}[70]。其算法的基本思想是:以空间中K个点为中心聚类,把最靠近他们的对象进行归类。然后利用迭代方法依次更新各聚类中心的值,一直到聚类中心收敛,得到最好的结果为止ADDINNE.Ref.{FF9F0093-3960-4429-A9FA-210D0CA07C3B}[71]。与其他其他聚类算法相比,K-means算法在处理文本数据时能够产生更好的聚类效果。此外,算法的处理过程也非常简单,以给定的数据,通过预先设定一定数目的簇集进行分类(假设k个簇)。K-means聚类算法有许多优点,但是该方法也存在两个缺点,在一定程度上限制了在实际中的应用。第一个是K值需要提前确定,第二个是依赖初始点的选取。本文从以上两个角度优化K-means聚类算法。目前针对K值得选取,主要通过遗传算法、混合F-统计量、克隆算法、类内类间距离或者多次测试得方法进行确定。初始点得选取主要有随机选取、凭经验知识选取、最大最小距离、遗传算法等等。常用的距离计算公式如下所示。设有两个N维特这个词对应的向量xi=x欧几里得距离ADDINNE.Ref.{BA5DB1B2-E04D-43EE-A7C3-0BDE5804502C}[72]:指的是在一个m维的空间中,两个点之间的直线距离。计算公式如下所示。dSX,Y余弦距离ADDINNE.Ref.{B0839374-9DE2-44F9-AA4B-A8149BD0290A}[73]:表示x和y的余弦距离,是通过计算两个向量的夹角来度量这两个向量之间的相似性的,公式如下:S1.3.2LDA主题模型LDA主题模型ADDINNE.Ref.{55917C18-6992-4C2E-BBC7-18DE043514C9}[74]是目前发展比较成熟的主题模型,本质是一个“文档(d)-主题(z)-词(t)”的三层贝叶斯生成模型,文本集中每条文本所提及的主题可以由它按照一定的概率分布形式给出ADDINNE.Ref.{29C2798C-44AC-46E9-8913-2CFEB8A9BF12}[75],在识别出大规模文档集或语料库中潜藏的主题信息具有一定的优势ADDINNE.Ref.{C784EF94-039A-4819-90C3-081CF5126FEA}[76]。其基本思想是将文档表示为潜在主题的随机混合物,其中主题的特征是分布在单词上。将文档描述为主题概率分布并进一步将主题描述为词项概率分布。模型的原理示意图如图2-7所示。图2-SEQ图_2-\*ARABIC7LDA模型示意图假设任何文本都可以表示成一系列主题的混合分布,记为P(Z),计算方式如下所示。p给定一个含有M个文本的语料库D=d1,d2,⋯dm,Step1:选择主题向量θ服从参数为α的狄利克雷分布,θi~DirαStep2:选择∅服从参数为β的狄利克雷分布,∅k~DirβStep3:对于文本中的每个词语wn生成主题zij服从参数为∅i的狄利克雷分布,zi,j~Multi∅i,其中∅i1.4算法评价指标1.4.1分类算法评价指标分类算法的评价方式有很多种,常用的精准率(Precision,简记为P)、准确率(Accuracy,简记为A)、召回率(Recall,简记为R)以及F度量(F-measure,简记为F)等等。情感分类是基于有监督问题的混淆矩阵(confusionmatrix),共有如表2-4四种可能结果,计算公式如下所示。实际中经常结合多种评价方式来评估算法质量,本论文算法评价指标采取这四种作为参考指标。表2-SEQ表_2-\*ARABIC4混淆矩阵混淆矩阵预测标记正例反例真实标记正例真正例(TP)假反例(FN)反例假正例(FP)真反例(TN)P=R=F1=A=1.4.2聚类算法评价指标聚类算法主要是通过评判类内聚集程度和类间离散程度来判断算法好坏,评估聚类算法的性能。常用评价指标有轮廓系数(Silhouettecoefficient)、CH(Calinski-Harabasz,CH)、戴维森堡丁指数(Davies-BouldinIndex,DBI)以及Dunn指数(DunnIndex,DI)等等。(1)轮廓系数轮廓系数的表示范围是从-1到1;
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 存在职业病危害企业安全管理员检修维修安全操作规程
- 体育馆无损检测施工方案
- 矿山爆破事故应急演练脚本
- 2026呼吸内科主治医师考试同步习题及答案
- 考试 90% 学生出错题型|暑假高中地理地貌形成专项突破复习课件
- 掌握高分逻辑初中历史因果逻辑推导暑假思维提升复习课
- 2026年初中道德与法治七年级上册单元试卷
- 2026年降酶退黄药物行业创新策略与市场前景报告
- 2026年链条行业创新产品与技术盘点报告
- 2026年航空点火设备行业创新趋势分析报告
- (高清版)WST 403-2024 临床化学检验常用项目分析质量标准
- 2024年阿维菌素市场分析:全球阿维菌素市场规模约为7.5亿美元
- JTS-252-2015水运工程施工监理规范
- 行测题库10000题讲解电子版
- GB/T 21837-2023铁磁性钢丝绳电磁检测方法
- 康复治疗师考试知识点汇总
- 传播学教程课件
- 维克多高中英语3500词汇
- 西方古典家具发展史
- JJF 1921-2021 GNSS行驶记录仪校准规范
- 三新背景下县域高中生涯规划教育的探索 论文
评论
0/150
提交评论