已阅读5页,还剩3页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
文本聚类的开题报告 文档聚类可以作为多文档自动文摘等自然语言处理应用的预处理步骤,可以将重要新闻文本进行聚类处理,是一种处理文本信息的重要手段。 文本聚类开题报告 基于KMean文本聚类的研究 摘 要 文本聚类能够把相似性大的文本聚到同一类中。K-Means常用来聚类文本,但是由于聚类中心的选取对聚类结果有影响,导致聚类不稳定,因此采用一种基于聚类中心的改进算法分析文本,通过实验,验证算法的有效性。 中国论文网 /9/view-6244858.htm 关键词 文本聚类;k-means;相似性;度量准则 中图分类号:TP391 文献标识码:B 文章编号:1671-489X(20XX)18-0050-03 Research for Text Clustering based on K-Mean/ZHANG Yue, LI Baoqing, HU Lingfang, MENG Li Abstract Text clustering can make the text similarity large clustered into the same class, K-Means usually is used in text clustering, because of impacting on the cluster center, which results in the clustering instability. Therefore, this paper uses a text analysis of improved algorithm based on the clustering center, through the experiment, it verifies the effectiveness of the improved algorithm. Key words text clustering; k-means; similarity; measure criterion 文本聚类是把不同的文本分别聚在不同的类别中,是文本挖掘的重要技术,它是一种无监督的学习技术,每个类中包含的文本之间具有较大的相似性,不同类间的文本相似性比较小。文本聚类是数据挖掘的重要分支,它应用神经网络、机器学习等技术,能够自动地对不同文本进行分类。 在文本聚类分析中,文本特征表示一般采用向量空间模型1,这种模型能更好表现文本。在对文本聚类的研究中,Steinbach等人研究了基于划分的方法和基于层次的方法在文本聚类中的适用程度2-3,得出结论:采用K-Means算法进行聚类,不仅聚类结果较好,而且适用于数据量比较大的聚类场合。在文章中根据研究者对K-Means的发现,结合实际研究,采用一种基于K-Means的改进算法来聚类。Dhillod等人对文本聚类进行研究发现,采用余弦夹角作为相似性度量比采用欧氏距离度量的结果好很多4。 1 文本聚类 文本聚类的方法很多,主要分为基于层次的方法、基于划分的方法、基于密度的方法、基于模型的方法、基于网格的方法5。在这些聚类方法中,基于划分的K-Mean是最常用也是很多改进方法的基础,文章中采取的改进方法也是基于K-Mean的。 K-Mean首先由MacQueent6提出。它能在大数据集中广泛被使用,因为算法效率较高、算法执行过程理解容易。当前进行的很多研究都是以K-Mean为基础开展进行的,它的计算复杂度低,具有与文档数量成线性关系的特性,计算效率不仅高,而且伸缩性较强,适应大数据集的能力也很强。K-Mean以k为初始聚类数,然后把n个文本分到k个聚类中,这样类内的文本具有较高的相似度,不同类间的相似度较小。 K-Mean具体的算法过程如下: 1)首先给定n个数据文本,从其中任选k个文本,这k个数据文本初始地代表了k个类的数据中心; 2)对剩余的每个文本计算其到每个中心的距离,并把它归到最近的中心类中; 3)重新计算已经得到的各个类的中心,通常计算中心的准则函数采用平方误差准则,这个准则能够使生成的结果类尽可能地独立和紧凑; 4)迭代执行第二步和第三步的动作直至新的中心与原中心相等或小于指定阈值,直到算法结束。 具体的算法流程如图1所示。 2 改进的聚类算法 虽然使用K-Mean算法进行文本聚类时,具有计算复杂度低,计算效率不仅高,而且伸缩性较强,适应大数据集的能力也很强的优点,但是实验发现,不仅初始聚类中心的选取对聚类结果有影响,孤立点的存在对文本的相似性的判断也有很大的影响,这就导致聚类判断不稳定。基于此,文章采用一种改进的方法来进行文本聚类,改进关键点在于聚类中心的计算,用与原聚类中心相似的文本数据来计算平均值作为该聚类中心。 改进的K-Means算法描述如下所示: 1)首先给定n个数据文本,从其中任选k个文本,这k个数据文本初始地代表了k个类的数据中心; 2)对剩余的每个文本计算其到每个中心的距离,并把它归到最近的中心类中,记作means; 3)选择类中与类中心大于等于(1+a)*means的文本集合D1,D2,.,Dk,其中a-0.31,0.31,重新计算新文本集中的类中心; 4)迭代执行第2步和第3步的动作直至新的中心与原中心相等或小于指定阈值,直到算法结束。 3 相似度计算 文本聚类中涉及文本的相似性计算,只有相似性大的文本才能聚到同一类中,因此,相似性的度量对文本的聚类很关键。在文本聚类中,相似度度量方式一般有曼哈顿距离、Cosine距离、欧式距离,其中Cosine距离更能体现文本的相似性。本文主要采用Cosine距离,当两个文本之间的文本相似度越大,它们之间的相关性越强。文本集用向量空间模型表示后,文本的相似度采用向量之间距离表示: (1) 4 评价标准 文本聚类的有效性需要进行验证,文章中主要采用F度量、平均纯度来对聚类结果进行评价。 1)F度量。F度量把召回率和评价标准准确率结合在一起。 准确率:P(i,r)=nir/nr (2) 召回率:R(i,r)=nir/ni (3) 其中nir是类别r中包含类别i中的文本的个数,nr是类别r中实际文本的数目,ni是原本类别i中应有的文本数,F值的计算公式: (4) 由公式(4)最后得到评价函数为: (5) 其中n为文本的总数。从公式看出F值越高,聚类效果越好。 2)平均纯度。除了用F度量来评价聚类,文章中还使用平均纯度来度量文本聚类质量好坏7。设类ci的大小为ni,则该类的纯度为: (6) 其中nj表示类ci与第j类的交集大小,则平均纯度公式为: (7) 其中k为最终的聚类数目。一般说来纯度越高聚类效果越好。 5 聚类实验结果分析 文章中采用的实验数据主要是搜狗语料库。搜狗语料库主要包括10种文本类别:军事、招聘、IT、文化、健康、汽车、体育、旅游、财经、教育。搜狗语料库包含了每一类的文件夹,在文件夹中都是txt文本。为了验证改进后的算法比原算法更有效,进行了多次实验,最终选取了其中一次实验结果为例子,对两种算法的F度量和纯度进行比较,分别如表1和表2所示。 从表1可以看出,改进聚类中心的K-Means算法在纯度方面相对有一些提高;从表2可以看到F值提高明显;从两个表中的实验结果可以看到改进的算法是有效的。 6 结论 基于文本的聚类分析能够对大量的文本进行聚类,分析中采用的聚类算法的改进能在很大程度上提高聚类的准确性。实验证明达到设计的效果,同时也为后期的各种数据挖掘工作打下基础。 参考文献 1Salton G, Wong A, Yang C S. A vector space model for automatic indexingJ.Comm. ACM,1975,18(11):613-620. 2Steinbach M, KaryPis G, Kumar V. A comparison of document clustering techniquesC.Proceedings of KDD XX Workshop on Text Mining.XX:1-20. 3Ying Zhao, KaryPis G. Hierarchical Clustering Algorithms for Document DatasetsJ.Proceedings of Data Mining and Knowledge Discovery,XX,10(2):141-168. 4Dhillon I S, Modha D S. Concept decompositions for large sparse text data using clusteringJ.Machine Learning,XX, 42(1):143-175. 5邵峰晶,于忠清.数据挖掘原理与算法M.北京:中国水利水电出版社,XX. 6MacQueen J. Some methods for classification and analysis of multivariate observationsC/Proceedings of 5
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年应急综合接待事业单位招聘考试笔试试题(含答案)
- 医联体协议书
- 2026 年凶险性前置胎盘期待疗法护理个案
- 广告宣传代理合同协议三篇
- 2026年秋季国际经济与贸易专业开学第一课 就业前景与求职策略讲座方案
- 2026年秋季教育学专业开学第一课 就业前景与求职策略
- 保障房项目地下管廊防水施工方案
- 2026输血知识考试试题及参考答案
- 职业暴露的试题及答案
- 2026年临床助理医师考试《消化系统》练习题(附答案)
- 2026中国联通内蒙古分公司招聘10人建设笔试参考题库及答案解析
- 120个文言实词趣记
- 宁夏回族自治区银川市永宁中学2025-2026学年第二学期第一次阶段检测高一物理试卷(含解析)
- 专职安全员考勤制度
- 非计划停机考核制度
- 天平代换课件
- GB/T 44937.2-2025集成电路电磁发射测量第2部分:辐射发射测量TEM小室和宽带TEM小室法
- 拖轮消防安全课件
- 钢结构质量管理培训课件
- 【项目方案】南瑞:2.5MW(构网型)储能技术方案
- 钢结构油漆翻新施工方案
评论
0/150
提交评论