版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大数据与数据挖掘-文本挖掘文本挖掘的背景数据挖掘大部分研究主要针对结构化数据,如关系的、事务的和数据仓库数据。现实中大部分数据存储在文本数据库中,如新闻文章、研究论文、书籍、WEB页面等。存放在文本数据库中的数据是半结构化数据,文档中可能包含结构化字段,如标题、作者、出版社、出版日期等,也包含大量非结构化数据,如摘要和内容等。1、文本挖掘概述文本挖掘概念文本挖掘旨在通过识别和检索令人感兴趣的模式,进而从数据源中抽取有用的信息。文本挖掘的数据源是文本集合,令人感兴趣的模式不是从形式化的数据库记录里发现,而是从非结构化的数据中发现。文本挖掘的过程预处理文档建模相似性计算信息检索文本分类文本聚类模型评价预处理把中文的汉字序列切分成有意义的词,就是中文分词,也称为切词。“我是一个学生”分词的结果是:我是一个学生。和平民主和平、民主;和、平民、主提高人民生活水平提高、高人、人民、民生、生活、活水、水平大学生活象白纸大学、生活、象、白纸大学生、活象、白纸最大匹配分词法S1="计算语言学课程是三个课时"设定最大词长MaxLen=5S2=""(1)S2=“”;S1不为空,从S1左边取出候选子串W="计算语言学";(2)查词表,“计算语言学”在词表中,将W加入到S2中,S2=“计算语言学/”,并将W从S1中去掉,此时S1="课程是三个课时";(3)S1不为空,于是从S1左边取出候选子串W="课程是三个";(4)查词表,W不在词表中,将W最右边一个字去掉,得到W="课程是三";(5)查词表,W不在词表中,将W最右边一个字去掉,得到W="课程是";(11)查词表,W不在词表中,将W最右边一个字去掉,得到W="是三"(12)查词表,W不在词表中,将W最右边一个字去掉,得到W=“是”,这时W是单字,将W加入到S2中,S2=“计算语言学/课程/是/”,并将W从S1中去掉,此时S1="三个课时";(21)S2=“计算语言学/课程/是/三/个/课时/”,此时S1=""。(22)S1为空,输出S2作为分词结果,分词过程结束。停用词指文档中出现的连词,介词,冠词等并无太大意义的词。英文中常用的停用词有the,a,it等中文中常见的有“是”,“的”,“地”等。停用词消除可以减少term的个数,降低存储空间。停用词的消除方法:(1)查表法:建立一个停用词表,通过查表的方式去掉停用词。(2)基于DF的方法:统计每个词的DF,如果超过总文档数目的某个百分比(如80%),则作为停用词去掉。文档建模特征表示是是指以一定定的特征项项如词条或或描述来代代表文档信信息。特征表示模模型有多种种,常用的的有布尔逻辑型型、向量空空间型等向量空间模模型中,将将每个文本本文档看成成是一组词词条(T1,T2,T3,…,Tn)构成,对对于每一词词条Ti,根据其在在文档中的的重要程度度赋予一定定的权值,,可以将其其看成一个个n维坐标系,,W1,W2,…,Wn为对应的坐坐标值,因因此每一篇篇文档都可可以映射为为由一组词词条矢量构构成的向量量空间中的的一点,对对于所有待待挖掘的文文档都用词词条特征矢矢量(T1,W1;T2,W2;T3,W3;…;Tn,Wn)表示。向量空间模模型将文档档表达为一一个矢量,,看作向量量空间中的的一个点。。文档的向量量空间模型型W权值计算方方法TF-IDF目前广泛采采用TF-IDF权值计算方方法来计算算权重,TF-IDF的主要思想想是,如果果某个词或或短语在一一篇文章中中出现的频频率TF高,并且在在其他文章章中很少出出现,则认认为此词或或者短语具具有很好的的类别区分分能力,适适合用来分分类。TF词频(TermFrequency)指的是某一一个给定的的词语在该该文件中出出现的次数数。IDF逆文档频率率(InverseDocumentFrequency)是全体文档档数与包含含词条文档档数的比值值。如果包包含词条的的文档越少少,IDF越大,则说说明词条具具有很好的的类别区分分能力。在完整的向向量空间模模型中,将将TF和IDF组合合在一起,,形成TF-IDF度量:TF-IDF(d,t)=TF(d,t)*IDF(t)TF度量在一份给定定的文件里里,词频((termfrequency,TF)指的是某某一个给定定的词语在在该文件中中出现的频频率。这个个数字是对对词数(termcount)的归一化,,以防止它它偏向长的的文件。((同一个词词语在长文文件里可能能会比短文文件有更高高的词数,,而不管该该词语重要要与否。))对于在某某一特定文文件里的词词语来来说,它的的重要性可可表示为::以上式子中中
是该该词在文件件中的出现现次数,而而分母则是是在文件中中所有字词词的出现次次数之和。。IDF度量逆向文件频频率(inversedocumentfrequency,IDF)是一个词词语普遍重重要性的度度量。某一一特定词语语的IDF,可以由总总文件数目目除以包含含该词语之之文件的数数目,再将将得到的商商取对数得得到:•|D|:语料库中的的文件总数数•:包包含词词语的文件件数目(即即的文件数数目)如果果该词语不不在语料库库中,就会会导致被除除数为零,,因此一般般情况下使使用关键词与与网页的的相关性性计算在某个一一共有一一千词的的网页中中“大数数据”、、“的””和“应应用”分分别出现现了2次、35次和5次,那么么它们的的词频就就分别是是0.002、0.035和0.005。三个数数相加,,其和0.042就是相应应网页和和查询““大数据据的应用用”相相关性的的一个简简单的度度量。概括地讲讲,如果果一个查查询包含含关键词词w1,w2,...,wN,它们在一一篇特定定网页中中的词频频分别是是:TF1,TF2,...,TFN。(TF:termfrequency)。那么么,这个个查询和和该网页页的相关关性就是是:TF1+TF2+...+TFN。词“的””站了总总词频的的80%以上,它它对确定定网页的的主题几几乎没有有用。在在度量相相关性时时不应考考虑它们们的频率率。删除除后,上上述网页页的相似似度就变变成了0.007,其中““大数据据”贡献献了0.002,“应用用”贡献献了0.005。“应应用”是是个很通通用的词词,而““大数据据”是个个很专业业的词,,后者在在相关性性排名中中比前者者重要。。因此我我们需要要给汉语语中的每每一个词词给一个个权重,,这个权权重的设设定必须须满足下下面两个个条件::一个词预预测主题题能力越越强,权权重就越越大,反反之,权权重就越越小。我我们在网网页中看看到“大大数据””这个词词,或多多或少地地能了解解网页的的主题。。我们看看到“应应用”一一次,对对主题基基本上还还是一无无所知。。因此,,“原子子能“的的权重就就应该比比应用大大。应删除词词的权重重应该是是零。如果一个个关键词词只在很很少的网网页中出出现,我我们通过过它就容容易锁定定搜索目目标,它它的权重重也就应应该大。。反之如如果一个个词在大大量网页页中出现现,我们们看到它它仍然不不很清楚楚要找什什么内容容,因此此它应该该小。概括地讲讲,假定定一个关关键词ww在在Dww个网网页中出出现过,,那么DDw越越大,,w的权权重越小小,反之之亦然。。在信息息检索中中,使用用最多的的权重是是“逆文文本频率率指数””(Inversedocumentfrequency缩写为IIDF)),它的的公式为为logg(D//Dw))其中DD是全部部网页数数。假定中文文网页数数是D==10亿亿,应删删除词““的”在在所有的的网页中中都出现现,即DDw=110亿,,那么它它的IDDF=log(10亿/10亿)=log(1)=0。假如如专用词词“大数数据”在在两百万万个网页页中出现现,即DDw=2200万万,则它它的权重重IDFF=log(500)=6.2。又假定通通用词““应用””,出现现在五亿亿个网页页中,它它的权重重IDFF=log(2)则只有0.7。也就只只说,在在网页中中找到一一个“大大数据””的比配配相当于于找到九九个“应应用”的的匹配。。利用IDF,上述相相关性计计算个公公式就由由词频的的简单求求和变成成了加权权求和,,即TF1*IDF1+TF2*IDF2+...+TFN*IDFN。在上面面的例子子中,该该网页和和“原子子能的应应用”的的相关性性为0.0159,其中““大数据据”贡献献了0.0124,而“应应用”只只贡献了了0.0035。这个比比例和我我们的直直觉比较较一致算例1词频(TF)是一词语语出现的的次数除除以该文文件的总总词语数数。假如如一篇文文件的总总词语数数是100个,而词词语“大大数据””出现了了3次,那么么“大数数据”一一词在该该文件中中的词频频就是3/100=0.03。一个计算算逆文件件频率(IDF)的方法是是测定有有多少份份文件出出现过““大数据据”一词词,然后后除以文文件集里里包含的的文件总总数。所所以,如如果“大大数据””一词在在1,000份文件出出现过,,而文件件总数是是10,000,000份的话,,其逆向向文件频频率就是是log(10,000,000/1,000)=4。最后的TF-IDF的分数为为0.03*4=0.12。算例2关键字k1,k2,k3与文档的的相关性性可用TF1*IDF1+TF2*IDF2+TF3*IDF3来表示。。比如文档档1所包含词词汇总量量为1000,k1,k2,k3在文档1中出现的的次数是是100,200,50。包含了了k1,k2,k3的文档总总量分别别是1000,10000,5000。文档的的总量为为10000。TF1=100/1000=0.1;TF2=200/1000=0.2;TF3=50/1000=0.05;IDF1=log(10000/1000)=log(10)=2.3;IDF2=log(10000/100000)=log(1)=0;IDF3=log(10000/5000)=log(2)=0.69这样关键键字k1,k2,k3与文档1的相关性性=0.1*2.3+0.2*0+0.05*0.69=0.2645,其中k1比k3的比重在在文档1要大,k2的比重是是0.文档相似似性计算算根据一个个文档集集合d和和一个项项集合t,可以以将每个个文档表表示为在在t维空空间R中中的一个个文档特特征向量量v。向量v中中第j个个数值就就是相应应文档中中第j个个项的量量度。计算两个个文档相相似性可可以使用用上面的的公式余弦计算算法(cosinemeasure)计算步骤骤(1)使用TF-IDF算法,找找出两篇篇文章的的关键词词;(2)每篇文文章各取取出若干干个关键键词,合合并成一一个集合合,计算算每篇文文章对于于这个集集合中的的词的词词频;(3)生成两两篇文章章各自的的词频向向量;(4)计算两两个向量量的余弦弦相似度度,值越越大就表表示越相相似。文档相似似性计算算示例句子A:我喜欢欢看电视视,不喜喜欢看电电影。句子B:我不喜喜欢看电电视,也也不喜欢欢看电影影。第一步,,分词句子A:我/喜欢/看/电视,不不/喜欢/看/电影。句子B:我/不/喜欢/看/电视,也也/不/喜欢/看/电影。第二步,,列出所所有的词词我,喜欢欢,看,,电视,,电影,,不,也也。第三步,,计算词词频句子A:我1,喜欢2,看2,电视1,电影1,不1,也0。句子B:我1,喜欢2,看2,电视1,电影1,不2,也1。第四步,,写出词词频向量量句子A:[1,2,2,1,1,1,0]句子B:[1,2,2,1,1,2,1]信息检索索信息检索索研究的的是大量量基于文文本的文文档信息息的组织织和检索索,如联联机图书书馆系统统、联机机文档管管理系统统和WEB搜索引擎擎。数据据库系统统关注结结构化数数据段查查询和事事务处理理。信息检索索研究的的典型问问题是根根据用户户查询((描述所所需信息息的关键键词),,在文档档中定位位相关文文档。文本检索索的基本本度量查准率((Precision)是检索索到的文文档中的的相关文文档占全全部检索索到的文文档的百百分比,,它所衡衡量的是是检索系系统的准准确性查全率((Recall)是被检检索出的的文档中中的相关关文档占占全部相相关文档档的百分分比,它它所衡量量的是检检索系统统的全面面性信息检索索的度量量方式{relevant}:与某某查询相相关的文文档的集集合。{retrieved}:系系统检索索到的文文档的集集合。{relevant}∩{retrieved}:既既相关又又被检索索到的实实际文档档的集合合。查准率(precision):既既相关又又被检索索到的实实际文档档与检索索到的文文档的百百分比。。查全率(recall):既既相关又又被检索索到的实实际文档档与查询询相关的的文档的的百分比比。模型质量量的评价价实例{relevant}={A,B,C,D,E,F,G,H,I,J}=10{retrieved}={B,D,F,W,Y}=5{relevant}∩{retrieved}={B,D,F}=3查准率::precision=3/5=60%查全率::recall=3/10=30%B,D,F相关并被检索到的文档所有文档A,C,E,G,H,I,J相关的文档
W,Y被检索到到的文档档文本挖掘掘举例文档向量量化查询:相相关度文档间相相似度((余弦定定理)3.文本本的维度度规约对于任何何一个非非平凡的的文档数数据库,,词的数数目T和和文档数数目D通通常都很很大,如如此高的的维度将将导致低低效的计计算,因因为结果果频度表表大小为为T*D。高维还会会导致非非常稀疏疏的向量量,增加加监测和和探查词词之间联联系的难难度。维度归约约使用数数据编码码或变换换,以便便得到原原数据的的归约或或“压缩缩”表示示。如果果原数据据可以由由压缩数数据重新新构造而而不丢失失任何信信息,则则该数据据归约是是无损的的。如果果我们只只能重新新构造原原数据的的近似表表示,则则该数据据归约是是有损的的。文本挖掘掘方法文本挖掘掘功能层层次关键词相似检索词语关联分析自然语言处理文本聚类文本分类文本挖掘掘功能层层次(1)关关键词检检索关键词建建立倒排排文件索索引,与与传统的的信息检检索使用用的技术术类似。。(2)相相似检索索找到相似似内容的的文本。。(3)词词语关联联分析聚焦在词词语(包包括关键键词)之之间的关关联信息息分析上上。(4)文文本聚类类和文本本分类实现文本本的聚类类和分类类。(5)自自然语言言处理揭示自然然语言处处理技术术的语义义,进行行文本语语义挖掘掘。关联分析析挖掘在文本数数据库中中,每一一文本被被视为一一个事务务,文本本中的关关键词组组可视为为事务中中的一组组事务项项。即文文本数据据库可表表示为::{文本编编号,关关键词词集}文本数据据库中关关键词关关联挖掘掘的问题题就变成成事务数数据库中中事务项项的关联联挖掘。。关联分析析挖掘可可以用于于找出词词或关键键词间的的关联。。关联分析析挖掘输入语义信息,如事件、事实或信息提取发现的实体输入是标记的集合输入是文档中关键词或词的集合基于关键词的方法标记方法信息提取方法关联分析析挖掘关联分析过程:对文本数据进行分析、词根处理、去除停词等预处理,再调用关联挖掘算法基于关键词的关联技术:收集频繁出现的关键词或词汇,找出其关联或相互关系关联挖掘关联挖掘掘有助于于找出符符合关联联,即领领域相关关的术语语或短语语关联分析析挖掘基于关键键字的关关联分析析基于关键键字关联联分析就就是首先先收集频频繁一起起出现的的项或者者关键字字的集合合,然后后发现其其中所存存在的关关联性关联分析析对文本本数据库库进行预预处理,,生成关关键字向向量,根根据关键键字查询询向量与与文档向向量之间间的相关关度比较较结果输输出文本本结果,,然后调调用关联联挖掘算算法文档分类类分析文档分类类分析自动文档档分类是是指利用用计算机机将一篇篇文章自自动地分分派到一一个或多多个预定定义的类类别中文档分类类的关键键问题是是获得一一个分类类模式,,利用此此分类模模式也可可以用于于其他文文档的分分类有了一个个模式之之后,需需要进行行人工标标记和训训练,以以确定这这个模式式的参数数,然后后才能进进行自动动的文档档分类文档分类类分析应用领域域门户网站站(网页页)图书馆((电子资资料)…自动分类类优点::减小人工工分类的的繁杂工工作提高信息息处理的的效率减小人工工分类的的主观性性文档分类类分析步骤定义分类体系系将预先分分类过的的文档作作为训练集从训练集集中得出出分类模型型(需要测测试过程程,不断断细化))用训练获获得出的的分类模模型对其其它文档档加以分分类文档分类类分析文本分类类基本步步骤文档分类类分析文本分类类过程文档分类类分析特征选择
方法贝叶斯分类最近邻分类相似文档具有相似文档向量,将每个文档关联到相应的类标号将文档分类看做计算文档在特定类中的统计分布文档分类支持向量机使用数表示类,构建从词空间到类变量的直接映射函数(在高维空间中运行良好,最小二乘线性回归方法区分能力较强)基于关联的、频繁出现的文本模式集对文档分类基于关联的
分类删除文档档中与与与类标号号统计不不相关的的非特征征词文档聚类类分析文本聚类类是根据据文本数数据的不不同特征征,将其其划分为为不同数数据类的的过程其目的是是要使同同一类别别的文本本间的距距离尽可可能小,,而不同同类别的的文本间间的距离离尽可能能的大文档聚类类分析文档自动动聚类的的步骤(1)获取结结构化的的文本集集(2)执行聚聚类算法法,获得得聚类谱谱系图。。聚类算算法的目目的是获获取能够够反映特特征空间间样本点点之间的的“抱团团”性质质(3)选取合合适的聚聚类IA值。在得得到聚类类谱系图图后,领领域专家家凭借经经验,并并结合具具体的应应用场合合确定阈阈值(4)执行聚聚类算法法,获得得聚类结结果文档聚类类分析混合模型聚类使用潜在语义标引聚类(LSI)光谱聚类对原始数据进行维度归约,运用传统的聚类方法(如k均值,缺点是计算昂贵)对文本数据和先验知识估计模型参数,基于参数推断聚类最小化全局重构误差下,找到原文档空间的最佳子空间近似文档聚类
分析使用保持局部性标引聚类(LPI)发现局部几何结构,具有更强的区分能力文档聚类类分析文档自动动聚类的的类型平面划分分法:对对包含n个样本的的样本集集构造样样本集的的k个划分,,每个划划分表示示一个聚聚簇层次聚类类法:层层次聚类类法对给给定的样样本集进进行层次次分解。。根据层层次分解解方向的的不同可可分为凝凝聚层次次聚类和和分裂层
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 人教版四年级数学下册《从同一位置观察用正方体搭成的3个几何组合体》教学设计
- 2026年学前儿童科学探索兴趣测试
- 2026年环境保护与生态保护知识竞赛试卷
- 2026年管理学原理重点知识点习题集
- 2026年金融法规与政策考点巩固习题
- 2026年部编版五年级科学下册第12单元知识点巩固习题
- 2026年陕西省湘教版初中英语八年级下册听力理解专项训练
- 2026年环境保护与生态恢复知识测试
- 2026年全民科普知识竞赛试卷
- 2026年公务员行测判断推理真题汇编及解析
- 生产副总管理的思路和规划
- 2024年中国装饰公司100强企业排名
- JGJ142-2012 辐射供暖供冷技术规程
- NB-T10935-2022除氧器技术条件
- 烟煤胶质层指数测定仪不确定度评定报告
- 染色定型车间管理制度
- 机械工程材料与热加工课程概论1-6章
- 房屋出售独家委托协议
- 费森尤斯CRRT操作流程1
- 汨罗2022小学教师招聘考试真题及答案解析
- GB/T 41831-2022项目管理专业人员能力评价要求
评论
0/150
提交评论