(计算机应用技术专业论文)基于主题和态度分类的文本过滤系统.pdf_第1页
(计算机应用技术专业论文)基于主题和态度分类的文本过滤系统.pdf_第2页
(计算机应用技术专业论文)基于主题和态度分类的文本过滤系统.pdf_第3页
(计算机应用技术专业论文)基于主题和态度分类的文本过滤系统.pdf_第4页
(计算机应用技术专业论文)基于主题和态度分类的文本过滤系统.pdf_第5页
已阅读5页,还剩46页未读 继续免费阅读

(计算机应用技术专业论文)基于主题和态度分类的文本过滤系统.pdf.pdf 免费下载

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

摘要 摘要 近年来,随着互联网的发展,人们可以获取的信息以指数的速度增长。一方 面,为了便于管理如此庞大的信息,文本分类技术日益引起人们的关注。另一方 面,对于特定的用户而言,所需要的信息往往只占其中极小的一部分,因此从大 量的文本数据流中寻找满足特定用户需求的文本的文本过滤技术显得犹为重要。 本文首先研究了主题文本分类中的各项关键技术,在文本表示方面,采用向 量空间模型来表示文本,以词汇作为向量空间模型的特征项,然后介绍了7 种不 同的特种选择的算法,包括文档频率、互信息量、z :一统计量、词汇的熵、k l 距离、信息增益、优势比,接着介绍了机器学习中比较常见的几种分类算法:中 心向量分类器、k 近邻算法、朴素贝叶斯分类器、a d a b o o s t 算法、支持向量机 算法。在中英文语料上的实验结果表明特征选择算法中,信息增益、z :一统计 量有着相对较好的性能。在2 0 - n e w s g r o u p s 数据集上,采用s v m 算法,选用全 部特征项,0 1 权重,5 - f o i d 交叉验证,宏平均和微平均分别达到8 9 2 和8 9 4 。 其次,在态度文本分类中,我们研究了词的倾向性分析和篇章态度分类。在 中文词的倾向性判断方面,我们提出了将知网的语义相似度和语义相关场计算功 能应用到对于词汇进行语义倾向性判别,最好的性能达到了8 7 的准确率。在 篇章态度分类方面,使用倾向性词表的无监督分类在中文和英文语料上都低于 6 0 的准确率,而采用支持向量机算法的监督学习的方法在中文和英文语料上则 都达到了8 6 5 。 最后,介绍了一个基于主题文本分类和态度文本分类技术的网页过滤系统, 采用中心向量分类模型进行主题判别和使用支持向量机算法进行态度分类,系统 的实验结果表明,该系统的过滤性能和效率都已经满足实际应用的要求。 关键词:文本分类,态度分类,内容过滤,倾向性分析 a b s t r a c t a b s t r a c t w 胁t h ed e v e l o p i n go fi n t e r n e ti nr e c e n ty e a r s t h ei n f o r m a b o nt h a lp e o p l ec a n a c c e s sg r o w se x p o n e n t i a l mt h et e x tc l a s s i f i c a t i o nt e c h n i q u et h a tc a na u t o m a t e l ym a n a g e s u c ht r e m e n d o u si n f o r m a t i o ni sg o t t e nm o r ea n dm o r ea t t e n d t i o nb yr e s e a r c h e r s o nt h e o t h e rh a n d ,o n l yal i n l eb i tr e f o r m a t i o ni sn e e d e dt oas p e c i f i cu s e r , s ot h et e x tf i l t e r i n g t a c h n = q u et or e t n e v es u c hr e l e v a n tt e x t sf r o ml a r g e - s c a l et e x td a t as t e a mb e c o m e sm o r e a n dm o r ei m p o r t a n t f i r s t l y , t h ek e yt e c h n i q u e si nt o p i ct e x tc l a s s i f i c a t i o na r ei n v e s t = g a t e di nt h i st h e s i s f o rt e x tr e p r e s e n t i n g 。v e c t o rs p a c em o d e li su s e d ,w i t ht h ew o r d sa st h ef e a t u r et e r m s t h a ns e v e nd i f f e r e n tf e a t u r es e l e c t i o nm e t h o d sa r ei n t r o d u c e d ,i n c l u d i n gd o c u m e n t f r s q u e n c y ( d f ) ,m u t u a li n f o r m a t i o n ( m i ) ,z 2 s t a t i s b c ,w o r de n t r o p y , k ld i s n t a n c e , i n f o r m a b o ng a i n ( i g ) ,o d d sr a b o ( o r ) a f t e rt h a l s o m ew e l lk n o w nc l a s s l f a t i o na l g o n t r n s s u c ha sc e n t r a lv e c t o rc l a s s i f i e r , kn e a r e s tn e l g h o u r , n a t v eb a y e sc l a s s r f i e r , a d a b o o s t a l g o r i t m ,s u p p o r tv e c t o rm a c h i n e ( s v m ) a r ep r e s e n t e d 1 1 1 ee x p e n m e n tr e s u l ts h o w st h a t i g , z 2 - s t a t i s t i ca r et h eb e s to n e sa m o n gt h es e v e nf e a t u r es e l e c t i o nm e t h o d s a n dt h e m a c r o a v e r a g ea n dm i c r o - a v e r a g ep e r f o r m a n c eo fs v m i nt h e2 0 - n e w s g r o p sd a t as e t 。i s 8 9 2 a n d8 9 4 r e s p e c t i v e l y , w d ht h es e t t i n g st h a tu s i n gt h e5 - f o l dc r o s sv a l i d a t i o n a l l t h ew o r d so c c u r r i n gi nt h ed a t a s e t 。0 1w e i g h t i n g s e c o n d l y , t h ew o r ds e m a n t i co d a n t a t i o na n dt h ep a g es e n b m e n tc l a s s l f i c a t m na r e e x p l o r e di nt h ec h a p t e ro fs e g m e n tt e x tc l a s s = f m a t i o n an e wm e t h o db a s e do nh o w n e ti s p r o p o s e dt oj u d g et h es e m a n t j co r i e n t a t i o no ft h ec h i n e s ew o r d ,a n dt h ea c c u r a c yi su pt o 8 7 w l t hr e s p e c tt op a g es e n t i m e n tc l a s s m c a t i o n t h ea c c u r a c yo fu n s u p e r v i s e dl e a r n i n g u s i n gs e n m a n t i co n e n t a t i o nw o r d sl i s ti sl e s st h a n6 0 b o t hi nc h i n e s ea n de n g l i s hd a t a s e t w h i l et h es u p e r v i s e dl e a m m gu s i n gs v mi su pt o8 6 5 f i n a l l y , aw e b p a g ef i l t e d n gs y s t e mi si n t r o d u c e d c e n t r a lv e c t o rd a s s j f e ri su t d i z e dt o j u s 嘶t h et o p i c ,a n dt h es v mi se x p l o i t e dt od e t e r m i n et h es e n t i m e n to n e n t a t l o ni nt h i s s y s t e m t h ee x p e n m e n tr e s u l td e m o n s t r a t e st h a tb o t ht h ee f f e c t i v e n e s sa n de f f e n c i e n c y o ft h es y s e mq u a l i f yt h er e q u i r e m e n to ft h ea c t u a la p p l i c a t i o n k e yw o r d s :t e x tc i s s s d i c a t m n ,s e n t i m e n tc l a s s i f i c a t i o n 。c o n t e n tf i l t e r i n g 。s e n b m e n t a n a l y s i s 复e t 大学硕 论文 第一章引言 1 1 本文所研究的内容 基于主题和态度分类的文本过滤系统 在当今的社会,信息资源已经成为了人们竞争的重点。有价值的信息已经成 为了一种新的财富,掌握了信息才能掌握未来。如何更好的处理和利用这些信息, 正是自然语言理解领域所研究的一个重要使命。 长期以来,在信息检索科学领域,文本分类和文本过滤都是自然语言处理的 一个重要的应用领域。例如,图书馆的工作人员按照一定的分类体系将各种图书 按照内容分到不同的类别中,或者把网络上的网页分到相应的分类体系中去,如 y a h o od i r e c t o r y 4 0 。人们当时主要采用的人工分类方法,这需要大量工作,周 期长、费用高、效率低,并且要求分类人员具有较多经验和专门知识。这样,在 人工分类文本中存在着大量的问题,主要体现在精确度和时间代价上,因此自动 文本分类技术应运而生。 另一方面,对于特定的用户而言,所需要的信息往往只占其中极小的一部分, 因此从大量的文本数据流中寻找满足特定用户需求的文本的文本过滤技术显得 犹为重要。一个典型的场景是某个信息发送者负责根据读者的阅读习惯向读者发 送信息,信息的提供者是一些信息机构,信息发送者负责把读者不感兴趣的信息 屏蔽而只把读者感兴趣的信息发送给读者。如果读者是一个体育爱好者,那么他 将只看到自己喜欢的体育新闻。现在很多的门户网站都提供了类似的订阅服务。 除了这种按照主题分类之外,在线文档,如网页、新闻组的文章、在线新闻 数据库等等,有着一种另有用的信息:倾向性,即作者对某一个主题表达的自己 的观点。 本文将主要研究文本分类及其在文本过滤中的应用,在主题文本分类方面, 其中涉及的关键技术有在文本表示、特征选择、分类算法。在文本表示方面,介 绍了向量空间模型,然后介绍了7 种不同的特种选择的算法,包括文档频率、互 信息量、z 2 一统计量、词汇的熵、k l 距离、信息增益、优势比,接着介绍了机 器学习中比较常见的几种分类算法:中心向量分类器、k 近邻算法、朴素贝叶斯 分类器、a d a b o o s t 算法、支持向量机算法。 其次,在态度文本分类中,我们研究了词的倾向性分析和篇章态度分类。在 中文词的倾向性判断方面,我们提出了将知网的语义相似度和语义相关场计算功 2 蔓虽大学硕上论文 基于主题和态度分类的文本过滤系统 能应用到对于词汇进行语义倾向性判别。在篇章态度分类方面,讨论了无监督学 习和监督学习的方法。 在文本过滤中,我们将只研究基于内容的文本过滤,并且把文本过滤看成一 个两类( 是否) 的分类问题即和用户主题相关或者不相关,并且介绍了一 个运用主题文本分类和态度文本分技术的实际的网页过滤系统。 1 2 本文所研究问题的意义 随着 _ q t e r o e t 网络在全球的迅速蔓延以及计算机软、硬件技术的飞速发展, 人们利用信息技术生产和搜集数据能力的大幅度提高,大规模的文本库不断涌 现。如何更好的管理这些信息成为一个迫切的问题,这其中一个基本的问题就是 如何把这些信息按照它们的主题分类,因此,文本自动分类技术的研究有着重要 的实际价值。此外,主题文本分类的研究在文本过滤、网页的层次分类、语义消 歧、垃圾邮件过滤等方面有着广泛的应用。 态度文本分类的研究也有着广泛的潜在应用,譬如:跟踪在线讨论的观点, 分析调查问卷和自动聊天系统。对一些公司,推荐系统,编辑网站来说,从人们 的评论中抽取出主观性的观点,或者仅仅是整个评论的一个倾向性,好或者是坏, 非常得有价值。此外,在商业领域中,语义倾向性研究能够为企业进行市场分析、 市场调查、顾客反馈提供更多有价值的信息( 【4 】【1 6 】【1 8 】) ;在管理领域,能够帮 助领导者更快地了解群众对各类政策措施的反馈意见,计算机代替人来完成评估 工作,可以节省大量的人力和物力。 面对汹涌而来的信息,人们没有必要而且也没有足够的时间和精力去阅读所 有的这些信息,越来越多的用户只希望看到自己感兴趣的信息,人工过滤的方法 显然对海量的文档和数据无能为力。这就使人们产生了这样的迫切心情,要求能 借助于某些工具,自动对这些信息进行过滤并自动滤除不需要的信息,从而能直 接获取有价值的情报和知识。 此外功能强大的信息网络的崛起与发展,在给社会生活带来巨大进步的同 时,也带来了一些新的问题。在不同的社会制度、信息环境、文化背景和宗教信 仰的影响下各国用户在这一国际网络空间从事信息发布、传递和使用的过程中, 表现出不同的行为规范和道德准则。因此,我们必需建设有效的信息边界,采取 必要的防护措施,以确保安全。 总之,本文的研究工作有着如下一些应用及意义: 1 ) 提供选择性信息服务的企事业单位可以根据用户的信息需求过滤新闻信 3 复旦大学硕士论文基于主题和态度分类的文本过滤系统 息,并且把用户可能感兴趣的内容发送给用户。 2 ) 在管理领域,主题文本分类系统可自动地确定文档所属的类别。 3 ) 在商业领域,态度文本分类系统能够为企业进行市场分析、市场调查、 顾客反馈提供更多有价值的信息 4 ) 研究与开发具有自主版权的信息过滤系统,对于提高我国的网络和人工 智能的研究和应用水平、保障国家信息安全、促进i n t e r a c t 技术在我国的健康发 展也有着重要的意义。 1 3 本文的贡献 本文首先详尽的研究了主题文本分类中的各项关键技术,实验比较了各种不 同方法的性能,得到了如下一些经验性的结论: ( 1 )对于主题文本分类来说,支持向量机有着相对较好的性能,对于测试 的2 个数据集,通常每类的训练文档达到上百以上时,可以达到8 0 以上的准确率; ( 2 )而且对于支持向量机分类器,采用所有的特征取得了最好的性能,这 说明特征选择算法对s v m 在文本分类中的性能影响不大,并且文本 中出现的词都会对分类有着一定的作用。 ( 3 )特征选择算法中信息增益和z 2 一统计量在特征数量较少( 大约占所 有语料中出现词汇总数1 ) 的时候有着比其它方法更好的性能,最简 单的使用文档频率的方法也有着次优的性能,优势比与文档频率有着 相似的性能,而互信息量、词汇的熵、k l 距离则在特征数量相对少 的情况下性能较差。 希望这些经验性的结论对于指导后续相关的研究有着一定的借鉴意义。 其次,我们提出了将知网的语义相似度和语义相关场计算功能应用到对于中 文词的倾向性判断方面,产生了较好的性能。在篇章态度分类方面,对于使用倾 向性词表的无监督分类做了初步尝试,但准确率不高,需要做进一步的改进工作, 实验给出了使用支持向量机算法的监督学习的方法在中文和英文语料上性能,再 次证明了该方法的有效性。 最后,基于主题文本分类和态度文本分类技术,我们实现了一个网页过滤系 统,用于过滤网络中一些非法信息,该系统经过外单位的评测,结果证明该系统 的过滤性能和效率都已经满足实际应用的要求。 4 复_ e l 大学硕士论文 1 4 本文的组织结构 基于主题和态度分类的文本过滤系统 本文的组织结构如下: 在第二章中,将给出主题文本分类、态度文本分类、文本过滤的定义,简要 的介绍各自的任务、解决该问题所需要的核心技术、以及同行在该方面的研究的 主要方法和进展。 在第三章中,将详细介绍主题文本分类中的具体组成部分和各自方面的主要 方法,其中包括文本表示模型、特种选择和分类算法。最后一节将通过实验比较 了不同分类器和特征选择方法在中英文语料上的性能。 在第四章中,首先介绍了利用h o w n e t 的语义相似度和语义相关场计算功能 对于词汇进行语义倾向性判别,然后介绍了篇章态度分类,其中包括利用倾向性 词的信息所做的无监督态度篇章分类和使用s v m 分类器的监督分类。 在第五章中,将介绍运用主题文本分类和态度文本分类的技术的实际的网页 过滤系统。 最后,总结全文并探讨进步的研究方向。 5 复黾大学硕士论文 基于主题和态度分类的文本过滤系统 第二章问题的定义及相关工作 2 1 主题文本分类 自动文本分类( t e x tc l a s s i f i c a t i o n ) 是指自动的把文档集分到预定义好的类 别中。其可以形式化定义为:寻找一个分类器毒:d x c - 仃,f 来近似未知的目标 函数垂:d x c 一口,f ,这里c h ,q 。| 是一个预定义好的类别的集合,d 是全 体文档( 可能是无限的) 的集合,如果中“,c 1 ) 一r ,那么称d ,为类巳的一个正例, 如果州,q ) - f 那么d ,称为类c l 的一个负例。 在线文档资源的快速增加促使着自动组织和检索在线文档技术的研究,并提 供了文本分类的大量的应用领域。通常的文本分类都是基于文章的主题 ( f 5 】【1 5 】【3 6 d ,也有基于文章类型( 1 3 9 和态度倾向性( 2 1 9 ,我们将在下一节详细介 绍态度文本分类。 几乎所有的最近关于主题文本分类的研究都是基于统计和机器学习的方法, 这些方法按照它们所依赖的模型通常可以分为产生式分类( g e n e r a t i v e ) 或者判别 式分类( d i s c r i m i n a t i v e ) 。产生式分类首先通过从训练样本中估计类条件概率,然 后应用贝叶斯决策规则( 或类似的方法) 来判断测试样本最可能的类别。而判别 式分类则直接从训练样本中学习出在特征空间中的判别函数。 通常的观点,起始于v a p n i k ( 1 3 9 1 ) ,证实判别式更为有效,因为它们直接解 决分类问题本身,而不是象产生式分类方法首先去估计一个更为困难的类条件概 率问题。但是 1 9 l q n 的研究指出,这两种不同的方法的分类性能相对的好坏往往 决定于训练样例的数目。我们将在第三章结合主题文本分类介绍这两种不同种分 类方法的代表性的方法,朴素贝叶斯分类器( n a v i eb a y e sc l a s s i f i e r ) 和支持向量机 ( s u p p o r tv e c t o rm a c h i n e ) 。 无论是判别式分类方法,还是产生式分类方法,其一般的文本分类模型如图 1 所示,由训练模块和分类模块构成。在训练模块,首先通过将训练文本集向量 化,产生特征的集合;特征子集抽取算法从特征的全集中抽取出部分具有代表性 的特征;之后对每篇文档中的特征赋予权重得到文本的向量表示,然后经分类器 学习算法得到相应分类器的参数模型。在分类模块,首先将测试文本用训练模块 抽取出的特征表示,再经分类器判别,得到测试文本所属的类别。 6 复旦大学硕士论文摹于主题和杏彦分类的文本过滤系统 训练模块 图1 文本分类模型 在文本分类中,特征通常选择一些文本中自有的词语来表示。特征选择的动 机通常在于更好的表示源文本中的特有信息。一般的方法都选择单个词语做为特 征项,然后构成特征空间。特征空间往往包含上万个项,因此减低维数可以减低 算法的复杂度而且可以得到更好的性能。f 3 4 1 q ,比较了五种特征选择的标准,实 验结果显示信息增益、z 。检验和文档频率阈值的方法有着较好的性能。而且结 果中还指出对文本分类而言,普通的词汇比出现频率很少的词汇更为有效,这一 点跟信息检索中的结论有所不同。 l e w i s ( 1 4 ) d d 比较了在文本分类中使用一些句法特征( 如词性标注和抽取出 的名词短语) 的性能,实验结果指出这些短语特征由于不可靠的频率分布和增加 了噪声而通常会降低分类性能。 【5 】和 3 6 1 q a 详细比较了不同种分类器在一些通用的文本分类语料集上的性 能。但训练语料数量足够大的时候,分类器之间的性能差别不太大,但当训练语 料数目有限的时候,s v m 取得了最好的效果。 文本分类是一个很有挑战性的任务,通常一个数据集中出现的词语量很大, 训练样例在各个类中有着不均匀的分布,因此如何采用有效的文本表示,如何选 择更好的特征,更准确的学习算法就值得更深入的研究。 2 2 态度文本分类 态度文本分类是指按照文章的倾向性而不是根据主题来对文章进行分析。 w i e b e 和他的同事在自动念度发现做了很多开创性的工作,他们提出了在文章, 句子,和短语不同程度上判别主观性和客观性的方法( 3 1 1 ,1 3 2 1 , 3 3 1 ) 。 h a t z i v a s s i l o g l o u 等( 1 7 1 ,【8 1 ,【9 】) 采用无监督学习的方法来判断形容词的倾向性, 准确率达到9 0 以上。t u r n e y ( 3 0 1 ) 介绍了一种基于词与其它有肯定或否定倾向 7 复旦大学硕士论文 幕于主题和态度分类的文本过滤系统 性词的统计联系来计算词语的倾向性,两种不同的统计方法用来计算这种词与词 之间的联系:p o i n t w i s em u t u a li n f o r m a t i o n ( p m l ) 和l a t e n ts e m a n t i ca n a l y s i s ( l s a ) t u m e y 在【2 9 】中的实验说明有可能仅仅使用很少一部分语义倾向性词( 即, “e x c e l l e n t a n d “p o o e 9 来标准别的与它们共同出现的别的短语,然后通过使用这 些短语可以自动的判别有肯定或否定倾向性的电影和产品评论,不同的语料,准 确度在6 6 - 8 4 。p a n g 等( 【2 1 】) 采用了一种非常直接的方法:使用监督学习的 方法,使用词语和m g r a m s 作为特征来判断文章的态度倾向性,精确度达到8 3 。 p a n g 等( 【2 2 】) 提出一种新颖的机器学习方法,采用文本分类的方法来判断文章的 主观部分,这些主观部分是通过利用不同句子上下文的限制,使用图的最小割算 法把它们从原文中分离出来。 j e o n g h e ey i 1 1 提出了s e n t i m e n ta n a l y z e r ( s a ) 来发现所有的关于给定主题 的评论内容,然后使用两个语言学资源:倾向性词词典和倾向性模式库来判别这 些内容的态度倾向性。 2 3 文本过滤 文本过滤指的是从大量的文本数据流中寻找满足特定用户需求的文本的过 程。文本过滤随着计算机应用的发展而从设想成为现实,并不断地完善自身的功 能,经历了很长的发展时期,并在因特网日益普及的今天,在信息发掘方面发挥 着越来越大的作用。 文本过滤( 【2 0 】) 大致可以分为两类:基于内容的过滤( c o m e m b a s e df i l t e r i n g ) 和合作过滤( c o l l a b o r a t i v ef i l t e r i n g ) 。合作过滤又称社会过滤( s o c i a lf i l t e r i n g ) 。在 基于内容的过滤模式中,每个用户假定是相互独立操作的。因此,文本表示仅仅 依赖于从文本内容所获取的信息。合作过滤的出发点在于任何人的兴趣不是孤立 的,应处于某个群体当中。在日常生活中,人们接受的信息往往是周围人推荐的 结果。因此,根据相同或者相近兴趣的用户对相应文本做出的评注,向其他用户 进行推荐。由于不依赖于内容,这种模式不仅适用于文本格式,也可以广泛应用 于非文本介质的电子媒介,如m p 3 、图像、v i d e o 等。 本文的工作集中在基于内容的文本过滤上,文本过滤和文本分类有很大的相 似之处。文本过滤本质上来说是判断文本是否符合用户需求,因此可以把文本过 滤看成一个两类( 是否) 的分类问题即和用户主题相关或者不相关。 8 复旦大学硕士论文 2 4 评价方法 基于主题和态度分类的文本过滤系统 下面介绍文本分类和文本过滤中常用的评价性能的指标。对于每一个类说, 常用的有下面4 个基本量: a 一属于该类别,而且正确的分到该类别的文章数目 b 一不属于该类别,但是被错误的分到该类别的文章数目 c 一属于该类别,但是没有被正确的分到该类别的文章数目 d 一不属于该类别,而且正确的没有被分到该类别的文章数目 利用这4 个基本量,我们可以定义如下的评价性能的指标: 精确率o r “缸户! 一 召回率o w c f f ) = 冬 正确率扣c “m 秽产羔4 - 4 -口+ dcd 错误率( c r r n r ) 5 :i i 等詈万口+ d + c + 4 雅蛙! 迦 ( 2 1 ) ( 2 2 ) ( 2 3 ) ( 2 4 ) ( 2 5 ) 其中p 为精确率,r 为召回率。口为控制精确率和召回率权重关系的参数。 常用的f 1 值即是一。1 的时候的f 值。 对于评价涉及到多个类别的系统的整体性能时,有宏平均( m a c r o - a v e r a g i n g ) 和微平均( m i c r o - a v e r a g i n g ) 两个常用的评价性能的指标。宏平均是指首先对每个 类计算出相应的性能指标,然后对所有类的值再做算术平均。微平均是指对所有 类的样本一起计算上述的a , b ,c ,d 的值,然后再用这些值计算相应的性能指标。 因此,宏平均是对每个类有相同的权重,而微平均则对每个样本有相同的权重。 9 复旦大学硕士论文 基于主题和态度分类的文本过滤系统 第三章主题文本分类 在本章中,第1 节首先介绍文本表示模型,其中包括空间向量模型的简介, 第2 小节介绍特征项的选择,特征项权重的计算;第3 节介绍分类算法,其中包 括最小距离分类器,k n n 算法,n a i v eb a y e s 分类器,s v m 算法。最后一节将 通过实验说明不同分类器和特征选择方法在中英文语料上的性能。 3 1 文本的表示模型 文本的表示模型是大规模文本处理非常基本的因素,确定了文本模型也就基 本确定了文本的表示。在向量空间模型( v e c t o r s p a c e m o d e l ) 中,类别和文档的 内容被形式化为多维空间中的向量。 3 1 1 向量空间模型简介 计算机并不具有人的智能,人在阅读文章后,根据自身的理解能力可以产生 对文章内容的模糊认识,而计算机并不能轻易地“读懂”文章。因此文本自动过 滤遇到的基本问题是如何对文本按照计算机可以“理解”的方式进行有效的表示, 从而在这个表示的基础上进行信息过滤。当前文本分类中主要应用的模型是文本 的向量空问模型( v e c t o rs p a c em o d e l ,v s m ) 。 向量空间模型是由s a l t o n 等人于上世纪6 0 年代末提出,并成功地应用于著 名的s m a r t ( s y s t e mf o rt h em a n i p u l a t i o na n d r e t r i e v a lo f t e x t ) 系统。该模型及 其相关的技术,包括项的选择、加权策略,以及采用相关反馈进行查词优化等技 术,在文本过滤、自动索引、信息检索( 【2 3 】【2 4 】) 等许多领域得到了广泛的应用。 v s m 已成为最简便高效的文本表示模型之一。 文档( d o c u m e n t )泛指一般的文本或文本中的片断( 段落、旬群或句子) , 一般指一篇文章。尽管文档可以是多媒体对象,但在下面的讨论中我们只认为是 文本对象,并且对文本与文档不加以区别。 项( t e r m )文档的内容特征常常用它所含有的基本语言单位( 字、词、词 组或短语等) 来表示,这些基本的语言单位统称为项,即文档可以用项集( t e r m l i s t ) 表示为d ( t l ,t 2 ,t n ) ,其中t t 是项,1 k n 。项t k 被赋予一定的 权重w k ,表示它们在文档d 中的重要程度,即:d d ( t 1 ,w l ;t 2 ,w e ; , w n ) ,简记为d = d ( w 1 ,w 2 ,w 。) 。这时我们说项t k 的权重为w k ,1 k p ( c ,i d ) ,i - l ,z ,m ,j 一1 , 2 ,m ,j f ,则有d c i ( 3 1 5 ) 式( 3 1 4 ) 是最大后验概率判决准则,将式( 3 1 4 ) 代入式( 3 1 5 ) ,则有: 若p qi c ,) p ( c 。) ,p ( di c i ) p ( c ,) ,l l 2 ,m ,- l ,j - l 2 ,m ,则d c ,0 1 6 ) 这就是常用到的b a y e s 分类判决准则。从理论上来说,b a y e s 分类器具有最 优的性能,即所实现的分类错误率或风险在所有的分类器中是最小的,因此该方 法常常被用来用为衡量其它分类器设计方法优劣的标准。 在n b 中假设给定一个类后,文本的各个词的条件概率是相互独立的,即设 有训练样本文本d ( w l ,m ,) ,w t 是文档d 中出现的单词,则有: p ( di q ) - np ( w ji c , ) ( 3 1 7 ) 存在着两种常用的n b 模型,m u l t i - v a r i a t eb e r n o u l l i 模型表示文档成一个每 维是一个0 1 值的向量,二值表示该维是否出现在文档中;对应的m u l t i n o m i a i 模 1 7 复且大学硕十论文基于主题和态度分类的文本过滤系统 型考虑了项的频率,把文档表示成一个权重向量,【1 7 6 p 详细讨论了这两种模型。 3 3 4a d a b o o s t 方法 a d a b o o s t 方法【6 】是k c a m s 和v a l i a n t 提出的b o o s t i n g 中最常用的一种算法。 b o o s t i n g 方法的一个主要思想是将很多性能相对较差弱规则( 特征) 结合成一个 性能较高的规则。所谓弱规则是指能够至少比一个随机猜测略好的把测试数据分 类的指示函数。b o o s t i n g 算法在机器学习的很多实践中都得到了很好的应用。 a d a b o o s t 中的前缀a d a 是“a d a p t i v e ”的缩写。a d a b o o s t 是用一种贪婪的优 化步骤最小化某个泛函,而这个泛函的最小点定义了l o g i s t i c 回归。r o b e r t 将 a d a b o o s t 应用到文本分类【2 8 】和过滤【2 7 】领域并显示了a d a b o o s t 方法的有效性。 文本过滤中a d a b o o s t 方法的描述如下: 鳓久, n 镐文档及其标号( d 时1 ) ( d z y z ) , 继时n ) y i e f - j , 1 ) 。 设t 为迭代次数 初始化:d l ( i ) = 1 n 对s 扶1 蓟t ,傲: 1 诵帛w e a k l e a r n 得笺一个弱规鄹h s 2 i r i s h s 的错误率:e | - d | l 1 6 晦h 3 接咿;l n ( 半) 4 ,修改: d j 。( f ) d s ( i ) e x p ( - a , y , 一h , ( d , ) ) 盟p 如黝,似。) 。) , z , ie 如黝,p 。) ,y z s 为| 趋一化因子 输出; m “) 一s t g n ( 善,p ) ) _ a , h ( 3 1 8 ) ( 3 1 9 ) 0 2 0 ) ( 3 2 1 ) 算法开始时,输入原始训练集,带有原始分布,在没有先验知识的情况下, 初始的分布应为等概率分布,也就是训练集如果有n 个样本,每个样本的分布 概率为1 n ,在算法每次叠代步骤中,获得一个弱规则,弱规则由一个称为“弱 规则学习”的算法获得。在算法的执行过程中,对不同的训练文档赋予不同的权 1 8 复旦大学硕士论文基于主题和态度分类的文本过滤系统 重( d j ) ,难以用单个弱规则进行正确分类的文档被赋予较高的权重;反之, 则赋予较低的权重。“弱规则学习”算法利用这些权重每次选择一个具有最小分 类错误的弱规则。同时根据分类错误给该规则赋予不同的权重( a 。) 。最后,将 这些弱规则进行加权求和得到最终的规则。a d a b o o s t 的叠代过程就是沿着损失 函数的负梯度方向进行最优化的过程。通过调整样本的分布和选择弱学习规则的 权重来使损失函数以最快速度下降。 3 3 5 s v m 算法 支持向量机方法是建立在统计学习理论的v c 维理论和结构风险最小原理 基础上的,根据有限的样本信息在模型的复杂性( 即对特定训练样本的学习精度, a c c u r a c y ) 和学习能力( 即无错误地识别任意样本的能力) 之间寻求最佳折衷,以期 获得最好的推广能力( g e n e r a l i z a t i o n a b i l i t y ) 。 s v m 是从线性可分情况下的最优分类面发展而来的,基本思想可用图3 1 的两维情况说明。 圈3 l 最优分类面 图中,实心点和空心点代表两类样本,h 为分类线,h 1 、h 2 分别为过各类中 离分类线最近的样本且平行于分类线的直线,它们之间的距离叫做分类间隔 ( m a r g i n ) 。所谓最优分类线就是要求分类线不但能将两类正确分开( 训练错误 率为0 ) ,而且使分类间隔最大。分类线方程为w x + b - 0 在样本线性可分的情况下,最大m a r g i n 的分类面等价于在权重向量的一些线 性条件下最小化权重向量的l 2 范式: l, “彳“ ( 3 2 2 ) s u b j e c tt o :y l ( w x + b j 1 ,v i 在样本线性不可分的情况下,通过引入松弛项优化问题转变为: 1 9 复旦大学硕十论文基于主题和态度分类的文本过滤系统 m 寺w7 w + c “ ( 3 2 3 ) s u b j e c t t o : t 0 , v i y i 【w x 。+ b ) 2 1 一岛,v i 这里c 表示损失系数,松弛项袅衡量样本点k ,y - j 被错误分在m a f g i n 另一 边的距离 这个优化问题的对偶形式可转化为 一乙q 弓u 叩讲,h ) ( 3 砷 0 口l c , s u b i c c t o y l 。o 对偶问题在理论和实际中都很有意义 决策的超平面可以写成: ,仁i s g 。【善n q 扛+ 6 】( 3 2 5 ) 从k a r u s h k u h n - t u c k e r ( k k t ) 条件,我们知道只有那些l a g r a n g i a n 系数b - ) 不为0 的样本点对最后的”。2 一一a y t x t 起作用。这些点就称之为“支持向量”。 在 1 2 1 和我们的文本分类实验中,线形核函数取得较好的效果,因此这里我 们不介绍s v m 中关于核函数( k e r n e l ) 的部分,可参见【3 9 】。 3 4 实验 3 4 1 英文语料上的实验 英文语料,我们采用2 0n e w s g r o u p s 数据集【4 2 】中2 0 n e w s 1 8 8 2 8 版本,总共 1 8 8 2 8 篇文档,基本均匀分布在2 0 个类中。其中有些类非常的相关,如 e o m p s y s i b m p c h a r d w a r e c o m p s y s m a c h a r d w a r e ,有些则非常不相关,如 m i s e f o r s a l e m e r e l i g i o n c h r i s t i a n 。错误l 未找到引用源是2 0 个类名字的列表, 一定程度上按照各个类的相关程度分成6 个部分。该数据集是机器学习尤其是文 本分类和文本聚类中常用的一个数据集。 我们首先比较了不同分类器性能在该数据集上的,如表2 所示,所采用的 参数如下:采用5 n o d 交叉验证,朴素贝叶斯使用m u i t i n o m i a l 模型,特征选择 采用c h i 方法,取1 0 0 0 0 个特征。 2 0 复目大学硕士论文基于主题和奋度分类的文本过滤系统 蠹= - | 1_,_-v,。 l t a l k p o li t i c s m i s c l t a l k p o li t i c s g u n s i t a l k p o l i t i c s m i d e a s t s c i c r y p t s c i e l e c t r o n i c s l s c i m e d l s c i s p a c e i t a l k r e l i g i o n m i s t l a l t a t h e i s m l s o c r e l i g i o n c h r i s t i a n 表2 不同分类器性能在2 0 - n e w s g r o u p s 数据集上的性能 分类器中心向量法朴素贝叶斯s v m l 平均准确卒0 7 8 3o 8 1 60 8 9 4 可以看出s v m 取得了最好的性能,这与其他研究人员的结论取得一致,因 此下面我们的实验都使用s v m 分类器。 不。 下面我们比较了不同特征选择方法和特征数量对性能的影响,如图3 2 7 所 图3 2 不同特征选择算法随特征数目宏平均f 1 值变化情况 一 一一 l l a y s b e e e k 一 1 s c c a 0 一 y b h c 一 s r t t o o r r t t o o u o p p a m s s 一 一 c c c c e e e e r r r r e c r s a 一 1 w e 一 堋m 盯 一 s a w w h d o r 一 耐h; 一s 1 一c w m c s 一1一b a w h s 1 m o p m d a s s n r s y y 1 一g o s s 一 一p p p p p 一锄伽伽 一c c c c c 复日大学硕士论文 基于主题和态度分类的文本过滤系统 从图3 2 中可以看出信息增益( i g ) 和z 2 一统计量( c h r ) 在特征数量较少( 1 0 0 0 ) 的时候有着更好的性能,当特征数量达到1 0 0 0 0 的时候,文档频率( d f ) 、z 2 一 统计量、信息增益、优势比( o d e sr a t i o ) 有着相似的性能,而互信息量( m i ) 、词汇 的熵( e n t r o p y ) 、k l 距离( k l d ) 则在特征数量相对少的情况下性能较差。 另外,s v m 在使用全部特征的时候有着最好的性能,这说明特征选择算法 对s v m 在文本分类中的性能影响不大,也说明了基本上所有的特征都会对分类 有着作用。 平均准确率随训练样例数量的变化如图3 3 所示 图3 3 平均准确率随训练样本变化曲线 从图3 3 中可以看出,s v m 在训练样例大约在1 0 0 2 0 0 之间的情况下,能 取得平均准确率8 0 以上,但训练样例到1 0 0 0 左右的时候,可以达到9 0 。 3 4 2 中文语料上的实验 中文语料缺泛一个相对通过的测试语料集,这里采用我们从互连网上自己收 集的一个小型的数据集,共6 0 0 篇文章,分为6 类:产品信息、互联网、人物及 专访、数字生活、信息安全、业界动态,每类1 0 0 篇文档。 我们使用s v m 算法,5 f o l d 交叉验证,比较不同特征选择方法的性能如图 3 4 和图3 5 所示 从图3 4 和3 5 可以看出信息增益、z 2 一统计量在特征数量( 1 0 0 0

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论