已阅读5页,还剩61页未读, 继续免费阅读
(计算机应用技术专业论文)网络评论观点的倾向性分析.pdf.pdf 免费下载
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
浙江工业大学硕士学位论文 网络评论观点的倾向性分析 摘要 网络已被公认为是继报纸、广播、电视之后的“第四媒体”,成为反映人们情感的主 要载体之一。用户在网络上发表自己对于某种产品的评价,对于厂家和潜在购买者来说, 都是很有研究价值的。厂家希望从中了解到自己的产品性能评价,也掌握竞争对手的产品 性能;潜在购买者希望从别人的评价中获得参考和建议。但是w e b 上的信息是海量的,仅 依靠人工进行网页浏览、观点分析将是一项费时而又低效的工作。因此,观点抽取技术具 有非常大的研究价值。 语义极性分析和观点抽取是指利用计算机技术自动分析句子或文档,从中提取出用户 感兴趣的主题或特征,并分析其语义极性倾向( 褒义、贬义或中性) 和强度。传统的信息抽 取和信息检索研究的重点是针对客观表达的事实信息,不适用于网络评论观点抽取。观点 是主观性的,这需要能够自动抽取主观性观点的技术,从用户评论中自动抽取出产品特征 的极性倾向。 目前,许多研究机构已经运用自然语言处理技术对网络评论进行观点抽取,取得了一 定的成就。本文尝试利用自然语言处理方法,对中文句子的语义极性倾向进行进一步研究, 提出了一些看法,并对一些算法作了改进。 本文根据一些词语的上下文极性的特征,分析名词的特点,通过给这些名词赋予极性 的方法,解决动态极性问题;在观点抽取方面,为了较好的处理主题词和极性成分的匹配 问题,判断句子中每个主题的极性倾向,本文吸取语义块和依存关系的思想,提出了极性 收缩传递算法,最终确立主题观点。并对感叹旬和问旬进行研究,取得了一定的成果。最 后,本文通过测试,将自动抽取的观点与手工标注结果进行比较,得出召回率和准确率, 并和其它算法结果数据比较,证明了极性收缩传递算法的有效性。 本文解决了一些其他研究者未解决的问题,提出了极性收缩传递算法,但是该算法对 于其它的一些特殊句型无法得出正确的结果,有待进一步的研究。 关键词:网络评论、极性词、观点抽取、极性收缩传递算法 浙江工业大学硕士学位论文 t h es e m a n t i co r i e n t a t i o na n a l v s i so ft h ew e br e v i 毛岁sr ln es e m a n t l c0 r l e n t a t l o na n a l v s l s0 lt n ew e dr e v l 跚r7 s 0 p l n l o n a bs t r a c t t h en e t w o r kh a sa l r e a d yb e e nr e c o g n i z e da sm e4 mm e d i af o l l o w i n gn e w s p a p e r ,b r o a d c a s t a n dt v ,w h i c hb e c o m e so n eo ft 1 1 em a i nc a r r i e r st or e n e c tp e o p l e se m o t i o n u s e r si s s u e 缸l e i r o w no p i l l i o n so nac e n a i np r o m l c ti n l en e t w o r k ni sw o m lc o n s i d e r i n gf o rp r o d u c e r sa l l d p o t e n t i a lb u y e r s t h ep r o d u c e r sh o p et ok n o wp r o p e r t i e so ft h e i ro w np r o d u c t ,a r l da l s ok n o wt l i e c o m p e t i t o r s p r o p e r t i e so fp r o d u c t t h ep o t e n t i a lb u y e r sh o p et oh a v et h es u g g e s t i o n sf 砧m 础e r s 印p r a i s a l b u ti n f o n n a t i o no fw e b i st o om u c h o n l yr e l yo n 吼i f i c i a lt ob r o w s ew e b p a g e t h r o u g ha n da n a l y z eo p i n i o n si st ob eat i m e - c o n s 眦n i n gb u tl e s se f ! e e c t i v ew o r k s o ,i ti sv a l l b l e t or e s e a r c ht h et e c h n o l o g ) ro fo p i n i o nm i n i n g s e m a n t i cp 0 1 a r i t ya n a l y s i sa l l do p i n i o nm i n i n gi sr e f e rt ou t i l i z i n gt h ec o m p u t e rt e c h n o l o 移 t oa n a l y z es e n t e n c eo rf l l ea u t o m a t i c a l l y ,a r l de x t r a c tt h et h e m eo rc h a r a c t e r i s t i ct h a tu s e r sa r e i n t e r e s t e di n ,a i l da 芏l a l y z ei t ss e m a n t i cp 0 1 a r i t ) ,o r i e n t a t i o n ( p o s i t i v e ,n e g a t i v eo rn e u t r a l ) a n d i n t e n s i t y t r a d i t i o n a l i n f o 肌a t i o nm i n i n ga 1 1 di n f o 肌a t i o nr e t r i e v a ls t u d ya r ef o c u so nt 1 1 e f a c t i n f o n n a t i o n 也a ti se x p r e s s e do b j e c t i v e l y ,w h j c hi sn o ts u i t a b l ef o r 也en e t w o r kr e v i e w so p i n i o n m i l l i n g t h eo p i l l i o ni ss u b j e c t i v i t y ,i tn e e d st h et e c l m 0 1 0 9 yo fm i n i n go p i n i o na u t o m a t i c a l l y , f i n do u tt 1 1 es e m a l l t i cp o l 撕t yo r i e n t a t i o no ft h ep r o d u c t s c h a r a c t e r i s t i ca u t o m a t i c a l bi nu s e f s r e v i e w s a tp r e s e n t ,a1 0 to fr e s e a r c hi i l s t i t u t i o n sh a v ea l r e a d yu s e dt h et e c h n 0 1 0 9 yo f1 1 1 en 釉a l l a n g u a g ep r o c e s s i n g t od dn e t w o r kr e v i e w so p i n i o nm i n i n g , w h i c hh a sm a d ec e i r t 咖 a c h i e v e m e n t 。t h i st e x tt r i e st ou t i l i z en a :t u r a ll a i l g u a g ep o c e s s i n gm e t h o d ,c o n t i n u et od of u n h e r r e s e a r c ht 0t h es e m a n t i cp o l a r i t yo r i e n t a t i o no fc h i n e s es e n t e n c e t h i st e x th a sm a d es o m e s u g g e s t i o n sa n ds o m ei m p r o v e m e n to fa l g o r i t h m s a c c o r d i n gt 0t 1 1 ec h a r a c t e r i s t i co ft h ec o n t e x tp 0 1 撕t ya j l ds o m en o u n ,t h i st e x ts 0 1 v e st h e 浙江工业大学硕士学位论文 d y n 鲫正cp o l 疵yp f o b l e m 也r o u 出也em e t l l o do fg i v i n gp o l a r i 够f o r 也e s en o u n s c o n s i d e r i n gt b e 硒p e c to fo p i m o nm i n i n g ,i i lo r d e rt os o l v et l l er e l a t i o n s l l i po f 廿l em e m ew o r da n dp o l a d 哆w e l l a n de s t i m a t et l l es e m a i l t i c 耐e n t a t i o no fe a c ht l l e m ei i ls e m e n c e s ,t 1 1 i st e x td r a w sn l es e m 删c m o d e la 1 1 dd e p e n d e n c ya n dm a k e san e wa l g o r i 也mw k c hi sn a m e dp 0 1 a r i t yc o n s t r i c t i o n 锄d p a s s i n ga l g o r i t l l m ,e s t a b l i s h e s 1 em e m eo p i i l i o nf i n a l l y t 1 1 i st e x tc a 仃i e so nr e s e a r c ht ot h e e x c l 锄a t o 巧s e n t e n c e sa i l dq u e s t i o ns e n t e n c e s 、) ,h i c hm a k e sc e r t a i na c h i e v e m e n t f i n a l l y ,廿l i s t e x tc o m p a r e s 廿l er e s u ho fo p i n i o nm i n i n ga u t o m a t i c a l l ya n dm ea r t i 矗c i a lr e s u hi i l 也e e x p e r i m e n t ;o b t a i nt h er e c a l l i n gr a t ea n da c c u r a c yr a t e t l l r o u 曲t l l er e s u l to fc o m p “n g 晰m 舭 d a t ao fo m e ra l g o r i t h m s ,i tp r o v e st 1 1 ev a l i d i t ) ,o ft h ep o l 撕t ) rc o n s t r i c t i o na n d p a s s i n ga l g o r i t h m t 嫩st e x tt 粥s o l v e ds o m ep r o b l e mm a to t h e rr e s e a r c h e r sh a v en o tr e s 0 1 v e d ,a i l dm a k e s 雠 p o l a r i t ) ,c o n g t r i c t i o n 锄dp a s s i n ga l g o r i n h n b u tt h i sa l g o r i t i su 1 1 a b l et oo b t a i nt h ec o r r e c t r e s u ht os o m eo m e rs p e c i a ls e m e n c ep a :t t e m s i tn e e d s 如r t h e rr e s e 卸c h k e yw o r d s :w e br e v i e w ,p o l a r i t ) r 、 ,o r d ,o p i n i o nm i n i n g ,p o l a r i 锣c o n s t r i c t i o na 1 1 d p a s s i n ga l g o r i t l l m 浙江工业大学 学位论文原创性声明 本人郑重声明:所提交的学位论文是本人在导师的指导下,独立进行研究工作 所取得的研究成果。除文中已经加以标注引用的内容外,本论文不包含其他个人或 集体已经发表或撰写过的研究成果,也不含为获得浙江工业大学或其它教育机构的 学位证书而使用过的材料。对本文的研究作出重要贡献的个人和集体,均已在文中 以明确方式标明。本人承担本声明的法律责任。 作者签名:磊戈 日期:矽驴鬈年i7 月f 日 学位论文版权使用授权书 本学位论文作者完全了解学校有关保留、使用学位论文的规定,同意学校保留 并向国家有关部门或机构送交论文的复印件和电子版,允许论文被查阅和借阅。本 人授权浙江工业大学可以将本学位论文的全部或部分内容编入有关数据库进行检 索,可以采用影印、缩印或扫描等复制手段保存和汇编本学位论文。 本学位论文属于 1 、保密口,在年解密后适用本授权书。 2 、不保密研 ( 请在以上相应方框内打“”) 作者签名:磊莓女 导师签名:维砖 日期:矽瞻年f 月f日 日期:矽舔年 月7 日 浙江工业大学硕士学位论文 1 1 研究背景 第1 章绪论 随着互联网络在全球范围内的飞速发展,网络已被公认为是继报纸、广播、电视之后 的“第四媒体 ,成为反映人们情感的主要载体之一。网络环境下的评论信息的主要来源 有新闻评论、b b s 、聊天室( c h a tr 0 0 m ) 、博客( b l o g ) 、维基( w i ) 、聚合新闻( r s s ) 等。 网络表达快捷、信息多元、方式互动,具备传统媒体无法比拟的多种优势,舆论热点焦点层 出不穷。这些网上评论为市场调查研究提供了充足且宝贵的信息资源。商家或厂家可以提 取大众对某一问题的看法或舆论信息,及时获取消费者的反馈意见,挖掘潜在消费者。监 督部门可以通过分析这些信息,及时发现有损消费者权益的产品。但是,网上评论数以万 计,仅依靠人工进行网页浏览、评论搜集、观点分析,这是不可行的。主要原因有如下两 点:一是网络信息是海量的,以人工方式去浏览分析,工作效率低下;二是有效评论抽取 困难,由于篇幅较长的评论中,也许只有几句话是用户感兴趣的主观评论。三是评价标准 不一致,人们的评价尺度容易弹性浮动,从而影响最终的评价结果。 国内这几年也开始在这方面进行研究,与单纯的事实内容相比,从文本中提取出带有 人的主观意识或感情色彩的内容比较复杂,因为并不是所有的信息内容都明确地表明正面 态度或反面态度。因此,需要使用统计和自然语言处理技术从网上收集的信息中抽取人们 的观点倾向。目前语义极性分析和观点抽取的研究已经成为自然语言处理的热点,该领域 分为词语的极性倾向和观点抽取两个相关联的内容。语义极性分析方面的工作已经很多, 比如,获取单个词的语义极性倾向,将主观句子和客观句子相分离,计算整篇文章或段落 的极性倾向等。但是,观点抽取方面的研究才刚开始,许多地方需要进一步完善,观点抽 取还在继续探索。 1 2 选题意义 随着互联网络的普及,我国互联网无论从用户规模,还是业务应用、技术实现等方面 一1 一 浙江工业大学硕士学位论文 都发生了巨大变化,c n n i c 第十九次中国互联网发展报告数据显示,截止到2 0 0 6 年底中 国互联网用户数己达到1 3 7 亿户,上网计算机数量为5 9 4 0 万台,网站数目达到7 8 8 万 个。作为一块正在加速膨胀的思想阵地,互联网已演化成一个虚拟社会,加上其本身的虚 拟性、隐蔽性、发散性、渗透性和随意性等特点,越来越多的人愿意通过它来表达自身真 实的想法。随着网络舆论成为社会舆论的重要表现形式,网络舆论也逐渐对有关部门的决 策产生了影响。 虽然到目前为止,在语义极性分析和观点抽取的研究领域,主要的研究成果依然集中 在英文语种。国外的成果不可能直接拿来用,关键是要学习他们的方法。随着近几年来对 汉语词语的研究,汉语语义极性分析研究有了一定成果的。国内前几年的研究范围,主要 集中在新闻报道等严格规范的语料。新闻报道等语料句法规范,主谓宾成分齐全,讨论的 主题比较集中,使用统计方法就能达到比较好的效果。但是,为了分析网络舆论观点,全 面反映广大人民的观点,就需要对舆论观点进行抽取,舆论观点反映大众问题,包括产品 的质量、价格、售后服务,商家和消费者可以一目了然地了解到产品的优缺点,具有很强 实际应用价值。因此本文研究的对象是中文网络自由评论语句。 观点抽取技术大多采用的也是统计学方法,统计学方法虽然对结构简单的句子可以取 得较好的结果,但是,对于结构较复杂的语句,统计方法都具有很大的不确定性,不能取 得理想的效果。目前,许多研究机构已经运用自然语言处理技术对网络评论进行观点抽取, 取得了一定的成就。但也存在着不足,如:正确分析名词和修饰词之间的关系;对于特定 语句,如反问句也没有进行深入的研究。 本文正是针对统计学方法和目前研究的不足,利用自然语言处理技术进一步对中文网 络自由评论句子观点抽取进行研究。 1 3 本文的主要工作 在研究了英文语种极性词抽取基础上,根据中文本身所拥有的特点。针对中文网络评 论的句子,研究极性词的上下文极性,并且尝试着运用自然语言处理技术,解决修饰匹配 问题,并进行观点抽取。主要工作和创新点如下: 1 利用h o w n e t 知识资料,将现有的极性词语进行极性及强度的标注,为极性词的检 索提供依据,也为新词语的极性判断提供依据,并建立新的词库,进一步提高极性词的判 断的准确率。 一 一 浙江工业大学硕士学位论文 2 。经过对词语上下文的分析,发现动态极性词产生动态极性的原因,将被修饰的名词 挑选出来,分析它们与一般名词不同的地方。提出将动态极性解决方法,将部分名词也标 注极性。根据动态极性词的极性与名词的极性,来确定短语的极性强度。 3 现有的观点抽取和极性分析方法的使用范围比较小,对于网络评论这种复杂的环境 不能得到较好的结果。因此,本文提出了极性收缩传递算法,选择修饰关系对,进行极性 的传递计算,并逐步简化句子成分。在一定程度上,提高了观点抽取的可信度和正确性。 4 在极性收缩传递算法的基础上,进一步分析感叹句和反问句的观点抽取情况,提高 特殊句型的观点强度和权值的准确率。 5 将观点抽取结果进行汇总,以图形加数据的方式显示评论分数。还增加同类产品的 对比图显示,展现给用户更佳的效果。 1 4 论文的组织结构 第一章,首先介绍了现在面临的实际情况和现有技术的研究成果和不足之处,根据现 有的环境情况,本文从中受到的有益启发,制定主要的工作,运用自然语言处理技术以完 成中文网络评论语句的观点抽取为目标 第二章,给出了语义极性分析和观点抽取的概念,包括极性词的含义、极性的判断方 法以及极性词判断方法所存在的问题。对几种常见的观点抽取算法进行介绍和有缺点的分 析。 第三章,详细介绍了基于h o w n e t 的极性词典的构造经过,并对极性词进行极性强 度的初始化,介绍了混合的极性词判断算法,最后分析了上下文极性的三种情况。 第四章,介绍上文极性的定义以及现有的算法,根据现有算法的特点设计新的方法解 决上下文极性抽取和动态极性的抽取,而且部分名词有了极性。 第五章,介绍了观点的定义和当今观点抽取的难点,自行设计了新的观点抽取方法。 还对特殊的感叹句和反问句进行了分析及计算。 第六章,选取实验语料,根据现有的极性词库,进行观点自动抽取,最后与人工的结 果进行比较,以检验算法的效果。用实验证明了本文算法的合理性和有效性。 第七章,本文最后对研究成果进行总结,指出研究中仍然没有解决的问题,并预测该 研究将来的重点和方向。 浙江工业大学硕士学位论文 2 1分词 第2 章语义极性分析和观点抽取 在汉语中,词是最小的能够独立活动的有意义的语言成分。分词和词形标注是文本处 理的基础和关键,也是一项比较繁杂的任务。在中文文本中,词与词之间却没有明确的分 隔标记,是连续的汉字串,因而汉语分词( 自动识别词边界,将汉字串切分为正确的词串) 是中文信息处理的首要问题。 目前,常用的分词算法一般分为以下三类: ( 1 ) 机械分词 机械分词指的是依据词典,按照一定的策略将汉字串与词典中的词逐一匹配,如果匹 配成功,就加以切分。该方法简单,易于实现,但是对于歧义切分和未登陆词语不能很好 解决。按照优先匹配的词长和扫描方向的不同,有正向最大匹配、正向最小匹配、逆向最 大匹配和逆向最小匹配等四种分词方案。【1 】 ( 2 ) 基于理解的分词 基于理解的分词方法旨在分词的同时进行句法、语义分析,利用句法信息和语义信息 来处理歧义现象。它通常包括三个部分:分词子系统、句法语义子系统、总控部分。在总 控部分的协调下,分词子系统获得词、句子等句法和语义信息,并对分词歧义进行判断, 确定最终的分词结果。该方法模拟了人对句子的理解过程,分词效果较好,但需要使用大 量的语言知识和信息。【1 】 ( 3 ) 基于统计的分词 这种分词方法利用了一种基于统计学的n 劬锄技术,根据相邻词的共现频率自动提 取特征,使文本数据分类实现了分类的领域无关性和时间无关性。它无需任何词典支持, 对输入文本所需的先验知识少,但是,在n g r 锄进行信息提取时,会产生非常大的数 据冗余,时间代销大。 本文采用中国科学院计算研究所研制的汉语词法分析系统i c t c l a s ( i n s t i t u t eo f 浙江工业大学硕士学位论文 c o m p u t i n gt e c h n o l o 鼢c h i n e s el e x i c a la n a l y s i ss y s t e m ) 中的i c t p r o p 概率句法分析器。 该系统的功能有:中文分词、词性标注、未登录词检测,i c t p r o p 概率句法分析器具有 中文分词和词性标注的功能。根据相关测试结果,i c t c l a s 的分词正确率高达9 7 5 8 , 未登录次检测召回率均高于9 0 ,其中中国人名的检测召回率接近9 8 ,处理速度为 3 1 5 k b y t e s s 。i c t c l a s 可以根据需要输出多个高概率结果,又多种输出格式,支持北大 词性标注集,9 7 3 专家组给出的词性标注集合,可以进行一级标注和二级标注【2 】。 表2 1i c t p r o p 概率句法分析器词性表 n 名词 b 区别词 m 数词 u 助词 j 简称 f 方位词 v 动词 g 语素词 e 叹词 l 成语 t 时间词 w 标点符号 d 副词 y 语气词 n t 机构团体 1 习用语 x 字 q 量词 n s地名s处所词 p 介词 z状态词o象声词r 代词 a 形容词 h 前接成份 k 后接成份 c 连词 n z 其他专名。 a g 形语素 a d 副形词 a n 名形词 起 副语素 n g 名语索 t g 时语素 v g 动语素 v d 副动词 v n 名动词 2 2 语义极性的判断 在分词之后,就是对词的分析,词的语义倾向或极性的研究是观点抽取方法的基础工 作。因为观点抽取就是要分析人们对事物所表达的观点或看法,而极性词则是人们用来表 达自己观点的直接描述工具,主要是形容词、动词和部分名词。如果句子或文章中没有出 现极性词,则该句子或文章是一般的客观性描述。影响观点的因素有很多种,极性词只是 表达情感的重要因素之一,其它元素还可以包括句子的语气等,如反问语气,感叹语气。 目前的研究主要集中在常用的形容词、副词、名词和动词等,而且一般不包括成语。 2 2 1 极性词的含义 语言是人类交流的工具,人们通过语言来表达自己的情感,有喜、怒、哀、乐、恶等, 一5 一 浙江工业大学硕士学位论文 这类情感主要是由一些词来反映。尤其是当人们对某一事物的好坏做出评价的时候,往往 通过使用这类词语来表达自己鲜明的观点。一般把带有情感倾向的词语称之为极性词 ( p o l 耐够w o r d ) 。从语法角度说,极性词( p o l 撕t ) ,w o r d ) 是指只能用于肯定句或只能用于 否定旬的词。这些词可以分成三大类:褒义词、中性词和贬义词。 这三类极性词代表着三类情感倾向:褒义( p o s i t i v e ) 、中性( n e u 仃a 1 ) 、贬义( n e g a t i v e ) 【引。例如: 褒义词:伟大、漂亮、优秀等 中性词:购买、窗帘、跑步等 贬义词:邪恶、无耻、丑陋等 事实上,除了极性词可以直接而且鲜明地表达说话者的情感之外,说话者的语气和修 辞手法也可以起到相似的作用,比如网络常用句“顶”,反问句“你们怎么会达到这种境 界? 和感叹句“我们的地方将会是多么的乱! ”。在研究一般正规的陈述评论语句的基础 上,将研究以上三类句型。 2 2 2 词语极性的判断方法 人工判断词语的语义极性倾向是非常容易的,人类每天都需要用到大量的极性词来表 达自己的情感,具有丰富的经验,形成了固有的知识,准确率高但效率不高。但是如果交 由计算机系统来判断极性词,这将是一件非常困难得事。因此对于词的极性倾向判断一般 都是采用手工与自动相结合的方法。即,首先手工标注一部分最常见的极性词,或者极性 比较强的词语,从而建立一个极性词集合( p o l 撕匆s e d ,然后根据新词语与极性词集合元 素的某种关系,由计算机系统来自动判断新词语的倾向极性和强度。 一般来说,目前有四类常用的方法: 第一类,根据新词和种子词之间出现的关联词,判定新词的倾向性。 h a t z i v a s s i l o g l o u 和m c k e o w n 【4 】在1 9 9 7 年首先开始了词汇倾向性的研究,提出了一种 判断单词极性( s e m a n t i co r i e n t a t i o n ) 的方法。他们主要是针对形容词作倾向性分析,首先, 手工标注一部分形容词的极性,分别以“+ ”、“一”表示褒义、贬义,然后利用词汇之间 的连词( a n d ,o r ,b u t ,e i t h e r o r ,和n e i t h e r n o r 等) 训练生成词汇间的同义或反义倾向的连 接图,然后用聚类的方法将词汇聚成褒义和贬义两类。 基于这种思想,他们在实验中手工标注了1 ,3 3 6 个形容词( 6 5 7 个褒义词,6 7 9 个贬义 浙江工业大学硕士学位论文 词) 的极性,并对包含了2 ,10 0 万个单词的集合进行极性倾向判断,准确率达到9 7 ,精 确率最低的一组实验也达到7 8 0 8 蚶钔。 第二类,根据新词和种子词之间出现的统计关系,判定新词的倾向性。 2 0 0 3 年加拿大国家研究委员会信息技术研究所的1 、唧e y 【5 1 和美国罗格斯大学的 l 蛐【6 噪用计算基准词对与词汇相似度的方法识别词汇倾向性。他们选择了七对褒贬倾 向比较强烈的词汇,计算待定词与每个基准词的s o p m i ( s 唧a n t 沁o r i e n t a t i o np o i n t s e r n l 咖a 】j n f - o n n a t i o n ) 值来判定词汇的倾向性。即根据一个新词与己知的极性词范例集合( 比 如强极性词集合,即感情色彩强烈的极性词集合) 之间的统计学关系自动推断该新词的 极性倾向。其精确率达到了8 2 8 。 第三类,通过同义词或反义词,判定新词的倾向性。 2 0 0 4 年j k 觚l p s ,m m a ,r j m o k k e n ,和m d 砌j k e 【,】利用w b r d n 乱计算词 汇倾向性。先选择基准词,判别待定词与基准词在w b t d n e t 中是否为同义词,得出词汇的 倾向性。其中d ( t 1 ,t 2 ) 是词汇t 1 t 2 在由w b r d n e t 生成的相似图中的最短路径,b a d 和g o o d 分别代表贬义和褒义基准词。计算公式如下: s 盼等篙 ( 2 _ - ) 第四类,计算倾向性待定的词汇与基准词汇的相似度,判定新词的倾向性。 首先选择一组褒贬基准词,利用h o 、州e t 提供的语义相似度和语义相关度计算测试词与 这组基准词的语义关系紧密程度,从而得到其语义倾向值。知网的基本思想是:设想所有 的概念都可以分解成各种各样的义原,同时应该有一个有限的义原集合,其中的义原组合 成一个无限的概念集合。如果能够把握这一有限的义原集合,并利用它来描述概念之问的 关系以及属性与属性之间的关系,就有可能建立所设想的知识系统。词汇相似度是一个数 值,一般取值范围在 0 ,1 之间。一个词语与其本身的语义相似度为1 。如果两个词语在 任何上下文中都不可替换,那么其相似度为0 。【8 】【9 】 2 2 3 极性词判断存在的问题 经过应用和研究,发现上述算法都存在以下一些问题: ( i ) 没有考虑种子词的强度。即使是h o 、v n e t 的相似度计算也没有很好的考虑词的倾 向强度1 1 0 l ,因此,也就无法为计算新词的强度提供基本的依据。对于同样是属于褒义词 浙江工业大学硕士学位论文 的词:“好”、“优”,都表示褒义倾向,但是,无法区分它们各自得情感强度。如果仅仅是 判断出它们的语义极性倾向,再根据统计方法,那么就会影响到句子层次的观点抽取和极 性分析。 ( 2 ) 算法复杂度较高。对于每个新词,计算其极性强度都需要花费大量时间,无法推 广和应用。在实际应用中,本文发现有一部分极性词出现频率特别高。而且在一般口语的 表达中,极性词与领域的相关度非常低。 ( 3 ) 没有考虑上下文极性。要知道绝大多数词语都有其本身固有的极性倾向,但是有 些词语出现在不同语境中,会产生相反的极性倾向。例如:“价格高”和“品位高”。旬中 都有“高 ,却形成了两种截然不同的极性倾向。前者的“高”表现为贬义,后者的“高” 表现为褒义,像这类词现有的算法都无法解决此类问题。 因此,本文将在本文第三章和第四章详细介绍新的算法,去解决上述问题。 2 3 观点抽取的研究概况 2 3 1 国外研究状况 目前为止,观点抽取的研究成果主要集中在英文语种,并且研究的重点是语义的获取, 主语的识别,褒贬词语以及短语。 h o n gy u 和v a s i l e i o sh a t z i v a l s s i l o g l o u 利用不同的极性成分组合从句子层次和文档 层次进行语义极性分析。所选用的极性成分包括单词、b i 伊锄s 、强g r 锄s 以及极性标注 ( p a r t o f - s p e e c h ) 。在此基础上,利用统计学的方法,识别句子的极性,计算文档的极性【1 1 】。 c w l i t e l a w ,n g a r g 和s 船锄o n 将分类学运用到语义分析中,将文档进行过滤【1 2 】。 2 0 0 5 年m j m v e m l e i j 利用有倾向性的词汇在产品评论中出现的次数计算用户 评论的倾向性,提出了一种按词频加权统计的方法【1 3 】。接着又对网络评论进行了相关的 研究,从评论的发现到评论观点的抽取,都取得了非常大的成果【1 4 1 7 】。微软美国研究院 g 锄o n ( 2 0 0 5 ) 等人所开发的p u l s e 系统可以自动挖掘网上用户所上载的自由文本中有关 汽车评价中的褒贬信息和强弱程度【18 】;美国伊利诺斯大学l i u 等人所开发的原型系统 o p i n i o no b s e r v e r 可以处理网上在线顾客产品评价,对涉及产品( 如电子照相机) 各种特 征的优缺点进行统计,并采用可视化方式对若干种产品的特征的综合质量进行比较1 1 9 1 。 2 0 0 5 年,i b m a l m a d e n 研究中心采用句法分析的方法y i 和n i b l a c k 介绍了该研究 一8 一 浙江工业大学硕士学位论文 中心开发的w r e b f o u n t a i n 系统中的意见挖掘器,对句子的成分进行浅层分析,从而根据 语法关系找出主题和修饰成分的关系【2 0 】。j ,t - n 2 l s u k a w a ,r b u l l e s c u 和w n i b l a c k 运用 自然语言处理技术,对给定主题的评论进行语义倾向抽取【2 1 1 。美国的t n a s u k a w a 和 j y i 运用自然语言处理技术对于日常用语进行语义分析【2 2 】。m i c h a e lg 锄o n 和加n h o n v a l l e 利用机器学习和n l p 提出了语义词汇的自动识别方法【2 3 】。2 0 0 7 年,德国s a a r l a l l d 大学 的x c h e n g 对文本主题自动发现及观点自动分类有了深入的研究【2 4 1 。t w i l s o n ,j w i e b e 和 p h o 胁a i l l l 利用上下文极性关系,将语句分为不同层次的短语,进行语义分析【2 5 】。 2 3 2 国内研究状况 中文语种的观点抽取研究起步较晚,但是仍有许多成果。2 0 0 4 年,龙丽君研究了网 络内容监管系统中基于局部信息的语义倾向性识别算法【2 6 1 ,复杂句中抽取出局部信息, 得到了较好的结果;刘永丹等研究文本过滤系统【2 7 】;r y 啪等研究了中文词语的极性判 别算法【2 8 1 。2 0 0 5 年,叶惠敏 2 9 1 等研究了网上舆论倾向分析与评估系统方案2 0 0 6 年,熊德 兰对中文网页褒贬倾向性分类研究【3 0 】;闵锦研究了主题和态度分类的文本过滤系统【3 l 】。 2 0 0 7 年,李慧等研究了基于页面分块与信息熵的评论发现及抽取【3 2 】;李姜将d o m 模型 运用载评论发现及抽取上进行了研烈3 3 】。 目前,国内有学者研究的比较多是基于h o w n e t ( 知网) 的中文词汇语义倾向计算。比 较著名的有香港城市大学b e 巧a m i n k yt s o u 和r a y m o n dw m y u e n 等。他们对北京、 上海、香港、台北四个城市的6 0 0 篇新闻报道进行极性分析,从文档层次( d o c u m e n t 。l e v e l ) 分析布什、克里、小泉、陈水扁四位著名政界领导人物的声誉褒贬。采用的方法是,首先 通过标记语料库获得文本中的极性元素,然后主要采用了三个衡量指标,即计算极性成分 ( p o l 撕t ) ,e 1 e m e n t s ) 在文章中出现的广度( s p r e a d ) 、密度( d e n s i t ) ,) 以及强度( i n t e n s i t y ) 。 值得注意的是哈尔滨工业大学信息检索研究室开发了一个评论系统,目前正在测试 中,名称是汽车领域产品评论的倾向性分析与挖掘,它的测试网站是 脚:z p i s o c h e c o 州。目前,它从各大汽车论坛中抽取评论,并分析车子的油耗、安全性、 空间、动力、操控、外观、内饰、性价比、配置这几个方面,将评论观点分为满意和不满, 并得出各个方面的分数,给用户一个直观的显示。 浙江工业大学硕士学位论文 2 3 3 观点抽取方法分析 ( 1 ) 简单分类器 这种算法基于正面和反面含义特征词汇的统计个数。这是最简单并且最直观的分类 器。根据特征词汇库中的预设词,在一个消息中每个词都被赋予相应的值表明正面、中立 和反面。如果特征词汇的个数超过了一个给定的正面( 或反面) 阈值,则就将该消息划分为 支持( 反对) ,否则就是中立。【3 5 】 ( 2 ) 基于判别式的分类器 简单分类器并不区分特征词的重要性,但特征词汇库中的词在实际的分类中起的作用 是不一样的。基于判别式的分类器在训练文集中通过计算来衡量特征词汇库中的每个词的 观点判别能力,根据计算结果可以分配给每个词不同的权值。每个词的权值判定可以根据 f i s h e r 的判别函数计算。设c = 正面,反面,中立) 代表了消息的类别。n i 表示词w 在类 i 中出现的次数。词w 出现在类i 的一个消息中的平均次数为。词w 出现在类i 的消息 中的次数为m j i 则每个词的判别公式为 击尉( “一熊) 2 f ( 们:卫等竺 ( 2 _ 2 ) ,寺,( 坞一“) 2 式( 1 ) 对特征词汇库中的每个词都分配了一个值f ( w ) ,此值实际上是类间( i 类对j 类) 方 差与类内( i 类c ) 方差之间的比率。比率越大,词w 在特征词汇库中的判别能力就越大。一 个判别能力强的词使类间的方差最大,类内的方差最小。【3 5 】 ( 3 ) 贝叶斯分类器 贝叶斯分类器主要基于贝叶斯定理,近几年它常常被用于w e b 搜索、发现w e b 类似性、 根据互联网的入口对网页进行分类等。根据贝叶斯原理,贝叶斯分类器也可以用于观点的 分类。该分类器由三个部分组成:特征词汇库中的文本;消息文本;观点类别( 正 面态度、反面态度、中立) ,由此组成了一个词一消息类( w ,m ,c ) 模型。贝叶斯分类器 使用基于词的概率,并不考虑语言的结构,所以它是独立于语言的。设类的集合为c ( = 3 ) , c i ,i = 1 c 。每个消息都表示为m j ,j = 1 m ,m 是消息的总数。m i 为每个类i 中的消息的总 数,且:。m = m 。特征词汇库中的词汇总数为d ,其集合表示为f 2 w k i k = 1 d 。由判 别式( 1 ) 可决定一个判别能力强的词的集合 w k ) 。 浙江工业大学硕士学位论文 设n ( 码,w k ) 是词w 在消息m 中出现的总次数,在训练集合中每个特征词汇库中的元素 在每个消息中出现的次数用n ( m j ) 表示,消息m j 中特征词汇的总数包括重复的个数, 甩( ) = d l 门( ,) 。在贝叶斯算法中一个词在某个消息类中出现的频率是一个很重要的 参数,n ( c i ,w k ) 表示词w 在所有m j c j 中出现的次数,即 玎( 勺,) = 门( ,) ( 2 3 ) m j t c i 对应于上式,e ( c i ,w k ) 表示词w k 在c 类中所有消息m 中出现的概率: 口( c f ,心) = 嗍,z ( ,比) 岬。胛( ,) 玎( c ,) 要求0 ( c i ,w k ) 0 ,v c i ,w k ,所以根据l a p l a c e 的公式调整如下: 讹= 鼍岩 ( 2 4 ) ( 2 - 5 ) 如果0 ( c i ,w k ) = o 并且n ( c i ) = 0 ,v k ,则每个词都是等概率的,即为1 d 。有了以上变量 以后,就可以计算出一个消自在类i 中的条件概率p m j l c i 】。 p | c f :堕l 蠡讹哪川 ( 2 6 ) 旦以( 垅,) ! 一1 还要计算出p 【c i 的值,p c i 是在训练集中被划分为c i 类的消息的比率。利用在训练集中 计算出的p 【呻i c i 与p c i ,根据贝叶斯定理就可以得出以下结果: p 【c l 肌, = 尸( 垅k ) 尸k 】 二p ( iq ) 尸m ( 2 - 7 ) 对于每一个消息,都计算出三个后验概率p c ii m j 】,三个概率分别对应于一个观点类 别。根据概率最高的那个类决定消息所属的类别。所以贝叶斯分类器的目标就是计算给定 消息m i 最可能的类c i 。【3 5 】 ( 4 ) 记分器法 这种算法通过对特征词汇设定值来达到自动分类的目的。假设观点类别只包含c 和c 正反两种观点,该算法首先用记分器给各个特征词汇赋值,由特征值之和来最后决定文档 的属于正面观点一类c 还是负面观点一类c 。 一1 1 浙江工业大学硕士学位论文 首先由一个记分器分配给每个特征合理地分值,分值计算公式如下所示: 跏毗) = 剿渊 ( 2 - 8 ) 其中p ( w i i c ) 定义为特征的频率,它等于w j 在c 中出现的次数除以c 中的所有标记的特征 词汇总数,同样p ( w i ic ) 是w j 在c 中出现的次数除以c 中的所有标记的特征词汇总数。一个特 征词汇的记分范围就是一1 1 之间。这种方法可以体现出任意长的特征词对分类所起的作用 大小。每个特征词汇都有一个相应的值之后,就可以将一个未知的消息的特征词的所有的 记分都加起来,以最后的和决定消息的分类,如果消息m i = 、i w n ,那么 c 妇( 他) = 鬈嬲:嚣 ( 2 - 1 0 ) 其中,幻幻,( 朋,) = s c d ,g ( m ) j ( 2 1 1 ) 当消息中所有特征词的记分之和大于0 时,就将该消息归为c 类,
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 山东东营市2027届八上数学期末复习检测试题含解析
- 吉林省四平市名校2027届数学七年级第一学期期末统考试题含解析
- 2026年广西壮族自治区桂林市初二学业水平地理生物会考试题题库(答案+解析)
- 2026年建设工程技术与计量(安装工程)考试练习题及答案解析
- 2026年广东韶关市八年级地理生物会考真题试卷+解析及答案
- 人教版数学七年级下册 第7章 解答题书写步骤专练30道(必考点分类集训) 同步练习 含答案
- 2026年唐县教师招聘笔试模拟试题及答案解析
- 2026年南方鼎元资产运营有限责任公司人员招聘笔试参考试题及答案详解
- 2026年武汉经济发展投资集团有限公司人员招聘考试参考试题及答案详解
- 2026年泰山财产保险股份有限公司人员招聘考试题库及答案详解
- 某电力公司仓储管理细则
- 学术不端防范进阶规范流程课件
- 2025-2026七年级数学第一次月考卷(全解全析)(深圳专用北师大版七上第1~2章)
- (2026年)热性惊厥患儿护理查房课件
- 隆力奇集团在我国日化二、三级市场营销策略的深度剖析与展望
- 《重点区域生态保护和修复工程建设投资估算指南(试行)》
- 高频电刀安全使用课件
- 第一单元学习项目一《没有共产党就没有新中国》课件人音版(简谱)初中音乐八年级上册
- 高素质农民培育项目服务方案投标文件(技术方案)
- 吉利汽车经销商运营手册
- 脚手架验收表
评论
0/150
提交评论