基于文本情感分析的网络舆情分析研究_第1页
基于文本情感分析的网络舆情分析研究_第2页
基于文本情感分析的网络舆情分析研究_第3页
基于文本情感分析的网络舆情分析研究_第4页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于文本情感分析的网络舆情分析研究

1数据分析的意义随着网络信息产业的发展,网络上出现了大量以情感为特征的主观性文章,它们也有各种形式的展览,如论坛论坛、网站、微博等。通过网络短文本信息,人们记录自己的日常生活及事务,可以抒发感情、释放情绪,表达了人们的各种情感色彩和情感倾向,人们的情感在网络这个“第三世界”得以宣泄。因此,对一段时间内的大量的短文本信息数据进行挖掘和分析,识别出群体的舆情趋向及演化规律,可以更好地分析人们的情感以及社会舆情热点。文本舆情分析又称为意见挖掘,是对带有情感色彩的主观性文本进行分析、处理、归纳和推理的过程,因此基于短文本的舆情分析可以称作舆情信息的一个深入加工。基于文本的舆情分析目前是信息挖掘领域研究的热点问题,具有很大的研究价值和应用价值,对于话题检测与跟踪,舆情预警与疏导和行为模式挖掘与异常检测等方面有重要的价值。2基于聚类方法的聚类分析网络环境中存在的大量短文本,特点比较鲜明:具有比较高的维度和稀疏空间、噪音数据多等特点,存在大量的文本冗余,因此,如何对文本数据精确去重,然后通过聚类的方法提取有意义的关键词语,特别是带有情感色彩的关键词,成为对用户群体舆情分析的关键工作。目前大多数短文本处理方法主要还是传统的文本分类、信息过滤和检索的方法,然而,与长文本相比,传统的单纯基于词的分类方法不能满足短文本分类的需要。本文提出一种短文本冗余去重聚类算法,基于后缀数组的频繁模式发现算法得到词汇集合后,结合词语局部性原理对词汇集合聚类分析,进行有意义字串挖掘。3确定最大重复串的定义定义1、频繁模式发现:针对多个文本,计算出现频次大于指定阈值的子字符串。定义2、后缀数组:给定一个由n个单词组成的文本T,其对应的后缀数组substr是一个元素取值在1到n之间的整数数组,即位置substr[i]所代表的后缀是字符排列在i的后缀。在短文本最后添加一个字符结束标志后,以深度优先的方式遍历后缀树组,可以得到按照字典顺序排序的后缀数组。表1中描述了对短文本“山东,济南,山东,曲阜”构建后缀数组的过程。定义3、最长公共前缀数组LCP(LongestCommonPrefix,LCP):对于文本T及其相应后缀数组substr,substr对应的最长公共前缀数组LCP是一个整数数组,其中LCP总是为0,LCP[i]为substr[i]位置对应的后缀与substr[i-1]位置对应的后缀之间的最长公共前缀的长度。表1表示短文本“山东,济南,山东,曲阜”后缀数组和LCP数组对应关系,统计的长度以字节为单位(标点符号按照一个字节)。定义4、右最大化重复子串(RightMaximalSubstring,RMS):若R为串S中一个RMS,其标识符为ID(R)=min{w|1≤w≤n,LCP[w]>0}同理,将串S逆转,得到其逆串~S,按照定义4可以求出串S的左最大化重复子串(LeftMaximalSubstring,LMS),其标识符为ID(L)=min{w|1≤w≤n,LCP[w]>0}定义5、最大化的重复串(MaximalSubstring,MS),为右最大化重复子串与左最大化重复子串的交集,其标识符为ID(R)={w|ID(R)∩ID(L)}从表2可以看出,按照以上算法得到的短文本最大化重复串在汉语语法中不一定是有意义字串,比如“,”和“东”,而“山东”才有实际意义。因此,还要基于短文本的最大化重复串挖掘有意义字串。4从有意义的时段理解空间局部性从网络中挖掘出来的有意义词有一定的局部性,所谓词语局部性,有两层含义:即时间局部性和空间局部性。时间局部性是指不同的时间段出现的有意义词语不同,比如一个热点事件出现后,接下来的时间段该词语可能成为谈论的焦点;空间局部性是指在不同领域的文档中出现的有意义词语可能不同,比如大学校园BBS与财经专业BBS中挖掘出来的有参考价值的词语不同。因此,本文从结合局部性度量策略的约束条件从以下方面对重复串处理:多中心点分“簇”、抗噪音处理、频次归一化约束。4.1确定中央簇内所需信息,确保中央获得全局效性字符串在短文本库各出现位置按照一定的策略划分为若干“簇”,对每个簇分别计算中心点,对每个簇分别度量字符串在该簇内分布的局部性,再得出字符串在整个文本库中总局部性度量。4.2反思第2和第3处的噪声有效处理噪音:在文本中,某个词如果在图1所示的三个部分出现,第2和第3处出现的频次远高于第1处,因此可以将第1出处称作孤立点或者噪音。噪音对于文本的分“簇”影响比较大:计算方差过程中带有噪音的方差比较大,偏离实际。因此在算法中要有效处理噪音。4.3密度和频次的密度词语在文中的局部性与其出现的频次(密度)有关系,一般情况下密度越大,其局部性越高,但是也不能简单比较词语在文本中的某个位置的密度或者频次,比如在图1和图2中,字符A在3位置的密度高于字符B在2的位置,不能说明字符A的局部性高于B,要对没有噪音的短文本中所有出现重复串的密度作归一化处理,计算其平均局部性,即各个区域局部性的平均值,保证词语局部性的计算不能局限于某个特定的区域,而应该是各区域局部性的综合。4.4聚类聚类算法若串S在短文本中出现n次,各出现位置分别为P1,P2,P3,…,Pn,字符串的局部性度量算法主要通过以下几个过程完成:(1)计算参考距离用参考距离Distance确定位置点的簇类,使用字符串在文本中各相邻位置之间距离的平均值作为位置点聚类的参考距离,则串S的参考距离可如公式计算:Distance=∑i=2n(Pi−Pi−1)n−1(1)Distance=∑i=2n(Ρi-Ρi-1)n-1(1)(2)位置点聚类对于重复串出现的所有位置点按照参考距离进行聚类,基本算法如下:初始化当前聚类C={P1};对于1<i<n+1,循环计算Pi-Pi-1,如果Pi-Pi-1>Distance,将C加入R,清空C;否则将Pi加入C;通过以上算法,结合公式1求出的参考距离,对所有最大化重复串位置点分“簇”,使得同一“簇”内距离较小,而不同“簇”间的距离比较大,从而得到较好的归一化结果。(3)字符串的整体局部性字符串的整体局部性可以通过字串在各簇局部性的平均值来度量,若根据各字串出现的位置点最终划分为k个簇{C1,C2,C3……Ck},字串在每个簇Ci的位置方差为Vi,其局部性的平均值用以下公式计算:Locality(s)=∑i=1kVik(2)Locality(s)=∑i=1kVik(2)其中Vi=∑i=1n(Pi−P¯¯¯)2N−1P¯¯¯=∑i=1nPinVi=∑i=1n(Ρi-Ρ¯)2Ν-1Ρ¯=∑i=1nΡin(4)字符串意义指数度量通过后缀数组的频繁模式发现算法得到最大重复串集合R={S1,S2,S3……Sn},并分别计算字串在整个短文本中的局部性,利用公式度量各个字串的有意义指数。MI(si)=λ×Locality(si)maxni=1(Localityi)(3)ΜΙ(si)=λ×Locality(si)maxi=1n(Localityi)(3)其中λ为指数影响因子,其设置为了影响MI的计算数值,可以通过实验数据来分析其取值变化对指数计算的影响,最后确定针对不同词语密度的最佳数值,提高短文本聚类分析的数据结果的准确率。5结果分析5.1确定多种设置的mi值我校官方论坛系统数据库中,帖子以文本文件格式存放,其格式与短文本的特点一致。因此,实验分析过程通过对2009年整个一年的标题数据库文件做实证分析。通过VisualC++实现以上算法,求出频次大于180的重复串,λ的取值从0变化到1,步长为0.05,对0到1的每一个λ值,按照公式3计算各字符串的MI值并排序,分别选取排序靠前的200个、400个、800个候选有意义串,统计其准确率如图3所示。可以看出,λ的最佳取值随着候选有意义串的数量的增大而增大,当候选有意义串数量为200时,λ的最佳取值为0.3;当候选有意义串数量为400时,λ的最佳取值为0.4;当候选有意义串的数量超过800时,λ的最佳取值为0.5。5.2案例数据的挖掘确定不同数量字符串对应最佳影响因子阈值之后,可以对论坛中的短文本数据重新聚类分析,为了更加准确反映短时间段的舆情信息,可以缩小时间范围,试验中得到2009下半年论坛文本数据的挖掘结果,如表3所示,在聚类结果表中列出了出现频次排名比较靠前有意义字串,比如“山东财经大学”排在第一,说明学校用户对我校整合其它院校以及更改校名事件比较敏感,以及合校之前新校长的上任比较关心;“酒后驾车”、“富二代”也是去年社会的关注热点;学生宿舍网络速度也需要引起管理者的注意。6算法影响因子的个数及对应的阈值出现以考通过以上的分析,本文提出的基于短文本频繁模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论