【《基于FWS-AP算法的微博热点话题检测分析案例》8100字】_第1页
【《基于FWS-AP算法的微博热点话题检测分析案例》8100字】_第2页
【《基于FWS-AP算法的微博热点话题检测分析案例》8100字】_第3页
【《基于FWS-AP算法的微博热点话题检测分析案例》8100字】_第4页
【《基于FWS-AP算法的微博热点话题检测分析案例》8100字】_第5页
已阅读5页,还剩9页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于FWS-AP算法的微博热点话题检测分析案例目录TOC\o"1-3"\h\u1017基于FWS-AP算法的微博热点话题检测分析案例 1112461.1基于FWS-AP算法的微博热点话题检测流程 272991.2FWS-AP微博话题检测方法 262291.2.1最小哈希 2264611.2.2改进相似度度量的近邻传播聚类算法 3289891.2.3FWS-AP微博话题检测 5295391.2.4微博话题表示 6162781.3微博热点话题评估分析 733901.3.1H指数 7202081.3.2话题热度影响因素 714171.3.3话题热度值计算 8152661.4实验与分析 9258181.1.1算法比较及分析 9151321.1.2话题表示及热度评估实验 11通过分析已有的话题挖掘方法发现,在不需要预先指定聚类数目,且适合于微博话题这种多类数据快速聚类的算法中,affinitypropagation(AP)算法是合适之选。然而,一般地,在使用affinitypropagation(AP)算法聚类时通常采用欧几里德距离(欧氏距离)作为相似性度量,导致其性能对变形十分敏感。针对这一缺陷,本文对affinitypropagation(AP)算法进行了改进,使用MinHash算法来计算数据集中文本相似度,提出了一种基于频繁词集和改进相似度度量的affinitypropagation(AP)聚类的微博话题检测方法(FWS-AP)。该方法通过构建频繁词集相似性矩阵进行聚类,实现有效的挖掘各个主题下的隐含话题。最后综合考虑微博文本数据特点和热度传播特性,本文提出了一种对话题中部分高质量微博进行分析得到话题热度的计算方法。通过与新浪微博真实的热度排名进行对比,验证本文提出的微博热点话题检测方法的有效性。1.1基于FWS-AP算法的微博热点话题检测流程本文的最终研究对象是各个主题下的隐含话题,为了得到具体话题信息,需要在主题聚类结果基础上进行更为深入的研究。在第三章通过聚类实验得到主题聚簇后,将每个聚簇中的所有文本看作一个新的文本集合,利用本文提出的方法对各个主题下的隐含话题进行挖掘及后续热点话题研究。本文提出的基于FWS-AP算法的的微博热点话题检测方法流程如图4-1所示,其中的关键步骤包括:频繁词集挖掘及过滤、引入MinHash改进AP算法聚类、主题下话题表示、话题热度评估等。图4-1基于FWS-AP算法的的微博热点话题检测方法流程图Fig.4-1FlowchartofmicrobloghottopicdetectionmethodbasedonFWS-APalgorithm每个主题下的所有微博文本组成一个文本集合,随后分别对主题文本集合使用FP-Growth算法进行频繁词集挖掘及过滤;之后使用基于MinHash改进相似度度量的AP聚类算法进行聚类得到话题类簇;再从话题文本中筛选若干有代表意义的特征词,对话题内容进行表示;最后进行话题热度评估得到最终需要的微博热点话题。下面将具体介绍其中的关键步骤。1.2FWS-AP微博话题检测方法1.2.1最小哈希最小哈希(MinHash)[55]是一种基于Jaccard度量的、用于快速判断两个集合相似程度的方法,可以用于大规模的文档聚类问题中。其实现原理是依次扫描这两个集合中所包含的每个元素,利用这两个集合中共同包含的元素数目来衡量集合之间的相似度。假设是将转换成某个整数的哈希函数,集合中的元素通过函数转换后,把得到最小哈希值的元素记为。现存在集合、,将集合、中的元素经过哈希函数哈希之后,如果和同时包含最小哈希值的元素,即。那么集合和的相似度就可以表示为、经过转换后得到的最小哈希值相等的几率,如公式(4-1)所示: (4-1)由于对每个主题类簇进行频繁词集挖掘后,大大增加了所要聚类的文本数据量,例如在“5G”的主题下,“世界5G大会”这一话题可能在使用FP-Growth算法后得到“2020/世界”、“2020/大会”、“2020/世界/5G”等诸多这样的频繁词集。因此,可以借助MinHash算法在计算两个文本集合相似度时对两个集合进行降维,从而提高话题聚类的效率,降低实验复杂度。1.2.2改进相似度度量的近邻传播聚类算法近邻传播(affinitypropagation,AP)是一种无监督聚类算法[56]。AP算法使用相似性矩阵和偏向参数进行聚类,在聚类性能和效率方面比传统聚类方法都有大幅度的提升。加上AP算法在使用时不需要事先指定聚类簇的数目,对多类数据集合聚类快速且结果稳定,非常适合本文微博话题聚类的场景。AP算法把数据集中全部数据样本均视为聚类中心,而不必预先定义聚类中心,之后把每两个数据样本进行连接,形成一个相似度矩阵网络结构,根据网络中每条边传递的responsibility和availability消息来计算每个数据点的聚类中心。该算法的输入参数包括三个:相似度矩阵、偏向参数和阻尼系数。AP算法依据数据点之间的相似性值对数据进行聚类过程,其中相似性矩阵使用欧几里得距离来构建,具体如公式(4-2)所示: (4-2)其中,相似性矩阵元素表示数据点和数据点之间的欧几里得距离。算法中将相似性矩阵对角线上的值赋予偏向参数,如公式(4-3)所示: (4-3)与数据点相对应的值越大,则该数据点越容易被判定为聚类代表。算法需要迭代更新吸引信息(responsibility)矩阵和归属信息(availability)矩阵,其中矩阵的元素描述的是信息从数据点传递向数据点,表示数据对象以多大的概率成为数据对象的代表点;矩阵的元素描述的是信息从数据点传递向数据点,表示数据对象以多大的概率成为数据对象的代表点。两个矩阵,中的全部元素初始化为0,并通过以下步骤迭代更新:首先,吸引信息(responsibility)更新如公式(4-4)所示: (4-4)然后,归属信息(availability)更新如公式(4-5)~(4-6)所示: (4-5) (4-6)AP算法为了避免聚类时候出现振荡,引入了阻尼系数,。每条信息更新如公式(4-7)~(4-8)所示: (4-7) (4-8)每次迭代,吸引信息和归属信息在数据点对之间传输,从而确定出聚类代表。从上述AP聚类划分问题的主要过程可以看出,AP聚类算法将所有数据点都看作潜在中心点,采欧氏距离法计算输入相似度矩阵。但是,欧几里德距离度量对变形具有很高的敏感度,也就是说欧几里德距离没有考虑数据点之间的空间关系,这将会大大影响AP算法的聚类性能。针对这一问题,本文对AP聚类算法进行了改进,将MinHash算法引入AP聚类算法中,代替原有的欧氏距离来计算数据点之间的相似度。改进的AP聚类算法中基于MinHash的相似度矩阵如公式(4-9)所示: (4-9)其中,、是各个主题下用频繁词集表示的微博文本,相似性矩阵元素表示文本和文本之间的基于MinHash的集合相似度。1.2.3FWS-AP微博话题检测对于聚类后每个主题下所有微博数据文本,本节仍然利用FP-Growth算法分别采用不同的最小支持度进行频繁词集挖掘,方法同3.3.1节。考虑到只有一个词的频繁词集对话题表示意义不大,并且会增加实验的难度,因此选取了长度大于等于2的频繁词集作为每个主题的聚类结果。由于每个主题下用频繁词集表示的文本数据量比较大,为了提高各个主题下话题检测的效率和精度,本文利用公式(4-9)构造每个主题下微博文本的相似度矩阵,然后采用引入MinHash算法改进相似性度量的AP聚类算法进行话题聚类,实现对各个主题下隐含话题的有效挖掘。本文提出的基于FWS-AP的微博话题检测算法具体描述如算法4-1所示。算法4-1基于FWS-AP的微博话题检测算法Algorithm4-1MicroblogtopicdetectionalgorithmbasedonFWS-AP输入:微博主题数据集,最大迭代次数输出:微博话题类簇Begin对数据集中的每个主题文本分别利用FP-Growth算法进行频繁词集挖掘;对频繁词集进行筛选,剔除长度小于2的频繁词集;初始化阻尼系数和最大迭代次数;读取处理后的用频繁词集表示的微博数据;使用公式(4-9)计算文本相似度矩阵;求出相似度矩阵的中位值,并赋给偏向参数;更新吸引信息矩阵;更新归属信息矩阵;如果达到最大迭代次数或达到终止条件,则继续往下执行,否则跳转步骤5执行;得到最后的聚类中心,并把每个数据划分到对应的类簇中;得到最终微博话题簇划分。End本文的基于FWS-AP的微博话题检测算法流程如图4-2所示。图4-2基于FWS-AP的微博话题检测算法流程图Fig.4-2FlowchartofmicroblogtopicdetectionalgorithmbasedonFWS-AP1.2.4微博话题表示在得到对微博主题的聚类结果之后,并不能直接表示话题的主要含义。为了更加直观的了解每个主题下所包含的话题结果,以及方便后续对话题热度进行分析,我们需要对话题进行描述。因此,本节主要关注如何根据聚类结果得到一个简洁精炼的话题描述。一个好的话题描述应该具备以下三个特点:(1)对话题高度描述性。话题描述是使用一句话或几个词语概要介绍当前话题所表达的信息,只有具有高度话题描述性的短语或词汇才能精简地概括话题内容,并且不遗漏重要内容。(2)良好的可读性。一个可读性良好,能够让读者轻松读懂并充分理解话题主旨的话题描述才是有意义的,因而话题的可读性也是非常重要的方面。(3)对不同话题具有可靠的区分度。如果两个不同话题或两个类似话题拥有同样的话题描述,将会带来一定的混淆,使读者无法了解真实话题内容。对于聚类之后的话题结果簇,最直接有效的方法是使用特征词进行话题描述,考虑到每个特征词语对话题表示的权重是不同的,所以可以在每个话题中挑选权重排名靠前的特征词作为话题描述词。jieba分词系统中给出了TF-IDF和TextRank两种特征词提取算法,因此,本文采用常用的TF-IDF来提取聚类结果中的关键词来表示微博话题。1.3微博热点话题评估分析微博本身并不具有热度属性,但是可以根据其相关特点和传播规律来评估微博话题的热度值。对于微博话题的热度估计,目前没有一个统一的度量标准。Xu等人[57]提出了一种Growth-TD算法,用来对微博热词进行评估。李汉才等人[58]提出根据微博话题的波动性和时序性特征来估计话题的热度,从而判断一个话题是否是热点话题。还有一种最直接的方法就是根据话题所包含的文本频数来估计话题热度,但由于受到网络等客观因素的影响,数据采集往往存在一定的缺陷,导致话题热度评估存在片面性。本节的主要研究内容是提出一种合理的微博热点话题评估方法。1.3.1H指数H指数是由物理学家Hirsch提出的一种评价指标[59],其定义为:某一位作者发表了N篇文章,将其被引频次的大小由高到低进行排序,当且仅当前H篇文章中每篇文章的被引频次至少为H,那么这个H值就是这位作者的H指数。H指数越高,也就意味着这位作者的学术影响力越大。H指数是通过作者所发表文章数目和文章被引用次数来综合评判作者的学术影响力,其思想方法也可以被用于其他相似的数据环境中。目前,已经有学者将H指数扩展应用于微博影响力评价中,周志峰等人[60]利用H指数建立微博评价指标体系,分析了我国“211工程”中25所大学图书馆微博影响力,并且他认为H指数具有很多优点,建议将H指数纳入新浪微博平台的数据分析中心,杨长春等人[61]将H指数应用于政务微博影响力分析,并验证了所建立的评价指标体系具有一定的合理性。加上H指数计算相对简单,结果相对稳定准确。因此,本文引入H指数来评判微博话题的热度。1.3.2话题热度影响因素微博话题的热度是由微博话题的综合因素决定的,通过对微博结构和话题的传播规律研究发现,对于微博平台而言,当一条关于突发事件、新闻热点或者可以引起广泛讨论具有争议的微博发布后,在一定的时间和范围内,关心并参与的微博用户比较广泛,则说明这条微博所涉及的话题事件受到的关注度较高。具体体现出来,就是这条微博得到了用户大量的转发、评论和点赞。根据对热点话题的研究发现,通常一条微博在进入大量用户视野之前都会遇到一个爆发点,这个爆发点可能是经过一个微台平台中具有权威性的用户转发或被微博平台编辑推荐。前一种情况通常是主要原因,因为微博平台的推荐以及二次编辑一般都是在话题已经在一部分人群中引起热议之后,将其推广开来,使更广泛的人群得以关注。这些权威性的用户一般是企业用户、高级别个人用户等大用户,在网络上具有较好的公信力,也拥有更多的粉丝,因此,他们对于话题的传播往往具有更大的影响。综合以上,将微博话题热度的影响因素总结为以下两方面:(1)话题词热度。从微博内容来看,微博信息中的评论数、转发数、点赞数通常反映了话题的传播热度。考虑到每个话题有多个话题词所描述组成,每个话题词可以来自多个文本,对话题影响力也是不同的。因此,本文借鉴H指数的思想,用话题词所在微博的评论数、转发数、点赞数的H指数来评判微博中某个话题词的热度。(2)用户参与度。从发布行为来看,对于某个话题,参与讨论的用户数量越大,尤其是拥有较多粉丝、对话题传播有较大影响的大用户所占比例越高,表明用户的参与度越大,对话题的影响力也就越高,该话题越容易成为热点话题。1.3.3话题热度值计算本文通过对微博话题传播规律进行分析,综合考虑微博话题热度的影响因素,通过引入H指数评价指标并选取话题词热度和用户参与度这两个维度进行话题热度值计算,综合得出微博热点话题。对于某个话题,本文给出了一种具体的微博热度值计算方法,相关定义如下。定义4-1话题词H指数。将某个话题词所在微博的被转发数、被评论数、被点赞数分别从高到低进行排序,直到前H篇微博的被转发数、被评论数、被点赞数各不少于H,得到某话题词被转发数、被评论数、被点赞数的H指数,分别记为,,。定义4-2话题词热度。一个话题由多个话题词组成,每个话题词对话题热度值贡献是不同的。话题词热度具体计算见公式(4-10)所示: (4-10)其中,,分别是包含某话题词所在微博的被转发、被评论、被点赞的H指数。定义4-3用户参与度。本文假设粉丝数达到1万的用户为大用户。用户参与度由包含话题词的微博总条数,包含话题词的微博参与用户数,和参与用户中大用户数量来度量。则用户参与度具体计算见公式(4-11)所示: (4-11)其中是包含某话题词的微博总数,是包含某话题词的微博参与用户数,是参与用户中大用户数。定义4-4话题热度。设某话题包含个话题词,综合话题词热度和用户参与度得出话题的热度计算公式如(4-12)所示: (4-12)使用公式(4-10)~(4-12),可以对每个主题下得到的各个话题进行定量的热度估计,根据计算出来的热度值大小得到一个话题热度排名结果,选择排名在前的话题作为我们所关心的热点话题。1.4实验与分析1.1.1算法比较及分析(1)话题聚类算法有效性对比。为了验证本文提出的FWS-AP算法对于微博话题聚类的有效性,本文设置了原始的affinitypropagation(AP)聚类算法,经典的K-medoids算法和本文提出的改进的FWS-AP算法进行对比,其中原始的AP算法使用频繁词集作为文本表示,K-medoids算法分别使用TF-IDF(K-medoids1)和频繁词集(K-medoids2)文本表示。在对四个主题进行频繁词集挖掘时,通过反复多次对比实验来得到参数最小支持度的最优解,最终确定新冠、5G、直播、打工人四个主题的取值分别为10、8、12、12。实验评价指标采用仍采用3.6.3节介绍的轮廓系数和CH值。在实验过程中,将每个微博主题下所有文本数据当成一个整体,分别对每个主题进行话题聚类实验,每组实验运行10次,计算得到聚类结果的平均轮廓系数和平均CH值,观察不同聚类算法在结果上的差异,实验结果如图4-3a)~b)所示。不同主题下四种聚类方法的轮廓系数Contourcoefficientsoffourclusteringmethodsunderdifferenttopics不同主题下四种聚类方法的CH值CHvalueoffourclusteringmethodsunderdifferenttopics图4-3不同主题下四种聚类方法的实验对比Fig.4-3Experimentalcomparisonoffourclusteringmethodsunderdifferenttopics由图4-3a)~b)的实验结果可知,本文提出的FWS-AP聚类算法在轮廓系数和CH值上均取得了较好的实验效果。首先,affinitypropagation算法相比于经典的K-medoids算法而言,不用事先指定每个主题下聚类的结果簇数目,从而对话题检测具有一定的灵活性。基于频繁词集的文本表示方法在一定程度上优于TF-IDF,主要是频繁词集提取的文本特征更加完整,比TF-IDF能够较为准确的表示文本。同时,实验结果表明,引入MinHash算法计算文本集合之间的相似度更加符合微博文本的特点,能有效实现对各个主题下的微博话题检测。(2)话题聚类结果对比。为了更加直观展示使用本文提出的FWS-AP算法得到的聚类结果的合理性,本实验在实验(1)实现微博话题聚类结果的基础上,选取5G主题下“2020世界5G大会”(话题1)、“华为海外市场5G依然快速增长”(话题2)和直播主题下“百度36亿美元全资收购YY直播”(话题3)、“封禁未成年用户直播打赏功能”(话题4)共四个话题展开讨论。实验过程中,采用实验(1)中的四种话题聚类方法就以上四个话题使用1.2.4节中的话题表示方法提取排名前6的话题词进行描述,所得结果如表4-1所示。表4-1不同聚类方法下微博话题结果Tab.4-1Weibotopicresultsunderdifferentclusteringmethods话题簇APK-medoids1K-medoids2FWS-AP话题1大会、联通、广州进程、挑战、未来2020、大会、成果、聚焦、关注、挑战2020、聚焦、广州、倒计时、大会、合作2020、5G、大会、世界、广州、聚焦话题2华为、全球、提出、目标、瞄准、领先华为、网络、5G、中国、采访、技术华为、互联网、5G、提出、领先、服务商华为、5G、技术、海外、快速、增长话题3百度、收购、协议直播、交易、业务百度、36、交易、平台、收购、业务百度、收购、YY、交易、亿美元、百度、36、亿美元、收购、YY、全资话题4未成年、管理、诱惑、注册、虚假、处理禁封、直播、注册、管理、未成年、平台禁封、未成年、加强、管理、注册、功能禁封、未成年、打赏、主播、直播、功能通过分析实验结果,本文的FWS-AP聚类算法得到的话题描述语义上比较容易理解,也能很好的表达话题内容,而其他算法的聚类结果,如原始的AP算法在话题1中提取的“联通”、“进程”描述词,所表达的话题含义不是很明确,不能准确辨识,对话题内容造成一定的混淆。K-medoids1和K-medoids2所得到的与真实的话题间也存在一定的偏差,如使用这两种方法得到的话题4聚类结果中,虽然“加强”、“管理”等描述词与主题含义上有一定的关联,但整体表达的内容和原本话题差别很大,结果不是很理想。因此,本实验验证了本文提出的FWS-AP算法对于微博话题聚类的有效性。1.1.2话题表示及热度评估实验本实验主要是验证本文提出的话题挖掘及话题热度评估分析方法的有效性,实验前在微博热搜搜索引擎上逐一使用关键词“新冠”、“5G”、“直播”、“打工人”搜索各个主题下的话题,并记录了各个主题下热度值排名前5的话题在新浪微博中的热度值。各个主题下话题热度值及排名详细信息如表4-2~4-5所示。表4-2新冠主题下新浪热点话题Tab.4-2Sinahottopicsunderthenewcrowntheme新浪微博排名热点话题新浪热度值1陈薇团队为新冠康复者研制新药2157842兰州一冷链食品标本新冠检测阳性1692623法国首次发现养殖水貂感染新冠病毒1690194张文宏称流感新冠合并感染在冬季常见1540995浦东机场高风险岗位新冠疫苗应急接种86035表4-35G主题下新浪热点话题Tab.4-3Sinahottopicsunderthe5Gtheme新浪微博排名热点话题新浪热度值1北斗5G等新技术试点应用于北京地铁22932022020世界5G大会1789963华为海外市场5G依然快速增长1678344全球5G网络三分之一来自中国技术15005755G网络将覆盖所有地级城市城区130811表4-4直播主题下新浪热点话题Tab.4-4Sinahottopicsunderthelivetheme新浪微博排名热点话题新浪热度值1薇娅双十一直播31033122唐嫣直播2600453百度36亿美元全资收购YY直播1934794李佳琦回应直播带货新规1223605封禁未成年用户直播打赏功能20673表4-5打工人主题下新浪热点话题Tab.4-5Sinahottopicsunderthethemeofhittingworkers新浪微博排名热点话题新浪热度值1宋运辉打工人8436862加油打工人2150553早安打工人已被注册商标1768184丁辉是打工人的真实写照1226045打工人的圣诞节104993在本实验中,利用本文提出的FWS-AP微博话题检测方法对之前得到的各个微博主题文本分别进行话题聚类,然后利用1.2.4节中的话题表示方法提取排名前6的话题词对话题结果进行描述,并使用话题热度计算公式(4-10)~(4-12)分别计算了每个主题下各个话题的热度值,分别选取了每个主题下热度值排名前5的话题进行展示。通过实验得到的各个主题下话题表示、话题热度值如表4-6~4-9所示:表4-6新冠主题下话题描述及话题热度值Tab.4-6Topicdescriptionandtopicpopularityvalueunderthenewcrowntheme本文排名话题描述词本文热度值新浪微博排名1陈薇、新冠、康复者、研发、新药、临床48.4612法国、养殖、水貂、新

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论