DB4401∕T 12-2018 网络舆情分级与判定_第1页
DB4401∕T 12-2018 网络舆情分级与判定_第2页
DB4401∕T 12-2018 网络舆情分级与判定_第3页
DB4401∕T 12-2018 网络舆情分级与判定_第4页
DB4401∕T 12-2018 网络舆情分级与判定_第5页
已阅读5页,还剩24页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

备案号:DB4401DB4401/T12—2018网络舆情分级与判定Classificationandjudgmentfornetworkpublicopinion2018-10-10发布2018-12-01实施广州市质量技术监督局发布IDB4401/T12—2018前言 Ⅲ 12术语和定义、缩略语 12.1术语和定义 12.2缩略语 13网络舆情评价一般流程 24指标体系 25指标量化 35.1量化要求 35.2事件指标 3 45.4媒体指标 55.5舆情态势指标 66综合评价 77等级划分与风险程度评价 77.1等级划分 77.2结果评价 8附录A(资料性附录)文档主题生成模型 9附录B(资料性附录)基于层次分析法(AHP)的权重计算方法 DB4401/T12—2018本标准按照GB/T1.1—2009给出的规则起草。本标准由中国共产党广州市委员会宣传部提出并归口。本标准起草单位:广州市网络舆情信息中心、广州市标准化研究院、广州市云润大数据服务有限公本标准主要起草人:李伟滨、陈韶航、徐湛、萧玉珊、王贺珍、郑裕钊、曾庆贤、林毅、李永康、陈敏华、陈振兴、裴炜。本标准是首次发布。DB4401/T12—20181网络舆情分级与判定本标准规定了网络舆情研判评价的一般流程、指标体系、指标量化、综合评价、等级划分与风险程度评价等内容。本标准适用于广州市网络舆情的监测、评估、预警及相关软件开发等。2术语和定义、缩略语2.1术语和定义下列术语和定义适用于本文件。2.1.1网民倾向性Netizens'tendency网民对舆情的评价和态度取向。2.1.2焦度Focalpower舆情在传播过程中最受关注点所处的状态。2.1.3拐度Flexion舆情生命周期中拐点所处状态。2.1.4网站的PR值PageRank全称为PageRank,是google搜索排名算法中的一个组成部分,级别从1到10级,10级为满分,PR值越高说明该网页在搜索排名中的地位越重要。2.1.5传播扩散度Propagationdiffusivity影响网络舆情信息安全的重要指标之一,它用来刻画某一具体的舆情事件或细化主题的相关信息在一定的统计时期内通过互联网呈现的传播扩散状况。2.2缩略语下列缩略语适用于本文件。AHP:层次分析法(TheAnalyticHierarchyProcess)LDA:文档主题生成模型(LatentDirichletAllocation)2DB4401/T12—20183网络舆情评价一般流程网络舆情评价工作应遵循一定的流程,主要包括以下三个环节,如图1所示:a)舆情获取与分析:全面收集数据并获取网络舆情源头,对涉穗数据进行分类筛选,对影响因素进行细致辨识;b)数据分析:构建层次结构的指标体系,选择科学可行的方法,进行定性和定量的数据处理;c)评价与措施:对舆情的危险程度进行分析,得出评价结果,给出建议的处理方法。VIVV网络舆情评价一般流程网络舆情评价一般流程VVVIVIVIVI图1网络舆情评价一般流程4指标体系网络舆情评价指标体系包括事件指标、网民指标、媒体指标、舆情态势指标等,这些指标又包含各自的子参数,构成了一个层次的指标体系,如图2所示。针对不同的对象可选择不同的指标,包含但不限于这些指标。DB4401/T12—20183事件性质(P11)事件指标(P1)事件指标(P1)事件风险度(P13)网络舆情评价指标体系网络舆情评价指标体系情感倾向度(P23)媒体权威度(P31)媒体指标(P3)媒体指标(P3)传播阶段(P33)舆情态势指标(P4)关注度(P42)图2网络舆情评价指标体系5指标量化5.1量化要求5.1.1对网络舆情评价各指标量化可采用定性或定量的方法,标度范围为[0,1]。5.1.2对指标定性量化以评价小组成员的平均值作为最终量化值。评价小组成员应受过专业培训。5.2事件指标5.2.1事件性质P11DB4401/T12—20184按照社会矛盾产生的原因对涉穗舆情信息主题进行分类,通常包括公共安全、群体事件、重大灾害、官员负面、经济财经、城市治理、意识形态等。事件性质可以通过文档主题生成模型(LDA,参见附录A)进行聚类分析,其它合适的分析方法亦可使用。5.2.2事件波及度P12网络舆情波及度是衡量所有网络媒体中涉及到相关信息网站的比例指标。这一指标的意义在于评判某一话题在网络中传播的广泛程度,或网民在任意登陆一家网站后能够获取到相关信息的概率。波及度为一个在[0,1]之间的值,可由公式(1)计算。……(1)P12——波及度;N1——表示涉及到相关信息的网站数量;wi——表示网站的权重;Sj——表示网站涉及到与事件相关的信息程度;N——表示网站总数量。5.2.3事件风险度P13网络舆情信息内容风险度是指某一特定的网络舆情信息内容可能造成的危害程度,与评估者的着眼点密切相关,如涉及重大安全事故、重大舆论危机等的负面舆情信息内容,风险度就较高。其评判结果是通过专家问卷调查确定的,可分为高风险、一般风险、无所谓、不敏感四档。网络舆情信息内容风险度经过专家问卷调查确定,构建层次分析法(AHP,参见附录B)的判断矩阵5.3网民指标5.3.1网民活跃度P21网民活跃度通过单位时间内发布信息次数、回复次数来衡量,计算方式见公式(2)。………(2)P21——网民活跃度;A(t)——在t时刻相关事件的网民活跃值,见公式(3);tend——最近更新时间;tstart——发布时间;N——平滑参数,表示网民活跃值大于N时具有参考价值。………………(3)DB4401/T12—20185A(t)——在t时刻相关事件的网民活跃值;Na——网民行为种类数量;wi——各种行为的权重,权重之和为1;Pi(t)——网民在t时刻对事件发布的信息、回复等各种对信息的关注行为次数。5.3.2网民结构P22网民结构包括年龄结构、教育程度结构等多个三级指标。通过文本挖掘技术的智能分析,得出一个在[0,1]之间的值,如:判别式方法、矢量距离法、贝叶斯方法、记分器方法等。经过问卷调查、专家确定,将网民结构档次分为四档,分别是网民结构不好、一般、好、很好。对应的网民结构得分如表1所示。表1网民结构得分表好5.3.3情感倾向度P23网民情感倾向度是民众对现实或社会问题等态度、意见、看法、要求等主观性综合反映。情感倾向度指标用以刻画针对某一特定的网络舆情信息,民众所持有的观点态度(即民意)倾向。可以通过对网民回贴关键字、褒贬义词进行分析,统计出网民对该舆情情感倾向的概率分布。5.4媒体指标5.4.1媒体权威度P31媒体权威度衡量了某个媒体的可信度和影响力,是一个网络媒体的最重要指标之一,常以PR值进行表征,见公式(4)。它包括了媒体的性质(政府,综合大站,娱乐大站,其他),网站新闻真实可靠的比例,以及网民大众对该网站的关注人数等。P31 PR——媒体权威度;——网站的PR值,可由站长工具输入网址得到,取值范围为[1,10]。5.4.2传播扩散度P32指在一段时间内,网络舆情在不同网络媒体中传播的速度,媒体舆情扩散度越大,网络媒体影响力也大。传播扩散度表征了某网络舆情信息在一定时间内的变化趋势,可以反映舆情信息是在海量的舆情信息中湮没,还是有可能带来舆情泛滥,可以通过公式(5)进行计算。…………………(5)x1+x2+x3DB4401/T12—20186P32——传播扩散度;Tend——最近的一次观察时间点;Tstart——之前的一次观察时间点;x1——Tend-Tstart网站新闻条数;x2——Tend-Tstart微博中有关事件条数;x3——Tend-Tstart微信中有关事件条数。5.4.3传播阶段P33传播阶段包括传播量、传播权威度、传播时间三个指标。传播量为新闻的全网总数,包括新闻网站、微信、微博。传播权威度为新闻传播网站的媒体权威度,可以通过公式(6)进行计算。…………………(6)−1…………………(6)P33——传播权威度;a——一般情况下,a=1.2;x1——网站新闻条数;x2——微博中有关事件条数;x3——微信中有关事件条数;Tend——最近的一次观察时间点;Tstart——之前的一次观察时间点。∈[0,0.2],那么该新闻处于萌芽期;当P33∈[0.2,0.45],那么该新闻处于上升期;当P33∈[0.45,1],那么该新闻处于爆发期;当P33∈[0.2,0.45],那么该新闻处于下降期(经过爆发期之后下降时);当P33∈[0,0.2],那么该新闻处于消退期(经过爆发期之后下降时)。5.5舆情态势指标5.5.1热度P41舆情关注度一般用主题下相关网页的数量来衡量。可通过改写过的逻辑函数Y降低数量级作为参数,赋予每个不同类别的新闻数量一定的权重,得到新闻的热度。热度指数能客观反映事件、人物、品牌、地域等在互联网上的受关注程度。热度指数所呈现的数值为[0,1],数值越大,表明其网络受关注度越高。热度计算公式见公式(7)。Y3b4……(7)P41——热度;Y1——网站新闻的合成结果;b1——Y1的权重系数,权重比率为40%;Y2——微博的合成结果;b2——Y2的权重系数,权重比率为45%;Y3——微信的合成结果;b3——Y3的权重系数,权重比率为10%;DB4401/T12—20187Y4——视频的合成结果;b4——Y4的权重系数,权重比率为5%。-1……i——第i项新闻、事件的合成结果,i=1、2、3、4;ai——第i项标准化公式参数,i=1、2、3、4,a1是网站新闻标准化公式参数1.05,a2是微博标准化公式参数1.001,a3是微信标准化公式参数1.005,a4是视频标准化公式参数1.1;xi——第i项新闻、事件条数,i=1、2、3、4,x1是网站新闻条数,x2是微博中有关事件条数,x3是微信中有关事件条数,x4是视频中有关事件条数。5.5.2关注度P42关注度会随着时间的变化而变化,新出来的新闻会较为受人们所关注,舆情关注度可根据公式(9)进行计算。……(9)P42——关注度;Qcounts——截至目前为止话题的总指数;Qage——距离话题发表的时间(天);Qchanges——最近一次更新的指数增长量,一段时间内话题的增加数目;Qupdate——最近一次更新时间(天)。6综合评价根据第5章得出的各单项评分结果,按公式(10)依照单项结果的加权平均得出综合评价的结果。………(1o)R——综合评价得分;n——指标项的个数;wi——第i项指标的权重,具体指标参见第5章;Pi——第i项指标的得分。7等级划分与风险程度评价7.1等级划分网络舆情划分为4个等级,分别为蓝色祥和区(良好区)、绿色安全区(正常区)、橙色警戒区(基本安全区)和红色警戒区(不安全区),具体如下:a)蓝色祥和区:表示安全,正常网络信息流通,没有引起网民的关注,没有舆情倾向;DB4401/T12—20188b)绿色安全区:表示相对安全,网民对该网络信息关注度低,传播速度慢,没有转化为舆情的可c)橙色警戒区:表示临界,网民对该网络信息关注度较高,传播速度中等,具有转化为舆情的可d)红色警戒区:表示危险,网民对该网络信息高度关注,传播速度快,已经形成舆情,表现出一定的社会效应。7.2结果评价综合评价得分取值区间为[0,1],根据大量数据统计、实验发现如下规律:a)综合得分越高,事件的风险程度越高;b)综合得分在0.3及以下的事件,一般为安全、和谐的事件;c)综合得分在0.3到0.5之间的事件,一般为比较安全的事件,这类事件如果不再有更大的因素触发,会慢慢地冷却;d)综合得分在0.5到0.7之间的事件,一般为比较热的事件,如果有负面的因素触发,很有可能转为负面、危险事件,一般为临界事件;e)综合得分在0.7及以上的事件,一般为社会影响比较大的事件,该类事件传播速度快,多带有负面影响,可定为高风险事件。根据综合得分及其对应的事件等级、风险程度规律,确定4个等级的评价尺度表,见表2。表2评价尺度表4321DB4401/T12—20189(资料性附录)文档主题生成模型A.1概述LDA文档主题生成模型是一种对离散数据集(如文档集)建模的概率主题模型,其中有两个重要的概率分布:Dirichlet分布和多项式分布,且Dirichlet分布是多项式分布的共轭先验。A.2Dirichlet分布和多项式分布Dirichlet分布被认为是分布之上的分布。K维Dirichlet分布的定义如下(公式(A.1。pkαk−1………………(A.1)p=(p1,...,pk),α=(α1,...,αk),且α1,...,αk是相等的。Γ是伽马函数,当n是正数时,有公式(A.2)。Γ(n)=(n−1)!……(A.2)多项式分布的定义如下(公式(A.3。Multipixi……………(A.3)xi表示数值i在样本中出现的次数。若p的先验概率如公式(A.1)所示,由Dirichlet分布和多项式分布共轭可知,p的后验概率为(公式(A.4即p的先验分布和后验分布的形式是一样的,都是Dirichlet分布。A.3LDA文档主题生成模型LDA认为文档是由多个主题按某种比例混合构成,而主题是单词上的多项式分布,见表A.1。表A.1LDA中的参数说明α主题k的词分布DB4401/T12—2018表A.1LDA中的参数说明(续)βK文档d的主题分布Nd文档d中的特征单词数Zd,nDWd,n文档d中第n个词LDA概率主题模型生成文本的过程如下:a)对于主题Z,根据Dirichlet分布(公式(A.1))Dir(β)得到该主题上的一个单词多项式分布向量φ;b)根据泊松分布P和公式(A.4)得到文本的单词数目N;c)根据Dirichlet分布(公式(A.1Dir(β)得到该文本的一个主题分布概率向量θ;d)对于该文本Nd个单词中的每一个单词Wd,n:1)从θd的多项式分布(公式(A.3中随机选择一个主题Zd,n;2)从主题Zd,n的多项式条件概率分布(公式(A.3))选择一个单词作为Wd,n。A.4LDA模型的参数推断采取Gibbs抽样算法计算LDA模型中最重要的两组参数——各主题下的词项概率分布、各文本的主题概率分布。在已知文本集(即生成的结果)的情况下,通过参数估计得到参数值。根据图模型,可以得到一篇文本的概率值。通过积分避开了实际待估计的参数,转而对每个单词的主题进行采样,一旦每个单词的主题确定下来,参数就可以在统计频次后计算出来。因此,参数估计问题变为计算单词序列下主题序列的条件概率,其公式如下(公式(A.5。……(A.5)(k)z¬i为除去当前词后的所有词的主题分配;w为所有词;cd,¬i为除当前词以外,文档d中主题k产生(v)的词的个数;ck,¬i为除当前词外,主题k词v出现的次数;V为词项数。一旦获得每个单词的主题标号,需要的参数计算公式可由下面公式(公式(A.6)、(A.7计出。…………………(A.6)DB4401/T12—2018为文档d中主题k所占比例,φ表示主题k中词v所占比例。A.5LDA模型训练和推理利用Gibbs抽样公式,建立基于语料训练的LDA模型,并应用训练得到的模型对新的文档进行topic语义分析。训练的流程如下:a)随机初始化:对语料中每篇文档中的每个词w,随机赋一个topic编号z;b)重新扫描语料库,对每个词w,按照Gibbs抽样公式重新采样它的topic,在语料中进行更新;c)重复以上语料库的重新采样过程直到Gibbs抽样收敛;d)统计语料库的topic-word共现频率矩阵,该矩阵就是LDA的模型。在LDA模型训练的过程中,取Gibbs抽样收敛之后的n个迭代的结果进行平均来做参数估计,模型质量更高。A.6新文档语义预测按照Gibbs抽样公式实行迭代收敛后,得到文档的主题分布,从分布中选择概率最大的对应主题作为文档的主题。DB4401/T12—2018(资料性附录)基于层次分析法(AHP)的权重计算方法B.1概述AHP法是一种定性与定量相结合多目标决策和规划的分析方法,被广泛应用于多目标、多要素、多层次的非结构化问题的解决方案中。确定舆情指标权重的步骤如下。B.2构建递阶层次结构模型把问题层次化,根据问题的性质和要求达到的总目标,把问题分解成不同的组成因素,根据因素间的相互关系影响及隶属关系,把各因素按不同层次聚集组合,形成一个多层次

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论