版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
摘要近年我国高等教育急速发展,竞争压力越来越激烈,大学生的心理健康问题也明显增加,因心理健康问题导致的大学生自杀等令人惋惜的沉痛事件时有发生。根据对北京23所高校的调查,16%的学生存在心理问题,达到严重程度的占3%到5%,这使大学生的心理健康问题成为社会焦点。大学作为培养全面发展高素质人才,更应该承担起大学生心理健康相关任务。传统的心理辅导教育过程,包括线下对学生进行心理测试,根据心理测试结果和谈话方向建立心理档案,这不仅对部分同学来说有压力,对于心理辅导员同样是很大的工作量。而借助网络进行心理健康教育作为一种新的心理教育方式,越来越受到导师和学生们的喜爱,网络的形式使心理教育过程拥有更好的私密性,同时也能让导师花费更少的精力获取更多的信息。本文从大学生心理健康状况的实际出发,结合所学习的软件开发的知识,设计出相对比较适合当前发展需要的大学生心理健康管理平台。本文重点分为两部分,第一部分以《SCL-90症状自评量表》为测量工具,对学生进行心理测试,作为对学生心理状况的初步了解,从各个维度评判学生状态,找出学生心理异常的侧重点。第二部分则对于第一部分心理测试成绩不理想的同学进行进一步的社交状态考察,本文以微博为例,利用python爬虫对某同学的特定的微博文本进行爬取保存;而后对原文本运用jieba工具进行中文分词和词频统计,使之更容易为后续的文本分析所用;最后用wordcloud和snowNLP对分割的词语进行情感分类,以词云的形式输出消极方面的词语和积极方面的词语,帮助导师找到可能导致学生心理状态异常的相关信息。关键词:大学生心理健康;舆情分析;情感分析;中文分词
AbstractInrecentyears,withtherapiddevelopmentofhighereducationinourcountry,thepressureofcompetitionismoreandmoreintense,andthementalhealthproblemsofcollegestudentsarealsosignificantlyincreased.Becauseofthementalhealthproblems,droppingoutofschoolorevensuicidesoftenoccur.Accordingtothesurveyof23collegesanduniversitiesinBeijing,16%ofthestudentshavepsychologicalproblems,accountingfor3%to5%oftheseriousdegree,whichmakesthementalhealthproblemsofcollegestudentsbecomethesocialfocus.Asthetrainingofall-rounddevelopmentofhigh-qualitytalents,universitiesshouldundertakethetasksrelatedtocollegestudents'mentalhealth.Asanewwayofpsychologicaleducation,mentalhealtheducationwiththehelpofnetworkismoreandmorepopularwithteachersandstudents.Theformofnetworkmakestheprocessofpsychologicaleducationhavebetterprivacy,atthesametime,itcanalsomaketeachersspendlessenergytogetmoreinformation.BasedontherealityofCollegeStudents'mentalhealthandtheknowledgeofsoftwaredevelopment,thispaperdesignsamanagementplatformforcollegestudents'mentalhealthwhichisrelativelysuitableforthecurrentdevelopmentneeds.Thispaperisdividedintotwoparts.Inthefirstpart,theSCL-90symptomchecklistisusedasameasurementtooltotestthestudents'psychology,asapreliminaryunderstandingofthestudents'psychologicalstate,tojudgethestudents'statefromvariousdimensionsandfindoutthekeypointsofstudents'psychologicalabnormality.Inthesecondpart,thestudentswhosescoresinthefirstpartofpsychologicaltestarenotidealarefurtherinvestigatedonsocialstatus.Thispapertakesmicroblogasanexample,usesPythoncrawlertocrawlandsavethespecificmicroblogtextofacertainstudent;thenusesthejeebatooltomakeChinesewordsegmentationandwordfrequencystatisticsfortheoriginaltext,makingiteasierforsubsequenttextanalysis;finallyuseswordcloudandSnOwnlpclassifiesthesegmentedwordsbyemotion,andoutputsthenegativewordsandthepositivewordsintheformofwordcloudtohelpthetutorfindtheinformationthatmayleadtotheabnormalmentalstateofstudents.Keywords:CollegeStudents'mentalhealth;publicopinionanalysis;emotionalanalysis;Chineseparticiple第1章引言1.1选题的目的及意义大学生即将踏入社会,一面为以后的工作生活积累经验,一面还留在最后的校园保持着天真的学生气息,两方面的舆论信息同时对学生的思想和心理进行冲击,很容易导致学生自己无法消化产生消极和错误的想法,让一些心理防线本就脆弱或偏激的学生做出无法挽回的举动[7]。这不仅对个人的生活产生影响,也给学校相关方面带来隐患,甚至在他们走向社会的时候给社会稳定和国家安全带来隐患。探究大学生受社会舆情影响的心理变化,把握高校舆情危机的内在特点与外在影响因素,构建系统的高校网络舆情危机应对机制,更有利于了解大学生在应对社会舆情时可能做出的反应,便于学校心理辅导员与需要帮助的同学及时联系、解决问题,在帮助大学生正确看待社会问题的方面具有很大的促进作用,从而更好的维护高校的良好形象,保障大学生的身心健康[8]。1.2国内外研究现状在许多的西方国家,从孩子开始学业就创建了他们自己的心理档案,学校里也有心理工作者对孩子进行观察与评估,定期的为学生进行日常心理辅导、心理诊断、心理咨询、心理评估和心理干预。学生的档案保存在网上,可供学生个人或专门的心理人员查阅,但同时遵循保密原则,无关人员无法查看。综上,国外许多国家对于心理相关问题相当重视,也建立了相对完善的管理体系,这些对我国学校心理健康教育有很大启发意义。相比而言,根据中国青少年研究中心2010年对大学生心理问题的研究,大多数大学生在出现较常见的心理问题时,更倾向于向自己的朋友、家人甚至素未谋面的网友进行倾诉,却很少人选择专业的心理机构进行正规的心理辅导。大众对于心理辅导的传统印象也是更偏于负面的、无用的,这种刻板的印象可能会导致一些想要进行心理辅导的人选择放弃。大学生可以接触到的心理知识,主要来源于网络和各类心理讲座,接触途径少,导致学生不能很好的判断自己的心理健康情况,也无法及时的做出自我诊治与求助,致使许多悲剧发生。如今随着信息化的发展,为大学生建立一个心理健康系统平台以保证学生能拥有更好的心理状态成为心理问题一条有效的解决途径。网络平台可以通过专业的心理测试以便导师和学生自己了解每个学生的状况,也通过舆情分析帮助导师及时发现学生可能存在的问题。有关文章中表示:“加强复杂环境下大学生心理健康舆情信息的搜集、整理、追踪、引导、服务,提供教育工作具有针对性的决策保障,是新时期学生思想政治工作和大学生管理服务工作的新课题。”由此可以看出大学生心理健康舆情引导的意义与价值,值得我们更多人关注与参与到其相关的工作方面中去[6]。1.3主要研究内容舆情分析是根据具体问题的需要,对舆情进行深入思考、分析和研究,推导出相关结论的过程。随着多元化发展,越来越复杂的社会环境影响着学校环境,也对大学生心理产生了许多隐蔽的影响,因此舆情分析系统越来越多的被应用于大学生心理健康分析相关领域[3]。本文从当前相关研究状况出发,主要考虑以下几个方面的问题:(1)数据采集与预处理。选择学校心理测试结果和微博平台数据作为数据集,运用微博API和数据爬虫实现对微博数据的实时采集,去除无关数据和噪声数据,处理空缺值,为后期数据分析提供准确简洁的数据集。(2)对数据文本进行关键词检索。利用分词工具对微博文本进行文本分词、停用词过滤、特征提取,检索文本数据中有关焦虑、抑郁等关键词信息,结合心理测试结果,得到心理状态异常的相关学生信息。(3)对于心理异常学生的相关数据进行检索,找到可能影响学生心理状态的事件与原因,方便教师与学生交流。
第2章相关技术分析2.1数据采集技术数据收集是舆情分析的第一步。能否及时、全面地获取数据,直接影响到舆情分析的后续工作。本系统运用两种工具来进行数据采集,一种是网络爬虫技术,另一种是对外开放的微博API。2.1.1网络爬虫网络爬虫是一个能够根据检索要求自动抓取互联网信息的程序,它通过访问互联网中的链接地址,按照一定的策略,在Internet中搜索并收集需要检索的内容。网络爬虫是搜索引擎的重要组成,它能以特定的关键词查找并返回所找到的信息的资料清单,搜索引擎对原始网页的信息进行重新组织,建立信息库,再由关键词查找到相关文件,并对文件进行整理排序,将整合完成的结果返回给用户。大部分网络爬虫的通用框架如图所示:网络爬虫作为应用程序是十分脆弱的,因为它涉及到数以万计的web服务器和许多域名服务器的交互,而这些内容都远远超过了系统的控制范围。网站爬行速度是由自身的Internet连接速度和爬行的站点的速度共同决定的。特别是当一个站点从多个服务器抓取数据,且多个下载并行时,总抓取时间可以显著减少。尽管有许多的网络爬虫程序,但它们的核心本质上都是一样的,以下为网络爬虫的工作流程:下载网页。解析下载的网页并检索所有链接。对于每个检索的链接,重复上述过程。由此,我们可以将所有网页分为五个部分:(1)已经被下载还没有过期的网页。(2)已经被下载但已经过期的网页:得到的页面事实上是检索到的内容的复制,Internet上的网站是不断变化的,下载网站的许多内容产生了变化,这些网站就是已经过期的。(3)正在等待下载的网页:也就是下一步需要检索并爬取的网页。(4)可知网页:还没有进行检索,也没有在待检索列表,但是对已检索的页面进行分析可以得到的这些页面,称之为可知页面。(5)不可知页面:除了上述几种类型,还有一些网站网络爬虫无法检索爬取,于是称之为不可知页面。在网络爬虫中,待检索网页列表是最为关键的一部分。在这些网页中决定先对哪个进行抓取,后对哪个进行抓取的排列顺序也是极为重要的,这极大的影响着网络爬虫的工作效率,因此针对不同类型的抓取对象,需要合适抓取策略。以下为几种常见的抓取策略:(1)深度优先遍历策略根据深度按照从低到高的顺序依次检索下一级网页,直到检索到最深层网页为止。完成一个爬行分支后,网络爬虫返回到上一层网页节点以继续搜索其他网页。当所有网页都被检索后,此次爬取过程结束。深度优先遍历可以遍历一个网站深层嵌套的所有内容,但当网站层次过于深时,可能造成爬虫陷入无法返回的情况,会对资源造成巨大的浪费。(2)广度优先遍历策略该策略根据内容目录的深度来对页面进行抓取,首先选择抓取的是目录层次较浅的网页。当同一级别的所有网页都抓取完成后,爬虫再进入更深一层的网页进行抓取。广度优先遍历可以避免在遇到网站过深时爬虫陷入无法返回的问题,同时在同一层次抓取完毕后才进入下一层次使其无需存储中间节点等待回读,节省空间,但一层一层检索会造成爬取到深层次页面的时间过长。(3)最佳优先搜索策略该策略是网络爬虫利用网页分析算法对待爬取的页面和目标页面之间的相似程度,或者主题的相关程度进行计算,选择相关度最佳的网页进行爬取。这种策略是往往是常被使用的搜索策略,但这种策略是一种局部优化,网络爬虫可能会因此略过其他相关页面。在实际应用中应根据具体需要进行优化。2.1.2微博APIAPI,即应用程序编程接口,是一个抽象的概念。它通过提供一些接口,使应用程序或者相关开发人员无需访问源代码,或理解其框架内部工作细节,直接为他们提供访问一组例程的能力。开放一直是互联网的核心要义。由于网络水平的进步,用户对软件的要求也有来越苛刻,对于单一互联网企业来讲,只凭借自身力量很难满足用户各方面各层次的需求,所以越来越多的企业选择开放之路,以凭借第三方力量不断完善自己的作品,在互联网市场站稳脚跟,于是向第三方开发者提供可以访问自家应用的API接口也成为大势所趋。新浪微博API正是如此。新浪服务商将一部分平台服务进行封装并对第三方开发者无条件开放,使之可以利用微博API得到相应的服务,这也使得新浪微博无成本的取得了更多用户的使用和关注,从而降低运营成本。2.2文本预处理技术文本预处理需要为后续的文本分析做好预备工作,通过对文本进行预处理,将大段的文本内容处更容易被计算机所识别利用的形式。文本预处理通常包括中文文本分词和去停用词两项操作。2.2.1中文文本分词不同于英文句子每个词之间以空格间隔,可以很方便的对词语进行分割,中文句子中没有明显的可分割标志,这就使中文文本分词的难度大大增加。因此,能否对中文文本进行自然准确的分割,是整个中文信息处理的关键。现有的中文分词算法可分为三大类:基于字符串匹配的分词方法、基于统计的分词方法以及基于理解的分词方法。(1)基于字符串匹配的方法字符匹配又叫做机械分词方法,它是以某种策略将要分析的中文字符串与一个预设好的词典中的词语逐条进行匹配,如果在词典中能够找到这个字符串,则为匹配成功。依据不同的扫描方向,字符串匹配方法可分为正向匹配和逆向匹配;依据优先匹配的长度不同,可以分为最长匹配和最短匹配;(2)基于统计的方法在整篇文章中,相邻的字同时出现的频率越高,它们组成一个词的可能性就越大,因此相邻的字同时出现的频率或者概率能比较好的反映它们成为一个词组的信度。对文本中相邻的字同时出现构成的词组出现的频率进行统计,计算它们同时出现的信息。定义两个字同时出现的信息,计算这两个字的相邻且同时出现的概率。这种信息体现了字与字之间结合的紧密程度。当紧密程度大于某个临界值时,便判定这两个字可能组成了一个词组。统计方法只对文本中字与字之间的频率进行统计,不需要机器词典,因此又叫无词典分词。但此方法也有一些缺点,可能有一些字与字之间相邻且同时出现的频率较高,但不是词组,造成混淆,并且这种方法对常用词的识别精度较差。(3)基于理解的方法这种分词方法就是基于模仿人类对句子的理解,使计算机识别中文词组,达到切分的效果。即对文本进行句法语义分析,利用分析得到的句法语义信息对文本分词同时处理歧义。它一般由分词子系统、句法语义子系统和总控三部分组成。分词子系统在总控部分的指挥下,可以获取词和句子的句法语义信息来判断分词是否歧义,由此达到模拟人类对句子的理解过程的目的。但这种基于理解的方法需要大量的相关语法知识和大量信息,而中文语法知识本就相对庞大、复杂,计算机很难以此方式理解中文本文,更难以将其翻译为可以直接利用的形式,因此此方法用的并不是很多,还在完善阶段。虽然有关算法研究正在不断进步,但就目前而言,中文文本分词还存在着以下几个主要问题:未登录词问题随着社会发展,越来越多的新词汇被创造出来,还有许多人名、地名、企业名以及新发展的专有名词,词汇的数量越来越庞大,组合也愈加复杂,但是这些词却必须在分词中被单独切分出来,否则会影响其他数据的质量,对后续的文本分析产生恶劣影响。想要实现对未登录词的自动识别,目前来说难度还较大,解决这类问题大多时候是靠人们对分词水平和语言构造的更深层次的了解。(2)歧义问题对于中文文本中的某一段文字,时常会出现多种切分方法的情况,这种情况叫做切分歧义现象。中文文本分词的过程并不是从文本中找词语的过程,由于每个字与字之间都有多种切分可能,中文分词需要选择一个可能性最高、最符合实际情况的字与字组成词语,进行切分。歧义切分是中文文本分词中经常会遇到的问题,能否较好的处理歧义切分的问题,是中文文本分词中的关键一步。2.2.2文本去停用词在信息搜索中,为了节约存储空间,增加检索水平,在处理文本时,会过滤某些字词,这些被过滤的词就叫做停用词。停用词一共有两种,一种是这些字词本身没有什么实际意义,只有在完整的句子中才有一定作用,因此去掉后不会对原文本的意思表达有太大影响,如语气词、连接词、限定词、拟声词等;还有一种词使用范围较为广泛,若进行检索可能检索到大量无用数据,对这样的词计算机无法给出真正相关的检索结果,难以缩小检索范围,造成检索结果混乱,降低检索效率,所以通常把这类词从文本中剔除,以提高检索性能。停用词的识别依据主要是停用词表,而停用词表是由人工输入的、而非自动形成的,因此如果使用的停用词表不同,进行分词的结果可能造成一些不同。若针对具体业务,可按照业务需要,专门整理出对此业务没有意义的词,以提高准确率。总而言之,去停用词需要根据目的决定哪些词作为停用词,理论上任何词语都可以被选择为停用词,关键在于选中的词汇是否对文本有实质性的帮助。2.3文本分析技术2.3.1文本情感分析文本情感分析又叫做意见挖掘。通俗地讲,就是对于给定的文本进行有关情感偏向的分析,确定文本作者对所描述的事物持有的态度是积极态度还是消极态度。人们每天都要在社交网站或电商平台上发表大量信息和带有主观色彩的评价,对于新闻热点、某件商品、某些服务的观点,潜在的表现出他们的好恶。而对于一些企业来说,通过人们带有情感色彩的各项言论来了解大众舆论对于他们自身产品的看法可以帮助他们更好的修正作品,增加用户对产品的好感度,使其对产品信赖程度增加。较为常用的文本分析技术可以分为四类:关键词识别、词汇关联、统计方法、概念级技术。关键词识别是通过对文本中明确带有情感偏向的影响词的定位来进行的,影响词如高兴、悲伤、愤怒、恐惧、焦灼等,是直接与情感相关的形容词。词汇关联除了以上对关键词的识别,还着力于寻找词语和某种情绪之间的关联,即使这个词语不带有明显的感情色彩,但如果它和某种情绪表达往往一同出现,就表明该词汇可能也带有情感偏向。统计方法通过调用机器学习中的元素,如潜在语义分析、支持向量机等,用统计的方法对文本进行综合分析,探索词语之间的深层结构含义,得到与目标关键词语义相近的词语。对于不同的语境,也许相同的词语表现得含义也不尽相同,一些更智能的算法试图模拟人们在指定情景下对于某件事物的情感倾向,想要探索这种更高级的模式,需要对中文语法之间的关系有深入理解,语法之间的关联性也需要更深度的剖析文本关系才能获得。与上述简单的关键词查找关联不同,概念级的算法添加了知识表达的部分,如知识本体、语义网络,因此许多较为微妙的情感色彩可以由此被探索出来。
第3章需求分析3.1系统设计目标结合实际需求和大学生心理健康的具体情况,利用计算机网络技术,设计一个符合心理健康教育的辅助教育网络平台,系统将通过建立学生的心理健康档案,动态跟踪学生的学习行为,健全心理危机干预机制,及早发现、干预和有效控制有严重心理障碍的学生。使心理健康教育与管理达到系统化、规范化,提高工作效率。3.2系统功能模块分析根据系统主要设计目标,系统整体用例图如下:心理测试数据采集心理测试数据采集学生学生心理评估测试分析心理评估测试分析心理测试心理测试数据采集数据采集微博文本微博文本数据预处理数据预处理导师导师心理评估测试分析心理评估测试分析词云可视化分析词云可视化分析3.2.1数据采集模块(1)心理测试数据采集:采用《SCL-90症状自评量表》作为心理卫生评定工具收集心理测试数据。(2)微博数据采集:利用爬虫技术获取舆情数据。(3)数据清理:重新审查校验数据,清洗脏数据,删除重复信息和无效值,确立缺省值,保证数据一致性。(4)数据集成:针对不同的数据挖掘过程或目的形成特定的数据集。心理测试数据学生心理测试数据学生数据采集模块数据采集模块微博数据导师微博数据导师3.2.2数据预处理模块(1)中文分词:将大段的中文文本按照一定规则切分为词语。(2)去停用词:过滤去除没有实际意义的功能词,增加检索效率。中文分词中文分词导师数据预处理模块导师数据预处理模块去停用词去停用词3.2.3测试分析模块(1)数据采集:学生通过SCL-90症状自评量表测量心理健康状况。(2)心理评估:根据心理测试得到的结果对当前数据进行评估。数据采集数据采集学生学生心理评估测试分析模块心理评估测试分析模块导师导师得出心理健康情况得出心理健康情况3.2.4可视化分析模块(1)文本情感分析:对于给定的文本进行情感偏向的分析,确定文本作者对描述的事物所持有的态度为积极态度还是消极态度。(2)词云:用不同颜色、不同大小的表现类型,直观的表现出文本中出现频率较高的关键词与其词频高低。文本情感分析文本情感分析可视化分析模块导师可视化分析模块导师词云词云3.3其他需求3.3.1性能需求大学生心理健康舆情分析系统需要采集大量数据,能够满足300名用户同时访问。3.3.2设计约束心理健康作为培养大学生整体素质的关键,需要严格符合国家标准。尤其是心理测试条目,本系统主要是对数据进行统计管理分析,所有心理测试平台需要严格进行筛选。
第4章大学生心理健康舆情分析系统设计本章首先给出系统的整体设计,包括大学生心理舆情分析系统的处理流程和组织构架。随后介绍每个具体功能模块的的设计方案,包括数据采集方案、测试分析方案、文本预处理方案、可视化分析方案。4.1系统整体设计4.1.1处理流程数据采集数据采集数据采集数据清洗文本预处理中文分词停用词过滤特征提取文本表示可视化分析情感分析可视化测试分析心理评估4.1.2组织构架问卷调查、微博数据问卷调查、微博数据数据采集模块数据预处理模块可视化分析模块数据库词云展示测试分析模块心理评估大学生心理健康舆情分析系统可分为三个层次:存储层、中间层、展示层。存储层的主要构成为数据库,任务就是储存经过数据采集的源数据及数据预处理的处理结果;中间层则是各个功能模块,是系统的主要运行部分;展示层则是直接面向用户的层面,负责收集信息,展示结果。4.2数据采集方案本文数据采集的方法主要有三种,心理测试调查、网络爬虫和微博API。心理测试采用《SCL-90症状自评量表》作为调查数据来源。本测试以16岁以上成人为测试目标,从躯体感觉、精神状态、人际情感、思维意识、异常行为及睡眠饮食等多方面评定被测试者是否有某种心理问题及其严重程度如何。本测试可以很好地区分被测试者是否存在心理障碍或是否处于心理障碍边缘,对于检测人群中可能有心理异常的人及其具体严重程度如何较为适用。若被测试者分数较高,可能在某些方面有心理障碍,需要进一步筛查确定,采取措施。4.3测试分析模块测试一共90道题目,分为10个方向,包括躯体化症状表现、强迫症状表现、人际关系敏感症状表现、抑郁症状表现、焦虑症状表现、敌对症状表现、恐怖症状表现、偏执症状表现、精神病性症状表现和其他症状表现。(1)躯体化症状:1题,4题,12题,27题,40题,42题,48题,49题,52题,53题,56题和58题,共12项。该项主要反映被测试者是否有主观意识上的身体不适感。(2)强迫症状:3题,9题,10题,28题,38题,45题,46题,51题,55题和65题,共10项。该项主要反映被测试者是否有思维强迫和行为强迫的临床表现。(3)人际关系敏感症状:6题,21题,34题,36题,37题,41题,61题,69题和73题,共9项。该项主要反映被测试者能否正确处理个人与他人关系,是否在人群中无法适应。(4)抑郁症状:5题,14题,15题,20题,22题,26题,29题,30题,31题,32题,54题,71题和79题,共13项。该项主要反映被测试者是否负面情绪增加,情绪过于低沉,对自我价值评定过低。(5)焦虑症状:2题,17题,23题,33题,39题,57题,72题,78题,80题和86题,共10个项目。该项主要反映被测试者是否对未发生或已发生的事情产生莫名的担忧和烦躁情绪。(6)敌对症状:11题,24题,63题,67题,74题和81题,共6项。该项主要反映被测试者是否陷入与他人不相容的敌视、对抗他人的心理状态中。(7)恐怖症状:13题,25题,47题,50题,70题,75题和82题,共7项。该项主要反映被测试者是否对特定情境产生强烈且莫名的恐怖心理。(8)偏执症状:8题,18题,43题,68题,76题和83题,共6项。该项主要反映被测试者是否有曲解他人行为、怀疑为人利用、产生病态嫉妒等倾向。(9)精神病性:7题,16题,35题,62题,77题,84题,85题,87题,88题和90题,共10项。该项主要反映被测试者是否在环境影响下导致认知发生障碍等精神问题相关症状。(10)19题,44题,59题,60题,64题,66题及89题共7个项目,未能归入上述因子,这些题目主要反映是否失眠、是否厌食等情况,不再另做分类,将之归为10“其他”。从以上十个方面评估学生的心理状态,得出学生的心理健康情况。4.4数据预处理方案(1)分词工具本文选择jieba分词系统作为分词工具。jieba分词是国内环境中较为优秀且较为常用的中文分词工具,它支持三种模式:①精确模式:将句子中的词语精准的分割,每个词语只会有一种分割形式,无冗余词汇。②全模式:将句子中每个词以尽可能多的可能性划分出来,每个词用到不止一次,存在冗余。③搜索引擎模式:对于全模式的各种可能性以某种顺序进行排列,使分词结果更有次序。jieba分词主要运用以下几种算法:①利用词典快速进行扫描,找出文本中所有可能构成词语的情况,构造一个有向无环图。②基于动态规划查询概率最大的路径,找出根据词频高低决定的最大切分组合。③对于未登录词,选择以中文构词能力为基础的HMM模型,同时采用Viterbi算法对文本进行运算。④利用Viterbi算法对分词后的词语进行词性标注;⑤利用tf-idf技术和textrank模型对关键词进行抽取;(2)停用词过滤同时考虑微博文本特点和舆情分析实际需要两方面,本文决定采用以下去停用词策略:·基于词性·基于长度·基于内容4.5可视化分析模块本文运用snowNLP进行情感分类。大部分语言处理库都对英文进行处理,SnowNLP是用python编写的一个针对中文处理的类库,方便对中文文本内容进行处理,这个类库是受到了TextBlob的启发而写的,但和textblob不同,snowNLP没有用到NLTK。运用SnowNLP库对分词后的文本进行情感分类,情感>0.96判为积极词,情感<0.06判为消极词。
第5章大学生心理健康舆情分析系统实现5.1学生功能模块进入系统首先需要登录,输入正确的账号密码后,选择学生端登录。5.1.1心理测试模块学生进行登录后,可进入心理测试模块进行《SCL-90症状自评量表》的心理测试,每个项目采取1-5级评分,从无为0分,很轻为1分,中等为2分,偏重为3分,严重为4分,最后根据测试标准判定测试结果。完成全部试题后点击提交。5.1.2测试结果模块学生完成测试确认提交后,即可进入测试结果模块查看自己的测试结果,测试结果分为各项项症状评定和总分评定。根据《SCL-90症状自评量表》测试标准,躯体化部分得分为12-60,分数<24症状表现不明显,≥36有较为明显症状;强迫部分得分为10-50,分数<20症状表现不明显,≥30有较为明显症状;人际关系部分得分为9-45,分数<18症状表现不明显,≥27有较为明显症状;抑郁部分得分为13-65,分数<26症状表现不明显,≥39有较为明显症状;焦虑部分得分为10-50,分数<20症状表现不明显,≥30有较为明
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 植物精油调理师岗前工艺规程考核试卷含答案
- 固体矿产钻探工成果知识考核试卷含答案
- 手绘工岗前应急预案考核试卷含答案
- 小学语文试题及答案
- 海运代理合同-中英文对照(范本)
- 门禁系统合同(范本)
- 小语文阅读教学设计逐字稿
- 生产管理条例
- 关于民宿的项目计划书
- 楼梯施工方案
- 儿童营养需求的调节与膳食指导
- 2025年河北物流集团招聘笔试参考题库含答案解析
- TD/T 1042-2013土地整治工程施工监理规范
- JG/T 161-2016无粘结预应力钢绞线
- 恋爱合同书(2025年版)
- JTG-T B05-2004 公路项目安全性评价指南
- 教学课件:《食品安全学》
- 欧莱雅培训体系
- GB/T 44438-2024家具床垫功能特性测试方法
- DL∕T 1700-2017 隔离开关及接地开关状态检修导则
- 2025年高考历史一轮复习复习学案(中外历史纲要上下册)15纲要下册第五单元:工业革命与马克思主义的诞生(解析版)
评论
0/150
提交评论