【《企业知识图谱构建概述》4200字】_第1页
【《企业知识图谱构建概述》4200字】_第2页
【《企业知识图谱构建概述》4200字】_第3页
【《企业知识图谱构建概述》4200字】_第4页
【《企业知识图谱构建概述》4200字】_第5页
已阅读5页,还剩9页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

企业知识图谱构建概述目录TOC\o"1-3"\h\u16597企业知识图谱构建概述 1214081.1数据获取 21571.2数据抽取 3308421.2.1实体抽取 3183291.2.2关系抽取 4236871.2.3数据存储 4254851.4金融企业知识图谱构建 5222731.4.1实验环境 554381.4.2数据介绍 5148841.4.3图谱设计 6287471.4.4图谱存储及展示 10215661.5小结 13知识图谱自身极强的关联性结构使得它可以从关系的维度出发,更深层次的整合金融数据,挖掘潜在用户,预测隐藏风险,充分发挥数据的价值,提高业务效率。知识图谱在金融领域的运用可以分为营销类应用,风控类应用,预测类应用。营销类应用是挖掘潜在用户,同时挖掘用户潜在需求,以便制定营销计划和精准推送。风险类应用帮助金融部门提高内审内控效率,协助机关监控违法行为。预测类应用是预测风险,防范风险。应用如图1.1所示。图1.1知识图谱在金融行业应用目前构建金融领域知识图谱的困难在于难于获取大量准确的知识图谱三元组,因为金融数据涉及隐私信息一般不会公开,因此我们就公司行业,股票,高管等信息自底向上构建企业知识图谱。企业知识图谱构建流程如图1.2所示。图1.2企业知识图谱建立流程1.1数据获取金融领域的数据都是来自网络,使用的技术为爬虫。根据数据结构的不同,其中结构化数据可以径直保存到数据库,非结构化数据则需要进行命名实体识别,关系抽取等工作。数据爬取的主要流程为:1)先爬取所有网站的url然后收集金融实体构成词汇表;2)对所有的url进行批量解析,以金融实体为关键字搜索相关金融论坛,将包含关键字的内容爬取下来;3)对结构化数据直接以json的形式存储到CSV中,对非结构化数据进行相应的抽取工作之后再进行存储。数据获取的流程如图1.3所示。图1.3数据获取流程在金融网站中,主要爬取的实体信息包括,行业,公司名,股市类型,公司高管,股票等,主要爬取的关系包括任职,属于,参股,所属公司行业等。而且由于该网站信息数据属于结构化数据所以不需要再进行相关的知识抽取等工作。为了防止获取的金融网站数据不足,我们还对相关的金融论坛进行爬取,爬取与金融实体相关的数据补充知识库。由于爬取的金融论坛数据属于非结构化数据,所以需要对其进行命名实体识别,关系抽取等操作。1.2数据抽取1.2.1实体抽取对上节爬取的与金融实体相关的非结构化数据需要进行知识抽取工作,才能存放于数据库。但是在知识抽取之前,需要先进行知识的清洗,因为非结构化数据中包含表情,字符等噪声会影响知识抽取的准确性,在数据清洗过后还要进行人工审核,确保数据的可用性。对非结构化数据需要先进行命名实体识别,通过分词以及词性分析抽取金融实体。为了保证数据的准确性,采用目前流行的Hanlp进行分词,同时使用自然语言处理库进行共同识别,在分词后依据词性选取有价值的知识,舍弃无价值的修饰词汇,并且对于存在性较高的实体才进行抽取。本文爬取的非结构化数据主要是关于金融机构,公司高管,所以词性方面主要关注图1.4上的几种。表1.1词性注解实体识别之后,将词句进行分词,分词的原则就是按照图1.4所示的词性,可以得到银行实体“平安银行股份有限公司”,地名实体“深圳市”,“罗湖区”,人名实体“谢永林”。实体识别效果如图1.5所示。图1.5实体识别结果示例1.2.2关系抽取两个实体之间具有某种关系,当某一句子中出现了两个有效的实体标记时,就需要通过研究两个实体的上下文抽取实体关系。一个完备的关系由两部分组成,分别是关系类型和关系参数。关系类型就是两个实体之间属于哪种关系,例如上级与下级之间的指导关系,监督关系等;关系参数就是关系对应的实体,如收购关系之间的两家企业。提取出来的(实体,关系,实体)三元组保存进数据库,其他的句子以文本的形式保存,作为对实体的描述。1.2.3数据存储数据的存储方式有以表结构形式保存也有以图结构形式的保存。以表结构形式的存储方式是把所有的三元组都放在同一张表中,后续的查询操作耗费较大,且不利于观察数据之间的逻辑关系,因此本文最终采取图结构方式保存数据。Neo4j[[]WebberJ.AprogrammaticintroductiontoNeo4j[C]//Proceedingsofthe3rdannualconferenceonSystems,programming,andapplications:softwareforhumanity.2012.[]WebberJ.AprogrammaticintroductiontoNeo4j[C]//Proceedingsofthe3rdannualconferenceonSystems,programming,andapplications:softwareforhumanity.2012.本文采用Neo4j存储实体以及实体间的关系,根据需要将数据统一存储在excel表中,然后将excel表批量导入Neo4j数据库中进行存储,具体过程为:遵循Neo4j数据库的存储要求,建立实体以及关系的csv表,表内设计Label作为实体标签,同时根据存储要求设计表中内容;设置好Neo4j的用户名以及密码,通过命令行导入csv表,如果出现错误可以根据log日志进行修改。1.4金融企业知识图谱构建1.4.1实验环境在本章中,我们构建一个金融企业知识图谱,为现有的金融领域知识图谱做一些补充,本文构建知识图谱的实验环境如表1.2所示。表1.2知识图谱实验环境1.4.2数据介绍在本章的第二小节中我们爬取了金融网站的结构化数据以及金融论坛的非结构化数据,其中结构化数据来自东方财富网如图1.6所示。图1.6东方财富网企业结构化数据爬取的主要步骤:从东方财富网获取企业列表。2)逐一获取股票代码,股票简称,所属行业,高管信息。3)将结果存储到文件。非结构化数据爬取的主要步骤:建立金融企业词汇库。逐一遍历金融论坛数据,如果与金融企业词汇库中的词汇相吻合,就爬取该论坛信息以及评论。经过爬取金融论坛获得1000余条评论信息,将爬取到的信息进行相关抽取操作,并与结构化数据进行知识融合,如果出现矛盾信息以结构化数据为准,将非结构化数据删除,最终数据存储在excel表中。1.4.3图谱设计为了使数据能够在Neo4j中可视化呈现,需要将excel表数据转化为Neo4j支持的csv格式,传入的数据实体关系设计如下,共包括3种实体,分别是企业,行业和高管,实体关系有4种,分别是行业属于,概念属于,董事会成员,十大股东。知识图谱的构建要符合现实,实体属性的设置要考虑唯一性。在企业实体信息中,实体序号为自己添加的,实体的序号和股票代码应具有唯一性,防止因公司名称重复而无法唯一标识,保证在知识图谱中导入的实体可以通过序号连接另一个实体;由于公司属于的行业,概念,股东可能不同,因此同样存储行业实体,概念实体,股东实体并同样设置序号作为唯一标识;在公司中有多个董事会成员,所以同样存储高管实体并设置序号作为唯一标识,名字,性别,年龄作为其属性。企业知识图谱企业实体属性设计如表1.3所示:表1.3企业实体属性Index:IDNameStock_codestatus:LABEL000001九联科技688609nomal企业000002奇精机械603677nomal企业000003株治集团600961nomal企业000004和林威纳688661nomal企业000005道通科技688208nomal企业…………n方大特钢600507nomal企业企业实体属性包括四个,分别是编号,股票简称,股票代码还有股票状态,在Neo4j中企业为企业实体的总标签。企业知识图谱高管实体属性设计如表1.4:表1.4高管实体属性Index:IDNameSexAgeStock_code:LABEL100001汪某某男45603677高管100002张某某女57603677高管100003翁某某男57603677高管………………n明某某男55603677高管企业高管属性包括六个,分别是编号,姓名,高管性别,高管年龄,股票代码,在Neo4j中高管为高管实体的总标签。企业知识图谱概念实体属性设计如表1.5:表1.5企业概念实体属性Index:IDName:LABEL200001节能环保概念200002污水处理概念200003高校背景概念………………n苹果概念概念企业知识图谱行业实体属性设计如表1.6所示:表1.6行业实体属性Index:IDName:LABEL300001通讯行业行业300002家电行业行业300003有色金属行业………………n钢铁行业行业行业实体属性包括两个,分别是编号和行业名称,在Neo4j中行业为行业实体的总标签。企业知识图谱十大股东实体属性设计如表1.7:表1.7股东实体属性Index:IDNameNature:LABEL400001国广环球资产管理有限公司其它股东400002德邦证券股份有限公司证券公司股东……n苹果概念概念概念企业知识图谱中关系有董事会成员,董事会成员连接的是企业和高管之间的关系,高管实体和企业实体之间的关系是属于关系,通常都是n-1的关系,本次实验也只考虑n-1的关系,例如“张某某是奇精机械的独立董事”,高管“张某某”属于“奇精机械”的董事会成员关系,“明某某也是奇精机械的独立董事”,那么“明某某”也属于“奇精机械”,董事会成员关系如图1.7所示:图1.7董事会成员关系图企业知识图谱中关系有行业属于,行业属于连接的是企业和行业之间的关系,企业和行业实体之间的关系是n-1的关系,例如“东贝集团”企业属于“机械行业”,“上柴股份”企业属于“机械行业”,行业属于关系如图1.8所示。图1.8行业属于关系图企业知识图谱中关系有概念属于,概念属于连接的是企业和概念之间的关系,企业和概念实体之间的关系是n-n的关系。概念属于关系如图1.9所示。图1.9概念属于关系图企业知识图谱中关系有控股,控股连接的是企业和股东之间的关系,企业和股东实体之间的关系是n-n的关系。控股关系如图1.10所示。图1.10控股关系图综上,企业知识图谱结构图如图1.11所示:图1.11企业知识图谱结构设计1.4.4图谱存储及展示金融知识图谱结构设计完成之后,按设计格式整理数据方便后续导入,本文采取import方法也就是Neo4j自带的方法导入数据,操作简单,导入速度快,但上传的数据应该存储到csv表中,所以上传数据之前要先建立实体csv表以及关系csv表。因此需要创建的实体csv表包括:企业Company表,行业Industry表,高管Executive表,股东Sharehold表,关系csv表包括:企业_行业company_industry表,企业_高管compony_executive表,企业_概念company_concept表,企业_股东company_sharehold表。在实体csv表中,第一列应该是唯一标识字段,后面为实体属性,在关系csv表中,第一列和第二列应该分别对应头尾实体的唯一标识字段,后面为关系类型。具体实体信息表示例如图1.11,关系信息表示例如图1.12。图1.11企业Company实体示例表图1.12企业_行业company_industry关系示例表信息表建立好之后就可以使用Neo4j的Cypher语句进行导入操作,构建企业知识图谱,需要注意的是实体csv表,关系csv表需要放在import文件夹下。使用Neo4j可以对构建的企业知识图谱进行直观的展示,用自带的Cypher就可以进行相关的查询工作。企业知识图谱董事会成员关系展示如图1.13:MATCH(n1)-[r:董事会成员]->(n2)RETURNr,n1,n2LIMIT25图1.13企业知识图谱董事会成员关系展示企业知识图谱概念属于关系展示如图1.14:MATCH(n1)-[r:概念属于]->(n2)RETURNr,n1,n2LIMIT25图1.14企业知识图谱概念属于关系展示企业知识

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论