版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
基于SPA-RNN的知识图谱补全分析目录TOC\o"1-3"\h\u20528基于SPA-RNN的知识图谱补全分析 1239221.1循环神经网络 1320401.1.1循环神经网络的前向传播过程 1122261.1.2循环神经网络的反向传播过程 2271861.2融合语义路径的循环神经网络 3281191.3引入注意力机制 533251.4SPA-RNN模型代价函数和训练 7103651.5实验设计与结果 8178091.5.1实验评测标准 8205521.5.2实验数据集 9143961.5.3实验设置 1077531.5.4实验结果与分析 10当下知识图谱普遍的使用在知识智能问答,推荐系统等应用中,但是伴随智能AI的发展,对知识图谱的准确性,广泛性,完整性都提出了更高的要求,所以挖掘数据之中隐含的知识在迫在眉睫。在之前的方法中,判定两实体之间具有某种关系的依据是两实体间具有关联性,而忽视了路径上更重要的实体和关系等信息,所以关系推理的准确性并不高。近几年由于深度学习在智能识别方面的运用,它的关键技术之一循环神经网络[[]JainA,ZamirAR,SavareseS,etal.Structural-RNN:DeepLearningonSpatio-TemporalGraphs[J].IEEE,2015.],因为能处理任意长度的时序信息而引起关注。综上,本文提出基于语义路径和注意力机制的循环神经网络模型(Recurrentneuralnetworkmodelbasedonsemanticpathandattentionmechanism,SPA-RNN),将利用RNN,处理路径上的实体和关系,并引入Attention机制,推测两实体间存在某种预测关系的概率,[]JainA,ZamirAR,SavareseS,etal.Structural-RNN:DeepLearningonSpatio-TemporalGraphs[J].IEEE,2015.1.1循环神经网络1.1.1循环神经网络的前向传播过程输入层:输入要处理的数据,数据的维度是关键,如果输入是16*16图像像素,那么该层神经元数量就是16*16个,也就是输入向量的维度会影响神经元的数量。输入层到隐含层:两层之间靠权值矩阵相连,假设前后两层的神经元数量分别是n,m,那么连接该两层的权值矩阵就是m*n维的,且m*n维矩阵中的a行b列的数值代表后一层第a个神经元与前一层第b个神经元之间的权值,其他层的维度权值同理。隐藏层中t时刻的输出结果如4-(1)所示: 公式4-(1)其中x为输入向量,St-1为上一时间步隐藏层的结果向量。隐藏层到输出层:设两层的神经元数量分别为m,p,那么连接两层的权值矩阵V就是p*m维的。t时刻输出层输出向量的计算公式如4-(4)所示: 公式4-(2)1.1.2循环神经网络的反向传播过程基于BP(BackPropagation)[[]Jianqiang,Yi,and,etal.BPneuralnetworkprediction-basedvariable-periodsamplingapproachfornetworkedcontrolsystems-ScienceDirect[J].AppliedMathematicsandComputation,2007,185(2):976-988.]算法是RNN中主要的反向传播算法,但是由于RNN处理的主要是在时间上有前后顺序的数据,每一时间步的输出由当前时刻的输入数据与过往的输入数据共同决定,例如计算第七时间步的梯度,就需要向前反向传播六步,并且六步的梯度累加,鉴于其梯度累加特性,更适用BPTT(BackPropagationThroughTime)[[[]Jianqiang,Yi,and,etal.BPneuralnetworkprediction-basedvariable-periodsamplingapproachfornetworkedcontrolsystems-ScienceDirect[J].AppliedMathematicsandComputation,2007,185(2):976-988.[]KaiC,QiangH.TrainingDeepBidirectionalLSTMAcousticModelforLVCSRbyaContext-Sensitive-ChunkBPTTApproach[J].IEEE/ACMTransactionsonAudio,Speech,andLanguageProcessing,2016,24(7):1185-1193.BPTT公式如4-(5)所示: 公式4-(3)其中E为t时刻的误差,δ是传播项,y是预测的输出结果,d是实际输出的结果向量,z是中间隐藏层的输入。在上面的公式中可以看出,反向传播算法中每进行一次反向传播,需要同时乘上f的求导结果以及参数矩阵,而激活函数导数最大不超过1,矩阵的最大值小于1,则经过数次反向传播之后,残差项会慢慢减小,梯度会慢慢降为0,也就是出现梯度消失的结果。归根结底,梯度消失是由于正向传播过程中每一时间步隐藏层的输出都受上一时间步隐藏层的影响。1.2融合语义路径的循环神经网络本文的任务是推理知识图谱中两实体是否具有某种关系R,使用的方法是将路径上的实体和关系信息融合起来,增强模型提取路径信息的能力。如果知识图谱中两个实体之间有路径相通,那么路径可以表示为L={(e1,R1,e2),(e1,R1,e2),…(en-1,Rn-1,en)},也可以用关系序列来表示,即S={R1,R2,…,Rn}。路径的长度就是路径上关系的数量,即dL=len(S)。为了使预测得到的关系更具有合理性,我们先分析融合路径上实体和关系的必要性。实体之间的路径信息如图1.1所示。在路径图中有Priscilla→Spouse→Mark→Chairman→Facebook→Headquarter→Califonia,和Priscilla→Friend→Lisa→Bornin→Califonia两条路径,现在假设Priscilla和Califonia之间关系是Livein,那由关系路径图可以看出,第一条路径上的信息对于该关系的推测更具有合理性,所以第一条路径就是我们推测实体Priscilla和Califonia之间是否具有关系Livein所需要的路径。因此实体之间路径对于本文要处理的任务,即两实体之间是否具有某种特定的关系R是不可或缺的。那么如何获取实体之间的所有路径?本文采用的方法是深度优先遍历算法,又鉴于循环神经网络只能处理有限长度序列的局限性,所以我们使用深度优先遍历算法获取了知识图谱中实体路径小于5的所有路径,用于后面模型的训练。图1.1实体间路径图现在我们已经有了实体之间的小于5的所有路径,那么接下来如何预测两实体之间的关系?我们通过嵌入表示将实体和关系表示低维向量,然后利用RNN推理实体之间的关系。在这里我们利用了循环神经网络处理序列数据的特性,联合了上一时间步的隐藏状态,迭代运算所有信息,同时在之前只关注实体间关系的基础上做了一些改变,将实体也加入进去,共同预测实体关系。我们得到路径向量的步骤如下:将路径上实体和关系嵌入表示为低维向量。按照顺序将路径上的实体向量关系向量输入到循环神经网络中,得到最终的路径向量。图1.2知识图谱子结构循环神经网络处理一条路径如图1.3所示:图1.3循环神经网络处理路径示例如图1.2所示,知识图谱中有这样一个子结构,Mark出生于WhitePlain,WhitePlain属于NewYork,而NewYork又属于美国,那么就可以预测Mark的国籍是美国,且这个推测存在的可能性非常大。循环神经网络处理一条路径如图1.3所示:输入端包括三个部分,一是实体向量;二是实体的关系向量;三是上一时间步隐藏层的输出向量,第一步的隐藏层输出向量是零向量。其中实体的向量和关系向量维数相同。t时刻隐藏层的输出为: 公式4-(4)其中Eat是t时刻实体向量,Ert是t时刻实体关系向量,ht-1是循环神经网络上一时刻的隐藏层输出,Eat,Ert是m维向量,ht-1是n维向量,则三者的堆叠向量[ht-1,Eat,Ert]的维度是(n+2m),W矩阵的维度是n*(n+2m)。为了后期方便计算路径向量和关系R的相似度,我们设定m等于n,则输入向量[ht-1,Eat,Ert]的维度是3m,W矩阵的维度为m*3m。激活函数f本文选取的是tanh。最后通过计算得到路径向量,通过比较路径向量和预测关系R向量的相似性,可以知道两个实体之间是否具有关系R。1.3引入注意力机制关于人类大脑的认知神经学注意力研究是注意力机制的起源。注意力指的是对于人类通过五种感觉器官接收的来自现实世界的大量信息,关注一小部分重点处理,保证大脑能高效有序的进行工作,是人类至关重要的处理信息的功能。例如人类特有的VisualAttention机制,人在看到一张图片的时候,先快速的整体的扫描整个图像,然后将注意力聚焦在特别的部分,以此来排除无用信息的干扰,获得重点的,关键的信息[[]李生武,张选德.基于自注意力机制的多域卷积神经网络的视觉追踪[J].计算机应用,2020,40(08):2219-2221.]。如图1.4所示,红色为注意力聚焦的区域,人们在看到图1.4时会更关注婴儿的脸,文章的标题和首句。在神经网络处理数据时,由于输入的数据庞大,且数据没有针对性,所以一些关键的数据就没法体现,这时就可以利用人脑的[]李生武,张选德.基于自注意力机制的多域卷积神经网络的视觉追踪[J].计算机应用,2020,40(08):2219-2221.图1.4人的视觉注意力计算机视觉领域是最早利用注意力机制的研究领域,在2014年Mnih[[]BaJ,MnihV,KavukcuogluK.MultipleObjectRecognitionwithVisualAttention.Computerence,2011.]等人首次利用注意力机制在循环神经网络模型上帮助图像分类。之后又扩展到了自然语言处理领域,Bahdanau[[[]BaJ,MnihV,KavukcuogluK.MultipleObjectRecognitionwithVisualAttention.Computerence,2011.[]BahdanauD,ChoK,BengioY.NeuralMachineTranslationbyJointlyLearningtoAlignandTranslate[J].ComputerScience,2011.在本文中,我们将通路上的经过表示学习的实体向量以及关系向量输入到RNN中,得到对应的路径向量,但是由于不是每条路径都与预测关系R相关,所以我们引入注意力机制去除冗余路径,提升训练效率。具体的,假设两实体之间有n条小于5的路径,我们将路径输入到循环神经网络中得到对应的路径向量Lp={vp1,vp2,vp3,…,vpn},然后通过cosine距离计算Lp与预测关系向量R的相似度,假设路径向量与预测关系向量的相似性为S={S1,S2,S3…,Sn},经过排序之后得到Rank={Rank1,Rank2,…,Rankn},这里预测关系向量R我们用Lr表示,最后我们选取与预测关系R最类似的路径向量做预测。其中相似度计算公式为: 公式4-(5)两实体之间存在预测关系R的概率计算公式为: 公式4-(6)1.4SPA-RNN模型代价函数和训练我们把知识图谱中现存的事实三元组作为训练的正样本,实验中采取两种概率抽样方法进行负采样。采用伯努利分布规则抽样(bern),以不同的概率更换头尾实体,采用等概率采样(unif)更换头尾实体。在知识图谱中包含上百万个三元组,而三元组中又有大量的一对多关系,所以unif的一个缺点是容易引入实际是正例的负例。譬如(俄罗斯,总统,普京)是一个正确的三元组,经过等概率替换为负例(俄罗斯,总统,戈尔巴乔夫),但是其实际是一个正例,这就会影响实际的训练准确性。在伯努利分布中可以平衡一对多关系,其中有两个变量,分别记为pht,pth,代表每个头实体或尾实体对应多少尾实体或头实体,计算参数为: 公式4-(7)更换头实体或尾实体的概率分别是p,p-1。其中存在关系R的正样本实体对用NR+表示,不存在关系R负样本实体对用NR-表示,则训练模型的代价函数为: 公式4-(7)P(h,R,t)如上述公式4-(6)所示: 公式4-(7)在对RNN的训练过程中,代价函数lost最大化处理。本文提出关系推理模型SPA-RNN流程图如下:图1.5SPA-RNN模型训练流程图区别于过去的知识图谱补全模型,本文结合实体和关系共同进行链路预测,依托两实体间的路径进行关系推理,嵌入到低维空间进行计算。根据图1.5循SPA-RNN模型的训练流程图所示:首先对知识图谱使用翻译模型进行知识表示,用向量表示实体和关系;其次使用深度优先遍历算法找出两实体间的路径,这里考虑到循环神经网络处理较长序列容易出现梯度消失的局限性,我们只查找两实体间小于5的路径;得到路径信息之后,把实体向量和关系向量作为循环神经网络的输入,利用其能保存历史信息的特性,充分发挥其关系推理的效果,得到路径向量;我们虽然只考虑两实体间小于5的路径,但是路径还是非常多,而且有一些与预测关系R无关,所以引入Attention,选择最类似的路径进行预测。1.5实验设计与结果1.5.1实验评测标准本次实验的评价标准为MAP(MeanAveragePresicion),其能很好的反映全局性能。正确率是指预测正确的数量占测试集中总数量的比例,但是在不均衡数据的分类中也就是不同类别的数据相差很大的情况下,它说明不了任何问题。所以引入了准确率P(Precision)和召回率R(Recall)。计算公式如下: 公式4-(8)其中TP是预测存在且真实也存在,FP是指预测存在但是真实不存在,FN是指预测不存在但是真实存在,TN是指预测不存在真实也不存在[[]王再见,傅忠谦,李斌,庄镇泉.GP在入侵检测规则提取中的适应度函数设计[J].计算机工程与应用,2007(26):103-105.][]王再见,傅忠谦,李斌,庄镇泉.GP在入侵检测规则提取中的适应度函数设计[J].计算机工程与应用,2007(26):103-105.于是AP(AveragePrecision)的概念就应运而生。在AP的计算中,先计算每个关系的Precision,Recall,每个Recall都有对应的最大的Precision的值,对他们取平均就能得到AP的值,对所有的关系的AP取平均就得到MAP的值。MAP的定义如下: 公式4-(9)1.5.2实验数据集为了方便实验,我们选取了Freebase数据集在一定领域的子集开展实验,同时删除一些冗余数据,对数据集进行去噪处理,防止无价值数据影响关系推理。下表1.1就是处理之后的最终统计数据:表1.1实验数据集StatisticsFreeBase企业知识图谱#Ent38900027216#Rel303#Train24000010000#Test48000020000实验在公开的知识图谱FreeBase的子集以及第三章构建的企业知识图谱上进行,本文在FreeBase子集中选取了出现频率最高的30个关系,分别对这些关系构建正负样本,在这些常见关系上做预测。1.5.3实验设置模型的训练用TensorFlow实现。实验的参数配置如下:实体类型和关系的表示向量的维度为100,学习率λ=0.001,边际值γ=1,采用L2距离度量方法,batch的大小设置为B=128,以上参数都是实验中的最优表示参数。由于实体间长度超过6的路径就有上亿条,难以计算,所以选择两实体间小于5的路径。实验迭代1000轮,结果用平均精度均值MAP(MeanAveragePresicion)表示。在两个数据集上各自做了4个实验:1.关注路径上的实体和关系信息,用循环神经网络处
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年中国HW-无机纳米抗菌粉体市场调查研究报告
- 2026年中国10-溴代癸酸市场调查研究报告
- 2026年计算机软件水平考试-初级信息处理技术员历年参考题库含答案解析
- 2026年航空职业技能鉴定考试-飞机勤务知识考试历年参考题库含答案解析
- 2026年福建住院医师-福建住院医师内科历年参考题库含答案解析
- 2026年石油石化技能考试-聚丙烯车间上岗考试历年参考题库含答案解析
- 2026年省市地方性知识竞赛-湖北知识竞赛历年参考题库含答案解析
- 2026年生化化工药品技能考试-在线分析仪表工历年参考题库含答案解析
- 2026年环保气象安全技能考试-环保企业从业人员培训历年参考题库含答案解析
- 2026年煤炭矿山职业技能鉴定考试-矿井轨道工历年参考题库含答案解析
- 2026中国大数据中心基础设施建设与区域布局规划报告
- 2026年贵阳市中考历史试题(含答案及解析)
- 某集团公司并购重组方案
- 26秋六年级上册数学入学检测卷《人教版》
- 2026年一级建造师《建设工程经济》考前必背十页纸
- 新教科版五上科学学科教学计划-2026秋
- 云南电力技术有限责任公司招聘笔试题库2026
- 生产人员操作能力绩效评定表
- 2026KDIGO慢性肾脏病贫血管理指南解读
- 2026年广东省职业病诊断医师考试(职业性耳鼻喉口腔疾病)复习题及答案
- 《工业用光稳定剂119》
评论
0/150
提交评论