版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
改进的命名实体识别算法设计案例分析目录TOC\o"1-3"\h\u28436改进的命名实体识别算法设计案例分析 [52]等学者发表的一篇论文就BERT的每层编码网络提取到的特征与表达的信息这两个问题做出解释。以BERT-base-uncased为例,作者将该模型的12层Transformer编码层大致分为底层网络、中层网络以及高层网络,通过实验证明BERT模型中不同层次的网络在文本中获取的信息倾向性不同。首先在短语句法方面,底层的神经网络能够更为有效地捕捉到短语句法的相关信息,而高层的神经网络却不容易捕获这些内容。其次通过探测任务测评每层网络对于各种语言学特征的学习能力后可以发现,底层网络能够学习到表层的信息特征,中层网络能够学习句法信息的特征,而高层网络可以学习到语义相关的信息,并且通过主谓一致实验加强了这一论证。综上所述,BERT各层神经网络从文本中可以学习到不同的内容。通常在进行下游任务时只会使用BERT最后一层输出的内容,受到注意力机制的启发,以机器翻译为例,在翻译每个字时,都会给这句话中的每个字赋予不同的权重,语义编码即为加权求和的结果。根据注意力机制的原理,同时结合上文得到的BERT每一层编码层从文本中学习内容侧重点不同的原理,本文设法为每一层的输出赋予不同的权重,在之后的训练过程中不断优化权重的值。再将每一层的权重与每一层的输出值相乘再相加得到加权平均值,随后再将其降维,作为BERT预训练模型最后的输出结果。(2)实现方法本文对BERT预训练模型的具体改进方法如下所示。如公式(1.12)所示,首先获取每一层编码层的输出output1,output2,…,output12α(1.12)其次将每一层编码层的输出进行拼接,之后与权重矩阵α相乘,并通过一层全连接层降维至128层,获得融合多层编码层特征的输出值,如公式(1.13)所示。Output(1.13)通过该方式可以融合每一层编码层学习到的结果,使得最后输出的向量可以包含文本的语法、句法与语义等多方面信息。其改造后的结构示意图如图3-9所示,其中α1图3-9融合多层编码层特征的BERT结构图(3)模型整体架构通过对BERT进行改造,将图3-9中的BERT结构代替图3-8中的BERT结构,最终的模型结构由改造后的BERT,BiLSTM和CRF组成,其训练过程如下:第一层,BERT层。对于NLP任务而言,将文本序列转换为计算机可以理解的数字是一个十分基础又重要的步骤,通常将词语对应的向量称为词向量或词嵌入。过去常常使用的词向量模型为Word2vec模型。然而通过Word2vec模型训练出的词向量一旦确定便无法改变,因而无法处理一字多义的问题。该方法无疑对命名实体识别任务的准确率造成一些影响。且传统的语言模型无法进行并行计算,也无法记住长距离的文本信息,不仅浪费训练时间,还易遗漏有效信息。因此本文采用BERT预训练模型来训练字向量。由于中文分词准确率并不能达到100%,且金融领域有许多新出现的实体,分词模型也许并不能将其识别,并且由于中文词语数量过于庞大,因此将文本序列以字为最细粒度输入BERT预训练模型中。输入的数据应该为每个字的字向量与句子向量和位置向量的叠加。本次实验采用的模型为BERT-base,该模型有12层的编码网络,因此BERT模型最终输出的字向量来自于这12层网络的加权平均值,这也是本文的创新之处。由于编码器来自于Transformer模型,因此训练出的字向量可以很好地融合上下文信息,不仅如此,还可以学习到包括语义、句法等多方面的信息。最终BERT层将输出一个128维的向量矩阵,作为BiLSTM层的输入。第二层,BiLSTM层。在序列标注任务,尤其是命名实体识别任务中,若结合上下文信息,命名实体将会被更为准确地识别。本文选择BiLSTM模型作为神经网络模型,正是由于其是一个双向的神经网络。相较于传统的RNN网络,BiLSTM特殊的记忆门、遗忘门和输出门结构,使得其可以有选择地记忆和遗忘部分信息,该模型能保留有效信息,并减少反向传播过程中梯度爆炸的可能性。相较于LSTM网络,BiLSTM网络是由两个不同方向的LSTM网络组成。因此该网络不仅结合LSTM网络的优点,还能有效地获取上下文信息。经过BERT模型训练出的字向量作为BiLSTM层的输入,经过双向的长短期记忆神经网络后会输出一个矩阵P,P中每一列都是由一个字向量对应的所有可能标签的发射分数组成的向量。一般情况下无法单独通过发射分数判断某个字的标签,序列的标注问题需要结合当前项附近的信息才能最终确定。因此需要CRF层制定规则,帮助最后标签的确定。第三层,CRF层。若只选取BiLSTM层输出结果中发射分数最大的一项组成标注序列,有很大可能会产生一些不符合语言逻辑的结果。这是由于BiLSTM模型通常作用于文本序列和标注标签之间,该模型并不关注标签直接的关系。CRF层为确保最终结果的准确率,不仅仅着眼于某一项,而是会作用于整个标注序列。CRF层会为整个序列的标注制定规则,通过规则为标注的结果打分。此处规则由转移特征函数与状态特征函数确定。而在本文的模型中,主要通过转移矩阵来为序列的标注结果打分。这样可以有效避免一些不可能情况的发生,例如‘I-PERSON’标签之前为‘O’标签,最终选出最符合实际情况的标注序列。以上三个过程是一种从局部到整体的研究方法,由字到句,再到标注序列等各个方面进行考量。该方法能有效地提高命名实体识别任务的准确率。1.3实验与分析为验证本文提出的ff-BERT-BiLSTM-CRF模型在通用领域上的有效性以及可移植性,本小节将使用该模型在人民日报标注数据集上进行实验,同时使用BiLSTM-CRF模型与BERT-BiLSTM-CRF模型作为对比模型在同一数据集上进行实验,并比较最终实验结果。1.1.1实验数据本次实验采用数据集为1998年人民日报标注语料。人民日报数据集包含人民日报1998年上半年刊登的所有文章,并按日期与版本序号排序,其格式如图3-10所示。该语料标注了26种基本词类,另增加三种命名实体,分别为人名(nr)、地名(ns)与机构名称(nt)。图3-10人民日报语料样例本次实验首先对人民日报数据集进行数据预处理,随后使用“BIO”标注法进行标注(该标注法详细内容见本文4.3小节),并将文本转换图3-11的格式,其中PER代表人名实体,LOC代表地名实体,ORG代表机构名称实体。图3-11标注语料格式最后将该数据集的80%作为训练集,其余数据作为测试集。经统计,训练集中人名实体数量为15572,地名实体数量为31283,机构实体数量为17469。测试集中人名实体数量为4016,地名实体数量为8111,机构实体数量为4437。1.1.2实验环境与参数本次实验涉及到的软件与硬件参数如表1.2所示。表1.2实验环境类别配置硬件GPU:GTX1080Ti内存:128G操作系统:Ubuntn17.10显存:11GBGDDR6软件Python:1.6Tensorflow:1.10Numpy:1.14.5实验模型涉及参数如下:最大序列长度为128,epoch为40,batchsize为16,学习率为5e-5,dropout为0.5,clip设置为5.0,BiLSTM隐藏层为128层。1.1.3实验评价指标在机器学习和深度学习领域,模型的设置固然十分重要,然而对模型结果的评估同样是实验过程中必不可少的一环。本文中所有实验采用的三个评价指标分别是准确率(Precision、P)、召回率(Recall、R)以及F1值(F1-score、F)。为了解这三个评价指标,首先需要对混淆矩阵有一定的认识。表1.3分类结果混淆矩阵真实情况预测结果正例反例正例TPFN反例FPTN表1.3为分类结果的混淆矩阵,图中四个值均由两个字母组成,其中T和F代表预测的正确性,分别为正确和错误,P和N表示预测的类别,分别为正例和反例。并且这四个值个数相加的结果为样本总数。根据该矩阵,可以推导出本文要用到的三个评价指标。精确率表示通过模型识别出的正确命名实体数量,占据识别出的所有命名实体的数量的比例,如公式(1.14)所示。P=(1.14)召回率表示被模型识别出的正确命名实体个数占样本中命名实体总数的比例,如公式(1.15)所示。R=(1.15)在实际实验结果中,有很大可能会出现精确率和召回率发送矛盾的情况,在这种情况下,本文还设置F1值对实验结果进行综合评估,如公式(1.16)所示。F1=(1.16)精确率、召回率和F1值的取值区间均为[0,1],通过这三个评价标准,可以对命名实体识别任务的模型结果有一个综合全面的评价。1.1.4实验结果分析本次实验使用模型为ff-BERT-BiLSTM-CRF,为证明本文提出的模型在通用领域的可行性,本节同时使用BiLSTM-CRF模型与BERT-BiLSTM-CRF模型在人民日报数据集上进行对比实验,实验结果具体数据如表1.4所示。表1.4实验结果对比模型名称实体类别P(%)R(%)F1(%)BiLSTM-CRF人名89.38484.26686.749地名91.25687.38389.276组织机构名82.84584.43581.632BERT-BiLSTM-CRF人名91.64587.02189.273地名91.13491.89391.512组织机构86.77289.39288.062ff-BERT-BiLSTM-CRF人名92.54391.52292.029地名94.57995.68395.128组织机构88.52889.84589.182图3-12为本次实验三个模型各个实体类别的F1值对比图,该图横坐标为本次实验的三个模型,纵坐标为F1值。由图中可以发现,相较于传统BiLSTM-CRF模型,引入BERT的两个模型在各个实体的F1值上都有显著的提高,证实了BERT预训练模型性在命名实体识别任务中的有效性。且本文提出的ff-BERT-BiLSTM-CRF模型相较于原生BERT-BiLSTM-CRF模型的F1值又有一定的提高。通过观察下图还可发现,三个模型识别地名的准确率最高,人名其次。造成该现象的主要原因是本次实验使用的数据集中地名类别实体出现次数远高于其他两类实体。虽然数据集中人名类别实体数量低于组织
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 海理定理与图式理论的脚本结构
- 创新生态气象一新深化产业创新发展行动方案
- 浙教版九年级科学下册教学设计:第2章 第1节 生物与环境的相互关系
- 基于深度学习的图像分析结题报告
- 七年级体育 体育与健康教育第28课教学设计 人教新课标版
- 浙教版七年级下册第1节新生命的诞生第2课时教学设计
- 英语Unit1Backtoschool教案设计
- 人教版高中政治必修4生活与哲学同步学教学设计
- 岁月漫长 解锁幸福密码(教学设计)2023-2024学年初三下学期教育主题班会
- 新教材高中英语 Unit 5 Working the Land Learning About Language(一)教案 新人教版选择性必修第一册
- 2026“才聚齐鲁成就未来”山东省信用增进投资股份限公司社会招聘2人易考易错模拟试题(共500题)试卷后附参考答案
- CSCO前列腺癌诊疗指南(2026版)
- 2025年高考地理答题技巧与模板模板05 人口和城市(答题模板)(含答案或解析)
- 管理篇-电力可靠性管理基础-标注版
- 彝族工人用工协议书
- 如何在家校共育中融入学生自控力培养的课程
- 客运知识培训课件
- 2023年全国职业院校技能大赛-智能节水系统设计与安装赛项规程
- AQ 1064-2008 煤矿用防爆柴油机无轨胶轮车安全使用规范(正式版)
- 岩土工程勘察服务投标方案(技术方案)
- 口内数字化印模
评论
0/150
提交评论