【中文电子病历命名实体识别算法模型研究9300字(论文)】_第1页
【中文电子病历命名实体识别算法模型研究9300字(论文)】_第2页
【中文电子病历命名实体识别算法模型研究9300字(论文)】_第3页
【中文电子病历命名实体识别算法模型研究9300字(论文)】_第4页
【中文电子病历命名实体识别算法模型研究9300字(论文)】_第5页
已阅读5页,还剩20页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

中文电子病历命名实体识别算法模型研究目录摘要 1第1章绪论 31.1研究背景及意义 31.1.1研究背景 31.1.2研究意义 41.2国内外研究现状 51.2.1中文电子病历文本挖掘 51.2.2中文电子病历命名实体识别 61.3研究内容及论文组织结构 101.3.1研究内容 101.3.2论文组织结构 10第2章相关技术方法 122.1长短时记忆神经网络 12+2.1.1LSTM概述 122.1.2LSTM运行过程 132.2条件随机场模型 16第3章电子病历命名实体识别模型构建 173.1BiLSTM-CRF模型设计 173.2模型参数设置 193.3模型评价指标 19第4章电子病历命名实体识别模型评价与结果分析 214.1电子病历实验语料分析 214.2模型比较结果 224.3命名实体识别结果 24第5章结论与展望 255.1结论 255.2展望 25参考文献 27摘要近年来医疗健康问题越发受到人民关注,国家大力推动医疗产业信息化,全国各地的医疗部门开始迅速推广电子病历。为进一步推动医疗信息化发展,满足日益增长的人民医疗健康需求,如何高效利用电子病历成为了当前的重要任务。在病人的就医过程中,电子病历可以记录临床医疗相关的各类数字化信息,并完成医疗信息的贮存、传输等任务。一般情况下,电子病历中包含着数量庞大的医疗实体,具有极高医疗价值。因此,越来越多的学者开始对中文电子病历的命名实体识别项目进行进一步研究。本文采用结合条件随机场(ConditionalRandomField,CRF)的双向长短时记忆神经网络模型完成命名实体识别任务,主要工作内容包括:(1)使用2017年全国知识图谱和语义计算大会(ChinaConferenceonKnowledgeGraphandSemanticComputing,CCKS)中文电子病历命名实体识别任务的开源标注电子病历数据集,搭建了BiLSTM与BiLSTM-CRF模型用以进行实验。(2)使用自行搭建的BiLSTM与BiLSTM-CRF模型进行对比实验,通过准确率、召回率、F1值三项指标进行比较,测试出结合条件随机场后BiLSTM模型的性能有所提升,准确率提高了3.06%,召回率提高了4.07%,F1值提高了3.62%。关键词:命名实体识别;双向长短时记忆神经网络;条件随机场;中文电子病历第1章绪论1.1研究背景及意义1.1.1研究背景近年来经济水平不断发展,人民对生活质量的追求不断提高,同时新冠疫情肆虐,使医疗卫生等健康问题开始被社会各界人士广泛关注。电子病历(ElectronicMedicalRecords,EMR)是一种可以记录患者的各类数字化临床信息的医疗记录,同时具有便于保存、传输和管理等特点。随着电子病历的推广,医疗行业信息化的进一步推进,越来越多的临床医疗信息得到了保存,经年累月,积聚了数量庞大的医疗数据。这些数据中包含了大量的医疗实体,具有相当的临床医疗价值,亟待进一步地研究、分析与利用。电子病历中存储了大量非结构化的文本信息,而命名实体识别(NamedEntityRecognition,NER)技术可以从非结构化信息中识别出命名实体,医疗领域的命名实体识别任务对电子病历数据的挖掘与利用有着重要意义。早期命名实体识别主要采用基于规则或词典的方法,然后基于统计的机器学习方法开始流行,计算机技术不断进步,得益于更快的机器和更多核的CPU/GPU的出现,深度学习(DeepLearning)方法开始持续升温,人们开始普遍使用深度学习模型来进行命名实体识别研究。1.1.2研究意义只有不断推动医疗行业信息化建设,才能满足我国人民群众日益增长的医疗健康需求。而医疗行业信息化建设的关键是如何有效利用信息化技术来处理电子病历数据,从而为接下来医疗系统的构建和自动化的辅助分析奠定基础。然而,电子病历具有较高的专业性,通常包含大量医疗领域专有名词,而医疗领域专有名词又极少出现在其他一般领域,医疗领域的标注语料库又需要资深医学研究人士帮助,较为稀缺,导致模型难以学习医疗领域专业名词的语义信息,而国内中文电子病历相关研究起步较晚,公开可用的中文电子病历注释语料库更加稀缺,这使得中文电子病历命名实体识别模型更加难以构建。尽管如此,国内仍有越来越多的研究人员参与到中文电子病历命名实体识别研究中来。中文电子病历的命名实体识别研究,在理论方面,命名实体识别是自然语言处理中的一项关键技术,其研究直接关系着与后续NLP的深层次应用比如机器翻译,自动问答、个性化推荐等等[1,2],是一项能够推动智能医疗系统进步的重要研究;在实践方面,可以进一步推进医疗行业信息化建设,对医疗行业的工作起到一定的辅助作用。1.2国内外研究现状1.2.1中文电子病历文本挖掘2003年,医疗卫生信息和管理系统协会(HealthcareInformationandManagementSystemsSociety,HIMSS)提出了电子病历定义[3],表示电子病历应该具有下列属性:.在诊断和治疗所需的任何时间和地点实时提供安全可靠的患者健康信息。;.存储和管理零散碎片化的或长期的电子病历信息;.当医师提供诊断和治疗服务时,可以作为医师了解患者实际情况的信息来源;.在为患者提供循证医疗服务方面起到一定的支持作用;.记录医疗信息以补充正在进行的医疗质量管理,风险管理和治疗效果评估;.记录医疗保险索赔时所需的患者信息;.向临床研究和公共卫生机构长期提供匿名信息;.支持临床试验和循证医学研究。电子病历中包含了大量有价值的医疗信息和临床知识,但同时具有数据量极大以及非结构化信息比例较高等问题,早期相关研究人员使用过决策树等方法进行电子病历的数据挖掘,效果有限;而随着近年来机器学习和深度学习技术的兴起,电子病历的文本挖掘研究开始快速发展[4]。1.2.2中文电子病历命名实体识别电子病历命名实体识别是电子病历文本挖掘中的一种基础研究,可以从海量的自由医疗文本中识别出特定种类的医疗实体,然后可以标注临床医疗实体或是开展进一步的关系抽取等研究。经过准确标注实体后的电子病历可以辅助医生查看病历,从而提升诊疗效率,缓解医疗压力。经过多年研究,电子病历命名实体识别领域的技术和方法在不断进步,从最开始的基于词典与规则的方法到基于统计的机器学习方法,再到过去几年中,逐渐成为主流的基于深度学习的方法。基于深度学习的方法中目前条件随机场和双向长短时记忆神经网络最为流行[5]。下面将详细介绍这几类方法。(1)基于词典和规则的方法这两种早期常用的方法逐渐退居二线,通常在深度学习神经网络模型中作为辅助存在。基于词典的方法顾名思义,即通常是依靠专业词典进行命名实体识别。对于电子病历这种专业性极强的文本信息,词典的规模和质量尤为重要。在医疗领域,中文电子病历的标注规范也在不断的探索当中,并形成语料库。如2015年曲春燕等人年参照i2b22010的标注规范制订了中文电子病历的标注规范,并由2名临床医生帮助检验了标准语料[6];后来在他们的中文电子病历标注语料基础上,一些研究人员也进行了改进,扩充了中文电子病历标注语料库的规模[7,8]。虽然使用基于词典的方法进行命名实体识别时可以保障维持一定水平的准确率,但是电子病历的词典的构建需要一定的医疗专业知识,通常需要医学方面的专业人员协助研究,同时语料库也需要不断地更新维护,需要耗费大量的人力物力。由于词典规模有限且需要及时更新等原因,仅使用词典往往效果不佳,因此后来标注语料库常作为特征帮助,在命名实体识别任务中起辅助作用。基于规则的方法则依赖专家构建规则模板,利用规则模板进行实体匹配。对比词典而言,基于规则的方法在更新维护上更加简单,但同样耗费人力物力,并且规则模板一般不具有泛用性,很难从一个领域拓展到下一个领域,所有通常情况下基于规则的方法也只是用于辅助模型研究。例如利用规则辅助优化特征,再结合条件随机场,以达到比单条件随机场更好的效果[9]。(2)机器学习方法面对各领域数据集的不断增大,基于词典和规则的方法开始越发乏力,与之相对,机器学习方法不但可以适应数量更大的数据集,同时耗费的人力成本和时间成本都更少,所以相对而言应用更加广泛。在机器学习的命名实体识别任务中有监督学习方法占据主要地位,常用的模型包括隐马尔可夫模型、最大熵模型、条件随机场模型和支持向量机等。=1\*GB3①隐马尔可夫模型(HiddenMarkovModel,HMM)由Bikel[10]等人最早提出,后续研究中,该模型在多个领域内的应用都展现出了很大的价值[11]。=2\*GB3②最大熵模型。熵(entropy)[12]表示空间中的能量分布均匀程度。最大熵模型(MaximumEntropy,ME)是在最大熵原理[13]的基础上实现的,主要思想是在所有概率模型中选择熵最大的概率模型。=3\*GB3③条件随机场模型。条件随机场[14-15]主要用于序列标记任务,是命名实体识别任务中最受欢迎的机器学习方法。如燕杨等人提出使用特殊层叠条件随机场进行命名实体识别,第2层中使用包含实体和词性等的特征集,对疾病和症状2类实体进行识别,实验结果表明该模型相比于传统层叠条件随机场和单CRF模型总体性能有明显提升[16]。=4\*GB3④支持向量机。Tang[17]等人结合了CRF,SVM以及词表征研究了结构化支持向量机(StrcutedSupportVectorMachine,SSVM)方法,实验结果精度最高达到了85.82%。(3)深度学习方法深度学习在图像、语音等领域大获成功之外,也渐渐成为自然语言处理领域的主要方法。命名实体识别任务中常用的深度学习模型包括卷积神经网络、循环神经网络、长短期记忆神经网络、Word2Vec模型和BERT模型等。=1\*GB3①卷积神经网络。卷积神经网络是一类前馈神经网络。Gehrmann[18]等人将卷积神经网络与传统基于规则的方法进行了对比实验,结果显示CNN的性能更加优越。Wu[19]等人使用CNN预训练文本的词向量,以此提高基准模型的准确率。Crichton[20]等人设计了有监督的多任务CNN模型,结果表明多任务学习的引入带来了更好的效果,且对小型数据集很有用。Luo[21]等人同时应用CNN和RNN对来自i2b2-VA挑战数据集的出院摘要中的医学概念之间的语义关系进行分类,并表明具备单词嵌入特征的CNN和RNN可以在挑战中获得与具有大量特征的系统相似性能。②循环神经网络。循环神经网络(RecurrentNeuralNetwork,RNN)是NLP领域的常用深度学习算法模型,但RNN极易出现梯度爆炸和消失等问题,尤其在处理长文本时。为了解决这个问题,1997年Hochreiter[22]等人首次提出了长短期记忆神经网络(LongShort-TermMemory,LSTM)概念,并从证明了这种结构能够很好地解决相关的梯度问题。③LSTM。LSTM在算法中加人了若干个门模块,用以解决传统RNN的梯度爆炸和消失问题。Schuste[23]等人提出了双向长短期记忆神经网络(bi-directionalLSTM,Bi-LSTM)概念,使用前向LSTM和后向LSTM组合输出,解决了LSTM无法编码由后往前的信息的问题。Habibi[24]等人将通过学习一个实体注释的金标准语料库(goldstandardcorpora,USC),结合预训练词嵌人(wordembedding)的大型语料库(大量来自PubMed的摘要)得到特征,并作为BiLSTM-CRF模型的输人。在包括5种不同的实体类型的不同标准语料库进行了准确率评估。平均而言,它比基于词典的NER工具提升5%,比单独使用CRF方法提升3%。Wang[25]等人为BioNER提出了一个使用字符级的多任务神经网络的学习框架。该框架考虑了具有依赖于上下文的Bi-LSTM层的BiLST1VFCRF模型。通过重用相应Bi-LSTM单元中的参数,来自不同数据集的输人可以有效地共享字符和单词级表征。在中文电子病历的命名实体识别研究中,张聪品[26]等人构建了LSTM-CRF模型对电子病历进行命名实体识别,准确率高达96.29%。=4\*GB3④Word2Vec模型和Bert模型。2013年Google提出了一种用于计算词向量的新方法Word2Vec[27],Word2Ve的特点在于可以快速训练词向量,面对数量庞大的文本数据时可以使用Word2Vec模型更快训练出更高质量的词向量。Zhu等人[28]在基于Wikipedia页面的语料库上训练上下文单词嵌人模型,然后训练BiLSTM-CRF模型并进行模型评估。Mao等人[29]在系统Hadoken中利用BERT模型完成预训练,然后将临床表征提供给CRF输出层以进行分类,并且发现模型可适用于多语言命名实体识别。1.3研究内容及论文组织结构1.3.1研究内容本文主要使用BiLSTM与BiLSTM-CRF两种模型进行对比研究。具体研究内容如下:(1)构建了BiLSTM与BiLSTM-CRF模型,以研究结合CRF层后模型在中文电子病历命名实体识别任务上的性能变化。(2)实验数据使用来自CCKS2017的电子病历命名实体识别任务的400份临床电子病历,主要识别疾病、症状、检查项目、身体部位以及治疗五种实体。使用交叉验证法,随机抽取四分之三数据作为训练集,剩余四分之一数据作为测试集,在一定程度上减小了过拟合,同时在有限的电子病历数据中获取了更多的有效信息。(3)使用准确率、召回率、F1值作为模型评价指标。实验表明BiLSTM-CRF模型的准确率、召回率、F1值比BiLSTM模型的相应评价指标分别高出了3.06%、4.70%、3.62%。1.3.2论文组织结构本文的组织结构为:第一章为绪论,首先介绍了选题的研究背景和意义,然后从中文电子病历的文本挖掘和命名实体识别两个方面介绍了中文电子病历命名实体识别相关研究现状,最后介绍了本文的主要工作内容和组织结构。第二章介绍相关技术方法,主要介绍了本文使用的长短时记忆神经网络和条件随机场的工作原理。第三章为模型设计,主要介绍了BiLSTM模型搭建和CRF层结合等具体过程。第四章为模型评价与结果分析,对实验语料进行了介绍与分析,然后通过一系列评价标准对BiLSTM与BiLSTM-CRF模型进行比较,实验结果表明了结合CRF层带来了性能上的提升。第五章为结论与展望,对本文的主要研究内容进行了总结,同时指出未来可能的研究方向。第2章相关技术方法2.1长短时记忆神经网络2.1.1LSTM概述LSTM(LongShort-TermMemory)是长短期记忆神经网络的简称,属于RNN的一类变种。在处理序列较长的数据时,原始的RNN模型经常出现梯度爆炸和消失这两个问题,从而导致信息丢失。针对这类情况,研究者决定对RNN进行改进和变形:通过引入遗忘门、输入门、输出门等若干模块来解决相应问题,并由此得出LSTM模型算法。LSTM具体结构如图2.1所示:图2.SEQ图_3.\*ARABIC1长短期记忆网络结构2.1.2LSTM运行过程为了解决RNN的问题,LSTM模块中增加了一个状态cellstate,若干个门的计算就在这个模块中进行。第一步计算遗忘门,决定要从前一时刻的细胞状态中遗忘哪些信息。输入前一时刻的隐层状态ht−1和当前时刻的输入词Xt,通过公式(2.1图2.SEQ图_3.\*ARABIC2遗忘门计算图 ft=σW第二步计算记忆门,选择性地记忆输入的值。输入前一时刻的隐层状态ht−1和当前时刻的输入词Xt,通过公式(3.2)(3.3)计算并输出记忆门的值it图2.SEQ图_3.\*ARABIC3记忆门计算图 it=σW Ct=tanhW第三步计算当前时刻细胞状态,输入记忆门的值it,遗忘门的值ft,临时细胞状态Ct和上一时刻细胞状态Ct−1图2.SEQ图_3.\*ARABIC4当前时刻细胞状态计算图 Ct=ft最后计算输出门和当前时刻隐层状态,输入前一时刻的隐层状态ht−1,当前时刻的输入词xt和当前时刻细胞状态Ct,通过公式(3.5)(3.6)分别计算出输出门的值o图2.SEQ图_3.\*ARABIC5输出门和当前时刻隐层状态计算图 ot=σW ht=ot最终得到与句子长度相同的隐层状态序列h0但是使用LSTM模型对语句进行建模存在明显的短板:即无法编码由后往前的信息;而双向LSTM(Bi-directional

LongShort-TermMemory,BiLSTM)模型同时含有前向LSTM与后向LSTM,可以更好地解决前后信息存在一定关系的问题。如“这道菜好吃得不得了”,位置靠后的信息“不得了”是用来表示位置更前的信息“好吃”的程度的,BiLSTM模型可以捕捉此类由后往前的语义。BiLSTM与常规LSTM的区别在于,它的前向层将文本按前向顺序输入,而后向层则将文本按后向顺序输入,将两层输出的结果结合作为BiLSTM层的最终输出。2.2条件随机场模型而BiLSTM模型也有一定的局限性,其对完整语句层面的特征分析较少,序列标注工作也不尽如人意,这时就需要引入条件随机场(ConditionalRandomFields,CRF)来辅助完成命名实体识别任务。BiLSTM-CRF模型结合了二者的优点:既可以捕捉语句的前后语义关系,又可以完成高准确率的序列标注。条件随机场是一种基于统计机器学习的模型,在命名实体识别等各类序列标注任务中被广泛使用。CRF可以结合相邻标签的关系来得到一个全局最优的预测序列。CRF模型如公式(2.7)所示。Pyh其中h为输入序列,y为预测序列,Z为归一化常数,tjyi+!,yi,h,i是相邻标签之间第3章电子病历命名实体识别模型构建3.1BiLSTM-CRF模型设计模型主要包含embedding层、BiLSTM层、CRF层和模型输出等3层,如图3.1所示。图3.1BiLSTM-CR使用预训练字向量,作为embedding层输入,然后经过BiLSTM层进行编码。双向LSTM层为了解决LSTM忽视下文信息的问题,由前向LSTM和后向LSTM结合组成,二者都链接同一输出层,从而可以输出完整的上下文信息,区别在于输人的文本词向量前者是前向的,后者是后向的。前向LSTM的输出序列为h=h1,h2,h3输入上层的输出序列Pk=h其中θ为CRF层的参数集合,由公式(3.1)计算可得即所有函数的估计:Lθ=X,Y∈DatasetlogpY其中p表示输入特征序列Pk和参数集合θ时Y最终通过相邻标签的关系获得全局最优标记序列。参数名称数值参数名称数值embedding_size100Learning_rate0.01神经元数量128batch_size64隐藏层32epoch100Layer_dropout0.4activitiontanh3.2模型参数设置本文实验均基于Python语言开发,搭建tensorflow环境,采用Keras实现深度学习神经网络模型。训练过程中采用了dropout策略以防止过拟合。实验具体参数设置如表3.1所示。表3.1参数设置3.3模型评价指标使用准确率P(Precision)、召回率R(Recall)、和F1值(F1-score)对实验结果进行评价,相关计算公式如下: P=TPTP+FP R=TPTP+FN F=2∗P∗RP+R 其中TP(TruePositive)为真正例,指被模型预测为正例,实际上也确实是正例的实例。FP(FalsePositive)为假正例,指被模型预测为正例,实际上是负例的实例。FN(FalseNegative)为真负例,指被预测为负例,实际上确实是负例的实例。通过三种公式得到的值来比较模型的命名实体识别效果,确保对神经网络模型进行相对全面立体的评价。第4章电子病历命名实体识别模型评价与结果分析4.1电子病历实验语料分析低质量的实验语料不仅自身的研究价值较低,实践意义不大,同时在一定程度上还会影响深度学习模型的训练和测试,使命名实体识别模型表现出来的性能下降,基于此,本文选择使用CCKS2017中文电子病历命名实体识别任务的高质量标注数据集,该数据集包含400份来自不同科室的真实中文临床记录,经由多名临床专家人工标注,对样本中的句子也根据中文标点符号进行了处理。数据集中具体的医疗实体统计信息如表4.1所示。表4.SEQ表4.\*ARABIC1实体数量统计信息数据集训练集测试集身体部位106203026疾病实体822613症状实体78352295检查项目95443134治疗实体1046503总计298679571该数据集的标注过程如下:首先对分类目标进行标记,总体分为五类实体:O-非实体部分,TREATMENT-治疗方式,BODY-身体部位,SIGN-疾病症状,CHECK-医学检查,DISEASE-疾病实体。然后使用BIO三元标注法对目标进行序列标注:将每个元素标注为“B-X”、“I-X”或者“O”。其中,“B-BODY”表示此元素所在的片段属于BODY类型并且此元素在此片段的开头,“I-SIGN”表示此元素所在的片段属于SIGN类型但不在开头位置,“O”表示不属于任何类型。标注使用的样例和结果如表4.2。表4.SEQ表4.\*ARABIC2标注的部分样例编号样例结果1右髋部右/BODY-B髋/BODY-I部/BODY-I2男,双塔山人,主因咳嗽、少痰1个月,加重3天,抽搐。男/O,/O双 /O塔/O山/O人/O,/O主/O因/O咳/SIGNS-B嗽/SIGNS-I、/O少/SIGNS-B痰/SIGNS-I1/O个/O月/O,/O加/O重/O3/O天/O,/O抽/SIGNS-B搐/SIGNS-I4.2模型比较结果为了直观地表现出结合CRF层后BiLSTM模型的性能变动,本文使用BiLSTM和BiLSTM-CRF这两种模型进行对比实验。由于数据集数量有限,为防止模型过拟合,并且便于检验模型的泛化能力,本文使用交叉验证法进行训练,将实验语料随机分为4份,随机选择其中3份作为训练集,余下1份作为测试集进行实验,进行4轮实验,然后求出几轮实验的平均值作为评估数据,结果如表4.3所示。实验表明BiLSTM-CRF模型的准确率提高3.06%,召回率提高4.07%,F1值提高3.62%。这说明BiLSTM模型结合了CRF层后,中文电子病历命名实体识别任务性能有明显提升。表4.SEQ表4.\*ARABIC3命名实体识别结果深度学习神经网络模型评价指标准确率召回率F1值BiLSTM80.6980.5380.6180.7279.7180.2180.2370.5175.0682.1275.4278.63均值80.9476.5478.63BiLSTM-CRF86.0478.8382.2883.4383.2383.3385.3983.8784.6281.1376.5178.75均值84.0080.6182.254.3命名实体识别结果使用训练后的BiLSTM-CRF模型进行中文电子病历命名实体识别。表4.4展示由BiLSTM-CRF模型识别实体的几个例子。表4.SEQ表4.\*ARABIC4通过BiLSTM-CRF模型识别实体样例编号命名实体类别样例1疾病(DISEASE)右髋部摔伤直肠癌2症状(SIGNS)少痰抽搐3治疗(TREATMENT)维生素活血化瘀药物4检查项目(CHECK)头颅CT拍片5身体部位(BODY)右侧眼眶外侧壁上腹部第5章结论与展望5.1结论命名实体识别往往是后续复杂任务的一个基础而又重要的环节,随着电子病历命名实体识别研究的不断深入,医疗行业从业人员对于各类疾病的特征分析也更加完善,从而更好地辅助医疗过程,进一步推动医疗行业的信息化建设。(1)本文使用char-embedding作为原始特征,然后经过BiLSTM进行编码,在一定程度上缓解了长文本输入的依赖问题以及梯度爆炸问题。(2)结合CRF层解码神经网络的输出,可以获取更加准确的识别结果,从而更加精确完成中文电子病历的命名实体识别任务,使命名实体识别模型的平均F1值提高了3.62%。5.2展望中文电子病历的研究相对起步较晚,目前中文电子病历相关的命名实体识别研究工作相对较少,且中文与英文在语言特性上也有显著的差异,在分词方式、标注方法、字体特征和词汇粒度等多个方面都大有不同,因此目前公开的中文电子病历高质量数据集非常稀少。本文采用的CCKS2017数据集质量优秀、应用广泛,但病例数量有限,难以测试出模型的泛化能力,本文模型在其他数量、质量各异的数据集上的性能表现还有待实验。而传统BiLSTM-CRF模型本身仍具有一定缺陷,无法体现出单个字符元素在不同语句中的差异,而这种单个字符的不同权重表现在上下文的理解过程中往往具有重要作用。未来的可能研究方向包括:(1)使用更多其他中文电子病历命名实体识别相关的数据集来测试模型的泛化能力,考虑使用数据更为庞大和标注质量参差不齐的各类数据集来对模型的性能进行进一步测试。(2)基于BiLSTM-CRF模型的缺陷,考虑引入注意力机制来进一步提高模型完成中文电子病历命名实体识别任务的性能。参考文献[1]GrishmanR,SundheimB.MessageUnderstandingConference一6:ABriefHistory[C]//COLING.1996,96:466-471.[2]Klinger,Roman,andKatrinTomanek.Classicalprobabilisticmodelsandconditionalrandomfields.TU,AlgorithmEngineering,2007.[3]HandlerT,HoltmeierR,MetzgerJ,etal.HIMSSelectronichealthrecorddefinitionalmodelversion1.0[J].TheInformationandManagementSystemsSociety(HIMSS)ElectronicHealthRecordCommittee,2003.[4]吴宗友,白昆龙,杨林蕊,王仪琦,田英杰.电子病历文本挖掘研究综述[J].计算机研究与发展,2021,58(03):513-527.[5]杨飞洪,张宇,覃露,等.中文电子病历的命名实体识别研究进展[J].中国数字医学,2020,15(2):9-12)[6]曲春燕,关毅,杨锦锋,等.中文电子病历命名实体标注语料库构建[J].高技术通讯,2015,25(2):143-150)[7]杨锦锋,关毅,何彬,等.中文电子病历命名实体和实体关系语料库构建[J].软件学报,2016,27(11):2725-2746)[8]BandyJM,HalpernY,SontagD,etal.ElectronicphenotypingwithAPHRODITEandtheobservationalhealthsciencesandinformatics(OHDSI)datanetwork[J].AMIASummitsonTranslationalScienceProc,2017,2017:48-57[9]翟菊叶,陈春燕,张钮,等.基于CRF与规则相结合的中文电子病历命名实体识别研究[J].包头医学院学报,2017,33(11):124-125,130)[10]BikelDM,SchwartzR,WeischedelRM.Analgorithmthatlearnswhatinaname[J].MachineLearning,1999,34(1/2/3):211-231[11]KupiecJ.Robustpart-of-speechtaggingusingahiddenMarkovmodel[J].C'omputerSpeech&Language,1992.6(3):225-242[12]BergerAI,PietraVJD,PietraSAD.Amaximumentropyapproachtonaturallanguageprocessing[J]ComputationalLinguistics,1996,22(1):39-71[13]JaynesET.Informationtheoryandstatisticalmechanics[J].PhysicalReview,1957,106(4):620-630[14]LaffertyJD,MaccllumA,PereiraFC.Conditionalrandomfields:Probabilisticmodelsforsegmentingandlabelingsequencedata[C]//Procofthe18thIntConfonMachineLearning.NewYork:ACM,2001:282-289[15]WallachHM.Conditionalrandomfields:Anintroduction[J].TechnicalReports,2004,53(2):267-272[16]燕杨,文敦伟,王云吉,等.基于层叠条件随机场的中文病历命名实体识别[J].吉林大学学报:工学版,2014,44(6):1843-1848)[17]TangBuzhou,CaoHongxin,WuYonghui,etal.Recognizingclinicalentitiesinhospitaldischargesummariesusingstructuralsupportvectormachineswithwordrepresentationfeatures[J].BMCMedicalInformaticsandDecisionMaking,2013,13(Suppl1):S1[18]GehrmannS.DernoncourtF.LiYeran,etal.Comparingrule-basedanddeeplearningmodelsforpatientphenotyping[J].arXivpreprint,arXiv;1703.08705,2017[19]WuYonghui,JiangMin,LeiJianbo,etal

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论