CN116467440B 基于李氏人工肝病历的多层次语义文本分类方法 (浙江大学)_第1页
CN116467440B 基于李氏人工肝病历的多层次语义文本分类方法 (浙江大学)_第2页
CN116467440B 基于李氏人工肝病历的多层次语义文本分类方法 (浙江大学)_第3页
CN116467440B 基于李氏人工肝病历的多层次语义文本分类方法 (浙江大学)_第4页
CN116467440B 基于李氏人工肝病历的多层次语义文本分类方法 (浙江大学)_第5页
已阅读5页,还剩21页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

US2023061731A1,2023.0基于李氏人工肝病历的多层次语义文本分体是基于李氏人工肝病历的多层次语义文本分处理再输入基于多层次语义的文本表示网络分现病史的文本分割为句子序列进行预处理后经过基于多层次语义的文本表示网络再经平均池既往史词向量矩阵和现病史词向量矩阵分别经过特征提取网络后通过特征融合预测网络输出2S2、将主诉和既往史的文本数据经过预处理后获S2.1、预处理后主诉的分词序列和分字序列经过基于S2.2、预处理后既往史的分词序列和分字序列经过S2.3、预处理后现病史的的分词序列和分字序列经过基于多层次语义的文本表示网基于多层次语义的文本表示网络将输入文本映射为词向量矩矩阵E∈Rk×D经过词向量上下文信息提取网络,对每个新的词向量矩阵E∈Rk×D在指定的上2.根据权利要求1所述的基于李氏人工肝病历的多层次语义文本分类方法,其特征在所述特征融合预测网络指特征拼接操作后再经过3.根据权利要求2所述的基于李氏人工肝病历的多层次语义文本分类方法,其特征在34.根据权利要求3所述的基于李氏人工肝病历的多层次语义文本分类方法,其特征在cDO(2)5.根据权利要求4所述的基于李氏人工肝病历的多层次语义文本分类方法,其特征在然后计算第i个词语为中心的窗口范围内的第i+t个词语词向量经过权重矩阵加权后6.根据权利要求5所述的基于李氏人工肝病历的多层次语义文本分类方法,其特征在所述基于多层次语义病历理解的特征拼接分类网络的训练和测试从医院病历系统中获得病历的文本数据并进行分类标注,4速给出分析辅助医生判断的方法以提高李氏人工肝现场的定程度上包含一些语义信息,但并没有考虑到[0005]本发明要解决的技术问题是提供基于李氏人工肝病历的多层次语义文本分类方5向量矩阵E∈Rk×D经过词向量上下文信息提取网络,对每个新的词向量矩阵E∈Rk×D在指定[0024]将分词序列分别通过两个embedding层,生成词向量的振幅向量rw和位置编码的[0030]将分字序列分别通过两个embedding层,生成字向量的振幅向量rc和位置编码的6[0036]然后计算第i个词语为中心的窗口范围内的第i+t个词语词向量经过权重矩阵加权后的投影向量r:基于多层次语义病历理解的特征拼接分类网络使得模型性能最佳,并使用测试集进行验[0049]需强调的是,本发明仅仅只是对于李氏人工肝病历中字72[0066]基于多层次语义病历理解的特征拼接分类网络包括基于多层次语义的文本表示[0068]基于多层次语义的文本表示网络包括基于已有复数位置编码工作搭建的词向量[0069]经过预处理后获得的分词序列经过词向量位置编码融合网络映射为融合复数形[0070]本发明的基于多层次语义的文本表示网络是基于已有复数形式位置编码方法搭8[0072]基于已有复数形式位置编码方法(WangB,ZhaoD,LiomaC,etal.Encoding[0077]将复数形式位置编码应用于字向量中,此处位置编码指的是字在词中的位置编[0083]词向量位置编码融合网络的输出(词向量)对应多个字向量位置编码融合网络的[0086]pftr=tanh(wovx)eRO(3)9本数据经过预处理之后得到的各自的分词序列和分字序列分别送入步骤S31构建的基于多为句子序列再进行预处理,然后将经过预处理的现病史的分词序列和分字序列经过步骤S31构建的基于多层次语义的文本表示网络和平均池化后将输入文本映射为现病史词向量矩阵;所获得主诉现病史、既往史现病史和现病史词向量矩阵再分别经过特征提取网络既往史特征和现病史特征通过特征融合预测网络(指特征拼接后再经过全连接层)输出基[0096]如表2所示,为本发明的基于多层次语义病历理解的特征拼接分类网络的整体网CentOS7.9.2009Python3.7.9PyTorch1.8.1[0104]将步骤2的训练集输入步骤S3建立的基于多层次语义病历理解的特征拼接分类网[0105]本发明的训练和测试采用合作医院的实际李氏人工肝适宜治疗的病历文本数据得的训练好的基于多层次语义病历理解的特征拼接分类网络适合用于对李氏人工肝是否更高质量的向量从而提升对于适宜基于多层次语义病历理解的特征拼接分类网络的分类征提取网络的基础上有无本发明的基于多层次语义的文本表示网络的分类准确性的差异,从表4结果中可以看出,本发明的基于多层次语义的文本表示网络在不同的基线分类网络上均有较好的表现,且本发明所提及的三个层次的语义信息均对最后的分类准确率有贡既往史文本的特征提取网络的输出用作分类的基于多层次语义病历理解的特征拼接分类网络中对于现病史文本的特征提取网络的输就进行拼接,再将拼接文本送入Bi_LSTM网络分类(拼接文本之后的结构与单文本进行Bi_输入文本方法准确率F1值主诉Bi_LSTM分类0.80280.8230主诉文本表示+Bi_LSTM分类0.86240.8819现病史Bi_LSTM分类0.83940.8560现病史文本表示+Bi_LSTM分类0.86240.8870现病史分句+文本表示+池化+Bi_LSTM分类0.88070.8943既往史Bi_LSTM分类0.77980.7983既往史文本表示+Bi_LSTM分类0.80730.8235文本直接拼接+Bi_LSTM分类0.84400.8682本发明方法0.88990.9016[0123]文献1是Bi_LSTM+CNN结构,文献2是较为常用的CNN+Bi_LSTM+At[0124]文献1参见AbuKwaikK,SaadM,ChatzikyriakidisS,etal.LSTM_CNNdeeplearningmodelforsentimentanalysisofdialectalArabic[C]//ArabicLanguageProcessing:FromTheorytoPractice:7thInternationalConference,ICALP2019,Nancy,France,October16–17,2019,Proceedings7.SpringerInternationalPublishing,2019:108_121.[0125]文献2参见JangB,KimM,HarerimanaG,etal.Bi_LSTMmodeltoincreaseaccuracyintextclassification:Combinin

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论