CN115640394B 文本分类方法、文本分类装置、计算机设备及存储介质 (平安科技(深圳)有限公司)_第1页
CN115640394B 文本分类方法、文本分类装置、计算机设备及存储介质 (平安科技(深圳)有限公司)_第2页
CN115640394B 文本分类方法、文本分类装置、计算机设备及存储介质 (平安科技(深圳)有限公司)_第3页
CN115640394B 文本分类方法、文本分类装置、计算机设备及存储介质 (平安科技(深圳)有限公司)_第4页
CN115640394B 文本分类方法、文本分类装置、计算机设备及存储介质 (平安科技(深圳)有限公司)_第5页
已阅读5页,还剩32页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

道福安社区益田路5033号平安金融中构建的N个分类模板,并将初始文本填充到每个匹配模型对预构建的训练样本集和初始文本进得到预测得分;根据预测得分确定文本分类结2获取待分类的初始文本和预构建的N个分类模板,并将所述初始文本填充到每个所述根据预训练的相似度匹配模型对预构建的训练样本集和所述初始文本进行文本相似将所述相似文本和所述相似文本标签填充到每个所述分类模板中,得到N个相似分类对N个所述分类模板对应的所述初始分类文本和所述相似分类文本进行文本拼接,得获取预设的M个分类类别标签,并根据每个所述分类类别标签对所述第一拼接文本中将每个所述分类类别标签下的N个所述第二拼接文本输入至预训练的语言表征模型进2.根据权利要求1所述的方法,其特征在于,所分别获取N个所述分类模板对应的所述初始分类文对每个所述分类模板下的所述初始分类文本和所述相似分类文本进行文本拼3.根据权利要求1所述的方法,其特征在于,将每个所述分类类别标签下的N个所述第二拼接文本输入至预训练的语言表征模型进根据N个所述token概率得分计算得到每个所述分类类别标签的掩膜语言模型处理层和预测处理层,所述将每个所述分类类别标签下的N个所述第二拼接将每个所述分类类别标签下的N个所述第二拼接文本分别输入至预训练的语言表征模通过所述嵌入表示处理层对每个所述第二拼接文本进行嵌入表示处理通过所述掩膜语言模型处理层对所述嵌入表示向量进行掩膜语言模通过所述预测处理层对所述掩膜表示向量进行预测处理,得到每3根据所述预测得分最高的分类类别标签确定所述初始文本对应的文本7.根据权利要求1至5任一项所述的方法,获取预构建的训练样本集,所述训练样本集包括多个训练样将所述训练样本集和所述初始文本输入至所述相似度匹配模型进行文本相似度匹配,根据多个所述相似度值确定所述初始文本对应的相似文本和所述相似文本的相似文相似度匹配模块,用于根据预训练的相似度匹配模型对预构建文本填充模块,用于将所述相似文本和所述相似文本标签填充到每个所述分类模板文本拼接模块,用于对N个所述分类模板对应的所述初始分类文本和所述相似分类文类别替换模块,用于根据预设的M个分类类别标签对所述第一拼接文本中的所述初始分类预测模块,用于将每个所述分类类别标签下的N个所述第二拼接文本输入至预训4所述至少一个计算机程序被存储在所述至少一个存储器中,所述至5[0005]获取待分类的初始文本和预构建的N个分类模板,并将所述初始文本填充到每个[0006]根据预训练的相似度匹配模型对预构建的训练样本集和所述初始文本进行文本[0007]将所述相似文本和所述相似文本标签填充到每个所述分类模板中,得到N个相似[0008]对N个所述分类模板对应的所述初始分类文本和所述相似分类文本进行文本拼[0009]获取预设的M个分类类别标签,并根据每个所述分类类别标签对所述第一拼接文[0010]将每个所述分类类别标签下的N个所述第二拼接文本输入至预训练的语言表征模[0012]在一些实施例中,所述对N个所述分类模板对应的所述初始分类文本和所述相似6[0014]对每个所述分类模板下的所述初始分类文本和所述相似[0016]在一些实施例中,所述将每个所述分类类别标签下的N个所述第二拼接文本输入[0017]将每个所述分类类别标签下的N个所述第二拼接文本输入至预训练的语言表征模和预测处理层,所述将每个所述分类类别标签下的N个所述第二拼接文本分别输入至预训[0020]将每个所述分类类别标签下的N个所述第二拼接文本分别输入至预训练的语言表[0025]对N个所述token概率得分进行均值计算,得到每个所述分类类别标签的预测得[0033]将所述训练样本集和所述初始文本输入至所述相似度匹配模型进行文本相似度[0034]根据多个所述相似度值确定所述初始文本对应的相似文本和所述相似文本的相7[0039]文本拼接模块,用于对N个所述分类模板对应的所述初始分类文本和所述相似分[0040]类别替换模块,用于根据预设的M个分类类别标签对所述第一拼接文本中的所述[0041]分类预测模块,用于将每个所述分类类别标签下的N个所述第二拼接文本输入至执行所述至少一个计算机程序以实现上述第一方面所先,获取待分类的初始文本和预构建的N个分类模板,并将初始文本填充到每个分类模板类类别标签,并根据每个分类类别标签对第一拼接文本中的初始文本标签进行类别替换,分类类别标签下的N个第二拼接文本输入至预训练的语言表征模型进行分类预测,得到每8技术人员通常理解的含义相同。本文中所使用的术语只是为了描述本申请实施例的目的,[0065]BM25算法:是一种用来评价搜索词和文9[0066]词频_逆文档频率(TermFrequency_InverseDocumentFrequency,TF_IDF)算Transformer构建而成。BERT中有三种Embedding,即TokenEmbedding,SegmentLM还要做以两个句子为输入的分类任务;PositionEmbeddings,这里的位置词向量不是transfor中的三角函数,而是BERT经过训练学到的。但BERT直接训练一个Position个包含位置信息的Embedding,最后这个PositionEmbedding和wordEmbedding的结合方[0068]基于预训练模型的PromptLearning零样本分类方法已经被普遍证明是一种高效习的海量知识让预训练模型还原输入中的[Mask]toke文本分类的方法,即PromptLearning中的verbalizer通常是基于人工经验生成标签到类服务、云通信、中间件服务、域名服务、安全服务、内容分发网络(ContentDelivery[0082]步骤S160,将每个分类类别标签下的N个第二拼接文本输入至预训练的语言表征先,获取待分类的初始文本和预构建的N个分类模板,并将初始文本填充到每个分类模板BM25算法构建相似度匹配模型,则根据相似度匹配模型对初始文本进行文本相似度匹配,即对当前输入的初始文本召回与其最相似的相似文本和该相似文本对应的[0089]在一些实施例的步骤S130中,为了便于根据相似文本对[0091]在一些实施例的步骤S150中,为了更准确地确定初始文本申请实施例通过遍历所有类别下组装得到的文本数据,即通过获取预设的M个分类类别[0092]在一些实施例的步骤S160中,将得到的M*N个第二拼接文本输入至预训练的语言从而更准确地确定初始文本对应的文本分类[0099]在一些实施例的步骤S210至步骤S230中,在分别获取N个分类模板对应的初始分[0100]具体地,可以采用SEP标签拼接方法对每个分类模板下的初始分类文本和相似分[SEP]相似文本标签[SEP]初始文本[SEP][0102]步骤S310,将每个分类类别标签下的N个第二拼接文本输入至预训练的语言表征[0104]在一些实施例的步骤S310中,将每个分类类别标签下的N个第二拼接文本输入至[0105]在一些实施例的步骤S320中,对于输入的每个分类类别标签下的N个第二拼接文则步骤S310具体包括但不限于步骤S410至步骤S440,下面结合图4对这四个步骤进行详细[0107]步骤S410,将每个分类类别标签下的N个第二拼接文本分别输入至预训练的语言个分类类别标签下的N个第二拼接文本分别输入至预训练的语言表征模型。并根据拼接采和结束处添加额外的tokens,以有效分隔第二拼接文本中的初始分类文本和相似分类文文本的token概率得分。本申请实施例利用BERT的MLM预训练的特性作为Verbalizer的方识库引入可能存在的偏差和统计计算的开销。板下的第二拼接文本在经过BERT模型的分类预测后,将得到一个预期答案对应的token概[0117]步骤S530,根据预测得分最高的分类类别标签确定初始文本对应的文本分类结[0122]步骤S630,将训练样本集和初始文本输入至相似度匹配模型进行文本相似度匹版投票的方式有效避免了单个人工构建模版存在的偏差,增加了文本分类输出的可信度。地预测出初始文本对应的类别,根据预设的M个分类类别标签对第一拼接文本中的初始文为整数。将每个分类类别标签下的N个第二拼接文本输入至预训练的语言表征模型进行分[0129]文本和模板获取模块710,用于获取待分类的初始文本和[0130]相似度匹配模块720,用于根据预训练的相似度匹配模型对预构建的训练样本集可以根据实际的需要选择其中的部分或者

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论