CN115510232B 文本语句分类方法和分类装置、电子设备及存储介质 (平安科技(深圳)有限公司)_第1页
CN115510232B 文本语句分类方法和分类装置、电子设备及存储介质 (平安科技(深圳)有限公司)_第2页
CN115510232B 文本语句分类方法和分类装置、电子设备及存储介质 (平安科技(深圳)有限公司)_第3页
CN115510232B 文本语句分类方法和分类装置、电子设备及存储介质 (平安科技(深圳)有限公司)_第4页
CN115510232B 文本语句分类方法和分类装置、电子设备及存储介质 (平安科技(深圳)有限公司)_第5页
已阅读5页,还剩36页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

道福安社区益田路5033号平安金融中US2018075351A1,2018.03.15本申请实施例提供了一种文本语句分类方本预测概率值进行数值比较以确定目标样本标对获取的初始文本语句进行分类以得到目标类2获取训练样本集,所述训练样本集包括多个样本对数据,每个所获取初始文本语句分类模型,所述初始文本语句分类将每个所述样本对数据的所述正样本语句和所述负样本语句输入至所述初始文本语通过所述文本分类子模型对所述第一文本特征进行文本分类处理对所述正样本语句的多个所述样本预测概率值进行数值比较,确根据所述正样本语句的所述正样本标签和所述目标样本标签对所述初始文本语句分获取待分类的初始文本语句,通过所述目标文本语句分类模型通过所述特征约束子模型对所述第一文本特征、所述第二文本特征、根据所述正样本标签和所述样本预测概率值得到交根据所述对比损失值和所述交叉熵损失值得到进行特征提取,得到所述正样本语句的第一文本特征和所述负样本语句的第二文本特征,将每个所述样本对数据的所述正样本语句和所述负样本语句输入至所述初始文本语分别对所述正样本语句中的每个文本字和所述负样本语句中的每个文本字进行所述分别对全部所述正样本字特征和全部所述负样本字特征进行所述3所述正样本语句的第一文本特征和所述负样本语句的第根据预设的文本长度阈值分别对所述正样本语句和所述负样本语根据预设的指示函数对所述正样本标签和所述负样本标签进行标签比较根据所述第一文本特征、所述第二文本特征和所述对比系数进行特征约束6.根据权利要求2至5任一项所述的方法,其特征在根据预设的交叉熵损失函数对所述文本字数、所述正样本标签和初始模型获取模块,用于获取初始文本语句分类模型特征提取模块,用于将每个所述样本对数据的所述正样本特征约束模块,用于通过所述特征约束子模型和所述第样本文本分类模块,用于通过所述文本分类子模型对所述第一文本数值比较模块,用于对所述正样本语句的多个4对比损失值获取模块,用于通过所述特征约束子模型对所述第一文本特交叉熵损失值获取模块,用于根据所述正样本标签和所模型损失值获取模块,用于根据所述对比损失值和所述交叉熵损失值得到模型损失5[0007]将每个所述样本对数据的所述正样本语句和所述负样本语句输入至所述初始文[0008]通过所述特征约束子模型和所述第二文本特征对所述第一文本特征进行特征约[0011]根据所述正样本语句的所述正样本标签和所述目标样本标签对所述初始文本语6个所述样本对数据的所述正样本语句和所述负样本语句输入至所述初始文本语句分类模[0018]将每个所述样本对数据的所述正样本语句和所述负样本语句输入至所述初始文[0019]分别对所述正样本语句中的每个文本字和所述负样本语句中的每个文本字进行[0020]分别对全部所述正样本字特征和全部所述负样本字特征得到所述正样本语句的第一文本特征和所述负样本语句的[0022]根据预设的文本长度阈值分别对所述正样本语句和所述负样本语句进行长度比[0026]根据所述第一文本特征、所述第二文本特征和所述对比7[0036]数值比较模块,用于对所述正样本语句的多个所述样本预测概率值进行数值比[0041]本申请实施例提出的一种文本语句分类方法和分类装置8技术人员通常理解的含义相同。本文中所使用的术语只是为了描述本申请实施例的目的,9于Transformer构建而成。BERT中有三种Embedding,即TokenEmbedding,SegmentLM还要做以两个句子为输入的分类任务;PositionEmbeddings,这里的位置词向量不是transfor中的三角函数,而是BERT经过训练学到的。但BERT直接训练一个Position个包含位置信息的Embedding,最后这个PositionEmbedding和wordEmbedding的结合方[0072]步骤S104,通过特征约束子模型和第二文本特征对第一 标签构成一个样本对数据。全部样本语句做匹配,以生成(n1+n2)*(n1+n2_1)/2个样本对数据,以使得标签更加多样束子模型用于基于提取后的文本语句特征的度量学习来约束与调整文本语句特征的表征,文本分类子模型用于根据得到的特征形成最后征进行自注意力处理,以得到正样本语句的第一文本特征和负样本语句的第二文本特征,该第一文本特征和第二文本特征用于表示将文本字与字之间的特征信息通过自注意力机[0093]需要说明的是,第一文本特征由对应的正样本语句的全部正样本子特征的token特征向量求和得到,第二文本特征由对应的负样本语句的全部正样本子特征的token特征类方法还可以包括但不限于包括步骤S301至步句分类模型的一个batch内的正样本语句和负样本预计进行文本长度调整,用于保证文本类方法还可以包括但不限于包括步骤S401至离,使得在文本的内容与标签的关联性不明显的情况下也能让模型有效学到对应的分布。[0108]请参阅图5,在一些实施例中,步骤S401可以包括但不限于包括步骤S501至步骤[0111]在一些实施例的步骤S501和步骤S502中,为了通过对比损失函数对第一文本特[0114]请参阅图6,在一些实施例中,步骤S402可以包括但不限于包括步骤S601至步骤[0120]需要说明的是,将对比损失值LCL和交叉熵损失值LCEL进行求备和服务端设备,客户端设备用于将自身获取的待分类的初始文本语句发送到服务端设备发送的待分类的初始文本语句后,通过目标文本语句分类模型对初始文本语句进行分[0125]需要说明的是,当用户需要通过确定待分类的初始文本使用评价后,使用本申请实施例的文本语句分类方法确定该用户对APP的认可程度分类类[0127]本申请实施例提供的一种文本语句分类方法,首先构建句进行高精度的文本语句分类,本申请实施例通过采集样本对数据的方式得到训练样本练子模型分别对正样本语句中的每个文本字和负样本语句中的每个文本字进行特征编码[0131]特征提取模块703,用于将每个样本对数据的正样本语句和负样本语句输入至初始文本语句分类模型,通过预训练子模型分别对正样本语句和负样本语句进行特征提取,得到正样本语句的第一文本特征和负样本语句的[0132]特征约束模块704,用于通过特征约束子模型和第二文本特征对第一文本特征进[0133]样本文本分类模块705,用于通过文本分类子模型对第一文本特征进行文本分类[0135]目标模型构建模块707,用于根据正样本语句的正样本标签和目标样本标签对初[0137]该文本语句分类装置的具体实施方式与上述文本语句分类方法的具体实施例基[0148]本申请实施例提供的一种文本语句分类方法和分类装置型对文本语句分类的准确性。本申请实施例通过采集样本对数据的方式得到训练样本集,有效地实现了训练样本的扩充并能够灵活控制每个类别训练样本数量从而实现样本的平过将深度度量学习的对比损失函数与交叉熵损失函数结合,以不断调整句子与token特征可以根据实际的需要选择其中的部分或者

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论