CN114896371B 一种自然语言处理模型的训练方法和装置 (鼎富智能科技有限公司)_第1页
CN114896371B 一种自然语言处理模型的训练方法和装置 (鼎富智能科技有限公司)_第2页
CN114896371B 一种自然语言处理模型的训练方法和装置 (鼎富智能科技有限公司)_第3页
CN114896371B 一种自然语言处理模型的训练方法和装置 (鼎富智能科技有限公司)_第4页
CN114896371B 一种自然语言处理模型的训练方法和装置 (鼎富智能科技有限公司)_第5页
已阅读5页,还剩35页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本申请提供了一种自然语言处理模型的训言处理任务的提示矩阵来更新其中的单个自然任务的训练样本数据和更新后的提示矩阵输入能够通过多个任务的提示矩阵的联合学习来提2确定第一任务在第一层对应的第一提示矩阵、第二任务在第一层对应的第二提示矩初始化与所述第二提示矩阵对应的第一权重矩阵,所述第任务的训练样本数据和所述第二任务的训练将所述第一权重矩阵、所述第二提示矩阵、所述第一偏置矩阵根据所述第一任务的训练样本数据、更新后的所述第一提示矩所述第一任务在第一层对应的自注意力机制运算的输入包括第一第一拼接向量矩阵由第一层的第一向量矩阵和所述更新后的所述第一提示矩阵拼接得到,所述第一向量矩阵为与所述第一任务对应的键向量矩根据所述第二系数矩阵、所述第一提示矩阵和所述第二提示矩阵,根据所述第二任务的训练样本数据、更新后的所述第二提示矩所述第二任务在第一层对应的自注意力机制运算的输入包括第二第二拼接向量矩阵由第一层的第二向量矩阵和所述更新后的所述第二提示矩阵拼接得到,所述第二向量矩阵为与所述第二任务对应的键向量矩获取预训练语言模型,所述预训练语言模型的第一层为采用自注意力机制的层结构,所述预训练语言模型的第二层为采用自注意力机制的层确定第一任务在第一层对应的第一提示矩阵、第二任务在第一层对应的第二提示矩确定第二任务在第二层对应的第三提示矩阵,所述第三提示基于陆地移动距离算法根据所述第一欧式距离确定第一转移量,所表征所述第二提示矩阵传递到所述第一提示矩阵3基于陆地移动距离算法根据所述第二欧式距离确定第二转移量,所根据所述第一任务的训练样本数据、更新后的所述第一提示矩所述第一任务在第一层对应的自注意力机制运算的输入包括第一第一拼接向量矩阵由第一层的第一向量矩阵和所述更新后的所述第一提示矩阵拼接得到,所述第一向量矩阵为与所述第一任务对应的键向量矩根据所述预训练语言模型的层数和除所述第一任务以外的剩余任务数量确定第二比模型获取模块,用于获取预训练语言模型,所述预训练语言模型的第提示矩阵确定模块,用于确定第一任务在第一层对应的第一提系数矩阵确定模块,用于初始化与所述第二提示权重矩阵是基于所述第一任务的训练样本数据和所述第二任务的训练样本数据的可学习确定第一激活函数以及与所述第二提示矩阵对应的第一偏置矩提示矩阵更新模块,用于获取所述第一系数矩阵与所述第二提示矩所述第一任务在第一层对应的自注意力机制运算的输入包括第一第一拼接向量矩阵由第一层的第一向量矩阵和所述更新后的所述第一提示矩阵拼接得到,所述第一向量矩阵为与所述第一任务对应的键向量矩4所述提示矩阵更新模块还用于根据所述第二系数矩阵、所述第一提示矩所述模型训练模块还用于根据所述第二任务的训练样本数据、更新后所述第二任务在第一层对应的自注意力机制运算的输入包括第二第二拼接向量矩阵由第一层的第二向量矩阵和所述更新后的所述第二提示矩阵拼接得到,所述第二向量矩阵为与所述第二任务对应的键向量矩5[0013]本申请实施例在训练模型前,将多个NLP任务对应的提示矩阵融合来更新单个任由于NLP任务之间具有递进关系或者相似关系,能够通过多个任务的提示矩阵联合学习来提升提示调整方法的效果。进一步地,由于本申请实施例中的提示调整方法基于了6[0034]在一个示例中,根据第一提示矩阵和第三提示矩阵确定7[0054]本申请实施例的装置在训练模型前,将多个NLP任务对应的提示矩阵融合来更新8[0057]图2是本申请实施例提供的再一例自然语言处理模型的训练方法的示意性流程prompt))和连续提示(又叫做软提数量决定了prompt的类型。例如,根据[z]位置的不同,可以将prompt分为clozeprompt([z]在句中)和prefixprompt([z]在句末)。具体选择哪一种则取决于任务形式和模型类[0068]提示调整(PromptTuning):将prompt加入到微调过程中,并且可以做到只对9最初EMD的概念是用于图像检索的,后来因为其各种优点,逐渐用到其他方面的相似度度[0071]Transformer层:Transformer是2017年的一篇论文《AttentionisAllYou个position的向量(vector)在最终该时间步(timestep)的上下文(context)中占的比重有多少。Transformer层中所使用的attention公式为其[0072]Transformers的双向编码表示(BidirectionalEncoderRepresentationfromspecific)的有监督模式转移到预训练上。基于预训练语言模型的研究思路通常是“预训[0079]示例性地,该预训练语言模型包括transformers层,该预训练语言模型为T5,[0089]更新第一提示矩阵的方式包括,首先随机初始化第一权重矩阵和第一偏置矩本数据的可学习的矩阵,第一权重矩阵和第一偏置矩阵用于将第二提示矩阵作线性映射。理后的提示矩阵参照上述方式更新(由于每个任务各自对应的提示矩阵的比重为1来参与的训练样本数据和第二任务的训练样本数据,经模型训练后更新第一层的第二权重矩阵。[0110]例如,更新后的第一提示矩阵=初始的第一提示矩二提示矩阵×第一系数矩阵+第二比重×第三提还可以包括其他任务,下面以包括第一任务和第二任务为例结合上述实施例进行效果说阵根据第二任务在第一层对应的第二提示矩阵和第二任务在第二层对应的第三提示矩阵[0115]其中,第一任务在第一层对应的自注意力机制运算的输入包括第一拼接向量矩[0119]本申请实施例在训练模型前,将多个NLP任务对应的提示矩阵融合来更新单个任由于NLP任务之间具有递进关系或者相似关系,能够通过多个任务的提示矩阵联合学习来提升提示调整方法的效果。进一步地,由于本申请实施例中的提示调整方法基于了0到hi是与训练任务相关的参数向量Embedding层的输入为长度z的文本对应的索引(该索引是每个词在模型词表中的索引,该么每一个head就按顺序取300维中被切分成5份的第h个份(每一份都有60维),并将切分后的h份分别放入不同的TransformersBlock中。本申请后续实施例以head数目为1进行说[0136]在上述transformers模型的基础上,假设第m层的任务1的提示矩阵分别为P1,m,k[0141]图5是本申请实施例提供的一例系数矩阵g的获取方法示意图,下面结合图5介绍[0142]参数矩阵Wij和经过随机初始化后,后续的矩阵中的值利用任务i和任务j的训P1,m,v共享由于多个任务之间的联系不会因为是K向量矩阵对应的提示矩阵还是V向量矩阵对应的提示矩阵而改变,故可以共享这样也可以减少将原始K向量矩阵和原始V向量矩阵分别与对应的更新后的提示矩阵拼接后,得到新的K向量矩阵和V向量矩阵。然后将新的K向量矩阵和V向量矩阵作为该层的自注意力机制运算的m层任务T对应的原始的K向量矩阵,K/T,m表示第m层任务T对应的[0163]模型对多个NLP任务进行学习能够提升模型对单一任务的学习效果,在提示调整学习来提升提示调整方法的效果。进一步地,由于本申请实施例的提示调整方法基于了[0165]方法200中考虑了相同层的多个任务之间的信息传递,本申请还提供了一例不同他任务中的一个任务能够传递到任务1的信息占多少比重),例如将第一层任务2转移到第一层任务1的转移量记为那么f1,1,k如1之间的值(包括0和1)。*Pall,k中为0的部分表示其他层的任务1给第一层的任务1的转移量是0,1/1之间的值(包括0和1)。*Pall,v公式(21)0的部分表示其他层的任务1给第一层的任务1的转移量是0,1/NLP任务之间具有递进关系或者相似关系,能够通过不同层之间的多个任务

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论