CN119397010A 大语言模型的训练方法、装置、计算机设备及存储介质 (腾讯科技(深圳)有限公司)_第1页
CN119397010A 大语言模型的训练方法、装置、计算机设备及存储介质 (腾讯科技(深圳)有限公司)_第2页
CN119397010A 大语言模型的训练方法、装置、计算机设备及存储介质 (腾讯科技(深圳)有限公司)_第3页
CN119397010A 大语言模型的训练方法、装置、计算机设备及存储介质 (腾讯科技(深圳)有限公司)_第4页
CN119397010A 大语言模型的训练方法、装置、计算机设备及存储介质 (腾讯科技(深圳)有限公司)_第5页
已阅读5页,还剩93页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本申请实施例公开了一种大语言模型的训过对同一样本文本的两个不同摘要文本进行对2将样本文本输入到大语言模型中,得到预测摘要信息,所述预测摘符中每个字符分别在所述样本文本的预测摘要文本中各个获取所述样本文本的第一摘要文本和所述样本文本的第二摘要基于所述预测摘要信息、所述第一摘要文本中正确语句、所基于所述预测摘要信息、所述第一摘要文本中正确语句以及所述第基于所述第一摘要文本中正确语句的平均损失函数值和所述第一摘要文本中错误语基于所述第一摘要文本、所述第二摘要文本以及所述多个字基于所述预测摘要信息,确定所述第一摘要文本中每个语句的损失基于所述第一摘要文本中每个语句的损失函数值,确定所述第一摘中正确语句的平均损失函数值为所述第一摘要文本中多个正确语句的损失函数值的均值,所述第一摘要文本中错误语句的平均损失函数值为所述第一摘要文本中多个错误语句的基于当前训练批次中多个样本文本的第一摘要文本中每个基于所述第一中间比值,确定所述第一摘要文本中正确语句的权重3要文本中正确语句的权重系数为所述第一中间基于所述第一摘要文本中正确语句的权重系数,确定所述第一基于当前训练批次中多个样本文本的第一摘要文本中每个个正确语句的损失函数值之和与所述多个样本文本的第一摘要文本中多个语句的损失函句的损失函数值之和与所述多个样本文本的第一摘要文本中多个语句的损失函数值之和基于所述第二中间比值和所述第三中间比值,确定所述第一摘要基于所述第一摘要文本中正确语句的权重系数和所述第一摘要文本中不准确语句的的权重系数为所述第一摘要文本中正确语句的权重系数和所述第一摘要文本中不准确语基于所述多个字符对应的预测隐向量、所述第一摘要文本中多个字对所述第一摘要文本的预测隐向量和所述第二摘要文本的预测隐向量分别进行池化,基于所述第一中间向量和所述第二中间向量,确定所述将所述样本文本和第一提示文本输入到第一附加模型中,得述第一提示文本用于指示所述第一附加模型基于所述样本文本生成包含补充信息的摘要将所述样本文本和第二提示文本输入到所述第一附加模型中,得到所述第二摘要文4摘要文本和所述第二摘要文本进行区分的能基于所述第一概率组和所述第二概率组,确定第一中间差基于所述第一中间差值和所述第二中间差值之间的差值,确定所述第三损失函数值,对于所述第一摘要文本和所述第二摘要文本中的任一摘要文本,获取基于所述字符位置对应的概率和所述字符位置的权重系数,确基于所述摘要文本中多个字符位置对应的中间乘积值,确定对于所述第一摘要文本和所述第二摘要文本中的任一摘要文本,获取基于所述摘要文本中多个字符位置对应的概率,确定所述参获取所述字符位置对应的匹配参数,所述字符位置对应的匹配参5要文本中所述字符位置处的字符与所述第一摘要文本和所述第二摘要文本中的另一摘要基于所述字符位置的标签,确定所述字符位置的权重系数,所一标签对应的预设权重系数大于所述第二标签获取所述字符位置对应的匹配参数,所述字符位置对应的匹配参要文本中所述字符位置处的字符与所述第一摘要文本和所述第二摘要文本中另一摘要文在所述字符位置对应的匹配参数小于匹配参数阈值的情况在所述字符位置对应的匹配参数不小于所述匹配参数阈值对于所述摘要文本中所述字符位置所位于的语句,在所述另一基于所述匹配语句中的匹配字符和所述字符位置处的字符,确息包括多个字符中每个字符分别在所述样本文本的预测摘要文本中各个字符位置上的概第一获取模块,用于获取所述样本文本的第一摘要文本和6段计算机程序,所述至少一段计算机程序用于执行权利要求1至17任一项权利要求所述的7确语句和错误语句,避免了由于摘要文本单一而导致的模型过拟合和生成不准确等问题,个字符中每个字符分别在所述样本文本的预测摘要文本中各个字符要文本包含的信息量大于所述第二摘要文本,所述第一摘要文本包括正确语句和错误语要信息包括多个字符中每个字符分别在所述样本文本的预测摘要文本中各个字符位置上8摘要文本中正确语句的平均损失函数值和所述第一摘要文本中错误语句的平均损失函数第二损失函数值用于指示所述第一摘要文本的预测隐向量和所述第二摘要文本的预测隐一摘要文本中正确语句的平均损失函数值与所述第一摘要文本中错误语句的平均损失函所述多个样本文本的第一摘要文本中多个正确语句的损失函数值之和与所述多个样本文述第二中间比值为所述多个样本文本的第一摘要文本中多个正确语句的损失函数值之和比值为所述多个样本文本的第一摘要文本中多个不准确语句的损失函数值之和与所述多9的预设次幂,所述第一摘要文本中不准确语句的权重系数为所述第三中间比值的预设次权重系数为所述第一摘要文本中正确语句的权重系数和所述第一摘要文本中不准确语句述语句反映所述样本文本的准确程度;将所述第二摘要文本输入到所述第二附加模型中,参考语言模型对所述第一摘要文本和所述第二摘要文本进行区分的能力文本的概率为所述摘要文本中多个字符位置对应的中间乘积所述匹配语句中的匹配字符和所述字符位置处的字符,确定所述字符位置对应的匹配参储器中存储有至少一条计算机程序,所述至少一条计算机程序由所述处理器加载并执行,型的训练过程中引入第一摘要文本和第二摘要文本,为模型训练提供了更多可学习信息,存储、网络服务、云通信、中间件服务、域名服务、安全服务、CDN(ContentDelivery信息包括多个字符中每个字符分别在该样本文本的预测摘要文本中各个字符位置上的概个元素用于表示元素所在列指示的字符在元素所在行指示的字符位置处出现的概率。其[0071]样本文本为在训练过程中对大语言模型的给定文本。样本文本为任意类型的文本的描述准确性较差;当摘要文本中错误或者不准确地描述样本文本的语句占比较低时,型的训练过程中引入第一摘要文本和第二摘要文本,为模型训练提供了更多可学习信息,[0085]上述实施例介绍了基于单个样本文本对应的总损失函数值训练大语言模型的过网络模型)堆叠而成。例如,大语言模型的主要结构包括1个Embe对大语言模型内的中间向量进行解码;LM_Head模块由fullconnectedlayer(全连接层)构成,LM_Head模块用于对每个待生成的字符位置出现多个字符的概率进行预测。其中,Layers模块包括1个Input_LayerNorm(Input_LayerNormalization,输入归一化)子模块、1个Self_Attn(SelfAttention,自注意力)子模块、1个Post_Attention_LayerNorm(Post_Attention_LayerNormalization,残差注意力归一化)子模块及1个MLP(MultilayerPerceptron,多层感知机)子模块。其中,Input_LayerNorm子模块是由块是由Attention(注意力)层构成,Post_Attention_LayerNorm子模块是由RMSNorm层构大语言模型生成摘要文本时仅限于对单一监督信息的学习,从而对该单一监督信息过拟[0095]如图3所示,图3是本申请实施例提供的另一种大语言模型的训练方法的流程第二提示文本用于指示第一附加模型基于样本提示文本为“给出一部剧某场戏的剧本,请给出该场次剧情概要,要求描述场次发生的事本对的形式为(样本文本、摘要文本summ1、摘要文本summ2、描述效果最好的摘要文本效果更好的摘要文本为第一摘要文本,并确定描述效果更差的摘要文本为第二摘要文本,本对的形式为(样本文本、摘要文本summ1、摘要文本summ2、描述效果最好的摘要文本失函数值为第一摘要文本中多个错误语句的损失函句的平均损失函数值为第一摘要文本中多个不准确语句的损失函文本中多个语句划分为两类或者三类的情况下,五个语句的类型参见下述(一)和(二)所[0116](一)在将第一摘要文本中多个语句划分为正确语句和错此第一摘要文本中第一句话存在不准确的描述为不准确语句。一种示例性的准确描述为[0120](1)在将第一摘要文本中多个语句划分为正确语句和错误语句等两类的情况下,[0121](2)在将第一摘要文本中多个语句划分为正确语句、错误语句以及不准确语句等本文本的准确程度,第二附加模型的输出结果为(A,B,[x1[0125]304、计算机设备基于第一摘要文本中正确语句的平均损失函数值和第一摘要文[0128]需要说明的是,在将第一摘要文本中多个语句分为两类[0129]方式一:在将第一摘要文本中多个语句分为正确语句和错误语句等两类的情况一摘要文本中第k个不准确语句的损失函数值,n3为第一摘要文本中不准确语句的数量,部分表示第一摘要文本中不准确语句的平均损失函数值。[0141]上述步骤303到步骤304为本申请实施例提供的一种基于预测摘要信息和第一摘第二摘要文本中多个字符,确定第一摘要文本的预测隐向量和第二摘要文本的预测隐向个字符位置对应的预测隐向量表示为4096x6400的矩阵。在第一摘要文本包含100个字符,第二摘要文本包含120个字符的情况下,第一摘要文本的预测隐向量表示为100x4096的矩[0145]306、计算机设备对第一摘要文本的预测隐向量和第二摘要文本的预测隐向量分损失函数值之外,还可以对两个中间向量归一化之后采用余弦距离表示第二损失函数值,一摘要文本的预测隐藏向量,pool(a1)为第一中间向量;a2为第二摘要文本的预测隐藏向2)为第二中间向量。外参考。由于传统的模型损失值是基于所有字符位置在大语言模型的词典中的预测概率,[0163]{"id":"999","conversations":[{"from":"human","value":"以下为一部剧某[0169]{"id":"999","conversations":[{"from":"human","value":"以下为一部剧某过程中采用第一摘要文本gpt,在计算每个样本对应的第二损失函数值的过程中采用第一得到的摘要文本summ2称为摘要文本2。计算机设备通过第一附加模型分别生成摘要文本1型的训练过程中引入第一摘要文本和第二摘要文本,为模型训练提供了更多可学习信息,[0180]其次,本申请实施例通过引入对不同摘要文本的预测隐向量对齐学习的辅助方[0188](3)计算机设备基于预测摘要信息和第一摘要文本,确定第一摘要文本中每类语[0199]方式B:计算机设备通过当前训练批次中第一摘要文本和第二摘要文本的数据表的全部摘要文本中正确语句的损失函数值之和与当前训练批次的全部摘要文本中语句的正确语句的损失函数值和全部摘要文本的错误语句的损失函数值之文本中正确语句的数量。表示当前训练批次的全部第一摘要文本和全部第二摘要文本中错误语句的损失函数值之和;表示当前训练批次的全部第一摘要文本中错误语句的损失函数值以及全部摘要文本中不准确语句语句的数量。表示当前训练批次的全部第一摘要文本和全部第二摘要文本中[0214]方式C:计算机设备通过当前训练批次中的第一摘要文本的数据表现来动态调整比值为多个样本文本的第一摘要文本中多个正确语句的损失函数值之和与多个样本文本数,第一摘要文本中错误语句的权重系数为第一摘要文本中正确语句的权重系数与1之间个样本文本的第一摘要文本中多个错误语句是指当前训练批次的多个样本文本对所包含练批次中序号为1的第一摘要文本中正确语句的数量,m22表示当前训练批次中序号为2的一摘要文本中全部错误语句的损失函数值之和;表示当前训练批次的全样本文本的第一摘要文本中多个不准确语句的损失函数值之和与多个样本文本的第一摘错误语句的权重系数为第一摘要文本中正确语句的权重系数和第一摘要文本中不准确语表示当前训练批次中序号为2的第一摘要文本中不准确语句的数量,以此类推。表示当前训练批次的全部第一摘要文本中全部错误语句的损失函数值之[0231](5)计算机设备基于每类语句的权重系数,对第一摘要文本中多个语句的平均损[0235]{"id":"999","conversations":[{"from":"human","value":"以下为一部剧某[0237]{"from":"gpteva[0241]上述实施例介绍了计算机设备基于第一损失函数值和第二损失函数值对大语言一附加模型获取第一摘要文本和第二摘要文本的过程与上述步失函数值,第二损失函数值为第一中间向量和第二中间向量之间的距离,参见步骤307所中该字符位置处的字符与第一摘要文本和第二摘要文本中的另一摘要文本之间的匹配程[0254]本申请实施例对获取语句的语义向量的方式不进行限制,例如,采用基于transformer网络结构的BERT(BidirectionalEncoderRepresentationsfrom定第二个语句的语义向量和第二摘要文本中多个语句的语义向量。在第二个语句和第二摘要文本的第三个语句。在大语言模型头部模块输出的多个字符的预测隐向量中,确定字符[0261]方式A:计算机设备先确定字符位置的标签,再基于标签确定字符位置的权重系[0265]在上述方式中,通过基于字符位置对应的匹配参数和匹三损失函数值的影响程度大于第二标签,第一标签对应的字符的学习价值高于第二标签。配参数阈值为排序后位于第二位和第三位的匹配参[0271]在一种可能实现方式中,计算机设备基于字符位置对应的匹配参数与1之间的差的权重系数为1减去字符位置的匹配参数。目标次幂对应于预设的用于进行尺度拉伸的指[0273]806、计算机设备基于该字符位置在预测摘要信息中对应的概率和该字符位置的置对应的概率和该字符位置的权重系数的乘文本包含的字符位置的数量,id_t表示该字符位置处的字符在大语言模型的词典中的序要文本中每个字符位置在参考信息中对应的概率的方式,与步骤806中计算机设备确定摘函数值用于指示大语言模型和参考语言模型对第一摘要文本和第二摘要文本进行区分的和第四概率的对数之间的差值;计算机设备基于第一中间差值和第二中间差值之间的差能够表示大语言模型和参考语言模型预测摘要文本的能[0307]"chosen":[{"content":"以下为一部剧某场戏的剧本,user"},{"content":A,"role":"assistant"}],[0308]"rejected":[{"content":"以下为一部剧某场戏的剧本,请提取该场次剧情概要,要求描述场次发生的具体事情,不要进行猜测、不要进行抽象描述,剧本为xxx","role":"user"},{"content":"B","role":"assistant"}],[0309]"messages":[{"content":"以下为一部剧某场戏的剧本,请提取该场次剧情概要,要求描述场次发生的具体事情,不要进行猜测、不要进行抽象描述,剧本为xxx","role":"user"},{"content":"A","role":"a模型参数,此时基于该训练批次采用第三函数值完成了对大语言模型的一次模型参数更相对比较的文字或语义不对齐的摘要文本中,对描述效果更好的摘要文本进行词汇挖掘,[0316]需要说明的是,通过本申请的训练方法得到的大语言模型能够应用在多种场景[0321]图12是本申请实施例提供的一种大语言模型的训练装置的结构示意图。参见图要信息包括多个字符中每个字符分别在样本文本的预测摘要文本中各个字符位置上的概失函数值为第一摘要文本中正确语句的平均损失函数值与第一摘要文本中错误语句的平中错误语句的平均损失函数值为第一摘要文本中多个错误语句的损失样本文本的第一摘要文本中多个正确语句的损失函数值之和与多个样本文本的第一摘要要文本中错误语句的权重系数为第一摘要文本中正确语句的权重系数与1之二中间比值为多个样本文本的第一摘要文本中多个正确语句的损失函数值之和与多个样本的第一摘要文本中多个不准确语句的损失函数值之和与多个样本文本的第一摘要文本句的权重系数为第一摘要文本中正确语句的权重系数和第一摘要文本中不准确语句的权文本生成包含补充信息的摘要文本;将样本文本和第二提示文本输入到第一附加模型中,值,字符位置对应的中间乘积值为字符位置对应的概率和字符位置的权重系数的乘积值;基于摘要文本中多个字符位置对应的中间乘积值,确定大语言模型预测摘要文本的概率,大语言模型预测摘要文本的概率为摘要文本中多个字符位置对应的中间乘第二摘要文本中的另一摘要文本之间的匹配程度;基于字符位置对应的匹配参数与1之间摘要文本和第二摘要文本包含的信息量不同,且第一摘要文本中包含正确语句和错误语理器1401可以采用DSP(DigitalSignalProcessing,数字信号处理)、FPGA(Field处理器是用于对在唤醒状态下的数据进行处理的处理器,也称CPU(CentralProcessing算机可读存

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论