CN119443155A 大语言模型的训练方法及装置 (支付宝(杭州)信息技术有限公司)_第1页
CN119443155A 大语言模型的训练方法及装置 (支付宝(杭州)信息技术有限公司)_第2页
CN119443155A 大语言模型的训练方法及装置 (支付宝(杭州)信息技术有限公司)_第3页
CN119443155A 大语言模型的训练方法及装置 (支付宝(杭州)信息技术有限公司)_第4页
CN119443155A 大语言模型的训练方法及装置 (支付宝(杭州)信息技术有限公司)_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本说明书实施例提供了大语言模型的训练考模型和待优化的大语言模型各自生成第一样其响应于确定第一偏好回答和第一非偏好回答相同而为0;基于训练损失更新大语言模型的参2对于所述训练样本集中任意的第一样本,将其中的第一问题作为据所述第一概率确定针对所述第一偏好回答的确定针对所述第一样本中的第一非偏好回答的第二奖励值基于训练损失更新所述大语言模型的参数,所述训练损失获取第一训练数据和第二训练数据,所述第一训练数据中的各训练样本均包括问题、对于所述第二训练数据中的每个训练样本,获取该训练样本中的偏好响应于所述大语言模型生成所述第一偏好回根据所述第一概率和所述第二概率,确定所述大语言模型3好回答上的第二对数概率和在所述第一非偏好回答第一确定单元,被配置成对于所述训练样本集中任意的第二确定单元,被配置成确定针对所述第一样本中的第一非偏好回答的第二奖励值,其响应于确定所述第一偏好回答和所述第一非偏好更新单元,被配置成基于训练损失更新所述大语言模型的参4[0002]大语言模型(LargeLanguageModel,LLM)通常使用人类反馈的强化学习来对齐失与所述第一奖励值和所述第二奖励值的差值二奖励值根据所述参考模型和所述大语言模型各自生成所述第一非偏好回答的第二概率[0007]在一些实施例中,所述确定针对所述第一样本中的第一非偏好回答的第二奖励数据中的各训练样本均由问题和偏好回答组成;对于所述第二训练数据中的每个训练样5损失与所述第一奖励值和所述第二奖励值的差值该计算机程序/指令被处理器执行时实现如第一方面中任一[0017]在本说明书的上述实施例提供的方案中,训练样本集中的各训练样本均包括问6[0026]如前所述,大语言模型通常使用人类反馈的强化学习来[0027]近期直接偏好优化(DirectPreferenceOptimization,DPO)技术简化了强化学示待优化的大语言模型,πref表示参考模型,LDP0(πθ;πref)表示DPO技术使用的损失函数为7wθwwlθ[0034]在DPO技术中,β在学习过程中基于偏好回答yw上的奖励励值的间距(RY,-RY),动态调整偏好数据对的梯度大小(或学习[0035]在进入工业界后,监督学习和直接偏好对齐学习被用于提升大语言模型在数字、[0036]本说明书实施例在DPO技术基础上提出了一种大语言模型的训练方案,该方案能[0037]图1是本说明书实施例可以应用于其中的一个应用场景的示意图。该应用场景涉习的训练数据D1和用于监督学习的训练数据D该训练样本符合偏好对齐学习的数据格式,从而根据训练数据D1和更新后的训练数据D28[0040]具体地,可以执行如图2所示的生成过程为训练数据D2中的每个训练样本进行扩练数据D2'。[0046]具体地,可以将训练数据D1中的各训练样本和训练数据D2'中的各训练样本进行好回答yw和非偏好回答yl的样本d,可以将样本d中的问题x作为大语言模型πθ和参考模型yw的奖励值Rye[0048]对于针对非偏好回答yl的奖励值RY,其受偏好回答yw和非偏好回答yl是否相同的lrefl[0049]在确定出奖励值RYWRY后,可以根据奖励值RYRY确定训9根据该概率确定针对偏好回答yw的奖励值Rye考模型πref根据问题x生成偏好回答yw的概率为例,当采用如前所述的公式(2)作为损失函θll[0058]具体地,在一种实施方式中,可以通过直接对偏好回答yw和非[0059]在另一种实施方式中,本说明书实施例提供的方案采用DPO技术原本使用的模型和πθllww如前所述的公式(2)计算得到。当本说明书实施例提供的方案应用于DPO技术的变种上时,[0068]图4是本说明书实施例中大语言模型的训练方法的另一个流程图。该方法可由任根据该概率确定针对偏好回答yw的奖励值Rye奖励值RY的差值负相关。和非偏好回答yl是否相同的判断结果,来确定本轮模型训练中针对非偏好回答yl最终的奖[0080]图5是本说明书实施例中大语言模型的训练装置的结构示意图。该装置可以应用据参考模型和大语言模型各自生成第一非偏好回该训练样本中的偏好回答,并将获取到的偏好回答作为非偏好回答添加到该训练样本中;程序/指令被处理器执行时实现如图2至图4描述的

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论