CN117668153B 大模型在线推理与训练一体化方法及系统 (吴东)_第1页
CN117668153B 大模型在线推理与训练一体化方法及系统 (吴东)_第2页
CN117668153B 大模型在线推理与训练一体化方法及系统 (吴东)_第3页
CN117668153B 大模型在线推理与训练一体化方法及系统 (吴东)_第4页
CN117668153B 大模型在线推理与训练一体化方法及系统 (吴东)_第5页
已阅读5页,还剩19页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本申请涉及一种大模型在线推理与训练一回复结果是否存在纠正情况;在存在纠正情况用在线SFT和RLHF分别对微调模型进行监督微调申请通过将用户输入数据和微调模型的回复结2在存在所述纠正情况时,将相应的所述用户输入数据和所述模获取所述消息中间件的训练数据,并利用在线SFT和RLHF分别对所述微调模型进行监在对微调模型进行在线训练之前,实时监听消息中间件中将所述用户输入指令和文本输入所述微调模型进行多轮对话SFT对所述微调模型进行监督微调时,所述在线SFT的训练数据包括SFT数据和预先标注的其中,所述SFT数据基于所述用户输入指令文本和所述模型回复结果中对应的纠正语8.一种系统,用于实现上述权利要求1_7中任一项所述的大模型在线推理与训练一体数据存储模块,在存在所述纠正情况时,将相应的所述用户3其中,所述处理器被配置为执行所述可执行指令时实现权利述计算机程序指令被处理器执行时实现权利要求1至7中任意一项所述的大模型在线推理4包括监督微调模型训练、符合人类偏好的强化模型训练和推理部署。具体的如附图1_3所[0004]为了解决上述问题,本申请提出一种大模型在线推理与[0009]获取所述消息中间件的训练数据,并利用在线SFT和RLHF分别对所述微调模型进[0015]其中,所述SFT数据基于所述用户输入指令文本和所述模型回复结果中对应的纠56[0038]包含在说明书中并且构成说明书的一部分的附图与说明书一起示出了本公开的所说明的任何实施例不必解释为优于或好于其它实和在线符合人类偏好强化模型训练数据,相应的利用在线SFT和RLHF对微调模型进行监督7述消息中间件的训练数据,并利用在线SFT和RLHF分别对所述微调模型进行监督微调及强数据基于所述用户输入指令文本和所述模型回复结果中对应的纠正语义组合得到。[0064]将存在纠正情况的对话,即用户输入的原始提问和模型修正后的答案组合成SFT89是在线训练数据混合4倍数量随机采样的标注数据,训练目标是最大化chosen回复和[0098]本实施例中,对微调模型参数的调整,借鉴梯度提升树(GradientBoosting[0099]原始模型输出为[0.1,0.2,0.3,0.2,0.2],[0100]旁路模型1输出为[0.2,0.1,0.3,0.1,0.0],[0101]叠加向量为[0.3,0.3,0.6,0.3,0.2],[0104]根据结果向量和期望结果向量计算得到的在线训练loss反向传播至当前旁路模[0.28,_0.09,_0.05,_0.09,_0.05]便十分接近目标训练如70亿甚至1760亿以上的完整原始模型减少为只需要调整参数量在亿甚至千万级的闪存储器(FlashMemory)、硬盘(HardDiskDrive,缩写:HDD)或固态硬盘(Solid_[0127]本公开实施例来控制系统包括处理器以及用于存储处理器可执行指令的存储域的其它普通技术人员能理解本文披

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论