2025A2M大会:公考垂域模型中强化学习的应用_第1页
2025A2M大会:公考垂域模型中强化学习的应用_第2页
2025A2M大会:公考垂域模型中强化学习的应用_第3页
2025A2M大会:公考垂域模型中强化学习的应用_第4页
2025A2M大会:公考垂域模型中强化学习的应用_第5页
已阅读5页,还剩48页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本次分享会讲哪些内容训练一个垂域模型需要多少数据?(小公司是如何通过精细化的强化学习(RL)机制设计,让RL训练参的黑箱操作”转化为“可拆解、可控制、可复现的分享大纲粉笔教育和粉笔公考AI产品简介粉笔AI老师/面试AI点评/AI系统班核心技术粉笔垂域推理模型l增量预训练(ContinuedPreTraining,CPT)l有监督微调(SupervisedFine-Tuning,SFT)l推理能力蒸馏语言大模型中的强化学习l强化学习介绍l根据用户反馈和Base调整训练样本和Rewardl控制推理时的思考长度多模态大模型中的强化学习粉笔教育介绍公考行业特点模型?)公考AI产品公考垂域推理模型-训练流程图公考垂域模型—实践经验1增量预训练(ContinuedPretrail这个是注入领域知识的核心步骤l需要平衡领域数据和通用数据,防止遗忘通用知识,比例大致为1:1l通用知识的领域构成(代码、数学、书籍、wiki等)尽量和使用基座模型(比如Qwen2.5-72B-Base)一致l数据质量很重要,低质量的数据会影响模型效果,需要过滤掉低质的数据l采用小学习5e-5缓慢退火到10%(即5e-6)lQwen2.5-72B-Base在最后阶段没有退火,所以刚开始训练的时候不用Warm-up实践效果领域客观答疑(avg.)Qwen2-7BCPT-1:1-anneal59.074.9CPT-1:3-anneall从0到1构建chat能力,使用和通用大模型分布以及总量一致的SFT数据(Infinity-Instruct*是一个很好的数据集)l增加领域SFT数据,领域SFT数据构建尽量和最终任务需要的样式保持一致lSFT阶段数据质量更重要通用SFT数据l尽量和基座模型保持一致:MAGPIEl增加指令遵循的SFT数据对效果提升显著l严格过滤低质数据l保持System多样化,以区分任务类型*Infinity-Instruct:https://huggingface.co/datasets/BAAI/Infinity-公考垂域模型—SFT数据示例公考垂域模型—最终效果语言大模型中的强化学习—强化学习介绍好的Reward标准:语言大模型中的强化学习—RLHFl人类反馈数据具有一定的主观性l奖励模型(RewardModel)非常难训练,训练过程和结果是一个黑盒,存在RewardHacking语言大模型中的强化学习—GRPO语言大模型中的强化学习—GRPO训练数据开源的数学、科学、逻辑、代码数据+有标准答案的领域数据一些值得注意的点2.要注意答案校验的鲁棒性3.稳定安全的代码校验沙箱环境语言大模型中的强化学习—DAPO语言大模型中的强化学习—DAPORewardfunction训练数据开源的数学、科学、逻辑、代码数据+有标准答案的领域数据语言大模型中的强化学习—根据用户反馈优化样本和reward语言大模型中的强化学习—根据用户反馈优化样本和reward语言大模型中的强化学习—控制推理时的思考长度通过修改logits实现强制输出<|end_of_tho多模态大模型中的强化学习多模态大模型中的强化学习实践经验l选择合适的基座l选择合适的RL数据集公考垂域大模型训练成本l有,可以使用大量公开知识对垂域进行强化&可以充分利用大量非公开的专有数据和知识l0.5Btoken肯定够,5B以上更好;0.1B应该也有效果,再少的话需要进一步实验l在0.5B垂域语料的情况下,一次训练30万够了,肯定在100万以内l主要通过增量预训练(ContinuedPretraining)注入领域知识l增量预训练:通用和领域数据比例1:1,小学习率l有监督微调:按照通用模型的方式训练,增加领域SFT的数据、指令遵循数据和推理数据l强化学习:用于保持模型的推理能力l语言大模型中的强化学习lDAPO:去掉KL散度、裁剪偏移(ClipHigher)、使用Token级别的策略梯度损失、思考长度超限动态惩罚、动态采样l根据用户反馈,针对性的设计RL的训练集和Rewardl控制推理时的思考长度:通过修改tokenlogits,并添加“由于用户限制,请停止思考,并基于已经生成的不完整思考过程<|end_of_thought|>”来强制停止思考l多模态大模型中的强化学习l精选RL数据集、精选基座(Mimo-7B)、去掉KL散度l多种奖励信号:规则奖励、基于模型的奖励下一步计划l多模态RL模型优化l进一步提升RL训练的效率和效果l自适应推理:根据问题难度决定是否推理以及推理的长度l多模态模型全模态(Omni)模型l实时语音视频交互模型我们粉笔算法团队正在招聘NLP方向的实习

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论