汽车行业深度报告:AI系列深度10期预训练与后训练如何塑造大模型_第1页
汽车行业深度报告:AI系列深度10期预训练与后训练如何塑造大模型_第2页
汽车行业深度报告:AI系列深度10期预训练与后训练如何塑造大模型_第3页
汽车行业深度报告:AI系列深度10期预训练与后训练如何塑造大模型_第4页
汽车行业深度报告:AI系列深度10期预训练与后训练如何塑造大模型_第5页
已阅读5页,还剩3页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

内容目录TOC\o"1-2"\h\z\u预训练与后训练:底座形成与使用适配 4术语溯源:两个概念的提出与演变 4本质区别:通用底座与面向使用的适配 5当前主要分歧:三条主线先行概览 5数字AI与物理AI:框架同构、口径分立 5预训练:通用能力底座如何形成 5自监督学习:以“预测下一个词”为核心目标 5扩展律ScalingLaw:规模与性能的定量关系 6数据约束:高质量公共文本的供给上限 6后训练:从基座可用到对齐与推理增强 6监督微调SFT:得指令遵循能力 6基于人类反馈的强化学习RLHF:对齐人类偏好 6直接偏好优化DPO等简化路线 7可验证奖励的强化学习后训练的推理目标线 7阶段过渡:中训练与推理时计算正在重塑边界 7中训练mid-training:正在形成的第三阶段 7推理时计算test-timecompute:推理阶段的算力投入 7思维链CoT:横跨预训练、后训练与推理的连接点 8数字AI与物理AI:同一框架,不同数据和反馈 8机器人:复用视觉-语言骨干预训练,依托真机与仿真后训练 8自动驾驶:从端到端到VLA,后训练引入强化学习 8物理AI的核心瓶颈:真机数据的稀缺 8产业与投资视角:成本与价值的迁移 9算力重心:从训练转向推理 9预训练的规模红利与后训练的效率红利 9中国厂商的布局:聚焦后训练与推理效率 9风险提示 9图表目录表1:预训练与后训练的四维分工 5表2:后训练主要方法对照 7预训练与后训练:底座形成与使用适配(Pre-training)—AI与物理AI术语溯源:两个概念的提出与演变2006“”HintonOsindero与Bengio2015—2018与与Devlin“ChatGPTGPTnsucGTTpost-trainingOpenAI、MetaLlamaRLHFRLAIFDPO直至本质区别:通用底座与面向使用的适配表1:预训练与后训练的四维分工维度 预训练Pre-training 后训练Post-training数据频学习目标 自监督,以“预测下一个词”、掩码还原为主

少量、高成本、高质量,人工示范、偏好排序、可验证答案模仿人类示范、对齐人类偏好、优化可验证奖励信号来源 数据自身,无需人工评分 人类,标注、偏好,或环境,奖励、验证器形成可用产品,决定指令遵循、格式、安全与作用 形成通用底座,决定知识广度与能力上限

能力的调用方式规模特征 算力需求极大、周期长,主导训练成本 算力需求小、迭代快,对效果的边际撬动显整理当前主要分歧:三条主线先行概览数字AI与物理AI:框架同构、口径分立框架同构:物理AI,英伟达等称之为PhysicalAI,其代表性模型已明确沿用大语言模型训练配方。机器人基座模型π0被官方描述为预训练后接后训练、对标大语言模型范式;自动驾驶VLA模型英伟达Alpamayo则采用驾驶数据模态注入、因果链数据监督微调、强化学习后训练的多阶段流程。AIAI1)AIAI-2AIAI3)AI面对公AI预训练:通用能力底座如何形成自监督学习:以预测下一个词为核心目标扩展律ScalingLaw:规模与性能的定量关系KaplanChinchillaHoffmann20个训练token1个参数据约束:高质量公共文本的供给上限202820282026SutskeverAI物理AIAI测下一个词为主;物理AI的预训练通常是复用已在网络数据上预训练的视觉-语言VLMAI预OpenX-Embodiment10022后训练:从基座可用到对齐与推理增强监督微调SFT:习得指令遵循能力用人工示范将续写能力转为应答能力:预训练得到的基座模型主要顺着上文续写,InstructGPT基于人类反馈的强化学习RLHF:对齐人类偏好Christiano等在2017900Stiennon20202022宪法AI与RLAIF:以AI反馈替代部分人工标注:Anthropic的宪法AI使用一组人工制定的原则作为“宪法”,让模型自我评判并自动生成反馈;基于AI反馈的强化学习在保持效果的同时大幅减少人工标注,是后训练降本的重要路线。直接偏好优化DPO等简化路线Rafailov2023PPORLHF,DPO“可验证奖励的强化学习。DeepSeek-R1采用表2:后训练主要方法对照方法 信号/数据 特点 代表InstructGPT第一步,SFT监督微调 人工示范,指令—回答 习得指令遵循与作答格式人类偏好→奖励模型→强化学

Ouyang等,2022,Christiano等2017;RLHF习

对齐偏好,更有用、更无害

InstructGPT2022DPO等 人类偏好,直接优化 省去奖励模型,稳定、省算力 Rafailov等,2023Bai等Anthropic,RLAIF/宪法AI 按“宪法”由AI自评反馈 降低人工标注成本

2022可验证奖励,数学/代码对错 激励推理、生成长思维链 DeepSeek-R1,2025整理阶段过渡:中训练与推理时计算正在重塑边界中训练mid-training:正在形成的第三阶段火是指逐步降低学习率以稳定收敛。phi-3.5将其视为多语言与长上下文整合阶段,OLMo2Yi-Lightning推理时计算test-timecompute:推理阶段的算力投入tokenSnell2024OpenAIo12024思维链CoT:横跨预训练、后训练与推理的连接点等与Kojima与DeepSeek-R12025年进一步用强化学习数字AI与物理AI:同一框架,不同数据和反馈机器人:复用视觉-语言骨干预训练,依托真机与仿真后训练从到-语言模型PaLM-EPaLI-Xtoken。π0以PaliGemma10000768OpenX-Embodiment,token自动驾驶:从端到端到VLA,后训练引入强化学习UniADAlpamayo:UniADTransformerAlpamayo-物理AI的核心瓶颈:真机数据的稀缺OpenX-Embodiment采集、仿真。产业与投资视角:成本与价值的迁移算力重心:从训练转向推理AI的成AItoken100倍。预训练的规模红利与后训练的效率红利DeepSeek-R1GRPOo1中国厂商的布局:聚焦后训练与推理效率DeepSeek围绕R1GRPOQwe

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论