版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
汽车行业深度报告证券研究报告·行业深度报告·汽车 汽车行业深度报告证券研究报告·行业深度报告·汽车AI系列深度22VLA模型的架构范式与厂商路线增持(维持)投资要点智能驾驶VLAVLM4ADVLM4AD再到VLA4AD:VLMVLA4AD的核心架构通常包括视觉编码器、语言处理器和动作解码BEV入预训练大模型、LoRA或RAG等方法注入驾驶知识;动作解码器再将融合后的多模态表征转化为轨迹、控制量或动作token。VLA4AD
行业走势21%17%13%9%5%1%-3%-7%-11%-15%
2026年08月07日证券分析师 黄细里执业证书:S0600520010001021-60199793证券分析师 黄细里执业证书:S0600520010001021-60199793huangxl@研究助理 童明祺执业证书:S0600125080005tongmq@理中枢四个阶段;主要挑战包括鲁棒性、实时性能、数据与标注、多模态对齐、多智能体协同和评测标准化。这意味着VLA并非单一固定架EMMAGeminiE2E+VLM3DMoE40BVLADriverAnalyst、Critic则通过多专家世界模型小鹏第二代VLA我们认为数字AIAIAIAIARR
相关研究《AI系列深度17期:视觉智能为何引入Transformer?》2026-08-06《AI系列深度16期:语言智能为何从RNN转向Transformer?》2026-08-061/13东吴证券研究所东吴证券研究所内容目录TOC\o"1-2"\h\z\u智驾VLA:从端到端到动作生成的范式升级 4自动驾驶技术演进:从模块化流水线到VLA4AD 4VLA4AD的核心架构:输入、三大模块与输出 4VLA4AD的阶段演进:从解释器到推理中枢 5VLA4AD的主要局限 6代表性模型:头部厂商VLA路线开始分化 7EMMA:基于Gemini的纯端到端架构 7理想:从E2E+VLM双系统到MindVLA统一架构 7元戎启行:40BVLA基座的Driver/Analyst/Critic三角色 8千里科技CoWorld-VLA:多专家世界模型8小鹏第二代VLA:弱化显式语言层,强化视觉思维链 9设计动机:标准VLA的语言转译瓶颈 9架构特征:原生多模态与视觉思维链 10去显式语言层的边界:趋近的VLA变体 工程与量产:算力、数据与落地节奏 风险提示 2/13东吴证券研究所东吴证券研究所图表目录图1:自动驾驶范式比较 4图2:VLA4AD四阶段演进时间轴 6图3:在v1上的PDMS贡献拆解与同类对比 9图4:小鹏第二代VLA对外披露的能力提升与体验改善 10表1:VLA4AD动作解码器的三类技术路线 5表2:VLA4AD自身的四阶段演进 6表3:代表性厂商VLA模型的架构与公开指标对比 9表4:小鹏第二代VLA对外披露的关键参数与指标 103/13东吴证券研究所东吴证券研究所智驾VLA:从端到端到动作生成的范式升级自动驾驶技术演进:从模块化流水线到VLA4AD自动驾驶的整体技术演进可划分为四个范式。Vision-to-ActionVLMVLMVLA4AD范式的关键变化,是把视觉感知、语言理解和控制决策整合到同一个策actionhead图1:自动驾驶范式比较ASurveyonVision-Language-ActionModelsforAutonomousDrivingVLA4AD的核心架构:输入、三大模块与输出VLA4ADBEV3DIMUGPS4/13东吴证券研究所东吴证券研究所语言输入包括环境查询、任务规则解析及语音交互。VLA4AD核心模块可拆分为视觉编码器、语言处理器和动作解码器。DINOv2ConvNeXt-V2CLIPBEV3DLoRAMPC表1:VLA4AD动作解码器的三类技术路线技术路线机制特点代表/适用自回归分词器将连续轨迹点/控制信号离散化为token序列,并按自回归方式逐个预测实现简单,与LLM生成范式天然兼容AutoVLA等扩散头基于扩散模型,从高斯噪声逐步采样出连续控制信号或轨迹擅长连续动作空间,生成轨迹更平滑DiffVLA、理想MindVLA分层控制器高层由LLM输出自然语言子目标,底层由PID/MPC转换为具体控制高低层解耦,可解释性较强ORIONASurveyonVision-Language-ActionModelsforAutonomousDrivingDiffVLA:Vision-LanguageGuidedDiffusionPlanningforAutonomousDriving》等其他文献,东吴证券研究所VLA4AD的阶段演进:从解释器到推理中枢VLA4ADVLA2023VLA20242025年初,LLM介,采用感知、语言理解、规划、控制的多阶段流水线,语言作为中间表示,代表如OpenDriveVLA。统一端到端VLA阶段集中在2025EMMAVLA引入5/13东吴证券研究所东吴证券研究所图2:VLA4AD四阶段演进时间轴ASurveyonVision-Language-ActionModelsforAutonomousDriving表2:VLA4AD自身的四阶段演进阶段语言LLM角色时间代表模型主要问题预VLA阶段被动解释器约2023年为主DriveGPT-4描述带来延迟;处理无关细节;描述与控制间存在语义隔阂模块化VLA规划协作者2024—2025年初OpenDriveVLA多阶段流水线误差在边界被放大;响应变慢统一端到端VLA动作生成器2025年为主EMMA反应快但长时程推理弱;决策解释粒度不足推理增强VLA推理中枢,引入CoT与记忆最新阶段ORION将长时域推理、记忆、交互整合进控制循环ASurveyonVision-Language-ActionModelsforAutonomousDrivingEMMAEnd-to-EndMultimodalModelforAutonomousDriving》等其他文献,东吴证券研究所VLA4AD的主要局限我们认为,当前VLA4AD从技术验证走向规模化落地仍面临六种挑战,其中数据瓶颈与算力约束是短期最核心的制约因素。一为鲁棒性与可靠性不足,包括语言幻觉、传感器噪声以及形式化验证的缺失.二为实时性能约束30HzTransformer叠LLMtoken三为数据与标注瓶颈,视觉—语言—动作三模态配对监督数据稀缺。四为多模态对齐6/13东吴证券研究所东吴证券研究所五为多智能体社会复杂性,受约束的车间V2V语言、信任与安全等长期问题仍处于探索初期。(sim-to-real)代表性模型:头部厂商VLA路线开始分化EMMA:基于Gemini的纯端到端架构EMMA构建于多模态大模型Gemini之上roadgraphEMMAEMMA在nuScenes运动规划任务上取得OpenMotionDatasetWOMDCoT推理/3D理想:从E2E+VLM双系统到MindVLA统一架构NOA(2021年年)→BEV/OCC感知大模型(2023年)→E2E+VLM双系统(2024年)→VLA(2025年E2E+VLM统:E2EVLM2024DriveVLM其将规划拆解为“场景描述—关键对象影响分析—分层规划”三段式推理链,并通过DriveVLM-Dual3DMindVLA3D3D高斯3DGaussianMindGPTMoEDiffusionVLA20258i87/13东吴证券研究所东吴证券研究所ADMax20263GTC2026MoE/元戎启行:40BVLA基座的Driver/Analyst/Critic三角色元戎启行40BVLACriticFoundationModel51220261002025年10月在第三方高阶智驾供应商中单月份额接近40%。千里科技CoWorld-VLA:多专家世界模型CoWorld-VLA论文提出,传统VLA通常将图像、导航指令与车辆状态直接映射为未来轨迹,缺少可被规划器调用的中间世界状态;文本思维链难以保留连续的空间与运动信息,单一世界表征又不足以覆盖交通交互、道路几何与未来动态。其核心创新是在VLM隐空间构造四类专家训练分三阶段Qwen3-VL为VLMVGGTHMEF与专家作为条件在动作空间中扩散去噪,生成连续自车轨迹。v1PDMS达,超越Uni-WorldVLA(9.orDr(9D指标32(越低效果越好消+5.0PDMS、HMEF+1.1PDMS里科技,董事长印奇的AI+车体系以与吉利合作的千里浩瀚智驾及世界模型为主线,8/13东吴证券研究所东吴证券研究所图3:CoWorld-VLA在NAVSIMv1上的PDMS贡献拆解与同类对比CoWorld-VLAThinkinginaMulti-ExpertModelforAutonomousDriving《Data-DrivenNon-ReactiveAutonomousSimulationandBenchmarking表3:代表性厂商VLA模型的架构与公开指标对比模型视觉/输入语言/推理动作解码公开指标WaymoEMMA环视相机,纯视觉,不含LiDAR/雷达Gemini统一语言空间,CoT推理轨迹文本tokennuScenes规划SOTA;CoT使端到端规划提升6.7%理想MindVLA3DMindGPT,MoE+稀疏注意力,Diffusion扩散轨迹公司口径:车端实时运行元戎启行40BVLA视觉输入为主Analyst因果推理,三角色,实时驾驶动作数据闭环周期由5天以上压缩至约12小时千里CoWorld-VLA图像+导航+车辆状态Qwen3-VL隐空间四类专家Token扩散式HMEF规划器NAVSIMv1PDMS89.8;FVD32.7小鹏第二代VLA音/32倍超密视觉思维链,弱化文本语言端到端直接输出动作CoT33%EMMAEnd-to-EndMultimodalModelforAutonomousDrivingCoWorld-VLAThinkinginaMulti-ExpertModelforAutonomousDriving》等其他文献,理想、小鹏等公司公开资料,东吴证券研究所;各指标口径不一,不可直接横向比较小鹏第二代VLA:弱化显式语言层,强化视觉思维链设计动机:标准VLA的语言转译瓶颈小鹏将行业传统VLA概括为视觉V、语言L、动作A9/13东吴证券研究所东吴证券研究所基VLA架构特征:原生多模态与视觉思维链小鹏第二代VLA32CoT,公32倍、相比传统CoTself-play也是原生舱驾一体的基础框架。图4:小鹏第二代VLA对外披露的能力提升与体验改善数据来源:小鹏汽车官网、2025小鹏科技日及2026THEFUTURE媒体日公开披露,东吴证券研究所整理表4:小鹏第二代VLA对外披露的关键参数与指标维度指标数值/表述披露场合模型视觉思维链推理效率提升32倍2026THEFUTURE媒体日模型相比传统CoT的预测误差降低33%2026THEFUTURE媒体日算力车端算力-Ultra版2,250TOPS2025小鹏科技日算力车端模型参数规模数十亿级,行业普遍千万级2025小鹏科技日数据训练数据量近1亿clips,累计50PB,科技日/推送公告数据每版模型训练数据约4万亿Tokens推送公告体验综合行车效率提升23%2026THEFUTURE媒体日落地首发外部客户大众汽车,图灵AI芯片获定点2025小鹏科技日数据来源:小鹏汽车官网、2025小鹏科技日及2026THEFUTURE媒体日公开披露,东吴证券研究所整理10/13东吴证券研究所东吴证券研究所去显式语言层的边界:趋近的VLA变体VLAVLAVLA作为对照,理想MindVLA-o1按公司表述保留了语言层,是原生多模态MoETransformer,将视觉、语言、行动三种模态联合训练并在同一表示空间对齐,支持快思考/慢思考双模式。由此可见,在是否保留显式语言推理层这一维度上,头部厂商的VLA工程与量产:算力、数据与落地节奏为实现第二代VLAAI2,250的Ultra版车型上搭载数十亿12VLA1clips42025科技VLA于2025年12年第一季度起面向小鹏Ultra车型推送AIVLANGPMPI23%。风险提示技术迭代不及预期的风险:数字AI、物理AI技术进展低于预期,任
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026二上数学试讲趣味课件
- 2026二上数学赛课说课课件
- 2026北师大二下平行四边形备课课件
- X射线计算机体层摄影设备(CQZ2501853)
- 13.类比法-物理一轮微专题(思维篇)
- 2026四下数学第一单元公开课课件
- 2026四下数学第四单元动画课件
- 垃圾分类知识教育课件【共23张幻灯片】
- 校园门店服务实施方案
- 2027届广东省深圳市盐田区物理九年级第一学期期末统考模拟试题含解析
- 2026年上海市闵行区中小学教师招聘考试试卷及答案
- 2026 年秋季开学:新时代教师师德师风建设专题培训
- 新版2026西师大版数学六年级上册全册完整版教案教学设计合集
- 2026年山西调度规程考试试题及答案
- 蓝图绘就 十五五(2026-2030)山东省纺织服装产业升级建设方案报告
- 2026年幼儿园新生家长会后勤园长
- 2025年新疆医科大学第一附属医院医护人员招聘考试题库及答案详解
- 工程伦理第2版
- 人民医院病房改造提升项目监理大纲服务方案投标文件(技术标)
- ICU患者镇静镇痛状态评估量表
- 社区胸痛健康教育
评论
0/150
提交评论