具身智能与世界模型:技术路线分化与商业化破局_第1页
具身智能与世界模型:技术路线分化与商业化破局_第2页
具身智能与世界模型:技术路线分化与商业化破局_第3页
具身智能与世界模型:技术路线分化与商业化破局_第4页
具身智能与世界模型:技术路线分化与商业化破局_第5页
已阅读5页,还剩33页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

EMBODIEDINTELLIGENCE&WORLDMODELS具身智能与世界模型技术路线分化与商业化破局从VLA到世界模型:探索机器人理解物理世界的终极路径行业深度研究报告基于腾讯科技深度报道及行业前沿研究整理目录CONTENTS01行业背景与技术拐点具身智能定义、发展历程、路线分化02世界模型的崛起Atlas、JEPA、LeWM等前沿模型03VLA与世界模型路线之争技术对比、Phi-WM物理原生模型04数据体系与训练方法反事实数据、仿真、ScalingLaw05商业化落地与未来展望汽车制造场景、商业模式、行业趋势与战略重点201行业背景与技术拐点具身智能正处在技术路线加速分化的临界点INDUSTRYBACKGROUND&TECHNOLOGYINFLECTIONPOINT什么是具身智能?WHATISEMBODIEDINTELLIGENCE工业人形机器人在工厂执行装配任务具身智能(EmbodiedAI)是指具有物理实体的智能系统,通过传感器感知环境,利用执行器与物理世界交互,在真实环境中完成感知、认知、决策和行动的闭环。核心特征物理实体:拥有机器人本体,能在真实世界移动和操作环境交互:通过视觉、触觉、力觉等多模态感知环境闭环学习:行动-观察-学习的持续迭代过程通用泛化:面对新物体、新任务时减少反复试错4具身智能发展历程DEVELOPMENTHISTORY2010s深度学习驱动感知突破,卷积神经网络在图像识别上超越人类,机器人视觉感知能力大幅提升2020-2022大语言模型爆发,GPT-3等模型展现强大推理能力,开始探索将LLM与机器人结合2023-2024VLA模型兴起,RT-2、OpenVLA等视觉-语言-动作模型出现,模仿学习成为主流路线2025-2026世界模型成为新热点,Atlas、LeWM、Phi-WM等模型发布,技术路线进入分化期5技术路线加速分化的临界点TECHNOLOGYROUTEDIVERGENCE"谈到具身智能的技术路线,确实有点'眼花缭乱'。前两年大家还在讲VLA,最近一年又开始频繁讨论世界模型、隐空间这些新方向,也有团队把强化学习、触觉、在线反馈不断加入模型。每家公司都有自己的一套说法。"当前并行的四大技术路线VLA路线视觉-语言-动作模型

模仿学习为主

代表:RT-2、OpenVLA

GR00T、Helix世界模型理解和模拟物理世界

预测状态转移

代表:Atlas、LeWM

Phi-WM强化学习试错学习与奖励驱动

仿真到真实迁移

代表:RTX系列

敏捷机器人分层运控高层规划+底层控制

传统机器人范式

工业成熟方案

确定性高6CHAPTER01·SUMMARY本章小结:百花齐放的技术路线路线收敛之前,新的思路和方法还会不断出现具身智能已从感知突破发展到认知与行动的融合阶段。VLA、世界模型、强化学习、分层运控四条路线并行探索,尚无单一路线被证明为终极方案。行业关注的核心问题是:模型究竟该如何学会理解和表征真实世界,并进一步转化为预测、规划和行动能力。下一章:世界模型为什么成为行业新焦点?702世界模型的崛起从李飞飞Atlas到杨立昆JEPA,理解物理世界的新范式THERISEOFWORLDMODELS什么是世界模型?WHATISAWORLDMODEL数字孪生与3D仿真:世界模型的工程化体现世界模型是智能体内部的预测表征系统,使其能够模拟未来状态、预判行为后果并规划动作。它让AI不再只是被动响应,而是能够"想象"行动的结果。核心能力状态表征:在隐空间中编码真实世界的状态状态转移:学习状态如何随时间和动作变化后果预测:预判不同动作会带来什么结果行动规划:基于预测结果选择最优动作序列9李飞飞的世界模型功能分类AFUNCTIONALTAXONOMYOFWORLDMODELS李飞飞在《AFunctionalTaxonomyofWorldModels》中,将世界模型按功能拆为三个维度:Renderer渲染器负责生成看起来真实的世界

从文本或图像生成视频

代表:Sora、视频生成模型Simulator模拟器试图模拟世界怎样运行

预测物理状态的演化

代表:LeWM、Phi-WMPlanner规划器帮助智能体判断下一步做什么

基于预测进行动作规划

代表:VLA+世界模型融合目前所有被称为"世界模型"的系统,其实是这个循环在三个不同方向上的投影,最终可能走向融合10李飞飞发布Atlas:全球首个多模态世界模型ATLAS:THEFIRSTOMNIWORLDMODEL2026年9月1日,斯坦福大学教授李飞飞团队(WorldLabs)发布全球首个多模态世界模型Atlas,官方定义为"omniworldmodel",从零开始预训练,原生处理文本、图像、视频、相机位姿与3D深度信息。Atlas的三大核心任务世界生成像素级相机控制生成图像与视频帧

支持新视角合成

几张照片生成3D场景空间重建单图生成完整3D世界

理解物体位置、形状、距离

和空间关系时空模拟在同一套模型中完成

世界生成、空间重建

和机器人仿真11Atlas的核心突破:从生成像素到理解空间ATLASKEYBREAKTHROUGHS机器人灵巧操作:Atlas仿真能力的应用场景与传统视频模型的本质区别预测新视角:LLM预测下一个token,视频模型预测下一帧,Atlas预测的是"新视角"——给它几张照片,它理解空间关系后告诉你从另一个位置看过去会是什么样原生3D理解:不是2D图像的拼接,而是真正理解物体的位置、形状、距离和空间关系统一架构:世界生成、空间重建、机器人仿真三件事在同一模型中完成,过去分属三个赛道机器人仿真:可直接用于机器人训练,在数字空间中预演物理交互12杨立昆的JEPA路线:在隐空间预测世界LECUN'SJEPA:PREDICTINGINLATENTSPACE图灵奖得主杨立昆(YannLeCun)提出JEPA(联合嵌入预测架构),核心思想是在抽象的表示空间中进行预测,而非像素空间。"你不会去预测每个像素的RGB值,你会预测高层次的语义信息。"JEPAvs生成式模型JEPA(杨立昆路线)在隐空间预测抽象表示不生成像素,避免幻觉问题训练效率更高(1.5x-6x)更适合机器人规划与控制生成式模型(扩散/自回归)在像素空间生成完整画面容易产生"幻觉"和不真实细节计算量大,推理链路长视觉效果好但可靠性存疑13LeWM与LpWM:JEPA世界模型的演进LEWM&LPWM:JEPAWORLDMODELEVOLUTIONLeWM(2026年3月)首个端到端稳定训练的JEPA世界模型采用稠密表征(DenseRepresentations)在多个机器人基准上取得SOTA证明JEPA路线在机器人领域可行LpWM(2026年8月24日)用稀疏表征替代稠密表征降低计算量,提升训练效率更好地捕捉物理世界的关键特征在机器人操作任务上表现更优核心洞察:稠密表征的局限稠密表征要求每个维度都被激活,导致模型在预测时浪费容量在无关细节上。稀疏表征只激活与当前任务相关的维度,更接近人类大脑的工作方式——我们不会同时关注场景中的所有细节,而是选择性地关注关键信息。14LeVJEPA:从图像到视频的JEPA拓展LEVJEPA:VIDEO-LEVELJEPA2026年8月27日,杨立昆团队发布LeVJEPA,将JEPA从图像拓展到视频领域,实现了对动态世界的时空理解与预测。LeVJEPA的关键能力时空联合预测同时建模空间和时间维度

理解物体运动轨迹

预测未来状态变化动作条件预测给定动作序列预测结果

支持机器人规划

"如果我这样做会怎样"高效自监督无需标注数据

从无标注视频中学习

训练效率显著优于生成式15CHAPTER02·SUMMARY本章小结:两条世界模型路线并行生成式路线(李飞飞)Atlas:多模态世界模型

原生处理文本/图像/视频/3D

世界生成+空间重建+时空模拟

从"生成像素"到"理解空间"JEPA路线(杨立昆)LeWM→LpWM→LeVJEPA

在隐空间预测抽象表示

稀疏表征替代稠密表征

从图像到视频的时空理解下一章:VLA与世界模型,哪条路线更接近终极答案?1603VLA与世界模型路线之争模仿学习的边界与物理原生世界模型的突破VLAVSWORLDMODELDEBATEVLA模型:模仿学习的主流范式VLA:VISION-LANGUAGE-ACTIONMODELS工业场景中的人形机器人操作VLA(Vision-Language-Action)模型将视觉感知、语言理解和动作生成统一到一个端到端模型中,通过模仿人类演示数据学习操作技能。代表模型RT-2(GoogleDeepMind):首个大规模VLA模型OpenVLA:开源VLA基础模型GR00T(英伟达):人形机器人基础模型Helix(智元):国内具身智能大模型Cosmos(特斯拉):自动驾驶+机器人统一模型18VLA的能力边界:模仿学习的局限LIMITATIONSOFVLAMODELS"VLA本质上是一个'高级模仿者',能学会演示中的动作模式,但很难真正理解动作背后的物理因果关系。"VLA的四大核心局限1.数据依赖严重需要大量高质量人类演示数据,采集成本高、覆盖场景有限2.泛化能力有限面对训练分布外的新物体、新场景时性能显著下降3.缺乏因果理解学到动作-结果的相关性,而非物理因果,难以推理"为什么"4.无法预测后果不能预判动作长期后果,出错后难以自我纠正和重新规划19世界模型的核心优势:从模仿到理解ADVANTAGESOFWORLDMODELS对比维度VLA(模仿学习)世界模型学习方式模仿人类演示,学习动作模式理解物理规律,学习状态转移数据需求大量人类演示,采集成本高仿真+自监督,数据可无限生成泛化能力分布外泛化弱,新场景性能下降理解物理本质,跨场景泛化更强规划能力反应式决策,缺乏长期规划可预测后果,支持前瞻规划纠错能力出错后难以自我纠正可检测偏差,动态重新规划20Phi-WM1.0:物理原生世界模型PHI-WM1.0:PHYSICS-NATIVEWORLDMODEL光象科技发布第一代世界模型Phi-WM1.0ActEffect,定位为"物理原生世界模型",核心是显隐状态解耦表征。创始人张涛、首席科学家吕尧均为清华系背景,联合清华大学李升波教授课题组。Phi-WM的核心理念物理原生不是在像素空间生成

而是在物理状态空间

建模真实世界的运行规律显隐解耦显状态(可观测)与

隐状态(不可观测)

分开建模,互不干扰ActEffect动作-效应建模

预测动作对物理世界

产生的实际影响21显隐状态解耦:Phi-WM的核心创新EXPLICIT-IMPLICITSTATEDECOUPLING显状态(ExplicitState)可直接观测的物理量

物体位置、速度、姿态

关节角度、力/力矩

传感器直接读数隐状态(ImplicitState)不可直接观测的内在属性

物体质量、摩擦系数

材质、形变特性

环境的潜在约束为什么解耦很重要?传统模型把所有状态混在一起编码,导致显状态的噪声干扰隐状态的学习,反之亦然。解耦后,显状态负责精确的物理计算,隐状态负责捕捉环境的内在特性,两者各司其职,预测更准确、泛化更强。这就像人类理解世界时,会区分"看到的"和"推断的"。22CHAPTER03·SUMMARY本章小结:路线之争的本质是范式之争VLA与世界模型的争论,本质上是"模仿范式"与"理解范式"之争。VLA擅长快速落地但受限于数据和泛化,世界模型追求物理理解但仍处早期。光象科技的Phi-WM提出物理原生+显隐解耦的新思路,代表了国内团队在世界模型方向的独立探索。未来更可能是VLA与世界模型融合,而非非此即彼。下一章:数据是世界模型的燃料——反事实数据与仿真体系2304数据体系与训练方法反事实数据、仿真主导与ScalingLawDATASYSTEM&TRAININGMETHODOLOGY反事实数据:世界模型的关键燃料COUNTERFACTUALDATA世界模型要学会预测,就需要知道"如果当时那样做,结果会怎样"。但真实数据只记录了"实际发生了什么",无法提供反事实信息——这正是仿真数据的核心价值。真实数据的局限只记录实际发生的动作和结果无法回答"如果换个动作会怎样"失败案例少,安全约束限制探索采集成本高,场景覆盖有限数据分布偏窄,缺乏多样性仿真反事实数据的优势同一状态可尝试多种不同动作获得完整的动作-结果对照可安全探索失败和边界情况数据可无限生成,成本极低覆盖长尾场景,提升泛化能力25数据职能分工:三类数据各司其职DATAFUNCTIONDIVISION真实数据占比:约10-20%提供真实世界的

物理特性和分布

用于模型校准和

Sim-to-Real迁移仿真数据占比:约60-70%提供大规模反事实

训练样本

覆盖长尾场景

是训练的主体合成/生成数据占比:约10-20%用世界模型生成

额外训练数据

数据增强和

场景扩充光象科技的观点:仿真数据在世界模型训练中占绝对大头,真实数据主要用于校准和验证,合成数据用于补充。三者不是替代关系,而是互补关系,共同构建完整的数据体系。26仿真数据为什么占绝对大头?WHYSIMULATIONDATADOMINATES智能工厂仿真与数据面板仿真的四大不可替代优势无限规模:可并行生成百万级轨迹,真实采集不可能达到反事实能力:同一状态可尝试不同动作,获得完整对照安全探索:可模拟碰撞、失败、危险操作,无真实风险精确标注:物理量(位置、速度、力)自动精确获取场景控制:可随机化环境参数,提升模型鲁棒性核心挑战:Sim-to-RealGap——仿真与真实世界的差异需要通过域随机化和真实数据校准来弥合27ScalingLaw在具身智能中是否适用?SCALINGLAWINEMBODIEDAI大语言模型的经验表明,模型规模+数据规模+计算量的提升会带来可预测的性能增长。但在具身智能中,这个规律是否成立仍有争议。支持ScalingLaw的观点仿真数据可无限扩展,突破数据瓶颈世界模型本质是预测模型,与LLM同构更大模型能捕捉更复杂的物理规律多任务联合训练带来涌现能力已有实验显示性能随规模单调提升质疑ScalingLaw的观点物理世界有硬约束,不是纯统计问题Sim-to-RealGap不会随规模自动消失真实数据稀缺,无法纯靠规模解决机器人硬件限制,模型能力难以完全释放交互闭环需要在线学习,非离线训练28世界模型:训练时的反馈器,而非部署时的规划器WORLDMODELASFEEDBACKER,NOTPLANNER光象科技提出一个关键定位:世界模型是"训练时的反馈器",而非"部署时的规划器"。这一定位直接影响了世界模型的使用方式和工程架构。传统认知:部署时规划器推理时用世界模型

预测多种动作后果

选择最优动作执行

延迟高、计算量大

实时性难以保证新定位:训练时反馈器训练时用世界模型

生成反事实反馈信号

指导策略模型学习

部署时策略模型直接决策

低延迟、高效率29CHAPTER04·SUMMARY本章小结:数据与训练的关键洞察反事实数据是世界模型的关键燃料,仿真数据提供了真实数据无法替代的反事实能力数据职能分工明确:仿真占60-70%为主体,真实数据10-20%用于校准,合成数据10-20%用于补充ScalingLaw在预训练阶段可能适用,但下游控制仍需场景适配世界模型定位为"训练时的反馈器"而非"部署时的规划器",兼顾学习效率与推理实时性下一章:从技术到商业——世界模型如何在真实场景中落地?3005商业化落地与未来展望从汽车制造到通用机器人,先建立"1"再扩展COMMERCIALIZATION&FUTUREOUTLOOK为什么选择汽车制造作为优先落地场景?WHYAUTOMOTIVEMANUFACTURING汽车焊接生产线:高度自动化的工业场景汽车制造的独特优势高度结构化:产线布局规范,任务重复性高,易于建模自动化基础好:已有大量工业机器人,改造升级需求强付费能力强:车企预算充足,愿意为效率提升付费数据可获取:产线数据丰富,便于仿真建模和训练价值可量化:效率提升、良率改善有明确的ROIPhi-BotX1已在多家汽车制造工厂部署收尾,验证了技术可行性和商业价值32场景选择的三大标准THREECRITERIAFORSCENESELECTION01场景结构化程度环境是否规范可控

任务是否重复明确

物体种类是否有限

结构化越高越容易

建模和验证02数据可获得性是否有充足的历史数据

能否方便地采集新数据

仿真建模是否可行

数据质量是否达标

决定训练效率03商业价值密度客户付费意愿和能力

效率提升的空间大小

ROI是否清晰可算

市场规模和增长性

决定商业回报三个标准同时满足的场景优先落地,汽车制造是目前最符合的场景之一33人机协作:不是替代,而是增强HUMAN-ROBOTCOLLABORATION在可预见的未来,具身智能的落地形态不是"机器换人",而是"人机协作"——机器人承担重复、危险、高精度的任务,人类负责决策、监督和异常处理。机器人的优势24小时不间断工作,无疲劳高精度、高重复性操作危险环境作业(高温、高压)大规模数据处理和分析重体力、高强度任务人类的不可替代性复杂决策和战略判断异常情况的灵活处理创造性和创新性工作人际沟通和协作伦理和价值判断34商业模式:先建立"1",再扩展到"N"BUSINESSMODEL:FROM1TON第一阶段:建立"1"聚焦汽车制造场景

深度打磨产品和技术

跑通商业模式

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论