2026 世界模型产业全景报告 世界模型竞逐 从语言到空间AI 如何理解真实世界_第1页
2026 世界模型产业全景报告 世界模型竞逐 从语言到空间AI 如何理解真实世界_第2页
2026 世界模型产业全景报告 世界模型竞逐 从语言到空间AI 如何理解真实世界_第3页
2026 世界模型产业全景报告 世界模型竞逐 从语言到空间AI 如何理解真实世界_第4页
2026 世界模型产业全景报告 世界模型竞逐 从语言到空间AI 如何理解真实世界_第5页
已阅读5页,还剩113页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

从语言到空间,AI如何理解真实世界报告结构五条主线贯穿全篇01市场高热2026全球世界模型市场超50亿美元,大摩预测2035年赋2026年,世界模型为什么火了世界经济论坛将"世界模型"列为未来五年深刻影响世界的核心技术之一。广东省"十五五"规划明确提出"构建多模态与世界模型"。政策端部委与省级规划纳入资本端政策端部委与省级规划纳入资本端上半年666亿元涌入赛道技术端大模型能力逼近物理世界大语言模型之后,AI要走向物理世界对世界的理解,并不依赖语言这是理解世界模型价值的出发点。·停车时判断车距·接住抛来的钥匙·在人群中自然避让这些日常动作,都是空间智能的体现。空间智能是目标,世界模型是路径衡量世界模型能力的三项基本要求四条技术路线并行,尚未收敛为单一秩式WorldLabsAtlas3DWorldLabsAtlas3D空间生成与重建谷歌Genie3实时交互环境英伟达Cosmos3物理AI基础模型杨立昆JEPA抽象表征预测Atlas2026.9发布新一代模型Atlas2026.9发布新一代模型全球首个多模态世界模型李飞飞离开斯坦福后创办约50亿美元创办一年内估值WorldLabs代表了从三维结构切入世界理解的技术路线——不直接预测像素,而是先重建显式的三维空间。四类任务统一在一个模型架构中能力说明能力说明相机控制生成像素级精度生成图像与视频,最高1分钟1440p空间重建时空模拟图像生成文本生成图像多模态自回归扩散TransformerAtlas从头预训练。文本、图像、视频、3D输入都被锚定在三维空间中,形成空间上下文,模型据此生成多模态输出。多模态输入文本/图像多模态输入文本/图像/视频/3D锚定三维空间形成空间上下文每种任务即一种序列机器人Real-to-Sim的一大步——英伟达机器人主管JimFan价值:为机器人训练提供低成本、高效率的仿真环境构建方案,让机器人能在更多不同模拟空间中训练和测试。杨立昆:在抽象层面预测世界联合嵌入预测架构(JEPA)不还原未来画面的每个像素,而是先取当前观测状态,再过编码器,预测器预测状态变化。当前观测状态编码器提取表征预测器:预测下一抽象状态当前观测状态编码器提取表征预测器:预测下一抽象状态学会模仿,还是学会推理?V-JEPA:不靠海量标注学物理推理Genie3:可实时探索的虚拟世界代表交互式世界模型的发展方向。环顾360度仍保持空间连续目前已为Waymo模拟器提供支持,帮助自动驾驶在"龙卷风""偶遇大象"等极端罕见场景下训练。空间连续性空间连续性=实时交互式世界模型的准入门槛。这是世界模型在自动驾驶领域最成熟的商业化落地。20年街景数据注入世界模型110个国家110个国家2800亿张谷歌把积累20年的街景数据接入ProjectGenie,覆盖全球110国和七大洲。既能基于真实地点构建模拟世界,又能把视角切换至行人、机器人等不同智能体。Cosmos3:全球首个完全开源的物理AI大模型Nano160亿参数Nano160亿参数·主力Edge40亿参数·边缘部署Super640亿参数·高拟真强调物理一致性与开发者生态,从边缘到高拟真全覆盖。从"看起来真实"到"用起来可靠"四条路线横向对比维度维度WorldLabsAtlasJEPAGenie3Cosmos3游戏/自动驾驶路线不同,指向同一个问题·模型该如何理解世界?·对环境的认识,最终要服务于怎样的交互与行动?·若无法回答,世界模型仍停留在技术推演层面,难以在真实场景产生实际价值。最大鸿沟:物理一致性物理运动推理仍是主要瓶颈。测试发现,所有被测模型都缺乏生成可靠真实世界交互所需的物理一致性。这是从"演示级"走向"实用级"的最大鸿沟。Sora上线半年即关停的警示巨额算力消耗、无法平衡的商业化收益是直接诱因;模型始终无法攻克基础物理一致性难题,最终压垮这款标杆产品。结论:仅有视觉逼真度不足以支撑商业化。这些模型目前尚不具备物理感知能力——尚未理解因果关系。从实验室到产业化的五道坎三物理一致性让模型规律严格符合物理定律"看懂"到"做对"之间隔着多个环节""AI能感知空间识别物体,并不代表能在物理空间顺利完成任务。"——复旦大学教授张立华真实世界数据:最高的竞争壁垒真实世界数据正在成为竞争中最高的壁垒。亿小时亿小时高成本使数据积累的时间壁垒,难以被短期资本投入跨越——先发者的积累构成护城河。合成数据可补充,不能替代真实数据异质数据引擎:多源融合而非押注单一顶层:顶层:真实机器人数据(稀缺、高价值)中层:中层:可无限生成的合成数据底层:底层:海量但被动的互联网人类视频物理世界数据,谁就掌握先机。高德CEO郭宁:理解真实世界的三层能力第三层第三层·时空推演从出发到到达、从单点到全局、从现在到未来,看透上下文关联第二层第二层·动态感知从车流到人流、从路况到商户、从白天到黑夜,捕捉每一刻变化第一层第一层·三维空间表达从地球到城市、从道路到建筑、从室外到室内,还原细节与层次由空间表达向动态感知、再向时空推演层层递进,构成空间智能体系。导航Live:实时识别眼前街景动态感知解决信息实时性——避免用过时信息指导当下行动。不仅反映当下,更预判未来等风险。从数据到决策的完整闭环时空推演帮助判断动态感知时空推演帮助判断动态感知提供依据降低理解成本三层能力不是孤立运作,而是协同形成闭环,最终落实为更可行的出行建议。这是高德空间智能区别于单一世界模型的核心特征。二十年的"笨重功夫"活跃用户真实反馈回流时空样本覆盖国家和地区覆盖国家和地区北斗定位日调用峰值数据不只是"大",更是"活"的ABot-Earth0.7依托3D原生技术架构与海量时空数据,支持从星球到街景的一体化全尺寸AI生成。把多种空间信息组织为可连续进入、自由探索、实时交互的三维数字孪生世界。覆盖超过196个国家和地区。不是改良,而是从数据到格式的全面重构一块消费级GPU,10分钟生成一座城模型自主补全并生成完整、连续的三维空间,用户不再受既定路线限制,可连续进入、自由探索。从星球到街景,单一模型全尺寸生成三个月:从单城重建到全球覆盖2026.6·0.5单图十分钟重建一座3D城市2026.9·0.7全球时空组织成可交互数字孪生短短三个月,高德实现从单城重建到全球覆盖的跨越。扫街榜:空间智能走进日常生活+424%烟火小店一年后订单+424%烟火小店一年后订单累计服务用户366亿公里商家累计导航里程2025年烟火小店榜商家一年后订单量同辨"顺路"还是"专程",把选择放回时空情境不只看来了多少人,更结合专程前往、回头客、本地人及行家评价等信号:是顺路经过,还是特意绕远?是旅游打卡,还是日常食堂?不只知道店在哪,更知道为何吸引人扫街榜的变化显露出空间智能的价值:不仅知道一家店在哪里,还判断它为何吸引人、适合谁、何时值得前往。58005800万每天做出行决策的人真探行家创作者AMAP-AIInside:能力走出屏幕依托空间智能与世界模型,智能汽车、智能眼镜、具身智能、低空飞行已陆续接入。ARAR眼镜夸克/雷鸟/Rokid接入导航智能体智能汽车奔驰成扫街榜首个汽车伙伴殊途同归:技术到场景vs场景到技术Atlas/Genie/Cosm"大模型理解语言,高德空间智能理解世界"世界模型的应用版图自动驾驶仿真:补齐现实采不到的极端场景这些场景对自动驾驶系统的安全性至关重要。世界模型让自动驾驶训练突破现实数据采集的天花板。机器人训练:几张照片生成仿真环境Atlas仅需几张照片就能生成逼真的RGB与深度数据,让机器人在更多模拟空间中训练测试。极佳视界:世界模型的三层架构L3L3几何层生成几何准确的通用空间世界空间智能相机:从软件走向硬件中科摇橹船全球首创空间智能相机矩阵,覆盖智能辅助驾驶、低空飞行、具身智能。预计实现批量上车应用>200米浓雾暴雨极端环境感知距离出行:空间智能最自然的高频场景·飞行街景2.0:出发前进入目的地三维空间·导航Live:实时识别眼前街景·避雷指南:15个维度提前识别行程风险·扫街榜:用空间智能重塑线下消费决策链路影视与内容:可能比机器人更快商业化Atlas支持文本生成图像与360度全景,能遵循复杂Prompt、准确渲染文字,生成多种视觉风格。时空模拟能力可转换已有视频的观察视角,制作戏剧性视觉效果。物理AI是多学科融合的系统工程中国人工智能学会林浩哲:物理智能是AI、物理学、控制科学、机械工程等多学科深度融合的全新领域。PAIWorld登顶WorldArena飞捷科思Fysiverse实现底层算法、核心架构100%全栈自研,完成对国产GPU深度适配。轨迹准确性领先第二名72.31PAIWorld总分登顶从"提升现有效率"起步,而非"创造新业务"C端价值路径C端价值路径扫街榜带动小店订单+424%B端效率路径Genie3支持Waymo仿真训练结构性差异:操作系统vs推理引擎简而言之:中国更接近具身智能的"操作系统",美国更接近AGI的"物理推理引擎"。资本与玩家深度参与腾讯开源混元3D世界模型2.0;阿里推出主打实时交互的HappyOyster。企业获融资,占赛道91%1-7月一级市场涌入资金中国团队已具备国际登顶能力分登顶。中国团队在国际权威评测中已具备登顶能力。生成式与表征预测正在走向融合Atlas融合大语言模型与视频模型思想,兼得LLM推理加速与扩散模型生成能力。路线融合可能比单一路线突破更快推动产业成熟。四个变量决定产业格局03端到端世界模型能否在机器人/自动驾驶规模部署概念热度不应掩盖真实距离视频生成模型并不等于世界模型——其训练目标并非还原真实物理规律。从技术探索走向产业落地的转折期四条技术路线并行竞争;真实世界数据成为核心壁垒;物理一致性是最大技术挑战;商业化路径尚在探索。高德依托二十年时空数据,以"三层能力"构建空间智能底座,走出一条从真实场景出发、以数据为护城河的差异化路径。·《信息通信行业发展"十五五"规划》,工信部,2026.9·李飞飞《从语言到世界:空间智能是AI的下一个前沿》,2025.11·WorldLabsAtlas官方技术文档,2026.9·GoogleD

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论