版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
WORLDMODEL·SPATIALINTELLIGENCE·2026李飞飞Atlas世界模型深度解析多模态空间智能的技术架构、核心能力与行业影响WorldLabs·2026年9月发布·技术深度报告AI技术前沿系列目录01世界模型浪潮与Atlas登场从Sora到空间智能,AI的下一个战场02WorldLabs与李飞飞的创业之路四位创始人、融资历程与产品线演进03Atlas的四大核心能力相机控制生成、空间重建、时空模拟、图像生成04技术架构深度解析多模态自回归扩散Transformer与空间上下文05性能评测与技术对比胜率数据、3D重建误差与横向对比06应用场景与产业影响影视、游戏、机器人、建筑四大领域07批评与局限"还是走在2024年的旧路上"——空间与时间的分裂08未来展望世界模型的终极目标与空间智能的下一座高峰共8章·46页·基于公开资料与技术博客深度整理01世界模型浪潮与Atlas登场当AI学会"生成像素"之后,下一个目标是"理解空间"——世界模型正在成为人工智能攀登的下一座高峰。从Sora到世界模型:AI的下一个战场Sora的宣言:视频生成即世界模拟2024年2月,OpenAI发布Sora,首次提出"视频生成模型作为世界模拟器"的愿景。Sora能够生成长达60秒的视频,展现出对三维空间、物体持久性和物理交互的初步理解。OpenAI认为,持续扩展视频模型是开发高能力物理和数字世界模拟器的一条极具前景的道路。Sora的局限性无法准确模拟玻璃破碎等基本物理过程长时间样本中出现空间不一致物体可能不受控制地出现或消失缺乏显式的三维空间记忆群雄逐鹿:世界模型的四条路线视频生成路线:OpenAISora、GoogleVeo、字节Seedance——从时间序列出发,学习画面如何随时间演变。游戏交互路线:DeepMindGenie系列——从动作条件出发,生成可实时交互的游戏世界。空间重建路线:WorldLabsAtlas——从三维空间出发,先构建几何连贯的场景再生成内容。机器人仿真路线:NVIDIACosmos、IsaacSim——从物理引擎出发,为具身智能提供训练环境。世界模型的定义与核心能力世界模型是能够理解、生成和模拟三维世界的AI系统——它不仅能"看到"空间,还能预测场景如何随时间和动作变化。三大核心能力维度世界生成从文本、图像或视频输入,生成全新的三维世界。包括场景创建、视角控制、内容补全等能力。空间重建从真实世界的少量图像或视频,恢复出完整的三维几何结构。输出深度图、点云或3DGaussianSplatting。时空模拟在重建的三维空间中模拟物体运动、机器人交互和物理变化,为具身智能提供训练环境。2024-2026世界模型发展时间线2024.02OpenAI发布Sora,提出"视频生成即世界模拟"2024.09WorldLabs结束隐身,李飞飞团队展示初代世界模型2024.12DeepMind发布Genie2,可实时交互的游戏世界模型2025.10WorldLabs发布RTFM,单卡实时生成可交互视频2025.11WorldLabs推出首款商用产品Marble,生成持久3D世界2026.07WorldLabs收购SceniX,加强机器人仿真能力2026.09WorldLabs发布Atlas,全球首个多模态世界模型Atlas发布:李飞飞的新答卷2026年9月1日,Atlas正式亮相美国当地时间9月1日,"AI教母"李飞飞旗下WorldLabs发布新一代世界模型Atlas。WorldLabs将其称为"全球首个多模态世界模型"(omniworldmodel),希望用同一个基础模型同时完成视频生成、3D重建和时空模拟。与主流视频生成模型不同,Atlas从零开始预训练,让文本、图像、视频和3D信息在统一的空间上下文中协同工作。"如果说传统视频生成模型是在'生成像素',那Atlas做的则是'理解空间'。"——WorldLabs官方博客本章小结世界模型正在从"生成像素"走向"理解空间",Atlas代表了从空间出发的技术路线。关键要点Sora开启了视频生成即世界模拟的方向,但物理模拟和空间一致性仍是短板世界模型形成四条技术路线:视频生成、游戏交互、空间重建、机器人仿真三大核心能力:世界生成、空间重建、时空模拟Atlas于2026年9月1日发布,号称全球首个多模态世界模型,从零开始预训练02WorldLabs与李飞飞的创业之路从ImageNet到空间智能,从斯坦福实验室到估值50亿美元的AI独角兽——理解Atlas,先要理解它背后的团队。李飞飞:从ImageNet到空间智能学术生涯斯坦福大学首位红杉讲席教授斯坦福HAI(以人为本AI研究院)联合主任美国国家工程院、医学院、艺术与科学院三院院士曾任谷歌云AI/ML首席科学家ImageNet数据集创始人,引爆深度学习革命从视觉到空间的研究脉络李飞飞的研究始终围绕一个核心问题:机器如何理解视觉世界?从ImageNet让机器学会识别物体,到3D场景理解,再到空间智能——她认为世界模型是AI攀登的下一座高峰。2025年11月,她在文章中明确提出:空间智能应当能感知多模态输入、预测场景变化、并与环境交互。"智能不只是模式识别,更是对世界的建模。"——李飞飞,2025年空间智能主题文章四位联合创始人的技术背景姓名背景核心贡献与专长李飞飞斯坦福大学教授ImageNet创始人,计算机视觉领域领军人物,CEO,负责公司战略与研究方向JustinJohnson密歇根大学教授李飞飞的学生,图像生成与风格迁移专家,PyTorch核心贡献者,负责模型架构设计BenMildenhall前Google研究员NeRF(神经辐射场)共同发明人,3D重建与新视角合成权威,负责空间重建技术ChristophLassner前MetaRealityLabsPulsar可微分渲染器发明人,人体建模与AR/VR专家,负责渲染与仿真技术融资历程与估值变化2024年1月$2.3亿首轮融资,a16z领投,成立3个月估值破10亿美元2026年2月~$10亿B轮融资,Autodesk战略投资2亿美元,估值约50亿美元累计融资~$12.3亿投资人包括a16z、英伟达、Autodesk等,黄仁勋个人参投关键投资人a16z:首轮领投,合伙人MartinCasado与李飞飞一顿晚餐促成创业英伟达:黄仁勋与李飞飞是多年好友,GPU算力与机器人战略协同Autodesk:2亿美元战略投资,建筑设计与3D内容创作场景协同产品线演进:从RTFM到Atlas2025.10RTFM实时生成世界模型研究预览版单张H100实时生成可交互视频端到端学习大规模视频数据从2D图像直接生成新视角2025.11Marble首款商用产品生成持久3D世界文本/图像/视频/粗略3D布局输入可探索、可导出的三维世界基于3DGaussianSplatting2026.01WorldAPI开发者API对外开放世界模型能力支持第三方应用集成程序化生成3D场景构建开发者生态2026.09Atlas多模态世界模型从零预训练的omnimodel原生处理文本/图像/视频/3D统一生成、重建、模拟像素级相机控制本章小结WorldLabs拥有CV领域最豪华的创始团队,两年内完成从研究原型到多模态世界模型的产品跃迁。关键要点四位创始人覆盖计算机视觉、3D重建、渲染仿真全链条,NeRF发明人BenMildenhall是核心技术资产累计融资约12.3亿美元,估值50亿美元,a16z、英伟达、Autodesk为关键投资人产品线从RTFM(研究)→Marble(商用)→WorldAPI(生态)→Atlas(多模态统一)逐步演进03Atlas的四大核心能力一个模型,四种模态——相机控制生成、空间重建、时空模拟、图像生成,Atlas如何统一实现?能力总览:一个模型,四种模态Atlas原生处理文本、图像、视频、3D深度四种模态,所有输入统一编码到带空间位置的上下文中相机控制生成1-6张参考图指定相机位置和运动路径最长1分钟视频1440p分辨率像素级视角控制空间重建1-100+张真实照片输出点云和3DGS未拍摄区域智能补全视频逐帧深度预测设备端高帧率渲染时空模拟Real-to-Sim流程手机视频重建环境机器人视角RGB+深度刚体/铰接/可变形物体大规模训练数据生成图像生成文本生成图片360度全景图复杂提示词处理图中文字生成多种视觉风格相机控制生成:从文字描述到精确路径传统方式vsAtlas方式传统视频生成模型用文字描述镜头运动:"向左移动""从高处俯拍"模型概率性地理解意图,实际运动轨迹不可控无法精确指定相机位置、角度和速度Atlas相机控制生成直接输入相机位置、方向和运动轨迹参数像素级精确控制,镜头运动可预测可复现可设计复杂路径,多路线、变速、多角度技术规格参数规格参考图数量1-6张最长视频时长60秒最高分辨率1440p控制方式相机位姿+运动路径空间一致性全程保持单图生成新视角:空间补全的魔法一张照片输入Atlas后,镜头可以移动到原本没有拍到的位置。模型需要判断物体之间的空间关系,并根据已有信息推断镜头移动后应该看到什么。输入一张照片例:菜地里的铜色玩具机器人只拍到机器人正面背景部分可见→Atlas推理理解3D空间关系推断机器人背面形态补全未拍摄的周围区域保持光照和材质一致→输出机器人背面视角完整的周围环境空间连贯的新画面多图融合:构建完整场景如果两张图片分别对应空间中的不同位置,Atlas可以把它们放入同一个空间上下文,再生成两张图片之间缺失的内容。参考图片不再只是决定视觉风格,而成为生成空间的一部分。WorldLabs展示案例:两张没有直接关联的场景图片被放在不同空间位置,Atlas生成了连接两者的门、走廊和其他过渡空间。多图输入的优势减少推测:输入图片越多,模型需要自行补全的区域越少,重建结果越忠实于真实扩展场景:不同位置的图片可以被连接成一个更大的完整空间,自动生成过渡区域多路线生成:同一组参考图可以设计不同的镜头路径,经过不同区域,改变运动速度和长度空间重建:从真实照片到3D世界输入越多,重建越完整WorldLabs用花园、房屋和小屋展示了重建过程:1张花园照片:重建花园,其他区域需推测2张照片:花园+小屋对应,部分仍需推测3张照片:场景得到更完整还原输出格式新视角图像帧点云(PointCloud)3DGaussianSplatting(可设备端高帧率渲染)视频逐帧深度图支持1张到100+张输入图片,两三张即可获得较为忠实的重建结果;未拍摄区域仍可智能补全时空模拟:为机器人搭建训练场Real-to-Sim工作流程第一步:真实环境采集用普通手机和运动相机拍摄真实场景,3-5个机位即可第二步:空间重建Atlas从视频中重建三维空间,仅需24帧画面第三步:机器人仿真模拟机器人沿不同路径移动,生成机身摄像头的RGB和深度数据第四步:训练数据生成改变物体位置、机器人运动、光照和背景,生成大规模训练数据支持刚体、可运动部件和可变形物体模拟;英伟达机器人主管JimFan评价:"这是机器人领域Real-to-Sim的一大步"图像生成与"子弹时间"特效图像生成能力Atlas可以根据文字生成图片和360度全景图,也能处理复杂提示词、生成图片中的文字,覆盖多种视觉风格。展示案例包括:电影画面、室内设计、游戏场景、童话村庄全景图。但这不是WorldLabs强调的主要方向——图像生成只是空间能力的副产品。核心区别:Atlas的所有生成结果都建立在空间关系之上,而不是孤立的2D图像。"子弹时间"特效使用普通手机和运动相机拍摄真实场景,利用3到5个机位重建空间。即使原本没有摄影机从某个角度拍摄,也可以在后期重新生成这个角度,实现类似《黑客帝国》中的"子弹时间"效果。不需要专业摄影设备——工程师用普通手机、三脚架和背包大小的小型夹具即可完成拍摄。影视应用价值:几张照片省掉几百个机位,大幅降低特效拍摄成本。本章小结Atlas的四大能力统一建立在空间上下文之上,从生成像素升级为理解空间。关键要点相机控制生成:像素级精确控制镜头,1-6张图生成最长1分钟1440p视频空间重建:1-100+张照片恢复3D场景,输出点云和3DGaussianSplatting时空模拟:Real-to-Sim流程,24帧手机视频即可重建大型环境供机器人训练图像生成:文生图和360度全景,但只是空间能力的副产品04技术架构深度解析多模态自回归扩散Transformer——Atlas如何用一个架构统一生成、重建与模拟?多模态自回归扩散TransformerAtlas的架构名称融合了三种技术范式,每个部分都有明确的职责分工:多模态原生处理五种数据类型:文本图像视频相机位姿3D深度图空间数据成为原生模态,而非后处理自回归不同任务组织成数据序列:输入之后接输出,模型根据此前信息逐个生成新元素类比LLM:根据context生成后续token可使用KVcaching、cache-awarerouting等LLM优化技术扩散+Transformer采用rectifiedflow模型,逐步去噪生成高维连续数据调整去噪步骤可在速度和质量间取舍Transformer作为基础架构可用diffusiondistillation、CFG等技术空间上下文:Atlas的核心设计空间上下文(SpatialContext)是整个架构的核心——每张图片都对应一个3D位置,图片和深度图与明确的相机位姿关联。类比大语言模型LLM:把输入文本编码成context,再基于context生成后续token。Atlas:流程相同,但进入context的每一张图像都带有三维空间坐标。模型生成新内容时,同时参考输入内容以及这些内容在空间中的位置。视频表示为连续的图片序列,每帧都有对应的相机位姿。带来的直接收益可控性:镜头语言从概率性提示升级为结构化条件可评测性:可以比较目标轨迹与生成内容中的实际相机运动空间一致性:不同视角的生成结果在三维空间中保持连贯统一架构:生成、重建、模拟共享同一套空间表示ScalingLaw与从零训练的意义遵循ScalingLawWorldLabs训练了不同规模和不同训练计算量的Atlas模型,观察到:随着训练计算量增加,模型获得新的能力性能提升呈现可预测的Scaling规律继续扩大训练规模后,未来世界模型仍会沿此方向提升这与大语言模型的发展路径高度一致。从零预训练的意义与主流视频生成模型不同,Atlas不是在现有视频或3D模型上改造,而是从零开始预训练。意义在于:空间信息从第一天就进入模型,而非后处理四种模态共享统一的表示空间避免了拼接多个专用模型带来的一致性问题从零训练+ScalingLaw=世界模型可能复制大语言模型的增长曲线与传统视频生成模型的本质区别维度传统视频生成(Sora/Seedance/Veo)Atlas世界模型核心目标生成连续的视频画面理解和构建三维空间镜头控制文字描述,概率性理解精确相机位姿和运动路径空间一致性长时间易出现不一致三维空间锚定,全程保持3D输出无显式3D输出点云、深度图、3DGS角色比喻导演——关心画面怎样往下演搭景师——先造出从各角度都说得通的空间本章小结空间上下文是Atlas的技术灵魂,从零预训练+ScalingLaw为持续进化奠定基础。关键要点架构为多模态自回归扩散Transformer,融合LLM和图像/视频模型的成熟技术空间上下文是核心:每张图像带3D坐标,模型同时参考内容和空间位置从零预训练,四种模态共享统一表示,避免多模型拼接的一致性问题遵循ScalingLaw,扩大训练规模可持续提升能力05性能评测与技术对比数据说话:Atlas在相机控制生成和3D重建两项测试中表现如何?与主流模型的差距在哪里?相机控制生成评测:人类偏好胜率在相机控制生成任务中,Atlas与主流视频生成模型进行人类偏好对比测试:vsMiniMaxH375%vsGeminiOmniFlash81%vsHappyHorse1.186%vsFLUX393%vsSeedance2.594%WorldLabs称,相机轨迹越复杂,Atlas的优势越明显。在需要精确镜头控制的场景中,传统文字描述方式的劣势被放大。注:以上数据来自WorldLabs官方评测,为人类偏好胜率。评测方法、样本量和具体测试集尚未完全公开,独立第三方复现结果有待验证。3D重建评测:点图误差对比第二项测试为3D重建:提供带相机位姿的图片,要求模型预测每个输入像素对应的3D点。指标为平均点图重建误差(越低越好)。模型平均点图重建误差类型Atlas(WorldLabs)25.3‰通用世界模型Pi3X高于25.3‰单图深度预测π³高于25.3‰多视图重建VGGT-Ω1B高于25.3‰几何基础模型DepthAnything3高于25.3‰单目深度估计注:Atlas在统一测试协议下取得最低误差。但VGGT-Ω1B存在基准污染争议(Meta/VGG8月18日公告),其结果可能被高估。AtlasvsSeedance:两条技术路线Seedance路线:从时间出发通过大量连续画面学习:人怎样转身水怎样飞溅镜头怎样移动前后帧怎么接得自然关注物理交互和物理实体随时间的变化。核心问题:下一秒发生什么?Atlas路线:从空间出发从一张图片出发,扩成可走进去的3D场景:换位置补出没拍到的墙面生成物体背面和周围区域保持空间关系一致不关心"下一秒发生什么",只关心"走到没拍到的那里会看见什么"。核心问题:这个空间长什么样?两条路线就像从两边修同一座桥——从时间出发和从空间出发,暂时还没有走到一起主流世界模型横向对比模型机构路线核心优势主要短板AtlasWorldLabs空间重建精确相机控制、3D重建、空间一致性物理交互和时间动态较弱SoraOpenAI视频生成视觉质量高、时序连贯、物理理解野心无交互、空间一致性不足Genie3DeepMind游戏交互实时交互、可玩世界生成视觉质量和物理还原让步Veo3Google视频生成音画同步、原生音频、电影级画质无3D输出、不可交互CosmosNVIDIA机器人仿真物理精确、Sim2Real、机器人专用领域专用、通用生成能力弱本章小结Atlas在相机控制和3D重建上优势明显,但评测数据待独立验证,与视频生成路线各有所长。关键要点相机控制生成胜率75%-94%,相机轨迹越复杂优势越明显3D重建平均点图误差25.3‰,在对比模型中最低Atlas(空间路线)与Seedance(时间路线)是两条互补的技术路线评测数据均来自WorldLabs官方,独立第三方复现有待验证06应用场景与产业影响从影视制作到机器人训练,Atlas正在哪些领域创造实际价值?影视与内容创作:省掉几百个机位对影视制作的变革精确镜头设计:导演直接输入相机运动路径,不再靠文字描述碰运气"子弹时间"特效:3-5个普通手机机位即可实现环绕镜头,省掉专业多机位拍摄场景扩展:少量参考图自动生成过渡空间,降低搭景成本多版本快速迭代:同一场景可设计不同镜头路线,快速比较实际价值传统影视中,复杂镜头运动需要:专业摄影设备和轨道大量机位布置反复拍摄和后期合成Atlas可以:用手机拍摄替代专业设备后期任意调整镜头角度大幅降低特效拍摄成本"几张照片省掉几百个机位"——Atlas让复杂镜头运动从高成本特效变成常规操作游戏、机器人与建筑:三大应用领域游戏与虚拟世界文本或图片快速生成可探索的3D游戏场景降低游戏美术资产制作成本程序化生成多样化游戏世界与Marble产品协同,支持场景导出独立开发者也能制作高保真3D内容机器人训练Real-to-Sim:真实环境快速数字化24帧手机视频重建大型环境生成大规模机器人视角训练数据支持刚体、铰接体、可变形物体降低机器人数据采集成本建筑与数字孪生少量照片快速重建建筑3D模型Autodesk战略投资的协同方向建筑设计可视化和方案展示施工现场数字孪生和进度监控室内设计快速预览和修改本章小结Atlas的核心价值是降低3D内容制作成本,影视、游戏、机器人、建筑四大领域均有明确落地场景。关键要点影视:精确镜头控制+"子弹时间"特效,大幅降低多机位拍摄成本游戏:文本/图片快速生成可探索3D场景,降低美术资产门槛机器人:Real-to-Sim流程,24帧视频重建环境,大规模生成训练数据建筑:少量照片重建3D模型,Autodesk战略投资协同方向07批评与局限"还是走在2024年的旧路上"——Atlas的突破与瓶颈在哪里?核心批评:"还是走在2024年的旧路上"Atlas比初代强了不少,但主线其实没有变化——初代是"一张图变成一个世界",Atlas是把更多来源的线索放在一起补全同一个空间。2024年初代模型从一张图片出发,扩成可以走进去的3D场景。换位置,模型补出原图没拍到的墙面、走廊和物体背面。不关心"下一秒发生什么",只关心"走到没拍到的那里会看见什么"。生成的世界像一套搭好的布景,空间存在,时间却没有真正启动。2026年Atlas能同时接收文字、多张图片、视频、相机位置和深度信息。生成新视角、深度图和3D场景,能力更通用。但仍然是"补全空间"的逻辑,不是让世界随时间运行。不是把旧模型简单放大,而是重做了更通用的底座——但路线未变。空间与时间的分裂:世界模型的终极挑战从Atlas的所有展示中,都看不到生成而非拍摄的时间性变化和物理交互。自回归Transformer框架可能主要用作下一个相机位置的画面预测,而非时间性和物理型的预测。当前缺失的能力物体碰撞后的真实物理变化用户动作改变未来状态世界在后台持续运行可变形物体的动态模拟因果关系的准确预测机器人部分的局限Atlas帮助构建仿真世界,但不预测碰撞后世界会怎样变化。机器人操作任务中,物体位置、运动、光照和背景的改变仍需外部仿真引擎。对机器人训练来说,台阶高度、障碍物位置一旦猜错,错误会进入训练数据。至少当下,从时间出发和从空间出发,暂时还没有走到一起其他局限:透明度、精度与
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026 年家国情怀融入日常教育实践课件
- 金属学自测试题及答案指南
- 安徽邮政测评试题及答案解析
- 碳排放管理员岗前创新意识考核试卷含答案
- 景泰蓝点蓝工安全生产能力水平考核试卷含答案
- 主提升机操作工岗前班组安全考核试卷含答案
- 糖汁过滤工创新意识水平考核试卷含答案
- 采油测试仪表工安全实操模拟考核试卷含答案
- 石膏墙材制品生产工班组安全评优考核试卷含答案
- 电力调度员安全应急水平考核试卷含答案
- 《机械基础(第七版)》课件(上)
- 厨房食品安全知识培训课件
- 1.2.2生物学中的科学探究课件-鲁科版生物六年级上册
- 医疗器械收货员培训课件
- 薪酬调整申请报告范文
- 桥架基础知识培训课件
- 视光科进修汇报
- 电信资产管理办法
- 保健艾灸师试题及答案
- 高职单招英语词汇表
- (完整版)高考英语词汇3500词(精校版)
评论
0/150
提交评论