版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第十章
智能系统:从具身智能到世界模型(第二讲)肖亮1南京理工大学计算机科学与工程学院(人工智能学院)江苏省生成式AI与应用研究生暑期学校本章目录1.4.4.具身智能:仿真到现实迁移1.4.5.大模型赋能:感知与任务规划器1.5从具身智能到世界模型1.6具身智能的典型应用1本章目录1.4.4.具身智能:仿真到现实迁移1.4.5.大模型赋能:感知与任务规划器1.5从具身智能到世界模型1.6具身智能的典型应用14SimtoReal1.4.4.具身智能:仿真到现实迁移仿真到真实的迁移(Simulation-to-Real,Sim2Real)是将虚拟仿真环境中训练好的模型、算法或策略,迁移应用到机器人、自动驾驶等现实物理实体中,使其在真实场景下仍保持良好性能与稳定运行效果。物理交互环境复杂动态输入听说看交互理解智能是具身化和情景化的,具身智能可通过与真实世界的交互完成任务智能体51.4.4.具身智能:仿真到现实迁移在数字孪生的虚拟环境中训练AI体,就像为它打造了一个无限试错的“平行宇宙”数据生成的“永动机”AI可以7×24小时不间断地“狂练”,加速学习进程数百万倍安全可控的“试验场”探索那些在现实中风险极高的策略,从而发现更优解可操控的“物理定律”可以操控物理定理,施加更加极限、极端环境的仿真“平行空间、无限试错、物理引擎,仿真推演”仿真到真实的迁移的优势SimtoReal61.4.4.具身智能:仿真到现实迁移从仿真到现实,绝非简单的复制。最大的难题就是
“现实鸿沟”(RealityGap)。无论我们的仿真引擎多么强大,它都只是对现实世界的一种近似。视觉差异虚拟图像的纹理、光照、阴影,与真实摄像头拍到的总有不同“迫切需要发展域泛化的迁移学习技术”仿真到真实的迁移的优势物理差异复杂干扰虚拟引擎中物体摩擦系数、材质弹性、电机响应速度的参数,不可能与真实世界百分百吻合现实世界复杂背景、开放环境SimtoReal71.4.4.具身智能:仿真到现实迁移机器人演示数据人体演示数据打开机柜切割甜椒将胡萝卜放在盘中清洗玻璃专家演示数据用微波炉加热汤将蓝色块放到绿色碗中打开门标注数据只用两根手指握住刀柄视频点云RGB+深度图文本声音触觉模拟数据格式域泛化的迁移学习技术
域适应:域适应使模型能够在不同但相关的数据分布上保持高性能,即从仿真环境迁移到现实环境中。通过识别仿真与现实环境的主要差异,并利用特征对齐等技术来缩小这些差异,帮助模型忽略特定噪声,关注有用特征。
域随机化:引入大量、系统性的随机变化来训练模型,使得模型学习到任务的核心、不变特征,从而将其能力泛化到未曾见过的、但可能属于同一分布范围的目标域(即真实世界或其他新环境)中
SimtoReal81.4.4.具身智能:仿真到现实迁移三部曲(1)域随机化(DomainRandomization)(2)系统辨识与模型校准(3)在仿真中预训练,在现实中微调SimtoReal本章目录1.4.4.具身智能:仿真到现实迁移1.4.5.大模型赋能:感知与任务规划器1.5从具身智能到世界模型1.6具身智能的典型应用110大模型技术得到快速发展1.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身11人类指令→大语言模型(任务规划/常识查询)→可执行的子目标序列→强化学习/模仿学习策略(控制身体执行)大模型负责思考,视觉大模型负责观测,传统学习范式负责精控
的协同范式。大模型分类:大语言模型、视觉大模型、视觉-语言-动作大模型1.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身12定义:VLAs是一种结合了视觉、语言与动作执行的更高级别任务处理框架,旨在结合视觉与语言信息,指导机器人或智能系统完成复杂任务(如清理桌面、拿取物品)。其核心在于其强大的多模态处理能力。VLA模型组成:视觉模块负责解析图像数据,语言模块则理解自然语言指令,动作模块据此生成动作指令并控制机器人执行相应的动作。三者之间通过深度协作与交互,使得模型不仅能理解复杂的场景与指令,还能灵活地执行任务,促进机器人综合能力的全面优化与提升。视觉-语言-动作(VLAs)的基本概念与操作策略1.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身131.2大模型赋能:作为知识库、感知器与任务规划器模式1:先推理再行动,观测与行动交替执行大语言模型负责思考、任务分解与推理,视觉大模型负责观测react:Thelibraryforwebandnativeuserinterfaces.-AtomGit|GitCode大模型与具身14模式2:先整体规划再行动大语言模型负责项目整体规划,大任务拆分为子任务列表;执行智能体可以调用视觉-行为大模型1.2大模型赋能:作为知识库、感知器与任务规划器大模型与具身151.2大模型赋能:作为知识库、感知器与任务规划器指令:打扫房间高级任务规划器
低级控制策略
大模型驱动分层机器人操作过程实例:智能机器人操作任务大模型与具身本章目录1.4.4.具身智能:仿真到现实迁移1.4.5.大模型赋能:感知与任务规划器1.5从具身智能到世界模型1.6具身智能的典型应用117杨立昆对世界模型的定义:包含了4个不可或缺的关键要素,它们共同构成了世界模型的核心功能。这些要素分别是观测(Observation)、状态(State)、行动(Action)和潜在变量(LatentVariable)
。世界模型(WorldModel)是智能体对环境的内部表征与预测框架,通过学习环境的状态转换、物理规律与因果逻辑,实现对未来的推演与反事实推理,从而支撑决策、规划与高效试错,是具身智能与自主决策系统的核心引擎。1.5从具身智能到世界模型世界模型与具身18世界模型演进历程1.5从具身智能到世界模型世界模型与具身192025年6月12日,Meta发布了最新的开源世界模型V-JEPA2,称其在物理世界中实现了最先进的视觉理解和预测,从而提高了AIagents的物理推理能力。世界模型与具身1.5从具身智能到世界模型201.5从具身智能到世界模型杨立昆甚至提出了一个更为宏大的构想,即构建一个“自主机器智能”(AutonomousMachineIntelligence)系统。这个系统包含:世界模型感知模块记忆模块执行模块代价模块。世界模型与具身211.5从具身智能到世界模型世界模型与无人驾驶实例世界模型与具身22自回归大语言模型并非通向“超人智能”的途径,它们尚不具备理解物理世界、持久记忆、逻辑推理和行动规划等“人类水平智能”的关键要素。构建世界模型意味着让AI像人类一样观察世界并理解世界以何种方式演变,然后预测世界将如何随着可能的行动而演变。要想拥有人工智能产业、拥有不带偏见的人工智能系统,唯一的办法就是拥有开源平台,在此基础上,任何团体都可以建立专门的系统。人工智能系统不会成为一个与人类竞争的物种,因为它们没有主宰的欲望。人工智能可以让人类变得更加聪明。图灵奖得主杨立昆最新访谈实录:大语言模型的局限、世界模型、开源、未来希望1.5从具身智能到世界模型世界模型与具身23图灵奖得主杨立昆最新访谈实录:
大语言模型的局限、世界模型、开源、未来希望1.5从具身智能到世界模型世界模型与具身本章目录1.4.4.具身智能:仿真到现实迁移1.4.5.大模型赋能:感知与任务规划器1.5从具身智能到世界模型1.6具身智能的典型应用125无人驾驶项目案例-整体框架没有利用具身概念,具有“感知—理解—决策—控制”的闭环1.5具身智能的典型应用无人驾驶项目案例无人驾驶环境感知与自主规划虚拟仿真实验
1.5具身智能的典型应用具身项目案例服务机器人导航多模态信息智能体行为环境反馈交互输入输出感知硬件感知算法RGB-D摄像头激光雷达臂端摄像头目标检测、视觉分割、视觉预训练感知硬件平台不同类型的服务机器人导航规划算法语义地图、边界跟踪、强化导航算法执行硬件轮式足式复合式行为预测算法轨迹预测、长短期目标预测、智能决策虚拟环境现实环境现实复杂环境
服务机器人项目案例-整体框架27视觉-语言-动作(VLAs)模型操控的具身机器人RoboticsTransformer-1模型2022年12月,谷歌推出了名为RoboticsTransformer1(RT-1)的具身智能模型,这是一种多任务处理模型,能够将机器人的输入和输出动作转换为Token形式,从而提升实时控制。从最上面的抽屉里取出薯片放到柜台上指令图像··1+γβFiLMEfficientNet…TokenLearnerTransformer模式手臂底部动作RT-13Hz1.5具身智能的典型应用具身项目案例视觉-语言-动作(VLAs)模型操控的具身机器人RoboticsTransformer2(RT-2)1.5具身智能的典型应用问:这张照片的内容是什么?答:31142317055244一只灰色的驴在街上行走问:Quepuis-jefaireaveccesobjets?(法语:用这些物品我能做什么)答:31142317055244Fairecuireungâteau(法语:烤一个蛋糕).问:对于<任务>机器人应该如何操作?答:132114128525156
互联网级别的视觉问答+机器人动作数据问:对于<任务>机器人应该如何操作?答:…ViT大语言模型LLM答:132114128525156
逆标记化机器人动作描述用于机器人控制的视觉-语言-动作模型把草莓放到正确位置捡起快要掉下的袋子捡起不一样的东西闭环机器人控制协同微调部署RT2视觉TransformerRT-2在模型设计上进行了重大创新,它将机器人的动作编码成一种独特的文本标记语言,这种创新性的表示方式使得RT-2能够利用互联网级别的庞大视觉-语言数据集进行训练。具身项目案例291.5具身智能的典型应用视觉-动作-语言模型-谷歌PaLM-E2023年,谷歌与柏林工业大学联合开发了一个新的视觉-语言-动作模型,称为为PaLM-E,其模型参数达到562B(Driess,D.,etal2023)。可以把PaLM-E想象成一个拥有“视觉”、“语言”和“动作规划”能力的通用大脑。其核心突破在于:将机器人“看”(视觉)、“想”(语言推理)和“做”(动作)这三项原本分离的能力,融合在一个统一的模型中,可以称之为“具身多模态视觉-语言-动作模型”。具身项目案例30大语言模型(PaLM)遥操作视觉问答,图像描述.......控制答:先抓住黄色积木并且:..PaLM-E:具身多模态模型给定:<嵌入>......<图片>问:如何抓住黄色积木?
答:先抓住黄色积木任务与动作规划人:把抽屉里的绿色玉米片拿给我。具身智能体:①.走到抽提前②.打开上面的抽屉。从抽屉里拿出绿色的玉米片。我看见了<图片>③.从抽屉中抓取玉米片,并把它放在台面上给定:<图片>,问题:图里有什么,并用表情符号回答。描述一下:<图片>,问题:一只狗在犬展览会上跳过障碍纯语言任务这是一个关于具身自然语言的俳句:自然语言模型是自然语言的未来桌面操控给定:<嵌入>问:如何抓取蓝色积木?答:先抓住黄色积木放到桌面上,再抓取蓝色积木给定:<图片>任务:把不同颜色的物体拖到各个角落。步骤1:把绿色星形推到左下角步骤2:把绿色圆形推到绿色星形旁边问:迈阿密海滩毗邻的是哪个海洋?答:大西洋问:372×18等于多少?答:6696在机器人传感器上数据训练的语言模型可用于指导机器人的行动1.5具身智能的典型应用具身项目案例31/video/BV1A
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 关于礼仪礼貌的试题及完整答案
- 七年级英语下册 Unit 6 I'm watching TV Section B第5课时(3a-3b)教案 (新版)人教新目标版
- 2026年机关单位工作总结范文写作课件
- 了解企业“7S”管理制度教学设计中职专业课-化学工艺-分析检验技术-生物与化工大类
- 2026年北师大版高中物理选修3-3原子物理课件
- 2026泉州鞋服行业产业链供应链优化及品牌国际化战略研究
- 2026年人教版初中物理九年级上册第8章电学课件
- 2026中国新能源金融衍生品开发与交易机制设计研究报告
- 2026欧洲生物科技行业市场现状供需调研及研发投入分析发展咨询报告
- 2026汽车智能导航系统技术发展前沿与产业分析
- 2026年秋季开学:中学开学第一课 预防近视科学用眼
- 2026年无锡市新吴区农村订单定向培养医学生招聘19人考试参考题库及答案详解
- 2026年库车市招聘市属国有企业工作人员(62人)笔试模拟试题及答案详解
- 2026年南疆能源(集团)有限责任公司招聘(42人)笔试模拟试题及答案详解
- 2026年新教材外研版九年级上册英语期末复习:Unit 1-6共6套 单元提升测试卷汇编(含答案)
- 2026年高考广西卷物理高考真题(解析版)
- 配电箱日常维护检查手册
- 17 Oracle基础 - DML和DDL综合案例
- 2025届天津市河西区七年级上学期历史单元测试题
- 2026年肉牛养殖数字化技术与市场竞争力报告
- 牧场安全培训课件
评论
0/150
提交评论