智能系统(从具身智能到世界模型)【第一讲】_第1页
智能系统(从具身智能到世界模型)【第一讲】_第2页
智能系统(从具身智能到世界模型)【第一讲】_第3页
智能系统(从具身智能到世界模型)【第一讲】_第4页
智能系统(从具身智能到世界模型)【第一讲】_第5页
已阅读5页,还剩49页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

智能系统:从具身智能到世界模型(第一讲)肖亮1南京理工大学计算机科学与工程学院(人工智能学院)江苏省生成式AI与应用研究生暑期学校23问题与导读2024-2025年,机器人和生成式AI(GPT、Sora,DeepSeek),是全世界最大的热点。其中通用人形机器人作为通用AI最好的载体,热火朝天。知名机器人网站TheRobotReport整理了北美机器人市场年度九大热点话题,其中超过一半涉及人形机器人,而宇树作为唯一一家中国企业,名列其中4问题与导读51950年图灵在《ComputingMachineryandIntelligence》的论文中首次提出具身智能(EmbodiedIntelligences)的概念,并展望了两条人工智能的发展之路:一种是基于逻辑与符号的系统,通过编程直接模拟人类思维,可称为“离身智能”;另一种则是模仿儿童学习的过程,让机器从简单的初始状态出发,通过与环境和教育的互动来塑造智能——这被视为后来“机器学习”与“具身智能思想的雏形“

过去5.4亿年,地球所有生物智能是基于身体作用于世界的行为所塑造出来问题与导读6主动猫具身智能被动猫离身智能1963年具身认知实验,主动猫学会了正常行为,但被动猫失去行为能力离身智能(Embodied

AI)缺少身体体验,无法支持机器人智能行为Held,

R.,

&

Hein,

A.

(1963).

Movement-producedstimulation

in

the

development

of

visually

guided

behavior.

JournalofComparativeandPhysiologicalPsychology问题与导读7具身智能机器人本体反馈进化驱动载体基于身体,理解物理世界,并与物理世界互动达成人类需求的智能系统问题与导读8问题与导读本章目录1.1具身智能:物理世界中的智能体1.2具身智能:感知与融合1.3具身智能:运动规划与控制1.4具身智能:学习范式1本章目录1.1具身智能:物理世界中的智能体1.2具身智能:感知与融合1.3具身智能:运动规划与控制1.4具身智能:学习范式1111.1具身智能-物理世界中的智能体什么是具身智能

具身智能是拥有物理身体,并能通过感知-行动闭环与物理世界进行实时、主动交互,以实现自主任务目标的智能系统。强调本体与世界的物理交互感知-行动

形成闭环:感知环境->大脑(模型)处理并决策->身体执行动作->动作改变环境/自身状态->获得新的感知…操纵空间的物体触觉、力感等反馈理解物体的物理属性情境适应性

具身智能体不能只会执行固定脚本,必须能理解所处情境(上下文),并灵活调整策略。特征(1)具身智能系统的物理载体或实体结构具身智能系统与物理世界交互的基础平台本体承载智能行为特征(2)特征(3)特征(4)121.1具身智能-物理世界中的智能体概念厘清:具身智能与智能体的区别智能体:是一个抽象的、普适性的模型和概念框架。它描述了一种“智能”的通用范式,即“感知-决策-行动”的循环。它可以在任何环境中(物理或虚拟)被实例化。离身智能:离身智能是智能体在虚拟或抽象领域中的一种主要实现形式。它强调智能可以脱离具体的物理形体,通过处理符号、数据或信息来独立体现。智能体现在其强大的推理、生成、预测或模式识别能力上,而非物理交互中。具身智能:是智能体概念下的一个关键子集或实现路径。它特指那些必须通过物理身体与真实世界进行实时、动态交互才能学习和体现智能的智能体。其核心是

“具身性”。什么是具身智能什么是具身智能1.1具身智能-物理世界中的智能体普适应概念智能体传统AI概念离身智能体具身AI核心载体具身智能体是否具有“具身性”纯数字环境(数据、仿真、网络)数据驱动与模式匹配(数据、模型、算法)处理符号与信息处理任务(生成、预测、推理)真实物理环境(具象、连续、多模态)依赖物理交互与体验(物理常识、多模态感知)完成物理空格键任务(定位、导航、操控等)具身智能离身智能(当前主流AI学习方式)标签盒子人类告诉我长这样子是盒子(“标签”学习)什么是“盒子”亲身体验盒子是什么可以打开,可以装东西9具身智能:具有身体体验智能141.1具身智能-物理世界中的智能体什么是具身智能15具身智能主要研究的科学问题:大脑层面:理解物理世界与人类行为常识小脑层面:克服感知,交互,本体不确定性通用任务执行进化层面:系统在实体世界交互中持续进化1.1具身智能-物理世界中的智能体什么是具身智能PIE(感知-想象-执行)方案具身智能PIE框架(Since

2016):与人类认知对于的模块化,标准接口具身感知(Perception)具身想象(Imagination)具身执行(Execution)大脑功能(世界理解与抽象)小脑功能(具象执行)161.1具身智能-物理世界中的智能体什么是具身智能17问题:离身智能+机器人是否能达成具身智能效果?回答:不能原因1:离身智能考虑身体联合优化;原因2:离身智能没有与实体世界交互进化的能力;原因3:离身智能和具身智能理解世界的方式不一样;但是,离身智能学习到知识可以成为加载到具身智能成为初始知识读万卷书,行万里路!1.1具身智能-物理世界中的智能体

提问总结本章目录1.1具身智能:物理世界中的智能体1.2具身智能:感知与融合1.3具身智能:运动规划与控制1.4具身智能:学习范式119多模态感知1.2具身智能:感知与融合视觉:光敏传感器等

摄像头、激光雷达、深度相机、事件相机听觉:声敏传感器味觉:味敏传感器嗅觉:气敏传感器触觉与力觉感知本体感知20视觉(摄像头、激光雷达等)是机器的“眼睛”,赋予其观察和辨识环境的能力,那么触觉感知就是为机器装上“皮肤”和“指尖”,使其获得与物理世界互动和理解的关键感官。它让机器能够通过直接接触,感知并理解物体的丰富物理特性,从而完成从“看见”到“安全、灵巧操作”的跨越。例1.1特斯拉人形机器人(TeslaBot)1.2具身智能:感知与融合多模态感知从视觉到触觉RGB-D摄像头激光雷达臂端摄像头211.2具身智能:感知与融合多模态感知表1.1给出了触觉感知的若干举例和说明感知维度人类感知举例对具身系统的价值力与压力抓、握、推、捏等力度实现力控操作,防止捏碎物体或抓握不稳。纹理与形状表面粗糙度和凹凸感识别物体表面特征与材质,辅助物体辨识与精细操作。滑动检测滑脱感实时预警,触发抓握力调整,防止操作失败。温度冷、温、热判断物体材质状态(如金属/塑料、冷/热),保障交互安全。柔软度/粘度柔软度、硬度、粘性理解物体力学属性,实现适应性变形抓取。

触觉与力感22表1.2不同触觉传感器传感器基本原理核心输出主要优势主要劣势应用场景Gelsight光学形变(视觉)超高分辨率3D几何图像细节丰富,直观,纹理识别强易磨损,动态响应慢,体积较大,难以微型化工业检测,触觉研究AllSight光学形变(视觉)高分辨率3D触觉图像结构紧凑,耐用,易集成主要提供几何形变信息,直接测量三维力的能力有限;成本较高;存在皮肤磨损问题。机器人灵巧操作Digit光学形变(视觉)高分辨率2D/3D触觉图像小型化,开源,低成本分辨率和耐用性低;开源方案需要用户自行维护校准流程,性能可能因设置而异;惧怕尖锐物体和污渍。灵巧手研究,算法开发XELAuSkin磁传感三维力矢量、振动、滑动多模态力觉,动态响应好空间分辨率较低:

无直接视觉纹理信息;

数据处理复杂:需要从磁信号反算三维力,算法复杂。机器人全身皮肤、精细力控抓取、滑动检测

1.2具身智能:感知与融合多模态感知231.2具身智能:感知与融合多模态感知24本体感知(Proprioception)是指智能体对自身状态和运动的感知能力,这种能力在具身智能系统中起到至关重要的作用1.2具身智能:感知与融合

本体感知:具身系统的重要概念源自拉丁语"proprius"(自己的)和"capere"(感知),意为"感知自身"。人体通过感知肌肉、肌腱和关节的运动与位置变化,了解自身在空间中的位置、姿势和运动状态的能力。根据Sherrington(1906)的经典定义

本体感觉是"由身体自身产生的感觉",区别于视觉、听觉等外部感官输入。现代神经科学进一步扩展了这一定义,认为本体感觉是一种复杂的多模态感觉,整合了来自肌肉、关节、肌腱以及皮肤的机械感受器的信息。多模态感知25总结2方法传感器视觉、听觉、味觉、嗅觉触觉-力觉本体感知多模态融合需要解决:多模态传感器采集信号的时空对齐与融合;需要将感知与任务的深度融合;需要具备主动感知,即为“做”而“看”,在“动”中“知”;模型-数据驱动智能提升物理AI系统创新关键器件与系统优化对齐与融合方法多模态融合传感器配置与选型1.2具身智能:感知与融合通过一个多感官融合的、主动的、与任务目标紧密耦合的感知系统,来破译物理世界的“密码”,并将这些实时解读转化为精准、自适应、可学习的行动。本章目录1.1具身智能:物理世界中的智能体1.2具身智能:感知与融合1.3具身智能:运动规划与控制1.4具身智能:学习范式127研究问题1.3具身智能:运动规划与控制问题:具身智能如何通过多模态感知来“理解”世界。然而,理解世界只是第一步,真正的挑战在于

“作用于世界”

。如何将抽象的“任务目标”,转化为身体一连串精确、协调、安全的动作?这就是运动规划与控制要解决的核心问题。1.运动规划:解决的是

“做什么”

“从哪儿走到哪儿”

的宏观问题。2.运动控制:解决的是

“如何精确地做”

的微观问题。它接收规划器给出的路径或目标点指令,通过实时计算和调整机器人的关节扭矩、电机电流等底层参数,驱动机器人的身体准确地、稳定地跟踪这条路径或抵达该目标。控制的核心是稳定性、精确性与抗干扰能力。281.3具身智能:运动规划与控制1.经典控制思想源于PID控制方法PID控制29PID控制基本原理1.3具身智能:运动规划与控制PID控制302.零力矩点与双足机器人平衡控制概念:零力矩点(ZMP)是动力学中的一个概念,特指在机器人足底与地面接触平面上的一个点,在该点上,地面反作用力对水平轴(x轴和y轴)产生的净力矩为零。基本规则:只要确保ZMP这个点,始终落在双脚构成的支撑多边形这个“安全区”内,机器人就能保持稳定不摔倒。它将机器人复杂的多体动力学平衡问题转化为一个更简单的几何问题:1.3具身智能:运动规划与控制ZMP平衡控制313.本体惯性导航本体惯性导航的核心目标:通过内部传感器(如加速度计、陀螺仪)测量物体的加速度和角速度,推算物体在三维空间中的位置、速度和位姿,而不依赖外部参照。在具身系统中,本体惯性导航不仅是“推算位置和姿态的技术”,更是系统实现

“本体感知”

“自我状态认知”

的核心生理基础。本体惯性导航1.3具身智能:运动规划与控制321.3具身智能:运动规划与控制本体惯性导航本章目录1.1具身智能:物理世界中的智能体1.2具身智能:感知与融合1.3具身智能:运动规划与控制1.4具身智能:学习范式1341.4具身智能:学习范式具身系统的学习的任务描述:如何让具身系统学习人类的行为和动作,从而完成复杂的任务?感知环境和状态生成动作与行为任务目标35具身系统的学习面临三重核心约束:数据获取成本极高奖励信号稀疏且延迟。物理仿真的“现实鸿沟”具身学习1.4具身智能:学习范式物理交互环境复杂动态输入听说看交互理解智能是具身化和情景化的,具身智能可通过与真实世界的交互完成任务智能体36强化学习—在试错中探索世界法则1.4具身智能:学习范式强化学习37强化学习框架:是一种通过智能体与环境交互来学习最优策略的方法。在具身智能中,智能体通过执行动作并接收环境反馈(奖励或惩罚)来优化行为,从而不断尝试新的动作组合以最大化累积奖励。

1.4具身智能:学习范式强化学习奖励状态动作环境智能体381.4具身智能:学习范式模仿学习具身智能的学习框架:模仿学习假设存在一个专家智能体,其策略可以看成一个理想的最优策略,那么具身智能体就可以通过模仿这个专家在环境中交互的状态动作数据来训练一个策略,并且不需要用到环境提供的奖励信号。这类方法我们称之为模仿学习。与强化学习不同,它是一种通过观察专家演示来学习行为的方法。39

具身智能的学习框架:模仿学习典型的模仿学习方法包括:行为克隆(BehaviorCloning,BC)逆强化学习(inverseRL)生成对抗模仿学习(GenerativeAdversarialImitationLearning,GAIL)模仿学习1.4具身智能:学习范式40具身智能的学习框架:模仿学习1.4具身智能:学习范式模仿学习41

模仿学习1.4具身智能:学习范式421.4具身智能:学习范式具身智能的学习框架:行为克隆(直接复制“招式”)行为克隆中的复合误差问题:智能体在测试时一旦因微小误差偏离了专家演示过的轨迹,就会进入“陌生”状态,由于没有学习过在此状态下的应对策略,可能做出错误动作,导致误差不断累积,最终彻底失败。模仿学习43克服行为克隆缺陷的一种改进方法:

DAgger(DatasetAggregation)-数据增广的行为克隆方法基本思想:基于在线学习

(OnlineLearning)的算法,其把行为克隆得到的策略与环境不断的交互,来产生新的数据。在这些新产生的数据上,DAgger会向专家策略申请示例;然后在增广后的数据集上,DAgger会重新使用行为克隆进行训练,然后再与环境交互;这个过程会不断重复进行。由于数据增广和环境交互,DAgger算法会大大减小未访问的状态的个数,从而减小误差。【见算法1.1】模仿学习1.4具身智能:学习范式441.4具身智能:学习范式模仿学习例1.5:NVIDIA通过模仿学习训练自动驾驶模型记录转向角调整换挡和旋转随机换挡和旋转机左摄像机中心摄像机右摄像机卷积神经网络(CNN)反向传播算法权重调整期望的转向指令误差训练过程45例1.5:NVIDIA通过模仿学习训练自动驾驶模型卷积神经网络(CNN)中心摄像机线控驾驶系统接口转向指令模型推理推理过程1.4具身智能:学习范式模仿学习46逆强化学习:从专家策略中学习奖励函数的无监督方法1.4具身智能:学习范式模仿学习强化学习是在已知奖励函数的情况下,通过最大化累积奖励来学习最优策略。与经典强化学习不同,逆强化学习旨在解决一个根本问题:在许多复杂任务中,我们难以甚至无法手动设计一个精确、有效的奖励函数。

逆强化学习的思路是,既然我们拥有专家(如人类司机、顶尖棋手、娴熟技师)的演示数据,那么其中必然蕴含着专家对任务的理解和评判标准。因此逆强化学习的核心任务,就是从

“专家行为(轨迹)”

反向推导出那个隐含的、能促使专家产生如此行为的

“奖励函数”(AndrewY.Ng,2000)47IRL算法通常具有一个双层优化机制(1)奖励学习:调整奖励函数的参数,使得在该奖励函数下,专家演示的轨迹比智能体自己生成的轨迹获得显著更高的累积奖励。(2)策略优化:给定当前猜测的奖励函数,利用强化学习算法训练出一个最优策略。专家示范策略状态动作逆强化学习(IRL)奖励函数(R)强化学习(RL)策略模型逆强化学习模仿学习1.4具身智能:学习范式48强化学习vs.逆强化学习维度强化学习(RL)逆强化学习(IRL)核心目标学习最优策略(policy)以最大化累积奖励。从专家示例中还原奖励函数(rewardfunction),并隐含地学习策略。输入环境模型(或可交互环境)、奖励函数。专家演示数据(通常为状态-动作序列)、环境模型(可选)。输出最优策略(π*)。奖励函数(R),有时伴随一个策略。关键假设奖励函数是已知且明确的,智能体通过试错学习。奖励函数是未知但隐含于专家行为中,专家行为是最优或接近最优的。问题本质控制/优化问题:如何行动以最大化累计回报。逆向推断问题:什么样的奖励函数能解释观察到的行为。训练数据在线生成(与环境

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论