具身智能导论-课件 第1-5章 绪论、具身智能的硬软件平台-具身智能大模型_第1页
具身智能导论-课件 第1-5章 绪论、具身智能的硬软件平台-具身智能大模型_第2页
具身智能导论-课件 第1-5章 绪论、具身智能的硬软件平台-具身智能大模型_第3页
具身智能导论-课件 第1-5章 绪论、具身智能的硬软件平台-具身智能大模型_第4页
具身智能导论-课件 第1-5章 绪论、具身智能的硬软件平台-具身智能大模型_第5页
已阅读5页,还剩521页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1普通高等教育新工科具身智能系列教材具身智能导论第一讲绪论目录00教材和课程特点01具身智能的起源与概念02典型的具身智能框架03主要研究内容04本章小结2教材基本信息书名《具身智能导论》作者秦建军、江磊、刘宇飞、邢伯阳、王陆旸、李国通编著出版机械工业出版社,2026定位具身智能、机器人工程、人工智能等本科/研究生专业/微专业教材3组织编制国家地方共建人形机器人创新中心为什么需要学习具身智能产业发展数字智能走向物理智能“十五五”规划将具身智能列入未来产业中国制造推动人形机器人开始量产中国人形机器人取得瞩目成就人才培养典型交叉学科、重视全栈能力培养具身智能专业和现有专业的能力要求既懂理论,更要会仿真和真机开发课程要求辨析与其他课程的联系和区别建立基本知识框架掌握具身智能的基本思路具备初步的动手实践部署4本书的特点01体系完整从起源概念到综合实践,11章内容对应到不同的具身智能主流话题02实践导向主要章节实践案例+三个综合实践(机械臂、NanoLoong小人形、G1全尺寸人形)03与时俱进RT-X、Helix、GR00T、Dreamer、LeRobot等当下流行思路04灵活选用教师可按学时裁剪,推荐32-48学时讲授,综合实践案例可用于1-2周的综合实验5全书结构:正文11章+附录1绪论2硬软件平台3强化学习4遥操作与模仿学习5具身大模型6导航与规划7VLA模型8世界模型9虚实迁移10具身数据与采集训练11综合实践附录AOpenLoong开源社区BHuggingFace/LeRobotC仿真软件安装本书未对AI和机器人基本知识做展开介绍,可根据学校实际进行补充6目录00教材和课程特点01具身智能的起源与概念02典型的具身智能框架03主要研究内容04本章小结2801具身智能的起源与概念1具身智能的起源与概念1.1.1图灵对AI路径的思考(1950)路径A抽象计算与推理,类似下棋的纯符号智能后来数十年的AI主流,如逻辑推理、知识工程、智能搜索到当下的大语言模型路径B给机器配备传感器,像婴儿一样与物理世界互动学习受传感器/执行器/算力限制被搁置,直到当下的具身智能取得实质性突破101具身智能的起源与概念1.1.1幼猫转盘实验(1963)“幼猫转盘”实验示意图赫尔德和海因‌(Held&Hein)•黑暗饲养三个月的幼猫后放入特制圆筒环境•一只走主动行走,一只坐篮中被动跟随•只有主动行走的幼猫发育出正常视觉导航结论:智能形成依赖于身体与环境的主动交互,而非被动接收信息111具身智能的起源与概念1.1.1“缸中之脑”思想实验(1981)“缸中之脑”思想实验示意图希拉里·普特南(HilaryPutnam)《理性、真理与历史》大脑被放入营养液缸中,由计算机通过电极模拟感觉输入大脑误以为自己仍在真实世界“离身感知可被伪造”、AI大模型再强,也不等于真正理解物理世界121具身智能的起源与概念1.1.1无需表征的智能罗德尼·布鲁克斯(RodneyBrooks):AI的行为主义AI并非必须依赖复杂的内部世界模型,可以通过智能体与环境的直接交互逐层涌现时代背景:20世纪80年代末至90年代初,AI第二次低谷核心主张:AI分布在身体、环境与相互作用中后续理论:普费弗和谢尔(Pfeifer&Scheier)系统阐述形态、环境与控制的耦合,二人提出的理论后来被称为“身体化智能”(Embodiedintelligence)13Brooks开发的Genghis

爬虫机器人1具身智能的起源与概念1.1.1从数字智能到具身智能宇树人形机器人在马年春晚表演群体武术轮臂和人形机器人开始能量产交付宇树G1:2025年量产交付智元:同年交付量突破5000台Figure02集成Helix,进入BMW工厂测试波士顿动力Atlas电动版将量产具身智能和人形机器人时代未来已来141具身智能的起源与概念1.1.2具身智能的定义定义具身智能(EmbodiedArtificialIntelligence,EAI)是指智能体通过机器人、无人系统等物理实体与环境交互,实现感知、认知、决策和行动一体化,从而具备自主推理、运动和操作能力的人工智能形态。具身智能的框架示意图具身智能的三要素:①物理实体②多模态感知③感知-认知-决策-行动的闭环151具身智能的起源与概念三要素①物理实体青龙

Wheel

轮臂机器人具身智能必须具有存在于物理世界的实体轮式机器人:平面物流、巡检,移动效率高人形机器人:非结构化地形,适应人类的生活和工作环境双臂/灵巧手:在特定的场景中具有综合优势16青龙Wheel(威龙):由国地中心开发包括:移动底盘、可升降躯干、双7自由度机械臂等,配备了RGB-D/激光雷达1具身智能的起源与概念三要素②多模态感知环境的能力Dactyl

解魔方项目给机械手设置的干扰OpenAIDactyl项目与ChatGPT并行开展的项目具备感知环境和抗扰动能力具身感知典型问题:•在哪里•什么状态•能否交互•如何交互171具身智能的起源与概念三要素③感知-认知-决策-行动闭环银河通用G1自主识别并抓取药品闭环意味着什么感知和决策还不够,还需要通过行动反馈来并应对变化。闭环=反馈+试错+学习181具身智能的起源与概念三要素缺一不可缺物理实体智能无法作用于现实世界。缺环境交互无法获得真实反馈,需要第一人称的反馈。缺闭环机制难以持续学习与进化。大模型算具身智能吗?——缺物理实体与真实闭环,可以成为具身智能的“大脑”19目录00教材和课程特点01具身智能的起源与概念02典型的具身智能框架03主要研究内容04本章小结22002典型的具身智能框架2典型的具身智能框架2.1虚实迁移Sim-to-Real宇树H1人形机器人在仿真环境中训练可以分为如下三步:•人类示范/模仿学习•高保真仿真中强化学习•虚实迁移,部署到真机Sim-to-Real的Gap:重定向简化、传感器噪声、接触参数、动力学不一致等22Sim-to-Real:先在仿真器中学习训练再迁移到真机2典型的具身智能框架2.2视觉-语言-动作模型(VLA)RT-2框架(局部)VLA是一种端到端大模型框架海量图文视频预训练→机器人示教微调→生成动作Token,与视语言统一建模能执行训练集里未写死的新指令。开放任务/自然交互/跨场景是它被追捧的原因。局限:实时性、数据、安全232典型的具身智能框架2.3世界模型WorldModelDreamer世界模型基本思路学习环境状态的演化规律,形成潜在状态,再在潜空间预演动作后果Dreamer结构VAE+RSSM、在想象里做Actor-Critic价值提高样本效率和训练安全性,为长时序决策、反事实推演和因果推理提供了基础。242典型的具身智能框架2.4快/慢系统框架Helix模型的快/慢系统框架System2(慢系统,7–9Hz)负责“做什么/为什么”System1(快系统,200Hz)负责“如何稳定及时做出来”以杯子抓取为例:S2识别任务与策略制定,S1负责关节动作与动态调整252典型的具身智能框架2.5“大脑-小脑-肢体”框架“大脑-小脑-肢体”框架示例

(国家地方共建人形机器人创新中心)大脑·秒级多模态大模型:语言、空间、意图、分层规划、错误反思小脑·10–100ms技能与全身协调:模仿学习、双臂协作、稳定行走肢体·毫秒级物理交互:感知输入+动作输出+分模块安全26青龙机器人动态调整动作2典型的具身智能框架五种框架对照表框架主要特点虚实迁移节省真机试错时间和成本、提高训练效率VLA视觉识别+大语言模型世界模型如何预演再行动快/慢高层规划vs实时控制大脑-小脑-肢体仿生路线,普通大众好理解27目录00教材和课程特点01具身智能的起源与概念02典型的具身智能框架03主要研究内容04本章小结22803具身智能的主要研究内容3具身智能的主要研究内容本书总结了八个相互联系的方向1具身感知与环境理解2表征、环境建模与认知3任务规划与行为决策4运动控制与操作技能5具身学习与能力泛化6语言交互与高层任务解析7系统集成、仿真与应用安全8场景落地与产业应用具身既是智能问题,也是机器人问题。CS和AI同学别只盯模型,机械专业别只盯本体,机器人专业别只注意机器人和控制293具身智能的主要研究内容从感知到内部世界(1)具身感知与环境理解关注机器人在哪里、处于何种状态、是否可以交互、如何交互。抓取时还要感知位姿、几何、材质、接触与抓取区域。代表性关键词:多模态融合、三维场景感知、动态跟踪、接触状态、身体姿态估计。(2)表征、环境建模与认知把碎片感知结构化为可理解、可推理、可预测的内部表征。不仅是“是什么”,还有“在哪里”“如何联系”“会怎样变化”。世界模型是这一方向的当代前端:让系统在内部学习环境演化,减少真实世界里的盲目试错。303具身智能的主要研究内容从决策到身体动作(3)任务规划与行为决策任务是链条不是单动作:移动、搜索、抓取、搬运、放置彼此关联。决策必须在闭环中生成—判断—修正—再执行。目标是从任务目标映射到具体行为序列。包括:经典规划/学习策略/分层混合。(4)运动控制与操作技能如何让人形机器人能够稳定、跟踪、避障和适应复杂地形。机械臂和灵巧手的位/力控控制,抓取、装配、工具使用等实际任务能力。需要环境、目标一起变化时具备柔顺鲁棒性。313具身智能的主要研究内容学习泛化与动作词元(5)具身学习与能力泛化从专用策略走向通用能力。包括监督、模仿、强化、自监督、迁移学习等。挑战包括:Sim-to-Real差距、样本效率、跨场景泛化实体部署成本·物理安全。(6)语言交互与高层任务解析智能体如何理解自然语言指令、结合场景信息实现语言指令的物理实现,把握人的意图,并将抽象的语言要求转化为可执行的行为过程。多模态大模型与VLA给了新动力,但可靠具身能力仍须与实时感知、控制、反馈深度耦合。323具身智能的主要研究内容系统、安全与场景落地(7)系统集成、仿真验证与应用安全算法正确≠系统可用。如何把本体、传感器、计算平台、软件栈和场景做软硬件深度适配。EAI导致的错误有物理不可逆性。安全与伦理比推荐系统更突出。(8)人机协作与场景落地机器人如何在工业制造、物流配送、家庭服务等场景中与人共同完成任务,并在协作过程中体现出安全、自然、可信和高效的行为特征。如何把具身智能转化为新质生产力,而不是停留在实验室演示。33目录00教材和课程特点01具身智能的起源与概念02典型的具身智能框架03主要研究内容04本章小结2本章小结起源图灵的思考、幼猫转盘、缸中之脑、Brooks行为主义、具身智能定义三要素:物理实体、环境交互、感知-认知-决策-行动的闭环框架虚实迁移/VLA/世界模型/快慢系统/大脑-小脑-肢体等研究具身智能的研究方向众多,能够辨析具身智能的代表性研究领域34普通高等教育新工科具身智能系列教材具身智能导论第2章具身智能的硬软件平台国家地方共建人形机器人创新中心组织编写“君子生非异也,善假于物也。”——荀子《劝学》具身智能的能力上限受到物理实体、传感器、控制与计算架构的严格约束。算法只有落在具体硬件与软件平台上,才能转化为稳定、可靠、可部署的实际系统能力。37学习目标01具身本体了解机械臂、移动操作机器人、人形机器人、四足机器人的结构特点与应用场景;能比较自由度、负载、重复定位精度与工作半径。02外部感知了解IMU、LiDAR、深度相机的测量原理,以及多传感器融合在定位、建图与避障中的作用。03控制方法了解基于模型的控制,以及学习和数据驱动控制的基本思想。04软件仿真了解Gazebo、MuJoCo、NVIDIAIsaac等仿真器的定位和差异,能够按任务选择。05平台搭建基于开源硬件与软件工具,搭建可运行的具身智能实验平台。38本章目录2.1典型的具身本体2.2外部感知2.3控制方法2.4软件仿真器2.5开源机械臂案例2.6小结3901典型的具身本体具身智能导论·第2章2.1典型的具身本体承载传感器、执行动作、与环境接触,是感知—决策—行动闭环中的物理载体。41典型的具身智能本体有哪些?机械臂、移动操作机器人、人形机器人、四足机器人、末端执行器…本体的作用2.1.1机械臂:最基础、最广泛的具身本体模拟人类手臂的结构与功能,可在三维空间执行抓取、搬运、组装等任务在具身智能开发中常用于强化学习、模仿学习和任务规划研究机械臂的核心要求:在灵活性的前提下兼顾工作精度与安全性全球工业机器人的保有量42机械臂结构形式:按连接方式与自由度划分空间6自由度=3个位置维度+3个姿态维度(横滚/俯仰/偏航)串联机械臂SerialManipulator关节依次串联形成链式结构。工作空间大、灵活性高,但刚性相对较低,易受累积误差影响。并联机械臂ParallelManipulator多个支链并联连接到末端平台。刚性与精度高,但工作空间相对较小。43串联机械臂①:笛卡儿机械臂结构由三个相互垂直的平移关节组成,机构直观、路径易描述。特点和应用结构简单、适合直线运动;典型应用包括3D打印机中的定位系统,易于控制。44串联机械臂②:关节型机械臂结构由多个旋转关节组成,通常为3~7自由度。喷涂、焊接、装配、打磨等工业场景7自由度冗余机械臂更适合避障和灵活操作,因此广泛用于具身智能。45应用为什么串联机械臂广泛用于具身智能开发?开发灵活、工作空间大,便于集成传感器与部署学习算法;人形机器人的上肢也普遍采用串联结构。串联机械臂③:SCARASCARA(SelectiveComplianceAssemblyRobotArm):选择顺应性装配机械臂。是关节型机械臂的一种具有三个旋转关节和一个平移关节,专为平面装配设计。XY方向具备柔顺特性,Z方向具备高刚性。常用于电子零部件装配、物料搬运以及汽车、食品等领域。46并联机械臂:高刚性、高精度、较小工作空间多个支链并联连接到末端平台优势:高刚性、高精度局限:工作空间较小典型Delta并联机械臂适用于高速拾取和放置,并已用于食品包装等领域Delta并联机械臂47机械臂选型的重点01自由度决定运动灵活性;具身智能研究以6/7自由度为主。02负载能力末端可承受的最大负载,含末端执行器和物体质量。03重复定位精度多次到达同一位置的一致程度。04工作半径末端可达空间范围的半径。05最大速度/加速度描述机器人运动快慢与动态响应上限。06关节类型主要包括旋转关节R和移动关节P。48参数1:自由度(DOF)定义确定机构运动构型所需的独立运动参数数目,决定机械臂的运动灵活性。空间6自由度x位置y位置z位置横滚姿态俯仰姿态偏航姿态为什么需要7自由度冗余机械臂7自由度冗余机械臂更适合避障和灵活操作,因此在具身智能领域应用广泛。49参数2:负载能力定义机械臂末端能够承受的最大负载,包括末端执行器及所操作物体的质量。末端负载的组成末端执行器+操作物体≤额定负载典型具身智能机械臂的负载FrankaEmikaPanda:负载能力3kg,适用于轻型协作任务。部分机械臂的负载能力UR3e:3kg、Research3:3kg、IRB360:3kgLBRiiwa14:14kg、GEN3:4kg50参数3:重复定位精度定义在相同条件下,机械臂从同一方向多次重复到达同一目标位置时,各次实际到达位置之间的一致程度。多次到达位置越集中,一致程度越高工业机械臂精度通常为0.01~0.1mm典型机械臂的精度数值ABBIRB120:0.01mmUR3e:0.03mmResearch3:0.1mmIRB360:0.1mmLBRiiwa:0.15mmGEN3:0.15/0.1mm51参数4:工作半径定义机械臂末端在给定构型下能够达到的空间范围的半径,通常由臂长与关节运动范围共同决定。abbirb120机械臂的工作半径为580mm典型机械臂的工作半径UR3e:500mmResearch3:855mmIRB360:1130mmLBRiiwa14:820mmGEN3:891/902mm52参数5:最大速度与最大加速度最大速度额定负载下,机械臂末端或各关节所能达到的线速度或角速度的最大值。最大加速度额定负载下,机械臂末端或各关节在单位时间内速度变化量的最大值。KUKAiiwa机械臂最大速度为2m/s53参数6:关节类型R关节|旋转关节绕轴线转动。P关节|移动关节沿轴线平动。机械臂的主要关节类型包括旋转关节(R)、移动关节(P)等54部分机械臂的主要参数及应用55参数须根据任务匹配,例如VLA开发实验优先选择高精度、中低负载的协作臂。运动学分析基础正运动学ForwardKinematics给定关节变量,计算末端执行器的位置与姿态,如可采用改进D-H参数法描述连杆坐标系关系。逆运动学InverseKinematics给定末端位置,求解关节变量。通常是非线性的,可能存在多个解,可采用几何法或雅可比矩阵等方法。56正运动学:关节参数→末端参数|逆运动学:末端参数→关节参数具身智能中的意义:路径规划:机械臂与人形机器人可通过运动学分析生成可执行的空间路径。学习轨迹生成:可通过逆运动学生成用于学习的关节轨迹,作为训练或示教数据。在科研和工程中,可借助MATLAB、ROS、Python库(如ikpy)等完成相关计算。正运动学:改进D-H参数法1955年,Khalil和Kleinfinger提出改进的D-H参数法。连杆坐标系{i}建立在第i关节的轴线上。通过4个D-H参数描述相邻连杆的几何关系:aᵢ₋₁、αᵢ₋₁、dᵢ、θᵢ。连杆i−1的结构参数57D-H参数①②:连杆长度aᵢ₋₁与扭角αᵢ₋₁aᵢ₋₁:连杆长度关节i−1的轴线与关节i的轴线之间的公垂线长度。αᵢ₋₁:连杆扭角关节i−1轴线与关节i轴线之间的夹角,方向遵循右手定则。若两轴线平行,则αᵢ₋₁=0。58D-H参数③④:偏距dᵢ与关节角θᵢ相邻连杆之间的关系dᵢ:连杆偏距公垂线aᵢ₋₁与关节i轴线的交点到公垂线aᵢ与关节i轴线交点之间的距离。θᵢ:关节角连杆i相对连杆i−1绕轴线i的旋转角度。594个D-H参数放在同一几何关系中相邻连杆之间的关系60齐次变换矩阵统一描述物体在三维空间中的旋转和平移操作坐标系{i}相对于坐标系{i−1}的变换矩阵可写成旋转与平移的连续组合。D-H矩阵把相邻连杆坐标系之间的旋转和平移统一为一个4×4齐次变换。式中:aᵢ₋₁:连杆长度,αᵢ₋₁:扭角,dᵢ:偏距,θᵢ:关节角61多自由度机械臂对于n自由度机械臂,末端位置/位姿由所有相邻坐标系变换矩阵的乘积得到。62式中:T:齐次变换矩阵、n:末端关节编号逆运动学给定末端位置,求解关节变量。问题通常具有非线性,且可能存在多个解对于6自由度机械臂,可采用几何法或雅可比矩阵求解。63雅可比矩阵对六自由度机械臂,雅可比矩阵J描述末端执行器速度与关节速度之间的关系若J可逆,则逆解可写为64式中:2.1.2移动操作机器人将轮式移动平台与机械臂(单臂或双臂)集成。是固定基座机械臂与人形机器人之间较为经济的中间形态。可完成环境感知、自主导航与任务执行的闭环操作,如搬运、抓取和分拣。室内平坦环境中兼具移动性、稳定性和安全性。65移动操作机器人的基本组成66轮式底盘承担平移与转向,通常为2/3自由度;常见差动驱动与全向轮底盘。机械臂单臂通常6/7自由度,可采用单臂或双臂构型。末端与传感配置夹爪/灵巧手,并集成传感器以完成“手、眼、脚”协同。底盘形式:差动驱动vs全向轮松灵TRACER2.0差动驱动底盘瑞士轮全向轮底盘底盘形式影响移动自由度、转向方式、控制复杂度与场地适应性。67单臂与双臂移动操作机器人AUBO-AMR300

单臂移动操作机器人睿尔曼具身双臂升降移动平台单臂更偏任务导向型实验;双臂人形构型更强调双臂协同与人类行为模仿。68双臂移动操作双臂轮式移动操作机器人可采用仿人构型:躯干和上身仿人、集成双臂与头部,底盘多采用三轮或四轮结构。青龙Wheel:全身22自由度、质量240kg、作业负载100N,可用于物流搬运与户外环卫等场景。LIMS2-AMBIDEX:每只手臂7自由度,驱动器集中布置在肩部并采用线性驱动,单臂最大速度可达5m/s。LIMS2-AMBIDEX69移动操作机器人的选型松灵

Cobot

Magic

协作机器人综合考虑:自由度、负载能力、重复定位精度、工作半径、最大速度与最大加速度。同时考虑:底盘类型、传感器配置等。这些指标共同决定移动操作机器人在具身智能任务中的适用性。70案例:Pepper仿人形移动操作机器人Pepper机器人2014年公开亮相,2015年开始限量发售。头部集成摄像头、麦克风阵列与3D传感器,尝试识别人类面部表情和声调。身高约120cm、重28kg,三轮移动底座,胸部10.1in触控屏,20自由度。曾在全球超过2000家企业提供零售导购、客户接待等服务2019年停止生产。71移动操作机器人的运动学整体运动学需要同时考虑轮式底盘与机械臂的运动,将两部分姿态变换矩阵级联。72式中:Tbase:底盘姿态变换矩阵、Tarm:机械臂变换矩阵、Tend:末端变换矩阵MoveIt:移动操作机器人的运动学可视化移动操作机器人虚拟样机可在ROS中的MoveIt模块中搭建移动操作机器人虚拟样机,进行移动和抓取仿真。732.1.3人形机器人在结构外形、身高、四肢、自由度等方面尽量接近人类。模仿人类身体结构和运动方式,可在复杂环境中行走、抓取并进行自然交互。是验证高阶具身智能的重要形态74人形机器人的发展ASIMOAtlas

液压驱动人形机器人ASIMO的动态行走能力Atlas通过高压液压系统与先进控制算法,展示了非结构化环境中的动态平衡和全身运动能力752021年后的新转折特斯拉推出Optimus人形机器人原型机,提出低成本、高性能电机驱动方案,此举推动全球新一轮人形机器人研发与投资热潮。我国凭借精密制造、电机驱动产业链以及长期机器人研究积累,迅速形成完整产业生态。76我国人形机器人产业进入批量生产与落地阶段77截至2025年:我国已拥有超过150家人形机器人相关企业宇树科技纯人形机器人交付量超过5500台优必选WalkerS已在工厂部署超过500台,用于组装任务。智元机器人于2025年实现第5000台机器人下线。我国人形机器人产业进入批量生产与落地阶段78部分代表性人形机器人及主要参数79人形机器人的典型结构组成宇树UnitreeG1结构组成头部:深度相机、3D激光雷达、麦克风阵列、IMU等感知模块。躯干:计算硬件、能源模块、冷却与热管理系统、扬声器等。上肢:同构双臂,单臂通常6/7自由度,末端配置夹爪或多指灵巧手。下肢:每条下肢通常6自由度。框架与保护外壳:钢、铝镁合金、碳纤维复合材料以及改性PC/ABS等。802.1.4四足机器人在复杂地形中兼顾通过性与工程可落地性比轮式/履带式平台更擅长台阶、砂石等非结构化地形。比人形机器人重心更低、步态控制更易工程化。可完成巡检、搬运、跟随和自主导航等任务。常用于验证环境感知、运动规划、学习控制的鲁棒性,并广泛用于虚实迁移研究。81四足机器人的典型结构Panda-5电动四足机器人工程上常见每条腿3个主动自由度(髋外展/内收、髋俯仰、膝俯仰),四条腿合计12个自由度。躯干集成电池、计算单元与外部传感器。足端通过与地面的接触力实现支撑、推进与转向。82四足机器人的足端接触分析足端轨迹需要生成足端轨迹与落足点,决定下一步“脚落在哪里”。接触约束需要在地面接触与摩擦条件下维持整体稳定。状态反馈通常配置足端触地检测、机身IMU和关节编码器,构成高频状态估计与闭环控制。83四足机器人运动学单腿运动学分析每条腿的关节角与足端位置关系,是基础运动学形式。机体运动学研究躯干位姿变化与各足端空间位置之间的关系,是建立整机运动模型的基础。84简化单腿模型:矢状面二连杆机构教材图2-16单腿着地示意图忽略髋关节外展/内收自由度。只考虑髋关节转角θ₁和膝关节转角θ₂。已知足端位置(x_end,y_end),求解腿部髋、膝关节转角。85四足单腿逆运动学①:几何约束由L_t²=x_end²+y_end²,结合余弦定理建立足端位置与两段腿长、膝关节角之间的关系。符号意义:xend,yend:足端位置、L₁,L₂:两段连杆长度、θ₂:膝关节转角86四足单腿逆运动学②:求膝关节角θ₂进一步得到膝关节转角θ₂。实际应用中,不同构型可能对应不同支链,需要结合关节运动范围与装配方式选择。87四足单腿逆运动学③

:求φ进一步由几何关系求得φ(用于求髋关节角的几何中间量)88四足单腿逆运动学④:求髋关节角θ₁89最终得到髋关节转角与足端位置之间的关系实际中需要结合关节运动范围、机构装配方式和期望步态进行构型选择。符号:θ₁:髋关节转角、atan2:二维方位角函数从单腿到整机机体平移和姿态变化,会同时影响四个足端在空间中的相对位置。因此机体运动学需要进一步考虑躯干与各足端之间的坐标变换关系。在此基础上可建立站立、行走和越障等任务的整体运动模型。整体运动学为后续步态规划与控制提供依据。90步态与控制:支撑相、摆动相与支撑多边形支撑相Stance足端与地面保持接触并承担支撑作用。摆动相Swing足端离开地面并向下一落足点移动。支撑多边形把所有支撑足端接触点作凸包得到支撑区域。低速/准静态运动时,质心投影通常应位于其中。91四足机器人常见的4种步态Walk慢步四条腿依次摆动,通常三足支撑;静态稳定性好。Pace同侧步同侧前后腿近似同步;效率较高,但机体横摆明显。Trot对角小跑对角腿成对交替;兼顾速度与稳定,是最常用动态步态之一。Gallop疾驰高速非对称步态,周期中可能出现短暂腾空。92Walk慢步老虎Walk步态落脚点序列四条腿依次摆动。任一时刻通常有三条腿处于支撑相。静态稳定性较好,适用于低速行走与复杂地形。落脚点序列:BL→FL→BR→FR93Pace同侧步骆驼Pace步态落脚点序列同侧前后腿近似同步运动。前进效率较高。机体横摆较明显,对姿态调节提出更高要求。教材落脚点序列:BL和FL→BR和FR。94Trot对角小跑:四足机器人最常用的动态步态之一马的Trot步态落脚点序列对角腿成对交替运动兼顾速度与稳定性占空比通常接近0.5脚点序列:BR和FL→BL和FR95四足机器人控制BigDog液压四足机器人经典控制框图四足机器人控制通常需要综合完成状态估计、机身姿态调节、足端轨迹规划、接触力分配,以及关节伺服控制等常用方法:基于模型的步态规划、MPC、全身协调控制;近年来强化学习也被广泛应用。962.1.5末端执行器同一台机械臂更换不同末端执行器后,能力边界会显著变化。两指夹爪:稳定搬运与装配。吸盘:快速抓取平面物体。软体夹爪:对形状不确定物体更具适应性。多指灵巧手:支持旋拧、拨动、翻转和手内操作等精细任务。97典型末端执行器①:两指平行夹爪与吸盘两指平行夹爪吸盘两指夹爪:结构简单、控制方便;吸盘:适合平整表面与高节拍,但对多孔、粗糙或边缘泄漏物体稳定性较差。98典型末端执行器②:软体夹爪的“天然顺应性”软体夹爪与柔性指尖材料通过材料形变提供接触初期的“天然顺应性”。可显著降低对精准位姿估计的要求。在水果、日用品等不规则物体抓取中表现突出。99典型末端执行器③:多指灵巧手三指灵巧手五指灵巧手旨在逼近人手的操作能力,在抓取的同时改变物体姿态或指间接触状态,通常自由度高、动作灵活,但硬件与控制也更为复杂在旋拧、插拔、整理等精细任务中具有不可替代的潜力100末端执行器选型:4类指标几何特性开口范围与行程、指尖形状、可达姿态、不同尺寸物体兼容性力学能力最大夹持力、抗滑移能力、额定负载、抓取稳定性感知能力指尖触觉、夹持力估计、滑移检测、腕部六维力/力矩传感接口生态开发软件支持、位置/速度/力控模式、可编程性、仿真接触模型10102外部感知具身智能导论·第2章2.2外部感知为“感知—决策—行动”闭环提供环境信息通过多种传感器获取外部世界的多模态信息。强调实时性、鲁棒性和多传感器融合。广泛用于导航、物体识别与姿态估计。包括IMU、LiDAR、深度相机等移动机器人外部传感器布置1032.2.1IMU(惯性测量单元)集成陀螺仪、加速度计和磁力计等。实时获得角速度、线加速度和磁场数据。陀螺仪利用科里奥利效应测量角速度;加速度计测线性加速度;磁力计用于方向校正。常与视觉传感器融合,用于姿态估计和稳定控制。104IMU姿态四元数更新姿态估计常用互补滤波或卡尔曼滤波融合数据;四元数q的更新可由角速度ω表示。实际应用中需要校正漂移,例如在足部接地时采用零速度更新进行重置。105符号:q:姿态四元数、ω:角速度向量、⊗:四元数乘法2.2.2LiDAR:3D环境扫描、建模与导航激光雷达激光雷达扫描点云激光雷达:通过发射激光脉冲测量距离,生成高精度点云,可用于SLAM与避障。106飞行时间测距ToF(Time-of-Flight)原理:激光雷达发射激光脉冲,测量反射回波时间t。107符号:d:目标距离、c:光速、t:往返时间2.2.3深度相机:同时获取RGB图像与深度信息结构光通过分析投影图案的变形计算深度。飞行时间ToF测量光脉冲往返时间获得深度。立体视觉利用双目图像的视差计算深度。108立体视觉的深度计算双目立体视觉根据焦距、基线距离与像素视差计算目标深度。式中f为焦距,B为双目基线距离,d为像素差。109ToF深度相机ToF

深度相机原理示意图110深度相机是常用于获取3D视觉信息的传感器,可同时提供RGB图像和深度图,支持物体识别与抓取03控制方法具身智能导论·第2章2.3控制方法具身智能需要机器人与环境实时动态交互,因此控制模型必须具备适应性和鲁棒性。工程上常将经典的基于模型控制与学习、数据驱动控制结合。1122.3.1基于模型的控制依赖机器人动力学模型和运动学模型,显式描述系统状态与输入之间的关系。用于实时优化、约束处理和底层执行。主要方法有PID、LQR、MPC、WBC等例如,波士顿动力公司Atlas形机器人采用模型预测控制处理多变量约束,从而实现复杂翻滚、跳跃等动态动作;ANYmal四足机器人则采用线性二次调节器(LQR)确保姿态稳定与鲁棒性。113状态空间方程线性时不变系统,机器人状态演化通常用以下状态空间方程描述:114符号:x:状态向量(位置、速度等)u:控制输入(如关节力矩)A:系统矩阵B:输入矩阵PID控制PID通过实时计算系统输出与期望值之间的误差e(t)来调节控制输入结构简单、实现方便、无需精确模型,适合关节位置/速度伺服;但对强非线性、强耦合系统通常需与更高级方法结合。115符号:Kₚ:比例增益,Kᵢ:积分增益,Kd:微分增益LQRLQR(线性二次型调节器‌)适用于线性系统或平衡点附近线性化后的非线性系统。求解代数Riccati方程得到最优反馈律u=−Kx。LQR计算高效、闭环稳定性好。116符号:Q:状态偏差权重矩阵,R:控制能量权重矩阵MPCMPC(ModelPredictiveContro,模型预测控制)每个采样时刻,在有限预测时域内求解最优控制序列,并满足动力学、状态与输入约束。求解后只施加第一个控制量u₀*,下一时刻重新优化。MPC适合显式处理约束和高动态运动。117符号:N:预测时域、xₖ:预测状态、uₖ:控制量WBCWBC(Whole-BodyControl,全身控制)以任务误差与控制输入为优化目标,是面向冗余自由度复杂机器人系统的多任务协调控制方法。WBC在满足动力学一致性和接触约束的前提下,统一处理多任务。118符号:e:任务误差,τ:关节力矩WBC(续)WBC的优化需要满足机器人动力学约束求解得到满足动力学约束的最优关节力矩;可统一处理质心平衡、末端轨迹、接触力与关节约束。119符号:q及其一、二阶导数:机器人状态相关变量τ:关节力矩;λ:接触力其余项:全身动力学模型项经典模型控制的特点PID结构简单,适合基础位置/速度伺服。LQR适合线性化系统,闭环稳定性好。MPC可显式处理约束,适合复杂动态运动。WBC适合冗余多自由度机器人的多任务协调。在具身智能中,经典控制仍是底层抓取、轨迹跟踪、姿态稳定和安全约束执行的基础。1202.3.2学习和数据驱动控制当动力学模型不完备、环境复杂多变、接触力与摩擦难以精确建模时,传统模型控制泛化受限。学习控制可从交互数据中自动学习状态到动作”的映射,或学习动力学、接触、落足等关键模块。可把视觉、触觉、力觉等高维感知信息直接融入决策。挑战:安全保障、可解释性不足、现实部署稳定性。121分层控制:“学习在上、经典在下”上层:学习和数据驱动方法实现高层策略优化与任务适应底层:PID/LQR/MPC等控制器保证基本动力学安全、姿态稳定与实时执行122学习控制的参数化策略函数学习控制最常见的数学表述:由参数化策略根据观测直接生成控制输出。观测可包含原始图像、点云或多模态特征;策略可由机器学习、深度网络、Transformer或扩散模型实现。123符号:o[k]:时刻k的观测,u[k]:控制输出,πθ:参数为θ的策略2.3.3控制系统硬件:低延迟、高可靠、模块化计算单元CPU/GPU/NPU/SoC,运行姿态估计、视觉处理、路径规划与AI推理。接口模块相机接口、EtherCAT/CAN、USB3.0/RS-485、无线通信等。电源与外壳锂电池+BMS;工业级材料、散热与电磁屏蔽。安全组件急停、状态监控、故障诊断、冗余设计。辅助组件编码器接口、驱动板、热沉、柔性电缆、抗振固定结构。124案例:UnitreeGo2四足机器人的硬件控制系统整机重量约15kg,硬件控制系统采用高度模块化设计。主控制板:高性能ARMSoC,集成CPU、GPU、NPU,并融合IMU数据进行实时姿态估计。接口:EtherCAT/CAN连接关节驱动;USB-C、以太网、SBUS、Wi-Fi/Bluetooth、LTE等。电源:8000mA·h锂电池组,4P8S配置,配BMS。安全:关节扭矩传感器与磁编码器、冗余连接、紧急停止。Unitree

Go2

主控制板12504软件仿真器具身智能导论·第2章2.4软件仿真器模拟机器人行为与物理交互,提供高效、安全、低成本的测试平台可验证感知算法、优化控制策略、模拟复杂场景。支持SLAM、路径规划、安全性评估等算法开发与验证。可生成合成数据用于学习训练,并通过并行计算提高训练速度。1272.4.1Gazebo核心特点开源;与ROS高度集成;支持ODE、Bullet、PhysX等物理引擎;支持LiDAR、摄像头、IMU;可做环境建模与插件扩展。适用场景ROS开发者、移动机器人、多机器人系统测试,以及需要从仿真快速迁移到实物的项目。局限:渲染中等、复杂场景CPU占用高、学习曲线较陡。1282.4.2MuJoCo核心特点高精度动力学;约束优化与软接触模型;支持RL;提供RGB-D、力传感器;内置OpenGL;使用MJCFXML建模适用场景机器人强化学习的标准工具之一,适合从简单运动到复杂操作任务;实时交互能力也可用于VR、教育培训与工业设计。1292.4.3NVIDIAIsaac:GPU加速的机器人开发生态IsaacGym专注高效并行环境模拟与快速强化学习训练。IsaacSim高保真物理与传感器仿真,基于Omniverse。IsaacLab基于IsaacSim的开源GPU加速框架,统一RL、模仿学习、运动规划工作流。130IsaacGym基于PhysX物理引擎。利用GPU在单个图形处理器上运行数千个独立环境,可同时模拟约1000个机器人智能体。提供数据导向API,可直接访问物理状态与传感器读数。特别适合强化学习;2024年以后功能逐步迁移至更先进框架。131IsaacSim:高保真物理+传感器+合成数据基于NVIDIAOmniverse,集成PhysX。支持视觉传感器、LiDAR、IMU等传感器模型。内置IsaacSDK,支持深度学习模型训练与部署。通过IsaacReplicator生成大规模合成数据集。支持ROS2Humble集成。132IsaacLab:面向具身智能训练的统一工作流Isaac

Lab基于IsaacSim构建,GPU加速、开源统一强化学习、模仿学习、运动规划等流程包含丰富机器人库与30余种可直接训练环境兼容RSL-RL、SKRL、RL-Games、Stable-Baselines等框架,并支持多智能体强化学习1332.4.4Webots134开源;采用ODE;图形化建模;支持LiDAR、摄像头、IMU等传感器;跨平台兼容。适合教育、初学者培训、中小型研究项目;优点是易用、模型丰富,局限是物理精度稍逊、社区规模较小。2.4.5CoppeliaSim135原名V-REP灵活的多物理引擎机器人仿真平台支持Bullet、ODE、Vortex;兼容ROS/ROS2;分布式控制架构,脚本与插件高度可定制。机器人系统开发与验证,可从虚拟测试快速过渡到硬件部署;高负载复杂场景计算需求较高。典型仿真器功能对比136仿真器选择建议ROS/多机器人优先考虑Gazebo。高精度接触/RLMuJoCo具有高效接触动力学与成熟RL生态。GPU并行/高保真IsaacGym/Sim/Lab面向GPU加速与AI集成教育/灵活原型Webots易用;CoppeliaSim灵活、支持多物理引擎。13705开源机械臂案例具身智能导论·第2章2.5LeRobotSO-ARM101:具身智能开源机械臂HuggingFaceLeRobot配套的开源机器人学习平台,由TheRobotStudio开发包括SO-ARM100和升级后的SO-ARM101。低成本、模块化、可扩展,适合初学者上手进行抓取、操作与交互实验。LeRobot集成硬件、软件与数据集,形成从感知到控制的完整闭环。139开源机械臂:成本与可自由装配度的定位三种典型机械臂的成本和可自由装配度对比140步骤1:硬件准备与组装领航臂采用混合齿轮比的STS3215伺服舵机:基座/肩部抬升关节减速比1:191,腕部关节1:147等,以实现轻便力反馈。跟随臂统一采用1:345高减速比,确保执行刚度。可按官方物料清单采购零件,或自行3D打印臂体。141步骤2:软件环境搭建—安装conda与gitwget/miniconda/Miniconda3-py311_25.7.0-2-Linux-x86_64.shshMiniconda3-py311_25.7.0-2-Linux-x86_64.shsudoaptupdatesudoaptinstall-ygit142步骤2:软件环境搭建—Ubuntu22.04环境condacreate-nlerobotpython=3.10condaactivatelerobotgitclone/huggingface/lerobot.git&&cdlerobotpipinstall-e".[feetech]"143步骤2:识别USB端口并写入电机ID/波特率lerobot-find-portlerobot-setup-motors--robot.type=so101_follower--robot.port=/dev/ttyACM0lerobot-setup-motors--teleop.type=so101_leader--teleop.port=/dev/ttyACM1注意:/dev/ttyACM0与/dev/ttyACM1仅为示例端口,实际应先用lerobot-find-port确认。144步骤2:校准领航臂与跟随臂lerobot-calibrate--robot.type=so101_follower--robot.port=/dev/ttyACM0--robot.id=my_followerlerobot-calibrate--teleop.type=so101_leader--teleop.port=/dev/ttyACM1--teleop.id=my_leader将各关节置于中位后进行全范围手动运动,系统自动记录零位偏移。145步骤3:运动学建模SO-ARM101运动学以URDF文件so101_new_calib.urdf为标准。也可采用经典D-H参数进行解析计算。教材给出包含伺服零位偏移的标准D-H参数表。可通过正运动学获得末端位姿,也可借助MATLABRoboticsToolbox、PyKDL等求解。146关节θₙ/(°)dₙ/mmaₙ/mmαₙ/(°)1θ₁−90115−33902θ₂0−15503θ₃0−13504θ₄+9000−905θ₅13000关节θₙ/(°)dₙ/mmaₙ/mmαₙ/(°)SO-ARM101机械臂D-H参数步骤4:配置后的效果—从遥操作到数据采集校准后,领航臂与跟随臂在相同姿态下的位置值一致,无明显抖动。运行lerobot-teleoperate,操作者轻柔移动领航臂,跟随臂可实时、平滑复现按空格键可进入记录模式,单次演示30~60s即可采集高质量关节/图像数据集后续加载ACT或Diffusion策略,可在真实臂部署并完成夹取、放置等任务。14706小结具身智能导论·第2章2.6小结本体机械臂、移动操作、人形、四足、末端执行器感知IMU、LiDAR、深度相机控制模型控制、学习控制、控制硬件仿真Gazebo、MuJoCo、NVIDIAIsaac、Webots、CoppeliaSim实践LeRobotSO-ARM101开源机械臂149谢谢普通高等教育新工科具身智能系列教材具身智能导论第3章强化学习国家地方共建人形机器人创新中心组织编写“经一蹶者长一智,今日之失,未必不为后日之得。”——王阳明《与薛尚谦书》强化学习的基本思想机器人通过与环境实时互动、自我探索或人类示范,逐步积累知识并提升自身行为决策能力。强化学习也是具身智能进步的核心技术之一。152强化学习特点实时互动智能体在环境中持续感知状态、执行动作并接收奖励反馈,形成闭环试错与探索无需预设标注样本,通过反复尝试和纠错逐步完善行为长期收益目标不是只追求即时奖励,而是最大化总折扣奖励与长期行为效果153学习目标01基础框架了解强化学习基本框架与马尔可夫决策过程,掌握贝尔曼方程在价值评估与最优策略求解中的作用02Q学习掌握时序差分更新机制与ε-贪婪策略,理解机器人任务中的优势与局限03策略类算法区分策略梯度与Actor-Critic,理解REINFORCE、A3C、SAC、PPO、DDPG的原理与适用性04基于模型方法了解Dyna-Q等混合框架与规划流程,比较与无模型方法的样本效率05仿真实践基于开源框架实现简单机器人强化学习训练,评估收敛性、探索效率与虚实迁移挑战154本章目录3.1强化学习基础3.2Q学习3.3策略梯度3.4Actor-Critic及扩展3.5基于模型强化学习3.6实践案例3.7小结155强化学习基础具身智能导论·第3章013.1强化学习:通过互动学习最佳行动方案强化学习(RL)是一种机器学习方法:智能体通过与环境互动,学习最佳行动方案学习目标是最大化总折扣奖励,而不是仅追求某一步的即时收益学习过程以离散或连续时序展开:感知状态→执行动作→获得奖励→更新行为强化学习不需要预设标注样本,强调通过反复尝试和纠错逐步完善行为强化学习框架简化示意图157不同学习方式的关注点监督学习依赖标签指导。强化学习则不依赖预先标注样本,而是从交互反馈中学习无监督学习关注从数据中发现结构;强化学习的焦点是长期收益最大化强化学习需要同时处理探索—利用权衡、数据利用效率和算法稳健性本章主要围绕“如何更稳定、更高效地改进策略”展开158强化学习基本思路:状态—动作—奖励1感知状态智能体获得当前状态s2选择动作依据策略选择动作a3环境反馈环境转移到新状态s′,并给出奖励r159强化学习框架的基本组成状态State描述环境当前状况动作Action智能体可执行的操作奖励Reward对行动效果的即时反馈策略Policy状态到动作的选择规则价值函数Value长期收益的期望环境动态Dynamics状态转移与奖励规律Episode/Trajectory一段完整交互及其经验序列160状态与动作:描述“在哪里”与“做什么”状态State记为s∈S,其中S是状态空间。状态既可以是离散型,例如棋局布局;也可以是连续型,例如机器人位置坐标。动作Action记为a∈A,其中A是动作空间。动作描述智能体在当前状态下可执行的操作。状态空间与动作空间的形式,直接影响后续算法表示与求解方式。161奖励Reward即时奖励奖励反馈值记为r。若只依赖状态和动作,可写为r(s,a);若还与后续状态有关,可写为r(s,a,s′)。奖励的困难奖励可能稀缺或滞后,因此智能体需要借助价值函数判断当前动作对长远收益的影响。折扣回报:γ∈[0,1]为折扣因子162策略Policy:智能体“如何选择动作”随机型策略策略以概率形式给出动作选择,可记为π(a|s)。在相同状态下可能选择不同动作确定型策略策略直接给出动作,可记为π(s)。在同一状态下输出确定的动作163策略可以采用确定形式(Deterministic)或概率形式(Stochastic)价值函数:从“即时奖励”走向“预期长期收益”状态价值函数Vπ(s)衡量在状态s下遵循策略π时,未来能够获得的累积奖励期望。动作价值函数Qπ(s,a)在状态s下先采取动作a,再遵循策略π时,未来能够获得的累积奖励期望。回答:当前选择会给长期收益带来什么影响?164状态价值函数Vπ(s)3.1.1概念状态价值函数对“从状态s出发并遵循策略π”后的折扣回报取期望。把未来多个时间步的奖励压缩为当前状态的长期价值165符号意义:π:策略,s:当前状态,γ:折扣因子,rt:t时刻奖励,E:期望动作价值函数Qπ(s,a)动作价值函数在状态s下固定首个动作a,再评估后续折扣回报Qπ(s,a)比Vπ(s)增加了“当前动作”维度1663.1.1概念V与Q的关系比较维度状态价值Vπ(s)动作价值Qπ(s,a)输入状态s状态s+动作a评价对象当前状态的长期收益当前动作选择的长期收益用途评估状态比较动作并支持策略改进比较维度状态价值Vπ(s)动作价值Qπ(s,a)167MDP与POMDP马尔可夫决策过程MDP记为(S,A,P,r,γ)。其中P(s′|s,a)是环境转移概率。马尔可夫性质强调:未来状态只依赖当前状态和动作,而非完整历史。部分可观测MDP(POMDP)在MDP基础上额外包含观测空间O与观测模型O(o|s)。当智能体无法直接获得完整状态时,需要利用观测进行决策。168Episode与Trajectory:交互形成“经验”的过程Episode智能体与环境进行交互,直到交互结束的完整过程。Trajectory一个episode中经历的状态、动作、奖励等连续经验序列后续策略梯度与REINFORCE都会直接从轨迹采样中估计优化方向169探索—利用之间的权衡利用Exploitation选用当前已知的最佳动作,获取较高即时收益。探索Exploration尝试新的动作,获取未知经验,为发现更优策略创造可能。强化学习往往需要在“已知最优”与“继续探索”之间取得平衡170ε-贪婪策略:用概率机制协调探索与利用概率1-ε选择当前最优动作动作选择概率ε随机尝试其他动作作用ε-贪婪让智能体大多数时候利用已知较优动作,同时保留一定概率探索新选项171例:4×4网格世界“觅食”问题智能体从左上角起点出发。目标是在最短时间内吃到价值最高的水果,并获得最大累积奖励。每走一步都会“饥饿”,奖励-1;吃到梨子奖励+5;吃到苹果奖励+10。智能体觅食的初始状态172例:把问题写成(S,A,P,R)状态空间SS={s₁,s₂}s₁:起点s₂:水果所在终点动作空间AA={上、下、左、右}共4个动作转移概率P从s₁执行动作后:0.5到达s₂;0.5留在s₁。用于模拟风吹、打滑等不确定性。终止条件到达s₂(吃到水果)后,过程终止。将现实任务抽象成有限状态、有限动作与概率转移,是后续策略评估的基础。173例:奖励函数s=s₁奖励-1:对应“饥饿”状态。s=s₂,梨子奖励+5。s=s₂,苹果奖励+10。174例:策略:从起点的动作序列两条典型觅食路径π₁较近路径:先吃梨子。π₂较远路径:吃苹果。175例:策略评估两条觅食路径的效用对比比较π₁的累积奖励为3;π₂的累积奖励为5。虽然π₂路径更远,但长期收益更高。176例:最短路径不一定等于最优策略路径长度π₁更近,行动步数更少终点奖励π₂对应苹果,终点奖励更高长期收益累积奖励比较后,π₂的长期收益更高,因此应优先选择π₂强化学习优化的是长期回报,而不是单独的距离、步数或即时奖励。177强化学习发展的代表性节点1957Bellman:动态规划与MDP奠定理论基础1988Sutton与Barto:强化学习范式1992TD-Gammon展现实战能力2013DQN推动深度强化学习2016AlphaGo将强化学习推向世界舞台2024Sutton与Barto获图灵奖强化学习已从仿真与游戏扩展到人形机器人动作学习、机械臂通用操作及大模型对齐。1783.1.2原理与数学框架:马尔可夫性质假设未来状态仅依赖当前状态和动作,而不依赖完整历史序列。当前状态s动作a下一状态s′179贝尔曼方程3.1.2原理与数学框架贝尔曼方程把当前价值分解为“即时奖励+折扣后的下一状态价值”。价值函数为递归结构形式,为值迭代、策略迭代等方法提供基础。180符号意义:a:当前动作,s′:下一状态,P:状态转移γ:折扣因子,Vπ:策略下状态价值贝尔曼最优方程最优价值函数在每个状态上选择能够带来最大期望回报的动作。最优策略的求解,本质上与寻找满足贝尔曼最优关系的价值函数紧密相关。1813.1.2原理与数学框架符号意义:maxₐ:对动作取最大,V*:最优状态价值,P:状态转移,γ:折扣因子模型已知VS模型未知动态模型已知可使用值迭代(ValueIteration)或策略迭代(PolicyIteration)逼近最优方案。动态模型未知需要借助采样轨迹,例如τ=(s₀,a₀,r₀,s₁,…)来估测模型或直接精炼策略。182许多强化学习算法的差异在于“是否显式使用环境模型”以及“如何使用采样经验”学习率与探索率学习率LearningRate决定参数每次更新的步长,它会影响算法的收敛速率与可靠性。探索率ExplorationRate控制尝试新动作的程度。探索不足可能遗漏更优策略,探索过强则会增加随机性。183Q学习中的α与ε分别对应这两类关键超参数Q学习具身智能导论·第3章023.2Q学习:直接估计状态—动作价值Q学习是典型的无模型强化学习方法。属于基于价值的离策略(Off-Policy)算法。不构建环境转移模型,而是直接从交互经验中估计Q(s,a)。特别适合离散状态和离散动作的决策场景,如机器人路径寻找、障碍规避和任务调度。185离策略学习探索策略负责生成多样化的交互样本,可以包含随机探索。目标策略根据最大Q值选择最佳动作,用于逼近最优策略。探索策略与目标策略可以不同这使Q学习能够利用“任意探索策略产生的数据”训练目标策略,提高数据利用率。186Q学习的核心:时序差分(Temporal‑Difference,TD)更新3.2Q学习每得到一个经验样本(s,a,r,s′),用“当前估计+TD修正量”更新Q值单步自举无需等到整条序列结束,更新通常比蒙特卡洛方法更及时。187符号意义:α:学习率,γ:折扣因子,r:即时奖励,maxQ(s′,a′):下一状态最佳估计TD目标、TD误差与更新步长TD目标r+γmaxₐ′Q(s′,a′)由即时奖励与下一状态最佳价值共同构成TD误差TD目标−当前Q(s,a),将这一差值作为当前估计需要修正的方向学习率α控制每次更新的修正幅度。Q学习通过反复的单步TD更新逐渐逼近贝尔曼最优方程。188单步自举当前Q(s,a)观察r与s′估计下一步最大Q立即更新单步自举的含义利用下一状态的当前价值估计来更新当前状态—动作价值,因此不必等到完整episode结束。189Q学习算法流程Q学习算法流程图初始化Q表获取初始状态sₜ使用ε-贪婪策略选择动作执行动作并获取奖励rₜ和下一状态sₜ₊₁更新Q值并进入下一状态循环直至终止并达到收敛190Q学习中的探索

常用大概率选当前最大Q动作,小概率随机探索。乐观初始化通过初始Q值设置鼓励尚未充分尝试的动作。UCB利用置信区间上界(UCB)等机制平衡探索与利用。Q学习需要持续处理探索与利用的平衡问题利用(Exploitation):选目前已知回报最高的动作,拿稳眼前收益探索(Exploration):尝试还没怎么试过的动作,也许它实际收益更高191从Q表和DQN表格型Q学习Q值存储在Q表中,适合有限、离散的状态与动作空间。深度Q网络(DQN)状态空间增大时如何扩展?复杂场景可用神经网络逼近Q函数,扩展为DeepQ-Network(DQN)192Q学习的优势无需环境模型可以直接从真实交互中学习Q(s,a)支持历史数据复用离策略属性让探索数据可以继续用于目标策略学习表格情形有理论收敛性满足充分探索、贪婪极限与适当学习率等条件时,可收敛到最优动作价值函数193Q学习的局限与缓解思路高维空间Q表规模快速增长使用函数逼近/DQN函数逼近不稳定训练可能波动或发散经验回放缓冲区、目标网络价值过估计风险最大化操作可能带来偏差双Q机制问题表现缓解思路194Q学习在机器人任务中的应用路径寻找在离散决策环境中通过Q值比较动作,寻找更优路径。障碍规避可结合深度相机获取深度信息并预测特征图,实现避障。任务调度适用于有限状态与有限动作的序贯决策。1953.2Q学习小结无模型不显式构建环境转移模型基于价值核心学习对象是Q(s,a)离策略探索策略与目标策略可分离TD更新每一步即可用新经验修正价值离散任务最适合有限状态/动作的表格问题196策略梯度算法具身智能导论·第3章033.3策略梯度:直接针对策略进行优化基本思路:调整策略参数,使智能体在环境互动中的预期总回报达到最大与Q学习相比,不要求先显式求出价值函数再选动作,而是直接从采样轨迹中提取梯度信息特别适合连续动作空间的复杂决策任务,如机器人运动控制、AI游戏和无人驾驶系统策略梯度定理提供了优化目标的梯度表达式,并缓解信用分配问题198Q学习vs策略梯度:优化对象不同比较维度Q学习策略梯度核心学习对象Q(s,a)价值函数参数化策略πθ策略获得方式由最大Q值间接得到直接更新策略参数动作空间适用性更适合有限离散动作特别适合连续动作控制数据使用典型off-policy通常on-policy比较维度Q学习策略梯度1993.3.1策略表示参数化策略用参数向量θ表示策略,便于在参数空间中迭代优化。如高斯策略与离散Softmax策略神经网络策略将高维状态(如图像、传感器信号)映射为动作,在复杂非线性任务中提升策略表达能力200两类典型参数化策略高斯策略适用于连续动作场景。动作从由均值μ(s;θ)与协方差Σ(s;θ)描述的高斯分布中采样。离散策略离散动作场景中常采用Softmax函数,把策略输出转换为动作概率分布。策略表示方式决定了动作分布的表达能力,也决定后续优化的空间201神经网络策略:从高维感知直接映射到动作高维输入图像与传感器信号等高维状态,可以由深度模型直接编码。Transformer利用自注意力处理序列和多模态输入,提升复杂策略表达。与VLA的关系VLA模型可采用Transformer生成机器人动作序列202策略优化目标:最大化预期总回报3.3.1策略表示与目标优化策略梯度算法以参数θ表示策略,优化目标是最大化该策略产生轨迹的折扣回报期望。J(θ)用于整体评价当前策略,例如路径导航或物体抓取任务中的长期表现203符号意义:θ:策略参数,τ:策略生成的轨迹γ:折扣因子,rt:t时刻奖励为什么采用梯度上升?目标函数通常非凸J(θ)一般无法直接求出全局最优解。沿梯度方向迭代实践中通过轨迹采样估计梯度,并沿提高预期回报的方向调整参数。轨迹采样使策略梯度能够应对高维、随机环境,但也会带来方差问题。204机器人策略优化还要考虑安全约束:CPO机器人场景中,策略优化往往不能只追求回报,还需要满足防碰撞等安全限制。约束策略优化(CPO)在提升J(θ)的同时,要求策略更新保持约束合规。CPO属于信任域方法:每次调整时近似约束影响,在“回报提升”与“安全约束”之间寻求可接受的更新方向205安全约束会改变可行的优化方向理解当原始优化方向会越过安全边界时,需要选择仍能提升回报、同时保持在可行区域内的更新方向。206优化方向随约束变化的示意图3.3.2REINFORCEREINFORCE是基础策略梯度算法,也称蒙特卡洛策略梯度。通过采样完整轨迹来估计梯度,不需要预先学习完整价值函数。更新信号由“动作的对数概率梯度”与“从该时刻起的折扣回报Gₜ”共同决定。207REINFORCE的策略

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论