版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
普通高等教育新工科具身智能系列教材国家地方共建人形机器人创新中心组织编写具身智能导论第6章具身导航与规划具身智能导论·第6章具身导航与规划2“纸上得来终觉浅,绝知此事要躬行。”——陆游《冬夜读书示子聿》具身导航与规划的核心思想机器人通过与物理三维环境实时交互,利用身体传感器进行自我中心感知、主动探索和决策,将感知、定位、建图、路径规划与控制有机结合,从起点自主移动至目标位置或执行指定任务。具身智能导论·第6章具身导航与规划学习目标301核心概念掌握具身导航的核心概念、主要特点、问题形式化方法及其在具身智能体系中的重要作用。02地图表示理解占据栅格地图、拓扑地图、语义地图及其构建原理。03SLAM掌握SLAM的概率框架和经典算法,理解定位与建图的闭环过程。04规划方法了解经典路径规划和运动规划算法,区分静态/动态环境中的优势与局限。05视觉语言导航掌握VLN的主要特点与典型模型,了解机器人实际部署中的实践与挑战。06系统实践通过轮臂机器人案例理解系统集成与部署,评估从仿真到现实的迁移挑战。具身智能导论·第6章具身导航与规划本章目录46.1具身导航6.2环境地图表示6.3同步定位与地图构建6.4路径规划与运动规划6.5具身导航框架6.6视觉语言导航6.7案例:轮臂机器人具身导航仿真6.8小结具身智能导论·第6章01具身导航具身智能导论·第6章具身导航与规划6.1具身导航:通过身体与环境交互实现自主移动6具身导航(EmbodiedNavigation)强调智能体通过物理身体与环境直接交互来实现自主移动和任务执行,而不是完全依赖预先构建的全局地图或外部定位系统。典型任务PointGoal:导航至指定点目标ObjectGoal:导航至指定物体目标典型观测仅依赖第一人称观测,如RGB-D图像。任务扩展视觉-语言导航(VLN)把自然语言指令融入导航。核心:从“上帝视角的地图导航”走向“自我中心的感知-行动闭环”。具身智能导论·第6章具身导航与规划6.1.1主要特点:具身导航的“四个具身性”7自我中心感知从自身视角获取信息,而非上帝视角的全局地图。主动交互与探索通过前进、转弯等动作主动调整视角,收集环境数据,形成感知-行动闭环。不确定性处理需要面对部分可观测性、传感器噪声与动态障碍。多模态融合整合视觉、深度、语言、触觉等多源信息,支持复杂语义任务。具身智能导论·第6章具身导航与规划具身问答:为了“回答”,智能体必须先“探索”8具身问答实验任务•智能体被随机生成在3D环境中的一个位置,并接收一个问题。•为了回答问题,智能体需要自主导航、主动探索,并通过第一人称视觉收集信息。•任务同时考察“去哪儿看”“看什么”“如何根据观测回答”的闭环能力。具身智能导论·第6章具身导航与规划具身导航在具身智能体系中的作用91到达先到达目标位置2感知在目标附近获取有效信息3操作才能进一步抓取或交互4完成任务形成高层任务闭环具身导航是物体抓取、人机协作、环境探索等更高层任务的前提。家用机器人跨房间移动、目标搜索、语义交互。仓库物流在货架/通道环境中自主定位、规划与避障。灾区救援在未知、动态与不确定环境中持续探索。具身智能导论·第6章具身导航与规划真实机器人本体目标导航任务10•Habitat、AI2-THOR等仿真平台推动了具身导航研究•导航性能会直接影响真实机器人在家庭、物流、救援等场景中的落地效果•任务形式可以是点目标、物体目标,也可以进一步扩展到自然语言目标真实机器人本体目标导航任务具身智能导论·第6章具身导航与规划6.1.2问题的形式化:从观测到动作111观测oₜ图像、深度等自我中心观测2策略π根据历史与当前观测选择动作3动作aₜ例如前进0.5m、左转30°4环境转移获得新观测oₜ₊₁与奖励具身导航可以视为MDP的扩展,实际更常建模为部分可观测MDP(POMDP)。优化目标最大化累积折扣回报,同时兼顾导航成功率与路径效率。具身智能导论·第6章具身导航与规划导航评价指标:SuccessRate与SPL12成功率(SuccessRate)判断任务是否成功到达目标区域,强调“能不能到”。SPLSuccessweightedbyPathLength。综合成功与路径效率,强调“到得是否高效”。仅看成功率可能忽略绕路;SPL通过最短路径长度与实际路径长度的比值惩罚低效导航。具身智能导论·第6章具身导航与规划SPL:路径长度加权成功率13Sᵢ第i个回合的成功标志。lᵢ起点到目标的最短路径长度pᵢ智能体实际行走的路径长度。具身智能导论·第6章02环境地图表示具身智能导论·第6章具身导航与规划6.2环境地图表示:把原始观测变成可决策的环境模型151传感器观测RGB-D、LiDAR、点云等原始数据2结构化表示把观测组织为地图或图结构3规划与决策为定位、避障、路径规划提供依据具身智能体强调自我中心感知与主动感知:机器人通过移动主动改变视角,获取更有信息量的观测。具身智能导论·第6章具身导航与规划环境地图表示的核心权衡16存储效率地图越精细,存储与计算开销往往越大。更新速度动态环境要求地图可以被快速、连续更新。信息丰富度地图既可只保留几何信息,也可加入对象、关系和功能语义。主流表示:度量地图、拓扑地图、语义地图。具身智能导论·第6章具身导航与规划6.2.1度量地图:用坐标与几何描述空间17度量地图以精确坐标和几何信息描述环境,将物理空间量化为可计算坐标系,存储障碍物与空闲区域的位置与形状。直接支持路径规划直接支持碰撞检测直接支持运动控制典型形式占据栅格地图(OccupancyGridMap)核心:每个网格单元保存“被占据”的概率。具身智能导论·第6章具身导航与规划占据栅格地图:把连续空间离散成规则网格18占据栅格地图•环境被离散为二维或三维规则网格•每个网格单元存储占据状态的后验概率•工程中常以log-odds形式存储,便于数值稳定和增量更新•占据栅格地图是安全导航和路径规划的基础具身智能导论·第6章具身导航与规划占据栅格地图构建:四个步骤191空间离散化连续物理空间→规则网格2概率表示每个单元维护占据后验概率3增量更新新观测到来后执行贝叶斯更新4构建与应用由传感器扫描持续维护并用于规划构建本质:对每一个网格单元持续进行二值贝叶斯滤波。具身智能导论·第6章具身导航与规划步骤1:空间离散化与坐标映射20设网格分辨率为r(米/格),连续物理坐标(x,y)映射到网格索引(i,j)。分辨率更高地图几何细节更丰富,但存储与计算量增加。分辨率更低计算更轻量,但狭窄通道与小障碍可能被“抹平”。具身智能导论·第6章具身导航与规划步骤2:状态定义与概率表示21每个单元格cᵢ,ⱼ的占据状态oᵢ,ⱼ∈{0,1}:0表示空闲,1表示占据。由于传感器噪声,系统维护的是后验概率而不是绝对标签。初始未知状态Lᵢ,ⱼ⁽⁰⁾=0,对应占据概率0.5。具身智能导论·第6章具身导航与规划步骤3:增量贝叶斯更新22新观测zₜ到来后,利用逆传感器模型对每个栅格的log-odds进行增量更新。L>τocc判定为占据L<τfree判定为空闲中间区间保持未知状态具身智能导论·第6章具身导航与规划步骤4:构建与应用231传感器扫描例如LiDAR扫描环境2栅格更新依据逆传感器模型更新概率3地图维护持续融合多帧观测4导航使用碰撞检测+路径规划地图不是“一次生成”,而是在机器人运动过程中持续更新。具身智能导论·第6章具身导航与规划6.2.2拓扑地图:用“节点-边”抽象空间24•将环境抽象为图G=(V,E)•节点V:关键地点或地标,例如房间、路口•边E:节点之间可通行路径,可附加距离、代价、方向约束•关注“连通关系”,不强调精确度量坐标拓扑地图具身智能导论·第6章具身导航与规划拓扑地图构建:三个典型步骤251节点提取从度量地图或传感器数据提取关键地点2边构建与标注依据轨迹/可行性建立连边,并附加距离、代价、方向3图优化与闭环利用回环检测和位姿图优化消除累积误差本质:把大规模几何空间压缩成适合长距离规划的“关系图”。具身智能导论·第6章具身导航与规划拓扑地图:优点、局限与混合表示26优势存储占用小、计算高效,特别适合大规模环境中的长距离导航和层次化规划。局限缺乏精确几何信息,无法直接用于精细运动规划。度量-拓扑混合地图先在拓扑层选择目标房间/区域,再切换到度量地图进行精细避障与局部规划。具身智能导论·第6章具身导航与规划6.2.3语义地图:从“几何空间”升级为“知识表示”27语义地图•在几何地图上叠加对象类别、功能属性与空间关系。•示例语义:沙发、门、桌子;可通行、可交互、不可进入;“沙发左侧是茶几”。•支持“去厨房”这类语义级目标,而不仅是具体坐标。具身智能导论·第6章具身导航与规划语义地图构建:感知→融合→推理281语义感知语义分割、实例分割、视觉-语言模型标注RGB-D/点云2语义-几何融合体素级、点云级或对象级场景图3动态维护与推理多帧融合+知识图谱,维护时序一致性语义地图让导航从“到坐标”走向“到对象/房间/功能区”。具身智能导论·第6章具身导航与规划语义地图:能力与局限29语义级决策支持“去厨房”“到沙发旁”等自然语言目标。动态行为预测可结合语义信息预测行人或移动障碍的行为。自然交互与LLM/VLM结合,提升语言理解与语义定位能力。主要局限依赖高精度语义感知,对光照、遮挡等噪声敏感。具身智能导论·第6章具身导航与规划三类环境地图表示对比30维度度量地图拓扑地图语义地图核心信息精确坐标与几何连通性与拓扑关系几何+对象/功能/关系语义优势可直接碰撞检测与规划存储小、长距离规划高效支持语义目标与高级推理局限大规模时存储/计算开销高缺乏精确几何依赖高精度语义感知典型用途局部导航、精细避障层次化/大范围导航VLN、人机交互、动态场景理解具身智能导论·第6章具身导航与规划环境地图表示与主动感知31高质量地图是导航闭环的基础,但具身智能并不只是“被动看地图”。1发现未知区域地图中仍存在未知栅格2主动转向/移动选择更有信息量的视角3获得新观测减少遮挡与不确定性4更新地图提高规划安全性与完整性具身智能导论·第6章03同步定位与地图构建具身智能导论·第6章具身导航与规划6.3SLAM:同时回答“我在哪”和“世界长什么样”33定位问题需要地图才能判断机器人位姿。建图问题需要知道机器人位姿才能把传感器观测放进地图。SLAM解决“先有地图才能定位,还是先有定位才能建图”的根本矛盾。具身智能导论·第6章具身导航与规划6.3.1基本定义:定位与建图的闭环过程34SLAM过程•机器人从未知环境中的任意起点出发•利用激光扫描或图像序列逐步构建地图•同时根据运动与观测不断修正自身位姿•SLAM是具身智能实现自主导航的关键基础具身智能导论·第6章具身导航与规划SLAM的贝叶斯后验35时刻t:机器人位姿xₜ、观测zₜ、控制输入uₜ、地图m。全SLAM的目标是估计整条轨迹和地图的联合后验。x₁:ₜ表示从起点到当前时刻的整个位姿轨迹。具身智能导论·第6章具身导航与规划FullSLAM与OnlineSLAM36FullSLAM估计整条位姿轨迹x₁:ₜ与地图m。保留完整历史状态,更适合全局一致性优化。OnlineSLAM更关注当前位姿xₜ与地图m。实时系统中通常优先使用在线形式。实际应用中更常用OnlineSLAM。具身智能导论·第6章具身导航与规划SLAM的三大技术挑战37数据关联将当前观测与地图中特征正确匹配。循环闭合检测识别“我又回到了来过的地方”,从而消除累积漂移。计算复杂度地图规模增长会显著抬高计算与存储开销。具身智能导论·第6章具身导航与规划6.3.2概率框架:预测+更新381上一时刻后验已有位姿/地图概率分布2预测Prediction运动模型根据控制输入uₜ预测xₜ3更新Update观测模型利用zₜ修正位姿与地图4新后验得到更可靠的位姿和环境估计SLAM本质上是基于贝叶斯滤波的递归概率推理。具身智能导论·第6章具身导航与规划预测与更新39预测运动模型描述机器人在控制输入作用下从xₜ₋₁转移到xₜ的不确定性。更新观测模型描述在位姿xₜ和地图m下获得观测zₜ的概率。p(xₜ|xₜ₋₁,uₜ)p(zₜ|xₜ,m)具身智能导论·第6章具身导航与规划SLAM中的主动感知40具身导航强调SLAM的实时性与主动性:机器人不仅“估计”,还会主动规划到信息量丰富的区域。1发现不确定定位/地图存在高不确定区域2规划探索动作转向、前进或改变视角3获得更强观测提高特征可观测性或回环概率4降低不确定性地图更快收敛,定位更稳定具身智能导论·第6章具身导航与规划6.3.3经典SLAM算法41EKF-SLAM高维联合状态+扩展卡尔曼滤波;适合特征地图。FastSLAMRao-Blackwellized粒子滤波;粒子表示轨迹,地图条件独立。VisualSLAM以相机为核心,前端跟踪+局部建图+回环+图优化。具身智能导论·第6章具身导航与规划EKF-SLAM:把机器人位姿与所有路标一起估计42•将机器人位姿与环境中所有Landmark的位置组成一个高维联合状态向量。•用均值与协方差描述联合高斯分布。•预测阶段由运动模型推进状态;更新阶段用观测修正状态和协方差。EKF-SLAM示例具身智能导论·第6章具身导航与规划EKF-SLAM的适用假设43环境静态环境中的路标位置在估计期间基本不变。高斯噪声系统噪声近似服从高斯分布。数据关联已知观测能正确对应到地图中的路标。特征地图特别适合点/线等稀疏特征地图。具身智能导论·第6章具身导航与规划EKF-SLAM流程:预测与更新44EKF-SLAM流程传感器数据与控制输入共同驱动状态预测、数据关联与观测更新。具身智能导论·第6章具身导航与规划EKF-SLAM预测阶段451.预测:运动模型先预测当前状态,再传播协方差。非线性系统通过雅可比矩阵进行一阶线性化具身智能导论·第6章具身导航与规划EKF-SLAM更新阶段46Kₜ=Pₜ|ₜ₋₁Hₜᵀ(HₜPₜ|ₜ₋₁Hₜᵀ+Rₜ)⁻¹x̂ₜ|ₜ=x̂ₜ|ₜ₋₁+Kₜ[zₜ−h(x̂ₜ|ₜ₋₁)]Pₜ|ₜ=(I−KₜHₜ)Pₜ|ₜ₋₁Kₜ为卡尔曼增益;Hₜ为观测模型雅可比;Rₜ为观测噪声协方差。计算卡尔曼增益更新状态更新协方差具身智能导论·第6章具身导航与规划EKF-SLAM:优势与瓶颈47优势算法结构清晰、理论完备;在路标数量较少时计算高效。瓶颈机器人3维位姿+n个二维路标时,协方差矩阵维度达到(3+2n)×(3+2n),难以扩展到大规模环境。FastSLAM与图优化SLAM正是针对这一扩展性瓶颈提出的改进路线。具身智能导论·第6章具身导航与规划FastSLAM:粒子表示轨迹,地图条件独立48FastSLAM基于Rao-Blackwellized粒子滤波。每个粒子代表一条可能的机器人轨迹,并为地图维护条件估计。分解后:轨迹由粒子采样,地图中的路标可在给定轨迹条件下独立估计。具身智能导论·第6章具身导航与规划FastSLAM路径估计仿真49机器人FastSLAM估计路径仿真结果•感知范围会影响粒子权重与路径估计质量•FastSLAM可以表示非高斯、多模态后验•对数据关联模糊的场景更具鲁棒性具身智能导论·第6章具身导航与规划FastSLAM步骤1-2:状态传播与权重更新501状态传播根据运动模型,从上一时刻粒子采样得到当前位姿:xₜ⁽ⁱ⁾~p(xₜ|xₜ₋₁⁽ⁱ⁾,uₜ)2权重更新根据观测模型计算重要性权重:ωₜ⁽ⁱ⁾∝p(zₜ|xₜ⁽ⁱ⁾,mₜ₋₁⁽ⁱ⁾),再进行归一化。具身智能导论·第6章具身导航与规划FastSLAM步骤3-4:地图估计与重采样513地图估计利用当前粒子位姿和观测更新粒子附属地图;特征地图可使用EKF,度量地图可使用栅格映射。4重采样复制高权重粒子、剔除低权重粒子,缓解粒子退化;可采用系统重采样或残差重采样。具身智能导论·第6章具身导航与规划FastSLAM2.0:改进提议分布52•采样新粒子时不仅依赖运动模型,还融入最新观测信息•提议分布更接近真实后验,因此可用更少粒子获得更稳健估计•流程仍保持“轨迹粒子+独立EKF路标估计+权重+重采样”的基本框架FastSLAM2.0的流程具身智能导论·第6章具身导航与规划6.3.4视觉SLAM:以相机为主要传感器53传感器单目、双目或RGB-D相机。优势成本低、信息丰富、部署灵活。适用尤其适合成本敏感的具身智能体。典型代表:ORB-SLAM系列。具身智能导论·第6章具身导航与规划ORB-SLAM的核心技术特点54ORB特征快速、旋转不变并具尺度不变性的特征描述。三线程并行前端跟踪、局部建图、后端优化并行运行。词袋回环Bag-of-Words高效检索历史关键帧,检测闭环。图优化最小化重投影误差,获得全局一致的位姿与稀疏地图。具身智能导论·第6章具身导航与规划ORB-SLAM系统架构55ORB-SLAM系统具身智能导论·第6章具身导航与规划ORB-SLAM三大核心模块56Tracking实时处理图像帧,提取ORB特征,与局部地图匹配,并快速估计当前相机位姿。LocalMapping插入关键帧,维护局部地图,并执行局部BundleAdjustment。LoopClosing利用词袋模型检索历史关键帧,确认回环后触发全局优化,消除累计漂移。具身智能导论·第6章具身导航与规划ORB-SLAM系列:传感器配置不断扩展57ORB-SLAM奠定经典特征视觉SLAM架构。ORB-SLAM2进一步支持单目、双目、RGB-D等配置。ORB-SLAM3进一步整合视觉惯性等配置,增强通用性。代码仓库可在GitHub获取。具身智能导论·第6章具身导航与规划ORB-SLAM3运行效果58ORB-SLAM3的运行效果•左侧:实时构建的稀疏点云地图与关键帧轨迹。•右侧:相机视角下的特征匹配可视化。•体现视觉SLAM在“定位+建图”两个维度上的同步工作。具身智能导论·第6章具身导航与规划视觉SLAM的演进:从几何一致性到语义理解591视觉SLAM相机位姿+稀疏/稠密几何地图2语义感知语义分割、实例识别、视觉大模型3语义视觉SLAM削弱动态物体干扰、提升场景理解4主动导航进一步服务于目标搜索和高层任务语义视觉SLAM是视觉SLAM向实用化、智能化演进的重要趋势。具身智能导论·第6章04路径规划与运动规划具身智能导论·第6章具身导航与规划6.4从“几何路径”到“可执行轨迹”61路径规划PathPlanning在自由空间中寻找从起点到目标的无碰撞路径,主要关注几何可达性与代价。运动规划MotionPlanning在路径基础上进一步考虑运动学/动力学约束,生成带时间参数的可执行轨迹。SLAM提供“我在哪+地图”,规划负责决定“怎么安全到达”。具身智能导论·第6章具身导航与规划6.4.1路径规划的基本原理62在已知或部分已知地图中,从起点s到目标g搜索一条完全位于自由空间内的无碰撞路径,并最小化路径长度、时间或能量等代价。自由空间FreeSpace机器人允许通过的配置区域。障碍空间ObstacleSpace与障碍物发生碰撞的禁止区域。具身导航还要求规划器具备实时响应动态障碍,并与SLAM更新同步。具身智能导论·第6章具身导航与规划路径规划算法的三大类别63图搜索算法把地图离散成图,在节点/边上搜索。适合占据栅格或拓扑地图。采样算法在高维配置空间随机采样,适合复杂、非凸环境。优化算法直接在连续空间中优化轨迹,可显式考虑动力学约束。具身智能导论·第6章具身导航与规划6.4.2A*:启发式图搜索64A*通过优先扩展总代价较小的节点,将“已经走过的实际代价”和“到目标的启发式估计”结合。g(n)起点到节点n的实际代价。h(n)节点n到目标的启发式估计,例如欧氏距离。具身智能导论·第6章具身导航与规划A*路径规划示例65A*算法路径规划•当启发函数h(n)可容许,即不高估真实最优代价时,A*可找到最优路径•适合占据栅格地图的全局路径规划•局限:在高分辨率地图中节点数量庞大,计算开销明显增加具身智能导论·第6章具身导航与规划RRT:快速随机树66•从起点建立一棵树,不断随机采样配置空间中的目标点。•寻找树中最近节点并向采样点方向扩展;无碰撞则把新节点加入树。•概率完备,特别适合高维、非凸配置空间或带非完整约束的问题。•RRT*通过近邻重连获得渐近最优性。RRT路径规划具身智能导论·第6章具身导航与规划RRT:优势与局限67优势易处理复杂障碍和高维空间,扩展性强,并可融入运动学约束。局限路径通常锯齿、需要平滑;随机性导致结果不稳定,常与局部规划器结合。教材将其用于动态或未知环境下的全局规划。具身智能导论·第6章具身导航与规划PRM:适合“多次查询”的概率路线图681随机采样在配置空间中采样大量无碰撞节点2构建路线图连接近邻节点,形成RoadMap3查询路径用A*等图搜索算法在路线图上搜索适合Multi-query:预处理一次,后续多次路径查询高效。局限高维空间中路线图构建阶段可能耗时较长。具身智能导论·第6章具身导航与规划A*、RRT与PRM对比69算法基本思想主要优势主要局限适用场景A*启发式图搜索可求最优路径,确定性强高分辨率图计算密集栅格/拓扑全局规划RRT随机树扩展高维、非凸、约束复杂随机、路径需平滑复杂配置空间/未知环境PRM采样构建路线图多查询时效率高预处理可能很耗时静态环境、多次查询具身智能导论·第6章具身导航与规划6.4.3运动规划:让路径真正“可执行”70运动规划在全局路径基础上进一步考虑运动学、动力学、时间和障碍物约束,生成平滑、安全、可跟踪的局部轨迹。1全局参考路径给出大致通行路线2局部状态当前速度、姿态、障碍物3约束优化/搜索满足速度、加速度与碰撞约束4控制指令输出线速度、角速度或控制量具身智能导论·第6章具身导航与规划DWA:在“动态速度窗口”中实时选择最优速度711速度窗口考虑当前速度与加速度限制,得到可行(v,ω)2轨迹模拟对每组速度预测短期运动轨迹3评价综合朝向、障碍物距离与速度偏好4执行选择得分最高的速度指令DWA是高效的局部实时避障方法。具身智能导论·第6章具身导航与规划DWA评价函数72G(v,ω)=α·heading(v,ω)+β·dist(v,ω)+γ·vel(v,ω)heading模拟轨迹与目标方向的对齐程度。dist模拟轨迹到最近障碍物的距离,越远越安全。vel前进速度偏好,用于提升导航效率。具身智能导论·第6章具身导航与规划DWA:实时性强,但容易局部最优73优势计算量小、实时性极强、易于处理动态障碍,广泛用于轮式机器人。局限视野有限、易陷入局部最优,因此通常需要全局规划器提供方向引导。具身智能导论·第6章具身导航与规划TEB:把参考路径看成“带时间戳的弹性带”74TimedElasticBand在全局参考路径上放置一系列“位姿+时间戳”控制点,通过图优化/非线性优化同时调整空间位置与时间间隔。优化目标执行时间优化目标障碍物距离约束运动学/动力学优点轨迹更平滑,符合非完整约束,前瞻性强,避障效果优于DWA。缺点参数多、计算复杂度更高。具身智能导论·第6章具身导航与规划MPC:在有限预测时域内反复优化控制序列75•在有限预测时域内预测未来状态。•反复求解最优控制序列,显式加入速度、加速度与避障等约束。•适合轨迹精度与约束满足要求高的机器人、无人车和无人机。•主要挑战:实时性依赖高效优化求解器。MPC方法躲避移动障碍示意图具身智能导论·第6章具身导航与规划DWA、TEB、MPC对比76方法核心思想优势局限更适合DWA速度空间采样+短期模拟实时性极强易局部最优轮式机器人动态避障TEB时空控制点+图/非线性优化平滑、前瞻、符合非完整约束参数多、计算更重复杂动态场景MPC预测模型+有限时域最优控制约束表达能力强、轨迹精度高求解器实时性要求高高性能运动控制具身智能导论·第6章具身导航与规划运动规划在开源机器人框架中的落地77ROSNav2把地图、全局规划、局部规划与控制集成到移动机器人导航闭环中。MoveIt把采样/优化规划与机械臂运动学、碰撞检测和控制对接。实际系统常将全局规划器与局部规划器混合使用,以提高鲁棒性。具身智能导论·第6章05具身导航框架具身智能导论·第6章具身导航与规划6.5具身导航框架791感知视觉/深度/LiDAR等自我中心观测2认知SLAM、地图、语义理解3决策全局路径+局部运动规划4行动速度/控制指令下发到执行器核心目标:从自我中心感知出发,输出可执行运动指令,实现持续自主导航。具身智能导论·第6章具身导航与规划6.5.1基本概念:分层式或混合式80高层全局任务解析、语义理解、全局路径规划。低层局部避障、轨迹平滑、执行控制。模块化便于独立开发、替换与维护。实时性可对动态环境持续响应。可扩展性可以融入强化学习与大模型。具身智能导论·第6章具身导航与规划6.5.2经典分层式具身导航框架:五个层次811感知与定位AMCL或SLAM2地图与代价地图静态图+传感器障碍信息3全局规划Dijkstra/A*4局部规划DWA/TEB5控制执行底盘控制器+电机PID代表:ROSNavigationStack具身智能导论·第6章具身导航与规划感知定位层+地图与代价地图层82感知与定位层已知地图:AMCL实时定位。未知环境:SLAM同步定位与建图。地图与代价地图层融合静态地图、LiDAR、深度相机等,构建全局与局部代价地图,为路径规划和避障提供环境表示。具身智能导论·第6章具身导航与规划全局规划层+局部规划层83全局规划层在全局代价地图上使用Dijkstra、A*等搜索低代价全局路径。局部规划层DWA、TEB等根据当前障碍物和机器人状态实时避障、平滑轨迹并跟踪全局路径。具身智能导论·第6章具身导航与规划控制执行层:把规划结果变成底盘运动84局部规划器输出速度指令,底盘控制器根据运动形式生成电机命令,并通过PID等闭环控制保证实际运动跟随目标。差分驱动左右轮速度差产生转向。全向轮支持更灵活的平面移动。阿克曼转向类似车辆转向机构。具身智能导论·第6章具身导航与规划ROSmove_base:经典分层导航框架的核心执行节点85基于ROSmove_base的经典分层式具身导航框架模块流程图具身智能导论·第6章具身导航与规划经典分层式框架:为什么长期成为主流?86优势模块职责清晰、可解释、调试方便;工业和科研生态成熟。局限串行链路中误差会逐级累积;计算开销较大,对复杂动态环境的适应性相对有限。具身智能导论·第6章具身导航与规划6.5.3其他具身导航框架:从模块串行走向学习驱动871视觉模块提取障碍/语义信息2SLAM估计位姿与地图3规划器搜索全局/局部路径4控制器跟踪并执行传统串行架构的关键问题:前级的感知偏差或定位漂移会向后级传递,整体性能受最薄弱环节制约。因此产生了端到端强化学习和大模型驱动导航框架。具身智能导论·第6章具身导航与规划端到端强化学习框架:四步处理流程881观测编码CNN/ResNet/ViT提取视觉特征2任务条件融合融合ImageGoal/LanguageGoal/PointGoal3时序推理LSTM/GRU/Transformer维护历史隐状态4动作输出离散动作概率或连续速度参数策略网络可基于A3C、PPO等强化学习算法训练。具身智能导论·第6章具身导航与规划端到端导航训练:在高保真模拟器中“边走边学”89Habitat大规模室内具身导航仿真。iGibson具备交互性的高保真室内仿真。AI2-THOR支持视觉导航与对象交互任务。智能体通过最大化累积折扣奖励,实现“观测输入→动作输出”的联合优化。具身智能导论·第6章具身导航与规划目标驱动视觉导航:用目标图像定义导航任务90目标驱动视觉导航•当前视觉观测与目标图像进入共享权重的SiameseCNN。•两者被编码到同一嵌入空间,显式建模相似度。•策略网络基于A3C训练,在AI2-THOR中完成目标驱动自主寻路。具身智能导论·第6章具身导航与规划目标驱动视觉导航:贡献与局限91突破引入“目标图像”作为任务表征,一个策略可以泛化到不同目标实例,无须为每个目标单独训练。局限复杂场景适应性不足,长程依赖处理能力弱,对未见环境的泛化能力相对有限。具身智能导论·第6章具身导航与规划大模型驱动框架:导航基础模型与VLA范式92随着VLA模型兴起,导航框架开始利用大规模预训练多模态基础模型,直接处理视觉观测与自然语言指令,并输出动作序列或轨迹。零/少样本泛化利用预训练知识适应新任务。跨任务迁移同一模型覆盖多种导航任务。跨具身形态在不同机器人/车辆平台之间共享能力。具身智能导论·第6章具身导航与规划NavFoM:NavigationFoundationModel93•跨具身形态、跨任务导航基础模型的代表•训练数据约800万条导航样本,包括四足机器人、无人机、轮式机器人和车辆等•支持视觉-语言导航、目标搜索、目标跟踪与自动驾驶等任务NavFoM具身智能导论·第6章具身导航与规划NavFoM的统一建模思路94统一架构用一套模型覆盖不同平台与任务。TVI指示符通过时序-视角指示符处理不同相机配置与导航时域。轨迹预测直接从多视角视频输入预测轨迹,强调跨场景泛化。具身智能导论·第6章06视觉语言导航具身智能导论·第6章具身导航与规划6.6视觉语言导航:让自然语言成为导航目标96视觉语言导航•把自然语言指令与第一人称视觉感知结合•机器人需要理解语言语义,并把语义与当前视觉观测对应起来。•这使导航从几何目标走向多模态推理与语义交互。具身智能导论·第6章具身导航与规划6.6.1一般流程:语言指令+视觉观测→动作序列971语言指令例如“从厨房走到客厅沙发旁”2第一人称观测RGB-D等视觉输入3跨模态对齐把语言片段与视觉对象/区域建立对应4序列决策逐步生成动作,直到到达目标VLN通常被形式化为POMDP:策略需要联合历史视觉观测与语言指令。具身智能导论·第6章具身导航与规划视觉语言导航的四个主要特点98多模态对齐语言提供高层目标,视觉提供局部环境细节。序列决策每一步动作都依赖历史观测与指令的联合推理。语义导向支持自然语言交互,不再局限于坐标或目标图像。泛化挑战需处理指令歧义、遮挡与未见环境。具身智能导论·第6章具身导航与规划VLN的核心挑战99指令歧义消解同一句话在不同场景可能对应不同路线或目标。视觉-语言对齐偏差模型可能看到了对象,却没有正确理解语言中的空间关系。长程时序推理导航需要在长时间跨度内保持目标、记忆历史并纠正错误。具身智能导论·第6章具身导航与规划6.6.2典型模型1001Seq2SeqRNN/LSTM编码语言与视觉,注意力解码动作2Transformer自注意力实现视觉词元与语言词元的细粒度对齐3RL增强在模仿学习基础上用PPO等微调策略4VLA融合利用大规模多模态预训练提升复杂指令和长程规划具身智能导论·第6章具身导航与规划Seq2Seq基线:根据历史观测和语言上下文预测动作101早期VLN以RNN/LSTM为主,通过注意力机制把语言与视觉上下文融合到动作解码中hₜ解码器在当前时刻的隐状态。cₜ注意力机制得到的上下文向量。具身智能导论·第6章具身导航与规划基于Transformer的VLN模型102VLN-BERT利用BERT/自注意力建模视觉与语言的跨模态关系。HAMT进一步强化历史记忆与多模态时序建模。现代框架还会整合LLM的语言理解能力,进行复杂指令解析与子任务分解。具身智能导论·第6章具身导航与规划强化学习增强VLN:缓解模仿学习的复合误差103仅依赖专家轨迹进行模仿学习时,模型一旦偏离专家分布,错误可能不断累积(CompoundingError)。1模仿学习初始化先学习专家行为2模拟器交互让策略面对自己的状态分布3PPO等微调最大化成功、效率相关奖励4提升鲁棒性更好处理偏离和未见状态具身智能导论·第6章具身导航与规划VLN评价指标与发展趋势104SuccessRate(SR)衡量是否最终到达目标。SPL同时衡量成功与路径效率。趋势随着多模态大模型兴起,VLN正逐步与视觉-语言-动作(VLA)模型融合,以提升复杂指令理解与长程规划能力。具身智能导论·第6章07案例:轮臂机器人具身导航仿真具身智能导论·第6章具身导航与规划6.7Fetch轮臂机器人:把本章技术串成一个完整系统106轮臂机器人将轮式移动底盘与多自由度机械臂结合:既能自主导航,也能在到达目标后执行抓取等操作。案例平台经典Fetch轮臂机器人+Gazebo仿真环境。实践目标从随机起点自主完成PointGoalNavigation,并为后续机械臂抓取预留接口。具身智能导论·第6章具身导航与规划系统组成107移动底盘差分驱动轮式结构,最大移动速度约1m/s。机械臂7自由度可达臂,末端平行夹爪。传感器RGB-D、LiDAR、IMU、轮式编码器软件框架ROS+SLAM+move_base+MoveItFetch机器人具身智能导论·第6章具身导航与规划Fetch的具身感知与执行能力108头部RGB-D相机同时提供彩色与深度信息,用于目标感知和场景理解。基座LiDAR+IMU+编码器提供距离观测、惯性信息和里程计,支撑定位与建图。7-DoF机械臂+夹爪为“到达之后的操作”提供执行能力。具身智能导论·第6章具身导航与规划Fetch仿真软件栈1091ROSNoetic机器人中间件2Gazebo物理仿真与传感器仿真3SLAM/AMCL建图或定位4move_base全局规划+局部规划+控制5MoveIt机械臂运动规划与抓取推荐环境:Ubuntu20.04+ROSNoetic+Gazebo11。具身智能导论·第6章具身导航与规划仿真环境配置:安装ROS并克隆Fetch仓库110推荐系统:Ubuntu20.04;先安装ROSNoetic完整桌面版cd~/catkin_ws/srcgitclone/fetchrobotics/fetch_ros.gitgitclone-bgazebo11/fetchrobotics/fetch_gazebo.gitcd~/catkin_ws&&catkin_make教材强调:无需真实硬件,即可在普通Ubuntu笔记本上完成完整仿真实验。具身智能导论·第6章具身导航与规划安装Gazebo依赖并验证配置111依赖安装与编译rosdepinstall--from-pathssrc--ignore-src-r-ycatkin_make#验证安装roslaunchfetch_gazebosimulation.launch若Gazebo窗口正常弹出,则基础仿真环境配置成功。具身智能导论·第6章具身导航与规划Gazebo仿真环境验证112Gazebo窗口具身智能导论·第6章具身导航与规划仿真实验任务:PointGoalNavigation113任务定义Fetch在Gazebo仓库环境中从随机起点出发,自主导航至指定货架位置,例如坐标(4.0,3.0),到达后保持稳定姿态。1随机起点机器人初始位姿随机2启动导航栈定位/SLAM+A*+DWA3设置目标RViz2DNavGoal4自主导航实时避障与重规划5到达距离阈值<0.5m具身智能导论·第6章具身导航与规划启动仿真与导航栈114两个终端分别运行#1)启动仿真环境roslaunchfetch_gazeboplayground.launch#2)启动导航栈roslaunchfetch_gazebo_demofetch_nav.launch系统将自动启动AMCL定位、A*全局规划器与DWA局部控制器。具身智能导论·第6章具身导航与规划在RViz中设置导航目标1151打开RViz查看占据栅格地图、机器人位姿和规划路径2点击2DNavGoal进入目标设置工具3点击并拖动指定目标位置与朝向4机器人执行立即开始导航、避障并持续更新路径红色箭头表示目标位置与朝向。具身智能导论·第6章具身导航与规划观察与记录116SLAM/定位观察机器人位姿和地图如何随运动更新。A*全局路径在RViz中观察全局路径(教材示意为绿色)。DWA局部轨迹观察局部避障轨迹(教材示意为黄色)与动态重规划。机器人成功到达目标后,终端会显示“GoalReached”。具身智能导论·第6章具身导航与规划Fetch在Gazebo中的具身导航环境117Fetch机器人在Gazebo仿真平台中的导航环境具身智能导论·第6章具身导航与规划实验扩展与思考118集成MoveIt在导航后继续完成机械臂抓取。动态障碍修改地图或加入移动障碍,观察DWA的重规划效果。任务扩展从PointGoal扩展到物体目标、语言目标和“导航+操作”。Sim-to-Real思考传感器噪声、地面摩擦等仿真与真实差异。MoveIt启动示例:roslaunchfetch_moveit_configmove_group.launch具身智能导论·第6章具身导航与规划从仿真到现实:为什么“仿真成功”不等于“真机成功”119传感器差异真实LiDAR/相机存在噪声、遮挡、反射和标定误差。动力学差异真实地面摩擦、轮胎打滑、负载变化会改变运动模型。环境差异真实场景动态性更强,未知对象与人的行为更复杂。因此部署需要持续的参数标定、鲁棒感知、在线重规划和安全约束。具身智能导论·第6章08小结具身智能导论·第6章具身导航与规划本章知识结构1211环境表示度量/拓扑/语义地图2SLAMEKF/FastSLAM/VisualSLAM3规划A*/RRT/PRM+DWA/TEB/MPC4系统框架ROS分层/端到端RL/基础模型5高级任务VLN+Fetch仿真实践具身智能导论·第6章具身导航与规划6.8小结122地图度量地图提供几何基础;拓扑地图压缩连通关系;语义地图服务语义任务。SLAM通过概率推理同时估计位姿与地图,经典路线包括EKF、FastSLAM与视觉SLAM。规划全局路径与局部运动规划共同保证“可到达、可避障、可执行”。系统现代具身导航正从模块化分层架构走向学习驱动和多模态基础模型。实践Fetch+Gazebo案例展示了从感知、定位、规划到控制的完整系统集成。谢谢普通高等教育新工科具身智能系列教材具身智能导论第7章视觉-语言-动作模型国家地方共建人形机器人创新中心组织编写具身智能导论·第7章视觉-语言-动作模型2“真知即所以为行,不行不足谓之知。”——王阳明《传习录·卷中·答顾东桥书》视觉-语言-动作模型的基本思想把视觉感知、自然语言理解与物理动作执行统一到一个端到端系统中,让机器人能够“看、听、做”,并通过真实环境反馈持续闭环调整。具身智能导论·第7章视觉-语言-动作模型3VLA模型的三个直观特征多模态输入同时理解图像、语言,并可进一步融合深度、触觉和机器人状态。端到端动作输出从原始观测直接生成关节角度、末端速度或离散动作序列。闭环执行感知环境变化,重新判断与规划,在执行中持续修正动作。目标:把“理解世界”进一步推进到“在世界中行动”。具身智能导论·第7章视觉-语言-动作模型4学习目标01基本概念理解多模态融合、端到端学习以及“感知-认知-决策-行动”闭环。02视觉抓取掌握视觉抓取原理、YOLO检测、6D姿态、抓取点预测与动作执行。03动作生成理解动作序列规划、生成式动作序列与扩散策略的基本机制。04VLA训练区分模仿学习与强化学习在VLA训练中的互补作用,并评价优势与局限。05实践部署基于开源框架完成轻量级VLA实验,关注泛化、虚实迁移与部署挑战。具身智能导论·第7章视觉-语言-动作模型5本章目录7.1概述7.2视觉抓取7.3动作序列规划与生成7.4语言-动作生成7.5视觉-语言-动作模型7.6VLA模型的训练与部署7.7案例:SmolVLA7.8小结具身智能导论·第7章01概述具身智能导论·第7章视觉-语言-动作模型77.1视觉-语言-动作模型:从理解到执行•VLA(Vision-Language-Action)把视觉感知、语言理解和动作生成组织为统一的条件策略•输入可以是图像、文本以及机器人状态;输出是可直接执行的动作或动作序列•它区别于“视觉模块→规划模块→控制模块”的传统级联系统,减少中间接口与误差累积•核心目标是在真实物理世界中实现更自然、更强泛化的交互能力具身智能导论·第7章视觉-语言-动作模型8VLA的“看-听-做”看|视觉感知从摄像头图像中识别物体、场景与空间关系→听|语言理解从自然语言中解析任务目标、对象与约束→做|动作执行将联合表征直接转化为连续控制量或离散动作三种能力通过反馈闭环连接,而不是彼此独立具身智能导论·第7章视觉-语言-动作模型97.1核心概念多模态融合联合处理图像、文本,甚至触觉等不同模态信息。端到端学习直接从原始输入学习动作输出,不依赖人工设计的中间规则。闭环迭代感知、认知、决策和行动实时循环,执行后根据反馈继续修正。具身智能导论·第7章视觉-语言-动作模型10传统模块化系统与VLA的本质区别传统模块化系统视觉、规划、控制相对独立优势:模块可解释、便于替换问题:接口复杂;误差可能逐级累积;遇到新任务通常需要重新编程VLA一体化策略视觉、语言、动作统一建模优势:端到端优化;闭环更紧密;可借助预训练知识提升泛化挑战:数据、算力与安全性要求更高具身智能导论·第7章视觉-语言-动作模型11“感知-认知-决策-行动”闭环感知获得图像、深度、触觉与本体状态。→认知理解对象、语义和当前任务意图。→决策预测下一步或未来多步动作。→行动执行动作并把新环境状态反馈给模型。闭环使策略能够在动态环境中持续修正,而不是一次性执行固定路径。具身智能导论·第7章视觉-语言-动作模型12VLA快速发展的技术基础深度学习提供视觉表征、序列建模与端到端优化能力。强化学习继承“交互—反馈—优化”的思想,让策略通过真实或仿真环境继续改进。大语言模型/VLM利用大规模视觉-语言预训练知识,提高样本效率与零样本、少样本泛化。三条技术路线在VLA中交叉融合:语义先验+机器人数据+闭环交互。具身智能导论·第7章视觉-语言-动作模型13VLA的典型应用场景家居服务自然语言驱动的整理、抓取、放置、清洁等操作。工业协作面向多品类工件的柔性搬运、装配与人机协作。医疗辅助在高安全约束下理解指令并辅助执行操作或递送任务。具身智能导论·第7章视觉-语言-动作模型14RT-2:视觉与语言直接生成动作词元RT-2模型框架自然语言指令和视觉图像进入模型后,直接预测离散动作词元;再经De-tokenize转换为机器人末端执行器的位姿变化具身智能导论·第7章视觉-语言-动作模型15RT-2的动作词元化思路图像/指令视觉图像与语言指令形成联合输入。→多模态模型VLM主干在统一词元空间中进行条件推理。→动作词元动作被表示为模型可预测的离散词元。→反词元化把词元恢复为可执行的末端位姿变化。关键变化:模型不只“回答文本”,而是把动作也当作一种可生成的序列。具身智能导论·第7章视觉-语言-动作模型167.1小结输入视觉、语言与机器人状态共同定义当前任务条件。模型通过多模态融合和端到端学习形成统一策略。输出预测离散动作、连续控制量或未来多步动作序列。闭环执行后重新感知环境,使策略在真实世界中持续修正。具身智能导论·第7章02视觉抓取具身智能导论·第7章视觉-语言-动作模型187.2视觉抓取:VLA的动作基础•视觉抓取(VisualGrasping)指机器人通过相机采集图像、识别物体并执行抓取动作•它把静态视觉观测转化为动态动作序列,是从“看见”走向“作用于环境”的关键一步•在VLA中,视觉抓取提供最典型的“感知→决策→行动”具身任务链具身智能导论·第7章视觉-语言-动作模型197.2.1基本原理传统抓取依赖人工编程的固定路径。当物体位置变化、出现新物体或环境发生扰动时,预设路径容易失效。视觉抓取模拟人类“手眼协调”。机器人持续观察环境、判断如何抓取、执行动作,并依据新的观测调整。具身智能导论·第7章视觉-语言-动作模型20视觉抓取的三个主要阶段1感知阶段RGB-D相机获得彩色图像与深度信息,形成图像观测I。→2决策阶段判断“是什么、在哪里、怎么抓”,确定位置、方向与抓取姿态。→3行动阶段把抓取决策转换为关节角度或速度指令并执行。视觉抓取把“看”转化为可以驱动机械臂的具体控制命令。具身智能导论·第7章视觉-语言-动作模型21感知阶段:RGB-D让机器人同时看到外观与距离RGB图像提供颜色、纹理和语义信息,适合物体检测与类别识别。Depth深度提供像素到相机的距离信息,便于三维定位、姿态估计和抓取点计算。联合RGB+深度,可把“图像中的物体”进一步变成“空间中的可抓取对象”。具身智能导论·第7章视觉-语言-动作模型22决策阶段:从“物体在哪”到“机械爪怎么放”•先识别物体类别与位置,再估计物体在三维空间中的方向与姿态。•根据物体几何、可达性与稳定性,生成若干候选抓取姿态。•用学习得到的评分函数评价候选方案,选择最稳定、最安全的抓取。抓取配置g一个抓取配置通常包含末端位置、方向、夹爪开合等信息。目标:在所有可行配置中找到成功概率最高的方案。具身智能导论·第7章视觉-语言-动作模型23最优抓取配置:以成功概率为目标G:所有可能的抓取姿态集合。Q(I,g):给定图像观测I时,抓取姿态g的成功概率评分函数,通常由神经网络从数据中学习得到。具身智能导论·第7章视觉-语言-动作模型24基于视觉的机器人实时抓取系统基于视觉的机器人实时抓取系统示意图包含手眼系统与评估系统两类配置:相机获得物体信息,机械臂根据视觉结果完成抓取并验证效果。具身智能导论·第7章视觉-语言-动作模型257.2.2典型技术路线:检测—姿态—抓取—控制目标检测YOLO实时框出物体边界,完成定位与分类姿态估计6D姿态或RGB-D/点云预测物体位置与方向抓取规划采样候选抓取点并进行质量评分运动执行用逆运动学把末端目标位姿转换为关节指令这条路线把计算机视觉输出逐步转化为物理执行器能够直接接受的控制量具身智能导论·第7章视觉-语言-动作模型26YOLO:适合实时抓取场景的单阶段检测•YOLO的核心思想是One-stage:一次前向传播同时完成物体定位与类别预测•与多阶段检测相比,YOLO强调推理速度,适合需要快速闭环响应的机器人场景•检测结果不仅给出“是什么”,还提供边界框位置,为后续姿态估计和抓取规划提供入口机器人抓取中的关键要求:检测速度必须跟得上环境变化具身智能导论·第7章视觉-语言-动作模型27YOLO的基本工作步骤1划分网格把输入图像均匀划分为S×S个网格。→2预测目标网格负责预测目标中心、边界框宽高、置信度和类别概率。→3NMS筛选利用非极大值抑制去除重叠框,得到最终检测结果。一次前向传播完成定位与分类,是YOLO的实时性来源具身智能导论·第7章视觉-语言-动作模型28YOLOv12简化结构示意图教材图7-3YOLOv12简化结构示意图读图提示主干网络逐步提取多尺度特征,颈部进行特征融合,检测头在多个尺度上输出分类与边界框结果。具身智能导论·第7章视觉-语言-动作模型29机器人抓取中的YOLO输出格式B=[x,y,w,h,c,p₁,p₂,…,pₙ](x,y):边界框中心坐标;w、h:边界框宽、高;c:检测置信度;pᵢ:属于第i个类别(如苹果、杯子)的概率。具身智能导论·第7章视觉-语言-动作模型30为什么还需要6D姿态?2D检测框物体在图像中的大致区域,以及类别与置信度。但它不能直接确定物体在三维空间中的完整朝向。6D姿态3个位置维度+3个姿态维度。机械爪只有知道“在哪里+朝哪个方向”,才能形成可执行的抓取位姿。具身智能导论·第7章视觉-语言-动作模型31决策阶段:候选抓取点与质量评分•系统可先估计物体6D姿态,也可以直接从RGB-D图像或点云中预测抓取姿态。•在物体表面采样大量GraspCandidate,形成候选点集Cg。•利用基于GraspNet-1B等数据训练的抓取姿态检测网络进行预测和评分。•最终选择稳定性、安全性等综合评分最高的抓取姿态。具身智能导论·第7章视觉-语言-动作模型32最佳抓取点:从候选集合中选择最高分gbest:最佳抓取点;Cg:候选抓取点集合;S(gᵢ,I):基于输入图像I的抓取质量评分函数,通常综合稳定性等因素,可由深度网络自动学习。具身智能导论·第7章视觉-语言-动作模型33机械臂末端执行器的抓取姿态变化不同阶段机械臂末端执行器的抓取姿态动作过程预抓取→接近→夹爪交互→提升→放下/松开。抓取不是单一瞬时动作,而是一段连续时序。具身智能导论·第7章视觉-语言-动作模型34行动阶段:逆运动学把末端目标位姿变成关节角目标位姿已知机械爪希望到达的位置与方向。IK求解逆运动学计算机械臂各关节需要转动的角度。伺服执行把关节角度或速度指令发送给伺服电动机。完成任务执行抓取、抬起、搬运和放置。检测、决策与控制必须在足够短的时间尺度内协同,才能保持实时闭环。具身智能导论·第7章视觉-语言-动作模型35视觉抓取:从视觉到执行器的完整链条感知RGB-D/相机获得图像与深度,YOLO等算法识别目标。几何通过6D姿态、点云和候选抓取点建立三维可抓取表示。决策用抓取质量评分函数选择最稳定、安全的姿态。控制用IK把末端位姿转为关节指令,并由伺服系统执行。具身智能导论·第7章视觉-语言-动作模型367.2.3视觉抓取面临的三类主要挑战环境不确定性光照变化、遮挡、相机抖动等会使检测和姿态估计失效。实时性与精度矛盾机器人需要快速响应,但高精度姿态估计计算量往往更大。Sim-to-Real差距摩擦、材质、传感器噪声和通信延迟让仿真策略在真实硬件上性能下降。具身智能导论·第7章视觉-语言-动作模型37挑战1:环境不确定性•光照变化会改变颜色与纹理分布,影响目标检测•遮挡让关键几何信息缺失,可能导致错误边界框或抓取姿态•相机抖动与噪声会使深度和位置估计不稳定对应思路训练时主动加入光照扰动、随机遮挡和噪声,让模型在更多“非理想观测”下学会稳定预测。具身智能导论·第7章视觉-语言-动作模型38挑战2:实时性与精度的权衡追求更高精度更复杂的特征提取、更密集的点云处理和更细粒度的姿态估计通常需要更多计算。追求更低时延抓取系统需要毫秒级或高频响应;推理过慢会让动作基于“过时观测”。工程目标不是单独最大化精度,而是在控制周期内获得“足够准确”的稳定决策。具身智能导论·第7章视觉-语言-动作模型39挑战3:从仿真到现实的迁移差距•仿真环境中的摩擦系数、材质反射、接触模型与真实世界存在差异•真实系统还会引入通信延迟、机械间隙、传感器噪声等因素•因此“仿真中完美”的策略并不等于“真实机器人上稳定”Sim-to-Real的核心:让模型在训练时经历更丰富的分布,并在真实交互中继续适配。具身智能导论·第7章视觉-语言-动作模型40改进方法1:数据增强提高视觉鲁棒性光照扰动随机亮度、对比度与色彩变化。遮挡增强人为遮挡部分物体,模拟拥挤场景。噪声注入加入传感器噪声、模糊或相机扰动。目标:把“训练数据的变化”转化为“部署环境下的鲁棒性”。具身智能导论·第7章视觉-语言-动作模型41改进方法2:多模态信息融合RGB语义、颜色和纹理信息Depth距离和三维几何信息Touch接触、夹持力与滑移信息多个模态相互补偿,可以减少单一视觉失效时的系统脆弱性。具身智能导论·第7章视觉-语言-动作模型42改进方法3:强化学习微调•先用演示数据学习一个可用的抓取策略,再在真实或高保真环境中交互。•PPO、SAC等强化学习算法可根据任务成功、碰撞、稳定性等奖励持续优化策略。•这种方式把“离线模仿”与“在线纠错”结合起来,提升策略对真实不确定性的适应能力。视觉抓取闭环与“状态—动作—奖励”交互循环高度一致。具身智能导论·第7章视觉-语言-动作模型43改进方法4:引入语言条件,升级为VLA决策•语言指令提供“要抓什么、做什么”的任务条件,视觉负责当前环境中的具体落点•模型可以根据自然语言描述进行条件化决策,而不必为每个任务单独编写固定规则•以RT-1为代表的多模态大模型路线能够显著提升复杂日常物体任务的成功表现从视觉抓取走向VLA:不只是“哪里能抓”,还要理解“用户希望抓什么、为什么抓”。具身智能导论·第7章视觉-语言-动作模型44多模态视觉抓取过程多模态视觉抓取过程示意图RGB图像、力反馈和机器人状态共同作为输入,经编码与融合后预测动作执行状态,并持续判断“下一步是否继续/是否完成”具身智能导论·第7章视觉-语言-动作模型457.2小结检测YOLO解决“物体是什么、在哪个图像区域”。三维6D姿态/深度/点云解决“物体在空间中如何放置”。抓取候选点+质量评分解决“机械爪如何接近和夹持”。执行IK+伺服控制把高层抓取决策转化为真实机械运动。具身智能导论·第7章03动作序列规划与生成具身智能导论·第7章视觉-语言-动作模型477.3长时序任务:一个指令对应一串动作靠近移动到目标附近→伸臂调整机械臂工作空间→抓取闭合夹爪→抬起离开支撑面→移动运送到目标位置→放置松开并完成任务示例:“把苹果放到篮子里”必须由多个有序动作共同完成。具身智能导论·第7章视觉-语言-动作模型487.3.1动作序列的数学表示aₜ表示第t时刻的动作,可以是离散指令(如“抓取”),也可以是连续向量(如关节速度);T表示序列长度。具身智能导论·第7章视觉-语言-动作模型49动作序列的类型离散动作序列适合粗粒度、高层规划。示例:“前进”“抓取”“放置”。特点:语义清晰、容易被人理解。连续动作序列适合精细颗粒度的底层控制。示例:关节角度、关节速度、末端速度。特点:可以直接精确驱动执行器。具身智能导论·第7章视觉-语言-动作模型50动作序列与MDP:在闭环中不断生成和修正•当前动作aₜ主要依据当前状态sₜ,而不是简单记住全部历史轨迹。•状态可包含视觉图像、语言指令、当前关节角度等信息。•机器人执行动作后获得新观测,再在下一时刻重新决策,因此序列并非“一次生成后永不改变”。核心:动作序列是随环境反馈滚动更新的时间过程。具身智能导论·第7章视觉-语言-动作模型517.3.2基于模型的规划:先预测未来,再选动作•Model-BasedPlanning利用已知或学习到的环境动力学模型预测未来状态•从当前状态出发,模拟多个候选动作序列的后果•最终搜索代价最低或任务成功率最高的序列思想:先“在模型里试一遍”,再把最优方案交给真实机器人执行。具身智能导论·第7章视觉-语言-动作模型52基于模型规划的三个步骤1构建模型学习状态转移P(sₜ₊₁|sₜ,aₜ)与奖励/代价函数。→2前向预测从当前状态模拟不同动作序列,得到未来轨迹。→3优化搜索比较候选轨迹,找到代价最低或成功率最高的动作序列。规划质量取决于动力学模型是否足够准确。具身智能导论·第7章视觉-语言-动作模型53基于模型规划的优势与不足优势可解释性强:可以检查预测轨迹。安全约束清晰:能显式加入碰撞、关节限位等条件。不足动作序列越长,候选组合快速增长。如果动力学模型不准确,预测误差会随时间积累。具身智能导论·第7章视觉-语言-动作模型547.3.3生成式动作序列:直接学习“动作分布”•数据驱动方法不再强依赖显式环境模型,而是从大量机器人演示中学习合理动作序列的分布。•同一条指令往往存在多种可行方案,因此模型需要能够表达“多模态”的动作分布。•可以把动作序列生成理解为:给定当前观测和语言条件,生成一段合理的未来行为。具身智能导论·第7章视觉-语言-动作模型55条件生成:视觉与语言共同决定未来动作Iₜ:当前视觉观测;L:自然语言指令。模型学习在这些条件下,哪些动作序列更可能是合理、成功的执行方案。•
生成式方法的核心是条件生成:给定视觉观测和语言指令(如“把苹果放进篮子”),模型输出动作序列概率
具身智能导论·第7章视觉-语言-动作模型56生成式动作序列的两类常见架构Transformer解码器按序列方式建模动作词元或连续动作。适合利用注意力机制捕获长程依赖,并可采用自回归生成。扩散模型从噪声轨迹逐步恢复为清晰动作序列。尤其适合连续、高维和多模态的动作分布。具身智能导论·第7章视觉-语言-动作模型577.3.4动作扩散:把“生成动作”看成“逐步去噪”•图像扩散从噪声中逐步恢复清晰图像;动作扩散把同样思想用于机器人轨迹•训练阶段:向真实动作序列逐步加入高斯噪声•推理阶段:从随机噪声开始,由神经网络反复预测并移除噪声,得到平滑可执行的动作序列具身智能导论·第7章视觉-语言-动作模型58图像扩散与动作扩散的对比图像扩散和动作扩散的对比图像:噪声→去噪→清晰样本;动作:噪声轨迹→逐步去噪→平滑抓取/放置轨迹。具身智能导论·第7章视觉-语言-动作模型59前向扩散过程:逐步把真实动作“加噪”真实轨迹a⁰从演示数据得到高质量动作序列。→加入少量噪声对动作序列施加高斯扰动。→逐步增加噪声随着扩散步k增大,结构信息逐渐丢失。→近似高斯噪声最终得到接近随机噪声的动作表示。训练目标是学
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 急诊理论试题及答案800
- 应急防护综合试题及答案公布
- 2024数学一历年真题(含答案详解)
- 考研数学二冲刺试卷全套-2026(考点速记版)
- 金融大数据处理全套课件
- 全国统考数学三强化试卷|2024考研(含答题卡)
- 急性外耳道炎诊疗指南(2026版)
- 创伤后应激障碍心理干预课件
- 《职业健康监护技术规范》解读
- 《信息工程》分层作业及答案-2026-2027学年湘科版(新版)小学科学五年级上册
- 2026年心力衰竭诊疗指南全面解读
- 2025年深圳市中考英语试题(考生回忆版)
- 2026中国电信量子公司春季博士招聘备考题库带答案详解(精练)
- 2026散装煤炭运输成本测算及供应链优化方案研究报告
- 小学历史与文化知识竞赛题库100道附参考答案【综合卷】
- 新版湘教版八年级下册数学全册教案(完整版)教学设计含教学反思
- 临床输血知识培训课件
- 营养均衡讲解课件
- 生产部报废管理制度
- 左宗棠介绍教学课件
- 心肌梗塞患者的运动康复护理
评论
0/150
提交评论