版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
课堂设计一、基本信息课次第10讲课次学时数2学时主题具身智能二、设计方案课堂目标(一)知识目标能简述具身智能的定义;能描述具身智能典型应用场景。(二)能力目标能列举具身智能的关键技术、方法和典型应用等;能分析具身智能的工作过程、组成结构和功能;能应用具身智能的关键技术和方法进行简单问题的分析。(三)素质目标能通过具身智能的多学科、跨学科知识,启发培养跨学科综合解决问题的思维和创新意识。教学重难点(一)教学重点具身智能关键技术,包括感知技术和推理技术。(二)教学难点具身推理关键技术。教学设计思路(一)教学内容组织1.具身智能的定义2.具身智能关键技术3.具身智能行业应用4.具身智能机遇与挑战(二)教学方法策略1.教学思路与方法采用问题驱动,以“为什么学习具身智能”、“什么是智能机器人”、“什么是具身智能”等引出授课内容,让学生从实际问题出发,进行思考。接着介绍具身智能的定义和工作过程以及具身智能的研究与应用领域。课程思政设计(1)崇尚科学意识:强调人工智能创新方向-具身智能对国家科技的贡献,强化学生崇尚科学的意识。(2)突出新质生产力:强调创新过程中新质生产力的作用,强化同学在具体应用中运用新质生产力的思维。(3)加强思考是行动的先导意识:强调具身智能中具身感知和具身推理的重要性,加强同学的思考先导意识。3.军事特色思考具身智能在军事上有何价值和用途,如何服务于人民部队。教学资源1.头歌(EduCoder)平台在线资源2.《人工智能技术及其应用》在线课程审签新上课教员£上新课教员£内容备注课堂导入今天,我们将一起探索一个令人兴奋且属于人工智能前沿的领域——具身智能。对于这个新兴领域,在座的同学们肯定都有一个困惑:为什么学习具身智能?关于这个问题的答案,首先要知道新质生产力,它是创新起主导作用,摆脱传统经济增长方式、生产力发展路径,具有高科技、高效能、高质量特征,符合新发展理念的先进生产力质态。新质生产力作为先进生产力的具体体现形式,是马克思主义生产力理论的中国创新和实践,是科技创新交叉融合突破所产生的根本性成果。然后,人工智能是发展新质生产力重要引擎。并且在工信部《人形机器人创新发展指导意见》中提到要以大模型等人工智能技术突破为引领,到2025年,实现人形机器人的批量生产,并突破紧密相关的具身智能关键技术。另外在宏观意义上,具身智能的发展,可以推动我国工业生产智能化,为建设制造强国、网络强国和数字中国提供支撑,促进我国实体经济的发展。在科研意义上,“具身”意味着主动性和交互性,而这也是目前最接近“智能”的大模型所欠缺的。因此,可以认为,具身智能是通用人工智能未来的发展方向。最后在应用意义上,它是一系列先进机器人,如家务机器人、四足机器狗、物流机器人和工业机器人等关键技术基石。现在的智能机器人种类非常多,但是关于什么是智能机器人?怎么才算是智能机器人?相信大家会得到一个模棱两可的答案。那么,我们设想中的智能机器人是什么?是像人类一样工作的机器人?各方面强于人类的机器人?还是有意识和情感的机器人?上个世纪对未来人工智能的幻想,主要表现为智能人形机器人,但目前人工智能技术仍然停留在电脑屏幕,没有以实体的方式进入物理世界。目前人工智能技术中智能程度最强的大模型,与目前最先进的人形机器人,能否结合形成智能机器人?但是大模型也有一些困局,例如,多模态大模型LLaVA已能做到标记出抓握图中插着花的花瓶的位置,但实际场景远比此复杂,例如判断电饭锅是什么?如何打开它?人的一些手势是什么意思?3D点云图如何理解?等等。此外,大模型的泛化能力较差,对于生成技能库API或代码API形式的运动指令,由于现实世界场景过于复杂,构建完整的技能库几乎不可能。因此,当前人工智能还不足以让机器人更智能,需要具身智能。那么,什么是具身智能?关于这个问题,本堂课主要从四个方面来学习具身智能的相关知识。一是学习和掌握具身智能的基本定义,知道什么是具身智能。二是学习具身智能关键技术,掌握技术内容和重难点。三是了解具身智能典型的行业应用。四是了解具身智能技术的未来考量,还有哪些机遇与挑战问题。理论讲授一、具身智能的定义如今的大模型,让机器人能学习和认识文本图像,但是能学会走路吗?在1963年进行了一场心理学实验,两只猫自出生起便在黑暗封闭的环境中生活。其中一只猫可以自由的移动,另一只猫只能被动移动位置。随着腿部动作,猫眼中物体的大小有相应的变化,最终学会走路。但是被动移动的猫只能注意到眼中的物体在变大、缩小,最终没有学会走路,甚至不能意识到眼中物体逐渐变大就是在靠近自己。这场实验说明有行走条件才能学会走路:有物理身体,可以进行交互。结合上述实验,关于具身智能的定义是:一种基于物理身体进行感知和行动的智能系统,其通过智能体与环境的交互获取信息、理解问题、做出决策并实现行动,从而产生智能行为和适应性。这实质上是强调有物理身体的智能体通过与物理环境进行交互而获得智能的人工智能研究范式。如图1,简单说,具身智能是有物理身体、并且可以与环境进行交互,例如可以学习“移开遮挡后的物体识别”。非具身智能则表示抽象的智能,例如让机器人学会下围棋、文本处理以及图像识别,这些是在学习“有遮挡的物体识别”。这启示我们,智能的培育需要与实践环境深度交互。如同智能体通过物理身体感知世界,新时代人才也需扎根实践土壤。为了更好地理解具身智能的定义,各位学员以小组的形式讨论下列哪些属于具身智能范畴?参与讨论的示例见图2。其中属于具身智能范畴的是宠物机器人、自动驾驶、人形机器人、复合机械臂以及机器狗。而属于非具身智能的是AI数字人、传统机械臂(基于编程)、接待机器人(无智能)。图1.具身智能与非具身智能对比图2.关于具身智能的讨论二、具身智能关键技术具身智能按照工作过程可以划分为:感知、推理、执行三个阶段。如图3所示,智能体通过与环境交互,最初阶段是感知阶段,在这个阶段中,主要实现对物体、场景、行为和表达的感知;然后利用感知到的信息,结合环境反馈,进入第二个推理阶段,这个阶段需要完成任务规划、具身导航以及具身问答。当具备信息以及推理结论后,可以开启第三个阶段,即图3.具身智能三个主要工作过程具身执行阶段,在最后执行阶段中,智能体可以基于规则、学习或者大模型开展相应的行为动作。通过与真实环境交互,不断获取交互数据加速学习过程和提高智能体的智能化程度。那么这三者是如何工作的呢?里面常用的关键技术都有哪些呢?下面就让我们带着这些问题开始学习三个阶段的主要内容。在开始学习之前,首先,让我们一起来观看宇树科技的一个短视频。图4.宇树科技先进具身智能示例短片在短视频中,有这样一个场景,机器人站在木质平台上,需要跃过障碍,跳到另一个木制平台上。对于这样一个特殊场景,同学们不妨想一想,为了完成障碍跳跃,机器人需要怎么做?在这个场景下,具身感知具体表现为机器人需要知道前方是什么?障碍多宽?平台位置在哪里?空间坐标是多少?等等关键信息;具身推理表现为关节扭矩应设置多大才能越过障碍?等问题探索;具身执行表现为机器人利用感知信息和推理结论调节末端执行器的位置、朝向、末端状态以成功执行任务。其中,从最后的成功执行来看,可以知道,机器人在行动执行之前的具身感知和具身推理过程是成功的核心及关键。同学们,就像机器人跨越障碍需要先感知环境、计算扭矩一样,要知道思考是行动的先导,我们做事也要先动脑再动手。遇到困难时,多问几个“为什么”,做好预案再行动,这种“具身思维”才是成功的关键。记住:智慧的火花永远闪烁在行动之前!下面,让我们一起来学习具身智能的核心:具身感知。2.1具身感知机器人需要具备环境感知能力,依据感知对象的不同,可以分为四类:表达感知、场景感知、行为感知和物体感知。其中,这四类感知需要达到的感知特征主要有:物体感知:几何形状、铰接结构、物理属性;场景感知:场景重建和场景理解;行为感知:手势检测、人体姿态检测、人类行为理解;表达感知:情感检测、意图检测。其中,重点需要感知能力的机器人主要有:服务机器人、人机协作场景下机器人、社交导航机器人、环境探索机器人。具身感知的过程主要包括以下几步:感受信息:利用RGB相机、3D相机、麦克风、触觉传感器和热传感器等感知外界环境的信息。信息的表示/建模/重建:通过获取3D物体的几何形状、铰接结构、物理属性信息完成物体感知;通过场景重建(主动探索、主动定位、场景的表示)等完成场景感知;基于2D图片和深度信息等完成行为感知;基于视觉表情和声音完成表达感知。信息理解:利用信息编码方法将信息编码为可机器学习的数据格式,然后基于交互的物体检测、空间关系理解和时序变化检测等完成对环境场景的理解,接着通过手势识别和姿态检测等实现对真实人类的行为理解,并且相应地完成情感识别和意图推断等。下游任务:当智能体在完成理解之后,可以实现对物体的位姿估计、物体抓取、交互感知、可供性预测、社交导航、自动驾驶、人机协作等智能交互任务。2.1.1物体感知对于3D空间中的物体,有必要感知其:几何形状、铰接结构、物理属性。(1)几何形状几何形状感知的数据格式包含点云、网格、体素、深度图等。对于点云,其由一组包含3D坐标和特征的点构成;网格则表示为基于点、线、面(三角形)的物体表面;体素则为一组立方体,每个立方体包括坐标、体积和特征;深度图则是为2D图片每个像素匹配一个深度。铰接结构与内部构件刚性连接,无法变形的刚性物体不同,铰接物体内部构件由关节或其他铰接结构连接,部件可以旋转、平移。刚性物体关注几何形状,对其的操作主要为抓取、放置,即位姿估计和物体抓取任务。铰接物体除几何形状外,还关注对其铰接结构。铰接物体支持复杂的操作,例如开关柜门,拧瓶盖。物理属性:物体的物理属性种类及来源包括:触觉(触觉传感器);力矩(六轴力矩传感器,3自由度力,3自由度扭矩);温度(温度传感器)以及材质、硬度等等。对于物理属性的表示,通常与其他模态融合,如图像和点云:IMAGEBIND、LANGBIND,或者单独使用物理信息,例如强化学习端到端的方式利用触觉信息。物体感知的典型应用案例是,利用几何形状信息实现物体抓取。在获取几何形状信息后,可以利用该信息实现物体抓取。对于传统的物体抓取:需要已知物体的3D模型,然后使用分析的方法通过数学建模求解抓取点位。基于深度学习的物体抓取:依赖3D相机获取初步点云,不进行显式的物体重建,直接基于点云通过神经网络求解抓取位姿。感知3D物体的几何形状,与计算机图形学(CG)中的物体重建有密切联系,即使不进行显式的物体重建,一个好的物体重建方法往往也是很好的3D物体和场景的表示方法。2.1.2场景感知场景感知是通过实现与场景的交互来理解现实世界场景,其赋予机器人理解周围环境并与之交互的能力。内在核心是使智能体完成对空间布局的几何理解以及对场景中物体的语义理解。场景感知由粗粒度和细粒度组成,粗粒度指场景中物体的组成、物体的语义、物体的空间关系,细粒度指场景中每个点的精确空间坐标和语义。通常使用点云、地标、拓扑图、场景图、隐表示的具体数据表示。场景感知的要素构成如图5所示图5场景感知的要素构成场景感知主要有三个目的:场景信息获取,场景重建,场景理解。目的一:场景信息获取,场景信息中较易利用的场景信息有视觉信号和激光/雷达信号。其中视觉信号符合人类的先验知识,相关研究工作多;激光/雷达信号可以直接获取准确的场景表示,无需视觉重建。难利用的场景信息主要有:听觉、触觉、化学、红外、超声等信号,这些信号应用范围狭窄,并非场景感知任务焦点。目的二:场景重建,该项核心技术是SLAM,即同步定位与映射。SLAM是机器人在未知环境下移动,逐步构建周围环境的连续地图,并同时估计其在地图中位置的技术。传统的SLAM技术包含滤波算法和非线性优化技术。引入深度学习后的SLAM可以获得很多新方法、新任务和新表示。新方法主要途径有:①将深度学习集成到SLAM;②用深度学习方法替换传统的SLAM模块,以完成特征提取和深度估计;③在传统SLAM上加入语义信息,以完成图像语义分割和语义地图构建。基于深度学习的新方法主要为SLAM领域的自我优化或迭代,很少有方法从具身智能的角度出发。传统SLAM的任务主要是机器人由人类控制,或使用预定义的航点,或基于给定的路径规划算法进行导航。而新任务是:主动SLAM,即机器人可以自主行动,以实现更好的场景重建和定位。机器人可以主动完成主动映射和主动定位。新表示是指探索几何外观等经典属性之外的环境表示,旨在对层次结构、功能、动态和语义等属性进行建模。主要的表示形式有:①拓扑模型,构建描述环境连通性的拓扑图;②场景图,将环境建模为有向图,其中节点表示对象或位置等实体,边缘表示这些实体之间的关系。目的三:场景理解,理解场景信息是场景感知的重要组成部分。高效的理解过程(例如分割、识别和检测)为智能体理解复杂环境,场景理解不仅包括物体识别,还包括物体之间的空间关系和场景帧之间的时间变化。对于物体识别,常规的、主流的物体识别方法有:YOLO、MASKRCNN、ResNet,这些方法的局限性是难以利用机器人与环境的交互能力。具身智能的物体识别方法有:物理交互和更改视点。物理交互是指通过移动(触碰)物体实现更好的物体识别;更改视点则是通过移动改变自身在场景中的位置,结合多视角信息实现更好的物体识别。对于空间关系推理,主要涉及视觉检测和关系推理,相关的数据集以及空间关系推理的基准benchmark主要是:Rel3d、Spatialsense、openimages。对于时序变化检测,即场景变化检测,是指一个机器人在两个不同的时间探索环境,并识别它们之间的任何物体变化。物体变化包括环境中添加和移除的物体。常用数据集是:roboticvisionsceneunderstandingchallenge、ChangeSim、VL-CMU-CD和PCD。2.1.3行为感知不同于对物体、场景的感知,对人的感知需要人的行为,包括:手势识别、人体姿态检测和人类行为理解。机器人对人的行为感知有助于社交导航、自动驾驶人机和人机协作装配等交互应用。一个经典案例是:人机协作装配场景下防碰撞,除预测人类移动轨迹用于社交导航场景和机器人场景外,在工业场景中人机协作进行装配任务同样需要预测人类未来行为轨迹,以免机器人和人发生碰撞。人类行为理解即通过检测姿势、运动和环境线索来推断其正在进行的行为,该领域超越了对基本动作的识别,还包括对复杂行为的分析,例如人物交互、多人协作、动态环境中的自适应行为。最近的研究侧重于通过更深入的语义理解来建模这些行为。例如统一的动作-语言生成预训练模型MotionGPT,其将人类动作视为一种外语,引入自然语言模型进行动作相关生成。该模型的功能包括:给定文本生成动作,给定动作生成文本,动作扩增和文本动作描述生成等。另外,可理解人类动作和视频的大语言模型MotionLLM,其收集并构建了一个名为MoVid的大规模数据集和MoVid-Bench的基准测试,提出了一个结合视频和动作数据的统一框架,通过大语言模型来理解人类行为。2.1.4表达感知机器人可以通过获取人的面部表情、语音以及两种表情和语音模态信号的结合来感知人类的情感和意图。对于面部情感感知,面部表情数据采集一般是通过摄像头设备进行采集,主要目的是完成特征提取,例如几何特征(关键点坐标)、纹理特征(局部二值模式,LBP)和动作单元(ActionUnits,AU)等。面部情感识别的主要挑战有:复杂环境下的面部情感感知,可能包括光照变化、姿态变化、遮挡和不同的背景场景等,对准确性和鲁棒性要求更高。对于语音情感感知和多模态情感感知,其中语音情感感知是从人类的语音信号中提取音高、音调、节奏、音色等特征作为输入。表示声音频率内容的图像形式主要是梅尔频谱图(Mel-spectrogram)及其梅尔频率倒谱系数(MFCC)。通过理解说话者的情感状态,系统能够做出更加人性化和智能化的响应,语音情感感知在客服机器人、智能助理、心理健康监测等领域有广泛的应用。多模态情感感知是通过结合多种不同类型的数据源,如语音、面部表情、身体语言、文本等,来识别人类的情感状态,在本节特指结合人类的面部表情和语音来进行情感感知。相比单一模态的情感识别,多模态方法能够从不同维度捕捉情感特征,提高识别的准确性和鲁棒性。表达感知不仅可以帮助机器人获知用户的情感变化,还可以辅助机器人进行对人类意图的推断。意图推测的精确度对于提升机器人在人机交互中的表现、提高用户体验和满意度具有重要意义,未来的机器人一定是能够“理解”人的想法的机器人。例如Figure01机器人(基于OpenAI大模型)听到人类说“我饿了”之后,准确领悟到了人类的意图,选择了苹果放到盘子中。具身感知小结:感知能力强和有一定的推理能力,就可以成为一个很好的机器人落地产品,例如服务机器人、人机协作场景下机器人、社交导航机器人、环境探索机器人。感知能力也可以为抓取、操作等执行任务提供帮助,在端到端执行模型性能达标前,抓取等任务更多依赖感知能力。多模态大模型处理语言、2D图片、3D数据都没有超出我们的想象。但能处理交互数据的大模型还没有出现。基于已有大模型,依赖人类先验设计模型结构或训练算法来弥补这个缺陷?人类先验或许不那么有效。学习完具身感知的内容之后,让我们再次回顾机器人跨越障碍的示例。具身感知获得了信息,那么当机器人感知到信息后,利用信息可以做些什么?这便涉及到后续的关键环节,具身推理,可以说这个环节是机器人能跃过障碍的关键!在这个场景下,对于机器人而言,它的任务是跃过障碍,而它需要规划的内容起跳及落地后关节扭矩及角度设置。这是它需要利用信息进行推断的内容。2.2具身推理具身推理包含任务规划、具身导航和具身问题三个主要内容。2.2.1任务规划任务规划(TaskPlanning)是具身智能的核心任务之一(另一个核心是技能学习),目的是将抽象的非可执行人类指令转换为具体的可执行技能。完成人类指令只需要两步:人类指令分解为机器人可执行的技能,然后执行技能。例如,人类对机器人说我渴了,可以帮我拿杯水放桌上吗?机器人在获取到指令后,会首先移动到水瓶附近,然后拿起水瓶,接着移动到桌子附近,最后把水放到桌上。在任务规划中,通常假设机器人有一组可执行技能集,潜在含义一:机器人并非万能,技能集之外的不能执行;潜在含义二:需要显式的指定技能,“你先拿捏住”这种自然语言要解析才能被执行。与轨迹规划的区别是:任务规划将人类指令分解为给定技能集的离散技能序列,而轨迹规划是为机器人执行操作技能生成连续7-DOF轨迹。任务规划的难点是需要理解人类指令、周围环境和技能集合。任务规划的关键问题主要有:①结构化,大模型输出自然语言,需要解析后才能被程序使用,可能出现未精准匹配,无法映射为单技能的情况;②可行性,结构化的动作不具备执行的可行性,例如操作不存在的物体,物体离机器人太远,物体不支持操作;③有用性,即使结构化的动作、被操作物体可被执行,它们还应该是有助于完成任务的。任务规划的两种关键信息:①观测信息,包含场景描述、物体列表、图片。不同类型的观察信息有不同的特点。②反馈信息,即使通过可行性检测,机器人仍有可能执行技能失败,此时反馈信息很重要。任务规划早期方法主要有专家系统和统一建模语言,如STRIPS,PRODIGYAI,SHOP2等专家系统,使用不同的形式化建模和搜索策略。又如统一规划建模语言PDDL和ASP,简化问题求解器的开发。最新的方法是结合大模型的任务规划,将大模型作为转换器,可以zero-shot进行任务规划。例如LLM+P,用LLM将状态信息描述成PDDL语言再进行规划,取代以往需要人工针对实际问题书写PDDL语言对任务进行建模。此外,结合大模型(多模态大模型)、小模型,构建以图片、自然语言、代码构建提示词(Prompt),设计管线(Pipeline)框架的具身智能体。提示词中还可以加入记忆、反馈等信息,以充分利用大模型的图文理解能力、推理能力。让我们又一次回顾短视频中的一个片段,如图6所示,机器狗需要穿过障碍到达前方。在这个场景下,当机器狗完成任务规划后,需要进一步开启具身导航以完成任务。那么,什么是具身导航,这里面又有哪些关键技术?图6机器狗穿越前方障碍2.2.2具身导航具身导航(EmbodiedNavigation)是指智能体在3D环境中移动完成导航目标。目标的形式可以是点、物体、图像、区域等。目标可以结合声音、自然语言指令、人类先验等。2000年以前主要以传统导航方法为主,主要是基于规则开展导航方法的设计与研究。通过构建一系列基于规则的组件和算法,实现有效的环境感知、定位、路径规划和避障。早期关键技术包括SLAM建图技术、路径规划算法以及避障算法。优点是鲁棒性强、计算效率高、实现方法简单、确定性高。缺点是适应性差、依赖地图,建图成本高、缺乏学习能力。2000年-2022年之间,主要以基于学习的导航方法为主,基于学习的导航利用深度学习与强化学习技术,提高了模型对复杂环境和新场景的泛化能力。不同于传统算法依赖预定义的规则和手工设计的特征,基于学习的导航算法从大量数据中学习环境特征和导航策略,实现强自适应性和高灵活性。按照输入模态可以分为:视觉导航和视觉语言导航。视觉导航是基于学习的导航的一个重要分支,它依靠计算机视觉来理解环境信息并做出导航决策。面临的主要挑战包括:如何从视觉输入中提取有用的信息;如何理解和记忆环境的布局;如何规划路径。视觉语言导航是通过通过自然语言指令和视觉图像进行导航的任务,其目标是开发一种能够与人类进行自然语言交流并在现实3D环境中导航的具身智能体。根据时间节点分为大模型之前的视觉语言导航,结合语言大模型(LLM)的具身导航两种。在大模型出现之前,主要通过RNN,LSTM,Transformer等网络来提取命令中的语义信息。而后续,则利用大模型作为辅助来帮助规划器输出规划或者大模型直接作为规划器来输出规划。2022年大模型的出现显著改变了视觉语言导航领域的发展,大模型或者视觉语言联合预训练模型如CLIP等,为该领域带来了新的方法和思路,使得视觉语言导航系统变得更加智能和鲁棒。根据大模型的作用不同,分为:视觉语言联合预训练模型的应用、大模型基于构建的地图输出规划、大模型基于图片转换的文本描述输出规划。2.2.3具身问答具身问答任务最早由Dasetal.提出,该任务下机器人需要主动探索环境,定位目标物体或位置,获取环境中的信息,然后基于获取的信息回答问题。该任务可视为导航、VQA任务的结合,相比于VQA等已有问答任务,具身问答的特点在于机器人具有主动行动能力。在短视频也有这样一个场景,即机器狗结合大模型可以清楚的知道它的前方有什么?并且也能知道物品名称。这本质上已经赋予了机器人主动感知和理解外界环境的能力。最早的具身问答论文主要关注于一个模块处理一个子任务,路径规划模块负责导航任务,视觉识别模块负责目标识别任务,问答模块负责生成自然语言回复任务。后续研究人员对该论文进行了一系列的优化,例如Luoetal.针对嘈杂环境设计鲁棒性更强的导航、问答模块,并提出两阶段鲁棒学习算法;Lietal.提出Model-basedRL的EQA算法,通过“想象”下一个子目标环境图片,提高探索效率,并使得智能行为更加具有可解释性;Chaplotetal.多任务联合学习,将文本信息与视觉特征融合。具身推理小结:在推理任务上,大模型具有非常显著的优势,其相比于小模型推理能力有了显著的提升。基于大模型构建具身智能体是一个非常自然的选择,但也存在许多问题,如推理速度慢,推理开销大;生成结果不够稳定;复杂的Agent结构难以维护,且时间开销会更大。2.3具身执行具身执行是智能体在与真实环境的交互中不断学习,并且在学习过程中持续交互数据的过程。机器人需要利用感知信息和推理结论调节末端执行器的位置、朝向、末端状态以成功执行任务。具身执行主要内容包含基于规则、基于学习和基于大模型的具身执行。在具身执行中仅学习一项内容:技能学习。所谓技能学习,是指以技能描述、环境观察为输入,输出完成技能所需的7Dof轨迹。7Dof轨迹主要指:人手腕或者机械臂末端执行器的位置、朝向、末端状态。主要为手部操作,虽然不足以表达人或机器人全部动作空间,但足以覆盖生活中绝大多数技能。技能学习包含两类方法:模仿学习和强化学习。模仿学习是指收集专家演示数据,用神经网络拟合。强化学习是指设计奖励函数,机器人通过交互学习行为策略。这里行为策略表示给定技能描述,在当前观察下,选择动作执行。两种方法的本质差别在于,模仿学习从样例中学习,机器人学习过程中不与环境进行交互,样例一般也是提前收集的交互样例数据,也可以算广义的交互学习。强化学习则从交互中学习,机器人学习过程中与环境进行交互。2.3.1模仿学习模仿学习主要理解并复制人类或机器人行为。常用的数据采集方法包含基于通过摄像头捕捉的专家演示,此时摄像头通常安置在执行主体的手腕、头部或侧面。使用动觉教学(手动接触)、VR、手柄、GUI界面控制等作为演示数据来源。在演示过程中,将收集到的专家演示包括一系列观察和行动作为演示数据,这些数据展示了末端执行器或关节的位置或者速度。模仿学习的核心是学习行为策略,将观察映射到连续动作空间。同学们,模仿学习就像临摹字帖——先观察大师笔法,再揣摩力道节奏。但临帖不是终点,最终要写出自己的风骨。科研也一样,既要虚心学习前辈经验,更要融入独立思考和创造,这才是站在巨人肩膀上的真正意义!对于机器人而言,模仿学习可以分为两部分:①对图像的编码,②图像表示映射到动作。一般而言,图像的编码器使用预训练的视觉编码器更好,如果只使用样例数据集训练编码器会导致实际应用中缺乏泛化性。另外,机器人的动作空间一般是连续的。对于连续动作值的预测一般有直接策略、隐式策略和扩散策略三类。对于直接策略,其是最经典、使用最广泛的策略学习算法,是将图像编码后直接映射到动作,简而言之是一种行为克隆。与其它策略唯一的区别在于损失函数的设计,即预测的动作值与真实动作值之间的损失。该策略具有广泛的影响力,包括RT-1、RT-2在内的具身多模态大模型均采用该方法。同时,直接的动作映射存在一些问题,包括:轨迹不连续以及多种模式(存在多种轨迹)。针对直接策略中存在的问题,Florenceetal.提出隐式策略,不直接建模条件概率分布,而是建模观察与动作的联合概率分布。在实际推理中,需要基于联合概率分布,基于优化的方法寻找最优动作。为机器人生成动作,本质是生成轨迹,因为生成动作一般不是预测一个动作,而是生成动作序列。轨迹生成需要考虑序列的连贯性,因此有研究者将其他领域中的生成方法引入策略学习中,例如使用联合概率建模实现隐行为克隆;受扩散模型生成图片的启发,利用扩散策略生成轨迹序列。2.3.2强化学习强化学习主要是以奖励函数为指导的交互学习框架,由于之前的课堂内容已经讲授过,因此这里简单介绍一下强化学习在具身智能中的应用。在具身智能中,强化学习专注于如何让智能体在环境中采取行动以最大化某种累积奖励。基于与环境的交互,智能体学习选择最佳行动,逐步改善其行为策略。另外,强化学习应用广泛,在自动驾驶、游戏、机器人控制等领域中有较大应用潜力。强化学习包含无模型强化学习和基于模型的强化学习两种,其中无模型强化学习直接从环境交互学习最优策略或价值函数,依赖尝试和错误经验提升策略性能。优点是能学习复杂行为,无需构建显式的环境模型,然而存在的挑战问题是可能需大量环境交互,样本效率较低。基于模型的强化学习通过学习环境的动态模型,以规划或预测未来状态。通过“想象”未来的环境状态,提高样本效率,减少实际交互需求。优点是具备更高的效率和规划能力,然而挑战问题是环境模型的建模准确性对性能的影响较大。具身执行小结:目前大模型用于具身执行会存在很多问题,例如推理速度慢、数量需求大、可解释性差。但是具身执行强调泛化性,对物体位置、形状、场景、技能、机器人类别各种维度上的泛化性,泛化性也是目前最主要的挑战。因此大模型仍然是具身执行未来的趋势。目前使用大模型压缩大量数据,实现了比较好的拟合效果,在真实场景数据上也有很好的泛化性,仍然是最有可能实现通用执行模型的方式。虽然目前10B量级以下大模型的能力不断增强,但是1B以上的模型规模是有必要的。如果不在具身执行上取得突破,实现一个通用执行模型,那么科幻电影中的智能人形机器人就永远不会到来,人工智能也只存在于命令行和对话界面上。三、具身智能行业应用2023年,宇树正式发布首款通用人形机器人H1,H1是国内第一台能跑的全尺寸通用人形机器人,拥有360°全景深度感知,在机动性、灵活性等方面具备优势,移动速度达到世界领先水平。同年7月,宇树推出了Go2具身智能新物种,也就是Go2四足机器狗。通过GPT提供的语言能力和知识库,Go2可以理解主人的意图,结合传感器信息更好地理解世界和做出决策。到了2024年11月,中国宇树科技正式宣布其G1人形机器人的量产。G1机器人是宇树科技在多年来积累的技术基础上开发的一款高智能人形机器人。其搭载了先进的深度学习算法、计算机视觉和语音识别技术,使得其具备自我学习与适应环境的能力。设计灵巧的G1不仅可以进行简单的日常互动,还能够学习新的任务,例如家庭助理、教育辅导等。除了国内的科技公司在大力开发具身智能应用外,国外的科技公司同样热衷于此。例如Tesla推出了Optimus的二代版本,其能力比一代有了长足的进步。但目前其技术细节并未公布。Figure联合OpenAI造出了一款人形机器人Figure01,其具备强大的与人深入交流,同时独立做出决策和执行命令的能力。通过OpenAI多模态大模型提供视觉和文本的理解能力,并通过策略神经网络提供快速、低级、灵巧的机器人动作。对于Figure01,它现在能够做到:描述它看到的一切情况;思考输入的视觉和文字信息;规划未来的行动;语音输出它的推理结果。接下来我们观看一个关于Figure01的介绍视频。图7Figure01介绍视频2024年8月,Figure发布了第二代人形机器人Figure02,其搭载了机载的视觉语言模型(VLM),板载计算和AI推理能力较初代产品Figure01提高了3倍,能够在现实世界中自主执行多种复杂任务。同样的,我们观看一个关于Figure02的介绍视频。除了这些之外,还有一些海外代表性公司和产品。例如早在2011年,本田就研发了Asimo机器人,但是在20年终止了研发。AgilityRobot在2018年研发了Digit机器人,用于物流和工业制造领域。2023年SanctuaryAI研发了一款结合结合LLM/人工智能的通用机器人phoenix。同样,国内也有一些代表性的公司和产品,例如在2021年优比选研发了一款用于生活服务的机器人WalkerX,目前优比选的市值超过了1000亿。
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 房建工程建筑机器人协同施工可行性研究报告
- 某电子厂品控管理准则
- 黄褐斑诊疗共识要点2026
- 2026防疫辅助面试题及答案
- 人工智能提升银行服务体验
- 2026国投面试题及答案
- 云计算在银行应用
- 2026教育艺术面试题库及答案
- 云计算支持下的智能银行架构
- 公司财务个人年终工作总结
- 特种设备分级管控清单
- 妊娠合并地中海贫血的护理查房
- 茶叶末釉制备工艺的研究
- ODCC:2023数据中心绿色设计白皮书
- CECA/GC1-2023年建设项目投资估算编审规程
- 部编版三年级语文上册单元测试第七单元基础达标卷答案
- GB/T 35260-2017公共汽车维护技术规范
- GB/T 11809-1998压水堆核燃料棒焊缝金相检验
- GA/T 950-2019防弹材料及产品V50试验方法
- 跨省转学操作方法
- 冲床设备日常点检表
评论
0/150
提交评论