版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
工业机器视觉人工智能应用实践
--4.3基于大模型的具身智能应用1.1基于大模型的具身智能应用1.1.1视觉及语言大模型1.主流视觉及语言大模型的基础知识1)基础概念语言大模型是通过海量文本数据训练的深度学习模型,能够理解、生成和推理自然语言。其核心思想包括自注意力机制和预训练+微调范式:自注意力机制通过计算词与词之间的相关性权重(见图1),其中Q(Query)、K(Key)、V(Value)是输入序列的线性变换结果。具体而言,给定输入序列的嵌入表示矩阵X∈R^(n×d),通过线性变换生成Q、K、V矩阵(式(公式1))。该机制通过计算不同位置的注意力权重,实现全局依赖建模,同时有效捕捉长距离依赖关系,如句子中前后词的关联等。1.1基于大模型的具身智能应用(公式1)2017年,谷歌发布的Transformer架构为语言模型研究带来了革命性改变,通过自注意力机制实现了对输入序列的全局建模。基于这一架构的模型,如BERT和GPT,在多项NLP任务中表现出色,极大地推动了自然语言理解与生成的发展。例如,大型语言模型(LLM)通过自监督学习技术,它在理解及生成类人文本方面的卓越表现,归功于在海量数据上的预训练以及针对特定任务的精细微调。1.1基于大模型的具身智能应用图1自注意力机制计算过程示意图在视觉大模型领域,ViT(VisionTransformer)的出现为视觉大模型带来了新突破,它将图像分割为N×N的块(Patches),以16×16最为常见,每个块通过线性映射为向量χ_i,并添加位置编码P_i(公式2),经过多层Transformer编码器后,输出特征通过全局平均池化进行分类。此外,CLIP和DALL-E等为代表的多模态融合技术,凭借对比学习或生成式目标的方法,成功实现了图像与文本的联合表征,从而为视觉大模型的发展开辟了新的道路。1.1基于大模型的具身智能应用(公式2)2)技术架构在自然语言处理领域语言大模型的核心架构主要基于Transformer,分为编码器-解码器和仅解码器两种范式。BERT模型采用仅编码器架构,并通过掩码语言模型学习双向上下文表征,这使得它在自然语言处理任务中表现出色,特别是在文本分类和实体识别等任务上。GPT系列则基于仅解码器架构,以自回归方式逐词预测生成文本,通过因果语言建模实现流畅的文本生成。
视觉大模型的架构近年来也取得了显著进展。ViT(VisionTransformer)将图像分割为固定大小的块(如16×16),经过线性映射和位置编码的处理后,这些图像块被送入Transformer编码器,从而完全摒弃了传统的卷积操作(见图2),此图呈现了ViT的结构。在其整体流程方面,左侧展示了ViT处理图像的全过程,即先把输入图像分割成多个Patch(图中有分割示例),每个Patch经线性投影转化为向量,并添加位置嵌入,同时还有额外可学习的类别嵌入。随后,这些经过处理的向量被传递给TransformerEncoder,以进行特征提取和处理,最后输出的特征由多层感知机(MLPHead)完成分类,最终得出如鸟类、球体、车辆等具体类别的分类结果。而右侧则详细展示了TransformerEncoder的内部构造,嵌入后的Patch向量先归一化,接着进入多头注意力机制模块捕捉不同位置特征的关联,随后再归一化并进入多层感知机进一步处理特征,如此循环L次。1.1基于大模型的具身智能应用总的来讲,ViT是一种基于Transformer的深度学习模型,它通过将图像分割成固定大小的patch块,并将这些块视为序列数据,利用Transformer进行注意力机制的计算,从而实现对图像的特征提取与分类。ViT模型的核心优势在于其能够捕捉图像中的长距离依赖关系,同时保持对局部特征的敏感性。这种结合了Transformer在自然语言处理中的优势与计算机视觉中的卷积神经网络优势的模型,在图像分类和分割任务中表现优异。1.1基于大模型的具身智能应用
图2ViT处理图像流程图2.典型模型与参数规模在语言大模型领域,有着众多极具代表性的成果。GPT-4由OpenAI研发,采用MoE稀疏架构,参数量约1.8万亿,训练数据涵盖文本、代码、多模态数据,高达13万亿token,训练成本为6300万美元。它具备强大的核心能力,支持多模态输入,可进行图像与文本的联合推理;拥有128000token的长上下文处理能力,能够处理整本书的内容;还擅长复杂逻辑推理,例如解决数学奥林匹克问题。Meta的LLaMA3模型有两种参数规模,其中70B版本拥有700亿参数,使用了超过15万亿个token的训练数据集进行训练。其优势在于开源可商用,并且支持本地部署,同时进行了低资源推理优化,甚至能够在手机端运行。而在视觉大模型和多模态大模型方面,也有出色的代表。OpenAI的DALL-E3参数量约120亿,基于数亿图文对进行训练,能够生成高分辨率达1024×1024的图像,还可以精确还原文本中的细节,如“蒙娜丽莎戴着墨镜”这样的描述。Google的ViT-22B参数量为220亿,使用JFT-4B数据集(40亿标注图像)训练,在图像分类任务中表现优异,ImageNet准确率达到90.1%,且具备零样本迁移能力,无须微调就能直接适应新任务。1.1基于大模型的具身智能应用谷歌推出的GeminiUltra模型,作为多模态大模型的代表,拥有约1.56万亿的参数量,其训练数据涵盖了文本、图像、视频和音频等多种类型。该模型具备原生的多模态推理能力,能够解析科学论文中的图表,并且在视频理解方面实现了时序动作识别。三种大模型的关键参数,见表1。1.1基于大模型的具身智能应用
表1三种大模型的关键参数模型类型参数量训练数据核心能力GPT-4语言大模型约1.8万亿13万亿token(文本、代码、多模态)多模态输入、128000token长上下文、复杂逻辑推理(如数学问题)LLaMA3语言大模型700亿1.4万亿token(公开数据集)开源可商用、本地部署优化、低资源推理(支持手机端运行)DALL-E3视觉大模型约120亿数亿图文对高分辨率图像生成(1024×1024)、精确还原文本细节ViT-22B视觉大模型220亿JFT-4B(40亿标注图像)ImageNet准确率90.1%、零样本迁移能力GeminiUltra多模态大模型约1.56万亿文本、图像、视频、音频原生多模态推理(解析图表、视频理解、时序动作识别)3.大模型能力与应用场景在人工智能领域,语言大模型展现出了强大且多样的能力,能写故事、论文、代码和诗歌。它具备卓越的推理能力,能解决复杂数学问题和逻辑难题。在代码调试方面,它能准确识别并修复错误,同时支持多语言翻译、跨语言生成,还能调用工具提升应用范围。视觉大模型同样在人工智能领域占据着重要地位,拥有丰富的功能。其具备图像分类、分割和目标检测等基础能力,能生成和编辑高质量图像,多个模型在细节与性能上表现突出。同时视觉大模型具备跨模态对齐能力,能精准匹配图像与文本。在视频处理方面,它能生成视频、识别动作并分析事件时序,为视频相关的应用提供了强大的支持。1.1基于大模型的具身智能应用1.1.2Grounded-SAM2、语言大模型与具身智能1.GroundingDino、语言大模型与具身智能1) GroundingDinoGroundingDino是一种基于DETR改进的多模态目标检测模型(见图3),在该跨模态模型中,输入部分清晰展示于左侧,包含文本示例(如“Acatsitsonatable”)及对应图像(一张猫坐在桌上的图片),文本通过文本主干网络被提取为初始文本特征,而图像则经由图像主干网络转化为初始图像特征。接着,这些初始特征被送入特征增强层,在该层中,通过文本到图像的交叉注意力、图像到文本的交叉注意力及自注意力机制,文本特征与图像特征相互融合,实现特征表示的增强,最终输出更新后的文本与图像特征。接着,更新后的特征用于语言引导查询选择模块,生成关键值和跨模态查询,二者进入跨模态解码器,经过多层跨模态解码层处理,每个解码层中文本特征和图像特征通过文本交叉注意力、图像交叉注意力和前馈网络进一步交互,产生更新的跨模态查询。解码器的输出用于计算对比损失和定位损失,最终得出模型输出,比如文本中提及物体在图像中的识别结果。此外,特征增强层通过引入交叉注意力机制,有效捕捉文本和图像特征之间的依赖关系,实现双向交互与增强,从而为后续处理提供更具表现力的特征。1.1基于大模型的具身智能应用该模型拥有零样本检测的能力,无须针对特定类别训练,凭借文本输入就能检测任意目标;通过对比学习实现跨模态对齐,让图像区域与文本描述的特征相匹配;采用基于Transformer的高效端到端检测框架,摒弃了传统检测模型中的手工设计组件,如锚框。这一系列先进技术的运用,使得模型在性能上远超同类产品,在智能检测领域树立了新的标杆
。
基于大模型的具身智能应用
图3GroundingDino的模型架构图2) 具身智能具身智能,本质上是“具身+智能”的融合,它通过将机器学习算法应用于各类物理实体,实现了与物理世界的有效交互,成为了一种崭新的人工智能发展范式。其核心包含“本体”“智能”“环境”三大要素:“本体”指的是硬件载体,“智能”涵盖大模型、语音、图像、控制、导航等多种算法,“环境”则是本体所交互的物理世界,这三者的高度耦合构成了高级智能的基石。为适应不同环境,硬件本体也呈现出多样的形态,比如在室内平地场景中,轮式机器人更为适用;而面对崎岖不平的地面,四足机器人(如机器狗)则更具优势。具身智能体在与环境的互动中,智能算法通过本体传感器精准感知周遭环境,迅速做出决策,并指挥本体执行相应动作,从而对环境产生有效影响。一个具身智能体的行动可拆解为“感知-决策-行动-反馈”四个步骤,分别由四个对应模块完成(见图4),以保障交互的流畅与高效。1.1基于大模型的具身智能应用
图4具身智能体四个模块的联系具身智能着重强调智能体通过物理或虚拟的身体与环境进行交互,以此来学习和决策,其核心是“感知-行动”闭环。具身智能的特点鲜明,智能体需要依靠物理传感器,比如摄像头、触觉传感器等,以及执行器,像机械臂等来实现具身性;在动态环境中,它要求智能体具备实时性,能够快速做出响应,如机器人在环境中避障;并且,具身智能会整合视觉、语音、触觉等多模态输入信息,以此来进行决策。3) 机器人运动控制机器人控制是技术领域中的一个核心分支,涵盖了机器人坐标系、运动学、动力学分析、轨迹规划以及控制策略等多个方面。机器人坐标系是机器人运动学和控制的基础,它用来描述机器人系统中的位置和姿态。机器人坐标系统主要由三个关键要素构成:位置信息、姿态描述以及参考坐标系的选择。“位置”指的是机器人末端执行器或工具相对于参考坐标系的空间位置,通常以三维坐标系来表示。“姿态”则描述了机器人的末端执行器或工具在空间中的旋转方向和角度,常用欧拉角或四元数来表示。参考坐标系作为确定坐标原点与轴线方向的基准,其选择可以依据机器人本体、工作台位置或外部固定点。常用的机器人坐标系有以下几种。1.1基于大模型的具身智能应用●关节坐标系:定义在机器人各个关节上的坐标系,它是每个轴相对其原点位置的绝对角度。●基座坐标系:定义在机器人基座上的坐标系,用来描述机器人本体运动。●世界坐标系:定义在某个固定空间上的标准直角坐标系,大部分情况下世界坐标系与基坐标系重合。●工具坐标系:用来定义工具中心点(TCP)位置和工具姿态的坐标系,原点位于机器人手腕法兰中心或工具中心。●用户坐标系:定义在工作台或工件上的坐标系,其原点和轴线方向可根据实际需要确定。1.1基于大模型的具身智能应用机器人运动学涵盖正向与逆向两大分支。正向运动学通过已知的关节变量,推算出末端执行器的位置与姿态;而逆向运动学则是根据末端执行器的已知位置与姿态,反推出所有关节的变量。轨迹规划是研究机械臂在空间中的运动轨迹,它是机器人控制的关键。控制是机器人技术的核心,其核心在于研究各种控制算法。例如,经典的PID控制通过比例(P)、积分(I)、微分(D)三个环节的巧妙组合,实时调整系统误差,实现稳定控制,具有结构简单、易于实施等优势。而模型预测控制则基于系统预测模型,通过滚动优化与反馈校正,在每个采样时刻求解有限时域内的优化问题,以确定当前最优控制输入,有效应对系统约束与多变量耦合问题,在复杂动态环境中展现出卓越的控制性能。目前市面上成熟的协作机器人和工业机器人厂商都内置了稳定的机器人控制算法和外部调用接口,可通过标准TCP/IP通信协议进行控制,提供了MoveJ(按关节运动)、MoveL(直线运动)、MoveC(圆弧运动)等多种常用运动类型。1.1基于大模型的具身智能应用2.主流视觉与语言大模型的架构、部署和调用方法及适用场景视觉大模型在架构上有着多样且强大的设计。Grounded-SAM2的架构颇具特色,它巧妙融合了GroundingDINO与SegmentAnythingModel2(SAM2)。GroundingDINO,作为一种先进的开放集目标检测模型,通过结合基于Transformer的检测器DINO与真值预训练,能够利用文本提示在图像中精准地识别出指定目标。它借助先进的算法和大规模数据训练,对文本语义与图像内容的关联理解能力较强,可有效定位图像中符合文本描述的物体,为后续的精细处理奠定基础。SegmentAnythingModel2(SAM2)是极具创新性的图像分割模型
(见图5),其强大的通用分割能力得益于在大规模数据集上的深入预训练。借助海量数据,模型得以掌握丰富的视觉特征,进而在面对新任务时展现出卓越的泛化性能。一个处理图像序列的模型流程(见图5),随着时间推移,一系列包含公鸡的图像依次进入绿色的图像编码器(imageencoder),将图像转化为特征表示。1.1基于大模型的具身智能应用接着,特征随后被送入蓝色的记忆注意力(memoryattention)模块,此模块能够融合过往图像的记忆信息,从而精准地凸显当前图像中的关键要素。下方的掩码(mask)、点(points)、框(box)等提示信息,经紫色的提示编码器(promptencoder)编码后,与记忆注意力模块的输出一同输入橙色的掩码解码器(maskdecoder),从而生成目标物体(公鸡)的掩码,图中以绿色显示在公鸡图像上。处理后的图像再由粉色的记忆编码器(memoryencoder)进一步编码后存入记忆库(memorybank),为后续图像的处理提供历史信息,形成一个循环反馈的处理机制
。通过循环神经网络(RNN)的循环连接和记忆单元,模型能够处理具有时序关系的图像序列数据。结合反馈机制,如反馈U-net方法在细胞图像分割中的应用,模型在连续图像分析任务中能够更精准地把握物体的动态变化和特征延续性。
基于大模型的具身智能应用
图5分割过程示意图其应用场景极为广泛:在图像编辑处理领域,它能实现自动检测、精准分割与高效编辑,如快速抠图合成;在自动驾驶领域,它能准确识别道路物体并进行分割,为决策系统提供有力支持;在医疗影像分析领域,它则能辅助医疗人员检测和分割病灶,显著提升诊断的准确性。语言大模型的架构同样丰富且各有特点,Qwen2.5在架构设计上采用了密集且易用的编码器-解码器架构,其理论基础是编码器负责将输入文本转换为高维特征表示,解码器依据编码器的输出生成目标文本,通过自注意力机制实现输入和输出间的对齐并捕捉长距离依赖关系。在部署与优化上,支持基于函数计算的部署,借助无服务器架构实现免运维、弹性伸缩和按量付费,函数计算平台能够自动高效地管理资源分配与扩展,完美适配突发性任务需求,不仅具备高可用性和显著的低成本优势,还特别适用于轻量级推理任务场景;支持基于GPU云服务器的部署,利用GPU的并行计算能力加速模型推理,借助分布式训练和推理技术,GPU集群能够轻松支持超大规模模型的部署工作;还支持本地部署与轻量化,运用模型压缩技术将大规模模型压缩至适合边缘设备运行的规模,如量化技术降低模型参数精度减少计算量和内存占用,目标是在保持模型性能的同时降低资源消耗。1.1基于大模型的具身智能应用在调用方法上,可通过HuggingFaceTransformers库调用,该库易用且灵活,支持多种模型架构和任务类型,借助Tokenizer将输入文本转换为模型可处理格式并生成输出;Ollama作为开源大模型部署工具,支持通过Docker容器实现模型的本地运行,兼容多种模型格式和硬件后端,特别适用于对高隐私和低延迟有严格要求的应用场景;支持通过vLLM进行高效推理,vLLM是高效大模型推理框架,通过优化内存管理和计算调度显著提升推理效率,支持API调用,具有灵活性和可扩展性,适合构建分布式推理系统。Qwen2.5采用了密集且易用的编码器-解码器语言模型架构,超大规模MoE(混合专家)架构使其支持多种模型大小。部署方式多样,包括基于函数计算的免运维、弹性伸缩、按量计费模式;依托人工智能平台,提供全链路AI研发支持,支持API和WebUI调用;利用GPU云服务器,显著加速推理过程,提高速度和吞吐量。调用方式灵活,支持通过HuggingFaceTransformers库加载模型和tokenizer处理文本,生成结果;或利用Ollama实现本地模型运行;亦可使用vLLM部署后,通过API进行聊天交互。其适用场景丰富,可用于打造聊天机器人,提供人性化交互;在内容创作领域高效产出高质量文本;助力教育学习,编写个性化材料和答疑辅导;以及在数据分析中从非结构化数据提取有价值信息,辅助企业决策。1.1基于大模型的具身智能应用3.智能体的原理、应用及构建方式智能体的原理涵盖核心机制、应用场景、构建方式等多个方面。在核心机制上,智能体凭借传感器(如摄像头、麦克风)感知环境,收集信息,并依据强化学习(RL)、规划算法(诸如MonteCarloTreeSearch)或大型模型推理制定决策,生成策略,最后借助执行器(如机器人关节、虚拟动作)执行动作,与环境进行交互。在应用层面,物理世界中,服务机器人诸如家庭清洁机器人(Roomba)、物流分拣机器人,以及采用多模态感知技术(激光雷达+摄像头)实现路径规划的自动驾驶系统,均展现了智能体的应用实例;在虚拟世界里,像《星际争霸》AIAlphaStar、NPC行为生成的游戏AI,还有结合TTS、STT与视觉模型的数字人虚拟助手也都依赖智能体。总的来说,技术协同在智能体中发挥着重要作用,如GroundingDINO用于开放词汇检测,TTS/STT实现人机对话,具身智能整合多模态输入完成复杂任务(如家庭服务机器人)。并且当前大模型正在降低具身智能的开发门槛,未来的重点则聚焦于多模态实时交互与低功耗部署(如端侧模型)。1.1基于大模型的具身智能应用综合实验——基于具身智能的机械臂控制1.1.3综合实验——基于具身智能的机械臂控制本实验结合视觉大模型进行目标检测与实例分割,并利用大型语言模型解析指令,实现机械臂智能抓取。视觉感知部分负责识别目标、分割物体,并通过高效推理加速计算。大型语言模型通过自然语言解析匹配相应的操作指令,机械臂根据操作指令计算抓取位姿并实现智能抓取物体。【实验目的】知识目标(1)理解视觉大模型在目标检测与实例分割中的应用。(2)理解大型语言模型函数调用中的原理和应用。能力目标(1)能够进行软件代码运行环境的配置以及相关硬件的配置。(2)能够部署视觉大模型(Grounded-SAM2)和大型语言模型(Qwen2.5),并完成推理测试。(3)具备结合视觉和大型语言模型实现机械臂控制的综合应用能力,实现智能抓取。1.1基于大模型的具身智能应用素养目标(1)培养学生严谨细致的工作态度和问题解决能力。(2)提高学生团队协作能力,通过小组项目完成任务。(3)提高学生对人工智能技术在实际工程中的理解与应用能力。【实验原理】本实验基于视觉大模型Grounded-SAM2进行目标检测与实例分割,结合Qwen2.5大型语言模型解析指令,实现机器人智能抓取任务。视觉感知模块通过GroundingDINO定位目标,SAM2进行分割,并借助Onnxruntime提升推理效率。大型语言模型负责解析自然语言指令,并通过函数调用自动匹配控制函数,实现机器人操作。同时,通过手眼标定进行坐标转换,确保机械臂精准抓取,最终结合模型推理,实现物体的智能抓取与放置。1.1基于大模型的具身智能应用【实验过程】使用视觉与大语言模型实现机械臂智能操控:首先构建代码结构并部署视觉感知模型,以实现目标检测与实例分割。随后安装大语言模型并完成手眼标定,确保机器人能够精准解析指令与执行抓取任务。然后通过运行主程序测试抓取与放置功能,最终实现智能机器人高效与可靠的智能操控。1.环境配置实验环境推荐使用Windows环境,需配置至少8GB显存的GPU一块。本实验基于windows11系统完成开发。具体的环境配置流程请观看视频讲解。2.代码结构该项目的整体代码结构见图6。使用视觉与大语言模型实现机械臂智能操控
图6整体代码结构●src:源代码所在目录;models:存放模型文件目录;tests:各模块的测试文件目录。●main.py:主程序入口文件,负责任务的整体调度。●calibrate.py:标定程序入口文件,用于执行手眼标定等校准操作。3.场景搭建本实验将基于视觉和大型语言模型实现机器人智能抓取物体,实验环境(见图7)。1.1基于大模型的具身智能应用
图7实验整体场景夹爪相机物料框4.实验流程以下为具体的实验流程。1)Grounded-SAM2模型的使用Grounded-SAM2使用Onnxruntime推理框架进行部署。Onnxruntime是一款高效的推理引擎,专门用于运行ONNX(OpenNeuralNetworkExchange)
格式的模型。它提供了多种计算后端,包括CPU、CUDA(NVIDIAGPU)等。在Grounded-SAM2部署过程中,需要先将Pytorch训练的模型转换为ONNX格式,然后利用Onnxruntime进行推理。本实验已经提供了预转换的ONNX模型,无须手动转换。使用时需要先将训练的Pytorch模型转换成ONNX模型,本实验提供了已转换的ONNX模型,位于models目录下(见图8):1.1基于大模型的具身智能应用
图8ONNX模型文件其中,groundingdino_swinb_cogcoor_quant.onnx和bert_base_uncased_tokenizer.json分别是GroundingDINO模型的权重文件和分词器词表文件。sam2.1_hiera_large.encoder.onnx和sam2.1_hiera_large.decoder.onnx分别是SAM2模型的编码器和解码器权重文件。GroundingDINO负责从图像中检测目标,并利用BERT分词器解析输入的文本提示。SAM2负责分割GroundingDINO检测到的目标,其编码器用于图像特征提取,解码器用于生成分割结果。为了方便测试,在tests目录下,预提供了一个简单的测试代码来执行Grounded-SAM2的模型推理和可视化。(1)使用Vscode打开该项目代码,并切换到llm_grasp虚拟环境。(2)在tests目录下选择tests\test_grounded_sam2.py文件,右击“在集成终端中打开”,在Vscode终端界面下输入如下命令(见图9)。pythontest_grounded_sam2.py1.1基于大模型的具身智能应用
图9命令操作1命令含义:运行test_grounded_sam2.py脚本文件。作用:运行test_grounded_sam2.py脚本,以测试Grounded-SAM2模型的推理效果,并可视化检测和分割结果。执行该程序文件之后,会弹出可视化窗口,展示模型推理的检测和分割结果(见图10)。1.1基于大模型的具身智能应用
图10模型推理后的检测和分割结果2)Qwen模型的使用大型语言模型的使用主要有云服务和本地部署两种方式。云服务使用方式简单,本地无需GPU即可使用,对硬件友好,能够使用较大尺寸规模的模型,回答问题的质量较高,但需要网络才能使用;本地部署需要根据CPU、内存和GPU等硬件资源选择合适尺寸的模型,通常只能部署小尺寸规模的模型,回答问题的质量相对于云服务会低一些,但无需网络,稳定性更高。可根据实际情况选择合适的大模型使用方式。本实验使用Ollama工具部署本地大模型。Ollama是一个开源的大模型部署工具,其通过docker容器部署和管理大模型,使得用户能够快速地在本地运行各种大模型。它简化了部署过程,通过简单的安装指令,用户可以执行一条命令就在本地运行大模型。CPU和GPU均可部署。Ollama安装流程请观看视频讲解。1.1基于大模型的具身智能应用大型语言模型的选择需要综合考虑模型尺寸和模型能力,模型能力重点考查指令遵循和函数调用能力。本实验选择Qwen2.5大模型。Qwen2.5是一款模型能力和模型参数较为平衡的国产开源大型语言模型。我们选择Qwen2.5-3B进行部署,该模型有30亿参数,在具有8GB内存的电脑上即可部署,如果硬件条件较好,可选择7b/14b/32b等更大尺寸的模型(“b”代表“billion”(十亿),表示模型的参数量以十亿为单位计算)。在Ollama部署工具中,如果使用GPU,Qwen2.5-3B模型加载需要2.8GB显卡内存,推荐配置内存为4GB及以上的显卡;如果使用CPU,则需要2.8GB内存,推荐配置8GB及以上的内存。(1)在Vscode终端任意目录下,输入如下命令并运行,拉取并运行Qwen2.5-3B模型(见图11)。ollamarunqwen2.5:3b1.1基于大模型的具身智能应用
图11命令操作2命令含义:使用ollama运行Qwen2.5-3B模型,其中qwen2.5:3b指定模型名称和版本。作用:自动拉取并执行Qwen2.5-3B以进行推理任务。完成后,在出现界面中输入任意文字进行模型测试(见图12)。1.1基于大模型的具身智能应用
图12Qwen模型测试界面Ollama兼容OpenAI-API协议,支持下游应用通过HTTP接口调用。OpenAI-API是由OpenAI提出的一种大模型接口调用协议,之后许多大模型服务商也兼容了该协议,使得用户可以在应用中灵活地切换大模型服务商。如果需要切换成大模型云服务提供商的线上模型,则只需修改src/config.py中的模型名称、模型服务地址和API密钥即可,见图13。1.1基于大模型的具身智能应用
图13大模型应用配置文件(2)在tests目录下,提供了一个简单的测试代码通过HTTP接口调用ollama模型。在Vscode终端界面下输入如下命令(见图14)。pythontest_llm.py命令含义:使用Python解释器运行test_llm.py脚本。作用:通过HTTP接口调用Ollama模型,测试其推理功能并返回结果。该大型模型有如下几个常用的参数,可在一定程度上控制大模型输出的变化。1.1基于大模型的具身智能应用
图14命令操作3●temperature:温度参数。控制模型输出的随机性,较高的值会让生成内容更加多变,而设为0时,相同输入始终得到相同的结果,适用于需要确定性答案的场景。●top_p:单步累积采样阈值。控制模型生成文本时多样性的参数,它决定了模型在每一步生成时,从概率最高的一部分单词(Token)中进行采样,而不是简单地选择最有可能的单词。也就是说,其影响模型在每一步生成时选择的词汇范围,较大值允许更广泛的词汇选择,使生成结果更丰富,而较小值会让输出更集中、可控。3)手眼标定手眼标定方法同4.1节实验内容中的标定环节。(1)在项目目录内,在Vscode终端界面下输入如下命令(见图15)。pythoncalibrate.py--modeacquire1.1基于大模型的具身智能应用
图15命令操作4命令含义:运行calibrate.py脚本,并通过--modeacquire参数指定执行数据采集模式。作用:采集标定所需的数据,包括标定图片、标定板圆心坐标及机械臂当前位姿,并将数据保存至data\calibration\目录下。运行后,在data\calibration目录下会保存标定图片、标定参数、末端姿态数据(见图16),这些数据将用于计算相机到基座坐标系的旋转矩阵。1.1基于大模型的具身智能应用
图16标定后的数据文件另外,通过图17可以更直观地理解这几种标定数据的存在意义。●标定图片(xxx_image.png):用于计算相机的外参矩阵。●标定参数(xxx_points.npy):存储标定板上所有圆心的坐标(n×2矩阵)。●末端姿态数据(xxx_pose.py):记录采集图像时机械臂的位姿信息。1.1基于大模型的具身智能应用
图17标定示意(2)在Vscode终端界面下输入如下命令(见图18)。pythoncalibrate.py--modecompute1.1基于大模型的具身智能应用
图18命令操作5命令含义:使用Python解释器运行calibrate.py脚本,并通过--modeacquire参数指定执行数据采集模式。作用:采集标定所需的数据,包括标定图片、标定板圆心坐标(n×2矩阵)及机械臂当前位姿,并将数据保存至相应目录下。运行后,在data目录下会生成calibration.npy文件(见图19),该文件保存了使相机坐标系转换到基座坐标系的旋转矩阵,用于后续的手眼标定计算。1.1基于大模型的具身智能应用
图19用于坐标系转换的旋转矩阵4)智能体工具(1)智能体工具的本质。智能体使用的工具实际上是一个函数,函数内部封装了工具的业务逻辑,并且有一个唯一的工具名称。在需要使用工具时,大模型返回工具名称和所需参数的值,应用层根据大模型返回结果调用对应的函数完成工具调用。①工具的组织方式。对于本实验内容,我们将物体抓取分解成抓取和放置两个动作,每个动作都封装成一个工具类,这个类具有统一属性和调用接口。每个工具类均有description和parameters属性和一个call方法。●description:其参数是对工具的功能描述。●parameters:函数调用输入参数的描述,包括参数名称、类型、参数功能描述、是否必需等。●call方法:其内部封装了视觉推理、机器人控制、夹爪抓取等业务逻辑。1.1基于大模型的具身智能应用②工具注册。每个类通过register_tool函数注册到系统工具集中,在大模型对话时将自动将工具的参数信息转换成提示词发送给大模型。③物体抓取和物体放置工具的定义。物体抓取工具(GraspObjectControl):执行抓取操作,主要包含物体识别、夹爪控制等逻辑,见图20。1.1基于大模型的具身智能应用
图20物体抓取工具定义物体放置工具(PutObjectControl):比抓取工具多一个position参数,见图21,这使得物体放置更加灵活,可以支持将抓取物体放置在目标物体的不同方位的描述,如“放在料框里”、“放在梨边”。值得注意的是,而物体放置工具比物体抓取工具多了一个position参数,这使得物体放置更加灵活,可以支持将抓取物体放置在目标物体的不同方位的描述,如“放在料框里”、“放在梨的左边”。1.1基于大模型的具身智能应用
图21物体放置工具定义④基于Qwen2.5大型语言模型转换后的提示词见图22。1.1基于大模型的具身智能应用
图22提示词转换不同的大模型可能具有不同的函数调用提示词模板,在使用过程中需要特别注意。此外,为了提高大模型在特定领域的回复准确率,建议在提示词中加入让大模型扮演特定领域专家角色的指令和输出内容的限定。如图22中的系统提示词,我们让大模型扮演了一个机器人工具助手,并根据是否调用工具进行判断输出。完整的工具实现请参考src\tools.py文件。同时,在tests目录下,提供了一个简单的测试代码来测试大模型的函数调用功能。在Vscode终端界面下输入如下命令(见图23)。pythontest_function_call.py命令含义:运行test_function_call.py脚本。作用:执行测试代码,验证大模型是否能正确解析提示词并调用相应的工具函数。1.1基于大模型的具身智能应用
图23命令操作65)抓取和放置位姿计算(1)抓取位姿。抓取位姿由位置(position)和姿态(pose)组成。位置描述了物体在空间中的具体位置,姿态描述了旋转角度。通过手眼标定,我们得到了相机坐标系到机械臂基座坐标系的变换矩阵(_camera^base)M,给定任意一个相机坐标系下的坐标点a=〖[x_a,y_a,z_a,1]〗^T,可求得该坐标点在基座坐标系下的坐标为:b=〖[x_b,y_b,z_b,1]〗^T=(_camera^base)M∙a我们可以直接获取图像的像素坐标点,但无法直接获取相机坐标系的坐标,需要根据像素坐标系与相机坐标系的变换关系求解得到。相机坐标系到像素坐标系的转换关系为c=〖[u,v,1]〗^T=K∙a=[■(f_x&0&c_x@0&f_y&c_y@0&0&1)][■(x_a@y_a@z_a)]1.1基于大模型的具身智能应用其中,f_x和f_y分别为在x和y方向上的焦距,c_x和〖c〗_y分别为在x和y的主点坐标,z_a为已知深度值。则有:x_a=z_a*(u-c_x)/fx, y_a=z_a*(v-c_y)/fy本实验采用
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026及未来5年中国双层仿木门数据监测研究报告
- 2026事业单位工勤技能-广东-广东电工二级(技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-广东-广东地质勘查员四级(中级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-天津-天津客房服务员二级(技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-四川-四川水工闸门运行工四级(中级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-吉林-吉林汽车驾驶与维修员二级(技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-内蒙古-内蒙古水工闸门运行工三级(高级工)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-云南-云南殡葬服务工一级(高级技师)历年参考题库含答案详解3套试卷
- 2026事业单位工勤技能-上海-上海热力运行工一级(高级技师)历年参考题库含答案详解3套试卷
- 2025年度成都历史文化知识竞赛考试试卷及答案
- 2026-2027学年第一学期学校安全教育主题班会记录
- 2026年幼儿园教师招聘保教知识与能力试题库
- 2026年山东将军开元纸业有限公司招聘(13人)笔试参考题库及答案详解
- 2026-2031年中国城市规划行业市场深度调研及发展战略研究分析报告
- 2026年乾安县公开招聘公益性岗位人员(100人)考试备考试题及答案详解
- 2026交管12123学法减分题库200题(含答案完整版)
- 2026年北京市高考化学试卷(含答案)
- T-SXCAS 038-2024 民用建筑低碳供暖系统设计标准
- 外墙内保温施工方案
- 2024年国家大剧院公开招聘专业技术及一般管理人员33人历年高频500题难、易错点模拟试题附带答案详解
- pvc地胶施工工艺演示
评论
0/150
提交评论