机器人感知智能 教案-第3章 机器人视觉感知_第1页
机器人感知智能 教案-第3章 机器人视觉感知_第2页
机器人感知智能 教案-第3章 机器人视觉感知_第3页
机器人感知智能 教案-第3章 机器人视觉感知_第4页
机器人感知智能 教案-第3章 机器人视觉感知_第5页
已阅读5页,还剩36页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

PAGEPAGE27授课周次第周授课时间2024年月日至2024年月日课程章节第三章机器人视觉感知3.1机器人视觉感知的介绍1、机器人视觉感知概述2、机器人视觉感知系统的组成3、机器人视觉感知发展教学目的1、理解机器人视觉感知概念2、理解机器人视觉感知系统的组成3、机器人视觉感知发展内容提要及板书设计第三章机器人视觉感知3.1机器人视觉感知的介绍1、机器人视觉感知概述2、机器人视觉感知系统的组成3、机器人视觉感知发展重点、难点及解决方案重点:机器人视觉感知概念难点:机器人视觉感知系统的组成教学内容时间分配序号教学内容1机器人视觉感知概述202机器人视觉感知系统的组成:硬件系统及软件系统303机器人视觉感知系统的分类204机器人视觉感知发展205教学手段讲解教学形式(在右栏勾选)理实一体()理论教学()实验()实训()上机()作业作业完成方式书面()电子()教学后记注:教案按周次填写,课堂组织和教学过程设计填写在附页中。附页:第周序号具体内容(课堂组织和教学过程设计)授课改进意见及实时教学效果记录3.1机器人视觉感知的介绍3.1.1机器人视觉感知概述1.什么是机器人视觉机器人视觉是赋予机器人视觉感知能力的系统,它通过结合相机硬件和计算机算法来处理现实世界的视觉数据。这项技术不仅能让机器人识别和处理二维图像,还能利用3D相机进行复杂任务,如在移动中安装汽车轮子。机器人视觉不仅是工程领域,也是包含特定研究领域的科学,它要求将机器人技术融入到视觉技术和算法中。2.机器人视觉的族谱机器人视觉与机器视觉密切相关。如果机器人视觉与机器视觉谈论的是一个“族谱”(见图3.1),计算机视觉可以看作是他们的“父母”。然而为了详细地了解机器人视觉与机器视觉在整个系统中的位置我们要更进一步对整个系统进行介绍。图3.1机器人视觉的族谱机器视觉和机器人视觉技术涵盖了光学、图像处理、信号处理、图形识别、机器学习等多个领域,其中机器视觉侧重于工业自动化的实际应用,如自动检测和过程控制,而机器人视觉则结合了机器人技术,强调在动态环境中的感知和交互能力。两者都依赖于先进的图像处理和计算机视觉技术,以及机器学习算法的进步,以实现更精准的图像分析和智能决策。3.1.2机器人视觉感知系统的组成机器人视觉系统是指用计算机来实现人的视觉功能也就是用计算机来实现对客观的三维世界的识别。机器人视觉主要研究用计算机来模拟人的视觉功能从客观事物的图像中提取信息进行处理并加以理解最终用于实际检测、测量和控制。1.机器人视觉感知系统的主要组成部分机器人视觉系统主要由软件和硬件两部分组成,硬件方面主要有:视觉传感器(组)、图像采集卡、计算机(主处理机)、机器人及其附属的通信和控制模块等(见图3.2);软件方面主要包括:图像处理软件和机器人控制软件等。图3.2机器人视觉系统的硬件系统机器人视觉系统由硬件和软件两大部分构成,其中硬件包括能够捕获高清晰度图像并与基准图像比较分析的视觉传感器、负责将模拟信号转换为数字信号的图像采集卡、用于处理视觉信息及控制机器人的计算机及其外设,以及执行具体任务的机器人或机械手及其控制器;软件方面,则由管理计算机资源的系统软件、专注于图像数据处理的视觉处理软件(如OpenCV、Halcon),以及确保基于图像数据进行精确控制的机器人控制软件(如CODESYS)组成,共同实现了机器人对环境的感知、理解及交互功能。2.机器人视觉感知系统的分类依据视觉传感器的数量和特性目前主流的移动机器人视觉系统有单目视觉、双目立体视觉、多目视觉和全景视觉等。单目视觉系统使用单个传感器,丢失深度信息;双目视觉系统通过两个摄像机和三角测量原理获取深度信息;多目视觉系统使用三个或更多摄像机提高匹配精度;全景视觉系统提供宽广视场,可达360度;混合视觉系统结合多种视觉系统的优势。3.1.3机器人视觉感知发展机器人学涵盖感知、操作和思维,其视觉系统经历了从简单图像处理的第一代,到具备学习能力的第二代,再到目前高度智能化、模拟人类视觉功能的第三代。1.国外机器人视觉感知的发展机器人视觉系统经历了从仅能进行简单图像处理的第一代,到具备一定学习能力的第二代,再到利用高速图像处理芯片和并行算法、具有高度智能与适应性的第三代的发展过程。随着视觉传感器技术自20世纪90年代以来的迅猛进步,这些系统已在工业制造、视频监控等领域广泛应用。国际上,诸如康耐视公司的In-Sight系列视觉传感器等产品因其高性价比和易用性而受到青睐,同时,深度学习技术的兴起也极大地推动了图像识别与检测领域的革新,为机器人视觉系统的智能化提供了新的动力。2.国内机器人视觉感知的发展国内机器视觉行业自1999年起经历了启蒙、发展和高速成长三个阶段,从初期的代理服务逐渐转向自主研发,尤其是在2008年后,随着核心技术的不断突破和市场扩张,行业迎来了快速增长,预计至2023年市场规模将达到约215亿元,尽管起步较晚,但通过不懈努力,中国在该领域已显著缩小与国际先进水平的差距,甚至在某些细分市场实现了超越。3.机器人视觉研究存在的问题及其未来的发展机器人视觉目前面临的主要问题包括目标的准确快速识别、可靠算法的构建与实现、实时性和系统稳定性。为解决这些问题,需要新的技术突破,如高速阵列处理单元和算法(例如神经网络法、小波变换等)。同时,机器人视觉的研究还需关注图像特征选择、专用软件库的建立、系统动态性能的研究、智能技术的应用、主动视觉技术的融合以及多传感器信息融合等。随着技术的发展,机器人视觉在工业、医疗、交通等领域的应用越来越广泛,正成为推动社会进步的重要力量。授课周次第周授课时间2024年月日至2024年月日课程章节第3章机器人视觉感知3.2机器人视觉感知传感器1、位置敏感探测器PSD2、CCD图像传感器3、CMOS图像传感器教学目的1、了解机器人视觉感知传感器2、了解位置敏感探测器PSD2、了解CCD图像传感器2、了解CMOS图像传感器内容提要及板书设计第3章机器人视觉感知3.2机器人视觉感知传感器1、位置敏感探测器PSD2、CCD图像传感器3、CMOS图像传感器重点、难点及解决方案重点:机器人视觉感知传感器难点:深入了解三种不同的视觉感知传感器教学内容时间分配序号教学内容1位置敏感探测器PSD302CCD图像传感器303CMOS图像传感器30教学手段讲解教学形式(在右栏勾选)理实一体(0)理论教学()实验()实训()上机()作业作业完成方式书面()电子()教学后记附页:第周序号具体内容(课堂组织和教学过程设计)授课改进意见及实时教学效果记录3.2机器人视觉感知传感器机器人是集成了机械、电气、控制和感知等系统的智能机电设备,其中视觉感知系统作为机器人的“眼睛”,负责获取外部信息,进行形态和运动识别,以完成各种任务。3.2.1位置敏感探测器PSD位置探测器PSD全称位置敏感器件(PositionSensitiveDetector),它是一种利用光敏面上的光信号转化为电信号再转化为位置信号的器件。PSD还被称为坐标光电池,它具有原理简单、外形轻便、检测灵敏、检测范围大、噪声低、分辨率高、处理速度快等优点。1.PSD的结构与工作原理图3.11显示了PSD的结构原理图。PSD的结构由三层构成,分别为最上层P层,最下层N层,中间层I层,形成PIN结构。I层为较厚的高阻层,它具有耗尽区宽,结电容小的特点。光照产生的载流子几乎全在该高阻层中产生。图3.11PSD结构原理图如图3.11所示。当PSD表面K处受到光照射时,在位置K处就会产生和光照能量成正比的电子空穴对,流经电阻P层,从两边的输出电极上输出光电流I1和I2。由于电阻P层是均匀的,所以输出光电流与流经的电阻距离成反比,即电极与光斑之间的距离。 (3.1)式中,d为光斑位置K到PSD光敏面中心的偏移距离,I分别为两个电极的输出电流,L为光敏面的长度,所以计算出电流之比就能计算出被探测物的位置。由上可知,PSD良好的光心位移特性使得入射光相对于光敏面中心的偏移位置可通过两侧输出电极的电流值间接获得。PSD位置探测器还分为一维和二维探测器。二维探测器如图3.12所示,有四个电极,一对为x方向,另一对为y方向。光敏面的几何中心设为坐标原点。当光入射到PSD上任意位置时,在x和y方向各有一个唯一的信号与之对应。同一维PSD的分析过程一样,光点M的坐标为 (3.2) (3.3)其中k和k’是与psd有关的常数。二维PSD探测器与一维PSD探测器工作原理类似,但因为其结构不同,光斑位置和输出电流的关系也不相同。所以再具体应用时,还需要根据具体结构来确定二者之间的关系。图3.12二维PSD结构原理图2.PSD的特性参数PSD(位置敏感探测器)的主要性能参数包括感光面积、光源频率响应范围、位置检测误差、位置分辨率、线性度和饱和光电流,其中感光面积影响检测范围,频率响应范围描述输出电流随光源频率变化的关系,位置检测误差反映测量精度,位置分辨率决定最小检测变化量,而饱和光电流表示在强光照射下PSD的最大输出电流。3.PSD的应用PSD主要用于位置检测,同时也可用来测距、测角、测位移(含角位移)、测振动体旋转体的状态、机加工零部件的定位,以及做机器人的“眼睛”等。(1)直线度测量基于位置敏感探测器(PSD)的直线度测量系统通过发射激光并利用PSD探测反射光来测量导轨的直线度。在理想情况下,激光点应在PSD上保持固定位置,但由于导轨的直线度误差,PSD的输出信号会随之变化。这种测量方法可以精确地测定光斑中心位置的变化,进而计算出直线度误差,适用于多种环境,广泛应用在精密加工、航空航天等领域。图3.13某数控机床直线测量现场图图3.14PSD在直线度测量下的应用原理图(2)自准直仪位置敏感探测器(PSD)在国防军事领域的应用包括自动准直系统和模拟射击系统等,通过将光斑信息转换成电流信号实现功能。中国计量科学研究院研发的自准直仪利用PSD测量反射镜偏转角,展示了PSD在精密测量领域的应用。图3.15PSD在自准直仪中的应用3.2.2CCD图像传感器CCD图像传感器又称电荷耦合器件(ChargeCoupledDevice),是一种可以将信号大小转换为电荷量大小,并利用耦合方式进行信号传输的检测元件。它的核心器件是组合成排的感光元件和电荷耦合元件,可以直接将光信号转化为电流模拟信号,并通过放大器和数模转换器件,实现对图像信息的获取、传输、储存和处理等功能。1.深耗尽状态和表面势阱CCD图像传感器中最基本的单元是MOS电容器,MOS(Metal-Oxide-Semicondudor)就是金属氧化物半导体。MOS电容结构如图3.17所示,其中金属电极就是MOS结构的电极,也称为“栅极”。P型Si半导体作为衬底电极,在两电极之间加上一层SiO2绝缘体。图3.17MOS电容的结构当电容器上未加任何电压时,该金属氧化物半导体的能带结构如图3.18a所示,达到平带条件。若在金属电极和半导体衬底间加电压Uc,对于P型半导体,空穴被排斥出表面,受体离子被留下,导致半导体的表面层形成负电荷耗尽层,其中电子能量从内部到界面由高到低弯曲,如图3.18b所示。当之间附加电压Uc超过某个阈值Uth时,能带进一步向下弯曲,半导体表面聚集电子浓度增加形成反型层,把Uth称为MOS管的开启电压。由于电子都汇集到半导体处,势能较低,对电子而言半导体表面形成了能容纳聚集电荷的势阱,其示意图如图3.18c所示。图3.18MOS电容的能带图2.CCD结构与原理CCD的结构示意图如图3.19所示,CCD图像传感器的最小单元就是MOS电容器,将大量MOS电容阵列集合到同一衬底下,再加上输入和输出端就构成了CCD器件的主要组成部分。CCD的基本工作原理主要是信号电荷的产生、存储、转移和检测。图3.20为三相时钟控制方式CCD的工作过程。图3.19组成CCD的MOS结构图3.20电荷在三相CCD中的工作过程3.CCD图像传感器的分类CCD图像传感器通常可分为线型传感器和面型传感器。(1)线型CCD图像传感器线型图像传感器由光敏元阵列和对应的CCD元件构成,通过光栅控制的光积分MOS电容器捕获光信号,并通过转移控制栅将信号电荷传输到上下移位寄存器,最终在输出端合并输出,实现图像的并行处理。图3.21线型CCD图像传感器(2)面型CCD图像传感器面型CCD图像传感器由光敏元件和不透明存储单元交替排列构成,具备高解析度、低杂讯、动态范围广等优点,广泛应用于摄像、信号处理等领域。其工作原理是光敏元件积累的电荷在光积分结束后由转移控制栅转移到存储区,然后通过移位寄存器读出,形成图像或视频信号输出。这种结构简单,操作容易,输出图像清晰。图3.22面型CCD图像传感器4.CCD图像传感器的特性参数CCD(电荷耦合器件)的物理性能由一系列内外部参数定义,包括电荷转移效率与转移损失率、驱动频率、光谱响应、分辨率、灵敏度、电荷存储容量和暗电流等。其中,电荷转移效率直接影响图像质量,高效率意味着更好的信号保持;驱动频率需在上下限之间选择,以确保信号电荷的有效转移;光谱响应决定了CCD对不同波长光线的敏感程度;分辨率反映了CCD捕捉细节的能力,与光敏单元数量相关;灵敏度衡量了CCD对外界光强度变化的响应;电荷存储容量限制了单个像素能够承载的最大信号量;而暗电流则是无光照条件下的背景噪声,可通过冷却等方式减少。这些参数共同决定了CCD图像传感器的性能和适用范围。5.CCD图像传感器的应用CCD图像传感器在工业机器人中应用广泛,如图3.23所示的机械臂物品分拣系统,通过CCD图像传感器捕获图像,经由图像处理单元数字化处理后传输给计算机,再由视觉算法分析物品的位置和类型,指导机器人完成精确的抓取或分拣任务。此外,如图3.25和图3.26所示,CCD图像传感器还应用于工业探测内窥镜中,利用光电转换原理,将难以直接观察区域的光学图像转化为高质量的电信号图像,通过伽马校正等技术优化图像质量,帮助检查人员快速准确地识别裂缝、焊接缺陷等问题,极大地提高了工业检测的效率和准确性。图3.23机械臂物品分拣实物图图3.24CCD图像传感器应用原理图图3.25CCD工业探测内窥镜图3.26CCD工业内窥镜应用3.2.3CMOS图像传感器CMOS图像传感器及其主要应用实物图如图3.27所示。CMOS中一对由MOS组成的门电路在瞬间要么PMOS导通,要么NMOS导通,要么都截至,比线性三极管的效率高得多,因此其功耗很低。与CCD不同的是,CMOS的每个像素点都有一个单独的放大器转换输出,因此CMOS没有CCD的“瓶颈”问题,能够在短时间内处理大量数据,输出高清影像,满足HDV的需求。除此之外CMOS图像传感器还适合批量生产,在低价格和摄像质量无极高要求的应用领域中占据较大的市场。图3.27CMOS图像传感器与其应用实物图1.CMOS图像传感器的结构CMOS图像传感器的结构如图3.28所示,主要组成部分为像敏单元阵列、列放大器、多路模拟开关、输出放大器、AD转换器、接口电路和时序控制逻辑电路等。他们被集成到硅片上。像敏单元阵列有横轴和数轴两个方向排列形成方阵,其中每一个单元格又有其对应的X、Y地址,并且该地址可由地址译码器进行选择。图3.28CMOS图像传感器的组成结构图2.CMOS图像传感器的工作原理CMOS图像传感器的工作核心是像敏单元阵列中的每个单元格,即像敏单元,它的结构如图3.29所示,三个场效应管分别为,VT1构成光电二极管的负载、VT2是跟随放大器的原极、VT3是选址模拟开关。当复位脉冲出现时,首先VT1导通,然后光电二极管复位。当脉冲结束时,VT1截止,光电二极管对光信号进行积分。VT2可以将光电二极管输出的电流进行放大,当选通脉冲出现时,VT3导通。将放大的电流输出到列方向上的中线上,最后经过输出放大器输出。如图3.30所示为上述过程的时序图。图3.29COMS像敏单元结构图3.30像敏单元工作时序像敏阵列中像信号的输出过程如图3.31所示,像敏阵列的X轴和Y轴方向上都配有X移位寄存器和Y移位寄存器,首先当光照信号出现时,在Y地址译码器的控制下,一次打开每行的像敏单元的模拟开关S,信号经过开关S,再投X地址译码器控制,传输到放大其中。图3.31CMOS像敏单元阵列工作原理3.CMOS图像传感器的特性参数CMOS图像传感器的性能受多个关键参数影响,包括填充因子、像素总数与有效像素数、动态范围和噪声等。填充因子指光敏面积与总像敏面积之比,影响灵敏度和噪声水平。像素总数是所有像素的总和,而有效像素数决定分辨率。动态范围由信号处理能力和噪声决定,通常用dB表示。噪声主要来源于光敏器件、MOS场效应晶体管和传感器工作噪声,影响图像质量。CMOS传感器相比CCD,具有低功耗、高集成度、低成本等优势,已成为图像传感器市场的主流。4.CMOS图像传感器与CCD图像传感器比较CMOS与CCD图像传感器虽然基于相同的光电转换原理,但由于制作工艺和器件结构的不同,两者在性能上存在显著差异。CMOS传感器支持随机读取、集成度高、读取速度快、功耗低且成本优势明显,而CCD传感器则以顺序读取信号、更好的光谱响应(尤其是对红光和近红外光)、更低的噪声水平和更高的动态范围著称,但其读取速度较慢、耗电量大且制造成本高。随着技术的发展,CMOS图像传感器的性能得到了显著提升,逐渐在众多应用领域取代CCD传感器,成为市场主流。5.CMOS图像传感器的应用在应用领域,CCD图像传感器以其低噪声、高分辨率和高灵敏度的优势,牢牢占据了精密测量、军事目标探测与跟踪等高端市场;而CMOS图像传感器则因高集成度、高速度、小体积、低成本、低功耗及易于使用的特点,在视频通信、手机摄像头、家用摄像机、文字识别等低端市场占据了重要地位。例如,图3.32和图3.33展示了CMOS图像传感器在佳能EOS数码相机中的应用,图3.34和图3.35则展示了华为Mate手机摄像头中CMOS图像传感器的工作原理,图3.36说明了CMOS图像传感器在自动驾驶技术中的关键作用,包括电子后视镜、倒车影像、360度全景成像、路障识别、防撞检测和无人驾驶等功能图3.32佳能EOSCMOS数码相机图3.33CMOS在数码相机中的应用图3.34华为Mate手机摄像头图3.35手机摄像头的组成示意图图3.36自动驾驶场景图授课周次第周授课时间2024年月日至2024年月日课程章节第3章机器人视觉感知3.3机器人视觉感知先进技术1、多目标跟踪2、基于视觉的三维重建3、基于深度学习的高分辨率重建教学目的1、了解机器人视觉感知先进技术2、理解多目标跟踪2、理解基于视觉的三维重建2、理解基于深度学习的高分辨率重建内容提要及板书设计第3章机器人视觉感知3.3机器人视觉感知先进技术1、多目标跟踪2、基于视觉的三维重建3、基于深度学习的高分辨率重建重点、难点及解决方案重点:了解机器人视觉感知先进技术难点:深入理解多目标跟踪,基于视觉的三维重建和基于深度学习的高分辨率重建教学内容时间分配序号教学内容1多目标跟踪302基于视觉的三维重建303基于深度学习的高分辨率重建30教学手段讲解教学形式(在右栏勾选)理实一体(0)理论教学()实验()实训()上机()作业作业完成方式书面()电子()教学后记

附页:第周序号具体内容(课堂组织和教学过程设计)授课改进意见及实时教学效果记录3.3机器人视觉感知先进技术3.3.1多目标跟踪1.多目标跟踪概述多目标跟踪为在有噪声的传感器测量时间序列中确定多个目标的如下特性:动态目标的个数、每个动态目标的状态(和单目标跟踪相同)。对比单目标跟踪与多目标跟踪后发现其处理问题多了一个确定动态目标个数,如图3.37、图3.38所示。单目标跟踪是在视频序列中定位并跟踪特定目标,通过初始化、候选框生成、特征提取、评分和选择最优预测目标等步骤实现。图3.37单目标跟踪图3.38多目标跟踪目标跟踪的前提是进行目标检测在机器人视觉中目标检测是在图像和视频(一系列的图像)中扫描和搜寻目标概括来说就是在一个场景中对目标进行定位和识别如下图中展示的我们要检测图像中的船只这就是典型的目标检测实例。目标检测的传统算法中分为三步:区域选取、特征提取和体征分类。CNN、FastR-CNN、YOLO和SSD是四种重要的目标检测算法。R-CNN采用选择性搜索生成候选区域,并利用CNN提取特征,结合分类器和回归模型实现目标检测。FastR-CNN改进了这一流程,通过整幅图像的特征提取和感兴趣区域池化减少计算冗余,提高了效率。YOLO算法提出了一个端到端的实时检测框架,通过将图片分割成网格单元,预测每个单元内的物体边界框和类别概率,实现了快速检测,但在小物体和非常规比例物体的检测上表现不佳。SSD算法进一步优化了目标检测方法,通过在不同尺度的特征图上直接执行检测任务,不仅提升了检测速度,而且改善了小目标检测的准确性,特别是通过引入不同尺度和长宽比的先验框来辅助边界框的预测,有效降低了训练难度。图3.39目标检测目标检测与目标跟踪的主要区别在于,目标检测是在静态图像上定位并识别特定类别的对象,而目标跟踪则是在视频序列中追踪对象的运动轨迹,不一定需要识别对象的具体类别。密集跟踪通过逐帧全面检测实现精确但计算量大,稀疏跟踪则基于预测仅局部检测,计算效率高且能生成更平滑的轨迹。结合两者,可在慢速线程中进行目标检测以初始化跟踪,而在快速线程中实施目标跟踪,以此实现高效且准确的视频分析。2.经典跟踪算法早期的目标跟踪算法主要是根据目标建模或者对目标特征进行跟踪。目标跟踪算法主要分为基于目标模型建模、基于搜索、基于相关滤波和基于深度学习四大类。基于模型建模的方法通过提取目标特征在后续帧中寻找最相似特征进行定位,但实时性较差。基于搜索的方法通过预测目标位置缩小搜索范围,提高效率,代表性算法有卡尔曼滤波、粒子滤波、Meanshift等。基于相关滤波的算法通过衡量信号相似度实现高速跟踪,如MOSSE、CSK、KCF等,适合实时应用。基于深度学习的方法利用深度特征提高跟踪精度,适应复杂场景,但计算成本较高。总体而言,相关滤波算法速度快,深度学习方法精度高,多特征融合和强大的分类器有助于提升跟踪性能,而尺度自适应和模型更新机制也是提高跟踪精度的关键因素。3.多目标跟踪的任务多目标跟踪利用来自相机、雷达和激光雷达等传感器的数据,通过检测模块处理单帧数据获得边界框、方位等信息,然后送入多目标跟踪模块处理多帧数据,以获得目标在机器人坐标系中的位置和速度等状态信息。4.多目标跟踪的类型多目标跟踪根据目标产生的测量数目和特性,可以分为点目标跟踪(每个目标产生单个测量,视为独立点)、扩展目标跟踪(目标产生多个测量,形状可变)、和目标群跟踪(将多个目标视为一个组,检测大致范围)。5.多目标跟踪的挑战多目标跟踪面临的挑战包括未知的目标数量和位置、目标的快速移动、目标的进入和离开、遮挡问题、传感器的漏检和虚警,以及数据关联的准确性,这些都需要通过有效的航迹管理和算法来解决。我们来举个例子,如图3.41所示,纵轴1、2、3分别对应三个时刻,灰色部分为虚警或新生成的路径,同一目标已用同一种颜色标出。通过图示可以清晰看出哪些目标应该关联在一起。图3.41多目标跟踪实例然而如果把颜色去掉,仅有3个时刻的测量肉眼就不好分别了。如图3.42所示,尤其是对于激光雷达与雷达这些目标多虚警多的传感器,数据关联算法就变得格外重要。图3.42颜色去掉后的多目标3.3.2基于视觉的三维重建三维重建经过数十年的发展已经取得巨大的成功。基于视觉的三维重建在计算机领域是一个重要的研究内容,主要通过使用相关仪器来获取物体的二维图像数据信息,然后对获取的数据信息进行分析处理,最后利用三维重建的相关理论重建出真实环境中物体表面的轮廓信息。基于视觉的三维重建具有速度快、实时性好等优点,能够广泛应用于机器人领域,具有重要的研究价值,也是未来发展的重要研究方向。三维重建技术分类如图3.43所示。图3.43三维重建技术分类1.基于视觉的三维重建的背景和意义机器人视觉通过模拟人类视觉系统,使用摄像头和算法赋予机器人感知、理解和分析三维环境的能力,而三维重建技术是实现这一目标的关键。2.基于视觉的三维重建的定义三维重建技术主要通过视觉传感器来获取外界的真实信息,然后通过信息处理技术或者投影模型得到物体的三维信息(以深度图、点云、体素、网格等形式),也就是说三维重建是一种利用二维投影恢复三维信息的技术。常见的三维重建表达方式有以下四种:深度图,其每个像素值代表的是物体到相机XY平面的距离;体素是三维空间中的一个有大小的点,一个小方块相当于是三维空间种的像素;点云是某个坐标系下的点的数据集。包含了丰富的信息包括三维坐标(XYZ)、颜色等。图3.44常见三维重建表达方式(a)深度图(b)体素(c)点云(d)三角网格3.基于视觉的三维重建的类型基于视觉的三维重建技术主要分为两大类:主动视觉法和被动视觉法。主动视觉法包括激光扫描法、结构光法、阴影法、TOF技术、雷达技术和Kinect技术等,通过控制光源或发射信号获取精确的三维信息,适用于小规模场景,但成本高、操作复杂。被动视觉法则依赖于分析图像序列,通过单目视觉、双目视觉或多目视觉等方法进行三维重建,成本低、操作简便,适合大规模复杂场景,但细节重建不如主动方法精确。根据匹配方法,被动视觉法又可细分为区域视觉法和特征视觉法;根据应用方法,则有运动恢复结构法和机器学习法,后者进一步分为统计学习法和深度学习与语义法。每种方法各有优缺点,适用于不同的应用场景,如图3.45至图3.63所示。图3.45激光扫描法过程图3.46结构光法示意图图3.47阴影法示意图图3.48KINECT摄像机图3.50单目视觉三维重建流程图3.51单目视觉法结果展示(红色表示近距离蓝色表示远距离)图3.52双目视觉法光路图3.53双目视觉法流程图3.54双目视觉法结果展示图3.55多目视觉结果展示图3.56运动恢复结构法效果(蓝点是摄像机红色区域是重构结果)图3.57运动恢复结构法效果(a使用传统数码相机b使用无人机c图像重建)图3.58统计学习法(大型场景)图3.59统计学习法(人脸识别)图3.60统计学习法(基于不同算法的人脸识别)图3.61深度学习与语义法(建筑三维重建)图3.62深度学习与语义法(范围性建筑三维重建)图3.63深度学习与语义法(场景细节重建)4.基于视觉的三维重建的挑战基于主动视觉的三维重建技术可用于不同环境下的三维重建。该类方法不足的是成本高昂需要购买扫描仪等专用设备如果操作稍有差错就会导致重构的结果不精确。另外,由于环境的限制主动视觉法不大可能对大规模复杂场景进行扫描导致其只能应用在小规模领域,并且其后期处理过程也较为复杂。基于被动视觉的三维重建技术法对物体的细节特征重建还不够精确。基于其他被动视觉的三维重建方法在三维重建中的时间比较长,实时性不高。应用此类方法需要相机精确的内外参数,因此在相机内外参数估计的过程上花费了较长的时间。3.3.3基于深度学习的高分辨率重建1.基于深度学习的高分辨率重建的背景和意义图像超分辨率重建技术通过提升图像的像素密度和细节,广泛应用于图像压缩、医学成像、遥感成像、公共安防和视频感知等领域,以提高成像质量、降低成本或增强视频画质。2.基于深度学习的高分辨率重建技术的定义和过程超分辨率(SuperResolution,SR)重建技术是指由一些低分辨率(LowResolution,LR)模糊的图像或视频序列来估计具有更高分辨率(HighResolutionHR)的图像或视频序列同时能够消除噪声以及由有限检验器尺寸和光学元件产生的模糊是提高降质图像或序列分辨率的有效手段。深度学习近年来在图像领域发展迅猛,它的引入即基于深度学习的超分辨率重建为单张图片超分辨率重构带来了新的发展前景。图3.64基于深度学习的超分辨率重建过程3.基于深度学习的高分辨率重建算法的类型近年来,深度学习成为图像超分辨率重建领域的研究热点,其核心在于通过构建深层神经网络模型来学习数据的高级特征表示,从而提高图像的分辨率。超分辨率卷积神经网络(SRCNN)首次将卷积神经网络应用于超分辨率重建,开创了深度学习在该领域的应用。FSRCNN作为SRCNN的改进版本,通过减少网络规模和引入反卷积层显著提高了处理速度。ESPCN则通过引入亚像素卷积层减少了计算量,提高了重建效率。视频超分算法VESPCN在此基础上进一步利用时间冗余信息,实现了视频的超分辨率重建。超分辨率生成对抗网络(SRGAN)利用生成对抗网络框架,通过对抗训练改善了重建图像的视觉质量。DRCN通过深度递归卷积网络结构,增强了网络的非线性映射能力。VDSR通过加深网络层次,提高了超分辨率重建的准确性和速度。RED网络采用编码-解码结构,结合跳跃连接,有效解决了梯度消失问题,恢复了更清晰的图像。DRRN融合了ResNet、VDSR和DRCN的特点,通过共享参数和残差学习策略,进一步提升了性能。LapSRN采用金字塔结构,实现了多尺度的超分辨率重建。SRDenseNet利用密集连接策略,加强了特征传播和复用,减少了参数数量。最后,EDSR通过对SRResNet的改进,特别是移除批量标准化层,提高了模型的表达能力和重建质量。上述模型及其网络结构如图3.65至图3.73所示。图3.65SRCNN网络模型示意图图3.66SRCNN与FSRCNN的网络结构对比图图3.67ESPCN网络模型图3.68亚像素卷积原理图图3.69SRGAN网络模型示意图图3.70DRCN网络模型示意图图3.71DRCN展开推理网络示意图图3.72LapSRN网络结构示意图图3.73SRDenseNet网络一个稠密快结构示意图基于深度学习的高分辨率重建的现实意义和发展空间尽管深度学习在图像超分辨率重建领域已取得显著进展,但仍面临诸多挑战,包括对大量训练数据和高性能计算资源的需求、过拟合的风险、测试与训练样本分布差异导致的泛化能力不足,以及重建图像平滑度过高、高频细节信息丢失等问题。因此,未来的研究需着重于解决这些限制,以期实现既能保留原始图像细节又符合人类视觉喜好的高质量图像重建。授课周次第周授课时间2024年月日至2024年月日课程章节第三章机器人视觉感知3.4机器人视觉感知的发展趋势1、机器人视觉感知技术——识别与追踪2、机器人视觉感知技术——定位3、机器人视觉感知技术——视觉与机器人的关联4、机器人视觉感知技术应用及未来发展3.5机器人视觉感知的实际应用1、三维成像2、同步定位与地图构建3、机器人图像识别教学目的1、理解机器人视觉感知概念及发展2、理解机器人视觉感知系统的组成内容提要及板书设计第三章机器人视觉感知3.4机器人视觉感知的发展趋势1、机器人视觉感知技术——识别与追踪2、机器人视觉感知技术——定位3、机器人视觉感知技术——视觉与机器人的关联4、机器人视觉感知技术应用及未来发展3.5机器人视觉感知的实际应用1、三维成像2、同步定位与地图构建3、机器人图像识别重点、难点及解决方案重点:机器人视觉感知概念难点:机器人视觉感知系统的组成教学内容时间分配序号教学内容1机器人视觉感知技术——识别与追踪202机器人视觉感知技术——定位103机器人视觉感知技术——视觉与机器人的关联204机器人视觉感知技术应用及未来发展205机器人视觉感知的实际应用20教学手段讲解教学形式(在右栏勾选)理实一体()理论教学()实验()实训()上机()作业作业完成方式书面()电子()教学后记附页:第周序号具体内容(课堂组织和教学过程设计)授课改进意见及实时教学效果记录3.4机器人视觉感知的发展趋势视觉感知技术通过摄像头等传感器获取信息,结合图像识别、机器人定位和视觉与机器人的关联技术,实现对环境的精确感知,对机器人技术的发展至关重要,推动着国家从制造大国向制造强国转变。3.4.1机器人视觉感知技术——识别与追踪图像识别技术经历了文字识别、数字图像处理与识别、物体识别三个阶段,融合了机器学习、深度学习等技术,推动了物体识别的发展。机器人视觉感知技术的硬件设备如光源、视觉传感器等对图像质量有重要影响,而识别与追踪算法,尤其是结合深度学习的算法,显著提升了识别效果。基于学习的目标识别方法和基于深度学习的三维重建算法,通过融合传统算法和深度学习的优势,进一步提升了机器人视觉感知技术的性能。3.4.2机器人视觉感知技术——定位机器人视觉感知定位技术主要通过双目立体视觉实现,涉及图像识别与追踪、机器人定位以及视觉与机器人的关联技术。双目视觉通过计算两个摄像机在不同位置拍摄的图像间的视差来获取空间点的三维坐标。机器人视觉定位包括二维和三维定位,广泛应用于工业机器人和智能设备中,如自动驾驶汽车、服务机器人、无人机等。定位算法从早期的模板匹配发展到现在基于滤波器的卡尔曼滤波、粒子滤波等方法,以及结合深度学习的单目视觉算法。这些技术的发展和应用,推动了机器人在多元环境中的精准定位和自主导航能力的提升。3.4.3机器人视觉感知技术——视觉与机器人的关联基于图像分析的视觉技术在机器人引导相关应用中的主要作用是精确获取对象物(待抓取物体)和目标物(待组装物体)的坐标位置和角度并将图像坐标转换为机器人能识别的机器人坐标指导机器人进行纠偏和组装。因此手眼标定和定位引导是机器视觉在机器人感知系统中应用的的核心。一般手眼标定方法分为3类:标准手眼标定基于旋转运动的手眼标定及在线手眼标定。在机器人与视觉的关联方面着重于Eye-in-Hand技术的更新迭代提高机器人作业的灵活性与稳定性将进一步促进机器人视觉感知技术的发展。3.4.4机器人视觉感知技术应用及未来发展中国推动机器人视觉感知技术快速发展,以应对科技革命和产业升级的需求。这项技术在工业自动化、农业现代化及智能交互中将扮演关键角色,并展现出RGB-D相机应用、三维动态感知、算法创新和跨领域融合等发展趋势。未来,机器人视觉将更加智能化,广泛应用于生活服务领域,推动制造业和农业向更高效、自动化的方向发展。3.5机器人视觉感知的实际应用3.5.1三维成像传统的编程来执行某一动作的机器人已经很难满足现今的自动化需求了在很多应用场景下需要为机器人安装一双眼睛即机器人视觉成像感知系统使机器人具备识别物体、分析、处理等更高级功能可以正确对目标场景的状态进行判断与分析做到灵活地自行解决发生的问题。1.三维成像系统硬件组成三维视觉系统主要由图像采集、图像处理和运动控制三部分组成,如图3.74所示。其中,相机和镜头是关键成像组件,相机通过成像传感器将光信号转换为电信号,镜头则负责将目标物体的图像聚焦在传感器上。成像质量受镜头焦距、光圈大小和拍摄距离等因素影响,这些参数共同决定了系统的成像质量和适用性。例如,光圈越大,景深越小,焦距越长,景深也越小,如图3.75所示。工业相机与镜头的接口类型多样,包括C接口、CS接口等,这些接口的区别主要在于后截距的不同,如图3.76所示。此外,相机的视场角根据感光面的形状和尺寸有不同的计算方法,既可以以对角线计算,也可以以长边计算,如图3.77和图3.78所示图3.74三维成像系统示意图图3.75成像原理图图3.76C接口和CS接口图3.77以可视范围直径确定的视场角图3.78以成像幅面的长度尺寸可拍摄范围决定的视场角2.成像的结构形式三维视觉系统的核心在于模拟人眼的视觉成像与智能判断决策功能,通过图像传感技术获取目标信息,经处理和理解后,用于机器人系统的测量、检测、识别与定位等任务或自身伺服控制。机器人视觉系统中最典型的例子是手眼系统,根据成像单元的安装方式,手眼系统可分为固定成像的“眼看手”系统(Eye-to-Hand)和随动成像的“眼在手”系统(Eye-in-HandorHand-eye),如图3.79所示。为了最大化发挥各自优势,有时将这两种系统结合使用,形成混合协同模式,即利用固定成像系统提供全局视野,而随动成像系统提供局部高分辨率和高精度的成像,如图3.80所示。图3.79两种手眼系统的结构形式(a)眼在手系统(b)眼看手系统图3.80协同视觉系统原理图3.机器人视觉三维成像方法3D视觉成像技术主要分为非光学成像与光学方法,其中光学方法应用更为广泛,包括飞行时间法、激光扫描法、激光投影成像和立体视觉成像等。飞行时间(TOF)相机通过测量光往返目标的时间差来获取深度信息,适用于大视野、远距离、低精度的三维图像采集,具有检测速度快的特点,但精度较低,易受环境光影响。扫描3D成像方法如图3.81和图3.82所示,包括线结构光扫描和色散共焦扫描,前者基于三角测量原理,后者通过分析反射光的光谱获取深度信息,这些方法精度高,特别适合测量透明或光滑表面的物体,但速度慢,效率低,不适用于实时3D引导与定位。立体视觉成像如图3.83所示,通过从不同视点获取多幅图像来重构目标物体的3D结构或深度信息,类似于人眼感知三维世界的方式,适用于多种应用场景。图3.81线结构光扫描三维点云生成示意图图3.82色散共焦扫描三维成像示意图图3.83立体视觉三维成像示意图3.5.2同步定位与地图构建SLAM(同步定位与地图构建)是一种技术,它允许机器人或自动驾驶汽车在未知环境中导航,同时构建环境的地图。SLAM系统通常包括特征提取、数据关联、状态估计、状态更新和特征更新等部分。SLAM可以应用于2D和3D领域,使用多种传感器,如激光雷达、超声波和视觉传感器,来获取环境信息。激光雷达测距是SLAM中最常用的方法,因为它精确且高效,尽管它通常成本较高,且不适用于水下环境或穿过玻璃平面。视觉测距提供了丰富的信息,但需要大量的计算,并且对光线变化敏感。SLAM的关键趋势包括多传感器融合、深度学习的应用以及低成本高性能的实现。1.SLAM的一般过程SLAM(同时定位与地图构建)的过程旨在通过不断更新机器人的位置估计和周围环境的地标的估计来精确定位机器人。这一过程通常包括:机器人移动后,使用位置传感器获取观测信息并从中提取特征点;接着,利用扩展卡尔曼滤波器(EKF)融合当前观测到的特征点位置、机器人移动的距离以及移动前观测到的特征点位置,以此来修正和优化机器人的当前位置估计及环境模型,确保即使初始的运动估计存在较大误差,也能逐步减少这种不确定性,提高定位精度。图3.84展示了SLAM的一般流程,而图3.85则详细说明了估计过程。图3.84SLAM的-般过程图3.85机器人当前位置和环境信息进行估计过程2.机器人自身运动模型SLAM的另外一个很重要的数据来源是机器人通过自身运动估计得到的自身位置信息。机器人自身位置数据通过对机器人轮胎运行圈数的估计可以得到机器人自身位置的一个估计其可以被看作EKF的初始估计数据。另外一个需要注意的是需要保证机器人自身位置数据与测距单元数据的同步性。为了保证其同步性-般采用插值的方法对数据进行前处理。由于机器人的运动规律是连续的因而一般对机器人自身位置数据进行插值。相对而言由于测距单元

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论