工业机器视觉与应用 课件全套 刘浪 第1-4章 人工智能与机器视觉基础 -工业机器视觉人工智能应用实践_第1页
工业机器视觉与应用 课件全套 刘浪 第1-4章 人工智能与机器视觉基础 -工业机器视觉人工智能应用实践_第2页
工业机器视觉与应用 课件全套 刘浪 第1-4章 人工智能与机器视觉基础 -工业机器视觉人工智能应用实践_第3页
工业机器视觉与应用 课件全套 刘浪 第1-4章 人工智能与机器视觉基础 -工业机器视觉人工智能应用实践_第4页
工业机器视觉与应用 课件全套 刘浪 第1-4章 人工智能与机器视觉基础 -工业机器视觉人工智能应用实践_第5页
已阅读5页,还剩605页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

人工智能与机器视觉基础1.1人工智能技术应用与发展1.1.1人工智能技术应用现状人工智能(ArtificialIntelligence,AI)是计算机科学的一个分支,旨在研究和开发可以模拟、扩展或增强人类智能的系统。它涉及多种技术和方法,包括机器学习、深度学习、自然语言处理、计算机视觉、专家系统等。1965年,在美国的新罕布什尔州的达特茅斯学院召开的用机器模拟人类智能的夏季专题讨论会上,麦卡锡提议用ArtificialIntelligence作为这一交叉学科的名称,标志着人工智能的诞生。半个世纪以来,人工智能发展迅速,已经应用于各个行业。1.1人工智能技术应用与发展1.行业应用场景(1)制造业:应用于智能装备、智能工厂和自动化生产线,如工业机器人、数控机床、智能生产调度和机器视觉检测。(2)金融:用于自动获客、身份识别、大数据风控、智能投顾和智能客服,分析客户行为、评估信用风险并优化投资决策。(3)医疗:用于辅助诊断、医疗影像分析和药物开发,提取医学影像信息、疾病监测及生成自动化报告。(4)交通:通过智能交通和自动驾驶技术改善交通管理,优化信号灯控制、路线规划并实现复杂环境感知。(5)教育:应用于在线教育和智能家教,提供个性化学习资源和定制化辅导方案,辅助教师减轻工作负担。1.1人工智能技术应用与发展2.技术实现现状人工智能应用技术主要包括机器学习(MachineLearning,ML)、深度学习(DeepLearning)、自然语言处理(NaturalLanguageProcessing,NLP)、计算机视觉(ComputerVision,CV)、专家系统(ExpertSystem)等。(1)机器学习是研究机器模拟人类的学习活动,获取知识和技能的理论和方法,以改善系统性能的学科。机器学习的方法主要有归纳学习、类比学习、分析学习等。(2)深度学习是以深层神经网络为核心的数据驱动方法,其核心思想在于模拟人脑的层级抽象结构,通过无监督的方式分析大规模数据,发掘大数据中的有价值信息。深度学习在计算机视觉、自然语言处理、语音识别等领域取得突破性进展,优势在于特征自动学习与复杂模式捕捉能力,但面临模型可解释性差、训练资源消耗大及过拟合风险等挑战,是推动现代人工智能发展的关键技术支柱之一。1.1人工智能技术应用与发展(3)自然语言处理是用机器处理人类语言的理论和技术。NLP作为语言信息处理技术的一个高层次的重要研究方向,一直是人工智能领域的核心课题,其融合语言学、计算机科学和机器学习技术,旨在实现机器对文本或语音的语义解析与智能响应。NLP的进步正推动人机交互从机械指令迈向自然对话,成为智能助手、教育科技和内容创作等领域的变革性驱动力。(4)计算机视觉是研究如何使机器“看懂”视觉世界并从中提取语义信息的核心技术领域,旨在通过算法解析图像或视频中的对象、场景及动态行为。(5)专家系统是一类具有专门知识和经验的计算机智能程序系统,通过对人类专家问题求解能力的建模,采用人工智能中的知识表示和知识推理技术来模拟通常由专家才能解决的复杂问题,达到具有与专家同等解决问题的水平。1.1人工智能技术应用与发展1.1.2人工智能技术发展方向人工智能的前沿发展方向正随着技术突破和应用场景的扩展而快速演变。以下是当前及未来几年备受关注的几个核心方向:(1)大语言模型(LargeLanguageModel,LLM)是当前人工智能的一个快速发展的领域,大语言模型通常是指包含数千亿或更多参数的语言模型,使用大量文本数据训练,可以生成自然语言文本或理解语言文本的含义。大语言模型的出现标志着人工智能领域的重大进步,以GPT-4、Claude、DeepSeek等为代表的大模型,正朝着更大规模、更多模态方向推进。(2)具身智能(EmbodiedIntelligence)相较于传统基于纯符号处理的人工智能,更关注认知与身体之间的关系,认为智能的形成与感知、运动、环境适应密切相关。在实际应用中,具身智能已在自动驾驶、医疗机器人、人机交互等领域展现出巨大潜力。1.1人工智能技术应用与发展(3)生成式人工智能(GenerativeArtificialIntelligence)能够通过训练模型生成文本、图像代码或视频等多模态内容。例如,OpenAI的GPT系列模型能够生成流畅、连贯的文本,广泛应用于写作、编程辅助和对话系统。此外,生成式人工智能还在视频生成、3D建模、音乐创作等领域展现出巨大潜力。(4)分布式人工智能(DistributedArtificialIntelligence)主要研究在逻辑上或物理上分散的智能系统如何并行地、相互协作地进行问题求解,分布式人工智能分为分布式问题求解和多智能体系统两种类型。分布式问题求解的核心思想是将单一复杂任务拆分为多个子任务,由分布式节点协作完成,最终合并结果。多智能体系统是由多个自主智能体通过交互、协作或竞争共同完成复杂任务的分布式人工智能框架。1.1人工智能技术应用与发展(5)可信性人工智能(TrustworthyArtificialIntelligence)是为确保人工智能系统安全、可靠、公平且符合伦理规范而提出的技术框架,旨在解决人工智能应用中潜在的偏见、隐私泄露、决策“黑箱”化等风险。(6)科学智能(ArtificialIntelligenceforScience)是通过人工智能技术推动科学研究范式变革的新兴领域,其核心在于利用机器学习、深度学习和大数据分析加速科学发现,解决传统科研中依赖经验试错、计算成本高或数据复杂度大的难题。1.1人工智能技术应用与发展1.2机器视觉技术应用与发展1.2.1机器视觉技术应用现状机器视觉可以理解为给机器加装上视觉装置,其目的在于赋予机器类似人类的视觉能力,实现视觉引导、测量、识别、检测等功能。(1)高精度:机器视觉能够进行精确的图像处理和分析,提供稳定的测量结果。(2)高效率:机器视觉技术可以快速、准确地完成大量重复性工作,显著提高了生产效率。(3)成本低:机器视觉相关设备一次性投入后,随着使用时间的增加,成本不断降低,为企业带来了长期的经济效益。(4)适应性强:机器视觉系统可以通过不同的光学传感器和照明系统来适应不同的环境和物体特性。1.2机器视觉技术应用与发展除上述优势外,机器视觉系统还具有数据自动记录与分析、功能可拓展性、算法可升级提升等特点。目前,随着人工智能技术的不断发展,机器视觉的功能也在不断完善。凭借其强大的视觉引导、测量、识别和检测功能,以及自身强大的技术优势,从最开始主要应用于电子装备检测,已经发展到应用在工业、医学、交通、农业等领域。1.2机器视觉技术应用与发展1.在工业领域中的应用随着机器视觉技术的不断进步和完善,其在工业领域中的应用越来越广泛,涵盖了如半导体与电子制造、3C电子、汽车制造、医药制造、光伏新能源制造、包装印刷、食品加工等不同的工业场景。机器视觉技术可以为汽车制造生产线的抓取、装配环节提供视觉引导。在抓取环节中,机器人通过搭载的相机获取零部件的二维或三维图像,随后利用图像处理技术对图像进行特征提取,精准定位零部件的具体位置,指导生产线上的机器人进行抓取,最大限度地减少误差和提高抓取效率。在装配环节中,通过机器视觉系统提取零部件的几何特征点、颜色等多维特征,对零部件进行精确定位,确保机器人能够准确地将每个零部件安装到指定的位置,见图1。1.2机器视觉技术应用与发展图1机器视觉装配图机器视觉技术在汽车制造过程中广泛应用于质量检测。在汽车零件制造过程中,机器视觉系统可以通过高分辨率的相机及图像处理算法,对车辆进行质量检测(见图2)。机器视觉还可以对汽车涂胶进行质量检测(见图3)。通过质量检测,提高汽车零件及整体产品的合格率,同时提高检测效率与质量,确保产品在制造过程中始终符合高标准的质量要求,延长汽车使用寿命。1.2机器视觉技术应用与发展图2汽车轮毂质量检测图3汽车玻璃涂胶质量检测此外,在食品加工中,机器视觉可以进行食品缺陷检测等,保障食品的安全与质量。在烟草制造中,机器视觉能够进行烟草外观检查等,确保烟草符合质量要求。在医药制造中,机器视觉可以进行药品尺寸合格检测等,保障医药产品的品质。1.2机器视觉技术应用与发展2.在医学领域中的应用机器视觉技术在医学领域的应用越来越受到重视,主要应用于辅助医疗诊断,辅助手术、医疗康复等多个方面。机器视觉技术能够辅助医生进行医疗诊断(见图4)。主要通过对CT扫描、病理切片等医学影像进行分析与处理,帮助医生做出更准确的判断,减少误诊的风险。还可以应用于辅助医生进行手术(见图5),能够帮助医生直观了解患者的口腔状况,并根据预定的路径进行种植操作,提高手术成功率。1.2机器视觉技术应用与发展图4医学影像处理图5手术定位导航系统机器视觉在医学领域中的应用十分广泛,不仅提升了医疗服务的效率,还有效地减轻了医生的工作负担,帮助提高诊断的准确性和治疗的效果,同时,推动了医疗服务的创新与进步。1.2机器视觉技术应用与发展3.在交通领域中的应用机器视觉在构建智能交通系统(IntelligentTrafficSystem,ITS)中发挥了重大作用。机器视觉技术可以应用于自动驾驶与辅助驾驶(见图6),帮助实现车辆智能化驾驶。在自动泊车功能中,利用机器视觉技术可以识别停车位及其周围的环境,同时进行路径规划,使车辆能够自动完成停车操作(见图7),提高停车效率。其还可以应用于交通管理,其应用包括交通流量监测、交通违章识别、车牌识别、停车占用检测、交通事故监测等多个方面(见图8)。1.2机器视觉技术应用与发展图6自动驾驶与辅助驾驶图7自动停车功能图8交通管理随着机器视觉技术的不断发展,其会继续推动智能交通系统建设,为交通安全提供技术保障。4.在其他领域中的应用机器视觉技术除了在工业领域、医学领域、交通领域得到广泛应用,其通过高效、精准的图像分析与处理技术,在农业、国防、生态保护与环境治理、建筑工程、娱乐与媒体等其他领域也展现出巨大的价值。1.2机器视觉技术应用与发展1.2.2机器视觉技术发展方向机器视觉是人类视觉的扩展和延伸。随着研究的不断深入和微处理器的快速提高,机器视觉技术与产品将会被广泛地应用于更复杂的场合。1.多传感器信息融合多传感器信息融合(Multi-sensorInformationFusion,MSIF)是指将不同来源、不同形式、不同空间或不同时间的信息集成在一起,形成更全面、准确和有用的信息。例如,在交通领域中,多传感器信息融合方法应用于车辆检测与定位、障碍物检测等方面,提升了机器视觉系统的准确性和可靠性。2.完整三维场景重建三维重建(3Dreconstruction)是指通过对单视角图像或多视角图像进行分析,结合某些先验知识恢复出场景的三维几何表示。同时,三维重建的应用越来越广泛,涵盖了自动驾驶、工业制造、农业等领域。1.2机器视觉技术应用与发展3.主动视觉主动视觉(activevision)是指视觉系统可以根据已有的分析结果和任务的当前需求,决定摄像机的运动,并且从合适的视角获取相应的图像。主动视觉理论强调视觉系统对人眼主动适应性的模拟,即模拟人的“头-眼”功能,使视觉系统能够自主地选择和跟踪注视目标物体。4.视觉并行计算结构视觉本身具有内在的并行性,但要完成视觉并行计算还有许多理论上、算法上和技术上的问题要解决。通过设计一些精巧的算法有效地利用并行性,提高视觉计算的速度。1.2机器视觉技术应用与发展5.通用机器视觉系统一个典型的机器视觉系统由图像采集、图像处理和运动控制组成。目前大多数系统是专用的,用于尺寸测量、缺陷检测或物体识别。研究目标是建立能够完成各种任务的通用视觉系统,通过特定任务积累经验,逐步实现通用系统。6.智能化视觉技术深度学习通过多层神经网络从数据中提取特征并学习规律,精度高、学习能力强。它已成为医疗、交通、制造等领域智能化的关键技术。同时,机器视觉技术和深度学习技术的融合,已经成为一个具有发展前途的研究方向。1.2机器视觉技术应用与发展1.3工业机器视觉技术应用与发展1.3.1工业机器视觉应用现状随着传感器技术进步、计算机性能提高和深度学习发展,机器视觉的功能越来越完善。机器视觉在工业领域相对于传统人工在精度、速度、重复性和安全性等方面具有优势,已广泛应用于物体定位、尺寸测量、零件缺陷检测等任务,减少人为错误,优化生产流程,降低生产成本。典型应用包括半导体与电子制造、3C电子、汽车制造、医药制造、光伏新能源制造、包装印刷、食品加工等。目前,随着传感器技术的不断进步,计算机硬件性能的提高,深度学习技术的不断发展以及视觉图像处理算法的持续改进,机器视觉的功能越来越完善。机器视觉技术凭借自身强大的技术优势,正在各行各业中发挥重要的作用。1.3工业机器视觉技术应用与发展1.在医药制造中的应用机器视觉技术可以应用于药品质量检测,保障药品质量。例如,在药丸外观检测方面(见图9),可以对药丸异形、异物等质量问题进行检测,确保药品符合标准。其还广泛应用于检测药品生产中物料的数量和尺寸、胶囊缺陷检测(见图10)等其他方面,确保生产的每一批药品符合严格的质量标准,进一步保障患者的用药安全和健康。1.3工业机器视觉技术应用与发展图9药丸外观检测图10胶囊缺陷检测2.在半导体行业中的应用机器视觉技术在半导体行业中的应用涉及晶圆制造、芯片封装、印制电路板组装、电路板缺陷检测及表面组装技术(SurfaceMountTechnology,SMT)检测等多个场景。例如,基于U-Net设计的晶圆微观检测算法,可以实现晶圆微观缺陷的高精度分割与识别,从而对晶体的表面缺陷进行检测(见图11),提高了检测效率和准确度。1.3工业机器视觉技术应用与发展图11晶圆缺陷检测3.在纺织制造中的应用机器视觉可以应用于纺织品质量检测,其应用包括原棉异纤检测、梳理棉网在线检测、织物疵点检测等多个方面。例如,在织物疵点检测方面(见图12),通过工业摄像机结合补充光源获取织物表面图像,将获取的织物图像利用机器视觉技术进行处理和分析,实现对不同大小疵点的检测,确保织物的质量符合标准。1.3工业机器视觉技术应用与发展图12织物疵点检测4.在其他工业场景下的应用机器视觉除了应用在医药制造、半导体行业和纺织制造中,在光伏新能源制造、包装印刷、食品加工等其他的工业场景的应用也十分广泛,例如在食品加工中,机器视觉可检测原材料质量、产品外观、包装缺陷,并实现分拣和流程控制(见图13)。机器视觉技术的诞生与应用,极大地促进了工业生产的智能化、自动化和精细化,对工业领域产生了深远影响。1.3工业机器视觉技术应用与发展图13产品外观检测1.3.2工业机器视觉发展方向工业机器视觉作为智能制造的核心技术之一,从传统的2D图像处理到如今的3D视觉、人工智能赋能,机器视觉的应用范围和能力不断扩展。本节将探讨三个发展方向:3D视觉、人工智能和深度学习集成、协作机器人。1.3D视觉传统的2D视觉技术仅能获取平面图像,无法准确获取物体的空间坐标信息。3D视觉可以获得物体的三维信息,完成传统二维无法完成的测量,例如检测产品的曲度、平面度、体积和三维建模等。3D视觉技术对于光照条件、物体对比度等适应能力更强,可以实现2D视觉无法实现的功能。1.3工业机器视觉技术应用与发展在工业应用中,双目视觉技术(见图14)因其广泛应用而备受关注,其原理类似人的双眼,通过三角测量计算三维信息。结构光技术、飞行时间成像技术、激光三角成像法(见图15)也是常用的3D视觉技术。3D视觉最有前景的应用场景包括高精度测量、缺陷识别、高速在线检测、自动抓取、视觉引导机器人(见图16)等。1.3工业机器视觉技术应用与发展图14双目视觉技术原理图图15激光三角成像法原理图图163D视觉机器手抓取2.人工智能和深度学习集成在工业检测领域,面临产品缺陷类别与识别字符多样化的挑战。然而,随着产品种类的增多以及应用场景日益复杂,传统机器视觉算法,存在误检和识别效率低等问题,难以解决复杂的检测任务。深度学习算法可以从大量数据中自动提取特征,避免传统机器视觉算法手工特征提取的复杂性和局限性;通过大量数据的训练,深度学习模型可以识别各类复杂的缺陷,提升工业生产中检测的精度和可靠性。1.3工业机器视觉技术应用与发展3.协作机器人工业机器人在工业生产中不仅能够代替人执行单调、频繁和重复的作业,还能够在危险、恶劣环境下开展作业,提高生产效率的同时保障工人安全。协作机器人被设计为在共享工作空间中与人类一起工作,并具有易用性、灵活性、安全性、低成本等特点,适用于各种非结构化、柔性、高灵活度的场景,图17展示了协作机器人的成品。1.3工业机器视觉技术应用与发展图17协作机器人1.4大模型与具身智能1.4.1大模型的基础概念与应用发展方向1.大模型的基础概念大语言模型是指参数量超过十亿级别的深度神经网络模型,也叫作大模型,其核心特征是通过海量数据和复杂架构实现对语言系统的深度建模。大模型的发展大致可以分为以下4个阶段。(1)前深度学习时期(1950年—2010年),基于统计的N-Gram语言模型、隐马尔可夫模型和最大熵模型为自然语言处理奠定了重要基础。(2)神经网络复兴期(2010年—2017年),Word2Vec、LSTM和GRU序列建模和注意力机制的提出带来了突破。(3)Transformer革命时期(2017年—2020年)是大模型发展的关键转折点。Transformer完全基于自注意力机制,摒弃循环和卷积结构,解决了长距离依赖问题,并大幅提升训练效率。1.4大模型与具身智能(4)大模型爆发期(2020年—2025年)。2020年GPT-3展示了超大规模语言模型能力;2022年PaLM验证了模型规模与性能的正相关关系;2023年Meta开源LLaMA系列模型,推动了开源生态发展。多模态大模型将能力从文本扩展到图像、音频和视频,实现跨模态理解与生成。接下来,我们将探讨大模型的关键技术,以及它的应用发展方向。1)Transformer2017年,瓦斯瓦尼等发布的变换器网络(TransformerNetwork)极大地改变了人工智能各细分领域所使用的方法,并发展成为今天几乎所有人工智能任务的基本模型。Transformer基于自注意力(Self-attention)机制,高效地捕捉序列中元素之间的依赖关系,支持并行训练模型,为大规模预训练模型打下坚实的基础。1.4大模型与具身智能Transformer由编码器和解码器两部分组成(见图18):左边是由N个编码器组成的编码部分;右边是解码部分,右边是由N个解码器组成的解码部分。编码部分将输入序列编码为中间表示,解码部分以自回归的方法不断解码中间表示到下一个词元,最终完成从序列到序列的变换并输出。Transformer由于具有并行计算能力强、可以有效捕捉长距离依赖关系和具有良好的扩展性的优点。GPT系列的核心基于Transformer架构的解码器部分,在Transformer基础上使用单向自注意力机制,使得GPT在文本生成和问答系统的语言生成任务中表现出色。1.4大模型与具身智能1.4大模型与具身智能Add&Norm-加和与归一化前馈Add&Norm-加和与归一化多头注意力输入嵌入Add&Norm-加和与归一化Add&Norm-加和与归一化前馈Add&Norm-加和与归一化LinearSoftmax掩码多头注意力输出嵌入多头注意力

输入输入位置编码位置编码输出概率NN图18Transformer架构Transformer由编码器和解码器两部分组成(见图18):左边是由N个编码器组成的编码部分;右边是解码部分,右边是由N个解码器组成的解码部分。编码部分将输入序列编码为中间表示,解码部分以自回归的方法不断解码中间表示到下一个词元,最终完成从序列到序列的变换并输出。Transformer由于具有并行计算能力强、可以有效捕捉长距离依赖关系和具有良好的扩展性的优点。GPT系列的核心基于Transformer架构的解码器部分,在Transformer基础上使用单向自注意力机制,使得GPT在文本生成和问答系统的语言生成任务中表现出色。1.4大模型与具身智能图19多头注意力机制架构2)多头自注意力机制变换器网络的最大创新是完全使用多头自注意力机制,其架构如图19所示。自注意力通过计算序列中每个元素与其他元素之间的相关性,动态捕捉数据内部的依赖关系,从而更好地建模上下文信息。单头自注意力机制只能关注输入序列的一种特定关系或模式,而多头机制允许模型在每个注意力头中学习不同的注意力分布,使得最终输出更加多样化和全面。如图19所示,V、K、Q是固定的单个值,线性层有3个,可伸缩点积注意力有3个,即3个头,类似于堆积了3个单头注意力。之后级联或者综合,最后线性。其实多头注意力就是把单头注意力执行了多次,然后把结果进行合并。1.4大模型与具身智能图20人类反馈强化学习框架3)人类反馈强化学习人类反馈强化学习(ReinforcementLearningwithHumanFeedback,RLHF)是一种人工智能模型在进行预测的过程中,通过人的反馈来实现模型学习,使得模型输出与人类的意图和偏好保持一致,并在连续的反馈循环中持续优化,进而产生更好的结果。人类反馈强化学习的框架图(见图20),奖励预测器是学习出来的,这点与传统强化学习人工设定奖励函数有所不同。强化学习算法环境奖励预测器人类反馈观测行动预测奖励1.4大模型与具身智能2.大模型应用发展方向大模型正加速向垂直领域渗透,形成“通用大模型+行业大模型”模式。场景深化强调在具体应用中落地。大模型是通过整合文本、图像、音频、视频等多种数据类型,构建能够理解和处理复杂多模态信息的人工智能系统,实现多模态融合与跨领域交互。这种融合与交互不仅提升了模型的综合理解能力,还推动了人工智能在更广泛场景中的应用,如智能医疗、自动驾驶、虚拟助手等,为跨行业创新提供了强大的技术支撑。未来大模型的发展趋势将围绕技术突破、能力提升和通用人工智能的实现展开,推动人工智能技术迈向新的高度。1.4大模型与具身智能1.4.2具身智能的基础概念与应用发展方向1.具身智能的基础概念具身智能是一种强调智能体通过身体与物理环境的实时交互来实现感知、学习和决策的智能理论。其核心观点是:智能的本质并非仅依赖抽象计算或符号推理,而是由智能体的身体形态、感知运动能力,以及与环境的动态互动共同塑造的。具身智能的早期理念可追溯至图灵的“学习机器”和布鲁克斯的“行为机器人学”,强调通过身体与环境交互产生智能。进入21世纪,研究者结合强化学习与物理仿真,使机器人能够在未知环境中自我学习。2024年,OpenAI与Figure公司发布人形机器人Figure01,实现感知-决策-行动闭环和高精度多关节协调,标志着具身智能工程化的重大突破。1.4大模型与具身智能1)具身智能实现的底层技术具身智能强调智能体通过物理身体与环境实时互动来实现感知、学习和决策,其底层技术融合了机器人学、人工智能、神经科学等多领域进展。以下是核心技术的分点总结。(1)多模态感知与实时处理。(2)仿生驱动与自适应控制。(3)具身计算架构优化。(4)物理-虚拟融合学习。(5)认知-运动协同机制。1.4大模型与具身智能2)具身智能的实现方法(1)基于大模型。基于大语言模型的具身智能以大语言模型(如GPT、PaLM等)为核心,通过自然语言理解与生成能力实现对具身智能体的初步规划和控制。模型通过文本指令理解任务目标,生成逻辑化的任务分解步骤(如“拿杯子→倒水→递给用户”),并将指令传递给机器人执行模块。基于视觉语言模型(Vision-LanguageModel,VLM)的具身智能以Flamingo、BLIP、GPT-4V等模型为代表,融合视觉与语言模态,使智能体能够直接解析图像/视频输入,结合语言指令进行环境感知与任务规划。例如,通过摄像头捕捉场景图像后,模型可生成“桌上红色杯子在左侧”等描述,并指导抓取动作。基于图像-语言-动作模型(Vision-Language-ActionModel,VLA)的具身智能以RT-2、Gato、VoxPoser等模型为标志,VLA实现了视觉、语言与动作的三模态端到端融合,可直接从多模态输入(图像+指令)生成低层级动作控制信号(如关节扭矩、末端位姿)。1.4大模型与具身智能(2)基于数学架构。基于数学架构的具身智能(Mathematically-StructuredEmbodiedIntelligence)是一类以数学建模和理论框架为核心,通过形式化方法实现智能体与物理环境交互的技术路径。数学建模与动力学控制:数学建模与动力学控制通过动力学方程和优化算法实现智能体的精确运动控制与稳定行走。例如,四足机器人通过实时求解腿部动力学模型,实现复杂地形下的稳定行走。状态估计与概率推理:利用多传感器融合和滤波方法应对不确定性,提升环境感知与决策的鲁棒性。例如,自动驾驶汽车通过扩展卡尔曼滤波融合GPS、摄像头和雷达数据,实时估计自身位姿与周围障碍物位置。优化理论与任务规划:将目标转化为数学优化问题,通过算法求解最优路径和动作方案。例如,机械臂抓取任务可建模为“最小化运动时间+避开障碍物”的优化问题,利用梯度下降或遗传算法求解关节空间轨迹。1.4大模型与具身智能3)具身智能的方法路径在具身智能的研究中,主要路径分为分层方法和端到端方法。(1)分层方法。在分层方法中,最经典的算法是将任务的完成分为感知、决策和执行三个主要层次。感知层:负责全局目标的生成与抽象推理(如“从厨房取一杯水到客厅”),依赖环境感知(视觉、语音等)和语义理解技术(如自然语言处理、场景解析)。决策层:将高层目标拆解为可执行的子任务序列(如“导航到厨房→定位水杯→抓握→避障返回”),需解决路径规划、行为优先级调度(如避障优先于移动)和资源分配问题。执行层:通过传感器与执行器的闭环反馈,实现精细化动作(如步态控制、抓握力度调整),通常依赖PID控制、模型预测控制(MPC)或强化学习策略。(2)端到端方法。通过深度学习模型直接将感知多模态感知输入映射为动作输出,

并通过设置奖励函数在仿真模拟环境中进行大量训练,逐步收敛至最优策略,然后将学习成果迁移到现实环境中。1.4大模型与具身智能2.具身智能应用发展方向1)更高层次的自我学习与自主性具身智能将突破依赖规则和有限数据的局限,演进为具备人类般学习能力与环境适应力的高阶智能。它将融合多模态感知与交互经验,结合终身学习、元学习和因果推理,从“试错学习”走向“反思学习”。2)多智能体协作与分布式具身智能未来的具身智能将通过多智能体协作与去中心化决策,实现任务分工与资源优化。仿生设计和新型驱动技术将提升其柔性交互与动态环境适应能力。1.4大模型与具身智能3)全感知整合与情境智能具身智能将通过跨模态感知和动态建模,实现人类级情境理解与主动预判。它能构建“环境-任务-用户”认知模型,不仅解析物理状态,还能推断时空连续性与人类意图。4)伦理和安全框架的完善具身智能需依托技术、法律和价值的协同治理,确保数据安全、算法透明和隐私保护。其安全体系包括风险评估、故障溯源和责任追溯,并在极端场景下通过伦理准则和人类监督保证决策可信。ThankYou华航科技·致真唯实HUAHANGKEJI·ZHIZHENWEISHI机器视觉系统及成像原理1.1机器视觉系统认识1.1.1机器视觉系统概述机器视觉是一种利用光学装置和非接触式传感器获取图像,并通过图像处理与智能算法将视觉信息转化为可操作数据的技术系统。它结合了图像处理、模式识别、人工智能和自动化控制等多学科技术,能实现物体识别、尺寸测量、缺陷检测、位置定位等任务。其核心可概括为“视”(硬件成像与采集)和“觉”(软件处理与分析)。机器视觉系统硬件部分主要由照明光源、镜头、相机、图像采集/处理卡、图像处理系统、其他外部设备等组成,其工作流程见图1。1.1机器视觉系统认识图1机器视觉系统工作流程1.照明光源照明光源(见图2)是视觉系统的输入核心,能增强目标特征对比度、减少环境干扰,直接影响成像质量;需根据具体应用选择,如LED环形光源、同轴光源等。根据光源发光类型可分为LED灯、卤素灯、荧光灯、激光灯等。1.1机器视觉系统认识图2常见的机器视觉光源2.工业相机工业相机(见图3)在机器视觉系统中最重要的作用是将光信号转换为电信号,生成数字图像,还可以通过接口将采集到的图像即时传输到图像处理系统或计算机中,确保数据的实时性和准确性。1.1机器视觉系统认识图3工业相机3.工业镜头工业镜头(见图4)在机器视觉系统中扮演着“眼睛”的角色,将产品检测的情况反馈给工业相机。它将目标物体反射的光线聚焦到相机传感器上形成图像,对成像质量至关重要,其参数和质量会直接影响机器视觉系统整体性能和结果精度。1.1机器视觉系统认识图4工业镜头4.图像采集卡图像采集卡是机器视觉系统中连接工业相机与计算机的核心硬件(见图5),负责将相机输出的图像转换为计算机可以处理的数字信号。1.1机器视觉系统认识图5图像采集卡5.机器视觉软件机器视觉软件是机器视觉系统中自动化处理的关键部件,它根据具体应用需求,进行二次开发,可自动完成图像的采集、显示、存储和处理等操作。常见的机器视觉软件见图6。1.1机器视觉系统认识图6常见的机器视觉软件1.1.2相机基础知识及工作原理工业相机是机器视觉系统中的一个关键部分,是决定整个系统成本、速度和精度的关键组件。工业相机一般安装在机器流水线上,代替人眼来做测量和判断,选择合适的相机也是机器视觉系统设计中的重要环节。工业相机在机器视觉系统中的本质功能是将光信号转换为电信号,与普通相机相比,它具有更高的传输能力、抗干扰能力和稳定的成像能力,工业相机的基本结构(见图7)。1.1机器视觉系统认识图7工业相机的基本结构1.工业相机主要参数工业相机的主要参数包含图像传感器类型、像元尺寸、分辨率、帧率、曝光方式、接口类型、位深等。1)传感器类型图像传感器是将光学图像转换为电子信号,进而生成数字图像的设备,它直接影响到图像的质量、分辨率、灵敏度和噪声水平。传感器的性能决定了相机在不同光照条件下的表现,以及能否捕捉到清晰、准确的图像。2)像元尺寸像元尺寸即单个像素的物理尺寸,是反映影像特征的重要标志,是同时具有空间特征和波谱特征的数据元。其几何意义是数据值所代表的地面面积,物理意义是波谱变量所代表的其在某一特定波段中波谱响应的强度,即同一像元内的物体只有一个共同灰度值。像元尺寸决定了数字影像的分辨率和信息量。像元小,数字影像分辨率高,信息量大;反之,数字影像分辨率低,信息量小。1.1机器视觉系统认识3)分辨率相机分辨率是指相机能够分辨的细节程度,通常用水平和垂直方向上所能分辨的像素数量来表示,如常见的1920×1080表示水平方向有1920个像素,垂直方向有1080个像素。分辨率越高,相机可以捕捉到的细节越多,图像越清晰。相机分辨率高低主要取决于其感光芯片(CCD或CMOS)上的像素数量。4)帧率帧率指相机每秒钟能够捕捉并输出的图像数量,单位为fps,通常受带宽、曝光时间、像素格式等因素影响。相机帧率高意味着相机能够更连续地捕捉运动物体,生成的视频也更流畅。相机帧率(FPS)的计算如式(1)所示。"帧率"(FPS)="拍摄图像数量"/"时间(s)"(1)例如,相机在1s内捕捉了30幅图像,则其帧率为30fps。1.1机器视觉系统认识5)曝光方式曝光方式有全局曝光和行曝光两种,见图8。全局曝光是让整幅图像在同一时间曝光,所有像素同时开始曝光,并在相同的时刻结束曝光,这种类型确保整幅图像在同一时间被捕捉,避免了逐行曝光导致的运动模糊或畸变。适用于需要精确时间控制的场景,如高速运动物体的拍摄。CCD和CMOS都支持全局曝光方式。行曝光逐行进行曝光,从第一行像素开始,依次曝光,直到最后一行像素结束。这种类型在曝光过程中,每一行图像都有一个微小时间差,导致运动物体在图像中可能出现扭曲变形或拖影,因此不适合运动物体的拍摄。CMOS支持行曝光方式,CCD不支持。1.1机器视觉系统认识图8曝光方式6)接口类型常见的工业相机接口,见表1。1.1机器视觉系统认识表1常见的工业相机接口接口名称千兆网口GigEUSB3.0CameraLinkCoaXPress万兆网口10GigE传输速度1000Mb/s3000Mb/s6.8Gb/s72Gb/s10Gb/s传输距离(m)100530100100最大带宽1Gb/s5Gb/s6.8Gb/s72Gb/s10Gb/s采集卡千兆网卡USB3.0采集卡CameraLink采集卡CoaXPress采集卡万兆网卡7)位深位深是指每个像素的灰度值或颜色信息所用的位数,决定了图像的灰度级数或颜色数量,例如,8位深的图像每个像素有256(28)个灰度级,16位深的图像每个像素有65536(216)个灰度级。位深越高。2.相机分类1)按输出图像信号格式分类工业相机按输出信号分为模拟相机和数字相机:模拟相机输出模拟视频信号,需采集卡转换,分辨率低、抗干扰差,但延时小、成本低,适用于低要求或短距离场景。数字相机直接输出数字信号,分辨率高、抗干扰强、接口多,适合高精度检测和复杂图像处理,但成本相对较高。1.1机器视觉系统认识2)按图像传感器类型分类按照图像传感器类型的不同,工业相机可分为CCD相机和CMOS相机。CCD相机是使用CCD感光芯片为图像传感器的工业相机,集光电转换及电荷存储、电荷转移、信号读取于一体,是典型的固体成像器件。CMOS相机用CMOS感光芯片作图像传感器,将光敏元阵列、图像信号放大器、信号读取电路、模数转换电路、图像信号处理器及控制器集成在一块芯片上。3)按像素排列分类按照像素排列方式,工业相机可分为线阵相机和面阵相机两种。线阵相机通过逐行扫描获取图像,每次采集一行像素数据,再拼接成完整图像,常用于高分辨率连续检测场景面阵相机由二维像素阵列组成,可一次性捕捉完整图像,分辨率高、细节丰富,适用于静态或动态场景的全面检测与分析。1.1机器视觉系统认识1.1.3镜头基础知识及工作原理工业镜头的基本功能是实现光束变换。在机器视觉系统中,工业镜头的作用是将目标物体成像在图像传感器的光敏面上,工业镜头的质量会直接影响机器视觉系统的整体性能,合理地选择工业镜头是机器视觉系统设计的重要环节。1.镜头的基本参数镜头是基于折射原理构造的,通常由多个透镜组(凸透镜、凹透镜)组成,利用光的折射原理改变光路,目标物体发出的光线通过镜头后,在传感器平面形成倒立实像。工业镜头涉及的主要参数有:焦距、光圈、景深(DepthofField,DOF)、工作距离和视野,下文将分别进行介绍。1.1机器视觉系统认识1)焦距当与光轴平行的光线射入凸透镜时,理想的镜头情况下,所有的光线经过透镜折射后将汇聚在主轴上清晰一点,再以锥状扩散开,这个汇聚光线的点叫作焦点(见图9和图10),镜头中心到焦点的距离称为焦距。1.1机器视觉系统认识图9焦距示意图图10物体成像示意图2)光圈光圈是相机镜头内部的一个机械装置,又称孔径光阑,通常由多个可调节叶片组成,这些叶片可以开合,从而改变光阑的孔径大小,从而改变进光量,大光圈表明孔径大,进入的光线也就越多。光圈的主要作用是控制进入相机的光线量,达到影响图像的亮度、景深和成像质量的目的。大小光圈效果对比(见图11)。1.1机器视觉系统认识图11大、小光圈效果对比3)景深景深指聚焦后,焦点前后能够生成清晰图像的距离,简单说来就是镜头能够看清楚的“厚度”。景深和镜头的焦距、光圈、物距等参数有关(见图12),光圈越小,景深越大;物距越大,景深越大;焦距越小,景深越大。1.1机器视觉系统认识图12景深示意图4)

工作距离工作距离指镜头到目标拍摄物体之间的距离,也称作物距,用s表示。5)视野视野就是镜头能看到的范围,也就是镜头正常工作时能够覆盖的最大工作空间,用2h表示。2.镜头的分类镜头的结构复杂多样,分类的方法也很多,下面将介绍几种常见的分类方法。1)按焦距分类在机器视觉系统中,按照镜头焦距是否可调节可分为定焦镜头和变焦镜头两大类。其中,变焦镜头又可分为手动变焦镜头和电动变焦镜头两大类;定焦镜头按照其等效焦距不同又可细分为:鱼眼镜头、广角镜头、标准镜头、长焦镜头等。1.1机器视觉系统认识2)按成像方式分类基于镜头与相机的配合方式以及成像原理,工业镜头可分为线阵镜头和面阵镜头两类。线阵镜头配合线阵相机使用,采用扫描式工作方式。线阵相机的传感器呈“线”状,通过逐行扫描的方式获取图像,每次采集完一条线后,物体或相机移动到下一个位置,继续下一条线的采集,最终拼合成一张完整的二维图像。面阵镜头则与面阵相机搭配使用,传感器呈“面”状,每个像素点同时捕捉图像,一次性获取整个图像。3)按镜头功能分类对于使用在特定任务情况下的镜头,称其为特殊种类镜头,如远心镜头、微距镜头、显微镜头等。1.1机器视觉系统认识3.镜头畸变畸变是在图像采集时,由于镜头的设计、加工或安装等,采集到的图像与实际物体之间存在一定变形的现象。这种现象是光线在不同镜头位置的折射角度不同或放大倍率不同而导致的,但它只影响成像的几何形状,对清晰程度不会产生影响。4.镜头的选择镜头的基本光学性能由焦距、相对孔径(光圈数)和视野三个参数表征,因此,在选择镜头时,首先需要确定这三个参数,最主要的是确定焦距,然后再考虑分辨率、景深、畸变、接口等其他因素。1.1机器视觉系统认识1.1.4光源基础知识及选型原则机器视觉系统的核心功能是图像采集和图像处理,而光源可以提供稳定的照明条件,在拍摄过程中采用适当的光源进行补光,可以使被拍摄物特征具备明显而稳定的灰度值差异,并降低环境及其他杂散光的干扰,以得到高对比度的特征图像,图像中的目标信息与背景信息就可以得到更好的分离,提高机器视觉系统的精度和可靠性。1.照明技术基础知识基于物理知识,我们可以了解到光传播的一些基本特质,如光在真空中呈直线传播,光在传播过程中会发生反射、折射、透射、吸收的现象。1.1机器视觉系统认识图13中入射光线照在被测物体表面后,产生反射、吸收和透射的现象。1.1机器视觉系统认识图13光线与被测物之间的关系2.打光方式不同的用途对采集图像有不同的要求,且不同被测物体之间材料、大小、形状特点的不同也会影响采集图像的效果,不同的光源照射方式可以着重突出图像的部分特性,对后续处理过程产生较大影响,因此选择合适的打光方式在机器视觉系统中也至关重要。1)高角度打光(明视野)2)低角度打光(暗视野)3)背向打光4)透射打光1.1机器视觉系统认识3.光源的种类光源的正确选择是机器视觉检测应用成功的关键因素之一,对于机器视觉系统,理想的光源应该是明亮、均匀、稳定的。目前视觉系统中常见的光源类型主要有:LED灯、卤素灯、荧光灯、激光灯等。根据不同应用场景的特性和要求测得参数的差异,测量中用到的光源类型需要结合具体情况分析选择。1)LED灯LED灯指利用发光二极管(即LED)作为光源的灯具。在机器视觉应用领域,由于LED光源的突出优势,应用范围最广。2)卤素灯卤素灯是一种填充气体内含有部分卤族元素或卤化物(通常为碘或溴)的充气白炽灯。卤素灯具有使用寿命长、显色性好、高亮度高效率等特点,适用于需要高亮度照明的场合。1.1机器视觉系统认识3)荧光灯荧光灯又称为日光灯,传统荧光灯即低压汞灯,是利用低气压汞蒸气在通电后释放紫外线,从而使荧光粉发出可见光的原理发光的。其具有扩散性好,适合大面积均匀照射;发热少,使用寿命约1500~3000h,适用于彩色图像视觉检测场景。4)激光灯激光是可使用范围内最亮的光源,激光灯正是利用激光进行照明的。通常应用于精度要求极高的精密测量和检测场景。1.1.5图像采集卡及图像处理组件图像采集卡又称图像捕捉卡,其主要功能是将来自相机的模拟信号或数字信号转换为所需的图像数据流并发送到计算机端,是实现相机与计算机间连接的重要组件。1.1机器视觉系统认识1.图像采集卡种类(1)按照接收信号的种类,图像采集卡可以分为模拟信号图像采集卡和数字信号图像采集卡。模拟信号图像采集卡主要用于处理模拟信号,通常将模拟视频信号通过A/D转换器转换为数字信号,然后传输到计算机进行处理。数字信号图像采集卡处理的是来自数字相机的数字信号,其通过数字接口接收来自数字相机的图像数据,然后将这些数据传输到计算机的内存中进行进一步处理。(2)按照接口适用性,可分为专用接口采集卡(如CameraLink、模拟视频接口等)和通用接口采集卡(如GigE、USB3.0等)。(3)按照支持的颜色,可以分为彩色图像采集卡和黑白图像采集卡。(4)按照性能作用,可以分为电视卡、图像采集卡、DV采集卡、高清采集卡、VCD卡等。1.1机器视觉系统认识2.主要技术参数1)图像传输接口与数据格式2)图像格式(像素格式)3)传输通道数4)分辨率5)带宽6)采样频率1.1机器视觉系统认识3.图像采集卡的选型在选择图像采集卡前,需要先明确应用场景具体功能要求,如分辨率、带宽、传输频率等要求,以及所用相机的具体参数,选用的图像采集卡应该与相机进行匹配,主要有以下几方面。(1)支持接口模式,如CameraLink接口的相机支持的模式有Base模式、Medium模式、Full模式,在选择图像采集卡时也应当与这些模式匹配。(2)支持的分辨率。在选择时应该考虑图像采集卡的分辨率是否能满足输入图像的要求。(3)其他因素:要考虑硬件的可靠性,如是否有过电压保护、散热性能如何等。除硬件外,还需要考虑配套软件的易用性,图像采集卡一般有配套的开发包,如SDK、开发平台等,需要根据实际情况和功能侧重进行选用。1.1机器视觉系统认识1.2图像处理技术的基本原理图像处理技术的本质是通过数学与算法工具对原始像素数据进行重构与解析,将无序的光信号转换为可量化、可分析的视觉信息。从工业检测中的缺陷定位到自动驾驶的环境感知,这一过程涵盖五大关键阶段:图像生成与表示奠定数字图像的数学基础,基本变换实现几何与灰度的规范化表达,滤波与增强抑制噪声并强化目标特征,特征提取提炼高阶语义信息,通过2D和3D图像匹配完成物体识别与空间定位。本节内容将深入解析这一技术链条的底层逻辑,揭示像素操作如何驱动机器视觉从“看见”迈向“理解”。1.2.1图像生成与表示1.图像获取图像获取(或称为图像采集)是图像处理的第一步,指的是通过各种传感器(如相机、扫描仪等)捕捉现实世界场景的光信息或其他形式的能量信息,并将其转换为可以被计算机处理的数字信号,以便后续处理和分析。1.2图像处理技术的基本原理2.图像数字化图像数字化是将连续的模拟图像转换为离散的数字图像的过程。它主要包括采样(sampling)和量化(quantization)两个步骤。采样:将连续的图像在空间上离散化,即把图像分割成一个个小的区域,每个小区域称为像素(pixel)。像素是数字图像的基本单位。每个像素的位置由其在图像中的坐标(m,n)决定,其中m代表行数,n代表列数。采样间隔越小,图像的分辨率越高,图像质量越好。量化:将每个像素的亮度值转换为离散的灰度或颜色值。每个像素的亮度值通常用整数表示,这个整数的范围称为灰度级(graylevel)。常见的灰度级有256级(0~255),对应于8bit量化。图像数字化后,就成为计算机可以处理的数字图像。常见的图像格式如下。(1)灰度图像:每个像素只有一个灰度值,表示图像的亮度。(2)彩色图像:每个像素有多个颜色分量,如RGB图像有红色(R)、绿色(G)和蓝色(B)三个分量。(3)二值图像:每个像素只有两个值,通常为0和1,分别表示黑色和白色。1.2图像处理技术的基本原理1.2.2图像的基本变换图像基本变换作为预处理的核心环节,通过重塑像素的空间分布与强度关系,实现三大关键目标。(1)信息强化:线性变换调节亮度/对比度,凸显目标区域细节。(2)特征聚焦:二值化压缩信息维度,分离前景与背景。(3)几何校正:空间变换消除成像畸变,建立标准化观察视角。以下是线性变换、图像二值化相关概述。1.线性变换在图像处理领域,线性变换是基础且广泛应用的工具,其核心在于通过矩阵运算改变图像的空间结构或像素值分布。线性变换满足叠加性和齐次性,即变换前后的线性组合关系保持不变。1.2图像处理技术的基本原理2.图像二值化图像二值化(imagebinarization)将灰度或彩色图像转换为仅包含两种像素值(通常为0和255,即纯黑和纯白)的二值图像(见图14)。图像二值化的基本原理是通过设定阈值,将像素的灰度值与该阈值进行比较,高于阈值的像素被归为前景(白),低于阈值的像素被归为背景(黑)。1.2图像处理技术的基本原理图14二值化前后图像对比(左右图片分别为原始图片和二值化处理后的图片)3.几何变换几何变换,本质上是通过建立不同观察视角下的空间映射关系,实现图像数据的结构化重组。这个过程需要满足两个核心要求:保持视觉信息的拓扑不变性,以及适应计算机的数值计算特性。如同建筑师需要精确的测绘工具构建建筑模型,几何变换为计算机视觉提供了构建数字世界的坐标量尺。1.2.3图像滤波与增强在完成图像数字化与基础变换后,原始图像仍受噪声干扰、细节模糊或对比度不足等问题的制约。图像滤波与增强作为预处理的关键阶段,通过重构像素的邻域关系与强度分布,实现三大核心目标。1.2图像处理技术的基本原理(1)噪声抑制:空域滤波消除脉冲噪声与高斯噪声,如中值滤波通过排序统计保护边缘完整性,高斯滤波利用加权平均平滑高频干扰。(2)特征增强:频域方法分离高频细节与低频背景,傅里叶变换结合带通滤波强化目标轮廓,直方图均衡化扩展灰度动态范围以提升对比度。(3)数据优化:自适应算法融合物理先验与深度学习,如小波变换联合卷积神经网络增强微结构特征,为后续特征提取与匹配提供高信噪比输入。下面简要描述了空域与频域滤波的数学原理,探讨自适应增强的策略设计,并引入多尺度融合与智能化处理的前沿方向,为高阶视觉任务奠定算法基石。1.2图像处理技术的基本原理1.灰度修正灰度修正主要针对独立的像素点进行处理,由输入像素点的灰度值来决定相应输出像素点的灰度值,通过改变原始图像所占据的灰度范围而使图像在视觉上得到改观,但这种变换没有利用像素点之间的相互空间关系,属于最简单的一类图像处理变换方法,因而这种处理方法也称为点运算。2.中值滤波中值滤波作为一种非线性滤波技术,凭借其独特的噪声抑制机制脱颖而出:通过使用一个滑动窗口遍历图像的每个像素,取邻域窗口内像素值的中位数替代中心像素值,并将中心像素的值替换为窗口内所有像素值的中值。1.2图像处理技术的基本原理在机器视觉系统中,中值滤波常作为重要的预处理步骤,为后续处理提供更清晰的输入(见图15)。1.2图像处理技术的基本原理(a)原始图像(b)高斯滤波处理后图像(c)中值滤波处理后图像图15两栖动物血液图像处理对比3.傅里叶变换(2D)傅里叶变换是图像处理中非常经典的工具。它通过将图像从空间域转换到频率域,为图像处理和分析提供了全新的视角。在傅里叶变换背景下,松鼠背后的灰色背景主要“包含”低频,因为像素的强度从一个像素到另一个像素缓慢变化。相反,尾巴部分需要高频来显示毛发和背景之间的快速交替,见图16。1.2图像处理技术的基本原理图片图16松鼠图像的DFT。振幅以对数刻度显示,以清晰区分细节DFT幅值DFT相位1.2.4图像特征提取图像特征提取属于图像分析的范畴,是数字图像处理的高级阶段,也是图像识别的开始。从图像中提取有用的数据或信息,得到图像的“非图像”的表示或描述,如数值、向量和符号等,这一过程就是特征提取,而提取出来的这些“非图像”的表示或描述就是特征。有了这些数值或向量形式的特征就可以通过训练过程教会计算机如何懂得这些特征,从而使计算机具有了识别图像的本领。图像特征提取的实施遵循系统化的处理链条(见图17)。1.2图像处理技术的基本原理图17图像特征提取流程1.特征的基本概念在计算机视觉中,特征是指关于图像内容的一段信息,通常用于描述图像中某个区域是否具有特定的属性。这些特征可以是图像中的边缘、角点、斑点或特定纹理等,它们携带着图像的本质信息,能够帮助系统理解图像内容。2.特征检测方法特征检测是低级图像处理操作,通常作为图像处理的第一步,检查每个像素以确定该位置是否存在特征。特征检测方法多种多样,根据检测的特征类型不同,可以分为边缘检测、角点检测、斑点检测和脊检测等。3.特征提取方法选择合适的特征提取方法需综合考虑应用需求、数据特性、计算资源和解释性要求等因素。传统方法在计算资源有限、数据量小或需要清晰理解特征含义的场景中具有优势,深度学习方法则在处理复杂图像、大规模数据集和高精度要求的任务中表现出色。未来的机器视觉系统将能自动选择和组合最优特征提取策略,为各行业视觉智能应用提供更强大支持。1.2图像处理技术的基本原理1.2.52D和3D图像匹配图像匹配的本质是在两幅或多幅图像中识别和关联对应的像素、特征或区域。从广义上讲,图像匹配旨在寻找图像A中的某个元素在图像B中的位置。图像匹配可分为密集匹配和稀疏匹配两种主要范式。密集匹配尝试为图像中的每个像素找到对应点,而稀疏匹配则仅关注特定的兴趣点或特征。无论采用哪种范式,图像匹配的核心挑战都在于应对各种复杂情况,如视角变化、光照差异、遮挡、尺度变化等。1.图像匹配的基本原理从数学角度看,图像匹配可以表述为一个映射问题。假设有两幅图像I₁和I₂,图像匹配的目标是寻找一个变换函数T,使得I₁(x,y)与I₂(T(x,y))之间的差异最小化。这个变换函数可能是简单的平移、旋转和缩放,也可能是更复杂的投影变换或非刚性变形。1.2图像处理技术的基本原理图像匹配主要可以分为特征匹配和区域匹配两种方法。1)特征匹配特征匹配是图像匹配中最为广泛应用的方法,其核心思想是通过特征点及其描述符来建立图像之间的对应关系。特征匹配通常包含三个关键步骤:特征检测、特征描述和特征匹配。2)区域匹配区域匹配方法直接比较图像中的像素块或区域,而不依赖于特征点。最基本的区域匹配技术是模板匹配,它通过在目标图像上滑动一个模板窗口,计算每个位置的相似度,找出最佳匹配位置。模板匹配虽然简单直观,但对旋转、缩放和变形敏感,且计算复杂度高。1.2图像处理技术的基本原理2.2D图像匹配技术特征匹配是比同图像的特征描述符以确定相似度的过程(见图18)。最简单的方法是暴力匹配,即计算第一幅图像中每个特征与第二幅图像中所有特征的距离,选择距离最小的作为匹配对。1.2图像处理技术的基本原理(a)使用暴力匹配进行图像匹配(b)使用KNN匹配进行图像匹配图18基于点匹配的图像匹配最匹配的10个关键点每个描述符的最佳匹配与特征匹配关注局部兴趣点不同,全局匹配方法考虑整个图像的整体特性。这类方法通常基于图像的颜色分布、纹理特征或形状轮廓等全局属性。颜色量化描述符是一种常用的全局特征,它通过将图像颜色空间划分为若干区域,统计每个区域中像素的分布情况,形成颜色直方图或颜色矩特征。1.2图像处理技术的基本原理3.3D图像匹配技术三维图像的目标是在三维空间内建立点云、深度图和多视角图像等不同数据源之间的精确对应关系,本质是建立不同视角下图像之间的对应关系,进而恢复场景的三维结构信息。与二维匹配相比,三维匹配不仅需要确定特征点在图像平面的对应关系,还需要处理额外的深度维度和复杂的空间几何变换,需要恢复特征点在三维空间中的位置信息,这对算法设计提出了更高要求(见图19)。1.2图像处理技术的基本原理图19确定物体的位置(需要灰度或RGB图像、深度信息和CAD(计算机辅助设计)模型)ThankYou华航科技·致真唯实HUAHANGKEJI·ZHIZHENWEISHI工业机器视觉基础应用实践

--3.1工业机器视觉技术概述1.1工业机器视觉技术概述1.1.1工业机器视觉的技术原理工业机器视觉(industrialmachinevision)是一种利用光学、传感器、图像处理和计算机技术,在工业环境中实现自动化测量、定位、识别和检测的技术。其核心是通过模拟人类视觉功能,结合算法和硬件系统,实现对目标物体的快速、精准分析。工业机器视觉技术的工作流程通常分为以下四个步骤。(1)图像采集与标定:图像采集与标定是机器视觉系统中至关重要的步骤,其将物理世界转换为数字图像,并准确建立了物理世界到数字图像之间的映射,从而能够进行精确的测量和分析,为后续的图像处理和分析提供基础。图像采集是系统的“眼睛”,决定了数据质量;标定是系统的“尺子”,决定了物理精度。1.1工业机器视觉技术概述(2)图像预处理:在工业机器视觉系统中,图像预处理是介于图像采集与特征分析之间的关键步骤,其核心意义在于优化原始图像的质量,使后续算法能够更高效、更准确地提取目标信息。预处理不仅直接影响系统的检测精度和鲁棒性,还能显著降低计算复杂度,是工业应用中不可忽视的技术环节。(3)图像特征提取与分析:在工业机器视觉中,图像特征提取是从预处理后的图像中识别并抽取出关键信息的过程,这些信息能够表征目标物体的本质属性(如形状、纹理、颜色等),为后续的检测、分类、测量或定位提供数据基础。其意义不仅在于简化数据,更在于将图像转换为可量化、可分析的语义信息。图像特征分析的核心任务是将图像特征(如边缘、纹理、颜色)转化为可理解的工业参数(如缺陷类型、尺寸偏差、坐标位置),是连接“感知”与“决策”的核心环节,直接影响系统的检测精度、效率和智能化水平。1.1工业机器视觉技术概述(4)决策与控制:在工业机器视觉系统中,决策与控制是流程的最终环节,其实将分析结果转化为可执行的工业指令,其核心意义在于将图像特征提取与分析的结果转化为物理世界的具体动作,完成从“感知”到“行动”的闭环,赋予机器视觉系统真正的应用价值——发现问题、量化问题并解决问题,是确保机器视觉真正落地工业应用、实现自动化的关键。1.图像采集与标定图像采集与标定是机器视觉系统中至关重要的步骤,它们确保了从物理世界到数字图像的准确映射,从而能够进行精确的测量和分析。本节将介绍图像获取的原理与过程,以及相机标定的重要性和常见方法。1.1工业机器视觉技术概述1)图像采集系统图像采集是机器视觉系统与物理世界之间的唯一接口,所有后续的算法、模型和决策都依赖于采集到的图像数据。如果原始图像信息缺失或失真,后续处理(如缺陷检测、尺寸测量)将失去可靠依据。合理设计的图像采集方案能够突出目标物体的关键特征(如边缘、纹理、颜色、缺陷),为后续处理提供“高价值数据”。(1)相机传感器:工业相机通常采用CCD(电荷耦合器件)传感器或CMOS(互补金属氧化物半导体)传感器。这些传感器通过接收光线,将光信号转换为模拟电信号,然后通过模数转换器将模拟电信号转换为数字信号,见图1。1.1工业机器视觉技术概述光源相机传感器镜头被测工件图1图像采集系统示例(2)镜头:镜头的主要功能是将物体的光线聚焦到图像传感器上。镜头的参数(如焦距、光圈、畸变等)决定了图像的质量和视场大小。选择合适的镜头对于图像质量至关重要。(3)光源:光源在图像采集中至关重要,合理的光照条件能够提高物体的对比度和细节,使得特征提取更加准确。常见的光源有LED、激光、点光源等,光源的布置会影响图像的亮度、阴影和反射。2)图像采集过程光学成像:通过镜头将目标物体的光学信息聚焦到图像传感器上。光电转换:图像传感器(如CCD或CMOS)将光信号转换为电信号。信号处理与传输:采集卡将电信号转换为数字信号,并通过接口(如USB、GigE)传输到计算机或其他处理设备。图像存储与初步处理:采集到的图像数据通常会进行初步处理,如去噪、对比度增强等。1.1工业机器视觉技术概述3)相机标定相机标定(CameraCalibration)是将图像中的二维像素坐标(O-xy)映射到物理世界的三维坐标系(Ow-XwYwZw)中的过程,如图2所示,其中,包括世界坐标系(Ow-XwYwZw)到相机坐标系(Oc-XcYcZc)的转换,相机坐标系(Oc-XcYcZc)到图像物理坐标系(O-xy)的映射,以及图像物理坐标(O-xy)到像素坐标(O’-uv)的转换,见图2。1.1工业机器视觉技术概述图2相机标定原理示意图相机标定的目的是建立相机的内部参数(如焦距、主点、畸变系数)和外部参数(相机的位置与姿态)与图像坐标系之间的数学关系,其中获取相机的内参的过程称为内参标定,获取相机的外的过程称为外参标定。(1)外参:描述相机坐标系与世界坐标系之间的关系,通常由旋转矩阵(描述相机姿态)和平移向量(描述相机位置)来表示。旋转矩阵:描述相机坐标系相对于世界坐标系的旋转。平移向量:描述相机坐标系相对于世界坐标系的平移位置。1.1工业机器视觉技术概述(2)内参:描述相机的内部几何结构,包括相机的焦距、主点坐标、像素尺寸、畸变等。对于一个具有固定镜头的相机,内参可认为是固定不变的。内参的精确获取能确保在不同的拍摄条件下,图像中的像素能准确地表示世界空间中的点。焦距:相机镜头的焦距,决定了图像的放大程度。主点:图像的光轴与图像传感器的交点,通常是图像中心。像素尺寸:指每个像素在现实世界中的物理大小,影响图像的分辨率。畸变系数:由于相机镜头的物理限制,镜头可能导致图像出现径向或切向畸变,影响图像的精度。在工业视觉测量的相机中,畸变系数实际上是非常小的,可以忽略。1.1工业机器视觉技术概述(3)外参标定是要将世界坐标系(Ow-XwYwZw)转换为相机坐标系(Oc-XcYcZc),见图3,此过程属于刚体变换,即物体不会发生形变只需要进行旋转和平移,因此,通过旋转和平移可得到在世界坐标系(Ow-XwYwZw)中P点在相机坐标系的坐标:1.1工业机器视觉技术概述表达式1其中,R为3×3的旋转矩阵,T为3×1的平移向量。因此,通过外参标定就可以确定相机的外参,即旋转矩阵和平移向量。1.1工业机器视觉技术概述图3外参标定原理示意图(4)内参标定是要将相机坐标系(Oc-XcYcZc)转换为像素坐标系(O’-uv),此过程包含相机坐标系(Oc-XcYcZc)到图像物理坐标系(O-xy),图像物理坐标(O-xy)到像素坐标(O’-uv)两个转换。对于第一个转换(见图4),空间中的一点P(Xc,Yc,Zc)在摄像机成像平面上对应到点p(x,y),相机光心Oc和空间物点P的连线与相机成像面相交于点p。光点为摄像机的光轴与成像面的交点,也表示图像物理坐标系的原点,若用f表示相机的焦距,则可利用光学三角原理可以得到:1.1工业机器视觉技术概述表达式2图4相机坐标系到图像物理坐标系转换原理对于第二个转换(见图5),以图像平面的左上角或者左下角为原点建立图像像素坐标系,假设成像平面坐标原点位于图像左上角,水平向右为u轴,垂直向下为v轴,均以像素为单位。以像平面与光轴的交点O1为原点建立图像物理坐标系,水平向右为x轴,垂直向下为y轴,原点O1(u0,v0)一般位于图像中心处,由此可得到:1.1工业机器视觉技术概述其中,dx和dy分别为相机CCD/CMOS感光芯片中单个像素的长度和宽度。表达式3综合公式(表达式2)和(表达式3)可得:1.1工业机器视觉技术概述表达式4一般来说,除了焦距,相机内参是在相机制造完成时就已经被固定。当采用不同的镜头采集图像时,相机的焦距也会发生改变。1.1工业机器视觉技术概述图5图像物理坐标到像素坐标原理示意图2.图像预处理图像预处理是机器视觉系统中至关重要的步骤,旨在对采集到的原始图像进行优化和处理,从而提高后续分析和计算的效率和精度。图像预处理的具体内容包括图像去噪、图像增强、几何变换、图像分割等。不同的应用场景可能需要不同的预处理方法,下面我们将介绍常见的图像预处理技术。1)图像去噪图像去噪的目的是去除图像中的噪声干扰,使得图像更加清晰、可用。噪声通常来源于多种因素,如传感器缺陷、环境光照变化、相机本身的噪声等。常见的噪声类型包括高斯噪声、椒盐噪声等。常见的去噪方法有均值滤波(meanfilter)、中值滤波(medianfilter)和高斯滤波(Gaussianfilter)等。1.1工业机器视觉技

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论