工业机器视觉技术与应用 课件 第四章-工业视觉图像分割_第1页
工业机器视觉技术与应用 课件 第四章-工业视觉图像分割_第2页
工业机器视觉技术与应用 课件 第四章-工业视觉图像分割_第3页
工业机器视觉技术与应用 课件 第四章-工业视觉图像分割_第4页
工业机器视觉技术与应用 课件 第四章-工业视觉图像分割_第5页
已阅读5页,还剩57页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

工业视觉图像分割提纲图像分割的基本知识传统图像分割方法基于机器学习的图像分割方法基于深度学习的图像分割方法工业图像分割应用案例图像分割的基本知识图像分割在视觉任务中非常重要,广泛应用于医学影像分析、自动驾驶场景理解、工业缺陷检测等领域,为后续的识别、检测和决策提供基础支持医学影像分析自动驾驶场景理解工业缺陷检测图像分割的基本知识图像分类判断整图类别,目标检测定位并标注目标,图像分割则精确到像素级划分区域,三者共同构成视觉理解的关键步骤图像分类Classification任务:判断整张图片属于哪个类别目标检测Detection任务:找出图中目标的位置和类别图像分割Segmentation任务:精确到像素级划分目标图像分割的基本知识图像分割实现像素级区域划分,是从粗粒度识别到精细视觉理解的重要跨越图像分类Classification输出:一个标签场景:如判断“这是一张狗的照片”粒度:整图级目标检测Detection输出:多个边界框+标签场景:如判断“这是一张猫的照片”粒度:目标级图像分割Segmentation输出:分割掩膜图(Mask)场景:精确勾出猫狗的轮廓粒度:像素级图像分割的基本知识图像分割是将图像划分为若干互不重叠的区域或像素集合的过程。其目标是将图像中具有相似特征的像素或区域聚集到一起,并且清晰地划分不同目标或感兴趣区域之间的边界输入图片图像中具有相似特征的像素或区域聚集到一起图像分割的基本知识图像分割可分为语义分割、实例分割和全景分割三类,分别实现像素级类别划分、个体区分和整体场景理解输入图片语义分割实例分割全景分割图像分割的基本知识

像素准确度PA:分类正确的像素点数和所有的像素点数的比例,计算公式为:

图像分割的基本知识

平均像素准确度MPA:计算每一类分类正确的像素点数和该类的所有像素点数的比例然后求平均,其计算公式为:

图像分割的基本知识

交并比IoU:目标掩膜与预测掩膜的公共区域的像素个数,与两者总的像素个数的比值,即该类别下预测正确的数量与该类别预测为其他类别和其他类别预测为该类别的总和的比值,其计算公式为:

图像分割的基本知识

平均交并比mIoU:对所有预测类别求交并比,然后对所有类别的交并比求平均;

图像分割的基本知识

频率加权交并比FWIoU:是采用每个类别的类别数量作为加权权重对所有类别的交并比求加权平均;

提纲图像分割的基本知识传统图像分割方法基于机器学习的图像分割方法基于深度学习的图像分割方法工业图像分割应用案例传统图像分割方法阈值分割(Thresholding/Otsu),通过设置灰度阈值将前景和背景分离,是最简单的分割方法原理:根据灰度直方图确定最佳阈值代表算法:Otsu大津法优势:快速、实现简单劣势:对光照和噪声敏感PS:Otsu大津法是一种自动阈值分割算法,通过最大化类间方差来自适应选择最佳阈值,将前景与背景自动分离传统图像分割方法Otsu大津法:最大类间方差自动阈值分割。首先将图像像素灰度划分为前景和背景两类;计算不同阈值下两类的类间方差;选择使类间方差最大的阈值作为最佳分割点,实现前后景自动区分

传统图像分割方法边缘检测(EdgeDetection),通过梯度算子检测像素灰度变化显著的边界原理:一阶或二阶导数检测边缘算子:Sobel、Canny、Laplacian优势:轮廓清晰劣势:难以得到闭合区域PS:Canny边缘检测是一种多阶段图像处理算法,通过高斯平滑、梯度计算、非极大值抑制和双阈值连接等步骤精确提取图像边缘。传统图像分割方法Canny边缘检测是一种经典的多阶段图像处理算法,通过平滑、梯度计算、非极大值抑制和双阈值连接等步骤精准提取图像边缘算法原理步骤:高斯平滑:使用高斯滤波去除噪声;梯度计算:计算水平和垂直方向梯度幅值和方向;非极大值抑制(NMS):沿梯度方向抑制非最大值像素,细化边缘;双阈值检测:设置高、低阈值,标记强边缘和弱边缘;边缘连接:将与强边缘相连的弱边缘保留,实现连续边界。非极大值抑制在得到梯度大小和方向之后,进行图像的全扫描以去除可能不构成边缘的任何不需要的像素。为此,在每个像素处,检查像素是否在其梯度方向上的邻域中是局部最大值传统图像分割方法区域生长/分裂与合并(RegionGrowing/Split&Merge),从种子像素出发扩展区域或按规则分裂合并图像块,实现区域划分原理:区域生长:基于相似性逐步扩张,分裂合并:自顶向下分块再合并优势:结果平滑、连贯劣势:参数敏感、速度较慢PS:区域生长从选定的“种子像素”出发,根据相似性准则不断扩展,将相邻像素归入同一区域,实现分割。分裂与合并采用自顶向下和自底向上的双向策略,将图像递归划分为小区域,再按相似性条件合并,实现分割。传统图像分割方法区域生长和分裂与合并都是基于区域像素相似性原则的传统图像分割方法,分别采用“自底向上扩展”和“自顶向下分解”策略,实现像素聚类与区域划分分裂与合并(Split&Merge)核心思想:采用四叉树分割,将图像自顶向下递归划分为小块,再基于相似性自底向上合并,实现复杂图像区域划分算法步骤:1.分裂(Split):将区域方差大于设定阈值的块四叉划分;2.合并(Merge):相邻区域若相似则合并;3.终止:所有区域满足相似性条件,得到最终分割图。区域生长(RegionGrowing)核心思想:从一个或多个“种子像素”出发,根据灰度、颜色或纹理相似性准则,将邻近像素逐步合并进区域,直至不满足条件算法步骤:选择种子像素;计算邻域像素与区域均值差异;满足阈值条件的像素加入区域;循环扩展,直到区域稳定。提纲图像分割的基本知识传统图像分割方法基于机器学习的图像分割方法基于深度学习的图像分割方法工业图像分割应用案例基于机器学习的图像分割方法机器学习方法通过对像素特征进行建模与分类,实现图像的自动分割,典型方法包括支持向量机、聚类分析和高斯混合模型基于机器学习的图像分割方法原始图像→特征空间表示→分割结果支持向量机(SVM)分割支持向量机(SupportVectorMachines,SVM)是一种强大的分类和回归方法,它主要被用于监督学习任务。在过去的几十年中,研究者们已经将SVM成功地应用于各种任务,包括图像分割。Vapnik等人在二十世纪末设计了最初的支持向量机SVM用于处理二分类问题。更详细来说,用两类样本训练的支持向量机的最大边界超平面和边界,而边缘上的样本称为支持向量支持向量机(SVM)分割在图像分割的背景中,SVM可以被用来根据图像特征(比如颜色、纹理、形状等)将像素分类到不同的分割区域。基于SVM的图像分割过程大致可以分为以下几步:①特征提取:对于每一个像素,我们需要提取一组特征,这些特征可以是颜色、纹理、形状等信息。②训练SVM:然后我们可以使用这些特征和对应的标签(像素属于哪个区域)来训练一个SVM。训练的目标是找到一个可以最大化间隔的超平面,该超平面能将不同类别的像素分开。③应用SVM:一旦我们训练好了SVM,我们就可以将它应用到同一图片的其它像素,或者其它图片的像素上,以进行图像分割。支持向量机(SVM)分割在图像分割的背景中,SVM可以被用来根据图像特征(比如颜色、纹理、形状等)将像素分类到不同的分割区域。基于SVM的图像分割过程大致可以分为以下几步:①特征提取:对于每一个像素,我们需要提取一组特征,这些特征可以是颜色、纹理、形状等信息。②训练SVM:然后我们可以使用这些特征和对应的标签(像素属于哪个区域)来训练一个SVM。训练的目标是找到一个可以最大化间隔的超平面,该超平面能将不同类别的像素分开。③应用SVM:一旦我们训练好了SVM,我们就可以将它应用到同一图片的其它像素,或者其它图片的像素上,以进行图像分割。支持向量机(SVM)分割以二分类为例,具体步骤如下:

基于聚类的分割方法JamesMacQueen等人在手稿SomeMethodsforClassificationandAnalysisofMultivariateObservations中首次提出并命名了K-means聚类算法。随着研究人员持续研究,K-means聚类算法在图像处理和计算机视觉领域的应用则是在后来逐渐发展起来。K-means聚类算法是一种广泛应用于图像分割的传统机器学习方法。该算法旨在将n个像素划分为k个聚类,其中每个像素属于离它最近的平均值对应的聚类基于聚类的分割方法K-means聚类的操作步骤通常由4个部分构成,这与前面介绍的工业图像分类任务的对应关系基本一致:第一步,初始化:随机选取k个像素点作为初始聚类中心(Centroid)。第二步,分配像素:将每个像素点分配给最近的聚类中心。这里的"最近"是通过计算像素点与聚类中心之间的欧氏距离来定义的。第三步,计算新的聚类中心:对于每个聚类,计算其所有像素点的平均值,得到新的聚类中心。第四步,迭代求解:重复步骤2和步骤3,直到聚类中心的变化小于某个预设的阈值,或者达到预设的最大迭代次数。基于聚类的分割方法具体步骤如下:

基于高斯混合模型的图像分割在机器学习中,基于高斯混合模型(GaussianMixtureModel,GMM])的图像分割是一种强大且常用的技术。首先,我们先简单介绍高斯混合模型技术,GMM是一个包含多个高斯分布的概率密度模型,GMM的基本思想是假设数据集中的每个样本点都是从多个高斯分布中的一个生成的,每个高斯分布称为一个分量。每个分量由三个参数定义:均值(mean),方差(variance)和权重(weight)。一个简单的高斯混合模型如图所示基于高斯混合模型的图像分割在图像处理中,GMM可以被用于对像素值(通常是颜色)进行建模。每个高斯分布可以被视为对应一个特定的颜色或颜色群体。GMM的一个关键特性是,它能够表示不同的颜色,因此在颜色空间中可以覆盖更广的范围。一般来说,基于GMM的图像分割由两个部分所组成,首先每个像素的颜色被认为是来自一个或多个高斯分布的样本。其次,我们可以使用EM(期望最大化)算法来估计这些高斯分布的参数(即均值和方差)。一旦我们有了这些参数,我们就可以将每个像素分配给最有可能生成它的高斯分布。这样,我们就将原始图像分割成了多个区域,每个区域对应一个高斯分布,也就是一种颜色或一组颜色。基于高斯混合模型的图像分割具体步骤如下:

提纲图像分割的基本知识传统图像分割方法基于机器学习的图像分割方法基于深度学习的图像分割方法工业图像分割应用案例全卷积神经网络(FCN)全卷积网络(FCN)是一种经典的深度学习图像分割模型。它最早由Berkeley大学的研究人员在2015年提出。FCN的主要创新之处在于它将传统的全连接层替换为卷积层,这使得网络能够接受任意大小的输入图像,并输出相同大小的分割图像。此外,FCN引入了跳跃连接和上采样操作,以保留图像的空间信息,这对于精确的分割十分重要。下图简单表示了卷积网络的基本结构。全卷积神经网络(FCN)具体而言,FCN的结构主要由两个部分组成:卷积层和反卷积层。卷积层部分用于提取图像特征,反卷积层部分用于预测每个像素的类别。FCN模型会逐层对输入图像进行卷积操作,这一过程中图像的尺寸会逐渐缩小,同时特征图的深度会逐渐增加。这个过程可以看作是对图像进行压缩编码,提取出图像的抽象特征。接下来,FCN会通过反卷积操作,将压缩后的特征图逐渐放大,恢复到与原图相同的尺寸。这一过程可以看作是对图像特征进行解码,得到像素级别的分割结果。卷积:蓝色的输入图片(4x4),深蓝色代表卷积核(3x3),绿色为输出图像(2x2)

反卷积:蓝色是输入(3x3),灰色是卷积核(3x3),绿色是输出(5x5)

全卷积神经网络(FCN)

其中,Σ表示对所有像素点进行求和。交叉熵损失衡量了模型预测的类别概率分布和真实的类别概率分布之间的差异。U-Net系列U-Net是一种特别设计用于医疗图像分割的深度学习模型。它由德国的弗莱堡大学的研究人员在2015年提出。下图简单表示了U-Net网络的基本结构。U-Net的结构可以看作是一个"U"字形,这也是其名称的由来。U-Net的网络结构由两部分组成:收缩路径(编码器)和扩展路径(解码器)。U-Net系列U-Net的一个重要特点是在扩展路径中引入了跳跃连接。跳跃连接将收缩路径中的特征图直接传递到扩展路径中的对应阶段。这种设计使得网络在生成分割结果时,能同时利用图像的抽象特征和详细空间信息,从而实现精细的图像分割。跳跃连接连接将收缩路径中的特征图直接传递到扩展路径中的对应阶段,同时利用解码器和编码器特征,进一步提升模型效果U-Net系列U-Net的损失函数通常选择为二分类交叉熵损失函数(BinaryCross-Entropyloss)或者Dice损失函数。对于二分类交叉熵损失函数来说,二分类交叉熵损失函数适用于像素级别的二分类问题,即每个像素只有两种可能的类别(例如,对象和背景)。对于每个像素点,模型需要预测它属于对象类别的概率。损失函数的计算公式如下:Dice损失函数:Dice损失函数基于Dice系数,Dice系数是一种用于衡量两个样本相似度的指标。在图像分割任务中,可以用Dice系数来衡量预测的分割区域和真实的分割区域之间的相似度。Dice损失函数的计算公式如下:

DeepLab系列DeepLab是由谷歌研究团队提出的一个经典的深度学习图像分割模型,专为解决语义分割任务而设计。语义分割的任务是将图像中的每个像素点归类到特定的类别中,这对精确区分物体和背景提出了高要求。然而,传统的卷积神经网络(CNN)在处理高分辨率图像时通常会出现信息丢失的问题,尤其是在下采样和上采样过程中,目标的细节信息可能丢失或模糊。DeepLab模型通过多种技术(如空洞卷积和全连接条件随机场)来克服这些问题,提高了分割结果的精度。DeepLab系列DeepLab的核心结构围绕卷积神经网络(CNN)展开,但其特别之处在于引入了一系列创新性的模块,旨在保留高层次语义信息的同时,也能捕捉到局部的细节特征。①空洞卷积(AtrousConvolution):DeepLab模型的重要创新之一是使用空洞卷积,空洞卷积能够在不增加参数量或计算量的前提下,扩大卷积核的感受野(ReceptiveField)。②空洞空间金字塔池化(AtrousSpatialPyramidPooling,ASPP):ASPP模块是DeepLabv2及其后续版本的关键组成部分。ASPP通过并行地应用多个空洞卷积层,并在这些卷积层中使用不同的空洞率,从而获得不同尺度的图像上下文信息。③全连接条件随机场(FullyConnectedCRF):DeepLabv1和DeepLabv2通过全连接条件随机场(CRF)进一步优化分割结果的边界。④编码器-解码器结构:在DeepLabv3+中,引入了编码器-解码器结构。编码器使用主干网络提取特征,解码器则用于恢复高分辨率的分割结果。DeepLab系列

VisionTransformer分割模型VisionTransformer(ViT)是一种基于Transformer架构的视觉模型,最初由Google团队提出,用于解决图像分类任务。随着ViT的成功,它也逐渐被应用到图像分割任务中,并演变成了诸如Segmenter、SETR等ViT分割模型。ViT的全局特性在分割任务中具有天然优势,因为分割任务需要同时捕捉图像中的局部细节与全局上下文信息。VisionTransformer分割模型ViT分割模型的结构大体可以分为三个部分:图像分块、Transformer编码器、以及特征解码器。第一,图像分块(PatchEmbedding):ViT的输入与传统的卷积网络不同,它首先将输入的二维图像划分为固定大小的图像块(Patch),然后将每个块展平为一维向量。第二,编码器:ViT的核心是基于多头自注意力Transformer编码器。编码器使用自注意力机制来捕捉图像块之间的全局依赖关系。自注意力机制允许模型在全局范围内关注各个图像块,帮助理解复杂的全局特征,而不仅仅局限于局部信息。第三,特征解码器:为了将高维特征转换回分割任务需要的像素级标签,ViT模型通常结合一个解码器结构。常见的解码器设计包括U-Net式解码器和MLP解码器,这些结构用于将编码器的输出映射回到原始图像的分辨率,并生成每个像素的预测标签。CLIP分割模型CLIP是由OpenAI提出的一种结合图像和文本预训练的跨模态模型。CLIP通过从大量的图像-文本对中学习,不仅能够理解视觉信息,还能通过自然语言进行表达和查询。CLIP模型的核心思想是通过对比学习来联合训练图像和文本的嵌入,使得相似的图像-文本对在特征空间中靠近。基于CLIP的分割模型结合了CLIP强大的跨模态表示能力,可以通过语言描述生成高质量的分割结果,这种方法为图像分割任务开辟了新的路径。CLIP分割模型基于CLIP的分割模型主要由以下几个关键模块组成:图像编码器、文本编码器、跨模态对齐机制、以及分割头。通过这些模块,模型能够从自然语言提示中获取目标信息,并在图像中进行精确分割。①图像编码器:基于CLIP的分割模型使用一个视觉主干网络作为图像编码器,用于从输入图像中提取深层视觉特征。②文本编码器:CLIP的文本编码器基于Transformer架构,它能够将输入的自然语言提示编码为一个向量表示。③跨模态对齐:CLIP通过对比学习实现图像和文本的跨模态对齐。图像编码器和文本编码器分别生成图像和文本的特征表示,然后通过对比损失来确保相似的图像-文本对在嵌入空间中距离更近。④分割头:在得到图像的全局特征后,分割头负责将这些特征映射回像素级别的预测结果。典型的分割头通常包括上采样层和卷积层,用于恢复图像的空间分辨率,并生成每个像素的类别标签。基于CLIP的分割模型的分割头不仅需要利用图像编码器提取的视觉信息,还要结合文本编码器的语义提示信息,确保生成的掩码能够匹配用户描述的目标对象。CLIP分割模型

CLIP分割模型

CLIP分割模型

SAM分割模型SegmentAnythingModel(SAM)是MetaAI团队提出的一种强大的图像分割模型,旨在实现通用的、可扩展的分割任务。与传统的分割模型不同,SAM的目标是能够分割任意对象,而不需要为每种特定任务重新训练。通过将强大的视觉感知与高级语义理解相结合,SAM能够处理不同类型的分割任务,从语义分割到实例分割,再到更复杂的场景分割。SAM的出现标志着图像分割模型进入了更通用、更具鲁棒性的时代,使其在广泛的视觉任务中表现出色。SAM分割模型SAM的核心设计结合了提示机制与强大的分割模型架构,使其能够在输入特定提示的情况下,对任意图像对象进行分割。SAM模型结构主要由以下几个部分组成:编码器、提示机制以及动态掩码生成。①编码器:SAM使用一个强大的视觉主干网络(通常是基于ViT的架构)来对输入图像进行编码。编码器将原始图像转换为高维特征表示,捕捉图像的全局和局部特征信息。通过深度Transformer网络,SAM能够提取多尺度、多层次的特征,这对于不同类型的对象分割任务非常重要。②提示机制:SAM的一个关键创新是引入了提示机制,用户可以通过多种方式为模型提供分割提示,例如通过点击对象的某些像素、绘制边界框,或者通过粗略的掩码来告诉模型需要分割的区域。③动态掩码生成:根据编码器提取的图像特征和提示信息,SAM生成目标对象的精确掩码。通过结合提示和全局特征,SAM能够对图像中的任意对象进行分割,并在对象的边界上保持较高的精度。SAM的掩码生成过程是动态的,这意味着即使输入的提示信息不同,模型也能快速调整分割结果,从而适应多样化的需求。SAM分割模型

SAM分割模型

SAM分割模型SAM的损失函数与传统的语义分割模型类似,主要采用交叉熵损失(CrossEntropyLoss)和Dice损失(DiceLoss)③边界优化损失:由于SAM的一个重要目标是生成高质量的对象边界,其损失函数中还包含边界优化相关的项。这类损失通过提高对象边缘的分割精度,使得模型在细节处理上表现更加出色。提纲图像分割的基本知识传统图像分割方法基于机器学习的图像分割方法基于深度学习的图像分割方法工业图像分割应用案例工业图像分割应用案例罐头实时监测流水线自动缺陷分割系统项目需求:随着工业自动化水平的不断提升,制造业对产品的质量要求越来越高。罐盖作为工业制造中常见的产品,其表面和结构的完整性对整体产品的性能起着至关重要的作用。本项目主要选取罐盖作为研究对象,该研究对象既存在各种常见的表面缺陷,如污染、擦伤、压痕、形变等;也存在与工艺相关的各种特殊缺陷,如胶水飞溅、缺胶等。此外,罐盖的检测对象具有非平面和复杂的三维结构,其整体被划分为四个检测区域:内表面区域、嵌环区域、胶水区和卷缘区,每个区域的缺陷类型各不相同。针对这些复杂的缺陷分布和形态差异,本项目的主要目标是开发并实施一套高效的自动检测系统,确保罐盖产品的表面和结构无缺陷,提高产品质量的稳定性,降低生产过程中的次品率。工业图像分割应用案例罐头实时监测流水线自动缺陷分割系统方案介绍:为了满足项目需求,本方案提出了一种多检测区域提取和分区域检测方法。在提出的多区域提取方法中,首先对在线获取的目标图像进行处理。采用熵率聚类方法将目标图像分割为多个区域,并结合目标的几何结构特征,实现检测对象的精确分割和识别。接着,通过边缘检测算法提取出各个检测区域的边缘轮廓,并采用形状拟合方法确定目标的圆心位置和外径尺寸。最后,利用预先获取的各检测区域的内径、外径等几何信息,对各个检测区域内的缺陷进行进一步分割与识别,以实现复杂结构中缺陷的精准检测。工业图像分割应用案例罐头实时监测流水线自动缺陷分割系统本系统主要由以下几个模块组成:工业图像分割应用案例罐头实时监测流水线自动缺陷分割系统系统的工作流程:罐头上料:待检测的罐头通过上升电梯被送至上料工作台,等待被机械臂取走。自动检测:机械臂将零件送至传送带,传送带移动,相机对罐头进行全方位扫描。随后相机将图像输入至1394接口。数据分析处理:待检测图像由1394接口输入工业计算机,检测异常区域。结果显示与处理:检测结果通过信息显示屏展示,操作人员根据显示结果,决定是否需要对零件进行返工或重新加工。零件下料:检测完成的零件通过下降电梯送至已检缓存区,等待后续处理或包装。工业图像分割应用案例罐头实时监测流水线自动缺陷分割系统应用案例总结:本项目提出的检测方法在定位精度、检测精度和分割精度等方面表现出显著优势。经过一年多的实际应用,其检测精度可达到99.9%以上,同时该方法具有良好的适应性和鲁棒性,能够满足复杂和严苛的工业环境需求,并能够完全替代人工检测,有效提升了检测效率,确保了产品质量的稳定性。思考与习题1. 图像分割方法的演变与对工业应用的影响,基于你对图像分割从传统方法(如阈值分割、边缘检测等)到深

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论