机器基础开发教程 3_第1页
机器基础开发教程 3_第2页
机器基础开发教程 3_第3页
机器基础开发教程 3_第4页
机器基础开发教程 3_第5页
已阅读5页,还剩23页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

机器视觉应用开发与项目案例教程

教程(四)

图像数据采集和标注2主要内容4.1

图像数据结构4.2图像文件处理4.3图像标注介绍4.4应用:智能分拣图像数据标注4.5应用:图像标记图像的数字化图像数字化是将连续的图像信号转换为离散的数字信号的过程。该过程包括采样、量化和编码三个步骤。1、采样是将连续的图像信号在空间和时间上进行采样,即将连续的空间或时间轴上的点取样成离散的点。这些离散的点被称为像素,它们是图像数字化的基本单位。采样速率决定了每秒采集多少个像素,也称为图像的分辨率。2、量化是将采样得到的连续信号转换为离散的数值。这涉及到确定一个幅度级别的有限集合,然后将采样到的像素值限制在此幅度级别集合内。量化过程通常使用均匀或非均匀量化来实现。3、编码是将量化后的数字信号转换为二进制码以便存储或传输。编码可以使用熵编码或者其他压缩算法来实现,以减小存储或传输所需的带宽和容量。34.1

图像数据结构44.1

图像数据结构数字图像的存储格式54.1

图像数据结构序号文件格式说明1bmpWindows位图,1位、8位和24位未压缩图像2jpeg/jpg联合图像专家组制定,包括8位、12位和16位基准3tif/tiff标记图像文件格式,包括1位、8位、16位、24位和48位未压缩以及采用Packbit、LZW或Deflate压缩的图像4gif图形交换格式,8位图像5png可移植网络图形,包括1位、2位、4位、8位和16位灰度图像;带有alpha通道的8位和16位灰度图像;1位、2位、4位和8位索引图像;24位和48位真彩色图像;带有alpha通道的24位和48位真彩色图像bmp格式bmp(bitmapfile)位图是windows系统采用的图形文件格式,也是windows内部各个跟图像绘制处理等相关操作的基础,因此受到windows平台下运行的所有图像处理软件的支持。64.1

图像数据结构序号结构组成数据结构名称大小(字节)1文件头BITMAPFILEHEADER142信息头BITMAPINFO403调色板RGBQUAD4N4图像数据BYTE图像实际数据大小jpeg/jpg格式JPEG格式是国际标准化组织(InternationalStandardizationOrganization,ISO)和国际电气技术委员会(InternationalElectrotechnicalCommisson,IEC)联合组建的联合图像专家小组(JointPhotographicExpertsGroup,JPEG)指定的一种静态图像数据的压缩编码标准。JPEG既适合灰度图像,也适合彩色图像。由专家组开发的JPEG压缩算法有两种,一种是基于离散余弦变换的有损压缩算法,另一种是基于预测的无损压缩算法。前者压缩了图像相邻行和列之间的多余信息,当压缩比在25:1时,压缩掉的颜色信息不会引起人眼视觉上的明显变化,人眼基本无法鉴别出压缩导致的颜色误差,是目前最好的图像压缩技术,得到了广泛的应用。JPEG推荐的编码算法也有两种,一种是顺序编码,另一种是渐进编码。74.1

图像数据结构tif/tiff格式TIF/TIFF是图形图像处理中常用的格式之一,由于它对图像信息的存放灵活多变,可以支持很多色彩系统,而且独立于操作系统,因此得到了广泛应用。TIF/TIFF全称是标记图像文件格式(TaggedImageFileFormat,TIFF),扩展名为TIF或者TIFF。它最初由Aldus公司与微软公司一起为PostScript打印开发。在刚开始的时候,桌面扫描仪功能比较单一,只能处理二值图像格式,随着扫描仪的功能逐渐强大,TIFF逐渐支持灰阶图像和彩色图像。如今,TIFF具有强大的数据描述能力,支持256色、48位、32位和24位等多种颜色深度,也支持RGB、CMYK和YCbCr颜色模式。TIFF是一种独立于操作系统和文件系统的图像存储格式,内部结构可以分成三个部分,分别是:文件头信息区(表头)、文件目录(标识信息区)和文件目录项(图像数据区)。84.1

图像数据结构gif格式GIF(GraphicsInterchangeFormat)格式是在1987年由CompuServe公司为了填补跨平台图像格式的空白而发展起来的一种公用的图像文件格式标准。GIF是一种位图,即图片由许多的像素组成,每一个像素都被指定了一种颜色,这些像素综合起来就构成了图片。GIF采用的是连续色调的Lempel-Zev-Welch(LZW)无损压缩算法,压缩效率在50%左右,支持8位256种颜色。GIF比较适用于色彩较少的图片,比如卡通造型、公司标志等等。如果碰到需要用真彩色的场合,那么GIF的表现力就有限了。GIF格式比较复杂,一般包括文件头、逻辑屏幕描述区、调色板、图像数据区和结束标志区,其中文件头和图像数据区是不可或缺的部分。94.1

图像数据结构png格式PNG即便携式网络图形(PortableNetworkGraphics),是一种采用无损压缩算法的位图格式,扩展名为png。PNG图像格式的文件由一个8字节的PNG文件署名和3个以上的后续数据块。所有PNG图片文件内容开头都有8字节文件署名,用于识别PNG格式。PNG定义了两种类型的数据块,一种是称为关键数据块(criticalchunk),这是必需的数据块,另一种叫做辅助数据块(ancillarychunks),这是可选的数据块。每个数据块都包含长度,数据块类型,数据块数据,循环冗余检测四个部分。关键数据块定义了4个标准数据块:文件头数据块IHDR,调色板数据块PLTE,图像数据块IDAT,图像结束数据块IEND。每个PNG文件都必须包含它们,PNG读写软件也都必须要支持这些数据块。104.1

图像数据结构图像的文件处理包括图像显示、图像读取和图像保存三个基本操作。OpenCV是计算机视觉和图像处理领域的专用库,支持多种平台和多种编程语言,功能强大,性能优越。而OpenCV-Python是OpenCV的Python语言接口;Matplotlib是Python语言的另一种图形图像处理库,也具备了简单的图像处理功能。114.2图像文件处理图像显示图像显示是将图像数据转换为可视化的图像过程。在计算机中,图像显示通常通过显示器进行。要显示一张图像,需要使用一个图像处理库或工具包来读取图像文件,并将其转换为特定格式的像素数组或位图。然后,这个像素数组会被传递给显示设备,例如屏幕或打印机,在屏幕上呈现出对应的图像。OpenCV提供了imshow函数在窗口显示图像,并会自适应调整窗口大小以适配图像尺寸,其函数原型为:cv2.imshow(window_name,img)Matplotlib提供了matplotlib.pyplot.imshow函数来显示图像,其函数原型为:matplotlib.pyplot.imshow(img)124.2图像文件处理

图像读取图像读取指的是从存储设备中获取图像数据并将其加载到内存中的过程。要读取一张图像,需要使用一个图像处理库或工具包,该工具包提供了读取不同文件格式的函数或API。当读取完成后,图像数据将以像素数组或位图的形式存储在内存中,可以进行后续处理或显示。OpenCV提供了imread函数从文件中读取图像数据,其函数原型为:cv2.imread(filename,flags)

另外,OpenCV提供cv2.cvtColor函数对颜色维度进行转换,函数原型是:cv2.cvtColor(img,color_change)Matplotlib提供matplotlib.pyplot.imread函数读取图像数据,函数原型是matplotlib.pyplot.imread(fname,format=None)134.2图像文件处理图像保存图像保存是将内存中的图像数据以某种格式保存到磁盘或其他存储介质中的过程。要保存一张图像,需要使用一个图像处理库或工具包提供的保存函数或API,该函数将接受将要保存的图像数据和保存格式作为参数。然后,图像数据将被编码并以指定格式写入磁盘。在保存过程中,可以选择不同的压缩比例和颜色模式等设置,以达到最佳的存储效果。OpenCV提供了cv2.imwrite函数来保存图像,函数原型为:cv2.imwrite(dir,img)matplotlib提供了matplotlib.pyplot.imsave函数来保存图像,函数原型为:matplotlib.pyplot.imsave(dir,img,**kwargs)144.2图像文件处理视频处理视频处理是指对一个或多个视频进行各种操作和修改的过程。这些操作可以包括剪辑、裁剪、合并、添加特效、改变颜色、调整音频等等,以满足不同需求和要求。视频处理在电影制作、电视广告、社交媒体、在线教育等领域都有广泛应用。随着互联网带宽的增加和技术的发展,视频处理也变得越来越普遍和重要。OpenCV提供了cv2.VideoCapture函数来获取摄像头序号,函数原型为:cv2.VideoCapture(intdecive)OpenCV提供VideoCapture.set函数和VideoCapture.get函数实现对摄像头对象的属性设置和访问,函数原型分别为:VideoCapture.set(propId,value)VideoCapture.get(propId)154.2图像文件处理

在机器学习的应用中,数据标注是至关重要的一个环节。它可以帮助机器学习模型更好地理解和识别数据,并提高模型的准确性和效率。而数据预处理则是对原始数据进行优化和处理的前置工作,以使其适应于机器学习模型的需求。图像数据标注则是机器学习中最常见的一种数据标注方式,通过对图像进行标注,可以帮助机器学习模型更好地理解和识别图像中的内容。164.3图像标注介绍数据预处理

数据预处理在机器学习中是非常重要的一环。它可以消除数据中的噪声和缺失值,提高数据质量,减少模型对于噪声的敏感度,从而提高模型的精确度和鲁棒性。1、数据来源数据集的获取也有几个主要渠道:开源数据集,商业数据集和网络数据。开源数据集。在计算机视觉、自然语言处理和语音识别等三大领域,都有大量的开源数据集提供给人们免费使用。商业数据集主要来自于各种商业机构收集的数据,其特点是具有较高的专业性,比如医疗影像数据,大型购物网站客户的商业行为数据等等。得益于手机等移动终端的性能升级和无线网速度的提高,人们在网络上留下大量数据。174.3图像标注介绍数据预处理2、数据采集数据采集是指从特定的数据源中获取、整理和处理数据的过程。一般来说,数据采集流程包括以下几个步骤:1)明确数据来源:在进行数据采集之前,需要明确数据的来源。2)确定数据范围与数量:在明确数据来源之后,需要根据特性行业与应用定位,确定需要采集的数据范围与数量。这个过程需要考虑到数据的关键性、可靠性以及使用场景等因素。3)选择合适的数据采集方法:根据数据来源和需要采集的数据类型,选择合适的数据采集方法。常用的数据采集方法包括爬虫技术、传感器数据采集、调查问卷、实验研究等。4)开展数据采集工作:根据确定的数据采集方法和范围,开展具体的数据采集工作。184.3图像标注介绍数据预处理3、数据清洗

采集到数据以后,需要对这些海量数据进行有效的管理,通常会把数据导入一个大型分布式数据库或者存储集群中,这需要针对原始数据中的缺失信息,冗余信息和非标信息进行相应的预处理工作,这个过程就是数据清洗。数据清洗主要有几种处理方式,包括缺失值处理、噪声过滤、和冗余合并。在具体的数据清洗过程中,一般依次遵循明确错误类型、识别错误实例、纠正发现错误和干净数据回流这四个步骤展开。194.3图像标注介绍数据预处理4、数据变换数据变换在数据预处理中的作用是非常重要的。通过对数据进行规范化、离散化、连续化、归一化等操作,可以使数据更适合进行置信区间分析或者可视化,得到符合人眼感知的图像,直观地展现数据之间的关系和趋势。同时,也可以降低数据的维度或复杂度,在保证数据完整性的前提下,去除某些无用的信息,压缩数据量,从而方便使用简单的回归模型进行建模。204.3图像标注介绍数据预处理5、数据降维数据降维的目的是通过减少数据的维度来优化模型、提高模型性能和减小计算开销。数据降维可以通过各种方法实现,其中最常用的方法包括特征选择和特征提取。特征选择是指从所有可用的特征中选择出最有用的一些特征,这些特征可以帮助我们更好地理解和预测数据。另一种常见的数据降维方法是特征提取,这是通过创建新的特征来减少数据的维度。214.3图像标注介绍图像数据标注数据标注是对采集到的原始数据(如图像、文本、语音和视频等)进行归类、整理、编辑、标记和批注的过程,其目标识给标注数据增加标签,生成满足机器学习模型训练要求的数据格式。其基本概念包括标签(Label),标注任务(AnnotationTask)、数据标注员(DataLabeler)和标注工具(AnnotationTool)。标签指的是表示数据的特征、类别和属性等;标注任务是指按照数据标注规范对数据集进行标注的过程;数据标注员是指负责完成对数据标注任务的人员;标注工具是指标注任务中所需的工具和软件,可分为手动标注工具,自动标注工具和半自动标注工具。224.3图像标注介绍数据标注管理标注数据是训练机器学习模型的重要保证,越精细的标注数据堆模型的训练就越有效。每一种类型的数据标注都应该受完整严格的规范约束,高质量的数据标注工作应该从人员和工程两方面入手,通过规范的管理制度管理标注人员和工程的质量,获取高精度的数据标注。234.3图像标注介绍4.4.1图像数据标注工具介绍1)LabelImg。LabelImg是一款非常优秀且使用率极高的图像标注工具。它基于Python语言开发,可以在Windows、Linux和MacOS平台下运行。LabelImg具有操作简单、快速、生成标注文件以XML格式保存、读取方便、格式标准等优点。2)VOTT。VOTT是一款由微软发布的基于JavaScript开发的图像目标检测标注工具。它使用React+Redux进行开发,并支持Windows和Linux平台运行。VOTT的主要功能是在图像中标注目标框,并将其导出为各种通用格式,如YOLO、PascalVOC和COCO等。3)Labelme。Labelme是一款基于Python语言和PyQt框架开发的图像标注软件。它支持多边形分割、语义分割、2D框、线标注、点标注等多种

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论