版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
第6章计算机视觉6.1认识计算机视觉6.1.1计算机视觉的定义计算机视觉(ComputerVision,CV)是一门研究如何让计算机达到人类那样“看”的学科。更准确点说,它是利用摄像机和电脑代替人眼使得计算机拥有类似于人类的那种对目标进行分割、分类、识别、跟踪、判别决策的功能。它以人工智能、自动控制机器人、信号处理、机器学习、物理学、图像处理、数学、成像技术和神经生物学等为基础。6.1.2人类视觉与计算机视觉的比较两者的“硬件”结构和进化目标的不同:(1)人类视觉是亿万年进化形成的生存导向型系统,追求对环境的高效理解和快速反应;(2)计算机视觉则是为特定任务设计的工具型系统,通过数据驱动不断逼近人类的视觉能力,但始终缺乏人类视觉背后的“意识”和“常识体系”。6.1.3计算机视觉与机器视觉的比较两者是“基础研究”与“工程应用”的互补延伸:(1)机器视觉侧重工业场景下的工程化应用,是计算机视觉技术在工业场景的具体化、实用化落地,其技术迭代依赖于计算机视觉在算法如深度学习模型、算力上的突破;(2)而计算机视觉更偏向人工智能领域的基础性研究,则通过机器视觉的工业实践,不断验证技术的实用性,反哺自身技术体系的完善,共同推动视觉技术从实验室走向产业场,成为各行业智能化转型的重要支撑。6.1.4计算机视觉的发展简史计算机视觉作为人工智能领域探索机器“看懂世界”的重要分支:始于20世纪60年代:拉里・罗伯茨奠定领域基础,“夏季视觉项目”揭示视觉任务复杂性,此阶段聚焦边缘检测与基础图像处理;80年代迎来理论突破,大卫・马尔的“视觉计算理论”提供系统性框架,相关学者推动三维物体表示与学科学术体系建设,研究以规则驱动为主;90年代至21世纪初,统计学习方法主导发展,各类数据集与特征描述子提升算法性能,ImageNet数据集为深度学习革命铺垫;2012年“深度学习元年”后,AlexNet开启深度学习在该领域的应用,YOLO、MaskR-CNN等推动任务升级;2020年后,VisionTransformer打破CNN垄断,生成式模型实现图像“创造”,如今计算机视觉已实现从规则驱动到数据驱动、从单一任务到多模态融合的技术跃迁,落地于自动驾驶等复杂应用场景。6.1.5计算机视觉与人工智能的关系计算机视觉与人工智能存在密不可分、相互驱动的深度关联:二者既为明确的从属关系(计算机视觉是人工智能聚焦“视觉感知与理解”的重要分支),又形成强烈协同效应。人工智能为计算机视觉提供底层方法论与技术框架,机器学习尤其是深度学习技术推动计算机视觉实现跨越式发展;计算机视觉则为人工智能落地提供核心场景与数据支撑,验证其实用价值并倒逼其向通用、可靠方向突破二者融合构成智能系统“感知-认知-决策”闭环的核心。未来,随着多模态智能、具身智能发展,二者融合将更深入,持续相互支撑、成就彼此,重塑人类与智能机器共存的未来图景。6.2计算机视觉主要内容6.2.1图像获取与表示数字图像基础
图像的获取与表示是计算机视觉的起点:图像获取依托相机、扫描仪等设备,原理类似人眼,通过镜头收集光线、传感器转换电信号、模数转换生成数字信号,最终形成数字图像;这些数字图像在计算机中以像素网格呈现,每个像素的位置由横纵坐标确定,其值记录对应位置的颜色或亮度。2.灰度图像与彩色图像黑白(灰度)图像的每个像素由1个字节的亮度值表示,数值范围为0(黑色)到255(白色),中间值对应不同明暗程度;彩色图像最常用RGB空间(以红、绿、蓝三基色混合显色,每个像素用三个0-255的数字表征),另一种常用的HSV空间更贴合人类描述颜色的习惯,包含色调、饱和度、明度三个维度,照片编辑中调整亮度、饱和度等操作,本质就是修改HSV空间的像素值。6.2.2图像预处理滤波与去噪图像预处理中的滤波与去噪是解决原始图像干扰问题的核心环节,原始图像会因设备、光线等因素产生噪声(杂点、条纹等无意义随机像素),模糊细节甚至掩盖重要特征;滤波则利用像素空间关联性,通过对像素邻域滑动窗口的计算替换异常噪声像素,常见的均值、中值、高斯滤波各有适用场景与特点;滤波与去噪作为计算机视觉处理的重要第一步,能让后续特征提取、目标识别更准确可靠,为各类图像分析奠定基础。2.边缘检测与特征增强图像中的边缘是物体轮廓线与不同区域分界线,蕴含形状信息,边缘检测旨在让电脑勾勒这些关键线条,其思路是寻找亮度或颜色剧变处,Sobel、Canny算子为常用方法;特征增强用于突出图像有用信息,可通过提高对比度、增强纹理等实现,边缘检测属于特殊的特征增强;二者对计算机视觉至关重要,能助力物体形状判断与后续识别检测(如扫描文档时的裁剪与文字清晰化),为相关分析提供支持。
3.图像的归一化图像归一化的本质是将不同来源的像素数值统一到固定尺度区间(如0到1、−1到1),常用最小—最大归一化、零均值归一化两种方法,其不改变图像视觉内容,却能提升算法稳定性与效率,是计算机视觉的基础性操作;而图像预处理各步骤(去噪、边缘检测、特征增强、归一化)环环相扣,将原始图像转化为标准化高质量数据,为后续物体识别、图像分割等高级视觉任务的准确高效开展奠定基础。以上这些预处理步骤环环相扣:先除噪让图像干净,再描边确定物体范围,最后增强特征突出重点,再统一规格方便处理。将“不规整”的原始图像转化为“标准化、高质量”的输入数据,经过这些预处理,计算机才能高效识别“这是猫”“那是汽车”。
6.2.3特征提取与描述
图像的特征提取是从原始数据中提取有意义的信息,以便用于后续的分析和识别。
特征描述是对提取出的特征进行进一步的加工和表示,以便更好地进行分类和匹配。在图像识别中,特征描述可能会将线条、边缘等特征组合成更高级的描述符
1.传统的特征提取算法传统特征提取算法的核心是人工定义特征提取规则(高度依赖领域专家知识),区别于深度学习的自动特征学习,其特征分为全局特征和局部特征两大类:全局特征对图像全部或多个区域像素信息建模(如颜色直方图、傅立叶频谱等),粒度较粗,适用于场景分类、大规模图像检索等高效且无需精细分类的任务;局部特征提取局部区域精细信息,2000年后十年得到充分发展,研究人员设计出数百种,多以建模边缘、梯度、纹理等为目标,典型的尺度不变特征变换方法(SIFT)、加速稳健特征方法(SURF)、方向梯度直方图方法(HOG)、局部二值模式方法(LBP)、Gabor滤波器、密集不变特征描述符方法(DAISY)、二进制稳健独立基本特征方法(BRIEF)、加速分割测试特征方法(FAST)、二进制稳健不变可扩展关键点方法(BRISK)等。6.2.3特征提取与描述2.基于深度神经网络的自动特征学习深度学习兴起后的自动特征学习以数据驱动、深度神经网络(尤其是CNN)为核心,无需人工干预特征定义与提取,通过多层网络从海量标注数据自主学习不同层级视觉特征(底层基础特征、中层局部部件特征、高层语义级特征),借助反向传播优化参数,泛化能力强且能应对复杂场景,广泛应用于各类图像识别任务,但依赖大量标注数据与高性能计算资源,特征可解释性低;传统特征提取则是人工定义规则、依赖专家知识,灵活性不足;二者分别代表计算机视觉从人工经验主导到数据与模型主导的技术跨越,各有所长,共同助力计算机理解图像。6.2.4目标检测与识别目标检测与识别是计算机视觉的关键技术,核心是让计算机从图像或视频中精准定位目标位置(目标检测,以矩形框标注,关注“在哪里”)并识别目标类别(目标识别,关注“是什么”),二者实际应用中紧密结合,如智能交通、安防监控领域均依赖该技术;深度学习的发展大幅提升其精度与效率,为计算机视觉的广泛应用奠定基础。1.单阶段检测目标检测中的单阶段检测方法简单高效,YOLO和SSD是其著名代表:YOLO核心是将整幅图像输入网络后一次性完成物体定位与识别,通过划分小格子实现检测,速度极快,适用于自动驾驶等实时场景;SSD基于多尺度检测,借助多个卷积层检测不同大小物体,对大小不一的目标识别效果好;二者简化检测流程,兼具速度与精度,为安防监控、智能交通、机器人视觉等领域提供有力支持。
2.两阶段检测目标检测中的两阶段检测方法以R-CNN系列为代表,其核心是分两步完成任务:第一阶段从图像中生成形状、大小各异的“候选区域”(可能包含物体的区域)第二阶段利用卷积神经网络(CNN)分析每个候选区域,判断其中是否存在物体及物体具体类别,如同先通过粗筛选出疑似目标区域,再用精细工具确认。R-CNN的流程:①输入图像后,使用无监督算法提取约2000个物体的可能位置,即候选区域;②将所有候选区域缩放至相同大小,输入卷积神经网络提取特征;③用支持向量机(SupportVectorMachine,SVM)对每个区域的特征进行分类。
6.2.5图像分割图像分割是计算机视觉中的一个重要任务,它的目标是将图像划分为若干个有意义的区域,以便更好地理解和分析图像内容。1.语义分割语义分割是一种图像分割方法,目标是为图像中每个像素分配特定类别,既识别物体又确定其每个像素位置;其关键特征是关注“类别”而非“个体”,不区分同类别下的不同实例;例如,如果有两辆车在同一张图像中,语义分割会将它们的所有像素都标记为“车辆”,而不会区分这两辆车是不同的个体。
该方法适用于场景理解、地图生成等任务,能提供图像各区域的语义信息。2.实例分割与全景分割实例分割和全景分割是语义分割的扩展,前者在语义分割识别物体类别的基础上,进一步区分同类别中的不同个体;后者结合语义分割与实例分割,既能识别类别、区分同类别个体,还能划分物体与背景区域;图像分割技术从语义分割到实例分割再到全景分割,对图像内容的解析能力逐步提升,助力计算机更精细地理解图像信息。
6.2.5图像分割
3.基于全卷积网络的图像分割全卷积网络(FCN)是图像分割、边缘检测等像素级分类和回归任务的代表性深度模型,核心目标为给图像每个像素分配类别标签以精准划分物体或区域边界;其显著特点是仅采用卷积层、摒弃全连接层,可接受任意尺寸图像输入并输出与原图尺寸一致的分割结果,工作流程分为卷积(提取图像特征)、上采样(通过反卷积等恢复原图大小)、逐像素分类(1×1卷积层实现像素分类)三步;FCN兼顾分割精度与处理效率,广泛应用于医学影像分析等领域,且通过改用1×1卷积核和反卷积层保持神经元空间关系,融合多尺度卷积特征图,为像素级任务提供高效框架。
6.2.6三维视觉三维视觉致力于让计算机能够感知和理解三维空间中的物体和场景。其应用广泛,例如自动驾驶、机器人导航、虚拟现实和增强现实等。
1.立体视觉与深度估计立体视觉是三维视觉中常见的技术,通过两个或多个视角图像感知并重建三维场景,原理类似人类双眼感知距离:借助双摄像头拍摄同一场景的差异化图像,利用物体在图像中的视差(位置差),经深度估计换算出物体到摄像头的距离;其典型应用包括手机人像模式、自动驾驶,还广泛用于机器人导航、三维建模、虚拟现实等领域。2.点云处理与三维重建点云处理和三维重建是三维视觉的重要领域:点云是由激光雷达、深度相机获取的物体三维坐标点构成的立体点阵;点云处理需过滤噪声、简化数据、分割部件,将杂乱点堆整理为有序三维骨架;三维重建经点云预处理与曲面拟合、网格生成等算法,从点云数据重建完整三维模型;二者广泛应用于自动驾驶、考古、建筑、游戏等领域,三维视觉借助这些技术让计算机感知理解三维空间,为各类实际应用提供支撑。
6.2.7计算机视觉模型的本质计算机视觉的各类任务本质可统一建模为广义函数拟合问题:
6.2.8人脸识别技术实例人脸识别是多学科理论方法的“试金石”,又深度应用于金融风控等关键场景,技术日趋成熟并大规模落地;其本质是计算两张人脸照片的相似度,典型人脸识别系统包含6个步骤:步骤1.人脸检测(判断图像中是否有人脸并确定位置大小)、步骤2.特征点定位(找到人脸关键特征点)、步骤3.面部子图预处理(归一化处理消除大小、旋转、光线等影响,得到标准人脸子图)、步骤4.特征提取(从人脸子图提取区分不同人的特征)、步骤5.特征比对(计算特征距离或相似度,有多种度量方式)、步骤6.决策(通过阈值判断或相似度排序确定识别结果,含1:1和1:N比对场景)。
人脸识别的典型流程6.3计算机视觉技术的应用6.3.1在分类与检测中的应用计算机视觉技术已广泛应用于工业、农业、林业、纺织印染业等领域的产品分类与质量检测环节,既提升产品品质可靠性,又推动生产效率大幅提高:工业领域可检测机械零件尺寸、缺陷及零部件文字标识,实现生产自动化;纺织印染业用于自动分色配色、成分与瑕疵检验;农林业领域应用涵盖农产品品质管控、病虫害防控、农作物生产全流程管理、畜牧养殖精细化管理及林业木材品质全维度检测,为各领域生产标准化、高效化提供技术支撑。6.3.2在医学中的应用计算机视觉最突出的应用领域是医疗计算机视觉和医学图像处理,医学图像成像方式包含X射线、CT、MRI、UT成像等;其应用主要有医学图像增强与自动标记辅助医生诊断、协助测量比较感兴趣区域、图像自动分割解释、病症图像分类检索、三维器官重建及视觉辅助机器人手术等。
6.3.3在视觉导航中的应用计算机视觉在军事及民用领域的精准导航场景中应用关键:在导弹精确制导中,为末段制导提供核心技术支撑,弹头双模探测器联动弹载视觉系统,通过系列算法完成目标检测、识别与定位,解析参数并修正导弹飞行姿态,提升抗干扰性与打击精度,鹰眼等仿生视觉模型也具备军事应用前景;在无人机驾驶领域,无人机兼具军事与民用价值,基于计算机视觉的无人机导航是研究热点,其导航装置借助传感器获取信息,经图像处理、地形匹配等确定自身准确位置,涉及目标捕获、定位等计算机视觉技术。
6.3.4智能交通智能交通是计算机视觉技术的典型应用领域,其应用既包括车辆/车牌/驾驶员识别、驾驶员危险行为识别等基础场景(服务于交通违章检测、不停车收费等),也涵盖自动驾驶与辅助驾驶这类核心方向;此外还延伸至车辆分类、行车违章检测、交通流量分析、停车占用检测、自动车牌识别、车辆重新识别、行人检测、交通标志检测、防撞系统、路况监测、基础设施状况评估、驾驶员注意力检测等多个细分场景,各场景依托计算机视觉技术实现自动化、高精度的交通管理与安全保障,推动智能交通与智慧城市发展。
6.3.5移动机器人移动机器人是集多种功能于一体的综合系统,导航是其核心问题,涵盖定位、目标识别、路径规划,自主定位是基础环节,需依托传感器感知信息并处理以实现安全运动;其导航方式多样,视觉导航因优势成为主要发展方向,视觉传感器负责环境检测辨识,视觉导航可分为基于地图、基于地图建立、无地图三类;好奇号火星探测器借助多相机实现自主导航与避障;视觉伺服通过光学装置和传感器处理物体图像,反馈信息用于机器控制调整,应用于工件装配、自动焊接等场景。
6.3.6在人机交互中的应用计算机视觉是人机交互核心技术(人类70%外界信息来自视觉),应用于人脸识别解锁/支付、隔空手势控制、智能手表健康监测、智能门锁、扫地机器人避障等场景,细分应用如下:1.人脸识别:分析人脸视觉特征辨身份,属生物特征识别技术,优势为自然性、不易被察觉;2.情感计算:依托计算机视觉获取人脸表情,通过三维图像建模与图形变换算法,赋予计算机情感识别、理解能力;3.视线追踪:以计算机视觉为核心,借红外摄像头采集眼部图像,经特征提取、三维建模计算视线向量,映射注视点并追踪,应用于人机交互优化、医疗辅助等;4.手势交互:分两类——依托手势位置信息替代鼠标,或依托姿态信息发送控制命令,应用于指点鼠标、汉语手指字母识别等;5.唇读/视话:通过口型变化解读内容,补充听觉信息,应用于语音识别等,需完成视频采集、唇动检测、特
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 瓦屋面工创新方法模拟考核试卷含答案
- 调理肉制品加工工岗前基础培训考核试卷含答案
- 皮肤管理师安全生产基础知识竞赛考核试卷含答案
- 工艺蜡染工安全技能测试模拟考核试卷含答案
- 水产养殖潜水工安全实操强化考核试卷含答案
- 印染烧毛工变革管理强化考核试卷含答案
- 压力机(生产线)操作工岗中业务能力考核试卷含答案
- 船舶电焊工变更管理评优考核试卷含答案
- 铝箔腐蚀氧化工班组安全能力考核试卷含答案
- 油船清洗工安全知识强化考核试卷含答案
- IPC7711C7721C-2017(CN)电子组件的返工修改和维修(完整版)
- 药品验收员培训试卷及答案
- DB41T 2689-2024水利工程施工图设计文件编制规范
- 乳制品gmp培训课件
- 智慧水电厂一体化平台建设技术导则
- 数说成长 共育花开-二年级数学家长会【课件】
- 幼儿园如何家长会培训
- 20起典型火灾事故案例合集-2024年消防月专题培训
- Nikon尼康D3100中文说明书
- 机械振动与电磁振荡课件
- 《生涯规划》第三课时 生涯规划之多元智能
评论
0/150
提交评论