版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
人工智能通识课模块二:
人工智能如何看懂世界目录第4章:计算机视觉基础理论与应用一第5章:图像表示与处理技术基础二第6章:图像识别与目标检测技术三第7章:生成式人工智能图像生成技术四.生成式AI与图像生成(AIGC)定义·任务·发展历程图像数学表示·预处理·CNN架构行业案例·目标检测
生成式AIo授课目标(一)理解计算机视觉的基本概念和原理(二)掌握卷积神经网络(CNN)的基础知识(三)了解图像识别和物体检测的技术(四)了解生成式人工智能(AIGC)在图像生成中的应用第4章
计算机视觉基础理论与应用计算机视觉(ComputerVision,CV)
是人工智能的一个分支,旨在使计算机能够从图像或视频中“理解”和“解释”视觉信息。结合图像处理、模式识别、机器学习等技术,模拟人类的视觉系统,使计算机能够识别、分析和理解视觉数据。4.2----计算机视觉应用领域医疗交通安防工业核心应用领域每组选择一个行业讨论AI视觉解决了什么痛点?农业零售家居娱乐4.2----计算机视觉应用领域医疗影像:AI医生的"第二双眼睛"肺结节检出率78%→92%+14%诊断时间缩短50%+效率提升核心技术•图像分割:精准识别器官与病变区域•病灶检测:自动标记异常组织位置•影像配准:多模态数据融合分析案例商汤科技肝脏CT智能分析系统基于深度学习的肝脏CT影像分析系统,可自动识别肝脏病变区域,辅助医生进行精准诊断,已在国内多家三甲医院投入使用。伦理讨论AI诊断出错,责任归谁?当AI辅助诊断出现误诊或漏诊时,责任应由医生、AI开发者还是医疗机构承担?如何建立合理的责任界定机制?4.2----计算机视觉应用领域智能安防与工业质检智能安防人脸识别:机场、车站、小区应用行为分析:奔跑、闯入、斗殴检测效果数据:安全事件发生率↓35%破案率↑40%隐私讨论人脸识别与个人隐私的边界在哪里?工业质检检测精度:0.1mm,效率提升50%以上应用场景:电子元件、汽车零部件、印刷品案例:手机玻璃盖板缺陷检测系统检测精度0.1mm效率提升↑50%+4.2----计算机视觉应用领域智慧农业与新零售智慧农业作物病虫害识别准确率92.5%传统方法准确率:65-75%应用场景杂草识别果实采摘生长监测讨论AI如何助力乡村振兴?新零售与智能家居无人超市商品识别+自动结算虚拟试衣实时体型捕捉与服装叠加智能家居手势识别、人脸门锁、异常行为检测体验分享你使用过哪些AI视觉产品?4.3----典型案例深度剖析案例解析:医疗与交通系统案例1医疗影像辅助诊断系统系统架构预处理肺实质分割结节检测良恶性判断核心技术U-Net分割FasterR-CNN检测CNN分类性能数据检出率92.3%微小结节检出率85.2%案例2智能交通监控管理系统系统架构高清摄像头边缘计算云平台核心算法YOLOv8车辆检测强化学习信号优化效果数据拥堵指数↓18.5%事故率↓27.6%
图4-9医疗影像辅助诊断系统结构示意图在医疗影像辅助诊断系统中,用于实现‘肺实质分割’任务的核心网络结构是?FasterR-CNNAYOLOv8BU-NetCMobileNetD提交单选题1分4.3----典型案例深度剖析案例解析:工业与农业系统案例3工业表面缺陷检测系统硬件配置:线阵相机+多角度光源+伺服传送检测能力:0.05mm划痕识别,99.2%准确率价值:在线100%检测,替代人工目检案例4智慧农业病虫害检测系统系统架构:APP采集云端分析专家咨询核心模型:MobileNet轻量化网络性能:92.5%准确率,3秒响应图
4
-
1
1
机器视觉表面缺陷检测系统组成及原理图4-12一种智能虫情监测系统流程示意图第5章:图像表示与处理技术基础12视觉
人类从外界获得的信息绝大部分是由视觉获取的。视觉信息量大,人类对视觉信息的利用率高,视觉功能很重要视觉--人类观察世界和认知世界的重要手段给计算机、机器人或其他智能机器赋予人类视觉功能,是人类多年以来的梦想--机器视觉5.1图像的数学表示方法像素与分辨率像素:图像的最小单位,包含颜色/亮度信息分辨率:宽度×高度如1920×1080=207万像素位深度:8位(256级)vs16位(65536级)灰度与RGB灰度图像:二维矩阵M[i][j],取值0-255RGB颜色空间:三通道矩阵,光学三原色加法混合颜色示例:红(255,0,0)绿(0,255,0)蓝(255,255,0)HSV颜色空间H(色调):0°-360°S(饱和度):0%-100%V(亮度):0%-100%优势:颜色、饱和度、亮度分离
图
5
-
1
图像的数学表示5.2图像预处理关键技术预处理的定位:计算机视觉任务基础步骤核心目标:优化图像质量、消除干扰、标准化输入,提升后续任务准确率与效率医学影像增强X光病灶细节,提升微小病变检出率工业检测消除传感器噪声,提高缺陷识别精度5.2.1几何变换(空间形态校正+数据增强)技术类型核心用途关键算法步骤缩放统一输入尺寸、适配显示1.确定目标尺寸与宽高比规则2.选择插值算法(双线性/最近邻)3.逐像素计算新值输出裁剪提取感兴趣区域、去除冗余背景1.确定裁剪规则(中心/随机/智能ROI)2.定位裁剪边界3.提取目标区域像素矩阵旋转/翻转校正倾斜、数据增强1.确定旋转角度/翻转方向2.计算变换矩阵映射新像素坐标3.扩展画布并填充空白区域仿射/透视变换校正畸变、图像拼接1.选取至少3组(仿射)/4组(透视)对应特征点2.计算变换矩阵3.逐像素执行变换输出仿射变换=对一张图片“平移、旋转、缩放、斜切”,但永远保持:平行线还是平行,直线还是直线5.2.2图像增强(提升视觉质量、突出特征)技术类型核心用途关键算法步骤直方图均衡化增强对比度1.计算图像灰度直方图2.计算灰度累积分布函数(CDF)3.归一化CDF并映射到0-255灰度区间输出*自适应版本:分块均衡后双线性插值消除块效应伽马校正校正非线性亮度失真1.确定伽马系数γ(γ<1提亮,γ>1压暗)2.对每个像素执行公式O=I^γ变换3.归一化像素值到0-255区间锐化(USM)增强边缘与细节1.对原图执行高斯模糊得到模糊图像2.原图减模糊图像得到高频边缘分量3.高频分量乘以增益系数叠加到原图输出5.2.3-4噪声去除+颜色空间转换噪声去除核心技术及步骤技术类型适配噪声类型关键算法步骤中值滤波椒盐噪声1.选定滤波窗口大小2.遍历像素,取邻域灰度中值替换原值双边滤波通用场景(保边去噪)1.设定空间距离与灰度相似度权重阈值2.计算邻域加权均值3.替换原像素值小波变换去噪通用场景(细节保留度高)1.小波分解为多尺度子带2.高频子带阈值处理3.小波逆变换重建图像颜色空间转换核心技术RGB转灰度按公式Gray=0.299×R+0.587×G+0.114×B合并三通道。RGB转HSV分离色调、饱和度、亮度,适配颜色分割场景。RGB转YCbCr分离亮度与色度分量,适配压缩传输场景。5.2.5形态学操作+典型预处理流水线形态学操作核心技术操作类型核心用途关键算法步骤腐蚀消除小噪声点、断开细小连接1.选定结构核(如3×3矩形核)2.取核覆盖区域的最小灰度值替换膨胀填补空洞、连接断裂区域1.选定结构核2.取核覆盖区域的最大灰度值替换开/闭运算组合操作降噪/补洞开运算:先腐蚀后膨胀(降噪保形)闭运算:先膨胀后腐蚀(补洞保形)典型预处理流水线(图像分类场景)缩放统一图像尺寸到224×224数据增强随机裁剪+随机翻转+颜色抖动标准化像素值归一化到模型要求区间演示:搜索图像增强演示视频
计算机视觉的定义是?让计算机通过图像或视频理解视觉信息仅用于医学影像分析的技术生成虚拟现实的工具
一种音频处理技术ABCD提交单选题1分图像的基本组成单位是?向量像素声波字符ABCD提交单选题1分视频的本质是?单一静态图像连续图像帧的时序组合音频信号
文本数据ABCD提交单选题1分以下哪种图像类型每个像素值仅为0或1?灰度图像彩色图像二值图像动态图像ABCD提交单选题1分RGB转灰度公式Gray=0.299R+0.587G+0.114B中,系数0.587对应G通道,其物理依据主要是:绿色在RGB色彩模型中数值范围最大A人眼视网膜中视锥细胞对绿光最敏感,亮度感知贡献最高BG通道在数字图像中噪声最少,信噪比最高C该系数由图像压缩标准(如JPEG)强制规定D提交单选题1分图像增强的常用方法包括?灰度变换和直方图均衡化图像放大和缩小删除部分像素
增加图像噪声ABCD提交单选题1分图像平滑处理的目的是?增强图像对比度去除噪声改善质量放大图像尺寸生成动态效果ABCD提交单选题1分5.3卷积神经网络(CNN)基本原理卷积神经网络(ConvolutionalNeuralNetwork,缩写CNN)是神经网络的一种特殊类型。除了包含输入层、隐藏层和输出层外,隐藏层中还包含了卷积层、池化层等特殊结构,这些特殊层的存在使得CNN能够更有效地处理具有空间或时间结构的数据大脑神经元神经网络5.3卷积神经网络(CNN)基本原理人工神经网络:输出层人工神经网络中的单个神经元人工神经网络5.3卷积神经网络(CNN)基本结构5.3卷积神经网络(CNN)基本原理---层级构成核心原理CNNvs全连接网络局部连接:每个神经元仅与局部区域连接,大幅减少参数量权值共享:同一特征图共享卷积核参数,实现平移不变性核心组件●
卷积层:提取局部特征,生成特征图●
池化层:降维压缩,增强鲁棒性●
全连接层:整合特征,完成分类决策生物启发Hubel&Wiesel的猫视觉皮层研究发现:视觉系统通过层级结构处理信息简单细胞→复杂细胞→超复杂细胞,启发了CNN的层级特征提取架构架构图示输入层卷积层激活层池化层全连接输出层[卷积→激活→池化]×N可重复堆叠原始图像特征图压缩特征抽象特征分类结果高层中层底层底层特征边缘、纹理、颜色中层特征部件、形状、结构高层特征语义、概念、对象/video/BV1AL4y1b7er/?spm_id_from=333.337.search-card.all.click&vd_source=ab4dd9e54a3376d03adc7261ff398fd05.3卷积神经网络(CNN)基本原理---输入层它是网络的第一层,没有可学习参数(权重、偏置),只负责接收并传递数据。神经元数量=输入数据的维度(比如227×227×3的图像,输入层神经元数就是227×227×3=154,587)。代表的是高度×宽度×通道数作用:把原始数据(图像、文本、数值)转换成网络能处理的数值形式,并传递给下一层。如:图像分类→输入层是像素值(227×227×3的RGB图像)文本分类→输入层是词向量(每个词对应一个向量)房价预测→输入层是房屋特征(面积、房间数、地段等)5.3卷积神经网络(CNN)基本原理---卷积层卷积是卷积核在输入数据上滑动,对局部区域进行加权求和并生成特征映射的过程,本质是”特征检测器”,是特征提取的数学操作。5.3卷积神经网络(CNN)基本原理---池化层作用是对卷积层输出的特征图进行下采样(降维压缩),在减少参数量和计算量的同时,增强特征的鲁棒性(对小幅度平移、缩放不敏感最大池化(MaxPooling)平均池化(AveragePooling)5.3卷积神经网络(CNN)基本原理---激活+全连接层是神经网络中负责特征整合与输出映射的核心层,其核心是通过线性变换(权重矩阵乘法+偏置)+非线性激活,将输入的一维特征向量映射为符合任务需求的输出向量。5.3卷积神经网络(CNN)基本原理---输出层它是网络的最后一层,有可学习参数(权重、偏置),负责把特征映射为任务结果。神经元数量=任务的输出维度(比如1000分类→1000个神经元;回归→1个神经元)如:图像分类→输出层是1000个类别的概率(ImageNet)二分类→输出层是2个概率(猫的概率、狗的概率)房价预测→输出层是1个数值(预测的房价)CNN为什么适合处理图像?两个核心设计局部感受野局部区域聚焦灵感来源:生物视觉系统,每个神经元只响应输入图像的一小块局部区域作用:不用同时处理整张图的所有像素,专注提取局部特征(边缘、纹理→部件→整体物体)人眼看东西,每次只聚焦一小块区域权值共享同一卷积核滑动核心机制:同一个卷积核(特征检测器)在图像滑动时共享相同的权重参数参数对比:全连接1.5亿参数
vs
3×3卷积核27个参数
(大幅减少参数,降低过拟合风险)同一个"边缘检测器",在整张图的所有位置都能用
5.3卷积神经网络(CNN)基本原理
5.4经典架构发展简史,每个模型记住一个核心特点1998年2012年2014年2015年LeNet-51998发布时间:1998年CNN的开山之作,首次实现手写数字识别,奠定了「卷积+池化+全连接」的基础框架AlexNet2012发布时间:2012年深度学习革命引爆点,ImageNet竞赛冠军,首次证明深层CNN的性能远超传统方法VGGNet2014发布时间:2014年结构最规整的模型,全部用3×3小卷积核堆叠,参数少、特征提取能力强,是迁移学习的首选ResNet2015发布时间:2015年解决深层网络"学不动"的问题,引入残差连接,让网络可以训练到上百层甚至上千层
CNN训练就像学生上课学习:从准备到学知识CNN训练流程类比:学生上课学习1准备教材、习题集、考卷收集标注好的图像数据,对应"教材内容"划分为三部分:•训练集(课后练习题)•验证集(模考题)•测试集(期末考试卷)预处理:统一尺寸、归一化、数据增强,对应"整理格式、多做变式题"2给学生发空白笔记本,填初始知识给模型的权重参数设置小的随机初始值进阶技巧:用预训练模型做初始化(迁移学习)相当于先学通用知识,再学特定领域知识3批改作业的打分规则衡量模型预测结果和真实答案的差距常用损失函数:•分类任务:交叉熵损失•回归任务:均方误差损失
CNN训练就像学生上课学习:从做题到改进继续类比:学生上课学习步骤4:前向传播学生做习题,给出自己的答案输入图像从输入层开始,逐层经过卷积、激活、池化、全连接,最后得到预测结果步骤5:反向传播对照答案找错题,分析错误原因从损失值出发,用链式法则从后往前计算每个参数对最终错误的"贡献度"(梯度),知道每个参数调大还是调小能降低错误步骤6:参数更新根据错题调整自己的知识体系优化器根据梯度调整参数值,常用的Adam、SGD就像不同的"学习方法"反复迭代几千到几万次,直到模型在验证集上的表现不再提升在CNN训练流程的教育类比中,'验证集'最贴切对应以下哪一项?教材正文内容,用于系统学习基础知识A课后习题,用于巩固课堂所学知识B模拟考试题,用于阶段性检验学习效果并调整复习策略C期末考试卷,用于最终评定学生综合能力D提交单选题1分
CNN总结与我们身边的应用核心总结●
结论1:CNN是专为图像等网格数据设计的深度学习模型,核心优势是自动提取分层特征,参数少、效率高●
结论2:核心结构:输入层→卷积层→激活层→池化层→全连接层→输出层●
结论3:训练核心:通过数据→前向传播算结果→反向传播找错误→更新参数,反复迭代优化常见应用场景日常类人脸识别解锁拍照AI修图图片搜索行业类自动驾驶的环境感知医学影像的病灶自动识别工业缺陷自动检测安防视频的异常行为识别讨论如果要用CNN做一个猫狗分类器,你会怎么设计流程?"你认出照片里的是猫还是狗什么是图像识别?判断图像中目标的类别,解决「是什么」的问题技术路线对比传统方法核心逻辑预处理→专家手工设计特征→分类器分类类比老师先教你「猫有尖耳朵、长胡须」的规则,你按规则判断优劣势优势:可解释性强、计算量小劣势:依赖专家经验、复杂场景准确率低深度学习方法核心逻辑数据准备→CNN自动学习层次化特征→端到端输出类比给你看10万张猫和狗的照片,你自己总结出猫和狗的特点优劣势优势:无需人工设计特征、复杂场景准确率高劣势:需要大量标注数据、计算资源要求高
第6章图像识别
第6章图像识别--CNN是如何识别出来狗的?
图像识别完整流程与核心挑战通用7步流程1图像采集:获取原始图像→你用眼睛看到物体2预处理:灰度化、降噪、几何校正→把模糊的东西看清楚、摆正角度3特征提取:手工提特征/CNN自动提特征→你找目标的特点4特征降维:去除冗余信息→你忽略无关的背景5分类决策:判断类别→你根据特点判断「这是猫」6后处理:过滤错误结果→你发现认错了及时纠正7结果输出:输出类别和置信度→你说出「这是猫,90%把握」核心技术挑战光照/姿态变化、遮挡、背景干扰光线暗、目标歪了、被挡住了、背景太乱类内差异大/类间相似同一种东西长得不一样,不同东西长得像小样本/实时性要求没多少练习素材就考试,还要一秒钟给出答案图像识别完案例--车牌识别
目标检测:不仅知道「是什么」,还知道「在哪里」什么是目标检测?同时完成分类(是什么)和定位(在哪里),输出目标类别和边界框通俗类比在班级合照里,找到所有同学的位置,还能叫出每个人的名字
主流目标检测算法对比与选型两阶段代表:R-CNN系列R-CNN两阶段开山之作,速度慢(50s/张)FasterR-CNN引入RPN网络,精度高,精度优先场景首选CascadeR-CNN级联多阶段精修,小目标、困难样本效果更好单阶段代表YOLO系列单阶段开山之作,YOLOv8速度100FPS,工业界实时检测首选SSD多尺度特征检测,小目标效果好RetinaNet提出焦点损失,单阶段精度首次追平两阶段新兴方向Transformer类(DETR)端到端目标检测,摒弃锚框和NMS后处理无锚框检测器结构更简洁,减少超参数调优发展趋势未来发展方向,精度与速度持续优化选型规则场景类型推荐算法适用说明精度优先FasterR-CNN/CascadeR-CNN医学影像、精密工业检测等对检测精度要求极高的场景速度优先YOLO系列自动驾驶、视频监控、移动端等对实时性要求高的场景FastR-CNN
性能评估指标与优化策略精确率识别出的目标里真正对的比例适合对误检敏感场景(门禁人脸识别)召回率所有真实目标里被找出来的比例适合对漏检敏感场景(安检违禁品检测)mAP平均精度综合所有类别的精度目标检测核心精度指标FPS每秒处理帧数衡量速度数据层面数据增强半监督/自监督学习难例挖掘给学生更多更好的习题模型层面轻量化设计特征融合知识蒸馏给学生更好的学习方法部署层面量化剪枝硬件加速把厚教材压缩成知识点手册图像识别和目标检测是计算机视觉的核心技术,已广泛应用在自动驾驶、工业检测、安防、医疗影像等领域,是AI落地最成熟的方向之一。在目标检测任务中,若某系统在安检违禁品检测场景下要求尽可能不遗漏任何真实违禁物品,则应优先优化哪一指标?精确率(Precision),因其反映识别结果中真实正例的比例A召回率(Recall),因其反映所有真实正例中被成功检出的比例BmAP,因其是综合所有IoU阈值和类别的平均精度CFPS,因其衡量模型推理速度D提交单选题1分
第7章生成式AI图像技术什么是生成式AI图像技术?通俗类比:给AI看几百万张真实画作,它学会自己画出全新的、逼真的画作。核心突破:实现计算机视觉从「看懂图像」到「创造图像」的跨越。让AI学会「画画」的核心逻辑/video/BV1Yg4y1K7LP?spm_id_from=333.788.player.switch&vd_source=ab4dd9e54a3376d03adc7261ff398fd0GAN基本原理GAN基本原理通俗类比:造假币的和警察的博弈游戏核心架构模块生成器(造假币者)随机噪声→假图像判别器(警察)输入图像→判断真假训练流程1训判别器看真假,提鉴别力2训生成器造假图,骗判别器3反复迭代达到纳什均衡循环博弈,真假难辨2014年提出,开创生成式AI新时代
第7章生成式AI图像技术
GAN的技术演进、应用与局限模型名称核心创新典型应用DCGAN首次把卷积神经网络引入GAN,大幅提升训练稳定性和生成质量早期图像生成、风格迁移WGAN系列用Wasserstein距离替代传统散度,解决GAN训练不稳定、容易崩的问题高分辨率图像生成CycleGAN不需要成对训练数据,实现无监督跨域转换马转斑马、夏季转冬季、油画转素描风格互转StyleGAN系列引入风格控制模块,可独立调整人脸的发型、肤色、表情等细节虚拟偶像生成、影视特效、人脸修复编辑【应用场景】
艺术创作、虚拟人生成、工业设计辅助、老照片修复【核心局限性】训练不稳定,需要精细调参;模式崩溃,生成的图像多样性不足。细节控制难,高分辨率生成计算成本高。
扩散模型:当前图像生成的主流技术基本原理通俗类比:先把清晰照片一点点加噪弄成雪花屏,再逆向一步步把雪花屏恢复成清晰照片。真实图像前向扩散(上千步)加噪→纯随机噪声反向扩散(迭代去噪)神经网络→生成图像优势总结训练稳定,无需对抗博弈生成质量与可控性远高于GAN扩散模型(DiffusionModels)能够生成超棒的图片、视频和音乐。它们的名字来源于自然界的扩散现象,就像水里的墨水慢慢散开一样。在AI的世界里,扩散模型通过逆转扩散过程来生成新数据,也就是说,它通过在数据中添加随机噪声,然后再逆转这个过程,从而从噪声数据中恢复原始
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 体检健康小贴士
- 肘关节综合征治疗-1
- 疼痛宣教健康教育方案
- 数字创业 课件 第七讲-数字平台
- 法律职业资格客观题真题精讲精练(带答案)
- UNIT 1 CULTURAL HERITAGE 高中英语必修第二册
- 七台河单招面试题及答案
- 汽车轮胎供应商质量不达标追究违约责任函4篇
- 家电维修时效性承诺函6篇
- 采购部门供应商管理培训通知函(3篇)
- 2026年全国中级经济师之中级经济师经济基础知识考试综合能力题详细参考解析
- 2026江苏淮安淮阴区国家统计局淮阴调查队招聘编制外工作人员1人笔试参考题库及答案详解
- 2026年云南事业单位考试真题
- 电子书 -失效模式及影响分析 FMEA-AIAG-VDA-第一版
- 检验科实验室标本处理与运输指南
- 中层管理能力提升2026年培训课件
- 2026年衡水学院教师招聘考试参考试题及答案解析
- 2025春人教版七年级英语下册单词默写练习
- 药品注册岗位招聘笔试题(某大型国企)2025年试题集精析
- 福建省招标采购集团公司招聘笔试题库2026
- 2024年成都西岭文旅投资运营集团有限公司招聘笔试冲刺题(带答案解析)
评论
0/150
提交评论