3第三章卷积神经网络进阶-2_第1页
3第三章卷积神经网络进阶-2_第2页
3第三章卷积神经网络进阶-2_第3页
3第三章卷积神经网络进阶-2_第4页
3第三章卷积神经网络进阶-2_第5页
已阅读5页,还剩18页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

AIPARTFOURYOUR

LOGO

DEEPSEEK图像分类、目标检测与语义分割图像分类

其中,B为批次大小,表示每批次输入数据中的样本数量。C为通道数,例如灰度图像的C=1,彩色图像的C=3。H和W分别表示图像的高度和宽度。y表示类别集合,在二分类任务中y={0,1},在多分类任务中y={1,2,...,K},K为类别数量。图像分类图像分类数据集MNIST数据集经典的手写数字图像数据集,由70000张28×28的灰度图像组成,包括10个类别(数字0~9),其中,训练集有60000张图像,测试集有10000张图像。CIFAR-10数据集和CIFAR-100数据集包含小型彩色自然图像,来源于80MillionTinyImages数据集。包含10类(如飞机、汽车、鸟、猫等)图像,每类图像数量均衡,分辨率为32×32训练集有50000张图像,测试集有10000张图。图像分类图像分类数据集ImageNet数据集ImageNet数据集是规模庞大的高分辨率图像数据集,广泛用于大规模图像分类任务。有多个版本,包括ImageNet-1K数据集和ImageNet-22K数据集。Fashion-MNIST数据集Fashion-MNIST数据集是MNIST数据集的替代版本,包含10类不同衣物(如T恤、裤子、包等)的灰度图像,尺寸为28×28Fashion-MNIST数据集的训练集有60000张图像,测试集有10000张图像。图像分类图像分类数据集SVHN数据集深度学习中常用的图像分类数据集SVHN数据集包含自然场景中的数字图像,主要用于多数字字符识别,该数据集中的图像可分为10类(数字0~9)。训练集包含73257张图像,测试集包含26032张图像。图像分类图像分类任务的评价指标混淆矩阵

图像分类对传统行业的冲击图像分类任务的评价指标TP、TN、FP、FN真正例(TruePositive,TP):真实类别为i,且类别被正确预测为i的样本数。真反例(TrueNegative,TN):真实类别不为i(负类),且类别被预测为非i的样本数。假正例(FalsePositive,FP):真实类别不为i,但类别被错误预测为i的样本数。假反例(FalseNegative,FN):真实类别为i,但类别被错误预测为其他类别的样本数。OA总体精度(OverallAccuracy,OA)是图像分类任务中最基本的评价指标之一,表示分类正确的样本数占总样本数的比例.AA平均准确率(AverageAccuracy,AA)是每个类别分类准确率的平均值.图像分类图像分类任务的评价指标Kappa系数

精确率精确率(Precision)表示被模型预测属于某一类别的样本中,有多少是真正属于该类别的召回率召回率(Recall)表示实际属于某一类别的样本中,被模型正确预测属于该类别的比例.图像分类图像分类任务的评价指标对传统行业的冲击F1分数F1分数(F1-Score)是精确率和召回率的调和平均值。ROC曲线和AUC受试者操作特征曲线(ReceiverOperatingCharacteristicCurve,ROC曲线)是通过改变分类阈值,以真正例率(TruePositiveRate,TPR)为y轴,假正例率(FalsePositiveRate,FPR)为x轴绘制出的关系曲线。AUC(AreaUnderCurve):对应ROC曲线下的面积,用于衡量模型的整体性能。AUC值越接近1,表示模型性能越好。AUC有以下几种特殊情况。

AUC=1.0:完美分类模型,ROC曲线与坐标轴围成的矩形区域的左上角边界重合。

AUC=0.5:模型效果等同于随机猜测,ROC曲线为对角线。

AUC<0.5:模型性能较差,分类结果可能错误。Top-k准确率和Top-k错误率Top-k准确率(Top-kAccuracy)表示在模型前k个最高概率的预测类别中,与实际类别匹配的样本数Top-kNrs占总样本数N的比例图像分类基于ResNet-34的图像分类实践对传统行业的冲击第1步:导入库和准备环境。第2步:数据预处理和加载数据。第3步:加载ResNet-34模型。第4步:定义损失函数和优化器。第5步:训练和验证。几种网络模型在10-croptesting条件下的测试结果目标检测目标检测是计算机视觉中的核心任务,旨在识别出图像中的所有目标,并确定每个目标的类别及其在图像中的位置(通常用边界框表示)。目标检测可以看作图像分类和目标定位的组合,其核心在于对目标类别和边界框同时进行预测。目标检测目标检测数据集COCO数据集COCO数据集是目标检测任务中最流行的数据集之一。它由微软发布,包含大量真实场景的图片,涵盖多种目标类别,且标注十分详细,支持实例分割、关键点检测等任务。包含80个类别,训练集包含118287张图像,验证集包含5000张图像,测试集包含40670张图像。COCO数据集包含复杂的场景(如图像中有多个目标、目标有遮挡或重叠的情况),是目标检测算法的标准测试基准。PASCALVOC数据集PASCALVOC数据集是目标检测领域早期的经典数据集。它为目标检测、图像分类和分割任务提供了标注数据,是许多早期目标检测模型的基准。PASCALVOC数据集包含20个类别(如人、动物、交通工具等),训练集和验证集有11530张图像,测试集有5823张图像。目标检测目标检测数据集ImageNetDETImageNetDET数据集是ImageNet数据集的一个子集,专为目标检测设计。它是一个超大规模的数据集,包含成千上万的目标实例,可分为200个类别(从ImageNet的1000个类别中选择)。其中训练集有395909张图像,验证集有20121张图像,测试集有40152张图像。OpenImagesDatasetOpenImagesDataset是由谷歌提供的大规模目标检测数据集。相较于COCO数据集和PASCALVOC数据集,OpenImagesDataset提供了更多的目标实例及更丰富的类别覆盖。OpenImagesDataset包含约600个目标类别(如人、动物、建筑物和日常物品等),图像分辨率不固定但整体较高。其训练集包含约900万张图像,标注了约1500万个目标实例;验证集和测试集分别包含41620张和125436张图像。该数据集适用于大规模、多类别和复杂场景下的目标检测任务。目标检测目标检测任务的评价指标评价指标作用公式交并比IoU衡量预测边界框与真实边界框的重叠程度精确率和召回率衡量模型在正样本检测上的表现精确率-召回率曲线展示了在不同阈值下精确率和召回率的变化关系AP衡量单个类别的检测精度mAP衡量整个模型在所有类别上的综合性能FPS对应目标检测模型的推理速度目标检测基于FasterR-CNN的目标检测实践FasterR-CNN改进了早期的R-CNN系列,引入区域候选网络实现了高效的目标检测,使目标检测的性能和速度得到大幅提升。FasterR-CNN的核心在于将目标检测任务分为两个阶段:候选区域生成(第一阶段)和目标分类与边界框回归(第二阶段)第一阶段(1)主干网络:用于提取输入图像的特征。常见的主干网络包括VGG、ResNet等。(2)RPN:用于生成候选区域,即可能包含目标的区域。具体来说,对输入特征生成一组候选锚框(AnchorBoxes),即在特征图的每个像素位置生成多个锚框,每个锚框的大小和长宽比固定。①分类分支(用于判断前景/背景)②回归分支(用于预测锚框偏移量)目标检测基于YOLO的目标检测YOLO的主要特点是将目标定位和目标分类整合在一次前向传播中完成。这种端到端的检测方式使得YOLO在保证较高精度的同时,具有非常快的速度,适合实时目标检测。YOLO的核心思想是将目标检测视为回归问题,一次性预测图片中的目标类别及边界框。YOLO不会生成候选区域,而是直接对整张图片进行全局回归。YOLO将整张图片划分为网格,每个网格负责预测一个或多个目标,通过单次前向传播即可完成目标检测。YOLO与其他模型在PASCALVOC2007数据集上的对比语义分割语义分割(SemanticSegmentation),它比目标检测更进一步,不仅识别目标的位置,还能够以像素级别的精确度来划分目标的边界。语义分割的标注效果语义分割语义分割数据集PASCALVOC数据集目前常用的是VOC2012数据集。该数据集包含20个目标类别以及1个背景类,共21类。训练集有1464张图像,验证集有1449张图像,测试集有1456张图像。COCO-Stuff数据集COCO-Stuff数据集发布于2017年,具有172类(包括80个实体类、91个背景类)。训练集包含118000张图像,验证集包含5000张图像。语义分割语义分割数据集Cityscapes数据集Cityscapes数据集是一个面向城市街景理解任务的高质量数据集。该数据集包含19个用于语义分割评测的目标类别(如道路、建筑、车辆和行人等),图像分辨率为2048×1024。Cityscapes数据集的训练集包含2975张图像,验证集包含500张图像,测试集包含1525张图像。该数据集提供精细的像素级标注,并额外提供规模更大的粗糙标注。ADE20K数据集ADE20K数据集发布于2017年,共包含150类(包含物体和背景),图像分辨率多样化。训练集有20210张图像,验证集有2000张图像,测试集有3352张图像。每张图像被标注为多种类别,涵盖前景和背景。是场景解析挑战(SceneParsingChallenge)的主要数据集。语义分割语义分割数据集KITTI数据集KITTI数据集发布于2012年,包含11类(官方提供的标注)或19类(扩展标注)。在该数据集中,图像的分辨率约为1242×375。训练集包含200张图像,测试集包含200张图像。KITTI数据集专注于自动驾驶任务,其中的图像采集自真实场景中行驶的车辆。ISPRS数据集ISPRS数据集包含Potsdam、Toronto、Vaihingen等城市或地区的二维语义分割,具有6个类别的高分辨率遥感影像。训练集和测试集以区域划分,不同场景下数据量不同。ISPRS数据集专注于遥感图像分割任务MSD数据集MSD数据集包含10个任务(涵盖不同医学成像场景),图像的分辨率根据任务而变化。每个任务对应几千张图像。MSD数据集专注于医学影像语义分割,数据来自计算机体层成像(ComputedTomography,CT)、磁共振成像(MagneticResonanceImaging,MRI)等,数据标签包含解剖学器官、病变区域。该数据集适用于医学图像分析、疾病检测、分割肿瘤和器官等医学任务。语义分割语义分割任务的评价指标语义分割基于FCN的语义分割实践FCN主要包含以下几个部分。(1)卷积特征提取:使用一个基础的卷积神经网络(如VGG16)作为特征提取网络,提取输入图像的多层特征。通过多次卷积和池化操作,逐步减小图像的分辨率,但保留其中的语义信息。(2)全卷积层:将分类任务中的全连接层替换为卷积层,使得网络可以处理任意大小的输入图像,并输出分辨率较低的特征图。(3)上采样(反卷积):使用反卷积操作将特征图的分辨率恢复到输入图像的原始分辨率,实现像素级分类。(4)跳跃连接:将不同层次的特征进行融合。低层特征具有更高的分辨率,而高层特征具有更强的语义信息。跳跃连接融合了这两者的优点。FCN-8s与其他模型在VOC2011和VOC2012测试集上mIoU指标的对比THANKS

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论