模态基础及学习 13_第1页
模态基础及学习 13_第2页
模态基础及学习 13_第3页
模态基础及学习 13_第4页
模态基础及学习 13_第5页
已阅读5页,还剩44页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

Introduction

to

Information

Retrieval图像特征

Live

Q&A/jinCS3245

–

Information

Retrieval多模态机器学习24.1图像特征基本概念:图像存储格式与理想特征的性质。4.2手工特征提取:局部特征:斑点、边缘、角点。全局特征:直方图、SIFT、SURF等。4.3基于神经网络的特征提取:卷积神经网络(CNN)基础。经典模型:LeNet、AlexNet、VGG、GoogleNet、ResNet。新方法:ViT与对比学习(SimCLR)。核心思想:将量级庞大、含冗余信息的图像像素数据,转换为量级较小、能描述关键内容的特征向量。Ch.

11-12本章内容概述CS3245

–

Information

Retrieval多模态机器学习3图像本质:由像素组成的矩阵,分辨率为宽×高。主流色彩模式:RGB(最常用):三通道(R/G/B),每个通道取值0~255。输入格式:C(通道)×W×H的三维矩阵。HSV:H(色调)、S(饱和度)、V(明度),符合人类视觉直觉。灰度图:单通道二维矩阵,取值0~255(黑~白)。注意事项:传统手工特征提取一般只接受灰度图输入。神经网络方法可直接处理RGB三维矩阵,保留更丰富的信息。Ch.

11-12图像在计算机中的表示CS3245

–

Information

Retrieval多模态机器学习4稳定性(Robustness)对输入图像的微小变化(如噪声、亮度微调),特征值不应剧烈变化。保证特征在不同图像中具有较好的一致性。仿射不变性(AffineInvariance)无论图像如何平移、旋转、缩放,都能提取到相同的特征。泛化性(Generalization)主要针对神经网络方法。模型能够适用于未见过的图像,而非仅记忆训练集。Ch.

11-12一个理想的图像特征应具备的性质CS3245

–

Information

Retrieval多模态机器学习5历史地位:伴随计算机视觉学科发展而出现,是传统方法的核心。优点:计算效率高,物理意义明确。缺点:处理复杂图像内容的能力有限。适用场景:特征明显、变化规律简单、语义简单的任务(如目标匹配、人脸识别)。分类:局部特征:关注图像中局部的形状特征(斑点、边缘、角点)。全局特征:对整个图像进行总体统计描述。Ch.

11-12手工特征提取概述CS3245

–

Information

Retrieval多模态机器学习6定义:在像素坐标系中,对每个像素的值与周围像素的值进行计算,得到新的像素值。滤波核:用于计算的权重矩阵。响应图:对所有像素进行空间滤波后得到的结果图像,尺寸与原图一致。Ch.

11-12局部特征提取的基础:空间滤波CS3245

–

Information

Retrieval多模态机器学习7关键步骤:扩充(Padding):为让边缘像素也参与计算,需在图像外围补零。阈值化:响应值可能超出0~255范围,需设定阈值筛选并归一化。本质:响应图中的每个像素值,代表该点附近某种形状特征(如点、边、角)的显著性。Ch.

11-12局部特征提取的基础:空间滤波CS3245

–

Information

Retrieval多模态机器学习8

Ch.

11-12斑点特征(LoG)CS3245

–

Information

Retrieval多模态机器学习9Ch.

11-12斑点特征(LoG)LoG滤波效果示意图:原图(左)以及检测结果(右)LoG滤波核示意图:3D视图(左)以及表格视图(右)LoG(高斯拉普拉斯)CS3245

–

Information

Retrieval多模态机器学习10

Ch.

11-12斑点特征(DoG)斑点特征(DoG)DoG差分计算示意图DoG与LoG曲线对比图两种计算结果大体相似CS3245

–

Information

Retrieval多模态机器学习12定义:图像中灰度沿某个方向显著变化、沿另一个方向变化不大的区域。常见检测方法:Sobel边缘特征Canny边缘特征LoG/Marr边缘特征Ch.

11-12边缘特征CS3245

–

Information

Retrieval多模态机器学习13定义:对图像区域内两个正交方向(X/Y)亮度变化的描述。核心原理:边缘处法线方向存在显著且均匀的亮度差异。检测方式:X方向计算差值→检测垂直边缘Y方向计算差值→检测水平边缘合成两个分量的向量模量→作为最终边缘响应Ch.

11-12Sobel边缘特征核设计特点:中间隔一列/行→采用中心差分,误差更小中心取2、两侧取1→重点计算主方向差值,兼顾邻域平均CS3245

–

Information

Retrieval多模态机器学习14定义:对图像区域内两个正交方向(X/Y)亮度变化的描述。核心原理:边缘处法线方向存在显著且均匀的亮度差异。检测方式:X方向计算差值→检测垂直边缘Y方向计算差值→检测水平边缘合成两个分量的向量模量→作为最终边缘响应Ch.

11-12Sobel边缘特征CS3245

–

Information

Retrieval多模态机器学习15核设计特点:中间隔一列/行→采用中心差分,误差更小中心取2、两侧取1→重点计算主方向差值,兼顾邻域平均Ch.

11-12Sobel边缘特征CS3245

–

Information

Retrieval多模态机器学习16

Ch.

11-12Sobel边缘特征CS3245

–

Information

Retrieval多模态机器学习17

Ch.

11-12Sobel边缘特征

CS3245

–

Information

Retrieval多模态机器学习18定位:改进Sobel,通过筛选去除冗杂响应,使边缘更清晰、简洁三步核心流程:高斯平滑

→防止结果过度敏感,使Sobel响应更平滑非极大值抑制

→取响应峰值,去除密集、重复的边缘响应滞后阈值(双阈值)→高于上限设为白,低于下限设为黑核心优势:Ch.

11-12Canny边缘特征双阈值策略更好避免噪声影响得到更精确干净的边缘响应CS3245

–

Information

Retrieval多模态机器学习19思想:LoG既可检测斑点(大滤波核),也可检测边缘(小滤波核)本质:Sobel是一阶差分近似,LoG是二阶差分近似边缘处亮度函数经过拐点→一阶导为零,二阶导非零边缘越尖锐→二阶导数值越大响应计算:直接求取像素点处的二阶差分LoG值,作为边缘响应多尺度检测:不同大小滤波核与σ值→检测不同粗细的边缘线条优势:效果与Sobel类似,但抗噪声能力更强经典应用:Marr-Hildreth边缘检测方法划分图像为多个小块→分别计算二阶导→寻找二阶导零点→判定边缘位置

Ch.

11-12LoG边缘特征CS3245

–

Information

Retrieval多模态机器学习20定义:边缘的转折点,在两个正交方向上梯度都发生显著变化。Moravec角点思路:计算四个主方向(0°、90°、180°、270°)的亮度变化量,取最小值作为响应。局限:对对角方向的亮度变化不敏感。Harris角点(改进)思路:利用泰勒展开近似任意方向的亮度变化,拟合更精确曲率。优势:检测更精确,对旋转具有较好的一致性。Ch.

11-12角点特征CS3245

–

Information

Retrieval多模态机器学习21动机:避免曲线拟合带来误差,直接通过亮度变化量近似计算曲率核心公式:特定方向(u,v)上的亮度总体变化量计算四个主方向:代入(u,v)=(1,0)、(0,1)、(-1,0)、(0,-1)分别得到水平、垂直及相反方向的亮度变化量Ch.

11-12角点特征-Moravec角点

CS3245

–

Information

Retrieval多模态机器学习22角点判定依据:角点处→四个主方向均出现较大亮度变化边缘处→仅某一方向变化明显平坦区域→各方向变化均较小响应值计算:取四个方向计算结果中的最小值作为该点的角点特征响应值局限性:只考虑四个主方向,对对角方向亮度变化不敏感后续Harris算法针对此问题进行了改进Ch.

11-12角点特征-Moravec角点角点特征-Harris角点改进:通过泰勒展开拟合任意方向曲率,实现更精确角点检测数学推导:像素值通过一阶梯度近似:P(x+i+u,y+j+v)≈P+(∂P/∂x)·u+(∂P/∂y)·v代入亮度变化公式,得到任意方向(u,v)上的变化量E(u,v)E(u,v)=A·u²+2C·uv+B·v²A=Σ(∂P/∂x)²B=Σ(∂P/∂y)²C=Σ(∂P/∂x)·(∂P/∂y)

角点特征-Harris角点简化计算(避免额外梯度计算):原始曲率公式需计算Mx、My(引入额外计算量)Harris通过矩阵分解简化为:κ_k=A·B-C²-k·(A+B)²直接通过A、B、C计算角点响应,无需额外梯度检测效果:角点处响应值显著高于边缘和平坦区域CS3245

–

Information

Retrieval多模态机器学习25定义:对整个图像特定属性的分布进行统计,以柱状图形式表示。特点:输出为固定长度的向量(不依赖于图像尺寸)。对微小扰动不敏感,具有较好的稳定性。常见类型:亮度直方图:横坐标为亮度值,纵坐标为像素数量。梯度方向直方图:横坐标为梯度角度,纵坐标为强度(或像素数量)。处理:通常需要进行归一化,以获得缩放不变性等性质。

Ch.

11-12全局特征(1):直方图CS3245

–

Information

Retrieval多模态机器学习26图像亮度直方图(左)与图像角度-梯度直方图(右)Ch.

11-12全局特征(1):直方图CS3245

–

Information

Retrieval多模态机器学习27全称:尺度不变特征变换(Scale-InvariantFeatureTransform)地位:计算机视觉领域最著名的图像特征描述方法之一。优势:对旋转、缩放、平移具有不变性。对光照变化、噪声、视角变化有很好的容忍度。信息量大,少量特征即可精确描述目标。Ch.

11-12全局特征(2):SIFT概述CS3245

–

Information

Retrieval多模态机器学习28提取四步骤:尺度空间极值点检测(使用DoG)每个尺度空间内递推生成极值点响应图通过平均池化将图像长宽缩放1/2,进入下一个尺度极值点筛选:在相邻尺度的3×3×3邻域内搜索,保留极值绝对值最大点输出:每个极值点包含坐标和尺度信息(x,y,σ)Ch.

11-12全局特征(2):SIFT提取步骤1CS3245

–

Information

Retrieval多模态机器学习29关键点定位(亚像素级矫正)极值点坐标是离散的,与真实值存在偏差通过曲线插值进行矫正,得到真实极值点位置关键点即矫正后的真实极值点过滤条件:移除超出图像范围的点+移除构成边缘的点确定特征点主方向在关键点邻域(半径3×1.5σ)内计算每个点的梯度方向和幅度构建角度-梯度直方图,取波峰方向作为主方向实现旋转不变性输出:特征点由(x,y,σ,θ)完整表示Ch.

11-12全局特征(2):SIFT提取步骤2&3CS3245

–

Information

Retrieval多模态机器学习30生成特征点描述子根据主方向θ旋转邻域内所有点,实现旋转对齐取8×8窗口,划分4个象限(种子点);每个种子点统计8个方向梯度累加实际应用:采用16个种子点(4×4划分),每个特征点生成

16×8=128维向量输出:N×128维特征向量,可用于图像检测、匹配、识别等下游任务Ch.

11-12全局特征(2):SIFT提取步骤4CS3245

–

Information

Retrieval多模态机器学习31SURF(加速稳健特征):SIFT的加速改进版(2006年)。使用Haar小波特征代替梯度直方图来确定主方向。使用积分图加速Haar-like特征计算。优势:计算速度显著快于SIFT,同时保持较好的鲁棒性。Ch.

11-12全局特征(3):SURF及其他方法常用的Haar特征模板

:左二列为边缘特征;中三列为线性特征;右一列为环绕特征。窗口内黑色覆盖的像素减去白色覆盖的像素的结果之和作为一个模板的响应。

CS3245

–

Information

Retrieval多模态机器学习32历史:始于1969年(Fukushima),但受限于算力。21世纪后随算力发展而超越传统方法。核心优势:能够自动学习高阶语义信息。具备更强的仿射不变性和稳定性。可同时提取局部和全局特征(在网络不同位置截取输出)。主流方法:CNN:LeNet→AlexNet→VGG→GoogleNet→ResNet视觉Transformer(ViT)对比学习(SimCLR)Ch.

11-12基于神经网络的特征提取概述CS3245

–

Information

Retrieval多模态机器学习33

Ch.

11-12卷积神经网络(CNN)基础相比全连接层,参数量更少,不易过拟合。堆叠可形成层次化特征CS3245

–

Information

Retrieval多模态机器学习34提出时间:1989年(YannLeCun)历史地位:现代卷积神经网络的开山之作。结构:2个卷积层+平均池化+全连接层。首次将反向传播(BP)

与卷积操作结合。应用:手写数字识别(MNIST数据集),错误率1.7%。贡献:证明了CNN的泛化能力优于全连接网络。LeNet5成为现代CNN的基础架构。Ch.

11-12经典CNN模型(1):LeNetCS3245

–

Information

Retrieval多模态机器学习35Ch.

11-12经典CNN模型(1):LeNetLeNet1结构示意图

LeNet5结构示意图

CS3245

–

Information

Retrieval多模态机器学习36提出时间:2012年(ImageNet冠军)历史意义:以15.3%

失误率夺冠,领先第二名约11%。标志着深度学习在计算机视觉领域的崛起。数据:ImageNet(1000类,120万+张图像)。Ch.

11-12经典CNN模型(2):AlexNetCS3245

–

Information

Retrieval多模态机器学习37结构特点:5个卷积层+3个全连接层。使用GPU进行训练(算力突破)。引入ReLU激活函数、Dropout正则化。

Ch.

11-12经典CNN模型(2):AlexNetCS3245

–

Information

Retrieval多模态机器学习38提出时间:2014年(ILSVRC检测任务冠军)核心设计:全部使用

3×3

小卷积核(K=3,P=1)。感受野相同,但参数量更少(5×5>3×3×2)。引入更多ReLU非线性,提升学习能力。结构规律:特征图尺寸减半时,通道数翻倍。Ch.

11-12经典CNN模型(3):VGGNetCS3245

–

Information

Retrieval多模态机器学习39代表版本:VGG16(13个卷积层+3个全连接层)。局限:参数量巨大(1.38亿),主要由全连接层贡献。Ch.

11-12经典CNN模型(3):VGGNetCS3245

–

Information

Retrieval多模态机器学习40提出时间:2014年(ILSVRC分类/检测双料冠军)核心创新:Inception模块

–增加网络宽度。并排使用1×1、3×3、5×5卷积核。1×1卷积:削减特征图深度,实现稀疏连接,大幅减少参数量。参数量:约500万(仅为VGG16的1/20,AlexNet的1/12)。额外技巧:使用平均池化替代全连接层进行线性化,减少参数。添加辅助分类器缓解梯度消失问题。Ch.

11-12经典CNN模型(4):GoogleNet(InceptionV1)CS3245

–

Information

Retrieval多模态机器学习41GoogleNet卷积层结构Ch.

11-12经典CNN模型(4):GoogleNet(InceptionV1)CS3245

–

Information

Retrieval多模态机器学习42

Ch.

11-12经典CNN模型(5):ResNetCS3245

–

Information

Retrieval多模态机器学习43优势:使深层网络具备回归浅层网络的能力。有效缓解梯度消失问题。成就:2015年ILSVRC冠军,可训练152层网络。影响:ResNet50成为最广泛使用的预训练模型之一。Ch.

11-12经典CNN模型(5):ResNetCS3245

–

Information

Retrieval多模态机器学习44Ch.

11-12经典CNN模型(5):ResNetCS3245

–

Information

Retrieval多模态机器学习45背景:受VisualBert启发,探索Transformer在纯视觉任务中的应用。核心思想:将图像视为“序列”。Ch.

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论