汽车行业深度报告:AI系列深度17期视觉智能为何引入Transformer_第1页
汽车行业深度报告:AI系列深度17期视觉智能为何引入Transformer_第2页
汽车行业深度报告:AI系列深度17期视觉智能为何引入Transformer_第3页
汽车行业深度报告:AI系列深度17期视觉智能为何引入Transformer_第4页
汽车行业深度报告:AI系列深度17期视觉智能为何引入Transformer_第5页
已阅读5页,还剩9页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

TOC\o"1-2"\h\z\u复盘CNN:视觉归纳偏置如何定义视觉任务上限 4基本原理:三项视觉归纳偏置与层级特征抽象 4从LeNet到ResNet的演进 4结构性局限 5爆发之前,卷积网络的应用上限 5卷积网络时代视觉任务的主要成果 5应用上限:封闭标签、任务专用与全局建模约束 6与卷积网络的结构对比及其优点 6两种架构的结构对比 7Transformer相对卷积网络的主要优点 7应用于视觉任务的学术成果梳理及发展阶段总结 8发展阶段框架 9里程碑学术成果与论文 10逐阶段梳理 10技术演进时间轴 12之后:视觉从封闭感知走向基础模型 13Transformer缺少CNN的视觉归纳偏置 13是否所有视觉任务都已改用Transformer 13Transformer是作为核心本体还是作为组件 14在语言、图像任务发展的对比 14风险提示 15图1:卷积神经网络的三项视觉归纳偏置 4图2:卷积神经网络的典型层级结构与特征抽象 4图3:卷积网络(CNN)与视觉Transformer(ViT)的结构对比 7图4:Transformer在视觉任务中的技术演进时间轴(2017—2026) 12图5:视觉归纳偏置的强弱谱与补偿手段 13表1:卷积网络在主要视觉任务上的代表方法 6表2:Transformer与卷积网络的多维对比 8表3:Transformer视觉任务发展三大阶段—子阶段框架 9表4:Transformer视觉任务重要成果分类表(里程碑红色加粗) 10表5:Transformer在语言与视觉任务中的角色对比 14复盘CNN:视觉归纳偏置如何定义视觉任务上限基本原理:三项视觉归纳偏置与层级特征抽象/分CNN之所以高度契合图像,源于其架构内置的三项视觉归纳偏置。局部连接权重共享其三,平移等变性:在理想卷积条件下,输入图像发生平移,输出特征图也随之平移。我们认为,正是这些由架构直接注入、而非完全依靠数据学习得到的空间先验,使CNN在数据规模有限时仍能高效学习,并奠定其在AI第一次爆发中的核心地位。图1:卷积神经网络的三项视觉归纳偏置 图2:卷积神经网络的典型层级结构与特征抽象Gradient-BasedLearningAppliedtoDocumentRecognition 绘制

Gradient-BasedLearningAppliedtoDocumentRecognitionImageNetClassificationwithDeepConvolutionalNeuralNetworks 绘制从LeNet到ResNet的演进卷积思想可追溯至Fukushima(1980)提出的神经认知机;LeCun等(1998)将反LeNet-5CNN的2012Krizhevsky等提出的AlexNetImageNetAIInception多ImageNettop-53.5%5%的top-5结构性局限CNN在图像分类等任务上取得了显著工程成功,但其能力也受到若干结构性因素约束。这些约束构成Transformer进入视觉任务的前提。CNN其三,任务专用,缺乏统一可迁移底座。CNN(如erRN如CkRNImageNet(zero-shot)任务。强空间先验、任务专用和封闭标签四种形式限定能力边界。理解这四点,是理解Transformer为何进入视觉、又为何无法对CNN形成彻底替换的前提。爆发之前,卷积网络的应用上限卷积网络时代视觉任务的主要成果在Transformer进入视觉之前,CNN已将主流视觉任务推进到较高工程水平,代表AeNt201)U-NetMaskR-CNNCNN表1:卷积网络在主要视觉任务上的代表方法任务方向 代表方法 主要时期图像类 AlexNetVGG、GoogLeNetResNet 2012—2016目标测两段) R-CNN、Fast/FasterR-CNN 2014—2016目标测单段/时)YOLOSSD 2016语义/例割 FCN、U-Net、DeepLab、MaskR-CNN 2015—2017图像分率/层觉SRCNN其续 2014—2017人脸别度学习 DeepFace、FaceNet 2014—2015DeepResidualLearningforImageRecognitionMaskR-CNN》等其他文献,东吴证券研究所应用上限:封闭标签、任务专用与全局建模约束NImageNetImageNetTransformer进入视CNN换言之,CNN与卷积网络的结构对比及其优点两种架构的结构对比ransor(01(20)ach即oe(如1×16tokentokenTransformer。两种架构最根本的差异,在于空间信息如何交互、先验从哪里来。CNNkenoken(ue(eyau图3:卷积网络(CNN)与视觉Transformer(ViT)的结构对比AnImageis16×16TransformersforImageRecognitionatScale《AttentionIsAllNeed 绘制相对卷积网络的主要优点基于上述结构差异,我们将Transformer相对CNN的优点归纳为四点。CNN第二,归纳偏置较弱,有利于释放数据规模价值。CNNTransformer(Transformer的图像分类性能可超过同等条件下的CNN。将图像表示为token第四,可扩展性强。Transformer结构均一、便于堆叠加深与加宽,配合并行训练,天然适配“扩大模型与数据规模”的路线,为视觉领域的规模化提供了结构载体。化无法成为一次彻底替换。中小数据规模下未必优于CNN其二,计算开销随分辨率快速上升:全局自注意力的计算量会随token数量增加而快速放大,高分辨率图像的token数量较多,直接使用全局注意力成本较高。其三,缺乏顺序与空间先验,必须依赖位置编码补足。表2:Transformer与卷积网络的多维对比对比维度 卷积网络(CNN) 视觉以为代表)空间息互 局部积逐扩感野 自注力全直交长距依赖 需堆多,径距增长 O(1)常数路径(归纳偏置变)

弱(依赖数据学习,需位置编码)计算杂度 随像近线性 全局意随token数(O(n²))空间验源 架构置 依赖置码大模训练小数表现 较好 较弱依大模训练跨任务/跨模任务用迁有限 接口一利迁与模态齐态可扩性 受结约束 利于模展AnImageis16×16TransformersforImageRecognitionatScale《AttentionIsAllYouNeed》等其他文献ansorr之于NTransformerCNN应用于视觉任务的学术成果梳理及发展阶段总结我们以论文与代表性学术成果为基础,梳理2017年以来Transformer在视觉任务中的学术演进,并对其发展阶段进行归纳。发展阶段框架基于相关论文与代表成果复盘,我们将Transformer在视觉任务中的演化归纳为三个大阶段、九个子阶段。三个大阶段分别为:tokenCNNtoken/queryTransformerCNNCNN表3:Transformer视觉任务发展三大阶段—子阶段框架大阶段子阶段时间核心变化代表成果token化token化token化2017—20192020—2021注意力先作为CNN的增强模块,建模长距离依赖图像被切成patchNon-local、ImageTransformerStand-AloneSelf-AttentionViT、DeiT入检测、分割从手工流一、图像被token化1.3输出token/query化2020—2021程转为token/queryDETR、SETR输出二、可扩展通用骨干二、可扩展通用骨干

重新吸收局部性、层2.1视归偏回归 2021—2022级结构与多尺度特征成为分类、检测、分2.2通视骨形成 2021—2023割、视频的通用骨干CNN 借

PVT、Swin、MViT、CoAtNet、MaxViTSwin、PVT、AdapterConvNeXt 、二、可扩展通用骨干三、走向视觉基础

2.3CNNTransformer融合再平衡

2022—2024

Transformer训练范式,二者结构互吸收从有监督训练转向大

InternImage、HybridViTDINO、BEiT、MAE、模型三、走向视觉基础模型

3.1自督觉训练 2021—20263.2开词视模型 2021—2026

规模无标签预训练从固定类别转向自然语言监督与零样本识别

EVA、DINOv2、DINOv3CLIP、ALIGN、Florence、SigLIP三、走向视觉基础模型

转向点、框、文本、3.3可提视基模型 2023—2026 mask提驱动

SAM、SAM2、SAM3、GroundingDINOAnImageis16×16TransformersforImageRecognitionatScale《SwinTransformer:HierarchicalVisionTransformerusingShifted ows》等其他文献里程碑学术成果与论文DETR(2020、patchtokenSwinTransformer(2021CLIP、SAM(2023SA-1B表4:Transformer视觉任务重要成果分类表(里程碑红色加粗)大阶段 子阶段 代表论文成果 核心贡献Non-local、Stand-一像被token化 前史

AloneSelf-Attention

CNNpach即okanoer一像被token化 输入token化 DeiT一像被token化 输出token/query化 DETR、SETRPVT 、

胜任分类将检测、分割改写为token/query输出,端到端化引入金字塔、窗口与层级结构,适配高分辨二可展用干 归纳置归二可展用干 融合平三走视基模自监督预训练型三、走向视觉基础模开放词表型三、走向视觉基础模可提示型

Transformer、ConvNeXt InternImageDINOBEiTMAE、DINOv2、DINOv3CLIP、ALIGN、FlorenceSigLIPSAM、SAM2SAM3、DINO

率密集任务ViT经验反哺CNN,二者双向借鉴摆脱人工标签,学习可迁移的通用视觉表征表识别转向点、框、文本提示驱动的开放视觉任务AnImageis16×16TransformersforImageRecognitionatScaleSegmentAnything逐阶段梳理okn(01—202anoer进CNNTransformertoken序列。(01—20N(202它将图像切分为固定大小patchtoken序列,使TransformerTransformer(02agNet也能训练出有竞争力的视觉nsoe,tokenDETR(2020)objectquery的SETR测。这意味着Transformer第二大阶段:视觉架构转向可扩展通用骨干(02—224。Ttoken2021anoernsoeCNNPVT(2021)TransformerCNN、CoAtNet、CNNSwin相当的水平,说明视觉架构进入CNNTransformer本替换RNN,视觉中则与CNN融合。第三大阶段:从封闭标签分类走向视觉基础模型(02—22。Transformer:DINO(2021)、17亿无70GramAnchoring4范式,ALIGN、Florence、SigLIP等沿同一方向推进。:SAM(2023)SA-1B数据(10mask(2024)扩展到视频并引入流式记忆支持实时分割;SAM3(2025)进一步引入概念提示,可依据名词短语一次性返回全部匹配实例,Florence-2、GroundingDINO则推动文本提示、视觉定位与检测分割统一。CNN技术演进时间轴CN01—201T确立图像ken(0)→DETR/SETR改写输出范式(2020—2021)→Swin/PVT形成通用骨干(2021)→ConvNeXt(2022)→DINOv2/CLIP/SAM(2021—2023DO3A3(22Transformer与CNN图4:Transformer在视觉任务中的技术演进时间轴(2017—2026)AnImageis16×16TransformersforImageRecognitionatScale《SegmentAnything》等其他文献之后:视觉从封闭感知走向基础模型缺少CNN的视觉归纳偏置要理解CNNTransformertokentokenCNN那样因此,Transformer直接用于视觉任务时,相比CNN图5:视觉归纳偏置的强弱谱与补偿手段AnImageis16×16TransformersforImageRecognitionatScale《SwinTransformer:HierarchicalVisionTransformerusingShifted ows》等其他文献绘制我们认为,这一差异是理解视觉与语言两条主线分野的关键。语言数据天然是离散TransformerTransformerRNNCNN的归纳偏置确有工程价值,因此Transformer是否所有视觉任务都已改用/TransformerTransformerTransformer。Swi

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论