CN119478403A 一种超长上下文建模的大幅面遥感影像语义分割方法 (武汉大学)_第1页
CN119478403A 一种超长上下文建模的大幅面遥感影像语义分割方法 (武汉大学)_第2页
CN119478403A 一种超长上下文建模的大幅面遥感影像语义分割方法 (武汉大学)_第3页
CN119478403A 一种超长上下文建模的大幅面遥感影像语义分割方法 (武汉大学)_第4页
CN119478403A 一种超长上下文建模的大幅面遥感影像语义分割方法 (武汉大学)_第5页
已阅读5页,还剩32页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一种超长上下文建模的大幅面遥感影像语本发明公开了一种超长上下文建模的大幅明所述方法能够在单台设备上处理亿级序列长使其能够有效应对不同数据环境的语义分割任2对基本网络进行端到端训练和微调;2.根据权利要求1所述的超长上下文建模的大幅面遥感影像语义分割方法,其特征在在所述骨干网络在重叠图块嵌入时,初始化并拼接加入3.根据权利要求1所述的超长上下文建模的大幅面遥感影像语义分割方法,其特征在4.根据权利要求1所述的超长上下文建模的大幅面遥感影像语义分割方法,其特征在用于将从骨干网络不同层级采集的特征向量通过多层感知机连接;然后通过一层激活函所述全局特征指导包括全连接层,用于将特征聚合层提取的局部特征5.根据权利要求1所述的超长上下文建模的大幅面遥感影像语义分割方法,其特征在对骨干网络进行预训练的方法包括:首先采用掩码自监督方法提36.根据权利要求1所述的超长上下文建模的大幅面遥感影像语义分割方法,其特征在利用感受野拓展层的总全局特征来预测整个图像的地物类别总数,并设置损失函数,8.一种电子设备,包括存储器、处理器及存储程序被处理器执行时实现如权利要求1至6任一项所述超长上下文建模的大幅面遥感影像行时实现如权利要求1至6任一项所述超长上下文建模的大幅面遥感影像语4技术表现出了一定的优势。土地利用/土地覆盖(LandUse/LandCover,LULC)分类是遥感策略是扩大输入图块大小并从分割输出中修剪容易出错的边缘,或采用更平滑的拼接技了在多层encoder_decoder架构中融合多尺度上下文特征的方法,以增强局部分割的精确基础Transformer架构称为VisionTransformer(ViT)。受多尺度、金字塔式图像处理的启5被直接应用于超大幅面遥感影像的语义分割任务,其中涉及的特定挑战尚未得到有效解[0009][文献1]G.Chevalier,"Makesmoothpredictionsbyblendingimagepatches,suchasforimagesegmentation,",2020.localnetworksformemory_efficientsegmentationofultra_highresolutionimages,"inProceedingsoftheIEEE/CVFconferenceoncomputervisionandpatternrecognition,2019,pp.8924_8933.andL.Ma,"Isdnet:Integratingshallowanddeepnetworksforefficientultra_highresolutionsegmentation,"inProceedingsoftheIEEE/CVFConferenceonComputerVisionandPatternRecognition,2022,pp.4361_4370.Ultra_highresolutionimagesegmentationvialocality_awarecontextualcorrelation,"inProceedingsoftheIEEE/CVFInternationalConferenceonComputerVision,2021,pp.7252_7261.[0013][文献5]Y.Li,W.Chen,X.Huang,Z.Gao,S.Li,T.He,andY.Zhang,"MFVNet:adeepadaptivefusionnetworkwithmultiplefield_of_viewsforremotesensingimasemanticsegmentation,"ScienceChinaInformationSciences,vol.66,p.140305,2023.[0014][文献6]W.Chen,Y.Li,B.Dang,andY.Zhang,"ElegantSeg:End_to_EndHolisticLearningforExtra_LargeImageSemanticSegmentation,"arXivpreprintarXiv:2211.11316,2022.analysisusingsegmentationdeeplearningalgorithms,"TheAmericanjournalofpathology,vol.189,pp.1686_1698,2019.transformer:Hierarchicalvisiontransformerusingshiftedwindows,"inProceedingsoftheIEEE/CVFinternationalconferenceoncomputervision,2021,pp.10012_10022.[0017][文献9]H.Fan,B.Xiong,K.Mangalam,Y.Li,Z.Yan,J.Malik,andC.Feichtenhofer,"Multiscalevisiontransformers,"inProceedingsoftheIEEE/CVFinternationalconferenceoncomputervision,2021,pp.6824_6835.[0018][文献10]A.Krizhevsky,"Oneweirdtrickforparallelizingcon6neuralnetworks,"arXivpreprintarXiv:1404.5997,2014.A.Senior,P.Tucker,andK.Yang,"Largescaledistributeddeepnetworks,"Advancesinneuralinformationprocessingsystems,vol.25,2012.[0020][文献12]V.Elango,"Pase:Parallelizationstrategiesforefficientdnntraining,"in2021IEEEInternationalParallelandDistributedProcessing7权重比例;8算机程序被处理器执行时实现如前述超长上下文建模的大幅面遥执行时实现如前述超长上下文建模的大幅面遥感了全局特征和局部特征的特性,在不过度增加内存开销的同时对全图特征进行了有效关[0064](1)所述方法为有效考虑了深度学习领域海量的基于视觉自注意力模型的骨干网[0065](2)所述方法引入感受野拓展层的这一空间聚合方法,能够有效关联亿级序列长[0068]图2为本发明实施例所述超长上下文建模的大幅面遥感影像语义分割方法的神经[0070]图4为本发明提供的超长上下文建模的大幅面遥感影像语义分割装置的结构示意9于验证。从数据集中可获取遥感影像的RGB数据,由于后面流程中有需要数据预处理的部感受野拓展层(ReceptiveFieldExpansionLayer,RFEL)、特征聚合层(FeatureAggregation,FA)、全局特征指导网络(GlobalFeatureInstitution,GFI)和基于混合专[0081]需要说明的是,SegFormer对于本申请实施例所述的基本网络具有如下特点:第[0089]感受野拓展层RFEL包括空间聚合(SpatialAggregation,SA)层、嵌入层L中指定图块(大小为l×l)中提取的tokens序列表示为其中M是序列长关联就是RFEL层的任务。规定CLS9表示序列中一个l×ltokens对应的注意力头得到的将第一个细粒度的特征提取网络直接称为骨干网络,而将高于x256分辨率的对应[L×L]分辨率大小的图像上的全局特征提取网络称为全局指导网络(GlobalGuidanceNetwork,如ViT_B),所以输入和输出的特征序列[0109]需要说明的是,ViT架构最后一层输出的特征信息不一定是所有层级中信息量最l代表大小为[l×l]图像提取的嵌入[0111]取用四个层级的局部特征,例如ub-SegFormer具有“变深度取用”的结构,因而可以在其中最小的16层网络中分别取用ub-1、b-14这四个层级的局部特征。[0113]本申请实施例所述方法选用SegFormer作为骨干网络需要将解码器中多尺度特征聚合部分更换为特征聚合层FA。而结构上,局部特征会先进入一个两层MLP和激活函数[0115]其中,AF()表示激活函数,wex学和weme为可学习的参数,γ为衰[0118]经过形式重构(Reshape),将的向量重构成的形操作之后的特征形式是通过合适大小的卷积核得到例如p=4的将后一级全局特征指导得到的全局特征和这一级特征聚合层或感受野拓展层得到[0125]本申请实施例使用2.2中表述的三[0126]首先,将RFELl4的局部特征结果分解成将RFEL4096[0129]其中,和wea"为可学习的参数,S"表示l3尺度下全局指导[0135]两层的GFI和RFEL组合是在当前设定下的示例,该结构保证本发明的模型面对更[0142]一个典型的门控函数通常是一个带有softmax函数的简单的网络,这个网络将学[0145]将形式重构后得到那么每一个gg量。而对于专家本身,其为和骨干网络配套的解码器,取决于使用者自身的选择。例如SegFormer在这里对应的专家就是一层简[0154]对于骨干网络,首先采用掩码自监督方法提高其局部特征精度,如MAE(MaskedAutoencoders);然后通过对比学习自监督方法提高其全局特征精度,如DINO(self_[0159](2)利用最后一层RFEL的总全局特征来预测整个图像的地物类别总数,并设置相[0162](5)将利用分层预训练得到的权重进行端到端的训练,其中需要注意的是解码器示门控网络解算的分布与真实类别分布之间的损失,GN的标签,Classification()表示针对类别个数的分类头。所以加上语义分割结果的损失分割结果,decodercu(ip2),decodercz(iiz)…decoderaw(iz)为门控网络遴选出的N个[0172]下面对本发明提供的一种超长上下文建模的大幅面遥感影像语义分割装置进行[0173]图4是本发明实施例提供的超长上下文建模的大幅面遥感影像语义分割装置的结[0180]此外,上述的存储器530中的逻辑指令可以通过软件功能单元的形式实现并作为发明的技术方案本质上或者说对现有技术做出贡

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论