CN119107447B 一种基于语言和图像大模型的多源路面病害识别方法 (河北工业大学)_第1页
CN119107447B 一种基于语言和图像大模型的多源路面病害识别方法 (河北工业大学)_第2页
CN119107447B 一种基于语言和图像大模型的多源路面病害识别方法 (河北工业大学)_第3页
CN119107447B 一种基于语言和图像大模型的多源路面病害识别方法 (河北工业大学)_第4页
CN119107447B 一种基于语言和图像大模型的多源路面病害识别方法 (河北工业大学)_第5页
已阅读5页,还剩23页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

A,2023.09.15A,2024.02.20A,2024.05.03A,2024.05.07一种基于语言和图像大模型的多源路面病本发明为一种基于语言和图像大模型的多于被LLM确定为裂缝横穿整张图像时,则以过图使用视觉语言大模型VLM对路面病害进行目标检SAM进行微调得到适应于道路病害分割任务的模型和分割大模型三者,并对分割大模型SAM进2道路病害图像,令其根据知识语料库进行分类并输出语义丰富包含上下文信息的文本描使用RGB相机或线扫激光或红外相机按照不同的采集方式进行图像采集,并按照采集使用指令对图像中病害进行问询使其完成对病害的描述,病害的描述内容包括病害的类第三部分:使用标注有病害掩码的图像对SAM进行微调得到适应于道路病害分割任务SAM使用掩码自编码器MAE预训练的VIT作为主干网络,并采用基于向量的随机矩阵适主干网络,所述主干网络由多个TransformerBlocks组成,每个TransformerBlocks记为3配器Adapter和第二个归一化层,第二个归一化层的结果经多层感知机的处理后与适配器p在窗口注意力层中增加VeRA模块,对于区块向量获得每的个图像区块patchx∈RHp一个作为支路的VeRA权重矩阵ΔW;ΔW由两个权重随机初始化后冻结的低秩矩阵A和权重原始键值对K和V向量前分别添加可更新的前缀向量PK和前缀向量PV,将由前缀向量PK和前缀向量PV分别与原始键值对K和V组成新的K和V与原始的Q一起SAM的提示编码器使用位置编码技术进行编码嵌入,对提示框的左上角和右下角坐标将图像特征与文本提示特征进行多层的特征融合,融合融合和深层编码交替进行,最后,对最终生成的图像特4键作用。而现有的VLM模型缺乏根据图片自动生成文本提示的能力。与之相对的,LLM(large5[0011]使用RGB相机或线扫激光或红外相机按照不同的采集方式进行图像采集,并按照[0012]根据目录中图像类型分别设置文本指令,将采集到的图像输入到大语言模型LLM[0014]若没有被LLM判定为裂缝横穿整张图像,而整张图像的预测框仍出现多框重叠情[0015]第三部分:使用标注有病害掩码的图像对SAM进行微调得到适应于道路病害分割适配器Adapter和第二个归一化层,第二个归一化层的结果经多层感知机的处理后与适配pp6添加一个作为支路的VeRA权重矩阵ΔW;ΔW由两个权重随机初始化后冻结的低秩矩阵A和和前缀向量PV分别与原始键值对K和V组成新的K和V与原始的Q一起进行[0022]SAM的提示编码器使用位置编码技术进行编码嵌入,对提示框的左上角和右下角[0024]将图像特征与文本提示特征进行多层的特征融合,融合后再进行更深层次的编[0029]本发明将大语言模型应用在道路病害识别上,使用LLM对路面病害图像进行初步[0030]本发明中VLM以大数据的方式学习到图像文本相关性,使它能进行有效的零样本7[0031]本发明通过对分割大模型SAM(segmentanythingmodel)进行微病害图像分割任务中的有效应用。入道路病害图像,令其根据知识库进行分类并输出语义丰富包含上下文信息的文本描述;第二部分为使用图像语言模型GLIP(GroundedLanguage_ImagePre_training)读入原始立一个覆盖各等级公路场景和路面病害术语的[0041]使用RGB相机或线扫激光或红外相机按照不同的采集方式进行图像采集,但不仅[0042]根据目录中图像类型分别设置文本指令,将采集到的图像输入到大语言模型LLM征进行多层的特征融合,融合后再进行更深层次的编码,对文本特征向量是经过Bert8[0045]对于被LLM确定为裂缝横穿整张图像时,则以过图片中心点沿垂直裂缝方向进行边超过图像的70则仍需进行裁剪,此时可过最大框的中心点沿短边方向设置裁剪线进[0048]三、使用标注有病害掩码的图像对SAM进行微调得到适应于道路病害分割任务的[0049]微调SAM的训练集可以使用带标签的公开数据集,也可以使用自行采集并进行标明使用GLIP生成的提示框作为微调输入的一部分,充分发挥SAM作为交互式分割模型的优[0052]本发明的工作原理是:使用爬虫程序或人工收集道路路部分使用跨模态多头注意力模块。分割大模型SAM可以接收提示框,使用VeRA(Vector_9[0056]3.根据目录中图像类型分别设置文本指令,将采集到的图像输入到大语言模型据目录中图像类型分别设置,如为红外图像则文本指令可设置为“Whatdoesthe病害,则还需包括是否横穿整张图像。采用命令“Youare`gpt_4o`,thelatestOpenAImodelthatcaninterpretimagesandcandescribeimagesprovidedbytheusindetail.Theuserhasattachequestion,thereisdefinitelyanimageattached,youwillneverreplysayingthatyoucannotseetheimagebecausetheimageisabsolutelyandalwaysattachedtothismessage.Answerthequestionaskedbytheuserbasedontheimageprovided.Donotgiveanyfurtherexplanation.Donotreplysayingyoucan'tanswerthequprovideddoesnotcontainthenecessarydatatoanswerthequestion,return'进入角色;使用命令“TheoutputmustbeinJSONformat,withthefollowing[0063]–special:ifit'satransversecrackorlongitidunalcrack,describewith'yes'or'no'ifitcrossestheentireimage”来限定GPT4_o的输式;最后输入命令“Youaretaskedwithaccuraandtextfromtheimagesprovided.YouwillfocusonWhatdoesthepavement[0065]向GLIP模型输入原始路面病害图像和步骤3得到的文本提示,对道路病害进行目输入文本提示P到GLIP的文本编码器中得到文本特征FP。使用跨模态多头注意力模块将两[0066]裁剪分割策略不仅对提高GLIP模型的精度有所帮助,还能对SAM的分割起到有益框双次预测)后,SAM能够精准高效地分割出病害的掩码。这个策略的具体实施为:通过框的中心点沿短边方向设置。对于单框的情况,则将其长边与图像对比,若超过图像的[0067]判断是否多框重叠时以当前图像中所有预测框的四个交点围成的坐标范围是否提高SAM在这一领域的适应性,本发明结合了VeRA(Vector_basedRandomp[0070]SAM的图像编码器是使用MAE(MaskedAutoencoder,掩码自编码器)预训练的VIT(VisionTransformer)作为主干网络,它由多个TransformerBlocks组成,每个意力层中增加VeRA模块,因为其在模型中占据较大的参数比例。对于区块向量获得每个p由两个权重随机初始化后冻结和权重共享的小矩阵A和B,以及两个可变的缩放向量b和d在K和V向量前添加可更新的前缀向量PK和PV,PK和PV的维度与K和V的维度相同,训练中更K和PV中元素在0_1范围内取值,将由前缀向量PK和前缀向量PV分别与原始键值对K和V[0073]在SAM的轻量级掩码解码器中,提示框的位置编码在经过掩码解码器的注意力层后,原始的提示编码特征向量还会被重新添加到已经更新了的图像嵌入(包含提示框的位[0074]使用标注有病害掩码的图像对SAM进行训练,这种标注有病害掩码的图像来源于道路病害图像开源数据集或自有病害图像数据集,标注有病害掩码的图像输入到GPT4_o使用Focal损失函数和交叉熵损失函数的加权[0076]L=λLFocal+([0079]Lna=-a(1-)Ntogo)Lce=-ylog(J)-(1-)log(1-)[0085]训练结束后得到针对道路病害的分割模型RoadS

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论