CN116468725B 基于预训练模型的工业缺陷检测方法、装置及存储介质 (北京航空航天大学杭州创新研究院)_第1页
CN116468725B 基于预训练模型的工业缺陷检测方法、装置及存储介质 (北京航空航天大学杭州创新研究院)_第2页
CN116468725B 基于预训练模型的工业缺陷检测方法、装置及存储介质 (北京航空航天大学杭州创新研究院)_第3页
CN116468725B 基于预训练模型的工业缺陷检测方法、装置及存储介质 (北京航空航天大学杭州创新研究院)_第4页
CN116468725B 基于预训练模型的工业缺陷检测方法、装置及存储介质 (北京航空航天大学杭州创新研究院)_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

院US2023162481A1,2023.05.25WO2022100366A1,2022.05.19US2022350965A1,2022.11.03本发明涉及基于预训练模型的工业缺陷检的语言文本一并输入到预训练的视觉语言模型2获取工业缺陷检测图像数据集,通过工业缺陷检测图像数据集来训练视觉语言模型,所述通过工业缺陷检测图像数据集来训练视觉语言模型对所述工业缺陷检测图像数据集中的每一张图像的缺陷类型以及位将每张含有工业缺陷的图像和对应的语言文本作为一组通过图像编码器获得含有工业缺陷的图像的图像特征将所述融合特征向量输入到所述待训练的视觉语言模型的分类将所述融合特征向量输入到所述待训练的视觉语言模将待检测图像和目标缺陷所对应的语言文本输入到所述预训练的视觉语言模型结合所述待检测图像以及目所述预训练的视觉语言模型结合所述待检测图像以及目所述预训练的视觉语言模型通过图像编码器对所述待检所述预训练的视觉语言模型将所述融合特征向量输入到多层感3所述预训练的视觉语言模型通过图像编码器对所述待检将所述待检测图像划分为固定大小的图像块,将所述固将所述图像块序列输入到位置编码器中,所述位置编将所述位置特征向量输入到所述预训练的视觉语言模型的图像通过WordPiece嵌入器对语言文本中的单词进行分割,将切割后的单词映射到一个固所述文本编码器通过多层双向编码器捕获输入张量的将所述图像特征向量以及文本特征向量输入到所述预训练的视觉语言模型的跨模态多头注意力模块中,所述跨模态多头注意力模块分别输出融合了文本信息的图像特征向视觉语言模型训练模块:用于获取工业缺陷检测图像数所述通过工业缺陷检测图像数据集来训练视觉语言模型对所述工业缺陷检测图像数据集中的每一张图像的缺陷类型以及位将每张含有工业缺陷的图像和对应的语言文本作为一组4通过图像编码器获得含有工业缺陷的图像的图像特征将所述融合特征向量输入到所述待训练的视觉语言模型的分类将所述融合特征向量输入到所述待训练的视觉语言模语言文本生成模块:用于针对每种场景下的每种工业缺输入模块:用于将待检测图像和目标缺陷所对应的语言文控器执行时,实现如权利要求1_6任一项所述的基于预训练模型的工业缺陷检测方法中的5[0007]将待检测图像和目标缺陷所对应的语言文本输入到所述预训练的视觉语言模型[0012]所述预训练的视觉语言模型通过文本编码器对所述目标缺陷的语言文本进行编[0013]所述预训练的视觉语言模型将所述图像特征向量以及所述文本特征向量进行融6[0022]对所述工业缺陷检测图像数据集中的每一张图像的缺陷类型以输出预测的检测框位置,将所述预测的检测框位置与预先标注的缺陷位置进行损失计算,[0035]所述预训练的视觉语言模型通过文本编码器对所述目标缺陷的语言文本进行编[0036]通过WordPiece嵌入器对语言文本中的单词进行分割,将切割后的单词映射到一7[0040]所述预训练的视觉语言模型将所述图像特征向量以及所述文本特征向量进行融[0041]将所述图像特征向量以及文本特征向量输入到所述预训练的视觉语言模型的跨[0042]将所述融合了文本信息的图像特征向量乘以所述融合了图像特征的文本特征向8[0053]图1是根据一示例性实施例示出的基于预训练模型的工业缺陷检测方法的流程示[0055]图3是根据一示例性实施例示出的基于预训练模型的工业缺陷检测装置的系统示[0059]图1是根据一示例性实施例示出的基于预训练模型的工业缺陷检测方法的流程示[0063]S4,所述预训练的视觉语言模型结合所述待检测图像以及目标9[0067]S401,所述预训练的视觉语言模型通过图像编码器对所述待检输入到所述预训练的视觉语言模型后,模型会将输入的图片通过一个图像编码器进行编高效的神经网络架构搜索方法,它可以在一次搜索中生成适用于多个设备和任务的模型,OFA模型结构包括两个部分:共享骨干网络和可调整的微调层,共享骨干网络是一个通用[0081]对所述工业缺陷检测图像数据集中的每一张图像的缺陷类型以输出预测的检测框位置,将所述预测的检测框位置与预先标注的缺陷位置进行损失计算,作为一组,分别输入图像编码器和文本编码器中,图像编码器我们可以采用ViT或者[0099]所述预训练的视觉语言模型通过文本编码器对所述目标缺陷的语言文本进行编[0100]通过WordPiece嵌入器对语言文本中的单词进行分割,将切割后的单词映射到一由多头自注意力机制和前馈神经网络组成,这些编码器可以捕获单词之间的上下文信息,[0105]所述预训练的视觉语言模型将所述图像特征向量以及所述文本特征向量进行融[0106]将所述图像特征向量以及文本特征向量输入到所述预训练的视觉语言模型的跨[0107]将所述融合了文本信息的图像特征向量乘以所述融合了图像特征的文本特征向[0110]图3是根据一示例性实施例示出的基于预训练模型的工业缺陷检测装置的系统示[0113]输入模块3:用于将待检测图像和目标缺陷所对应的语言文本输入到所述预训练[0114]目标缺陷检测模块4:用于通过所述预训练的视觉语言模型结合所述待检测图像[0115]可以理解的是,本申请通过视觉语言模型训练模块1用于获取工业缺陷检测图像通过语言文本生成模块2用于针对每种场景下的每种工业缺陷设置语言文本,所述语言文本用于描述该工业缺陷的特征;通过输入模块3用于将待检测图像和目标缺陷所对应的语言文本输入到所述预训练的视觉语言模型中;通过目标缺陷检测模块4用于通过所述预训图像以及目标缺陷的语言文本,通过在待检测图像上寻找与语言文本相关联的物体区域,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论