CN120219887A 一种图片数据预处理方法、装置、设备、介质及产品_第1页
CN120219887A 一种图片数据预处理方法、装置、设备、介质及产品_第2页
CN120219887A 一种图片数据预处理方法、装置、设备、介质及产品_第3页
CN120219887A 一种图片数据预处理方法、装置、设备、介质及产品_第4页
CN120219887A 一种图片数据预处理方法、装置、设备、介质及产品_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

(19)国家知识产权局(71)申请人陆泽科技有限公司地址116023辽宁省大连市沙河口区软件园路8-4号B3座三层(72)发明人杨玉麟方金朋刘向东(74)专利代理机构北京高沃律师事务所11569专利代理师万慧华(54)发明名称及产品本申请公开了一种图片数据预处理方法、装根据目标检测模型的任务目标获取对应的图片数据集;按照待检测的目标种类对图片数据集中的各类图片数据进行分类和筛选,得到目标种类数据集;对目标种类数据集中各个目标种类的图片数据进行数据均衡处理,得到均衡后数据集;对均衡后数据集中的每张图片数据进行特征维度优化处理,得到优化后的特征向量并存入向量数据库,供目标检测模型训练使用。本申请将图片数据直接以特征向量的形式存储于向量数据库中,在用于模型训练时,不仅能避免重复的操作流程,还能降低模型训练的时间复杂度和空间11根据目标检测模型的任务目标获取对应的图片数据集45将优化后的特征向量存入向量数据库,供目标检测模型训练使用321.一种图片数据预处理方法,其特征在于,包括:根据目标检测模型的任务目标获取对应的图片数据集;所述目标检测模型的任务目标包括人物对象检测、动物对象检测、车辆对象检测、病灶区域检测、障碍物检测、产品缺陷检测、异常物品检测和病虫害区域检测;对应的图片数据集包括人物图片数据集、动物图片数据集、车辆图片数据集、病灶图片数据集、障碍物图片数据集、产品图片数据集、物品图片数据集和农作物图片数据集;按照待检测的目标种类对图片数据集中的各类图片数据进行分类和筛选,得到目标种类数据集;对目标种类数据集中各个目标种类的图片数据进行数据均衡处理,得到均衡后数据对均衡后数据集中的每张图片数据进行特征维度优化处理,得到优化后的特征向量;将优化后的特征向量存入向量数据库,供目标检测模型训练使用。2.根据权利要求1所述的图片数据预处理方法,其特征在于,所述按照待检测的目标种类对图片数据集中的各类图片数据进行分类和筛选,得到目标种类数据集,具体包括:通过CLIP模型计算图片数据集中的每张图片数据与每个目标种类的相似度,保留相似度大于相似度阈值的图片数据,构成目标种类数据集。3.根据权利要求2所述的图片数据预处理方法,其特征在于,所述对目标种类数据集中各个目标种类的图片数据进行数据均衡处理,得到均衡后数据集,具体包括:判断目标种类数据集中各个目标种类的图片数据中,任意两个目标种类之间的图片数据比例是否均衡;若比例均衡,则将每个目标种类的图片数据进行数据压缩,压缩至同一分类数量Nmax;其中Nmax为数据压缩后占比最大的目标种类所包含的图片数量;若比例不均衡,则对占比较小的目标种类的图片数据进行数据增强,对占比较大的目标种类的图片数据进行数据压缩,将各个目标种类的图片数据增强或压缩至同一分类数量Nmax。4.根据权利要求3所述的图片数据预处理方法,其特征在于,所述对均衡后数据集中的每张图片数据进行特征维度优化处理,得到优化后的特征向量,具体包括:对均衡后数据集中的每张图片数据进行分块处理,将每张图片数据分割成M行×N列的多个图片块;M和N均为大于1的整数;对每个图片块进行块级分类,将包含目标对象的图片块标记为1,将不包含目标对象的图片块标记为0,得到带标签的图片块;基于每个图片块所带标签,对每张图片数据分割成的多个图片块进行筛选和重组,得到优化后的特征向量。5.根据权利要求4所述的图片数据预处理方法,其特征在于,所述基于每个图片块所带标签,对每张图片数据分割成的多个图片块进行筛选和重组,得到优化后的特征向量,具体包括:遍历每张图片数据分割成的M行×N列的多个图片块,以每一行为单位,将标签为1的图片块保留,将标签为0的图片块丢弃;将所有标签为1的图片块重组为1×X维度的特征矩阵,每一行图片块重组成功后添加3序列起始位置标记[b],最后一行图片块重组结束后添加序列结束位置标记[e],得到优化后的特征向量;其中X为每张图片数据中标签为1的图片块数量。6.根据权利要求5所述的图片数据预处理方法,其特征在于,所述将优化后的特征向量将优化后的特征向量作为特征数据集,存入向量数据库中;进行目标检测模型训练时,将特征数据集划分为训练集、验证集和测试集,用于对目标图片数据集获取模块,用于根据目标检测模型的任务目标获取对应的图片数据集;所述目标检测模型的任务目标包括人物对象检测、动物对象检测、车辆对象检测、病灶区域检测、障碍物检测、产品缺陷检测、异常物品检测和病虫害区域检测;对应的图片数据集包括产品图片数据集、物品图片数据集和农作物图片数据集;图片分类筛选模块,用于按照待检测的目标种类对图片数据集中的各类图片数据进行数据均衡处理模块,用于对目标种类数据集中各个目标种类的图片数据进行数据均衡特征维度优化模块,用于对均衡后数据集中的每张图片数据进行特征维度优化处理,得到优化后的特征向量;特征向量存储模块,用于将优化后的特征向量存入向量数据库,供目标检测模型训练使用。8.一种计算机设备,包括:存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序以实现权利要求1至6中任一项所述的图片数据预处理方法。9.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该计算机程序被处理器执行时实现权利要求1至6中任一项所述的图片数据预处理方法。10.一种计算机程序产品,包括计算机程序,其特征在于,该计算机程序被处理器执行时实现权利要求1至6中任一项所述的图片数据预处理方法。4一种图片数据预处理方法、装置、设备、介质及产品技术领域[0001]本申请涉及人工智能中的图像处理技术领域,特别是涉及一种图片数据预处理方背景技术[0002]在进行图片中目标对象的检测和识别时,图像本身质量的好坏和数据量的大小会直接影响到后续模型架构的设计、损失函数的选择、优化算法的实现以及识别效果的精度等等。因此在进行检测或识别操作之前,需要对图片进行恰当的预处理操作。图片预处理主要是为了能够消除掉图片中的一些噪点信息,增强有效信息的可读性,能够更大限度地优化数据信息,为后续图片中目标对象的检测提供优质条件。现有数据预处理技术一般都是检查数据中的异常,根据业务需求进行数据去噪,去除无用信息或者非法信息,然后把图文数据(文字数据为图片数据的标签)全部交给模型进行训练。新的业务需求出现后,开发人员需要根据新的业务逻辑再进行数据预处理,再把图文数据作为输入进行模型训练,模型内部进行向量化把图文数据变为特征向量数据。这样的流程增加了数据预处理的时间成本。并且大量的图文数据中包含着与业务需求无关的数据,这些无关的数据,会进一步增加模型的训练成本和空间复杂度。在调整模型的算法或者想进行算法参数调整的时候,这一预处理过程又会重复。发明内容[0003]本申请的目的是提供一种图片数据预处理方法、装置、设备、介质及产品,将图片数据直接以特征向量的形式存储于向量数据库中,在用于模型训练时,不仅能避免重复的操作流程,还能降低模型训练的时间复杂度和空间复杂度,减少同等条件下模型训练和调参过程中需要的硬件资源。[0004]为实现上述目的,本申请提供了如下方案。根据目标检测模型的任务目标获取对应的图片数据集;所述目标检测模型的任务陷检测、异常物品检测和病虫害区域检测;对应的图片数据集包括人物图片数据集、动物图片数据集和农作物图片数据集;按照待检测的目标种类对图片数据集中的各类图片数据进行分类和筛选,得到目标种类数据集;对目标种类数据集中各个目标种类的图片数据进行数据均衡处理,得到均衡后数对均衡后数据集中的每张图片数据进行特征维度优化处理,得到优化后的特征向5将优化后的特征向量存入向量数据库,供目标检测模型训练使用。[0006]可选地,所述按照待检测的目标种类对图片数据集中的各类图片数据进行分类和通过CLIP模型计算图片数据集中的每张图片数据与每个目标种类的相似度,保留相似度大于相似度阈值的图片数据,构成目标种类数据集。[0007]可选地,所述对目标种类数据集中各个目标种类的图片数据进行数据均衡处理,判断目标种类数据集中各个目标种类的图片数据中,任意两个目标种类之间的图片数据比例是否均衡;若比例均衡,则将每个目标种类的图片数据进行数据压缩,压缩至同一分类数量Nmax;其中Nmax为数据压缩后占比最大的目标种类所包含的图片数量;若比例不均衡,则对占比较小的目标种类的图片数据进行数据增强,对占比较大的目标种类的图片数据进行数据压缩,将各个目标种类的图片数据增强或压缩至同一分类[0008]可选地,所述对均衡后数据集中的每张图片数据进行特征维度优化处理,得到优对均衡后数据集中的每张图片数据进行分块处理,将每张图片数据分割成M行×N列的多个图片块;M和N均为大于1的整数;对每个图片块进行块级分类,将包含目标对象的图片块标记为1,将不包含目标对象的图片块标记为0,得到带标签的图片块;基于每个图片块所带标签,对每张图片数据分割成的多个图片块进行筛选和重[0009]可选地,所述基于每个图片块所带标签,对每张图片数据分割成的多个图片块进遍历每张图片数据分割成的M行×N列的多个图片块,以每一行为单位,将标签为1的图片块保留,将标签为0的图片块丢弃;将所有标签为1的图片块重组为1×X维度的特征矩阵,每一行图片块重组成功后添加序列起始位置标记[b],最后一行图片块重组结束后添加序列结束位置标记[e],得到优化后的特征向量;其中X为每张图片数据中标签为1的图片块数量。[0010]可选地,所述将优化后的特征向量存入向量数据库,供目标检测模型训练使用,具将优化后的特征向量作为特征数据集,存入向量数据库中;进行目标检测模型训练时,将特征数据集划分为训练集、验证集和测试集,用于对图片数据集获取模块,用于根据目标检测模型的任务目标获取对应的图片数据集;所述目标检测模型的任务目标包括人物对象检测、动物对象检测、车辆对象检测、病灶区域检测、障碍物检测、产品缺陷检测、异常物品检测和病虫害区域检测;对应的图片数据集包括人物图片数据集、动物图片数据集、车辆图片数据集、病灶图片数据集、障碍物图片6数据集、产品图片数据集、物品图片数据集和农作物图片数据集;图片分类筛选模块,用于按照待检测的目标种类对图片数据集中的各类图片数据进行分类和筛选,得到目标种类数据集;数据均衡处理模块,用于对目标种类数据集中各个目标种类的图片数据进行数据特征维度优化模块,用于对均衡后数据集中的每张图片数据进行特征维度优化处特征向量存储模块,用于将优化后的特征向量存入向量数据库,供目标检测模型训练使用。[0012]第三方面,本申请提供了一种计算机设备,包括:存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述计算机程序以实现所述图片数据预处理方法。[0013]第四方面,本申请提供了一种计算机可读存储介质,其上存储有算机程序被处理器执行时实现所述图片数据预处理方法。[0014]第五方面,本申请提供了一种计算机程序产品,包括计算机程序,该计算机程序被处理器执行时实现所述图片数据预处理方法。[0015]根据本申请提供的具体实施例,本申请公开了以下技术效果。标检测模型的任务目标和待检测的目标种类自动筛选目标种类数据集并均衡种类占比,另一方面进行了图片数据的特征维度优化处理,实现了特征降维。使用本申请方法预处理后的图片数据,直接以特征向量的形式存储于向量数据库中,这样在用于目标检测模型训练时,不仅避免了重复的操作流程,又降低了模型的时间复杂度以及空间复杂度,降低了同等条件下模型的训练时间,减少了训练、调参过程中需要的硬件资源,从而有效减少了模型训练成本。附图说明[0017]为了更清楚地说明本申请实施例或现有技术中的技术方案,下面将对实施例中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本申请的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动的前提下,还可以根据这些附图获得其他的附图。[0018]图1为本申请一种图片数据预处理方法的流程示意图;图2为本申请实施例中老虎的原始图片示意图;图3为本申请实施例中对原始图片进行分块处理的示意图;图4为本申请实施例中对图片块进行块级分类的示意图;图5为本申请实施例中对图片块进行筛选和重组的示意图。具体实施方式[0019]下面将结合本申请实施例中的附图,对本申请实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅仅是本申请一部分实施例,而不是全部的实施例。基于7本申请中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他的数据预处理策略,将图片数据直接以特征向量的形式存储于向量数据库中,在用于模型训练时,不仅能避免重复的操作流程,还能降低模型训练的时间复杂度和空间复杂度,减少同等条件下模型训练和调参过程中需要的硬件资源。[0021]为使本申请的上述目的、特征和优点能够更加明显易懂,下面结合附图和具体实施方式对本申请作进一步详细的说明。[0022]在一个示例性的实施例中,如图1所示,提供了一种图片数据预处理方法,包括以下步骤1至步骤5。[0023]步骤1:根据目标检测模型的任务目标获取对应的图片数据集。[0024]目标检测是计算机视觉中的一个核心任务,旨在识别和定位图像(或称图片)中的目标对象,并为每个检测到的目标对象生成边界框和类别标签。目标检测技术广泛应用于人等目标,实现交通拥堵预测和智能驾驶。例如,在智能零售领域,用于货架商品检测和顾客行为分析,提升零售效率和顾客体验。又例如,在医疗影像分析领域,辅助医生进行病灶[0025]因此,本申请所述目标检测模型的任务目标可以为人物对象检测、动物对象检测、车辆对象检测、病灶区域检测、障碍物检测、产品缺陷检测、异常物品检测和病虫害区域检测等。对应获取的图片数据集则应该为人物图片数据集、动物图片数据集、车辆图片数据集、病灶图片数据集、障碍物图片数据集、产品图片数据集、物品图片数据集或农作物图片数据集。[0026]步骤2:按照待检测的目标种类对图片数据集中的各类图片数据进行分类和筛选,得到目标种类数据集。[0027]待检测的目标种类与目标检测模型的任务目标是对应的,后续为描述方便,可以将目标检测模型简称为模型,种类一词也称为类别。例如,对于病灶区域检测,待检测的目标种类可以为肿瘤、结节等病灶区域和正常组织区域。例如,对于障碍物检测,待检测的目标种类可以为车辆前方道路上的行人、其他车辆和各种物体。例如,对于产品缺陷检测,待测,待检测的目标种类可以为遗留包裹、危险物品等可疑物体。对于病虫害区域检测,待检测的目标种类可以为病虫害类型和受病虫害侵蚀的作物区域等。[0028]初步获取的图片数据集中包含各类图片数据,图片数据也可以简称为图片。步骤2的目的就是通过一种自动化方法提取出符合模型任务目标的图片,来构成目标种类数据集。[0029]CLIP(ContrastiveLanguage-ImagePretraining,对比语言-图像预训练)模型是由OpenAI在2021年提出的一种多模态机器学习模型。CLIP模型的核心思想是,通过大规模图像-文本对训练,将图像和文本映射到同一语义空间,实现跨模态理解。CLIP模型的训练数据是4亿对互联网公开的(图像,文本)数据。CLIP模型具备以下能力:零样本(Zero-8无需训练数据:直接支持零样本分类;2)动态调整类别:随时修改候选类别文本,无需重新训练;3)跨领域泛化:适用于开放域场景,训练时接触过海量开放域数据,能理解广泛的主[0030]CLIP模型的输入包括图像输入和文本输入。其中,图像输入是指单张图片,如RGB图像。其预处理过程需将图像调整大小至固定分辨率(如224×224),归一化像素值。使用VisionTransformer(ViT)或ResNet编码器提取图像特征。文本输入是指自然语言描述的类别或句子,例如“一只狗的图片”。其预处理过程需要通过分词器(Tokenize为词元(Token)序列。使用Transformer编码器提取文本特征。CLIP模型的输出为所输入图像和文本的相似度分数。CLIP模型通过计算图像特征与文本特征的余弦相似度(范围:实数,无固定上下界),并通过Softmax归一化后,得到每个文本描述与图像的匹配度,即相似度。[0031]因此,本申请在计算图片数据集中的每张图片数据与每个目标种类的相似度时,只需输入任意候选类别文本(如裂纹、划痕、气泡、斑点等目标种类)和图片数据集中的任意一张图片数据,CLIP模型即可计算每张图片数据与每个目标种类文本的相似度。进一步地,保留相似度大于相似度阈值的图片数据,构成目标种类数据集。其中相似度阈值的范围在0-1之间,越靠近1则是目标类别的可能性越大,阈值可根据实际情况设置。例如,将相似度阈值设置为0.75。[0032]下面采用一个具体示例进行举例说明。例如,在一个示例性的实施例中,目标检测模型的任务目标是进行动物对象检测,所获取的对应图片数据集中包括狮子、老虎、大象、狮子、老虎和猎豹,则确定目标种类为狮子、老虎和猎豹。那么步骤2的目的就是要将图片数据集中的每一张图片分类到狮子、老虎、猎豹中的某一类。那么具体的分类和筛选过程就包的图片”),并编码为对应的文本特征向量;2)图像编码:将待分类的图片编码为图像特征向量;3)相似度计算:图像特征向量分别与三个文本特征向量计算余弦相似度;4)概率归一化:通过Softmax得到相似度概率分布,选择概率最高的类别作为图片标签。计算每张图片与给定的3类标签(狮子、老虎、猎豹)的相似度,保留相似度>0.75的图片样本,其余标记为“Other(其他)”。最终在目标种类数据集中给出是狮子、老虎和猎豹这三种动物的图片,每一张图片会有三种动物中至少一种动物的标签信息。[0033]步骤3:对目标种类数据集中各个目标种类的图片数据进行数据均衡处理,得到均衡后数据集。[0034]在步骤2得到的目标种类数据集中,包含多个目标种类的图片。在模型训练中,训练数据中每个种类的比例越均衡,模型的训练效果越好,如果每个种类的比例悬殊,那么训练后的模型可能会偏科:对于整体占比更大的图片,模型的训练效果会远远好于占比较小的图片。所以在这一步会判断以上具体示例中,狮子、老虎和猎豹这三种图片的数据比例是否均衡。例如在包含以上3个目标种类的图片中各类数据任二者之间比例为1:1,即3个目标种类的图片数量的比例为1:1:1,则代表数据非常均衡。所述步骤3具体包括以下步骤3.1至9得到。CLIP模型将输入图像转换为固定维度的高维向量,例如CLIP-ViT的输出为512维或文本编码器映射为与图像特征同维度(如512维)的向量。文本特征向量编码了标签的语义强制||Vimagell=|Vtextll=1。因此在推理阶段,编码后的特征向量已自动满足归一化量Vtext=[0.3,-0.4,………,0.6]。S=0.2*0.3+(-0.5)*(-0.4)+……+0.7*0.6=0.85。那么当[0043]当然,所计算相似度的数值无论是多少,都与在[0.84,0.85]区间内的数据压缩似度在[0.86,0.96]的区间内,那么数据压缩时小区间的跨度设置为0.005,即在小区间之小,那么数据压缩时小区间的跨度设置为0.001,即在小区间之一的[0.87,0.871]区间范[0050]将图片切分成块,是为了后续识别每一个图片块中是否包含要识别的目标对象。11位置编码是为了保留原始图片切分成的图片块之间的空间信息。原始图片经过分割后,整体维度为M×N;M和N均为大于1的整数。图片的原始维度是高乘以宽,为了表达方便,用h代表高,w代表宽,即:h×w。此处分割后的图片块的像素大小可以根据实际情况调整,例如取16×16像素。[0051]下面采用一个具体示例进行说明。对于图2所示的“老虎”类别图片,使用ViT将原始图片分割为固定尺寸(如16×16像素)的图片块。如图3所示,将图片分割成了4行×3列共12个图片块。图2中老虎图片的原始整体维度为(4×16)×(3×16)。经过分割,图3的整体维度为M×N=4×3。[0052]进一步地,可以将每个图片块展平为向量。假设原始图片尺寸为256×256像素,且为RGB三通道图像,则其实际形状为3×256×256块的实际形状为3×16×16。图片块的展平操作是指,将每个16×16大小的图片块视为一个独立的小图像,将图片块的R/G/B这3个通道的16×16像素值按顺序排列成一个一维向量,则每个图片块的向量长度为3×16×16=768。[0053]假设对于一个16×16的三通道图片块,实现代码示例如下:block=torch.randn(3,16,16)#形状[3,16,16]block代表图片块。block.flatten()是指图片块的展平操作。flattened_block是指展平后的向量。[0054]进一步地,将展平后的768维向量映射到ViT所需的统一维度(如512维),实现方式如下。使用一个可学习的全连接层(线性层),权重矩阵形状为768×512.将每个展平后的向量(768维)与该矩阵相乘,输出512维的嵌入向量。此过程称为“线性投素信息进行特征压缩和抽象。实现代码示例如下:linear_layer=torch.nn.Linear(768,512)#定义线性层其中,torch.nn.Linear()是PyTorch中的一个非常重要的模块,用于实现全连接层(也称为线性层)。全连接层是神经网络中的一种常见层类型,用于将输入数据转换为输得到的嵌入向量。[0055]进一步地,为嵌入向量添加位置编码以保留空间信息。相关方法的实现代码已经内置于Transformer库中,调用相关函数的代码即可实现。[0056]步骤4.2:对每个图片块进行块级分类,将包含目标对象的图片块标记为1,将不包含目标对象的图片块标记为0,得到带标签的图片块。[0057]本申请通过微调ViT结构进行每个图片块的块级分类。具体地,是在ViT的Transformer编码器后,为每个块的输出嵌入添加分类头(全连接层+Softmax)来实现。[0058]ViT的主要模块包括:图像分块与嵌入(PatchEmbedding)、位置编码(PositionalEncoding)、Transformer编码器(多个层)以及分类头(通常是一个全连接层)。本申请在ViT的Transformer编码器后,为每个块的输出嵌入添加分类头(全连接层+Softmax),其中全连接层的作用是将Transformer输出的每个块的高维嵌入映射到类别空间(如二维空间,对应0和1)。Softmax则将线性输出转换为概率分布,表示每个块属于各个类别的概率。全连接层的输入是每个块的嵌入向量(embedding_dim,如512维),输出是类别数的维度(如0和1,二[0059]将每个图片块输入改进后的ViT结构,经过块级分类,把包含目标对象的图片块标[0060]步骤4.3:基于每个图片块所带标签,对每张图片数据分割成的多个图片块进行筛签为“1”的图片块重组为1×X维度的一维特征矩阵,并且在每一行图片块重组成功后添加序列起始位置标记[b],最后一行图片块重组结束后添加序列结束位置标记[e],从而得到优化后的特征向量,也就是得到目标块和标记[b]、[e]构成的序列。其中X为每张图片数据ending(结束),用于指示序列的结束位置。[0062]如图4和图5所示,老虎的图片在分块识别后,第一行、第二行的图片块都包含老虎的一部分信息,因此被标记为1,则在重组时保留这两行,重组时在第一行图片块的结尾后加[b],然后再加上第二行图片块,在第二行图片块的结尾后加[b]。第三行的第一个图片块不包含老虎的任何一部分信息,因此被标记为0,丢弃这个标签为0的图片块,前面的[b]加上第三行中剩下的被标记为1的两个图片块和一个[b]。第四行的第一个图片块也不包含老虎的任何一部分信息,因此被标记为0,丢弃这个为0的图片块,前面的[b]加上第四行中剩下的标记为1的两个图片块和一个[e],因为这里是图片的最后一个图片块,序列结束。[0063]步骤5:将优化后的特征向量存入向量数据库,供目标检测模型训练使用。[0064]图片数据在经过步骤4的特征维度优化后,此时是以特征向量的形式表示,图片特征向量可以直接用于模型训练。将优化后的特征向量作为特征数据集,存入向量数据库Milvus中。具体地,在向量数据库Milvus中创建一个集合,用于存储步骤4特征维度优化后段可根据需求自行添加。在模型训练时可以直接从Milvus中获取图片的特征向量数据用于训练。[0065]Milvus是一个高性能、可扩展的向量数据库,适用于大规模AI应用,尤其适用于NLP(NaturalLanguageProcessing,自然语言处理)、计算机视觉、推荐系统等场景。Milvus兼容PyTorch、TensorFlow、HuggingFace,易于集成到AI生态系统中。支持分布式部署,适合云端应用,可以利用Kubernetes进行管理。Milvus作为一个高性能的向量数据库,能够高效地存储和检索大规模的图像特征向量,支持快速的相似性搜索。从Milvus中检索到的图像特征向量可以直接用于模型训练,提高训练效率和模型性能。[0066]后续进行目标检测模型的训练时,直接从Milvus中调用对应的特征数据集,并将特征数据集划分为训练集、验证集和测试集,用于对目标检测模型进行训练、验证和测试。其中,训练集(TrainingSet)用于训练模型,调整模型参数以最小化损失函数。验证集最终评估模型的泛化能力,通常在模型训练完成后使用。[0067]本申请的目标检测模型可以为卷积神经网络(CNN)模型、循环神经网络(RNN)模型和Transformer模型等深度学习模型。其中,卷积神经网络模型用于图像处理。循环神经网络模型用于序列数据(如时间序列、文本)处理。Transformer模型用于自然语言处理和多模Batch_size为批次大小,是指在训练机器学习或深度学习模型时,每次迭代(或称为“步”)块添加的位置信息,如[b]和[e]标记的位置。[b]和[e]作为分隔符,帮助模型识别序列边[0068]目标检测模型的任务需求决定了模型的输出形式。例如,输出为序列到序列(Seq2Seq):输出与输入等长的序列,如机器翻译。序列到标签(Seq2Label):输出单个分类预测目标类别(分类任务)→输出[Batch_size,num_classes]。num_classes表示目标种类;生成目标位置(检测任务)→输出[Batch_size,X,4],4为边界框坐标数量。[0071]训练好的目标检测模型可以用于实现以下功能特定目标的位置。图像描述生成:根据目标块序列生成自然语言描述。图像修复:基于保留的目标块重建完整图像。图文检索:匹配图片块序列与文本描述。[0072]下面列举目标检测模型的几种常见应用场景。[0073]应用场景一、医学影像分析:肿瘤区域定位。其任务目标是在CT/MRI图像中快速定位肿瘤区域,辅助医生诊断。所训练目标检测模型的输入为采用本申请方法预处理后的医学图片块序列,仅保留被分类为“肿瘤”的目标块(简称块),如保存为[b,块1,块2,...,块X,e]的形式,每个块包含局部组织特征。所训练目标检测模型的输出为肿瘤位置的热力图(标记所有分类为“1”的图片块在原始图片中的坐标)或概率分布图。模型输出的肿瘤位置热力图或概率分布图可用于辅助诊断,减少医生阅片时间,提高早期癌症筛查效率。[0074]应用场景二、自动驾驶:道路障碍物实时检测。其任务目标是识别车辆前方道路上的行人、车辆、物品等障碍物。车载摄像头捕捉的图像或视频流经由本申请方法预处理后,生成对应的特征向量,即目标块序列。所训练目标检测模型的输入为图片块序列,仅保留包含障碍物的目标块,如保存为[b,块A,块B,...,块X,e]的形式。所训练目标检测模型的输出为障碍物边界框坐标(基于图片块位置重构)及类别(如行人、车辆、物品)。基于训练好的目标检测模型进行道路障碍物实时检测,能够有效提升自动驾驶系统的实时反应能[0075]应用场景三、工业质检:产品缺陷检测。任务目标为检测生产线上的产品表面缺处理后,生成对应的目标块序列。所训练目标检测模型的输入为产品的图片块序列,仅保留缺陷块,如保存为[b,缺陷块1,...,缺陷块X,e]的形式。所训练目标检测模型的输出为缺陷类型分类(如裂纹=1,划痕=2,气泡=3,斑点=4)及缺陷位置标记。基于训练好的目标检测模型进行产品表面缺陷检测,能够替代人工质检,提升检测效率和一致性。[0076]应用场景四、安防监控:异常物体识别。任务目标为在监控视频中识别可疑物体,如遗留包裹、危险物品等。所训练目标检测模型的输入为采用本申请方法预处理后的视频帧分块后的目标块序列,仅保留异常块,如保存为[b,异常块1,...,异常块X,e]的形训练好的目标检测模型进行异常物体识别,能够增强公共场合安全性,减少人工监控成本。[0077]应用场景五、农业监测:病虫害区域识别。任务目标为通过无人机拍摄的农田图像,定位受病虫害侵蚀的作物区域。所训练目标检测模型的输入为采用本申请方法预处理后的农田图片块序列,仅保留存在病虫害的目标块,称为病块,如保存为[b,病块1,...,病块X,e]的形式。所训练目标检测模型的输出为病虫害严重程度分级(如轻度/重度)及分布热力图。基于训练好的目标检测模型进行病虫害区域识别,能够辅助精准施药,减少农药[0078]本申请图片数据预处理方法的关键点在于,一方面根据任务目标及其目标种类自动筛选图片数据并均衡种类占比,另一方面进行了图片数据特征降维。图片数据预处理阶段的特征工程把图片数据处理为总体维度更低的特征向量数据,这样在模型训练阶段需要的硬件资源更少,即空间复杂度降低,同样的模型以及参数条件下训练的时间复杂度也更低,同时处理后的特征向量数据可以供其他算法构成的模型复用,减少资源消耗和开发维护成本,提高了资源利用效率和模型开发的效率。其中,时间复杂度(TimeComplexity)是指算法运行时间随输入规模增长的速率,通常用大0的符号表示,如0(n)、0(n²)等。空间复杂度(SpaceComplexity)是指算法运行过程中占用的存储空间大小,也用大0符号表示。[0079]为了验证本申请效果,使用本申请方法得到的特征向量来训练Transformer模型,本申请在目标检测任务的时间复杂度与空间复杂度上的优势,可通过以下数学推导与对比分析进行论证。依据本申请方法,每张图片处理后的特征向量维度为1×X,其中X因图片中目标块的数量不同而变化。虽然传统神经网络(如全连接网络、CNN)通常要求输入尺寸固定,但Transformer的设计天然支持变长序列输入。Transformer的核心是自注意计算过程不依赖序列长度,因此可以处理任意长度的输入序列。[0080]首先,Transformer的计算复杂度主要来源于自注意力机制,其时间复杂度与空间复杂度均与输入序列长度n的平方成正比。时间复杂度表示为0(n²d),d为特征维度。空间复杂度表示为0(n²),通过注意力矩阵存储。下面进行传统方法与本申请方法的输入序列长度对比。[0081]传统方法采用原始像素输入。假设原始图片尺寸为h×w,输入序列长度n₁=h×w。[0082]而对于本申请方法,在分块阶段,将图像分割为p×p像素的图片块,块数量为(h/p)×(w/p)。例如,p=16,则块数量=(224/16)×(224/16)=14×14=196。块分类与重组阶段,仅保留了标记为“1”的目标块,假设保留k个目标块(k<分块总数)区域占10%,则k≈196×10%=19.6≈20。序列构造阶段,添加特殊标记[b]和[e],最终序列长度n₂=k+m,m为特殊标记数。由于特殊标记处理所需的时间和空间复杂度与目标块相[0086]则加速比:T₁/T₂≈1.93×10¹²/3.07×10⁵≈6.28×10⁶倍。2=400个存储单元。<h×w),使Transformer模型的时间复杂度与空间复杂度均降低至传统方法的1/α²×(p²/(h×w))²,在典型参数下可实现百万倍

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论