版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
PAGEPAGEI基于深度学习的中药材分类识别系统的设计与实现摘要中药材是中华民族的瑰宝,在疾病防治和健康维护方面具有关键作用,但是由于种类繁多,传统的人工鉴别方法效率较低且容易受到人为因素干预,很难满足现代中医药行业的需求,为了提升传统鉴别方法的效率和精度,本课题实现了一个基于VisionTransformer的中药材分类识别系统,通过应用数据增强和预处理技术并构建3000张图像的数据集,结合分层特征提取和混合卷积技术,优化ViT模型使测试集分类准确率达到91.8%,优于AlexNet、VGG16和MobileNetV3等传统CNN模型,该系统对用户友好,支持图像上传、分类识别、结果展示和历史记录查询等功能,为中药材分类提供了高效的解决方案,推动了深度学习在中医药领域的应用。关键词:中药材分类;深度学习;VisionTransformer(ViT);图像识别
ABSTRACTChineseherbalmedicineisatreasureoftheChinesenationandplaysakeyroleindiseasepreventionandhealthmaintenance.However,duetothewidevariety,thetraditionalmanualidentificationmethodisinefficientandvulnerabletohumanfactors,whichisdifficulttomeettheneedsofthemodernChinesemedicineindustry.Inordertoimprovetheefficiencyandaccuracyoftraditionalidentificationmethods,thispaperimplementsaclassificationandrecognitionsystemofChineseherbalmedicinebasedonVisionTransformer.Byapplyingdataenhancementandpreprocessingtechnologyandconstructingadatasetof3000images,combinedwithhierarchicalfeatureextractionandhybridconvolutiontechnology.TheoptimizedViTmodelachievesaclassificationaccuracyof91.8%inthetestset,whichisbetterthantraditionalCNNmodelssuchasAlexNet,VGG16andMobileNetV3.Thesystemisuser-friendlyandsupportsimageuploading,classificationrecognition,resultdisplayandhistoricalrecordquery.ItprovidesanefficientsolutionfortheclassificationofChineseherbalmedicinesandpromotestheapplicationofdeeplearninginthefieldoftraditionalChinesemedicine.Keywords:TraditionalChineseMedicineClassification;DeepLearning;VisionTransformer(ViT);ImageRecognition
目录TOC\o"1-3"\h\u15416第1章引言 178031.1选题背景 1290031.2研究目的 1229781.2.1理论意义 1216511.2.2实际应用价值 16881.2.3政策背景 1110311.2.4国外研究现状 2118661.2.5国内研究现状 2125701.3研究内容与方法 2157291.3.1主要研究内容 2276751.3.2研究方法 2288621.4预期结果与意义 319933第2章需求分析 4242152.1用户概述 4144872.2功能需求 4145272.3性能要求 4137572.4界面设计 437332.5安全需求 431747第3章中药材图像数据集的构建与预处理 5218943.1数据收集与整理 516733.1.1数据来源 546203.1.2数据整理 5200483.2数据预处理 535333.3数据增强扩充数据集 61033.3.1几何变换 6111613.3.2颜色变换 677933.3.3噪声添加 7123673.4数据集划分与标注 793343.4.1数据集划分 7204663.4.2数据标注 7261383.4.3类别平衡 72172第4章基于ViT的中药材分类模型设计 899054.1ViT模型的基本结构 8246254.2模型优化与改进 8191444.3损失函数与优化器选择 929304.3.1损失函数 9141034.3.2优化器 9241754.4模型训练与调参策略 9204814.4.1训练策略 9207774.4.2调参策略 9261214.4.3训练加速 9206294.5模型压缩 1032477第5章面向对象设计与实现 11117575.1面向对象分析概述 11102275.1.1系统用例模型 11177755.1.2用户用例图及规格描述 1199255.1.3管理员用例图及规格描述 13185.1.4用户用例描述 14154065.1.5管理员用例描述 15122905.2系统类图设计 1670355.2.1用户类 1715075.2.2识别结果类 17315255.2.3图像类 1833605.2.4系统类 1852105.3系统交互流程分析 19204435.4系统架构设计 20204075.4.1前端 2018495.4.2后端 2043205.4.3深度学习模型 2189845.4.4数据库 21245415.5功能模块设计 2131885.6系统实现与界面展示 21262175.6.1技术栈 21245885.6.2界面展示 21103815.6.3系统部署 242814第6章实验与结果分析 25233576.1实验环境与配置 25167586.1.1硬件配置 2543186.1.2软件配置 25183386.2实验设计与步骤 25293896.3实验结果与分析 2519366.3.1训练过程分析 25144446.3.2测试集性能 266676.4模型性能对比与讨论 26202826.4.1与经典模型的对比 26254826.4.2讨论 2712786.4.3.改进方向 2724230总结 2819479参考文献 2914136致谢 31PAGEPAGEI第1章引言1.1选题背景中药材是中华民族的瑰宝,在疾病防治和健康维护方面具有关键作用,但是由于种类繁多,传统的人工鉴别方法效率较低且容易受到人为因素干预,很难满足现代中医药行业的需求,而人工智能技术快速发展,尤其是深度学习在图像识别领域的突破,为中药材的自动化分类和识别提供了新的可能[1]。近年来深度学习技术在中药材分类识别中得到广泛应用,卷积神经网络作为传统的图像识别方法在该领域取得了一定成效,但是CNN在特征提取时存在局限,尤其在处理图像远距离关系时难以全面捕捉中药材的整体特征,VisionTransformer作为一种新兴深度学习模型,引入自注意力机制可以更有效地建模图像各区域之间的关系,这让ViT模型在中药材分类中能够更好地提取整体形态和细节特征,提高分类准确率。1.1.2政策背景国务院办公室引印发《“十四五”中医药发展规划》指出,促进传统中医药理论与现代科学技术深度融合,实现中西医优势互补与协同发展,加速中医药体系的现代化转型与产业化升级[2]。《加快推动中医药高质量发展》文件指出,我国拥有丰富的中药资源,总数超过1.8万种。中草药识别网站可以有效管理和利用这些资源,满足现代社会对中药快速、精准识别的需求。人工智能技术在图像识别方面取得了关键进展,为中草药识别提供了新的技术手段。将人工智能应用于中医药领域,有助于推动中医药的信息化发展。近年来,国内外学者围绕深度学习在中药材分类识别中的应用开展了大量研究,取得了一定成果。1.1.3国外研究现状国外学者主要将深度学习应用于植物分类识别,就像在植物病害识别方面,卷积神经网络(CNN)具有较好的分类效果,Tambe研究团队开发的CNN架构在马铃薯叶部病害分类中表现良好,整体精度达到99.1%[3],Chowdhury等学者设计的CNN模型能够有效检测和分类农作物病害,为智能化病害监测系统提供了技术支持[4]。1.1.4国内研究现状国内研究团队在中药材智能识别方面取得了一些进展,典型范例包括,刘艺团队采用改进型CNN架构,在药用植物叶片分类中获得了较高准确率,训练集和验证集的分类精度分别为97%和94%[5],常添春研究组认为MCResNet50模型,在中药材识别测试中达到98.6%的分类准确率[6],张昕莹团队基于SE-MobileNetV2改进深度学习模型实现了对中药材粉末显微图像的高效识别,部分类别的识别率达到100%,整体准确率达97.5%[7],此外许曙博团队将VisionTransformer的自注意力机制应用于医学图像分析,通过优化策略提升了阿尔茨海默病MRI影像的分类准确率[8],这些研究为中药材智能识别奠定了基础。通过总结以上文献可以分析出现有的研究仍存在一些不足,就像现有模型在不同数据集上的测试表现较差,大部分研究集中在算法层面,缺少可实际应用的识别系统等。1.2研究目的本论文的目的是设计实现一个基于ViT模型的中药材分类识别系统以提高鉴别的效率和准确性,主要研究内容为三点:收集不同种类的中药材图像进行数据预处理和增强,结合中药材图像的特点优化ViT模型参数,设计一个易于使用的系统,开发的中药材分类识别系统可应用于中药材种植、生产、流通和消费等环节,提高中药材鉴别效率,保障中药材质量安全,促进中医药产业现代化发展。1.3研究内容与方法1.3.1主要研究内容通过系统采集和标准化处理来收集整理不同种类的中药材图像,建立较完整的中药材图像数据库,研究ViT模型的原理,结合中药材图像特点优化模型参数,提高分类准确率后压缩模型以在网站上部署,设计开发基于ViT模型的中药材分类识别系统,支持图像上传、分类识别和结果展示,提升使用便捷性。1.3.2研究方法(1)查阅国内外相关文献,了解基于深度学习的中药材分类识别研究现状、发展趋势和存在的问题;(2)实地调研,构建中药材图像数据集,如图1.1所示;图1.1中医展览馆参观训练和测试ViT模型,评估模型性能,采用软件工程的方法,设计和实现中药材分类识别系统。1.4预期结果与意义提升中草药鉴别的准确性和分类效率,可以使得人力成本降低,同时也能在中药材的种植、采摘、鉴别和制药等环节发挥作用,助力中药产业向数字化、智能化发展。为此,本课题提出了一种基于ViT模型的中药材分类识别方法提升分类精度,开发了一个操作简单的识别系统,这样可以让中药材鉴别更加便捷高效。第2章需求分析2.1用户概述该网站面向中医药领域的多类用户群体:对于中医药从业者,系统可以快速准确地鉴别药材真伪和品种,辅助临床用药和处方审核,显著提升工作效率并降低人工鉴别误差,针对中医药专业学生,系统提供识别功能结合药材功效知识展示,是很重要的数字化学习工具,中医药爱好者可通过系统直观了解各类药材的视觉特征和药用价值,对制药企业和质量控制机构而言,系统能够支持高效完成原料药材的入厂检验,这样是为了确保药品生产源头的质量安全。2.2功能需求该系统支持用户上传中药材图像,支持常见图像格式,它使用ViT对中药材图像进行分类,输出识别结果并以图文形式进行展示,包括中药材名称、置信度、相关描述等信息。2.3性能要求在测试集上的分类准确率应达到90%以上,单张图像的识别时间控制在3秒以内,系统需支持多用户同时访问,保证在高并发情况下的稳定性,系统具备良好的可扩展性,能够方便地添加新的中药材类别或更新模型,在保证性能的前提下,尽量减少系统对硬件资源的占用,降低运行成本。2.4界面设计本系统界面布局清晰,操作流程简单,用户不需要了解专业知识同样可以快速上手,系统支持在不同设备上流畅使用,同时也提供明确的提示信息,并且在页面设计中采用符合中医药文化的设计风格,这样可以提升用户体验。2.5安全需求对用户上传的图像和识别记录进行加密存储,防止数据泄露,采取必要的安全措施,以防止SQL注入、XSS攻击等常见网络攻击,明确告知用户数据的使用范围和隐私保护措施,遵守相关法律法规。
第3章中药材图像数据集的构建与预处理3.1数据收集与整理3.1.1数据来源本课题主要从《中药材图像数据库》中获取图像,见图3.1,在此期间使用实地调研方法获取数据,课题对多个来源的数据进行了筛选和整合,这样可以确保数据的多样性,图像包括了常见的中药材种类,共构建成一个包含3000张高质量图像的中药材数据集,为后续的模型训练和性能优化奠定了坚实基础。图3.1数据来源3.1.2数据整理依据中药材的种类对图像进行分类以确保每个类别都有足够的样本数量,去除模糊、重复或不相关的图像以保证数据集的质量,将所有图像都统一转换为JPG格式,调整分辨率以适应模型输入的要求。3.1.3数据预处理本课题对图像进行了多项预处理步骤。具体表现在调整图像尺寸为模型输入固定值且进行线性归一化处理,为每张图像生成了对应的标签文件且记录其所属的中药材类别,确保每张图像都能正确标注以方便后续分类识别工作,这些预处理步骤为后续的模型训练提供了高质量的输入数据,如图3.2所示。图3.2(a)原始数据集图3.2(b)预处理后数据集图3.2预处理前后对比图3.2数据增强扩充数据集3.2.1几何变换采用多种数据增强技术来提升模型的泛化能力,在[-30°,+30°]区间内均匀采样旋转角度,模拟实际拍摄时不同视角的采集条件,以50%概率执行水平翻转,增强模型对药材对称特征的识别鲁棒性,如图3.3所示。3.2.2颜色变换随机调整图像的亮度,模拟不同光照条件;随机增强或减弱图像的对比度;随机调整图像的色调、饱和度和明度,如图3.3所示。图3.3几何变换、颜色变换后的数据集3.2.3噪声添加在图像中添加随机噪声,提高模型对噪声的鲁棒性,如图3.4所示。图3.4噪声添加后的数据集3.3数据集划分与标注3.3.1数据集划分(1)训练集:用于训练模型,占总数据的70%。(2)验证集:用于调整模型超参数和监控训练过程,占比15%。(3)测试集:用于评估模型性能,占比15%。3.3.2数据标注本课题采用Labelme工具对中药材图像进行人工标注,以确保类别标签的准确性,先依据中药材分类标准对图像进行逐张标注,确保所有数据都具备明确的类别信息,在标注过程中,对形态相似的中药材进行了严格审核,在此期间通过交叉检查减少误标现象,所有标注结果均以JSON格式存储,其中包含图像路径、类别标签以及多边形标注信息等,这种JSON格式兼容性较强,方便后续的数据处理、可视化以及深度学习模型的训练,如图3.5,以党参图片标注为例。图3.5标注数据集3.3.3类别平衡对数据集进行类别平衡优化以避免数据分布不均导致的模型偏差,首先进行统计分析,发现部分中药材类别的样本数量明显少于其他类别。针对这一问题,我们采用了两种策略进行平衡:数据增强和过采样。在数据增强方面,我们对样本较少的类别应用旋转、翻转、颜色变换、仿射变换、高斯噪声等图像处理技术,以模拟真实环境中的图像变化,提升模型的泛化能力。在过采样方面,我们使用SMOTE(合成少数类过采样技术),通过插值法生成额外样本,以补充低频类别。此外,为了进一步验证类别平衡策略的有效性,我们训练了两组模型(平衡前和平衡后),实验结果表明,类别平衡后的模型在小样本类别上的识别准确率提高了约7.5%,有效降低了类别不均衡带来的负面影响。
第4章基于ViT的中药材分类模型设计4.1ViT模型的基本结构VisionTransformer(ViT)是一种基于自注意力机制的深度学习模型,最初应用于图像分类任务。其基本结构如图4.1所示。图4.1VIT模型架构图像分块(PatchEmbedding):将输入图像划分为固定大小的图像块(如16x16像素),每个图像块被视为一个“词”,通过线性变换将每个图像块映射到一个高维向量,形成序列输入。位置编码(PositionEmbedding):为每个图像块添加位置编码,以保留图像的空间信息,位置编码可以是固定的(如正弦函数)或可学习的。Transformer编码器:由采用级联式Transformer模块构建,每个块包含多头自注意力机制(Multi-HeadSelf-Attention)和前馈神经网络(Feed-ForwardNetwork),自注意力机制用于捕捉图像块之间的全局依赖关系[9]。分类头(ClassificationHead):在序列的开头添加一个特殊的分类标记([CLS]),其最终输出用于分类任务,通过全连接层和Softmax函数输出每个类别的概率分布。4.2模型优化与改进本课题对ViT模型进行了多方面的优化从而更好地适应中药材分类任务的需求,在ViT的前端可以加入卷积层以提取低层次特征,从而让模型更好地识别中药材的基础形态,Transformer部分用于捕捉图像的高层次特征来实现更全面的特征提取。在注意力机制这部分,采用局部注意力机制来减少计算复杂度并保留对局部特征的关注,本课题引入稀疏注意力机制,进一步降低长距离依赖的计算开销提升计算效率,在此期间为了让其在新数据上的表现更加稳定,结合了数据增强技术和Dropout正则化方法有效地提升了模型的泛化能力。最后采用迁移学习策略,先在大型数据集ImageNet上对ViT模型进行预训练,之后在中药材数据集上进行微调,这一策略加速了模型的收敛过程,提升了模型的分类性能,使本课题能够在中药材图像识别任务中提供更高效、更准确的解决方案[10]。4.3损失函数与优化器选择4.3.1损失函数使用交叉熵损失(Cross-EntropyLoss)进行模型优化。以防止logits输出极端值,在计算交叉熵损失时,对真实标签进行平滑处理,降低模型过度自信倾向,提高泛化能力[11]。4.3.2优化器使用AdamW优化器,其结合了Adam优化器的自适应学习率和权重衰减,更适合训练Transformer模型。同时使用线性衰减(LinearDecay)策略,动态调整学习率,加速收敛以避免陷入局部最优[12]。4.4模型训练与调参策略4.4.1训练策略根据硬件资源选择合适的批量大小,以平衡训练速度和内存占用,初始学习率设置为较小的值,并且根据验证集性能进行调整,在验证集性能不再提升时提前停止训练,防止过拟合[13]。4.4.2调参策略使用随机搜索(RandomSearch)对关键超参数,例如学习率、权重衰减等进行优化,此外训练多个ViT模型,并通过投票的方式集成结果,提高分类性能。4.4.3训练加速使用分布式训练,在多GPU或分布式环境下进行训练,进一步提升训练效率。4.5模型压缩如图4.2所示,通过知识蒸馏进行模型轻量化。不仅能快速准确的提取图像的特征,并且对其进行精准快速的分类操作,更具有模型参数量少、占用计算机资料低,运行速度快等特点,可以灵活便捷地部署到网站上[14]。ViT模型作为新纪元的开创者,它的问题在于:(1)需要非常大的算力资源;(2)只使用ImageNet训练得到的准确率并未很高(top1-accuracy:77.9%);(3)预训练数据集JFT-300M并未被公开;(4)对超参数设置要求较高。对于ViT出现的一众问题,本课题对照DeiT模型进行了相似改进。首先使用软蒸馏操作[15],如式1-1所示。Lglobal图4.2softmaxwithtemperature在模型蒸馏的过程中,teacher模型和student模型都接收到相同的输入图片并进行前向传播,由于teacher模型处于测试阶段,它会通过softmax函数来获取一个标签,在这个过程中,softmax函数会除以一个称为temperature(蒸馏温度)的参数[16],这个操作会导致softmax输出一个相对平缓的softlabel,而不是硬性的类别标签,这种平缓的softlabel有助于模型学习到更细致的类别信息,从而提高模型的性能。(式4-2)
第5章面向对象设计与实现5.1面向对象分析概述本系统采用面向对象的方法进行需求分析,主要目的是通过系统对象模型分析中药材分类识别系统的主要功能及其之间的交互关系,有助于系统的设计和后续开发[17]。5.1.1系统用例模型根据需求分析,中药材分类识别系统的参加者包括以下两种:用户:使用中药材的主体管理员:负责中药材分类识别系统的操作和后台维护两个参与者如图5.1所示:图5.1系统参与者5.1.2用户用例图及规格描述(1)用例图用户在该系统中能够进行上传中药材图像、分类识别以及查看识别结果的相关操作,通过这些活动创建的用户用例图如图5.2所示。图5.2用户用例图(2)规格描述①UC01:用户注册功能描述:新用户通过填写必要信息创建系统账户。处理流程:用户填写注册表单并提交。2)系统校验用户名唯一性及密码复杂度。3)发送验证码至邮箱/手机号。4)用户输入验证码完成注册。②UC02:用户登录功能描述:已注册用户通过凭证访问系统。处理流程:用户输入凭证并提交。2)系统验证凭证有效性。③UC03:上传图像功能描述:用户上传中药材图像以进行分类识别。处理流程:用户选择文件并上传。2)系统校验格式与大小。3)对图像进行压缩和预处理。异常处理:文件损坏:提示重新上传。④UC04:查看识别结果功能描述:用户查看系统对上传图像的分类结果。处理流程:系统调用ViT模型进行识别。2)返回结果(中药材名称、置信度、功效描述)。异常处理:识别失败:提示“无法识别,请重新上传”。⑤UC05:查看本人历史记录功能描述:用户查询自己过往的识别记录。可选:时间范围、关键词筛选处理流程:系统从数据库查询该用户的历史记录。2)按时间倒序排列结果。异常处理:无记录时显示“暂无历史数据”。⑥UC06:提交反馈功能描述:用户对识别结果提出修正或意见。处理流程:用户填写反馈表单并提交。系统记录反馈并标记为“待处理”。异常处理:必填字段为空:高亮提示补全。5.1.3管理员用例图及规格描述(1)用例图管理员在该系统中能够进行管理用户信息和管理管理图像数据等的相关操作,通过这些活动创建的管理员用例图如图5.3所示。图5.3管理员用例图规格描述=1\*GB3①UC01:管理用户信息功能描述:管理员对系统用户账户进行管理,包括查询或禁用等操作。处理流程:管理员在后台输入查询条件,筛选目标用户,然后系统记录操作日志。异常处理:操作冲突时提示“无权操作”。②UC02:管理图像数据功能描述:管理员需要审核和清理用户上传的中药材图像来检查是否有违规内容或敏感信息,这样可以确保数据合规可靠。处理流程:管理员打开系统,展示待审核图像列表。2)管理员删除低质量或者无关图像。异常处理:图像被识别任务引用时:提示“请先终止关联任务”。③UC03:管理识别结果功能描述:管理员会检查并修正系统的识别结果,尤其是用户反馈有错误的内容或系统识别率较低的图像,确保识别更准确。处理流程:管理员查看疑似错误的识别结果并在手动修正结果后提交。2)系统会更新数据库,标记为“已人工校验”。④UC04:管理数据集功能描述:管理员负责管理系统的中药材图像数据集,包括上传新图片、更新数据,这样可以确保系统训练用的数据的准确和完善。处理流程:上传新数据集时,系统会自动解压并校验图像格式,之后对图像进行去重和类别平衡处理。3)系统生成数据集版本号和变更日志。异常处理:数据集标注文件缺失:暂停导入并提示补全。⑤UC05:管理模型功能描述:管理员部署、更新或回滚ViT分类模型。处理流程:选择数据集启动训练任务,监控GPU资源占用。2)验证集准确率达标后,部署至生产环境。3)保留旧模型版本以备回滚。⑥UC06:查看反馈结果功能描述:管理员处理用户提交的识别结果反馈。处理流程:系统分类展示反馈。2)管理员核实后标记为“已解决”,并通知用户。异常处理:反馈关联图像已删除:标记为“无法复现”。5.1.4用户用例描述如表5.1、表5.2、表5.3所示,用例描述表格详细定义了“上传中药材图像”、“分类识别”以及“查看识别结果”等功能的基本信息,这些用例可以作为系统设计和开发的参考以确保功能符合用户需求。表5.1“上传中药材图像”用例描述名称上传中药材图像描述用户上传中药材图像以进行分类识别前提用户已登录系统结果图像上传成功并准备进行分类识别扩展如果图像格式不支持或大小超过限制,系统提示用户重新上传表5.2“分类识别”用例描述名称分类识别描述系统对上传的中药材图像进行分类识别前提用户已成功上传中药材图像结果系统生成识别结果并存储扩展如果模型无法识别图像,系统提示“识别失败,请重新上传”表5.3“查看识别结果”用例描述名称查看识别结果描述用户查看历史识别记录和详细信息前提用户已上传中药图像并完成分类识别结果系统显示用户的历史识别记录列表和详细信息扩展如果历史记录为空,系统提示“暂无识别记录”5.1.5管理员用例描述管理员可以对中药材图像数据集进行管理,其前提是管理员已登录系统,在操作后数据集信息将更新且模型训练模块可访问最新数据集,如果数据格式不支持,系统会提示上传失败;此外管理员也可以管理系统中的分类模型,其前提是管理员已登录系统,在操作后分类识别模块可使用最新模型,如果训练参数错误系统将提示训练失败并建议检查数据集和参数。表5.4“管理数据集”用例描述名称管理数据集描述管理员对系统中的中药材图像数据集进行管理(添加、删除、更新、查看详情)前提管理员已登录系统结果数据集信息更新,模型训练模块可访问最新数据集扩展如果数据集格式不支持,提示“上传失败”表5.5“管理模型”用例描述名称管理模型描述管理员对系统中的分类模型进行管理(训练、查看详情)前提管理员已登录系统结果模型信息更新,分类识别模块可使用最新模型扩展如果训练参数错误,系统提示“训练失败,请检查数据集和参数”5.2系统类图设计根据主要的四个类对象:系统类、用户类、识别结果类和图像类创建完整的类图如图5.4。系统类负责管理其他三个类(用户类、识别结果类、图像类),用户类可以查看系统类的信息,用户类可以查看识别结果类的信息,图像类是识别结果类的生成来源。图5.4类关系图5.2.1用户类用户类是软件系统用来存储和管理用户信息的数据结构,里面包含了一些属性和方法,具体内容见图5.5。用户名是用户的标识符,系统中的每个用户都具有唯一用户名以区分不同的用户。密码是用户的登录凭证,其使用加密存储来确保安全性。角色是用来描述用户在系统中的权限级别的属性,分为普通用户和管理员,管理员会比普通用户拥有更多管理权限。上传图像方法允许用户将图像文件上传到系统中。查看历史记录方法允许用户查看他们过去的操作记录,这样有助于用户了解自己的活动历史。提交反馈方法允许用户向系统提供反馈或建议,管理员可以从这些建议中了解用户的需求,故而可以改进系统的质量。图5.5用户类图5.2.2识别结果类识别结果类是用于存储和管理图像识别任务的输出结果的类,它通常包含以下属性和方法,如图5.6。识别结果用于存储图像识别的结果信息。识别准确率用于存储识别结果的准确率,即正确识别的对象数量与总识别对象数量的比例。显示识别结果方法用于在界面上显示识别结果的信息,包括识别对象、识别对象的名称和识别准确率。图5.6识别结果类图5.2.3图像类图像类是用来存储和管理与图像相关的各种信息的类,它通常包含以下属性和方法,如图5.7。图像路径指的是图像文件在计算机上的存储位置。上传时间是图像文件被上传到系统的时间戳。获取图像信息的方法会先从数据库或其他数据源查找数据,接下来会提取出和图像相关的详细信息。更新图像信息方法用于修改或更新图像的属性值,像是更改图像路径、名称等。删除图像方法是从系统中删除指定的图像与其相关信息的属性。图5.7图像类图5.2.4系统类系统类主要负责统筹管理整个中药材识别平台的运行,它通常包含以下属性和方法,如图5.8。管理用户信息是为了存储同用户相关的各种信息。图像数据主要是存储与图像相关的信息。识别结果是用来存储图像识别的结果信息,像是识别对象的名称、置信度。用户反馈是为了存储用户的反馈信息。获取系统信息方法主要用于查询系统的各项运行数据,这种方法可以从数据库、日志文件或其他数据源中检索出详细的系统运行信息。更新系统信息方法可以修改或更新系统的属性值,像是更改用户信息、图像数据或识别结果等。删除系统信息方法将会从系统中移除指定的系统对象。图5.8系统类图5.3系统交互流程分析表5.1详细说明了中药材图像分类系统的全流程技术实现方案,该表将流程划分为8个关键阶段:从用户上传图像开始,依次经过文件验证、图像预处理、特征提取、ViT模型分类、结果存储与展示,每个阶段均包含具体操作说明[18]。表5.1图像分类流程说明表流程阶段操作说明技术实现异常处理用户上传图像用户通过Web界面选择本地文件限制:JPG/PNG格式,≤10MB前端:<inputtype="file">+格式校验后端:Multer/Flask-Uploads接收文件格式错误:提示"仅支持JPG/PNG"大小超限:提示"请压缩至10MB以下"文件验证校验文件头标识,检查实际文件大小Python:imghdr+os.path.getsize文件损坏:返回HTTP415错误码图像预处理尺寸标准化:256×256像素增强:直方图均衡化OpenCV:resize()+cvtColor()+equalizeHist()处理失败:记录日志并返回原始图像特征提取分块:16×16像素块TensorFlow:PatchEmbedding层分块异常:自动填充边缘像素ViT分类通过12层Transformer编码器分类头输出Top-3结果及置信度模型:ViT-Base(12层)输出:Softmax概率分布超时(>5s):切换结果存储原始图像:压缩为JPEG结果:JSON格式数据库:MongoDBGridFS字段:{user_id,image_hash,pred_results[]}写入失败:暂存Redis队列重试结果展示药材名称置信度进度条功效简介前端:Vue.js动态渲染数据:{name:"当归",confidence:0.92,desc:"..."}知识库无数据:显示"暂无补充信息"图5.9描述了中药材图像分类的核心流程。图5.9图像分类流程用户选择本地图像文件,在系统中验证格式和大小,如果验证失败则提示上传错误,在通过验证后图像进入预处理阶段,包括尺寸标准化、灰度转换和对比度增强。预处理完成的图像输入ViT模型进行分类识别,模型通过分块处理和Transformer编码器提取特征并输出药材名称及置信度,识别结果与原始图像压缩存储至数据库,最终前端以可视化卡片形式展示分类结果。5.4系统架构设计5.4.1前端本系统的前端部分使用HTML、CSS以及Hbuilder开发用户界面,以确保系统具有良好的可视化效果和用户体验。采用Vue.js框架进行动态交互的实现,通过其数据绑定和组件化设计,使得界面更加灵活且易于维护。Vue.js使得页面能够响应用户的操作,实时更新界面状态,从而提升用户体验[19]。5.4.2后端后端使用Python语言的Flask框架进行开发搭建系统的服务器端,Flask框架因其轻量级和灵活性在处理HTTP请求时表现出色,适合快速构建API接口,通过Flask提供的路由机制,系统能够高效地处理图像上传、分类请求、以及返回分类结果等操作。5.4.3深度学习模型本系统的核心功能是基于深度学习模型进行中药材分类,选择ViT模型来进行图像分类任务,其在处理视觉任务时具有较好表现,能够通过Transformer架构有效从图像中提取高质量特征,在TensorFlow框架下加载并运行ViT模型,通过训练好的权重对用户上传的图像进行并预测输出分类结果,模型通过对输入图像进行分块处理和Transformer编码器的多层处理,提取图像的特征信息,识别中药材的种类及其置信度以保证系统的准确性与高效性。5.4.4数据库使用MySQL存储用户信息、历史记录和反馈数据,其系统架构图如图5.10所示。图5.10系统架构图5.5功能模块设计(1)图像上传模块可以支持用户上传中药材图像,它会对上传的图像会进行格式校验和预处理。分类识别模块可用来调用ViT模型,这是为了对图像进行分类识别来返回分类结果和相关信息。结果展示模块支持图文形式展示分类结果并提供中药材的详细信息。反馈模块允许用户对识别结果进行反馈,收集用户反馈数据用以模型优化。5.6系统实现与界面展示5.6.1技术栈前端:HTML/CSS/Hbuilder+Vue.js后端:Python+Flask数据库:MySQL深度学习框架:TensorFlow5.6.2界面展示登录页:提供用户登录操作,密码做加密处理,输入用户名,密码即可登陆系统,如图5.11所示。图5.11登录页面首页:提供图像上传入口及登陆注册功能,如图5.12所示。图5.12上传中药材图像识别结果页:展示识别结果,置信度以及中药简介等相关信息,如图5.13所示。图5.13图像识别结果管理员页:包含数据集管理、模型管理、系统状态显示及相关信息,如图5.14所示。图5.14管理员页面数据集管理页:包含添加、更新、删除数据集,查看数据集详情、时间戳及相关信息,如图5.15所示。图5.15数据集管理页面5.6.3系统部署系统通过Flask框架搭建Web服务,在此期间利用@app.route装饰器定义路由来处理用户请求,以后台管理界面、数据集和模型管理举例,Flask的简洁性和扩展性可以让系统更高效地管理不同的功能模块。
第6章实验与结果分析6.1实验环境与配置6.1.1硬件配置CPU:11thGenIntel(R)Core(TM)i5-11260H@2.60GHZGPU:NVIDIAGeForceRTX3050LaptopGPU内存:16384MBRAM6.1.2软件配置操作系统:Windows10深度学习框架:TenserFlow2.0+CUDA11.2编程语言:Python3.9数据库:MySQL8.0其他工具:OpenCV、Pandas、Matplotlib等6.2实验设计与步骤(1)数据预处理:对图像进行尺寸调整(128x128像素)、归一化和数据增强。模型训练:使用预训练的ViT模型作为基础模型,采用50个epoch的微调策略,使用AdamW优化器,初始学习率为1e-4。模型验证:模型性能评估在每个epoch结束后通过验证集进行,记录损失和准确率,根据验证集性能调整超参数。模型测试:在测试集上评估模型的最终性能,计算分类准确率、精确率、召回率和F1分数。对比实验:与其他经典模型(Alexnet网络,VGG16网络、MobileNetV3网络)进行性能对比,分析ViT模型的优势与不足[20]。6.3实验结果与分析6.3.1训练过程分析如图6.1(a)所示,训练集准确率在50个epoch后达到98.5%,验证集准确率在50个epoch后达到97.2%,训练损失和验证损失随epoch的变化曲线如图6.2(b)所示,模型在30个epoch后逐渐收敛,表明模型具有良好的拟合能力。图6.1(a)训练集、验证集准确率图6.1(b)训练集、验证集损失率图6.1准确率及损失率6.3.2测试集性能在测试集上,模型的分类准确率为91.8%,精确率为92.1%,召回率为91.5%,F1分数为91.8%。6.4模型性能对比与讨论6.4.1与经典模型的对比将ViT模型与Alexnet、VGG16、MobileNetV3等经典模型进行对比,结果表6.1、6.2所示。表6.1各个网络的训练结果网络训练时间(小时)训练集准确率(%)验证集准确率(%)Alexnet0.80.9690.802VGG163.30.9870.825MobileNetV320.9880.887Vit4.50.9930.981表6.2各个网络的参数量对比网络总参数量层数模型大小(MB)单张图片预测时间(ms)Alexnet14,606,028855.7287msVGG1670,317,90016268.24212msMobileNetV34,241,8042816.18484msVit85,802,50112327.31352ms实验结果表明,ViT模型在中药材分类任务中表现优于传统CNN模型,尤其是在捕捉全局特征方面具有明显优势。6.4.2讨论(1)ViT模型的优势能够捕捉图像的全局信息,适合处理中药材图像中复杂的纹理和结构特征,在大规模数据集上预训练后,通过微调可以快速适应特定任务。(2)ViT模型的不足对数据量的要求较高,在小规模数据集上容易过拟合,且计算复杂度较高,训练和推理时间较长。6.4.3.改进方向为了让中药材识别系统更容易使用,本课题将对AI模型进行三大升级:创新性地融合传统图像识别技术和最新Transformer技术,使系统能精准捕捉药材叶片的细部纹理特征,扩充训练数据集为大幅提升模型的识别准确率和泛化能力,在此期间可以使用算法优化提高运算效率,这样可以把识别速度变得更快、响应变得更及时。
总结本课题围绕中药材分类识别展开,一共构建包含3000张图像的中药材数据集,共包括5种常见中药材,并且通过使用数据增强与预处理技术提升数据质量与多样性。系统基于VisionTransformer架构构建中药材分类模型,添加的分层特征提取和注意力机制优化使分类准确率提升到了91.8%,比传统CNN模型性能更加优秀,所开发的分类系统实现了图像上传、自动识别和结果可视化等核心功能,系统架构设计具有良好的扩展性。实验分析表明,ViT模型在中药材全局特征提取方面展现出显著优势,当前研究存在以下改进空间,受限于数据规模,部分药材类别的样本量不足,针对形态相似药材的误判问题,可探索融合图像与文本等多模态信息的综合判别方法,而在系统功能层面,后续可扩展批量图像处理和真伪鉴别等实用功能以增强系统应用价值。在模型设计方面,本系统采用ViT构建分类模型结合分层特征提取与Transformer的优化策略提升分类准确率,开发的中药材分类系统支持图像上传、分类识别和结果展示等功能,从而让其具备良好的可扩展性,系统在测试集上的分类准确率达到91.8%,高于传统CNN模型,在此期间通过可视化分析与对比实验验证了ViT模型在捕捉中药材全局特征方面的优势,但是,当前数据集规模和多样性仍有提升空间,部分类别样本数量较少,这会影响模型的泛化能力,这样可以涵盖更多中药材种类与不同拍摄条件,此外模型对形态相似的中药材分类效果有些差,容易产生混淆,可以引入多模态数据结合图像特征进行综合判断[21],另外由于该系统功能较为基础,也可以增加多图像批量处理、中药材真伪鉴别等高级功能,这样能够提升本系统的实用性和综合能力。未来可以进一步探索多模态融合方法,结合图像、文本、光谱等多种数据源来提高分类准确率和鲁棒性[22],针对样本较少的中药材类别,可以引入小样本学习技术提升模型泛化能力,在此期间优化模型计算效率来实现实时分类功能,这样可以方便用户随时随地使用,构建更加完整的智能中医药服务平台。
参考文献汤玉荣.机器学习方法鉴别中药材种类和产地的比较研究[J].甘肃科技,2024,40(01):84-87+105.DOI:10.20156/ki.2097-2490.2024.01.017.国务院办公厅关于印发“十四五”中医药发展规划的通知[J].中华人民共和国国务院公报,2022,(11):8-21.TAMBEUY,SHOBANADEVIA,SHANTHINIA,etal.Potatoleafdiseaseclassificationusingdeeplearning:Aconvolutionalneuralnetworkapproach[J].InternationalJournalofComputerVision,2024.DOI:10.1007/s11163-024-1335-8.CHOWDHURYMJU,MOUZI,AFRINR,etal.Plantleafdiseasedetectionandclassificationusing
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026专注素材面试题及答案
- 中小学完整版感恩主题班会课课件
- 网络内容审核年度个人工作汇报
- 大班安全教案防洪防汛
- 2026年7月老年医学科层级培训考核试题(含答案)
- 地震雷电安全教育
- 敬老院电暖器火灾应急演练脚本
- 文物保护工程从业资格历年真题模拟(完整版)
- 秋季交通安全课件
- 幼儿防水安全教育
- 2027创新设计一轮生物第14讲 减数分裂和受精作用
- 2026年宁夏惠安市政产业有限公司公开招聘工作人员考试参考题库及答案详解
- 2026上海闵行公安机关专业特保招聘602人笔试模拟试题及答案详解
- 2026河南南阳南召县招聘巡防队员招聘60人笔试模拟试题及答案详解
- 2026年江苏省初级注册安全工程师考试真题及答案
- 2025版老年晚期肺癌治疗专家共识解读课件
- 2026贵州六盘水市消防救援支队面向社会招录政府专职消防员22人笔试参考题库及答案详解
- 小儿支气管哮喘持续状态护理查房
- 临床腹腔内压力经膀胱间接测量技术解读及实践经验共享
- SLT 336-2025水土保持工程全套表格
- 医院合法性审查工作制度
评论
0/150
提交评论