版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
CHAPTER04·教学课件解锁深层特征——深度学习核心技术解析ANN基本原理·CNN视觉任务·RNN序列建模王丹丹2026.11.26配套教材:《人工智能基础:案例驱动的技术认知与应用》第4章CHAPTER04·CASESTUDY导读案例:当AI遇见千年本草第4章·导读案例——基于深度学习的中药材智能识别。中医药是中华文明的瑰宝,但许多中药材外形相似、产地多样、加工方式复杂,即便经验丰富的药师也难免误判。外形相似,药师也难分辨人参与西洋参、川贝母与浙贝母在外观上极为接近,稍有不慎便可能导致用药偏差,影响疗效甚至安全。市场乱象,传统识别力不从心以次充好、掺杂染色等现象屡见不鲜,传统依赖人工的识别方式已难以满足现代中医药高质量发展的需求。深度学习给出新方案收集中药材高清图像,构建规模庞大的图像数据集;模型逐层提取特征——从边缘和颜色,到复杂的纹理与形态结构,建立对每种药材独特的"视觉记忆"。"本草智眼":几秒钟完成识别手机拍一张药材图片即可判断种类、给出置信度,甚至评估质量等级、检测硫磺熏蒸或染色处理。对当归、黄芪、天麻等的识别准确率超过95%,接近资深中药师水平。机器究竟是如何"学会"看懂图像的?它是否也像人类一样具备某种"视觉感知"的能力?——这正是本章要揭开的"数字大脑"之谜。内容来源:教材第4章导读案例02CHAPTER04·CASESTUDY案例解析:不再编写规则,让机器从数据中自主学习第4章·导读案例深度学习最核心的思想传统程序需要工程师明确告诉计算机"什么样的颜色和形状对应哪种中药材",但现实世界千变万化,规则难以穷尽。深度神经网络通过多层非线性变换模拟人类视觉皮层的工作机制,让机器从海量数据中自主学习规律,实现从像素到语义的理解跃迁。技术为人服务:辅助而非取代这项技术并非要取代药师的经验与判断,而是作为辅助工具,帮助人类更高效、更准确地传承和发展中医药文化——AI不仅能用于自动驾驶、人脸识别等前沿领域,还能深深扎根于传统文化的土壤,为古老智慧注入现代科技的生命力。本章地图:三大核心技术4.1ANN基本原理:神经元模型、FNN层级架构、前向/反向传播、主流框架4.2CNN视觉任务:卷积与池化、五层结构、LeNet→ResNet演进、中药材识别实战4.3RNN序列数据:循环连接与记忆机制、LSTM与GRU、多模态时序建模从一株草药的照片,到一个智能识别的结果,背后是一场关于数据、算法与人类智慧的深刻对话——这正是深度学习的魅力所在。内容来源:教材第4章导读案例03SECTION4.1.1·NEURON人工神经元:向大脑学习的"最小功能单元"4.1.1·神经元ANN(人工神经网络)并非凭空创造,而是人类对自身大脑神经机制的"仿生探索"与"工程化落地"。人类大脑中约860亿个神经元通过树突接收信号、细胞体处理信号、轴突传递信号,形成复杂的神经连接网络——正是这种层级化、分布式的信息处理模式,支撑了人类的感知、学习与决策能力。典型人工神经元的核心组成部分(见图4-2)输入(x₁,x₂,…,xₙ):对应生物神经元的树突,接收外部原始数据(如客户信用评级中的收入、负债等特征);权重(w₁,w₂,…,wₙ):代表对应输入的重要程度,权重越大影响越显著;偏置(b):信号处理的基准阈值,即使所有输入为0也可输出信号;求和函数:计算输入与权重的乘积和并叠加偏置,得到净输入值;激活函数:对净输入值做非线性变换,筛选有效信号并输出,是ANN具备非线性处理能力的关键。图4-1神经元信号传递连接示意图(教材原图)工作流程一句话人工神经元的运行可概括为"接收输入→加权求和→激活输出",如同一个小型决策器,完成从原始数据到有效信息的转换。内容来源:教材4.1节引言、4.1.1节(图4-1)04SECTION4.1.1·PERCEPTRON感知机三步走:加权整合、设定门槛、触发判断4.1.1·神经元①加权整合每个输入信号都有对应"权重"。判断一个人是否适合贷款时,"月收入"可能比"兴趣爱好"更重要——系统把每个输入与其权重相乘,然后全部加起来。②设定门槛在总和的基础上再加一个叫"偏置"的调整值——就像设置一个"及格线"。有了它,即使所有输入都很弱,模型也可决定是否触发输出。③触发判断将加权总和与阈值比较:达到或超过阈值就输出"1"(激活/通过),否则输出"0"(抑制/拒绝)。y=1,若Σᵢwᵢxᵢ+b≥阈值y=0,其他一句话概括:"重要信息加起来,过了门槛就点头。""加权整合+阈值触发"模拟了大脑神经元"接收信号—处理信息—发出指令"的基本逻辑。单个神经元只能解决简单的线性分类问题,但它为更复杂的神经网络奠定了基础,是迈向深度学习的第一步。图4-2人工神经元的结构(教材原图)内容来源:教材4.1.1节(1)(图4-2)05SECTION4.1.1·FNNFNN:把神经元按层组织起来的基础架构4.1.1·神经元单个神经元只能解决线性可分问题。面对复杂的非线性关系(如综合评估一个人的信用状况),需要将大量神经元按层次组织起来,形成前馈神经网络(FNN),也称多层感知机(MLP)。输入层(InputLayer)网络的数据入口,神经元数量等于输入特征的维度。如客户信用评级有5个特征(收入、负债、年龄、工作年限、逾期次数),输入层就包含5个神经元。隐藏层(HiddenLayer)位于输入与输出之间的"特征加工厂",通过多层非线性变换自动提取高阶特征组合:第一层可能将"收入"与"负债"结合生成"偿债能力"指标,第二层进一步融合成更抽象的风险判断依据。输出层(OutputLayer)网络的结果出口。二分类任务用1个输出节点(配合Sigmoid函数),多分类任务用多个输出节点(配合Softmax函数)。图4-3FNN的结构(教材原图)核心特点:信息单向流动数据从输入层开始,逐层经过隐藏层处理,最终由输出层输出结果,整个过程没有反馈或循环连接,形似一条高效的自动化生产线。正是这种层级化的特征提取机制,赋予了神经网络强大的表达能力。内容来源:教材4.1.1节(2)(图4-3)06SECTION4.1.2·DEEPLEARNING什么是"深度"?——层数背后的认知革命4.1.2·深度学习深度学习(DeepLearning)本质上是基于深层神经网络的机器学习方法。"深度"并不仅仅指层数多,更重要的是它带来了一种全新的能力——逐级抽象特征。仅含少量隐藏层的浅层网络虽能解决一些非线性问题,但面对图像、语音、自然语言等复杂数据仍力不从心。用"看图识药"理解逐级抽象(图4-4)第一层隐藏层:识别药材图片中的边缘和颜色块;第二层隐藏层:将边缘组合成纹理或轮廓;第三层隐藏层:进一步提炼为"断面形状""表面皱缩"等典型特征;第四层输出层:根据这些高级特征判断药材种类。就像人类观察事物是从细节到整体逐步理解一样,深层网络通过层层加工,自动构建起对数据的"分层理解"——这种能力,是浅层神经网络无法企及的。图4-4“看图识药”的深度学习过程(教材原图)内容来源:教材4.1.2节(1)(图4-4)07SECTION4.1.2·POSITIONAI金字塔的尖端:优势、代价与发展历程4.1.2·深度学习深度学习的定位AI:让机器模拟人类智能行为的总称,如识别、推理、决策;机器学习:实现AI的核心路径,通过数据训练模型,使其具备泛化能力;深度学习:机器学习的一个分支,以深层神经网络为基础,在图像、语音、文本等领域表现尤为突出。简单来说,深度学习=多层神经网络+自主特征学习——不再依赖人工设计特征,让模型自己从海量数据中发现规律。深度带来的优势自动提取特征:无须专家手动标注关键特征,模型可自行挖掘;更强表达能力:深层结构能拟合极其复杂的函数关系;端到端学习:从原始输入(如像素)直接到最终输出(如类别),流程更简洁。深度带来的挑战依赖大量数据:需要成千上万有标签样本进行训练;高计算成本:训练常需要GPU/TPU等高性能硬件支持;训练难度大:层数越多,越容易出现梯度消失等问题。发展历程:从沉寂到爆发2012年:AlexNet在ImageNet竞赛中大幅领先,标志深度CNN的实用化突破;2015年:ResNet(残差网络)提出,使百层以上网络成为可能;2017年至今:Transformer架构兴起,推动自然语言处理进入大模型时代;2020年代:预训练大模型(如BERT、GPT系列)广泛应用,生成式AI迎来爆发,深度学习全面走向产业落地。内容来源:教材4.1.2节(2)(3)(4)08SECTION4.1.3·FORWARD前向传播:信息如何在网络中流动4.1.3·训练学习的本质:从错误中改进。想象一位初学者学习辨识中药材:一开始他可能把"天麻"误认为"莪术",老师指出错误后,他调整判断标准,下次就会更加注意断面纹理和气味差异。神经网络的学习与此极为相似:对输入数据做出预测→将预测与真实标签对比,算出"差了多少"(误差)→根据误差反过来调整权重和偏置。"预测→对比→调整"的循环,正是深度学习实现智能的核心路径。前向传播的四个步骤(1)输入特征x₁,x₂,…,xₙ进入输入层;(2)每层神经元对其输入进行加权求和并加上偏置:z=w₁x₁+w₂x₂+…+wₙxₙ+b(式4-1);(3)将净输入值z传入激活函数f(z),得到该神经元的输出;(4)输出作为下一层的输入继续向前传递,直到输出层给出最终预测结果。前向传播就像一次"推理旅程"——网络基于当前参数对输入做出判断(图4-5)。图4-5前向传播示意图(教材原图)内容来源:教材4.1.3节(1)(2)(图4-5)09SECTION4.1.3·ACTIVATION激活函数:赋予模型非线性能力的关键组件4.1.3·训练如果没有激活函数,无论神经网络有多少层,都只能表示线性关系。正是激活函数引入了非线性变换,使神经网络具备逐层抽象特征的能力,从而能够拟合高度复杂的函数映射(图4-6)。(1)Sigmoid函数f(z)=1/(1+e⁻ᶻ),输出压缩到(0,1),适合二分类任务的输出层。平滑可导、适合作为概率输出,但易导致梯度消失,不利于深层网络训练。(2)Tanh函数(双曲正切)f(z)=tanh(z),输出范围(-1,1),是Sigmoid的改进版本。输出以0为中心,收敛速度优于Sigmoid,但仍存在梯度消失问题。(3)ReLU函数(修正线性单元)f(z)=max(0,z),计算简单、响应快速,是目前最常用的隐藏层激活函数。计算高效、可缓解梯度消失,但存在"神经元死亡"风险。(4)LeakyReLU/ELU函数对ReLU的改进:输入为负时仍保留微小输出(如f(z)=αz,α≪1),缓解ReLU的"死区"问题,在低精度问题中表现更稳定。图4-6激活函数示意图(教材原图)选择建议:隐藏层首选ReLU或其变体;输出层根据任务选择——分类用Sigmoid(二分类)或Softmax(多分类),回归则通常不加激活函数或用线性激活。内容来源:教材4.1.3节(3)(图4-6)10SECTION4.1.3·LOSS损失函数:衡量预测准确性的标尺4.1.3·训练要让机器知道自己错得多远,就需要一个量化的"评分标准"——这就是损失函数。不同的任务使用不同的损失函数。(1)回归任务:均方误差MSEL=(1/n)·Σᵢ(yᵢ−ŷᵢ)²(式4-2)n为样本数量;yᵢ为第i个样本的真实值;ŷᵢ为预测值;L为所有样本的预测误差均值。适用于房价预测等数值预测任务,衡量预测值与真实值的偏差。(2)分类任务:交叉熵损失L=−Σᵢyᵢ·ln(ŷᵢ)(式4-3)yᵢ为真实标签(通常为one-hot编码,只有对应类别为1,其余为0);ŷᵢ为预测概率;L为预测概率与真实标签的"差异程度"(其值越小,预测越准确)。适用于中药材识别等分类任务(Cross-Entropy)。共同作用:损失函数是机器学习中量化"预测结果与真实情况差距"的核心工具——回归任务用均方误差衡量数值预测的偏差;分类任务用交叉熵损失衡量概率预测与真实类别的偏离,两者共同作用可引导模型优化参数、提升预测准确性。内容来源:教材4.1.3节(4)11SECTION4.1.3·BACKPROP反向传播:误差的逆向传递机制4.1.3·训练当前向传播完成后,模型得到了预测结果和对应的损失。接下来要解决的问题是:哪些权重导致了误差?该怎么改?这就是反向传播(BackPropagation)的任务。它利用链式求导法则,从输出层开始,逐层向前计算每个参数对总误差的偏导数(梯度),从而明确"谁该负责"(图4-7)。反向传播的核心思想①误差信号从输出层反向流动;②每层根据本地激活状态和上游误差,计算本层权重的梯度;③所有梯度最终用于更新参数。反向传播是深度学习得以实现的关键算法之一,使得多层神经网络的高效训练成为可能。图4-7反向传播示意图(教材原图)内容来源:教材4.1.3节(5)(图4-7)12SECTION4.1.3·OPTIMIZER优化器:让参数更新更智能4.1.3·训练反向传播通过计算损失函数对参数的梯度来指导模型更新。然而,单纯使用梯度下降时,学习过程可能缓慢且不稳定。为了提升训练效率与稳定性,研究人员提出了多种优化器(Optimizer),核心思想是智能地调整参数更新的步长和方向。w_new=w_old−η·∂L/∂w(式4-4)
每次参数更新都沿着损失函数下降最快的方向(负梯度方向)移动,η是学习率,控制更新步长。SGD(随机梯度下降)每次仅使用单个样本或小批量数据进行参数更新,计算速度快,但更新方向波动较大。Momentum(动量法)引入动量机制,模拟物理中的惯性运动,如同滚下山坡的小球,能够加速穿越平坦区域并减少震荡。Adam(自适应矩估计)融合动量机制与自适应学习率调节,兼顾收敛速度与稳定性,是当前最广泛使用的优化器。RMSProp、Adagrad根据各参数的历史梯度动态调整其学习率,适用于稀疏数据与非平稳目标函数。采用先进的优化器,有助于模型更快、更稳定地收敛,显著提升训练效率与性能表现。内容来源:教材4.1.3节(6)13SECTION4.1.3·PIPELINE完整训练流程:从数据到模型4.1.3·训练①前向传播输入数据→层层计算→输出预测。②损失函数计算比较预测值与真实值,得出误差。③反向传播将误差沿网络反向传播,计算各参数梯度。④参数更新使用优化器(如Adam)更新权重和偏置。⑤重复迭代反复执行以上过程,更新参数,直至模型性能趋于稳定。经过成千上万次这样的循环,神经网络最终学会从原始数据中提取有效特征,完成复杂任务——如准确识别一张图片中的中药材种类。图4-8神经网络训练流程(教材原图)内容来源:教材4.1.3节(7)(图4-8)14SECTION4.1.4·FRAMEWORKS搭建智能系统:主流深度学习框架4.1.4·框架"难道每个模型都要从头编程实现吗?"当然不是。就像盖房子不必自己烧砖一样,深度学习框架为开发者提供了标准化的"工具箱"——封装了复杂的数学运算(矩阵计算、自动求导、GPU加速),让开发者专注于模型设计,而不必重复"造轮子"。PyTorch——研究人员的首选由Meta(原Facebook)开发,以动态计算图和简洁易读的Python风格著称,广泛应用于学术研究与原型开发。调试灵活、上手快,是许多高校课程和科研项目的首选。TensorFlow——工业级部署的可靠选择由Google推出,早期以静态图为主,适合大规模生产部署;其高级接口Keras极大简化了模型搭建过程,如今已成为工业界广泛应用的标准之一。MindSpore(昇思)——中国自主创新的重要成果由中国华为主导开发,支持全场景AI计算,强调自主可控与国产化适配,在我国高校、科研机构及重点行业中快速推广。PaddlePaddle(飞桨)——中文AI开发的好伙伴百度推出的开源深度学习平台,提供丰富的预训练模型和可视化工具,特别适合中文自然语言处理任务,在教育和中小企业中有良好生态。使用这些框架,开发者可以用几十行代码完成一个图像分类模型的搭建与训练——推动深度学习从实验室走向千行百业。内容来源:教材4.1.4节15SECTION4.1.5·APPLICATIONS看见现实世界:深度学习典型应用示例4.1.5·应用智慧中医药基于CNN的中药材智能识别系统已在多家中药企业投入使用:手机拍照或专业相机扫描,几秒内识别上百种常见中药材并判断真伪优劣。一些基层卫生院借助这类AI助手,显著提升了用药安全性。医学影像辅助诊断在肺癌、乳腺癌等疾病的早期筛查中,深度学习模型能从CT、X光片中识别微小病灶,辅助医生做出更准确的判断,部分系统在特定任务上已接近资深放射科医师水平。自动驾驶感知系统车辆依靠深度学习实时识别行人、车道线、交通标志和红绿灯,实现环境理解与决策控制。特斯拉、小鹏等车企的核心技术背后,正是深层神经网络在持续"看路"。智能语音助手Siri、小爱同学、天猫精灵等设备能够听懂我们的指令,背后依赖深度学习在语音识别与自然语言理解中的突破——不仅能转录语音,还能理解语义、执行任务。个性化推荐引擎抖音、淘宝、网易云音乐等平台根据用户行为数据,利用深度学习模型预测兴趣偏好,实现"千人千面"的内容推送,极大提升用户体验与平台效率。共同的技术脉络:数据驱动+深层网络+自动特征学习。从一个简单的神经元出发,到构建深层网络,再到通过训练获得智能,最终落地为改变生活的系统——这就是深度学习的力量。内容来源:教材4.1.5节16SECTION4.2.1·PAINPOINT全连接ANN处理图像的痛点:算不动,还会"学歪"4.2.1·CNN原理ANN在结构化数据处理上具备出色的拟合能力,但面对图像这类复杂非结构化数据时局限性逐渐显现。手机相册自动分类照片、口罩识别筛查人员状态、AI辅助医疗影像诊断等场景,核心需求都是让机器捕捉物体的"不变特性"——无论物体平移、缩放或旋转,都能准确识别本质。算一笔账:1000像素×1000像素的彩色图片输入特征数量=1000×1000×3=300万个(R、G、B三通道);仅第一个隐藏层设置100个神经元,就需要300万×100=3亿个参数;再多几层隐藏层,特征数量直接涨到几百亿个!两大致命问题①计算量爆炸:参数规模太大,计算机跑不动,还容易"学歪"(过拟合);②"不会抓重点":猫的耳朵、眼睛可能在图片左边也可能在右边,但全连接ANN把每个像素都当成独立的点,无法识别"同一个特征在不同位置"。图4-9全连接ANN处理1000像素×1000像素的彩色图片(教材原图)内容来源:教材4.2节引言、4.2.1节(1)(图4-9)17SECTION4.2.1·INVARIANCE图像的"不变特性"与CNN的三大核心优势4.2.1·CNN原理人类视觉系统具备一个核心特性:无论物体的空间位置、尺度大小或旋转角度发生何种变化,均能准确识别其本质——这就是图像识别所需的"不变特性"。平移不变性如手机中的自拍照,无论显示在屏幕的左侧或右侧,观察者仍能准确识别主体。缩放不变性如路边的大树,无论观察者距离远近导致视觉尺度差异,仍能判定其植物类别。旋转不变性如书写"福"字的春联,无论正贴或倒贴,均能识别其文字本体。CNN之所以成为图像识别领域的核心模型,源于三大关键设计局部感知CNN并非对整张图像进行全局感知,而是聚焦局部区域提取特征,通过局部信息的整合形成对图像的整体认知——类似人类视觉先捕捉细节再构建全局的过程。权重共享通过同一特征探测器(卷积核)对图像进行全域遍历,卷积核的参数在遍历过程中保持不变,大幅减少了模型的参数规模,降低了计算复杂度。不变特性适配通过局部感知与权重共享的协同作用,CNN能够实现对平移、缩放等变换后的特征精准识别,契合图像识别的核心需求。内容来源:教材4.2.1节(2)(3)18SECTION4.2.1·CNNAPPSCNN的应用场景:分类、检测、分割4.2.1·CNN原理图像分类手机相册的智能分类(自动生成人物、风景、美食等标签)、口罩佩戴状态识别系统,均基于CNN实现特征匹配与类别判定。目标检测外卖配送平台的骑手实时定位、交通监控系统的违章车辆识别,通过CNN快速捕捉目标区域的空间位置与特征信息,实现高效定位。图像分割医疗领域中CT影像的肿瘤区域精准分割、自动驾驶场景中行人与道路的边界区分。如手掌X光片可自动定位骨折区域,辅助医生快速诊断。图4-10CNN图像分类应用(教材原图)图4-11CNN目标检测应用(教材原图)图4-12CNN图像分割应用(教材原图)内容来源:教材4.2.1节(4)(图4-10~4-12)19SECTION4.2.2·CONVOLUTION卷积运算:会"扫图"的特征探测器4.2.2·卷积运算卷积运算的本质是让一个"特征探测器"(卷积核)在图像上按规则滑动,对覆盖区域进行对位相乘并求和,把局部特征提取出来。输入图像灰度图像是一个数值矩阵(如6×6),彩色图像则包含RGB三个通道的数值矩阵。卷积核Kernel一个小型矩阵(常用3×3、5×5),其数值是模型学习到的"探测规则",负责捕捉边缘、纹理等局部特征。特征映射FeatureMap卷积核每滑动到一个位置,将覆盖区域对位相乘后求和,得到的所有结果组成特征映射。步长Stride卷积核每次滑动的距离。步长为1时逐像素滑动,特征提取更细致;步长为2时每滑2个像素,输出尺寸更小。步长越大,特征映射越小。填充Padding在图像边缘补0,避免边缘像素被卷积核覆盖次数过少而导致边缘特征丢失,同时可保持输出与输入尺寸一致。思政小延伸:卷积运算"精准提取、全域覆盖"的设计理念,契合"精益求精、全面赋能"的工匠精神——用最小的参数代价,实现对图像信息的充分利用。内容来源:教材4.2.2节20SECTION4.2.3·CNNSTRUCTURECNN的五层结构:从像素到语义4.2.3·五层结构图4-136×6卷积输入图像(教材原图)图4-143×3卷积核(教材原图)①输入层接收原始图像像素矩阵:灰度图像为单通道矩阵(如32×32),彩色图像为RGB三通道矩阵(如224×224×3)。②卷积层对局部区域加权求和并经激活函数处理,逐层提取从低阶(边缘、颜色)到中阶(纹理、形状)再到高阶(部件、结构)的特征。③池化层对特征映射进行下采样,压缩特征尺寸、保留关键信息,降低计算量并增强特征的平移不变性。④全连接层将卷积与池化提取的局部特征整合为全局特征向量,实现特征的高层语义组合。⑤输出层根据任务类型输出结果:分类任务常用Softmax输出各类别概率,回归任务直接输出数值。五层协同,完成"像素→特征→语义"的转化。内容来源:教材4.2.3节(图4-13、4-14)21SECTION4.2.3·CONVMATH卷积计算实例:3×3卷积核滑动求值4.2.3·卷积计算图4-15卷积计算过程:卷积核在6×6图像上逐步滑动(教材原图)逐步对位相乘再求和(步长=1,无填充,6×6输入→4×4特征映射):F[0][0]=1×3+3×(−3)+(−2)×3+1×(−2)+2×2+(−2)×(−2)+(−1)×(−3)+(−1)×1+(−3)×(−3)=5F[0][1]=6F[0][2]=6F[0][3]=−8F[1]=−15,16,−19,21F[2]=−17,10,−6,−9F[3]=12,6,−19,1内容来源:教材4.2.3节(图4-15)22SECTION4.2.3·CONVMATH卷积计算实例:3×3卷积核滑动求值4.2.3·卷积计算图4-15卷积计算过程:卷积核在6×6图像上逐步滑动(教材原图)逐步对位相乘再求和(步长=1,无填充,6×6输入→4×4特征映射):F[0][0]=1×3+3×(−3)+(−2)×3+1×(−2)+2×2+(−2)×(−2)+(−1)×(−3)+(−1)×1+(−3)×(−3)=5F[0][1]=6F[0][2]=6F[0][3]=−8F[1]=−15,16,−19,21F[2]=−17,10,−6,−9F[3]=12,6,−19,1内容来源:教材4.2.3节(图4-15)22SECTION4.2.3·POOLING池化层:给特征"瘦身"的下采样4.2.3·池化层池化层(Pooling)的核心是下采样:用一个固定大小的窗口在特征映射上滑动,对每个窗口内的数值进行聚合,从而压缩特征尺寸、降低维度、防止过拟合。最大池化MaxPooling取窗口内的最大值作为输出,保留最显著的特征响应,是CNN中最常用的池化方式。平均池化AveragePooling取窗口内的平均值作为输出,保留区域的整体特征信息,平滑特征表达。图4-16最大池化:2×2窗口将4×4特征映射压缩为2×2(教材原图)池化的意义·特征尺寸减半,计算量显著下降·保留关键特征,剔除冗余细节·增强对微小平移的鲁棒性·窗口常用2×2,步长2内容来源:教材4.2.3节(图4-16)23SECTION4.2.3·LAYERROLES各层核心作用:以中药材识别为例4.2.3·层间协同卷积层——模拟人眼的"局部观察"局部感知:如同药师鉴别药材时先观察局部器官,卷积层聚焦局部区域提取特征。权重共享:同一卷积核全域遍历、参数不变,既能捕捉中药材的边缘轮廓与表面颜色,也能提取纹理形态与断面结构,参数量大幅减少。池化层——保留关键、忽略干扰剔除冗余细节,保留"根茎形状、断面纹理"等关键鉴别特征,忽略药材摆放角度、拍摄远近带来的差异,让模型对真实场景更稳健。全连接层——从局部到全局的"综合研判"将卷积与池化提取的局部特征整合为全局特征向量,像药师综合所有性状特征后作出判定一样,精准区分外形相似的人参与西洋参、川贝母与浙贝母。内容来源:教材4.2.3节24SECTION4.2.3·HYPERPARAMS关键超参数:激活、卷积核与批归一化4.2.3·超参数激活函数的选择隐藏层首选ReLU:计算简单、收敛快,能有效缓解深层网络的梯度消失问题;传统的Sigmoid、Tanh在深层网络中容易出现梯度饱和,导致参数难以更新。输出层则按任务选择:多分类用Softmax,回归任务可不用激活函数。卷积核:"小而多"的设计哲学卷积核尺寸以3×3最常用:多个小卷积核堆叠的感受野可媲美大卷积核,而参数更少、非线性表达更强。数量上"逐层增多":第一层可设6个提取边缘、笔画等基础特征,深层可增至100个以上,捕捉更复杂的语义特征。批归一化BatchNormalization将每层输入标准化为均值≈0、方差≈1的分布,缓解梯度消失、加速收敛,还允许使用更大的学习率。这一过程类似中药材的"标准化炮制与性状鉴别规范"——统一标准,才能保证后续处理稳定高效。内容来源:教材4.2.3节25SECTION4.2.3·CASE:TCMRECOGNITION实战案例:PyTorch中药材自动识别(一)4.2.3·应用案例数据集:5类中药材图像图像源于互联网,包含百合、白芷、枸杞、天麻、薏仁5个类别,每类约200张。数据按类别存放于主目录traditional_Chinese_Medcine下的各子目录中,子目录名即类别标签。代码说明·torch.manual_seed(42):固定随机种子,保证实验结果可复现·device:检测到CUDA即调用GPU,训练可提速数十倍·图像统一缩放至224×224,每批32张代码①环境准备与基本配置importtorchimporttorchvision.transformsastransformsfromtorchvision.datasetsimportImageFolder#固定随机种子,结果可复现torch.manual_seed(42)#有GPU用GPU,否则用CPUdevice=torch.device("cuda"
iftorch.cuda.is_available()else
"cpu")#数据集主目录data_dir="traditional_Chinese_Medcine"image_size=(224,224)batch_size=32内容来源:教材4.2.3节·应用案例(代码①)26SECTION4.2.3·CASE:PREPROCESS实战案例:图像预处理与数据加载(二)4.2.3·应用案例代码②图像预处理与数据集构建#预处理流水线:缩放→转张量→标准化transform=transforms.Compose([transforms.Resize(image_size),transforms.ToTensor(),transforms.Normalize(mean=[0.485,0.456,0.406],std=[0.229,0.224,0.225])])#按子目录名自动生成类别标签dataset=ImageFolder(data_dir,transform=transform)num_classes=len(dataset.classes)预处理三步走·Resize:统一缩放到224×224·ToTensor:彩色图像→数字矩阵(张量)·Normalize:用ImageNet数据集的均值与标准差做标准化ImageFolder的巧妙之处无需手动标注:只要把图片按类别放入不同子文件夹,子文件夹名就自动成为类别标签,大幅简化数据准备工作。为什么用ImageNet的均值?这些数值来自大规模图像数据集ImageNet的统计结果,是视觉任务中广泛采用的通用标准化基准。内容来源:教材4.2.3节·应用案例(代码②)27SECTION4.2.3·CASE:DATALOADER实战案例:数据集拆分与加载器(三)4.2.3·应用案例代码③7:3拆分训练集/测试集#30%作测试集,70%作训练集num_test_samples=int(len(dataset)*0.3)num_train_samples=len(dataset)-num_test_samplestrain_dataset,test_dataset=torch.utils.data.random_split(dataset,[num_train_samples,num_test_samples])#DataLoader:按批次加载数据train_loader=torch.utils.data.DataLoader(train_dataset,batch_size=batch_size,shuffle=True)test_loader=torch.utils.data.DataLoader(test_dataset,batch_size=batch_size,shuffle=False)为什么按7:3拆分?70%的数据用于训练模型,30%用于检验泛化能力。random_split随机划分,避免类别分布偏差。shuffle的讲究训练时shuffle=True:每轮打乱顺序,防止模型"记住"数据排列;测试时shuffle=False:保证评估结果稳定可比。DataLoader的作用按batch_size=32分批喂入数据,兼顾内存效率与梯度稳定性。内容来源:教材4.2.3节·应用案例(代码③)28SECTION4.2.3·CASE:MODEL实战案例:搭建CNN模型ConvNet_1(四)4.2.3·应用案例代码④定义卷积神经网络importtorch.nnasnnclassConvNet_1(nn.Module):
def__init__(self,num_classes):
super().__init__()self.model=nn.Sequential(#卷积块1:3通道→16通道nn.Conv2d(3,16,kernel_size=3,stride=1,padding=1),nn.ReLU(),nn.MaxPool2d(kernel_size=2,stride=2),#卷积块2:16通道→32通道nn.Conv2d(16,32,kernel_size=3,stride=1,padding=1),nn.ReLU(),nn.MaxPool2d(kernel_size=2,stride=2),#展平+全连接分类器nn.Flatten(),nn.Linear(32*56*56,256),nn.ReLU(),nn.Linear(256,num_classes))
defforward(self,x):
returnself.model(x)model=ConvNet_1(num_classes)model.to(device)图4-17打印ConvNet_1模型结构的终端输出(教材原图)内容来源:教材4.2.3节·应用案例(代码④,图4-17)29SECTION4.2.3·CASE:TRAINING实战案例:训练与评估(五)4.2.3·应用案例代码⑤损失函数、优化器与训练循环criterion=nn.CrossEntropyLoss()optimizer=optim.SGD(model.parameters(),lr=0.001)num_epochs=20forepochin
range(num_epochs):model.train()
forimages,labelsintrain_loader:images,labels=images.to(device),labels.to(device)outputs=model(images)#前向传播loss=criterion(outputs,labels)optimizer.zero_grad()#清空梯度loss.backward()#反向传播optimizer.step()#更新参数#统计running_loss与训练准确率model.eval()#每轮结束后在测试集上评估
print("Epoch/TrainLoss/TrainAcc/TestAcc")图4-1820轮训练的打印结果(教材原图)测试准确率约0.40~0.51——小数据集+简单模型,为后续改进(数据增强、迁移学习)留下空间。内容来源:教材4.2.3节·应用案例(代码⑤,图4-18)30SECTION4.2.4·CNNEVOLUTION经典CNN演进:二十多年的"智力接力赛"4.2.4·经典模型图4-19CNN演进之路(教材原图)LeNet-5(1998)首次系统组合卷积、池化与全连接,成功识别银行支票上的手写数字,奠定CNN基本范式。AlexNet(2012)ImageNet竞赛夺冠,错误率骤降近10个百分点,引爆深度学习浪潮。VGGNet(2014)坚持3×3小卷积核堆叠至16层,用"少即是多"证明深度的价值。ResNet(2015)以跳跃连接破解"越深越难学"的退化难题,把网络深度推进到152层,每一次突破都源于对现有问题的深入思考。内容来源:教材4.2.4节(图4-19)31SECTION4.2.4·LENET&ALEXNET奠基与爆发:LeNet-5与AlexNet4.2.4·经典模型LeNet-5(1998·杨立昆YannLeCun)·应用于银行支票手写数字识别,是CNN首次大规模商用·首次系统组合卷积+池化+全连接,确立CNN基本架构范式·结构轻巧,被誉为深度学习视觉领域的"开山之作"图4-20LeNet-5网络结构(教材原图)AlexNet(2012·AlexKrizhevsky)·ImageNet竞赛夺冠,错误率降低近10个百分点·首次大规模使用GPU训练深度网络·引入ReLU激活与Dropout防过拟合,开启深度学习黄金时代图4-21AlexNet网络结构(教材原图)内容来源:教材4.2.4节(图4-20、4-21)32SECTION4.2.4·VGG&RESNET深化与突破:VGGNet与ResNet4.2.4·经典模型VGGNet(2014·牛津大学)·秉持"少即是多":只用3×3小卷积核,堆叠至16层·结构规整简洁,成为人脸识别、视频监控等任务的骨干网络图4-22VGGNet-16网络结构(教材原图)ResNet(2015·微软亚洲研究院)·提出跳跃连接SkipConnection:让梯度跨层直达,解决"越深越难学"的退化问题·网络深度推进至152层,至今仍是众多模型的基础骨架图4-23ResNet残差结构(教材原图)经典CNN的演进就是一部深度学习进化史——每一次突破,都源于对现有问题的深入思考。内容来源:教材4.2.4节(图4-22、4-23)33SECTION4.3.1·SEQUENCEDATA序列数据:用"时间线"串起信息流4.3·RNN脑电图EEG记录大脑的"思维节奏":特定刺激出现约300毫秒后会出现特定脑电反应,顺序本身就是信息。心电图ECG心脏跳动的"节拍记录",波形的时间先后与间隔蕴含着心律是否异常的关键线索。音乐音符序列《命运交响曲》标志性的"短-短-短-长"动机——打乱顺序,旋律便不复存在。步行步态信号连续采集的步态数据可识别中风患者的步幅异常,辅助康复评估。RNN的本质:让机器学会"回忆"ANN与CNN是"健忘"的——每次只独立处理一张照片、一条记录,无法利用前后关联。而人听到熟悉的歌曲能自然接出下一段旋律,正是因为大脑记住了音符的顺序。循环神经网络(RNN)正是为这类有先后顺序的序列数据而生。内容来源:教材4.3.1节34SECTION4.3.2·RNNSTRUCTURERNN基本结构:会"自我反馈"的神经网络4.3.2·RNN结构图4-24RNN基本结构(教材原图)图4-25RNN记忆机制(时间展开,教材原图)结构三要素+循环回路输入层、隐藏层、输出层之外,隐藏层引出一条指回自身的循环回路:上一时刻的隐藏状态会参
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026年电工中级职称考试真题:电力系统继电保护操作与调试要点解析题库
- 食品添加剂采购验收规范告知函4篇
- 勤劳动惜粮食强筋骨壮体魄小学主题班会课件
- 物流行业结算标准制定函(3篇范文)
- 励志故事激发奋斗精神小学主题班会课件
- 阅读习惯重要性讨论小学主题班会课件
- 智能锁技术专利申请成功通知(5篇)范文
- 小学主题班会课件:科学探究与中学生物钟
- 婴儿床垫硬度分级检验报告
- 医院婴儿辐射保暖台皮肤温度探头防脱落与超温切断安全防范措施
- 2026年高考真题-语文(全国二卷) 含解析
- 2025版老年晚期肺癌治疗专家共识解读课件
- 2026贵州六盘水市消防救援支队面向社会招录政府专职消防员22人笔试参考题库及答案详解
- 小儿支气管哮喘持续状态护理查房
- 临床腹腔内压力经膀胱间接测量技术解读及实践经验共享
- SLT 336-2025水土保持工程全套表格
- 医院合法性审查工作制度
- 2026年达芬奇调色考证通关练习题附完整答案详解(名师系列)
- 新修订《药品管理法实施条例》全文重点学习解读
- 2023年机动车驾驶人科目一考试题库
- 2026年法语口译考试模拟题及听力材料
评论
0/150
提交评论