《人工智能通识教程》课件第4章 人工神经网络与深度学习_第1页
《人工智能通识教程》课件第4章 人工神经网络与深度学习_第2页
《人工智能通识教程》课件第4章 人工神经网络与深度学习_第3页
《人工智能通识教程》课件第4章 人工神经网络与深度学习_第4页
《人工智能通识教程》课件第4章 人工神经网络与深度学习_第5页
已阅读5页,还剩135页未读, 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

一个大脑里的微小细胞,如何被抽象成一条数学公式,并成为今天AI的计算砖块?人工智能通识·第4章·人工神经网络4.1从生物神经元到人工神经元4.1·学习目标学完这一节,你能做出哪几件可检查的事?01在一张图上指出生物神经元的树突、细胞体、轴突、突触,并分别说清它们各自由"谁"扮演收件、整合、派送、转换的角色。02写出一个人工神经元的计算式(加权求和+偏置+激活函数),并代入一组给定输入与权重,手算出最终输出是0还是1。03用一张对应表,把生物神经元的五个部件映射到人工神经元的输入、权重、加权求和、偏置、输出,并指出一处关键差异。04按时间线说出1943年MP模型、1957年感知器、1969年XOR寒冬三个节点各自证明了什么、又暴露了什么问题。4.1·学习路线这一节沿哪条路径,把"细胞"变成"公式"?01生物神经元:大脑的"信号快递站"树突、细胞体、轴突、突触如何完成一次信号接力。02人工神经元:把信号站写成一条公式输入、权重、加权求和、偏置、激活函数、输出。03早期模型:从MP模型到感知器寒冬1943整合触发、1957可学习、1969被XOR难住。04核心差异:是"启发",不是"复制"简化、可学习、确定性、连接模式——四处根本不同。驱动问题·DRIVINGQUESTION只会"收到—判断—发出"的细胞,

凭什么启发今天的AI?你会卡在哪里单个神经元看起来只会"输入够了就放电、不够就沉默",它究竟聪明在哪?更难的是——数百亿个这样简单的单元连在一起,凭什么能"理解"一句话、认出一张脸?4.1.1·生物神经元它凭什么被叫成大脑里的"信号快递站"?树突细胞体轴突突触收件窗口接收化学信号包裹分拣决策过阈值即放电高速运输送动作电位到下游包裹转换电信号转化学递质判断:四个部件只做四件事——收、算、发、转。单个神经元并不"聪明",它只是一个整合输入、越过阈值就放电的决策开关。简单个体,复杂网络=惊人智能细胞体突触树突轴突4.1.1·一个完整回路摸一下热水,手凭什么瞬间缩回来?1皮肤上的神经元,树突接收"热"信号2细胞体汇总强度,越过阈值,判断"危险"3轴突把"缩手"指令快速传给中枢4肌肉执行,手迅速缩回关键在第2步:阈值触发阈值未达→沉默(0)越过→放电(1)输入强度像水位,越线就"响铃"。这一次"判断—动作",正是后面人工神经元公式要复刻的核心。判断:完整回路=接收→阈值判断→发出指令→执行;单个神经元不智能,智能来自海量复用。4.1.1·回到引题单个神经元只会"开关",智能从哪里冒出来?单个单元:只会开关0/1收信号→加总→过阈值就放电,否则沉默。功能单一,谈不上"理解"。数百亿个互联:涌现出智能连接数以万亿计,连接强度还能随经验调整——复杂行为从这种大规模互联中"涌现"。判断:智能不在单个单元里,而在"简单单元+海量互联+可调连接"三者的乘积里。这正是科学家构建人工神经网络的出发点:用大量简单计算单元互联,模拟大脑的处理机制。4.1.2·人工神经元它把生物神经元简化成了哪六个部件?

从外部或上游接收的信号,相当于树突收到的"包裹"。

调节每个输入的重要性与方向,正是"学习"要调整的对象。

各输入乘权重再相加,模拟细胞体对输入的整合。

不依赖输入的可调项,相当于激活阈值,控制容不容易被点燃。

非线性地决定"够不够格输出",是网络能处理复杂问题的关键。

激活后的结果,传给下一层神经元或作为最终答案。直觉:各科成绩是输入,科目重要性是权重,算总分是加权求和,额外加分是偏置,"是否及格"就是激活函数。4.1.2·结构对应生物部件和人工部件,是怎么一一对应的?生物神经元组件人工神经元对应主要功能关键差异树突输入aᵢ接收信号生物信号是化学递质,人工信号是数值突触连接强度权重wᵢ调节输入影响力生物靠生化过程变化,人工靠算法调整细胞体加权求和+激活函数整合信号并决定输出生物整合涉及复杂生化,人工只是算术运算激活阈值偏置b控制激活难易度生物靠递质浓度变化,人工是可学习参数轴突输出t传递给下一层生物输出是化学递质,人工输出是数值4.1.2·数学表达六个部件串起来,公式其实只有两行

aᵢ输入信号wᵢ权重b偏置/阈值f激活函数t输出关键:加权求和本身是线性的;真正让网络能处理复杂问题的,是外面那层非线性的f。去掉f,叠多少层都只是一条直线。这就是人工神经元的完整计算:先加权求和加偏置,再过激活函数。4.1.2·动手算一次几行Python,怎么替你决定"推不推荐"?inputs=[3,4,2]#剧情/演员/特效weights=[0.5,0.3,0.2]bias=-3total=sum(i*wfori,winzip(inputs,weights))+biasoutput=1iftotal>0else0代入数值,一步步算3×0.5=1.54×0.3=1.22×0.2=0.4加权和=3.13.1+(−3)=0.10.1>0→output=1→推荐电影教材示例:剧情权重最高(0.5);偏置−3相当于"及格线",总分0.1刚刚越过。

人工神经元计算示例:判断是否推荐某部电影4.1.2·思想边界既然"受大脑启发",为什么不直接复制大脑?自然界原型

鸟:扑动翅膀飞行工程实现

飞机:不扑翼,靠固定翼与空气动力学起飞自然界原型

生物神经元:数千种蛋白的生化过程工程实现

人工神经元:一条加权求和+激活的公式判断:被启发的是"用简单单元互联产生复杂智能"这个思想,不是生物学细节。目标是造出能用的计算模型,而不是造一颗电子脑。4.1.3·历史第一站1943年,第一个神经元模型到底"证明"了什么?194319571969McCulloch(神经科学家)与Pitts(数学家)合作提出MP模型·第一次用数学语言写下生物神经元的"整合—触发"机制·输入、输出都取二元值0/1,模拟神经元的"兴奋/抑制"状态·关键证明:这样的神经元网络可以执行AND、OR、NOT等基础逻辑运算判断:MP模型的历史地位不在"聪明",而在它第一次把"神经元=计算"这件事写成了数学,并证明"神经网络能做逻辑运算"。来源:教材4.1.3;McCulloch&Pitts,1943。4.1.3·一起一落1957点燃热潮,为什么1969又跌入寒冬?1957·Rosenblatt感知器·引入权重自适应,能通过监督学习自己调权重·能分类"线性可分"的数据·人们相信机器能像人一样学习→第一次AI热潮1969·Minsky与Papert·在《感知器》一书中严格证明其局限·单层感知器是线性决策边界,解决不了异或XOR·研究陷入十余年低谷→"AI第一次寒冬"判断:这一摔不是否定神经网络,而是精确指出了它的边界——单层线性模型不够用,必须走向多层。这为后来的突破埋下了伏笔。来源:教材4.1.3;Rosenblatt1957;Minsky&Papert《感知器》1969。4.1.3·关键反例一条直线,为什么就是分不开异或XOR?AND:线性可分,一条线就够只有(1,1)为真,蓝线一刀切分XOR:怎么画直线都分不开真类在对角,虚线必同时切到两类判断:单层感知器的决策边界只是一条直线;XOR的两类点在对角,一条直线做不到——这正是必须引入多层网络的根本原因。示意图(示意素材):线性可分vs线性不可分;依据教材4.1.3与表4-5文字说明绘制。4.1.4·核心差异除了"像",它们还有哪四处根本不同?简化程度人工:一个公式模拟输入输出生物:数千种蛋白、复杂信号通路学习方式人工:反向传播自动调权重、偏置生物:LTP/LTD等突触可塑性变化确定性人工:同输入必得同输出生物:传递带噪声与随机性,可能是优势连接模式人工:预先设计,早期常全连接生物:基因+经验共同塑造,动态变化判断:这四处差异既是挑战也是机遇——尤其"连接模式的动态变化",正是当前人工神经网络仍在追赶的方向。来源:教材4.1.4生物启发与人工实现的核心差异。实战案例·教学补充一个神经元,真能挡下"异常交易"吗?背景某支付平台每天处理数百万笔交易,风险规则越来越多。问题能否用一个极简单元,先做一道"可疑与否"的初筛闸?方案用一个单神经元:输入为"金额倍数/是否异地/是否夜间/是否陌生商户",权重由历史标注数据学习,阈值输出"可疑/正常"。结果它作为第一道粗筛,把高危交易推给人工复核;更复杂的判断再交给深层模型——"简单单元+组合"再次胜出。可迁移判断:不要一上来就上大模型。一个调好权重和偏置的单神经元,往往就是高风险系统里那道便宜、透明、可审计的第一道闸。教学示意案例(为教学重构的合理场景,非某真实公司披露数据)。AI实训·结合AI一起做和AI一起:设计一个"是否及格"的神经元任务用一个对话式AI(如豆包)帮你搭一个单神经元:输入平时分、期中分、期末分(0–100),输出"及格/不及格"。输入/场景给AI一组示例成绩(如80、60、70),让它写出权重与偏置的Python;你先用手算核对输出,再运行代码验证。完成标准①写出完整公式(加权求和+偏置+阈值激活)②自选一组权重,并说明为什么期末权重应最大③追问AI:把偏置调高,及格门槛会怎样?为什么?提示:不要让AI替你"算完"。先自己估一权重、手算一次,再用AI验证——重点是理解权重和偏置各自拧的是哪个旋钮。练习场景:教学任务,答案与"自己手算结果"对照后再上AI。本节小结·回到驱动问题只会"收到—判断—发出"的细胞,凭什么启发今天的AI?01智能不在单个单元,而在"简单单元+海量互联+可调连接"。02人工神经元=加权求和+偏置+非线性激活;去掉非线性,再多层也是直线。03历史起落证明:单层线性模型连XOR都解不了,必须走向多层。04它是"启发"不是"复制":简化、可学习、确定性、连接模式,四处都不同。一句话:我们抄的不是大脑的零件,而是"简单互联产生智能"的思想。迁移·课后延伸离开这节课,你还能拿它去想什么??课后思考1:你手机里的推荐算法,是不是也在悄悄给"你喜欢的每个维度"加权求和?它的"权重"是谁定的??课后思考2:用一句话向下一届同学解释——为什么"没有非线性激活函数,深度学习就不成立"?延伸资源·预习4.2:这些单个神经元,将按"层"组织成完整网络。·有余力可查:Minsky&Papert《Perceptrons》(1969)关于XOR的原始争论。本节完·下一站:4.2人工神经网络的基本结构。单个神经元已经会算;那把它们按"层"叠起来,为什么就能从像素认出一个数字?人工智能通识·第4章·人工神经网络4.2人工神经网络的基本结构4.2·学习目标学完这一节,你能做出哪几件可检查的事?01用一句话说明:为什么去掉激活函数,无论网络叠多少层都只是一个线性模型。02对比Sigmoid、Tanh、ReLU三者的输出区间,并各指出一个主要局限(如梯度消失、死神经元)。03对着一个三层网络,指出输入层、隐藏层、输出层各自由几个神经元构成、各自在做什么。04解释全连接层"每个神经元连所有人"为什么会参数爆炸,以及它和过拟合的关系。4.2·学习路线这一节沿哪三步,看清网络的"骨架"?01激活函数:给网络装上"非线性"Sigmoid/Tanh/ReLU/Leaky/PReLU/Softmax各自的脾气与局限。02层级结构:原料→加工→成品输入层、隐藏层、输出层各管什么,特征如何逐层抽象。03全连接层:把特征"汇总"到答案每神经元连所有人,强大但代价是参数爆炸与过拟合。先懂"为什么需要非线性",再看网络怎么分层,最后看全连接的代价。本节驱动问题·DRIVINGQUESTION单个神经元已经会算,

为什么"连起来、叠起来"才谈得上智能?你会卡在哪里一个神经元就能做判断,那直接堆很多个,为什么还要分"层"?层与层之间到底多做了什么事?又是什么决定了第一层放784个、最后一层放10个?4.2·从单神经元到网络多叠一层,凭什么就多出一层"智能"?输入层隐藏层输出层判断:多一层不是多一个"开关",而是对上层特征再做一次非线性加工——层数越多,能组合出的特征越抽象。输入层—隐藏层—输出层的基本连接形态。4.2.1·激活函数激活函数到底在做什么?没有它会怎样?它是什么激活函数是网络中引入非线性的关键组件:对神经元加权求和后的结果再做一次变换,决定这个神经元该不该被"激活"、以及激活到什么程度。没有它去掉激活函数,每一层都只是线性变换;无论叠多少层,整体仍然等价于一个单层线性模型,学不会XOR这类复杂模式。直觉类比:它像一道"闸门"——不是所有信号都原样放行,而是按强度决定放大、压下还是拦下,这正是网络能弯曲决策面的原因。来源:教材4.2.1激活函数的作用。4.2.1·常用激活函数六个常用激活函数,输出区间与脾气各是什么?函数输出区间主要特点/局限Sigmoid(0,1)输出可解释为概率;两端饱和易致梯度消失Tanh(-1,1)零中心输出;仍存在两端饱和、梯度消失ReLU[0,+∞)计算简单、缓解梯度消失;负区间可能"死神经元"LeakyReLU(-∞,+∞)负区间给小固定斜率,缓解"死神经元"PReLU(-∞,+∞)负区间斜率由数据自己学,而非人工固定Softmax和为1输出各类别概率;通常只放在多分类输出层4.2.1·为什么被淘汰Sigmoid明明平滑,为什么深网里被"嫌弃"?①两端饱和

输入很大或很小,曲线几乎压平②梯度≈0

平处斜率接近零,反向误差被乘没③传不回去

浅层几乎收不到"该怎么改"的信号这就是梯度消失:层数越深,误差在逐层相乘时被不断打折,靠前的层"学不动"。Tanh比Sigmoid好一点(零中心),但两端同样会饱和。来源:教材4.2.1Sigmoid/Tanh的局限(示意流程)。4.2.1·ReLUReLU凭什么成为默认?"死神经元"又是什么坑?为什么它成为主流正区间梯度恒为1,不会饱和,误差能顺畅传回计算就是max(0,x),极快、省算力缓解了Sigmoid的梯度消失问题它留下的坑与补救输入长期为负时梯度为0,神经元不再更新——"死神经元"LeakyReLU:负区间留一个很小的固定斜率PReLU:负区间斜率交给数据自己学判断:没有任何激活函数是完美的。ReLU用"简单+不饱和"换来了可训练的深网,代价是要额外防"死神经元";这正是深度学习里常见的"权衡"。来源:教材4.2.1ReLU/LeakyReLU/PReLU。4.2.1·Softmax的位置Softmax那么好用,为什么不让它进隐藏层?它做什么把一组未归一化的分数,变换成和为1的概率分布——正好回答"这张图属于0–9哪一类"。为什么只在末层它本质是"对外宣布答案"。若放进隐藏层,会强迫中间特征也归一化成概率,抹掉中间表示的表达力——隐藏层需要ReLU这类保留特征、可叠加的函数,而不是马上归一。记法:隐藏层"攒特征"(ReLU),输出层"报概率"(Softmax)。来源:教材4.2.1Softmax的使用位置。4.2.2·层级结构一张流水线:输入层、隐藏层、输出层输入层·原料接收原始数据(如像素)。只负责"把数据端进来",自身不做计算,神经元个数=输入特征维数。隐藏层·加工夹在中间,可不止一层。逐层对上一层输出做变换,提取并组合特征——网络的"脑力"主要在这里。输出层·成品把加工好的特征变成最终答案。神经元个数=类别数(分类)或一个值(回归)。判断:层数与每层神经元数不是拍脑袋定的——输入层跟着数据走,输出层跟着任务走,中间隐藏层决定模型容量。来源:教材4.2.2层级结构(输入层/隐藏层/输出层)。4.2.2·输入层28×28的小图,输入层凭什么是784?28×28灰度像素图(示意)摊平成一维784=28×28个像素亮度值每个像素=一个输入神经元输入层

共784个神经元所以"输入层神经元数=输入维度"。图像是二维的,但网络第一层只能读一串数——它根本不知道这串数原来排成几行几列。来源:教材4.2.2手写数字识别示例(MNIST,28×28)。4.2.2·隐藏层在做什么同一串像素,怎么越看越"高级"?输入784个像素亮度值(原始)隐藏1边缘/笔画走向隐藏2局部形状(弧线、拐角)组合输出Softmax输出0–9各类概率,取最大者判断:每一层不"认识数字",只把上一层的低级特征组合成更高级的表示;层数越多,最终特征越接近"这个数字长什么样"。来源:教材4.2.2手写数字识别层级示例(示意抽象阶梯)。4.2.2·输出层输出层,为什么分类和回归长得不一样?分类任务(这是几?)输出层神经元数=类别数(如10类)经Softmax变成和为1的概率分布取概率最大者作为最终类别回归任务(值多少?)通常只要1个输出神经元直接输出一个连续数值(如房价)不套Softmax,也不做概率解释判断:输出层长什么样,是由"你要一个类别,还是一个数"决定的——不是随便放多少个神经元。来源:教材4.2.2输出层与任务的对应关系。4.2.3·全连接层"全连接"到底是什么意思?它强在哪?定义全连接层(FC层):相邻两层之间,每一个神经元都和下一层每个神经元相连,每一条连接都有一个可学习的权重。它的作用把前面各层提取的特征"全部汇总、整体组合",再映射到要预测的输出——所以它常放在网络末尾。代价预告:连接数=上一层神经元数×下一层神经元数。两边一多,参数会飞快上涨——下一页专门算这笔账。来源:教材4.2.3全连接层(FC层)的特点与作用。4.2.3·全连接的代价参数一多,为什么模型反而会"学坏"?先算一笔账仅一层784→1000,权重就有784×1000≈78万;再叠几层,参数轻松上百万。两个后果训练变慢、吃显存

每多一个参数,就要存它的值和梯度,硬件压力陡增。过拟合

容量太大,模型把训练集里的噪声也背下来,新数据上反而更差。所以工程上不会无脑堆全连接——后面会用卷积等更省参数的结构,以及正则化来控制过拟合。计算为示意:784×1000≈78万;参数规模与过拟合关系见教材4.2.3。实战案例·教学补充校园手势识别,网络该怎么"排层"?背景课堂想统计学生"举手/OK/点赞"三种手势,做互动反馈。问题输入是64×64灰度图、要分3类——三层网络各放几个神经元?方案输入层64×64=4096→两个隐藏层逐步降维、用ReLU→输出层3个神经元接Softmax。结果作为教学原型能跑通全流程;但4096维输入参数太大,真实产品会换卷积并加正则防过拟合。可迁移判断:搭网络先问三件事——输入几维?分几类?中间要不要降维?再回头算参数量,别等训练不动才发现太大。教学示意案例(合理重构场景,非某真实产品披露数据)。AI实训·结合AI一起做和AI一起:为手写数字设计网络,并追问三个为什么任务请AI写出一个三层全连接网络的层结构:每层几个神经元、用什么激活函数。输入/场景输入28×28手写灰度图,输出0–9共10类;先自己估一版,再让AI给参考答案。完成标准①写出每层神经元数与对应激活函数②问AI:为什么隐藏层用ReLU,而不用Sigmoid?③问AI:为什么输出层是10个神经元并接Softmax?提示:不要只抄AI的答案。先自己写一版结构,再用它来质疑和补漏——重点是能否说出每个选择背后的"为什么"。练习场景:教学任务,先自评、再用AI对照。本节小结·回到驱动问题单个神经元已经会算,为什么"连起来、叠起来"才谈得上智能?01没有非线性激活函数,叠再多层也只是一个线性模型。02三层分工:输入层接数据、隐藏层攒特征、输出层报答案。03隐藏层越叠越抽象:像素→边缘→局部形状→类别。04全连接强但参数爆炸,必须警惕过拟合。一句话:智能不在单元多,而在"非线性+分层抽象+可控参数"。迁移·课后延伸离开这节课,你还能拿它去想什么??课后思考1:卷积网络为什么不把图摊平?它是不是在用我们这节课"被迫丢掉"的二维空间结构??课后思考2:把你设计的网络结构拿给AI看,请它指出"哪一层参数可能过多、该怎么砍"。延伸资源·预习4.3:结构搭好了,那成千上万的权重,到底是怎么"学"出来的?·有余力可查:为什么ReLU让"训练很深的网络"第一次变得可行。本节完·下一站:4.3人工神经网络的训练过程。结构搭好了,那成千上万的权重,到底是怎么一点点"学"出来的?人工智能通识·第4章·人工神经网络4.3人工神经网络的训练过程4.3·学习目标学完这一节,你能做出哪几件可检查的事?01按顺序复述训练闭环的八个阶段,并指出哪几步在"反复循环"。02区分前向传播与反向传播:各做什么、误差从哪一层传向哪一层。03说明MSE与交叉熵分别对应回归、哪类任务,为什么它是"指南针"。04各举一例,说明正则化、学习率调度、早停、Dropout、批归一化分别防什么。来源:本小节教学目标,课后可用复述与对照图自检。4.3·学习路线这一节沿哪三步,看清网络"怎么学"?01训练闭环:八个阶段怎么循环从数据预处理到前向、反向、更新、再迭代,形成闭环。02核心引擎:反向传播与参数更新损失是指南针,链式法则算梯度,优化算法决定怎么走。03防学歪:优化技巧与过拟合正则化、学习率调度、数据增强、早停、Dropout、批归一化。阅读顺序:先看闭环全貌,再拆解核心引擎,最后看怎么防止它学歪。本节驱动问题·DRIVINGQUESTION初始权重全是瞎猜的,

它凭什么把自己"练"出本事?你会卡在哪里一开始错得离谱,它怎么知道往哪个方向改、一次改多少?又是靠什么,保证它不会越练越糟、把训练集背下来却认不出新数据?4.3·训练的本质训练到底在干嘛?像教一个孩子认水果不断给例子

摆出一张又一张水果图纠正错误

"错了,这是苹果,不是橘子"能答对

再见红色圆果,能认出苹果本质:训练是一个端到端的迭代优化过程——通过调整权重和偏置,让模型的输出一步步逼近真实值。它不是一次算出来的,而是"试错→改进→再试错"。来源:教材4.3训练过程的总述。4.3.1·训练流程八个阶段连成一个闭环,哪四步在"循环"?1预处理

归一化/标准化2定义损失

损失函数3初始化

随机取权重偏置4前向传播

网络先"猜"5计算损失

差了多少6反向传播

链式法则算梯度7参数更新

沿梯度调权重8重复迭代

直到收敛停止再喂下一批数据判断:1–3只做一次;4→5→6→7→8才是反复循环的心脏,每喂一批数据就转一圈,直到损失不再下降。来源:教材4.3.1训练流程八阶段(图4-7重绘为流程示意)。4.3.1·阶段1数据预处理开练之前,为什么要先把数据"摆平"?归一化把数据缩到一个特定范围,比如0~1。让各输入处在相近尺度,权重更新不至于被某一维牵着走。标准化把数据均值变成0、标准差变成1。让数据围绕0对称分布,训练更稳。为什么:预处理让网络收敛更快、更准——相当于给孩子看之前,先把水果图片统一尺寸。来源:教材4.3.1(1)数据预处理。4.3.1·阶段2损失函数没有"猜错多少"这把尺,它怎么知道往哪改?损失函数(成本/误差函数)衡量预测值与真实值的差距,训练目标就是把它压到最小——它是网络的"指南针"。均方误差MSE适用于回归问题——预测一个连续数值(如房价),看离真值差多少。交叉熵损失适用于分类问题——衡量预测概率分布与真实类别的差距。选错损失函数,等于指南针指错方向——哪怕训练再努力,也会朝错误的目标逼近。来源:教材4.3.1(2)定义损失函数。4.3.1·阶段3参数初始化权重为什么不能全设成0,必须"随机"?怎么做从某个分布(如均匀分布、高斯分布)随机采样初始权重和偏置;合适的初始化让模型收敛更快、避免梯度消失或爆炸。为什么不能全0若全设成0,同一层所有神经元算出一模一样的结果、收到一模一样的梯度,永远无法分化成不同的特征检测器——网络白搭。记法:随机初始化=给每个神经元一个"不一样的起点",它们才有机会长成不同的样子。来源:教材4.3.1(3)初始化参数。4.3.1·阶段4–5一次"猜"是怎么发生的,又怎么知道错多少?输入层

接收原始数据隐藏层

加权求和+激活输出层

给出预测前向传播:数据从输入层一路算到输出层,是网络在"猜"。接着:算损失拿到预测后,用损失函数对照真实标签,算出"猜错了多少"。这个数就是下一步改参数的依据——像告诉孩子:"错了,这是苹果。"来源:教材4.3.1(4)前向传播、(5)计算损失。4.3.1·阶段6反向传播(核心)知道猜错了,怎么把"责任"一层层分回去?输出层

损失在这里隐藏层

逐层往前传梯度输入层

梯度一直算到这里从后往前,方向与前向相反用链式法则,计算损失对每个参数的梯度(损失对该参数的偏导)——即"每个权重该为这次错误负多大责任"。拿到这些梯度,才知道每个权重往哪个方向、调多大。孩子也是这样分析:错在颜色还是形状?再调整判断标准。来源:教材4.3.1(6)反向传播——训练的核心步骤。4.3.1·阶段7参数更新知道方向了,一步迈多大才合适?梯度下降三兄弟:一次看多少数据批量梯度下降看完全部数据再改,方向稳但慢。随机梯度下降SGD看一个样本就改,快但方向抖。小批量梯度下降看一小批再改——工业界最常用。更聪明的还有Adam、Adagrad等,会为每个参数自动调节步长,按任务和数据挑选。这就是"学习":按梯度把权重往损失更小的方向挪,下次遇到类似输入就更准。来源:教材4.3.1(7)参数更新与优化算法。4.3.1·阶段8重复迭代这个循环什么时候停?别练到把题背下来循环里发生什么每一圈都前向、算损失、反向、更新;随迭代推进,损失逐渐下降、预测越来越准。怎么停达到最大迭代次数

事先定好轮数,到点就收。损失收敛到阈值

损失不再明显下降,就认为够了。光看训练损失会"自欺欺人"——后面早停法还要用验证集判断该不该停。来源:教材4.3.1(8)重复迭代与停止条件。4.3.2·优化技巧①正则化怎么防止它把训练题"背"下来?在损失函数里加一个"正则化项",限制权重别太大、别太专横,逼模型别死记噪声。L1正则化倾向产生稀疏权重——很多权重直接变0,等于自动挑出重要特征。L2正则化倾向产生较小的权重——不让任何一个特征说了算,整体更平滑。直觉:正则化像给网络"打疫苗",让它别过度记住训练集里的噪声和细节,从而在新数据上更稳。来源:教材4.3.2(1)正则化。4.3.2·优化技巧②③步子忽大忽小,为什么反而更聪明?学习率调度动态调更新步长:开始大步快走、后期小步慢走。常见策略:指数衰减、余弦退火等。数据增强对原图做旋转、缩放、平移、翻转、加噪,凭空多出一批"新练习题",帮模型抓住本质、提高泛化。两者分工:学习率调度调"怎么走",数据增强补"练多少"——一个优化过程,一个扩充样本。来源:教材4.3.2(2)学习率调度、(3)数据增强。4.3.2·优化技巧④⑤⑥还剩三招,怎么让它练得更稳、更通用?早停法盯着验证集:一旦它不再提升甚至变差,立刻停——别让它把训练集背熟。Dropout训练时随机关掉一部分神经元,不让它们互相依赖,强迫每个都学点真本事。批归一化每个隐藏层后把输出标准化,让各层都在稳定分布上训练,收敛更快更稳。三招分工:早停管"何时停",Dropout管"怎么练",批归一化管"每层练得稳不稳"。来源:教材4.3.2(4)早停法、(5)Dropout、(6)批归一化。实战案例·教学补充手写数字分类器"考试"掉分,调了什么才救回来?背景课程演示:用一个两层全连接网络识别0–9手写数字。问题训练集越练越准,可换到新一批手写数字上明显掉点——疑似过拟合、死记了训练图。方案加L2正则化+隐藏层Dropout;用早停法盯验证集;学习率先大后小地衰减。结果验证集掉分被止住、回升稳定,新数字上的表现明显更可靠——过拟合被压住了。可迁移判断:训练准≠会考试;先怀疑过拟合,再上正则化/Dropout/早停。教学案例,数值为示意,用于说明调参思路;非教材原文事实。结合AI一起做·HANDS-ON和大模型一起,把训练闭环亲手走一遍任务向AI对话助手提问题,让它带你搭一个最小训练流程,并解释每个环节。场景一组二维特征+标签的小数据集;要求拆出"前向→损失→反向→更新"四段。完成标准①能说清八阶段每一步在干嘛;②能指出"猜/打分/分责任/调整"各对应哪一步;③能说出至少一种防过拟合技巧及其作用。实训任务,用于课堂动手;答案不在本页,完成后自行对照八阶段闭环自查。本节小结·回到驱动问题瞎猜的权重,到底是怎么练出本事的?1训练=前向猜→损失打分→反向分责→梯度更新的闭环迭代,不是一次算出来。2损失函数是指南针,反向传播靠链式法则把责任层层分回去——这是核心。3正则化/Dropout/早停防"背题",让模型换一批新数据也考得住。判断:本事不是"想"出来的,是在一次次试错与纠错的闭环里,被梯度一点点调出来的。小结:4.3节八阶段训练流程与优化技巧。迁移·延伸离开课件后,你还能接着追什么?课后思考网络越深、层越多,梯度在往回传的时候会发生什么?——这正是下一节"深度学习的基本原理"要回答的问题。延伸资源·动手跑一个最小手写数字训练;·推导一遍反向传播的链式法则;·对比SGD与Adam的步长差异。下一节预告:既然训练闭环已经清楚,为什么还要"深度"?为什么要把网络"叠"得很深?它到底在深什么?人工智能通识·第4章·人工神经网络4.4深度学习的基本原理学习目标·WHATYOUCANDO学完这一节,你能做到这五件事1用"剥洋葱"说出深度学习如何从像素一层层剥到类别。2指认输入层、隐藏层、输出层各自接收什么、做什么。3用厨师类比复述"前向→损失→反向→优化"的训练循环。4说出深度学习成功的三要素,以及至少两种防过拟合技巧。5解释什么是端到端学习,以及它省去了哪一步手工工作。本节对应教材4.4深度学习的基本原理。学习路线·MAP这一节,分三站把"深"讲透第一站它"深"在哪

剥洋葱式分层提取特征第二站它怎么练

前向·损失·反向·优化第三站它靠什么成

数据·算力·技巧顺序:先看它长什么样、怎么分层,再看它怎么练,最后看它凭什么能成。本节路线:分层→训练→成功要素。本节驱动问题·DRIVINGQUESTION一层网络就能算,

为什么非要叠成很多层的"深"网络?你会卡在哪里多几层,不就是多堆几个计算单元吗?难道每多一层就聪明一点?它到底"深"在哪里?又是凭什么,让这一大团网络能自动认出猫和狗?4.4·它"深"在哪"深"的意义:像剥洋葱,一层层剥到核心第一层·外皮图像里的像素、文本里的单词——最原始的输入。第二层·纹理颜色、形状、短语——把外皮组合出的中间层。最后层·核心物体类别(猫/狗)、句子意思。判断:分层处理让网络能一步步从简单到复杂地理解数据——这就是"深"。来源:教材4.4深度学习核心思想(剥洋葱比喻,图4-8示意重绘)。4.4·典型网络的三层同一张图流过去,三层各在干什么?输入层接收原始数据:图片像素矩阵、一句话的词向量。隐藏层洋葱中间层:加权+激活(ReLU/Sigmoid/Tanh),变成更抽象的特征。输出层根据最后特征给出答案:图里是猫还是狗。关键:隐藏层是"深"的载体——它不只是一层,而是很多层叠在一起,层层往上抽象。来源:教材4.4典型网络的输入层/隐藏层/输出层。4.4·分层特征提取越往上看得越"高级":从边缘一路到类别较低层捕捉边缘、纹理等低级特征。中间层把低级特征组合成局部形状、部件。较高层识别物体形状、类别等复杂模式。每一层都对上一层输出做非线性变换,特征因此一步步抽象上去。来源:教材4.4隐藏层多层结构与分层特征提取。4.4·它怎么练它怎么练?用"做菜"走一遍这个循环前向传播·厨师做菜原材料(输入)经多道工序(各层)→成品(输出)。损失函数·美食评论家评成品与客人期望(真实标签)差多少。反向传播·经验师傅按反馈指导怎么改每道工序(各层权重)。优化·一步步调整梯度下降/Adam更新权重,把误差压到最低。和上一节的八阶段是同一套机制,这里换成人话:做菜、被点评、师傅带、再改进。来源:教材4.4训练过程的厨师/评论家/师傅类比。4.4·优化与学习率改作业的"步子",多大才合适?学习率就是每次改作业时迈的步子——它决定权重每次更新多少。步子太大容易走过头、来回震荡,反而到不了最低点。步子太小慢吞吞,收敛很慢,训练拖得很久。所以要用梯度下降或Adam等优化算法,一步步更新权重,把误差慢慢降到最低——既不能莽,也不能磨。来源:教材4.4学习率与梯度下降/Adam更新。4.4·端到端学习它最省心的一点:原始数据到答案一步走完传统做法人要先手动设计特征:手工调边缘检测器、形状描述符,再喂给分类器。深度学习·端到端从原始数据→输出结果一步完成,中间不用手动设计特征。例子:Transformer直接读句子、自动抓语义;CNN从像素一路提取边缘、纹理到物体类别——省去了手工设计特征的麻烦。来源:教材4.4端到端学习与Transformer/CNN例子。4.4·它靠什么成它凭什么能成?三样东西缺一不可大规模标注数据足够多、足够丰富,模型才学得到一般规则,而不是只记住训练样本。强大计算力GPU/TPU等加速器同时处理成千上万张图,大幅缩短训练时间。防过拟合技巧批归一化、Dropout、权重衰减,防止把训练数据背得太死。判断:光有结构不够——深度学习是"数据+算力+技巧"共同喂出来的。来源:教材4.4深度学习成功的要素。4.4·防过拟合三道保险怕它把训练题背得太死?三道保险批归一化让每一层的输入都保持在合适范围,训练更稳。Dropout随机让一部分神经元"休息",避免过度依赖少数节点。权重衰减也就是L2正则化,限制权重别过大。目的一致:让模型换一批新数据也考得住,而不是只在训练集上好看。来源:教材4.4批归一化/Dropout/权重衰减(L2)。4.4·它的代价它这么强,为什么还被说"看不懂"?贵多层结构复杂,对数据量和算力要求高,训练时间和成本都不低。黑箱它的决定由成千上万个权重共同做出,我们很难彻底理解"它为什么这么做"。这不是要否定它——而是提醒:用它的同时,要正视这些代价与可解释性问题。来源:教材4.4深度学习的挑战。4.4·应对方法嫌它吃数据、看不懂?研究者给了三剂新药迁移学习把在大数据上学到的知识,搬到小数据任务上用。注意力机制让模型把注意力放在更重要的部分上,别平均用力。GAN生成对抗网络,用来合成新数据或增强样本。三剂药合起来,是为了让深度学习更灵活、更实用——也是下一节"明星模型"的技术伏笔。来源:教材4.4迁移学习/注意力机制/生成对抗网络(GAN)。4.4·应用领域今天,它已经渗进了哪些日常?图像识别认猫认狗、人脸、医学影像。语音处理语音识别、语音助手、转写。自然语言理解机器翻译、对话、阅读理解。判断:在大数据和硬件加速支持下,深度学习已成为人工智能的核心技术。来源:教材4.4结尾应用概述。实战案例·教学补充垃圾分类:为什么不靠"绿瓶子=塑料"的手写规则?背景同学想做一个校园垃圾分类自动识别。问题他想手写规则"绿色瓶子就是塑料"——换个角度、换个光照就判错。方案改用CNN端到端,从像素自动学到形状与颜色;叠加数据增强和Dropout。结果换角度、换光照仍能分对,还省掉了一条条手写规则。可迁移判断:别再手写"特征规则",让网络端到端自己学特征。教学案例,数值为示意,用于说明端到端与防过拟合;非教材原文事实。结合AI一起做·HANDS-ON和大模型一起,画出你自己的"洋葱分层图"任务选一个你熟悉的识别任务,向AI请教它"可能怎么分层提取特征"。场景比如识别手势、识别某类声音——先给出原始输入,再让AI猜各层提取什么。完成标准①能画出输入/隐藏/输出三层;②能说清每一层抽象到什么程度;③能指出端到端学习省去了哪一步手工工作。实训任务,用于课堂动手;答案不在本页,完成后对照分层结构自查。4.4·关键一问叠很多层,为什么还必须靠"非线性"?只有线性变换无论叠多少层,整体仍等价于一次线性变换——深层的层数就白费了。加上非线性激活ReLU/Sigmoid/Tanh让每一层产生弯曲,多层叠加才能拟合复杂模式。判断:"深"之所以有用,靠的正是每层的非线性变换——否则层数再多也只是一层。来源:教材4.4每一层对上一层输出做非线性变换。本节小结·回到驱动问题回到开头:到底为什么非要"深"?1"深"是分层从简单到复杂——像素、纹理、类别层层剥洋葱,不是单纯堆计算单元。2训练仍是前向→损失→反向→优化,但端到端,省去了手工设计特征。3它成于数据+算力+技巧;代价是贵,且有"黑箱"。判断:深度不是为了大,而是为了让特征能层层抽象、端到端自动学出来。小结:4.4节深度学习的基本原理。迁移·延伸离开课件后,你还能接着追什么?课后思考CNN和Transformer,为什么一个更适合图像、一个更适合文本?——这正是下一节"明星模型"要展开的。延伸资源·看一个CNN逐层特征可视化;·了解注意力机制怎么"挑重点";·动手试一次迁移学习。下一节预告:原理都清楚了,有哪些真正改变世界的"明星模型"?ResNet、Transformer、GAN:它们各自凭什么改写了一个领域?人工智能通识·第4章·人工神经网络4.5深度学习的明星模型学习目标·WHATYOUCANDO学完这一节,你能做到这五件事1说清ResNet的残差连接解决了什么老问题。2说清Transformer的自注意力为什么能取代RNN。3说出GAN的生成器与判别器是怎么对抗的。4为三个模型各举出一个真实应用场景。5对比三者各自革新了哪个领域、凭什么成了"明星"。本节对应教材4.5深度学习的明星模型。学习路线·MAP这一节,按三位"明星"各走一站第一位ResNet

让网络敢加深第二位Transformer

让语言有全局注意力第三位GAN

让机器学会创造顺序:视觉先深(ResNet)→语言并行(Transformer)→开始生成(GAN)。本节路线:ResNet→Transformer→GAN。本节驱动问题·DRIVINGQUESTION模型那么多,凭什么偏偏是这三个

成了"明星"?你会卡在哪里它们各自赶上了什么时机?又各自打破了哪个前人解不开的死结?为什么是"加深"、"自注意力"、"对抗生成"这三个方向真正改写了领域?引入·三个方向为什么这三个方向,各自出圈?不同领域卡在不同瓶颈,于是长出了不同的"明星"设计。图像处理网络越深特征越好,但太深训不动——→ResNet自然语言逐词处理太慢,也看不全上下文——→Transformer生成任务机器只会分类,还不会"造"新东西——→GAN判断:明星模型不是巧合,而是各自回应了一个真实卡住全行业的瓶颈。来源:教材4.5开篇——三模型分别推动图像、语言与生成发展。第一位明星·ResNet·何恺明等2015为什么网络越深,反而越难训练?按直觉,层数越多表达越强。可在ResNet出现前,事实却相反——增加层数→梯度消失或爆炸,深层网络难以训练,性能甚至不如更浅的网络。死结在哪"深度"的潜力被训练困难卡住,没人敢把网络做深。ResNet的任务,就是解开这个死结——让人敢把网络做到上百层。来源:教材4.5.1——ResNet前增加层数导致梯度消失/爆炸。ResNet的核心创新为什么"抄近路",网络就训得动了?引入"快捷连接":把输入直接加到输出上,网络只学输入与输出的差异(残差),不学输出本身。x卷积层F(x)+x+F(x)快捷连接:x抄近路直送相加就像老师不直接给答案,而是教你怎么从已知条件推到答案——缓解梯度消失,可训数百上千层。来源:教材4.5.1——残差连接/快捷连接,学残差而非输出本身。ResNet的成绩单152层夺冠后,它又去哪了?战绩ImageNet竞赛夺冠;152层版本大幅提高图像分类精度,证明"深度"的价值。溢出到这些领域·目标检测(如FasterRCNN)·图像分割、视频分析·医疗影像:X光/MRI识别肺炎、肿瘤·自动驾驶:识别行人、车辆、交通标志像一位经验丰富的医生,从复杂影像里读出疾病特征——这就是"敢做深"带来的红利。来源:教材4.5.1——152层ImageNet夺冠及各领域应用。第二位明星·Transformer·Vaswani等2017读长句子时,RNN为什么越读越累?RNN的老做法逐词顺序处理,慢;靠中间隐状态把信息往后传,隔得远的两个词就容易失联。Transformer的改法摒弃序列处理,改为全并行;用自注意力让任意两个位置直接对话,建模全局上下文。核心转变:从"一个词一个词往后传",变成"一句话里任意两个位置同时看彼此"。来源:教材4.5.2——Transformer摒弃RNN序列处理,全并行+自注意力。Transformer的核心机制读句子时,凭什么盯着关键词?例句:他喜欢苹果强关联他喜欢苹果多头自注意力:模型能同时关注序列的不同部分,像一位阅读者同时读文章的不同段落、理解它们的关系。来源:教材4.5.2——注意力模拟人类阅读,"他喜欢苹果"例;多头自注意力。补齐顺序·两个代表光有注意力,模型怎么知道词的先后?自注意力把顺序"打散"了,于是用位置编码把每个词的先后位置重新加回来。BERT双向预训练、深刻理解上下文;擅长问答、文本分类、情感分析。GPT专注生成连贯文本;广泛用于对话系统与内容创作。一懂一问一答,一负责生成——共用同一套自注意力底座。来源:教材4.5.2——位置编码;BERT双向预训练,GPT生成。Transformer的通用性同一套注意力,怎么又看懂了图像?影响不止于语言:架构被搬到视觉和更多领域,通用性是它成"支柱"的原因。视觉VisionTransformer(ViT):把图像切块当"词"来读。多模态与推荐多模态任务、推荐系统,都在用这套架构。产品级应用机器翻译更准确流畅;智能助手如Grok的自然对话。判断:Transformer标志着深度学习进入新阶段——它的通用性,使其成为现代人工智能的支柱。来源:教材4.5.2——影响溢出到CV/多模态/推荐;机器翻译与智能助手。第三位明星·GAN·Goodfellow2014机器第一次学会了"创造"?由两个网络组成,靠对抗训练共同进步——这是它和"判别/分类"类模型最大的不同。生成器像技艺精湛的画家,努力生成能以假乱真的数据。对抗判别器像经验丰富的鉴定师,努力分辨哪些是真品、哪些是仿作。这场"猫鼠游戏"让机器从只会判别,第一次具备了创造全新内容的能力。来源:教材4.5.3——Goodfellow2014,生成器与判别器对抗。对抗的训练过程两个对手,怎么越打越强?1生成器尝试骗过判别器2判别器提高分辨真假的能力反复交替,彼此施压最终平衡:生成的数据几乎与真实数据无异——这就是"以假乱真"。来源:教材4.5.3——猫鼠游戏:不断对抗直到生成数据逼近真实。两代代表作与应用从"能生成"到"换风格",GAN走到哪了?DCGAN早期成功案例,结合卷积网络生成清晰图像,成为许多生成任务的基准。CycleGAN无监督学习实现风格转换:照片转艺术风,甚至把马换成斑马。落地:艺术创作、数据增强、虚拟人物、影视特效、游戏场景。训练稳定性仍是挑战,由此催生WGAN、StyleGAN等改进模型。判断:GAN把科学与艺术结合,为深度学习注入了"创造"这一新维度。来源:教材4.5.3——DCGAN/CycleGAN及各领域应用;WGAN/StyleGAN。三模型横评三家"明星",各自破了哪个死结?模型年份破的死结一句话革命ResNet2015深层网络梯度消失/爆炸,训不动残差连接,让人敢把网络做深Transformer2017RNN逐词慢、远距关系失联自注意力全并行,建模全局上下文GAN2014机器只会判别,不会"创造"生成器与判别器对抗,学会造新内容来源:教材4.5——三模型分别在CV/NLP/生成领域立里程碑。实战案例·教学补充手机里的三个AI功能,背后各是哪位"明星"?背景同学想弄清自己每天用的AI功能,到底靠哪种模型。问题相册识别人脸/物体、智能助手对话、AI换头像——三个功能分别对应哪个明星模型?判断识图分类→ResNet类视觉网络;对话→Transformer/GPT;换风格头像→GAN/CycleGAN。结果三个功能各自落到一个明星模型,理解了"为什么是它"。可迁移判断:看一个AI功能,先问它"在分类、在理解语言、还是在生成"。教学案例,用于模型归类练习;具体产品内部实现以公开技术资料为准。结合AI一起做·HANDS-ON做一次"模型侦探":猜猜背后是哪位明星任务选三个你身边的AI功能,向大模型请教各自可能用了哪种架构。场景给出功能描述,让它判断属于"分类/理解语言/生成",并说明理由。完成标准①三个功能各归到一类;②说出判断依据;③至少找出一个"反例"——同一功能也可能用别的模型。实训任务;答案不在本页,完成后按"分类/理解/生成"三类自查。本节小结·回到驱动问题回到开头:凭什么偏偏是这三个?1ResNet用残差连接,突破了深层网络的训练瓶颈。2Transformer以自注意力,革新了序列建模与全局上下文。3GAN以对抗训练,开启了"机器创造新内容"的新篇章。判断:它们既是学术里程碑,也是自动驾驶、医疗、对话、艺术背后的基石。小结:4.5深度学习的明星模型。迁移·延伸离开课件后,这些理念会怎样生长?课后思考为什么GAN的训练比普通分类更难稳住?这和"两个网络互相博弈"有什么关系?延伸资源·体验一次图像风格转换,感受GAN;·关注多模态大模型如何融合三者;·回看2017年Transformer原始论文。这些理念与架构,将继续启发下一轮突破。人工智能通识课·第四章深度学习机器如何"看懂"图像?从分类到生成的视觉智能演进4.6节深度学习在计算机视觉中的应用4.6学习目标学完本节,你能回答哪些问题?01能说出CNN从边缘、纹理到物体形状的特征提取层次02能区分图像分类、目标检测、图像分割三类任务的输出差异03能比较FasterRCNN与YOLO在精度与速度上的取舍04能解释GAN中生成器与判别器如何通过对抗"以假乱真"05能指出每类视觉任务在极端天气、标注成本等方面的真实局限学习路线视觉任务的难度,为什么是逐级递增的?图像分类输入:一张图输出:一个类别标签目标检测输入:一张图输出:位置框+类别图像分割输入:一张图输出:逐像素类别图像生成输入:噪声或文字提示输出:一张全新的、逼真的图像路线判断:从"贴一个标签"到"框出物体",再到"逐像素理解",最后到"凭空创造",任务粒度越来越细,对模型能力的要求也越来越高。本节驱动问题为什么深度学习能自动"看懂"图像,而传统方法要手工设计特征?困惑锚点你可能以为机器识别"猫"是靠人写的一条条规则,但它其实从未被告诉"猫有尖耳朵"——它是从百万张像素中自己总结出规律的。这个"自动提取特征"的能力,正是深度学习颠覆传统视觉的关键。图像分类·核心机制CNN是如何从像素中"逐级读懂"图像的?原始像素纯数字矩阵,机器原始输入低层:边缘纹理卷积提取边缘、纹理中层:物体部件组合边缘形成眼睛、轮子高层:语义类别全连接层输出"猫/狗"关键判断:多层卷积+池化=自动特征工程传统视觉需要人工设计"边缘检测器""方向直方图"等特征;CNN通过多层堆叠,让低层到高层的特征全部从数据中自动学出,这正是它在复杂任务上表现出色的根本原因。来源:《人工智能通识课》4.6节·卷积神经网络特征提取机制图像分类·演进从AlexNet到ResNet,靠什么不断刷高精度?2012AlexNetImageNet竞赛夺冠,标志深度学习在图像分类领域崛起加深网络VGGNet通过堆叠更多卷积层,提升特征表达能力残差连接ResNet引入残差连接,解决深层网络退化问题演进主线:层数越来越深,但单纯加深会遇到退化难题——ResNet的残差连接让"跳层"成为可能,这才是精度持续提升的关键。图像分类·落地图像分类在哪些真实场景中已经落地?电商平台:商品自动分类模型自动识别商品图片类别,优化搜索与推荐系统,让用户更快找到目标商品。社交媒体:内容安全审核分类模型自动识别不当或违规内容,提升平台安全性,减轻人工审核压力。场景识别:自动归类与检索对海量照片按场景自动归类,支撑相册检索、安防监控等下游应用。目标检测·概念目标检测比图像分类多了哪一步?图像分类:只回答"是什么"输入:整张图输出:一个类别标签不关心物体在图中的位置目标检测:回答"是什么+在哪里"输入:整张图输出:多个边界框,每个框附带一个类别同时完成分类与定位典型代表模型:RCNN系列·FasterRCNN·YOLO·SSD检测任务之所以更难,是因为图中可能出现任意数量的物体,模型不仅要分类,还要预测每个物体的坐标框。这就要求算法在"找候选区域"和"精细分类定位"之间做权衡。目标检测·框架对比FasterRCNN与YOLO,到底谁快谁准?对比维度FasterRCNN(两阶段)YOLO(单阶段)检测流程先由区域提议网络生成候选框,再分类与定位单次前向直接预测框与类别精度较高,检测性能更精细略低,但已满足多数实时场景速度较慢,适合离线高精度分析快,可实时检测多个物体适用场景对精度要求高的离线任务自动驾驶、实时监控等需快速响应来源:《人工智能通识课》4.6节·目标检测框架目标检测·边界与反例目标检测在什么情况下会"失明"?01极端天气:传感器数据失真大雾或暴雨下摄像头与雷达感知失效。特斯拉曾发生多起此类事故,正是在大雾天气中。02环境敏感:光照与角度波动模型对光照、拍摄角度等环境因素敏感,同一场景在不同条件下检测结果可能不稳定。03罕见场景:训练数据之外的盲区面对罕见交通参与者等非常规场景,模型表现明显下降,需持续补充数据与优化。图像分割·概念为什么图像分割要把每个像素都归类?分类:一个标签整图输出一个类别,不管边界检测:一个边界框框出物体,但框内是粗糙矩形分割:逐像素蒙版精确勾勒物体轮廓边界为什么需要这么细?以医学影像为例在CT或MRI中,医生需要精确知道肿瘤占据了哪些像素——边界框会把周围健康组织也框进来,无法区分。图像分割把肿瘤区域逐像素标出,帮助医生制定更精确的治疗方案。代表模型:U-Net、MaskR-CNN。图像分割·代表模型U-Net与MaskR-CNN,各擅长什么?对比维度U-NetMaskR-CNN设计目标专为生物医学图像分割设计更通用的实例分割模型核心结构编码器-解码器+跳跃连接识别物体同时分割其边界擅长精确分割细微结构区分同类不同个体真实案例:ResNet结合U-Net在X光片中识别肺炎区域,准确率达95%来源:《人工智能通识课》4.6节·图像分割应用图像分割·边界逐像素分割为什么用不便宜?01标注成本高需要逐像素标注,数据量大且标注过程复杂耗时。02计算资源重对算力要求较高,难以在手机等边缘设备上部署。03复杂背景与遮挡遇到复杂背景和遮挡物体时表现较差,需更高级算法与数据增强。图像生成·核心机制GAN是如何"无中生有"造出逼真图像的?生成器(画家)从随机噪声出发,生成一张"假"图像,目标是骗过判别器判别器(评论家)面对一张图,判断它是真实样本还是生成器伪造的对抗的结果:两个对手互相逼迫、共同进化生成器不断提高造假水平,判别器不断提高鉴别能力。最终生成器能造出足以"以假乱真"的图像——这就是GAN的核心思想。代表:StyleGAN(高分辨率人脸)、CycleGAN(无监督风格转换)。图像生成·代表模型StyleGAN与CycleGAN分别在做什么?StyleGAN·生成全新人脸生成高分辨率人脸图像,广泛应用于虚拟人物设计与艺术创作。影视行业用来生成逼真的虚拟角色或场景,游戏开发用来创建虚拟角色。CycleGAN·无监督风格转换把照片转成梵高风格画作,或将白天场景转为夜间场景。关键优势:无需成对训练数据即可完成风格转换。另一重价值:数据增强生成技术还能通过制造多样化训练样本,提升模型在小数据集上的表现。图像生成·边界"以假乱真"的生成,藏着哪些隐患?01"幻觉":造出不存在的东西生成器可能创建出现实世界中并不存在的物体或场景。02数据偏差:生成结果不公模型容易受训练数据偏差影响,可能产出不公平或歧视性内容。03训练稳定性:难以收敛对抗训练容易震荡,训练稳定性仍是待解难题。实战案例肺炎影像AI辅助诊断,如何帮基层医院"看懂"片子?背景基层医院经验丰富的影像科医生不足,肺炎X光片判读高度依赖人工,漏诊风险高。问题只做整图分类无法给出病灶位置,医生仍需逐片肉眼排查;需要精确标出可疑区域。方案采用ResNet结合U-Net,自动分割X光片中的肺炎区域,把病灶逐像素高亮给医生。结果识别肺炎区域准确率达95%,辅助医生制定更精确的治疗方案(教学示意案例)。AI实训任务:用AI把一张校园照"换"成赛博朋克风任务说明用即梦、通义万相等AI图像工具,对一张校园实拍照做风格转换,体会"输入图像+提示词"如何引导生成。输入/场景一张校园建筑照片;初始提示词参考:"将这张照片转为赛博朋克风格,保留建筑轮廓,加入霓虹灯与雨夜氛围。"完成标准提交原图与生成图各一张,并对比差异至少迭代2版提示词,记录哪一句改动带来了画面变化写出3条你总结出的提示词优化经验(练习场景)本节小结回到开头的问题:为什么深度学习能自动"看懂"图像?01深度学习的根本优势是自动特征工程——多层网络从数据中学出特征,取代了传统的手工设计。02视觉任务的输出粒度逐级变细:分类给标签,检测给框,分割给逐像素,生成则凭空造图。03每类能力都有明确边界:极端天气让检测失明,标注成本让分割昂贵,幻觉与偏差让生成需被约束。一句话判断:视觉智能的进步,就是"自动特征"把任务越做越细,同时把代价与边界越露越清楚。迁移与拓展下次再用视觉AI,你会先问什么?课后思考手机相册的"人脸聚类"属于哪一类视觉任务?它的输出粒度是什么?如果要做一个"识别红绿灯"的功能,选分类、检测还是分割?为什么?延伸资源回顾ResNet残差连接的原始论文,理解深层网络为何能训练在AI绘画工具中试用一次"图生图",体会CycleGAN式风格迁移的效果人工智能通识课·第四章深度学习机器如何"听懂"人类语言?从词法分析到深度语义理解4.7节自然语言处理与大语言模型4.7学习目标学完本节,你能回答哪些问题?01能说出自注意力机制如何让模型权衡句中每个词的重要性02能区分Transformer的编码器与解码器各自承担什么任务03能讲清"预训练+微调"两阶段分别在学什么04能列举大模型在医疗、法律、教育等领域的具体用法05能指出大模型在语义理解、偏见、算力上的三大挑战学习路线从"词法分析"到"深度语义",路是怎么走的?语言的复杂性词不只是排列,还有语境、情感、隐含意义Transformer编码器+解码器架构自注意力并行权衡词间权重预训练+微调海量学规律,任务再优化应用与挑战医疗、金融、法律、教育落地;语义局限、偏见、算力三大挑战并存。路线判断:理解语言的难点不在单字,而在词与词的关系——Transformer与自注意力正是为解决这个关系而生。本节驱动问题大语言模型真的"懂"语言吗,还是只是在玩高级的文字接龙?NLP·概念机器理解的"语言",到底难在哪?表面:一串单词的排列"我昨天在图书馆学习,然后去咖啡馆休息。"——每个词都认识,但真正的意思不在单词本身。背后:语境+情感+隐含"学习"和"图书馆"配对,"休息"和"咖啡馆"配对——机器要抓

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论