版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
大学本科三年级人工智能专业:深度学习算法优化策略教学实施教案
一、教学分析
(一)课程定位与教材分析
本课程为大学本科三年级人工智能专业核心必修课程“深度学习原理与应用”的关键专题模块。该模块在学生已系统掌握前馈神经网络、卷积神经网络、循环神经网络等基础架构后,聚焦于算法性能提升的核心环节——优化策略。课程共计4学时,2学分,属电子信息类国家级一流本科专业建设点核心课程,直接支撑工程教育认证毕业要求中“问题分析”“设计/开发解决方案”及“研究”等指标点。主教材选用IanGoodfellow等所著《深度学习》(DeepLearning)英文版及中文翻译版,参考教材涵盖邱锡鹏《神经网络与深度学习》及近三年NeurIPS、ICML、ICLR国际顶级会议中关于优化算法的综述与实证论文。【非常重要】辅助资源包括PyTorch官方教程、TensorFlowModelOptimizationToolkit文档及开源社区实现,自编实验指导手册《深度学习优化算法对比实验指南》已通过校级精品教材立项。【基础】
(二)学情分析
1.知识储备:学生已完成高等数学、线性代数、概率论与数理统计等数学基础课,修读Python科学计算栈(NumPy、Pandas、Matplotlib)及深度学习框架(PyTorch)入门课程,能够独立构建简单的卷积神经网络并完成CIFAR-10图像分类任务。前期测验显示,约65%的学生能准确写出反向传播链式法则,但仅20%的学生能解释学习率、动量系数对收敛性的影响机制,普遍将优化器视为“黑箱”。【重要】【难点】
2.能力特征:大三学生具备较强的逻辑推理与抽象思维能力,但工程调试经验严重不足。学生在机器学习基础课程中接触过梯度下降概念,却从未经历过梯度爆炸、损失震荡、收敛平台等真实训练困境,缺乏故障诊断的元认知策略。此外,学生个体间编程水平呈显著分化:前20%的学生已参与过Kaggle竞赛或教师科研项目,接触过LAMB、Lookahead等前沿变体;而后30%的学生仍困于反向传播公式的矩阵维度推导。【热点】
3.学习风格与动机:问卷调查显示,该年级83%的学生拥有个人GitHub账号,习惯通过StackOverflow、PyTorch论坛获取技术方案,对可视化调参工具(WeightsBiases、TensorBoard)抱有强烈好奇心。同时,学生对“调参炼丹”的刻板印象存在抵触,渴望理解算法设计背后的数学原理。因此,本设计需在“数学严谨性”与“工程直观性”之间建立桥梁,并设置分层任务满足差异化发展需求。【非常重要】
(三)教学目标
依据布鲁姆教育目标分类学(修订版)及工程教育认证毕业要求指标点1.3、2.2、4.1,确立以下三维目标:
1.知识目标:【基础】【高频考点】
(1)准确复述随机梯度下降及其变体(Momentum、NAG、AdaGrad、RMSProp、Adam)的迭代公式与几何意义。
(2)对比分析自适应学习率算法与固定学习率算法的适用场景、收敛速度与泛化性能差异。
(3)阐释批归一化、权重衰减、梯度裁剪等技术对优化曲面平滑度及训练稳定性的影响机理。【难点】
2.能力目标:【非常重要】【热点】
(1)能够基于PyTorch框架自主实现SGD、Momentum、RMSProp、Adam等优化器核心逻辑,并完成超参数对比实验与可视化分析。
(2)能够诊断深度学习训练过程中梯度消失、损失震荡、过拟合等典型故障,针对性地调整优化策略并验证效果。
(3)能够阅读并复现顶会论文中针对特定任务(如ViT、BERT微调、扩散模型)设计的定制化优化器模块,撰写结构化技术评述。【拓展】
3.素养目标:
(1)树立严谨求实的科学精神,深刻理解“无免费午餐”定理在优化算法演化中的哲学映射,拒绝盲目迷信单一算法。
(2)培养开源协作与学术规范意识,在实验报告中正确引用优化器原始论文,遵守CC协议进行代码复用与分发。
(3)增强技术伦理敏感性,辩证看待超参数自动搜索技术对算法工程师岗位能力的重塑挑战。
(四)教学重难点
1.教学重点:【重要】【高频考点】
(1)动量法对梯度更新路径的修正机制及其参数γ的物理意义。
(2)自适应学习率算法族(AdaGrad、RMSProp、Adam)的核心思想:从累积平方梯度到指数移动平均,再到一阶动量与偏置校正的完整演进逻辑。
(3)优化器与学习率调度、网络架构、正则化策略的联合调优系统工程方法。
2.教学难点:【难点】【热点】
(1)指数加权移动平均在动量计算与二阶矩估计中的无偏估计推导,以及Adam初始阶段偏置校正的必要性。
(2)二阶优化方法(如拟牛顿法、自然梯度法)与一阶方法的本质区别,及其在深度学习中鲜少应用的根本原因——计算复杂度与随机逼近困难。
(3)大规模分布式训练环境下同步SGD与异步SGD的收敛性保证差异,及梯度压缩技术对优化轨迹的影响。【拓展】
(五)教学策略与方法
本专题整体设计理念遵循“认知冲突—理论建构—实践验证—迁移创新”的体验学习圈模型,融合BOPPPS有效教学结构与翻转课堂范式。【非常重要】具体采用以下四种核心教学方法:
1.可视化启发式教学:使用优化景观可视化工具Optuna、Plotly动态展示不同优化算法在Rosenbrock函数、Ackley函数等高维非凸曲面上的迭代轨迹,将抽象的梯度向量场转化为直观的“寻宝路径”游戏,降低认知负荷。【重要】
2.代码拆解重构教学法:提供仅包含框架占位符的优化器模板类(Python),引导学生逐行补全梯度获取、缓存变量更新、参数更新等核心逻辑,在“填空”中破除黑箱恐惧,建立算法与代码的映射关系。【基础】
3.争议性议题辩论式教学:设置辩题“在计算机视觉主流任务中,Adam及其变体是否已完全取代SGD+Momentum?”,要求学生在课前检索文献、搜集证据,课堂上以小组为单位开展微型辩论,培养基于证据的批判性思维。【热点】
4.双元制项目化学习:以“优化器动物园”横向对比实验舱为贯穿整个模块的实战主线,各小组需完成涵盖经典、自适应、解耦、大规模等四大类共计12种优化器的系统性评估,产出包含量化指标、可视化证据、统计检验及理论解释的完整研究报告。【非常重要】
二、教学实施过程(核心环节)
本专题共计4学时,每学时50分钟,教学实施严格遵循课前导学、课中研学、课后拓学三段式闭环结构。下文以0.5学时为最小颗粒度进行全流程精准刻画。
(一)课前准备阶段(学生自主用时约70分钟,不计入学时)
1.自主学习任务单发布:【重要】
(1)微课学习:观看教师团队自制的交互式微课《梯度下降的困境与突围》,时长15分钟。微课采用Manim动画引擎,直观展示固定学习率SGD在狭长山谷地形中的锯齿振荡现象,并埋设“如何让梯度更聪明”的悬念。【基础】
(2)文本阅读:精读教材第8.1-8.3节,完成学习管理系统中嵌入的在线测验(8道选择题+2道公式推导填空题)。系统自动批阅并生成班级学情热力图,教师根据热力图确定课堂重点突破的共性盲区。【非常重要】
(3)环境就绪确认:要求每位学生在GoogleColab或本地PyTorch环境中成功运行教师提供的“ResNet-18_mini”脚本,该脚本已人为注释掉优化器定义行,仅保留模型、数据与训练循环骨架,为课堂第一节的代码拼图任务埋设接口。【基础】
2.差异化预习支架:【拓展】
(1)数学补丁包:针对在前期测验中暴露出矩阵求导薄弱的学生,通过LMS定向推送《向量对向量求导的链式法则实例详解》及3Blue1Brown相关视频片段。
(2)前沿速递包:针对申请参与科研训练的学生,附加阅读Adam原作者Kingma在2023年访谈录节选及ICLR2024关于自适应优化器泛化边界的最新投稿论文。
(二)课堂实施阶段(核心研学环节,总时长200分钟)
第一学时:困境具象化与第一次认知飞跃(50分钟)
1.导入与认知冲突制造(5分钟)【非常重要】
(1)对比实验引爆冲突:大屏幕实时运行两段代码——左屏:固定学习率SGD(η=0.01)在MNIST两层CNN上的训练曲线,损失剧烈起伏,验证集准确率徘徊于89%;右屏:同一模型,仅将学习率策略改为“人肉衰减”(每3轮手动降低10%),损失平滑下降,准确率跃升至94%。教师设问:“计算机能否学会自动调整学习步长?甚至为每个参数分配不同的步长?”学生陷入短暂静默后产生强烈求知欲。
(2)前知激活:随机抽取两名学生在黑板书写SGD参数更新通式:θ_{t+1}=θ_t-η·∇L(θ_t),并口头解释梯度方向为何指向最速上升反方向。此环节全员动笔,助教巡视确保无公式书写错误。【基础】
2.新知建构:动量法的双重本质(15分钟)【重要】【高频考点】
(1)物理类比驱动理解(5分钟):播放慢速动画——铁球从山顶滚下,并非直接沿瞬时梯度方向跳跃,而是累积历史动量冲过局部凹坑。教师同步板书:v_t=γ·v_{t-1}+η·∇L(θ_t);θ_{t+1}=θ_t-v_t。强调γ是摩擦系数(通常0.9),记忆长度约1/(1-γ)步。展示无动量SGD与动量SGD在Beale函数上的路径对比:前者呈密集锯齿,后者呈平滑螺旋。
(2)数学拆解与代码映射(5分钟):现场打开PyTorch源码风格的教学代码片段,引导学生发现torch.optim.SGD中momentum参数实际实现了上述累积逻辑。进一步提问:“能否在更新前看一眼未来的梯度?”引出Nesterov加速梯度(NAG)。板书NAG核心:先跳跃,再修正。公式表达:θ_{t+1}=θ_t-γ·v_{t-1}-η·∇L(θ_t-γ·v_{t-1})。【难点】
(3)直观演示(5分钟):在二维二次型曲面上对比标准动量与NAG的轨迹,NAG在接近极小值时减速更灵敏,振荡更小。
3.交互式代码拼图与即时反馈(20分钟)【核心实践】【非常重要】
(1)分组拼图任务(12分钟):班级分为6个小组,每组在Colab中接收到一份“残缺优化器”代码——已实现基础SGD,但Momentum更新逻辑被替换为注释。任务:参考板书公式,在TODO区域补全带动量项的参数更新行。教师通过LiveShare插件同时查看多组进度,典型错误包括:未保存历史梯度v_t、混淆η与γ的位置、未使用inplace更新导致计算图滞留。教师抓取典型错误截图匿名展示,全班共同纠错。
(2)画廊漫步与投票(8分钟):各组将补全后的代码训练损失曲线截图上传至Miro看板。学生自由浏览,投票选出“收敛最快组”与“曲线最平滑组”。教师针对动量系数过高(γ=0.99)导致发散的反例,引导学生总结动量系数应小于1且通常不低于0.5的经验规律。【热点】
4.小结与悬念植入(5分钟)
教师以思维导图形式总结:动量是优化器智能化的第一次跃升,但学习率全局固定仍是桎梏。展示一组极端稀疏特征(文本嵌入)的训练案例,提问:“经常出现的特征与罕见特征,是否应享有相同的学习率?”引出AdaGrad。【基础】
第二学时:自适应学习率的谱系建构与批判(50分钟)
1.复习与衔接(5分钟)
(1)快速诊断测验:通过Plickers实时答题,题目为“给定连续3步梯度值[2.0,1.5,0.8],γ=0.9,η=0.1,求动量法第3步的累积速度v_3”。全班作答正确率92%,显示动量计算已基本过关。【基础】
(2)衔接设问:回顾上节末的稀疏特征问题,点明本节核心——为每个维度配备自适应学习率。
2.核心概念三层进阶(20分钟)【非常重要】【高频考点】
(1)AdaGrad:累积历史平方梯度的洞见(6分钟):推导AdaGrad更新规则:θ_{t+1}=θ_t-η/√(G_t+ε)·∇L(θ_t),其中G_t=Σ_{τ=1}^tg_τ^2。强调其几何意义:频繁更新的参数(梯度大)学习率迅速衰减;稀疏参数(梯度零散)保持较大学习率。展示其在Glove词向量训练中的经典应用,同时指出致命缺陷——G_t单调递增导致学习率过早归零。【难点】
(2)RMSProp:移动平均拯救衰减(6分钟):由AdaGrad缺陷引出指数移动平均。板书:E[g²]t=ρ·E[g²]
{t-1}+(1-ρ)·g_t^2,ρ=0.9。更新式为θ_{t+1}=θ_t-η/√(E[g²]t+ε)·∇L(θ_t)。对比AdaGrad与RMSProp在非凸曲面上的轨迹,后者可持续下降至更优区域。
(3)Adam:动量+自适应+偏置校正的集大成者(8分钟):拆解Adam三要素。第一阶段:一阶矩(动量)m_t=β_1·m
{t-1}+(1-β_1)·g_t;第二阶段:二阶矩(RMSProp核心)v_t=β_2·v_{t-1}+(1-β_2)·g_t^2;第三阶段:偏置校正——m̂_t=m_t/(1-β_1^t),v̂_t=v_t/(1-β_2^t)。最终更新:θ_{t+1}=θ_t-η·m̂_t/(√v̂_t+ε)。教师强调:若无偏置校正,Adam在初始步将严重偏向于0,导致参数几乎不更新。【热点】
3.批判性思维介入:Adam是否完美无缺?(10分钟)【热点】【难点】
(1)正反观点交锋:教师展示Reddit论坛2018年经典论战截图。正方论据:Adam收敛极快,鲁棒性强,已为Transformer训练默认配置;反方论据:SGD+Momentum经精细调参在ImageNet上泛化性更优,Adam易收敛至尖锐极小值。
(2)理论深化:简述Reddi等人在ICLR2018《OntheConvergenceofAdamandBeyond》中构造的反例——Adam在某些简单凸问题上不收敛。由此引出AMSGrad修正:v̂_t取max(v̂_t,v̂_{t-1})。同时点明AdamW通过解耦权重衰减进一步提升了泛化性能。此环节意在打破学生对“最新=最优”的迷思,培养算法演化史观。【非常重要】
4.分组对抗式实验(13分钟)【核心实践】
(1)实验设定:在CIFAR-10简化ResNet-18上,分别采用SGD+Momentum、RMSProp、Adam。固定10个Epoch,各组仅可调整各自负责优化器的超参数,并需记录调参日志。
(2)实施与观察:各组将标量曲线推送至共享TensorBoard实例。全班实时观看三条曲线竞速:Adam前3个Epoch绝对领先,SGD缓慢爬升;第7轮后SGD反超Adam,RMSProp居中。教师捕捉这一典型现象,引出“自适应优化器初期激进、后期乏力”的共识,并介绍学习率热重启(CosineAnnealing)作为补救措施。【高频考点】
5.微小结(2分钟)
教师总结:从全盘自适应到动量与自适应结合,优化算法演化呈现螺旋上升。但超参数并未彻底解放——Adam仍有β_1、β_2、η需设定。下一学时将探讨更底层的优化辅助技术:归一化与梯度裁剪。
第三学时:优化支撑技术与诊断工具体系(50分钟)
1.学习率与批量大小的协同调优(15分钟)【重要】【高频考点】
(1)学习率调度策略全景(5分钟):超越固定衰减,展示分段衰减(StepLR)、指数衰减、余弦退火(CosineAnnealingLR)、线性预热(LinearWarmup)的PyTorch实现。利用matplotlib预绘制不同调度策略下的学习率曲线及对应训练损失轮廓,直观揭示预热阶段对于稳定大学习率初始训练的关键作用。【热点】
(2)批量大小与学习率的线性缩放法则(5分钟):阐述Goyal等人2017年论文核心发现——当批量大小乘以k时,学习率也应近似乘以k。但线性法则成立需配合预热。现场演示:在ResNet-50上,batchsize从256增至1024,若不调学习率,准确率骤降5%;若将lr从0.1增至0.4并预热5轮,准确率恢复。【难点】
(3)梯度累积:显存不足的工程对策(5分钟):演示通过accumulation_steps参数模拟大批量,强调其与真正大批量在BN统计量计算上的细微区别。
2.归一化与正则化的优化视角(20分钟)【非常重要】【高频考点】
(1)批归一化(BN):从ICS神话到平滑景观(7分钟):批判性回顾BatchNormalization原始论文中的InternalCovariateShift解释框架,引入Santurkar等人NIPS2018观点——BN使损失函数利普希茨常数更小,梯度预测性更强。现场实验:对比有无BN的VGG网络在CIFAR-10上的梯度范数分布直方图,有BN者梯度范数更集中,极少出现极端大值或小值。【热点】
(2)权重衰减与AdamW(7分钟):澄清深度学习圈流传五年的经典误解——L2正则化与权重衰减在SGD中数学等价,但在Adam中不等价。推导AdamW更新步骤:先从参数中减去权重衰减项,再执行Adam更新。展示使用AdamW后ImageNetTop-1准确率约提升0.5%的实证图表。【难点】
(3)梯度裁剪(6分钟):针对RNN、Transformer中梯度爆炸的专有急救术。现场故意构造梯度爆炸:在简单LSTM语言模型中,将权重初始化过大,loss瞬间变为NaN。教师执行torch.nn.utils.clip_grad_norm_,设定max_norm=1.0,训练恢复稳定。学生惊叹,深刻理解裁剪阈值设定的双刃剑效应。【基础】
3.可视化诊断工作流(10分钟)【重要】
(1)TensorBoard进阶应用:除损失曲线外,展示如何记录参数直方图、梯度直方图、激活值分布。案例:通过梯度直方图发现底层卷积层梯度范数接近零,诊断出网络初始化不当导致的梯度消失。
(2)W&BSweeps自动化调参演示:教师代理运行一次贝叶斯超参数搜索,对比网格搜索效率。学生虽不现场操作,但形成“人机协同调参”的未来工作想象。
4.实作巩固:为优化器加上辅助轮(5分钟)
学生回到第二学时的CIFAR-10实验代码,为各自负责的优化器添加余弦退火调度器及梯度裁剪。再次运行10轮,观察Adam后期乏力现象是否缓解。多组报告添加余弦退火后Adam最终准确率提升约2-3%。【非常重要】
第四学时:真实挑战实战与学术视野拓展(50分钟)
1.真实场景故障诊断挑战赛(25分钟)【非常重要】【热点】
(1)任务发布(5分钟):每个小组领取一个“故障训练脚本”。故障类型包括:①损失平台期(优化器陷入鞍点);②准确率震荡发散(学习率过大/动量过高);③验证Loss早于训练Loss上升(过拟合,需权重衰减);④梯度爆炸(NaNloss)。任务目标:20分钟内定位故障根源并修复,使模型在规定20轮内达到预设性能阈值。
(2)小组攻关与巡回指导(15分钟):教师提供“优化器急救箱”思维卡片,包含常见症状-病理-处方映射表。各组参照但不限于此,允许联网检索。教师观察各组策略:优秀组能迅速打印梯度范数、绘制特征图;中等组尝试盲目调低学习率;落后组陷入死循环。助教重点援助落后组,引导其从最简诊断输出(print梯度均值)入手。
(3)复盘与反思(5分钟):随机抽取3个小组陈述。其中一组面临过拟合,最初试图降低模型容量未果,后调整为AdamW并增大weight_decay至5e-4,验证损失显著下降。教师提炼:优化器选择需与正则化策略联动,孤立的参数调整往往徒劳。【高频考点】
2.前沿优化技术速览与价值导向(10分钟)【拓展】
(1)前沿变体掠影:教师以极快节奏介绍RAdam(用移动标准差纠正Adam收敛方差)、Lookahead(维护快慢两套权重,慢权重每k步插值)、LAMB(Layer-wiseAdaptiveMoments,用于BERT大规模预训练,支持百万级batchsize)。强调这些变体并非颠覆性创新,而是针对特定痛点(收敛稳定性、通信效率)的工程修补。
(2)优化器自动化搜索:简述DARTS框架如何将优化器类型、超参数作为架构参数进行可微分搜索,展示AutoML对未来算法工程师角色的重塑可能。
3.科学精神与价值观嵌入(5分钟)
教师引用Goodfellow“优化是科学,更是艺术”及LeCun“理解优化就像理解烹饪,配方可学,火候需练”。引导学生正视:当前深度学习优化理论仍远落后于实践,大量SOTA模型依赖于启发式调参。鼓励有志于基础研究的学生关注神经切线核、特征学习理论等优化理论前沿,将“炼丹”升华为“炼金”。
4.单元总结与分层作业发布(5分钟)
(1)师生共建知识图谱:教师在白板核心区绘制“优化算法族谱”,学生口述补充技术节点与标志性论文年份,完成集体知识建构。
(2)课后任务说明:【非常重要】
①基础必做:完成Kaggle“PyTorch优化器速度挑战赛”公开练习赛,提交可复现Notebook,要求可视化至少四种优化器的收敛曲线。
②进阶选做:复现ICLR2024一篇关于“梯度中心化”或“归一化流优化”的短文,撰写1500-2000字技术评述,格式参照《软件学报》技术评论专栏。
③团队项目:以3-4人小组为单位,自选CV/NLP/语音任一任务,系统比较至少6种优化器(含SGD、Adam、AdamW、RAdam、LAMB及自选一种),提交包含消融实验、统计检验(Wilcoxon符号秩检验)及理论归因的分析报告。优秀作品将推荐至学院本科生学术论坛及企业开放日展示。
(三)课后拓展阶段(深度学习与持续优化)
1.异步研讨深化:教师在课程Discord频道开设#optimizer_deep_dive子频道,每周发布一个思辨议题,如“大语言模型预训练为何几乎独尊AdamW?”“梯度裁剪阈值设置为1.0的经验主义是否合理?”要求学生运用本模块所学撰写微评论,并至少回应他人一点。教师择机介入,引导学生引用具体文献,避免空谈。【热点】
2.开源社区贡献引导:对完成进阶作业且代码功底扎实的学生,教师提供已标记“goodfirstissue”的优化器开源库名单(如PyTorch、Tianshou、OpenMMLab),指导学生完成首次PullRequest,体验从使用者到贡献者的身份转换。已有先例:前两届学生曾为Lightning-Bolts库贡献过RAdam的改进实现。【拓展】
3.个性化学习路径推荐:基于课堂实作完成速度与正确率,通过LMS向学生智能推送差异化学习包。对诊断思维薄弱者推送《机器学习调试:系统化方法》章节;对理论偏好者推送《深度学习的优化理论》综述中文翻译版。
三、教学评价与反思
(一)多元化发展性评价体系
本模块评价旨在超越“记忆公式”的浅层考核,建构指向高阶思维与工程素养的证据链。
1.形成性评价(权重45%):【重要】
(1)课前在线测验(5%):侧重于优化算法基本公式的记忆与简单应用,系统自动评分,未通过者需重测直至通过。【基础】
(2)课堂代码拼图完成度(15%):根据各组在Colab中的补全正确率、提交时效性进行评分,允许迭代改进,取最高分。
(3)画廊漫步投票及互评量表(10%):每位学生需为至少三个其他组的可视化成果填写结构化反馈(清晰度、洞察力、美学),同伴互评分数经归一化后计入总分。【非常重要】
(4)故障诊断挑战赛表现(15%):依据小组是否在限定时间内达成目标性能、诊断日志的逻辑清晰度、解决方案的创新性,由教师与助教共同评定。
2.终结性评价(权重55%):【非常重要】【高频考点】
(1)优化器对比实验报告(35%):包含摘要、问题定义、实验设计、结果可视化、统计分析、讨论与结论等完整章节。评分重点考察控制变量是否严谨、结论是否有数据支撑、是否讨论算法局限性。严禁直接拼接开源代码而不加引用,查重阈值设为15%。
(2)闭卷考试模块(20%):设置场景化选择题与简答题,如“某任务训练Loss持续在1.5附近震荡,请从优化器角度提出两种解决方案并解释原理”,避免死记硬背。
(二)教学反思与持续改进
1.设计亮点与实效:
(1)认知冲突策略效果显著:第一学时伊始的固定学习率与手动调参对比,使85%的学生在课后反馈中表示“意识到自动化优化的必要性”,远高于以往直接讲授算法的课堂。
(2)代码拆解任务精准打击难点:从学生提交的补全代码来看,95%的学生能够正确实现动量累加,对参数缓存的理解显著优于往届。
2.痛点与改进预案:
(1)Adam偏置校正环节仍有30%学生感到抽象。下轮授课拟引入Jupyter交互式滑动条,让学生观察t=1,2,5时校正系数(1-β^t)的具体数值变化,将纯数学符号转化为可操纵的变量。
(2)第四学时前沿速览部分容量过大,学生对LAMB、RAdam等变体仅停留于名词记忆。后续改为“海报集市”形式:将学生分组,每组负责一种变体,课前调研并在课堂上以3分钟闪电演讲形式分享,教师补充。从被动听讲转为主动建构。
四、板书与数字资源协同设计
(一)主副板书结构化布局
左侧主板书区(持久保留):纵向绘制“深度学习优化算法演进年轮”,以时间轴形式标注1986年BP算法(隐含SGD)、1999年Momentum、2011年AdaGrad、2012年RMSProp、2015年Adam、2017年AdamW、2019年RAdam/Lookahead、2021年LAMB等关键节点,并以箭头指示算法继承与批判关系。【基础】
右侧副板书区(随堂更新):速查表格——优化器超参数典型范围:SGDlr∈[
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026氢能源行业市场供需分析投资机会与发展规划研究
- 2026中国食品自动化行业市场现状供需分析及投资评估规划分析研究报告
- 某家具厂油漆管理准则
- 纺织原料检验流程细则
- 云原生应用可移植性标准技术协议
- 医用直线加速器辐射头防碰撞安全性评估报告
- 修脚服务作业标准
- 肺栓塞的长期随访管理
- 胃痛中医护理的常见问题解答
- 2026年初中地理中国地理专项卷
- 2025甘肃省民航机场集团招聘38人笔试历年难易错考点试卷带答案解析
- 硫铁矿制酸施工组织方案
- 地砖铺设闭水试验管控方案
- 军考2026年考试题及答案
- GB/T 47582-2026航空航天P形(环形)卡箍通用规范
- 2026地质队矿山水文岗面试题及答案
- 2026深静脉血栓形成诊断和治疗指南(第四版)全面解读
- 兵器集团人才学院题库
- 《JBT 8293-2025浮动油封》专题研究报告
- 采购文件三级审核制度
- 《工业用全氟壬烯、全氟-4-甲基-2-戊烯》编制说明
评论
0/150
提交评论