1深度学习-第一章 深度学习基础_第1页
1深度学习-第一章 深度学习基础_第2页
1深度学习-第一章 深度学习基础_第3页
1深度学习-第一章 深度学习基础_第4页
1深度学习-第一章 深度学习基础_第5页
已阅读5页,还剩29页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

《深度学习》第一章深度学习基础

第一节深度学习应用方勇纯南开大学

人工智能学院1.1深度学习应用深度学习的时代深度学习给世界带来了惊喜ChatGPT、图像及视频生成、AIforScience很多互联网公司都在从事深度学习研究Google、微软、DeepMind、OpenAI、DeepSeek、百度、阿里、腾讯、字节深度学习无处不在计算机视觉自然语言处理语音识别机器人1.1.1深度学习应用:ChatGPTChatGPT:OpenAI开发的一款人工智能聊天机器人程序,在很多领域都有广泛的应用潜力:学习辅助1.1.1深度学习应用:ChatGPTChatGPT:OpenAI开发的一款人工智能聊天机器人程序,在很多领域都有广泛的应用潜力:创意写作1.1.1深度学习应用:ChatGPTChatGPT:OpenAI开发的一款人工智能聊天机器人程序,在很多领域都有广泛的应用潜力:个性化智能助手1.1.1深度学习应用:ChatGPTChatGPT:OpenAI开发的一款人工智能聊天机器人程序,在很多领域都有广泛的应用潜力:虚拟角色扮演1.1.2深度学习应用:图像及视频生成使用Diffusion模型生成各种有趣且充满想象力的图片:1.1.2深度学习应用:图像及视频生成Sora:OpenAI公司发布的一个文生视频大模型

1.1.3深度学习应用:古卷轴破译赫库兰尼姆卷轴文字的破译赫库兰尼姆卷轴是收藏在赫库兰尼姆城图书馆的古代卷轴,在两千年前的苏威火山喷发时化为了焦炭VesuviusChallenge挑战赛于2023年开展,希望能够邀请全球优秀的研究人员利用新的智能技术破译古老卷轴中的文字参赛人员YoussefNader,LukeFarritor,和JulianSchilliger成功地使用深度学习技术破译了4页卷轴,每页有140个字符,这次破译的卷轴内容大约占全部卷轴的5%1.1.4图灵奖获得者1.1.5诺贝尔奖获得者《深度学习》第一章深度学习基础

第二节机器学习基础方勇纯南开大学

人工智能学院1.2机器学习机器学习是不显式编程地赋予计算机能力的研究领域核心:具有自学习能力利用经验提升系统对某种任务的处理能力经验以数据形式存储本质:通过数据产生模型学习到的模型在面对经验中没有出现的情况时,也能提供相应的判断或预测机器学习问题分类监督学习无监督学习强化学习1.2机器学习机器学习使用流程数据准备和预处理模型构建模型训练测试与泛化1.2.1数据准备和预处理经验以数据形式存储数据集由一个个样本组成每个样本由一组称为特征的属性组成,通常将一个样本表示成一个向量,其中向量的每一个元素

是一个特征例如,一张图片的特征通常是指这张图片的像素值;医疗患者的特征往往是一组标准的特征(如年龄、生命体征和检查结果)在监督学习问题中,要预测的是一个特殊的属性,被称为标签无监督学习则没有标签在监督学习中,样本形式为(特征,标签)1.2.1数据准备和预处理数据准备与预处理主要包括:数据收集需要注意数据的代表性和多样性,来保证模型在未知数据上的表现,即泛化能力数据清洗处理缺失值、异常值、噪声、重复数据特征工程标准化:为了消除特征之间量纲不同导致的取值范围差异的影响,将数据按比例缩放,使其落入一个特定的区域特征选择:去掉某些对输出结果没有影响的特征,减少数据的维度数据集划分训练集:用于训练模型,占总数据集的60%-80%验证集:用于模型选择(比如决定哪个模型更好)和模型超参数调整,占总数据集的10%-20%测试集:在整个训练过程中未曾见过的数据,用于评估模型的效果,占总数据集的10%-20%1.2.2模型构建在数据准备完成后,需要选择合适的模型线型回归、决策树、SVM、神经网络……选择损失函数性能度量:来衡量模型得到的预测值与对应样本真实标签之间的差别大小常用损失函数举例均方误差:通过计算模型预测值与真实值之间的平方差来衡量误差,也称为平方L2损失交叉熵误差:常用于分类问题,用于衡量模型预测的概率分布()与真实标签的概率分布()之间的差异。对于二分类问题,交叉熵损失函数表示为:其中或,1.2.2.1参数什么是参数?参数可以被看作旋钮,旋钮的转动可以调整模型的行为举例:神经网络的权重、偏置在一个数据集上,可以通过最小化损失函数来学习模型参数的最佳值,找到最合适的模型Y=A*颜色+B*大小+C模型:参数:(A,B,C)1.2.2.2超参数超参数是用于管理机器学习模型的外部配置变量举例:网络层数、宽度、学习率等超参数会决定模型架构和模型复杂性,比如神经网络中的层数和每一层的节点数超参数需要在训练前进行手动配置深度学习领域常说的“调参”,就是指超参数调优超参数的值不是通过学习算法学习出来的超参数调优可以手动进行,也可以使用自动算法完成验证集:用于挑选超参数的数据子集原则上,测试样本不能以任何形式参与到模型的选择中,包括设定超参数1.2.3模型训练从数据中进行学习,获得模型的过程称为训练经过训练,我们可以发现合适的参数集,从而使模型执行所需的行为训练过程通常包含如下步骤:从一个随机初始化参数的模型开始,这个模型基本没有“智能”获取一些数据样本(例如,图片以及对应的标签)调整参数,使模型在这些样本中表现得更好重复第2步和第3步,直到模型在任务中的表现令人满意1.2.3.1优化算法优化算法:搜索最佳模型参数,以最小化损失函数优化算法通过不断调整模型的参数,使得在训练数据上的损失函数值最小深度学习中,大多流行的优化算法通常基于一种基本策略——梯度下降使用梯度下降的过程就像是在一个山谷中寻找最低点,每次都沿着最陡峭的方向(即梯度)走一步,直到到达梯度几乎为0的最低点深度学习中常用的优化算法:SGD、Adam1.2.4测试与泛化在训练数据上表现良好的模型,不一定在测试数据上有同样的性能当一个模型在训练集上表现良好,但在测试数据上表现很差时,这个模型称为过拟合机器学习的目标:从训练样本中学习适用于所有潜在样本的普遍规律过拟合:模型过于关注训练数据,把训练数据本身的一些特点当做了所有潜在样本都会具有的一般性质极端例子:只要输入出现在了训练集中,就把训练集中的标签作为对应输出;如果输入没有出现在训练集中,就输出一个随机值该模型在训练数据集上的损失为0,但没有意义仅仅是记住了训练集,没有挖掘训练集中的规律和模式过拟合的一般原因:模型学习能力太强,学到了训练样本包含的不具有一般性的特点欠拟合:在训练数据上表现很差,对训练样本的一般性质都没有学到欠拟合的一般原因:模型学习能力不足(左)用线性函数拟合数据,导致欠拟合,它无法捕捉数据中的分布规律(中)用二次函数拟合数据,效果较好,并且捕捉到了数据的分布规律,不会导致明显的欠拟合或者过拟合(右)一个高阶的多项式拟合数据导致过拟合,模型能够精确地穿过所有的训练点,但无法提取有效的结构信息线性函数二次函数高阶的多项式1.2.4测试与泛化机器学习的主要挑战:算法必须能够在未观测的新输入上表现良好,而不只是在训练集上表现良好。在未观测到的输入上表现良好的能力称为泛化能力训练误差:模型在训练数据集上计算得到的误差训练集上的均方误差:泛化误差/测试误差:模型应用在从原始样本的分布中抽取的无限多数据样本时,模型误差的期望无限多样本上的均方误差:无法计算,需要遍历无穷多样本在随机选取的、未曾在训练集中出现的测试集样本上估计1.2.4测试与泛化1.2.4.1正则化为了提高模型的泛化能力,通常会使用正则化技术L1和L2正则化在模型的损失函数中添加一个额外的惩罚项,避免模型的参数值太大早停在训练机器学习模型的同时,观察验证集上的性能,当性能开始下降时,就停止训练Dropout(丢弃)在神经网络中常用的正则化技术在训练过程中,Dropout会随机选择一部分神经元并将其输出设置为0,以此防止模型过度依赖某些特定的神经元,从而提高模型的泛化能力数据增强通过修改已有训练样本来增加训练数据例如,在图像分类任务中,我们可以通过旋转、缩放、剪裁等方式来创建新的训练图像《深度学习》第一章深度学习基础

第三节数学基础方勇纯南开大学

人工智能学院1.3.1微积分基础一个函数在某一点的导数描述了这个函数在这一点附近的变化率,也称为函数在该点的切线斜率假设函数在某一区间内有定义,及在该区间内,则定义函数在点处的导数为泰勒展开:一种常见的函数近似方法,其本质是利用幂函数来近似任意函数假设在处有阶导数,则泰勒公式为越大,近似效果越好多元函数是自变量具有多个分量的函数,其一般形式为多元函数关于某一分量的导数称为偏导数,记为,具体定义如下即在求偏导的过程中,保持分量恒定不变,仅求该函数关于分量的导数即可1.3.1微积分基础在深度学习中,函数通常是以嵌套的形式出现的,例如当,且时,与的关系表示为

,我们将这类函数称为复合函数对于复合函数求导,通常利用链式法则链式法则对多元复合函数也成立假设有一可微多元函数,对于任意可微函数,都有变量,则同样可以利用链式法则求得多元复合函数对任意自变量的偏导数:1.3.1微积分基础1.3.2线性代数基础定义含有个元素的向量为对于多元函数,我们对其自变量的所有分量分别求偏导数,并把求得的偏导数写为(列)向量形式,称作该多元函数的梯度,记作定义行列的标量组成的矩阵为1.3.2线性代数基础对于实对称矩阵,其特征值分解为其中是由特征值向量构成的正交矩阵,满足,

是由特征值构成的对角矩阵对于矩阵,其奇异值分解为其中和是由奇异值向量构成的正交矩阵是由奇异值构成的对角矩阵1.3.3概率统计基础期望又称数学期望、均值,反映随机变量平均取值的大小对于离散型随机变量,对于连续型随机变量,方差又称变异数、变方,描述的是一个随机变量的离散程度,即该变量与其期望值的距离,是随机变量与其总体均值或样本均值的差的平方的期望值方差的平方根称为该随机变量的标准差1.3.3概率统计基础设A与B为样本空间中的两个事件,在事件B发生的条件下,事件A发生的条件概率,记为,具体定义如下:假设A与B为随机事件,事件A在B已发生的条件下发生的概率,与B在A已发生的条件下

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论