版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
深度学习预备知识主讲:XXX时间:202X/X目录CONTENTS01线性代数02概率论03本章小结线性代数AIPARTONE线性代数什么是维数灾难?在很多机器学习问题中,训练集中的每条数据经常伴随着上千、甚至上万个特征。要处理这所有的特征的话,不仅会让训练非常缓慢,还会极大增加搜寻良好解决方案的困难。维数灾难并不是特征维度越大越好,模型的性能会随着特征的增加先上升后下降。线性代数降维降维是将训练数据中的样本(实例)从高维空间转换到低维空间为什么要降维?(1)高维数据增加了运算的难度。(2)高维使得学习算法的泛化能力变弱(例如,在最近邻分类器中,样本复杂度随着维度成指数增长),维度越高,算法的搜索难度和成本就越大。(3)降维能够增加数据的可读性,利于发掘数据的有意义的结构。降维的主要作用1.减少冗余特征,降低数据维度身高x(cm)身高y(m)1801.8假设我们有两个特征x与y这两个分开的特征和,实际上表示的内容相同,这样其实可以减少数据到一维,只有一个特征表示身高就够了。身高x(cm)180线性代数降维的主要作用1.减少冗余特征,降低数据维度2.数据可视化降维可以提供一个框架来解释结果。相关特征,特别是重要特征更能在数据中明确的显示出来;如果只有二维或者三维的话,更便于可视化展示。这样做也存在一定的问题,降维的算法只负责减少维数,新产生的特征的意义就必须由我们自己去发现了。降维降维是将训练数据中的样本(实例)从高维空间转换到低维空间为什么要降维?(2)高维使得学习算法的泛化能力变弱(例如,在最近邻分类器中,样本复杂度随着维度成指数增长),维度越高,算法的搜索难度和成本就越大。(3)降维能够增加数据的可读性,利于发掘数据的有意义的结构。(1)高维数据增加了运算的难度。线性代数特征值分解以PCA(主成分分析)为例场景导入拿到一个汽车的样本,里面既有以“千米/每小时”度量的最大速度特征,也有“英里/小时”的最大速度特征,显然这两个特征有一个多余。拿到一个数学系的本科生期末考试成绩单,里面有三列,一列是对数学的兴趣程度,一列是复习时间,还有一列是考试成绩。我们知道要学好数学,需要有浓厚的兴趣,所以第二项与第一项强相关,第三项和第二项也是强相关。那是不是可以合并第一项和第二项呢?线性代数拿到一个汽车的样本,里面既有以“千米/每小时”度量的最大速度特征,也有“英里/小时”的最大速度特征,显然这两个特征有一个多余。拿到一个数学系的本科生期末考试成绩单,里面有三列,一列是对数学的兴趣程度,一列是复习时间,还有一列是考试成绩。我们知道要学好数学,需要有浓厚的兴趣,所以第二项与第一项强相关,第三项和第二项也是强相关。那是不是可以合并第一项和第二项呢?需要一种特征降维的方法来减少特征数,减少噪音和冗余,减少过度拟合的可能性。特征值分解以PCA(主成分分析)为例场景导入线性代数主成分分析(principalcomponentanalysis,PCA)最初由卡尔·皮尔逊(KarlPearson)在1901提出。主成分分析是数据降维的重要方法之一。通过线性变换,主成分分析将原始多维数据投影到一个新的正交坐标系,将原始数据中的最大方差成分提取出来。特征值分解以PCA(主成分分析)为例PCA是什么?线性代数更通俗地讲,主成分分析实际上寻找数据在主元空间内投影。图中所示杯子,它是一个3D物体,在一张图展示杯子,而且尽可能多地展示杯子细节,就需要从空间多个角度观察杯子并找到合适角度。这个过程实际上是将三维数据投影到二维平面过程。这也是一个降维过程,即从三维变成二维。特征值分解以PCA(主成分分析)为例PCA是什么?线性代数PCA计算过程假设我们得到的2维数据,行代表了样例,列代表特征,这里有10个样例,每个样例两个特征。可以这样认为:有10辆汽车,x是千米/小时的速度v1,y是英里/小时的速度v2分别求x和y的平均值,然后对于所有的样例,都减去对应的均值。这里x的均值是1.81,y的均值是1.91,那么一个样例减去均值后即为(0.69,0.49)STEP1特征值分解以PCA(主成分分析)为例线性代数分别求x和y的平均值,然后对于所有的样例,都减去对应的均值。这里x的均值是1.81,y的均值是1.91,那么一个样例减去均值后即为(0.69,0.49)STEP1显然第二个的方差比第一个小。因此,在第一步之后,需要对特征做方差归一化。求每个特征的标准差考虑另一种场景:特征x是汽车速度(0到100),特征y是汽车的座位数(2到6)然后对每个样例在该特征下的数据除以PCA计算过程特征值分解以PCA(主成分分析)为例线性代数分别求x和y的平均值,然后对于所有的样例,都减去对应的均值。这里x的均值是1.81,y的均值是1.91,那么一个样例减去均值后即为(0.69,0.49)STEP1STEP2求特征协方差矩阵,如果数据是3维,那么协方差矩阵是这里只有x和y,求解得对角线上分别是x和y的方差,非对角线上是协方差。协方差大于0表示x和y若有一个增,另一个也增;小于0表示一个增,一个减;协方差为0时,两者独立。协方差绝对值越大,两者对彼此的影响越大,反之越小。PCA计算过程特征值分解以PCA(主成分分析)为例线性代数STEP3求协方差的特征值和特征向量,得到上面是两个特征值,下面是对应的特征向量特征值对应特征向量为STEP4将特征值按照从大到小的顺序排序,选择其中最大的k个,然后将其对应的k个特征向量分别作为列向量组成特征向量矩阵。这里特征值只有两个,选择其中最大的那个,这里是对应的特征向量是PCA计算过程特征值分解以PCA(主成分分析)为例线性代数STEP5将样本点投影到选取的特征向量上。假设样例数为m,特征数为n,减去均值后的样本矩阵为DataAdjust(m*n),协方差矩阵是n*n,选取的k个特征向量组成的矩阵为EigenVectors(n*k)。那么投影后的数据FinalData为:这里是
FinalData(10*1)=DataAdjust(10*2矩阵)×特征向量得到结果FinalData(10*1)=PCA计算过程特征值分解以PCA(主成分分析)为例线性代数这个数据可以认为是v1和v2特征融合为一个新的特征叫做v12特征,该特征基本上代表了这两个特征。有10辆汽车,x是千米/小时的速度v1,y是英里/小时的速度v2PCA计算过程特征值分解以PCA(主成分分析)为例线性代数正号表示预处理后的样本点,斜着的两条线就分别是正交的特征向量(由于协方差矩阵是对称的,因此其特征向量正交),最后一步的矩阵乘法就是将原始样本点分别往特征向量对应的轴上做投影。PCA计算过程特征值分解以PCA(主成分分析)为例线性代数
如果取的k=2,那么结果是水平轴基本上可以代表全部样本点。PCA计算过程特征值分解以PCA(主成分分析)为例线性代数奇异值分解SVD计算SVD是将一个任意矩阵分解为三个矩阵。所以如果我们有一个矩阵A,那么它的SVD可以表示为:A是m*n矩阵,U是m*m的正交矩阵,S是m*n的非负对角矩阵,V是n*n的正交矩阵。线性代数由于矩阵V是正交的,等于单位矩阵I。我们可以将SVD方程重新写为:矩阵V:其中:矩阵U:其中:矩阵S:我们取第1个特征向量:得:可以通用化上式:因此A的SVD分解可以看做是和的一系列外积:奇异值分解SVD计算线性代数我们取第1个特征向量:得:可以通用化上式:因此A的SVD分解可以看做是和的一系列外积:若我们取前k个奇异值,根据上式得到新的矩阵。矩阵是降维后的数值。SVD降维线性代数即特征值
在PCA的计算中,如果特征数很多,直接计算协方差矩阵的特征分解在数据维度高时计算量大,且数值稳定性较差。SVD提供了一种更高效、稳定的替代方案。奇异值分解SVD在PCA中的应用协方差矩阵奇异值分解对比特征分解的列向量即PCA的主成分(协方差矩阵的特征向量)概率论AIPARTTWO概率论全概率公式全概率公式是用来求一个事件发生的总概率的,它的基本思想是:将一个复杂的事件分解为若干个互不相容且完备的子事件,然后分别求出每个子事件发生的概率,再乘以该子事件下复杂事件发生的条件概率,最后将所有结果相加,就得到了复杂事件发生的总概率。设
B1,B2,…,Bn
是一组互斥且完备的事件(即它们两两不相交,且并集覆盖所有可能结果),则对任意事件
A,其全概率为:
概率论高射炮向敌机发射三发炮弹,每弹击中与否相互独立且每发炮弹击中的概率均为0.3,又知敌机若中一弹,坠毁的概率为0.2,若中两弹,坠毁的概率为0.6,若中三弹,敌机必坠毁。求敌机坠毁的概率。设X为敌机坠毁的概率;只中1炮A1,只中2炮A2,3炮全中A3,则有中1炮的概率中2炮的概率中3炮的概率全概率公式概率论贝叶斯公式贝叶斯公式描述的是条件概率的逆向推理,核心思想是通过已知的信息,这些信息可能是历史统计信息或者是一种经验,又或者是根据已有知识进行的概率估计——也就是先验概率,结合新情况下得到的数据,反向修正已有的假设或预测,从而更加准确的反映现实情况,得到新情况下的后验概率。概率论先验概率与后验概率P(A∣B):后验概率,表示在事件B发生的条件下,事件A发生的概率——这是我们要经过反向推理计算得到的数据。P(B∣A):似然度(Likelihood),表示在事件A发生的条件下,事件B发生的概率,也就是新情况下得到的数据。P(A):先验概率(Prior),表示在观察到任何新的证据之前,事件A发生的初始概率。P(B):边际似然(MarginalLikelihood),表示事件B发生的总概率,可通过全概率公式计算。概率论高斯混合模型GMM高斯分布(正态分布)μ
是均值(分布的中心)σ
是标准差(分布的离散程度)曲线呈对称的“钟形”(钟形曲线)概率论高斯混合模型是一个概率模型,用于表示一个由多个高斯分布(正态分布)组成的数据集合。GMM假设数据集中的每个数据点是由多个潜在的高斯分布之一生成的。这些高斯分布的参数(如均值和方差)以及它们的权重(每个分布的贡献程度)是需要估计的。数学上,GMM的形式可以表示为:
是数据点。
是高斯分布的数量(也称为组件)。
是第
个高斯分布的混合权重,满足
。
是第
个高斯分布,具有均值
和协方差矩阵
。高斯混合模型GMM概率论假设你在城市的不同咖啡店测量了人们的身高。由于不同地区的人群有不同的身高分布,你会发现你测到的数据有几个明显的“高峰”,每个高峰代表了一个区域的身高分布。如果把这些高峰看作是单个的高斯分布(钟形曲线),那么GMM就会告诉你,每个数据点(每个人的身高)是由哪个钟形曲线生成的,或者说属于哪个“群体”。运用前提条件数据独立同分布:假设数据点是独立同分布的。簇结构可表示为高斯分布:假设每个簇可以用高斯分布描述,即数据的簇是椭圆形的分布。维度适中:对于非常高维的数据,协方差矩阵计算可能复杂,可能需要降维处理。高斯混合模型GMM概率论高斯混合模型GMM算法流程初始化:随机选择高斯分布参数(用二维的圈表示)循环直到收敛:步骤1:根据当前高斯分布为每个数据点分配颜色(即计算归属概率)根据数据点的颜色重新计算高斯分布参数(更新均值、方差)概率论高斯混合模型优缺点优点:灵活性:GMM可以处理复杂的多峰数据分布,每个高斯组件允许不同的均值和协方差矩阵。软分配:与K-means不同,GMM为每个数据点分配概率,而不是硬分配,这种软分配适合处理有重叠的簇。概率解释:GMM提供了概率上的解释,适用于需要概率输出的应用。密度估计:能够用于估计数据
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 食品加工原料定点采购合同二篇
- 2026年弋阳县公务员招聘笔试备考题库及答案解析
- 2026年文县公务员招聘笔试备考题库及答案解析
- 2026四川建强鑫建筑有限公司劳务派遣人员招聘1人考试备考试题及答案详解
- 淄博锅炉考试典型试题及答案分享
- 2026年墨江哈尼族自治县公务员招聘考试模拟试题及答案解析
- 浙江省台州市2025-2026学年高二下学期期末数学试题 含解析
- 2026年嵊泗县公务员招聘考试模拟试题及答案解析
- 2026中国无人机物流配送空域管理政策适应性分析
- 2026汽车销售行业市场深度调研及发展研究分析报告与投资前景展望分析
- 2026云南大理州交建实业(集团)有限公司及下属公司员工招聘15人笔试题库含完整答案详解【夺冠系列】
- 2026宁波高新区机关各部门、事业单位及街道编外招聘30人考试备考题库及答案详解
- 实验室生物安全手册
- 韩杰案医保与医疗风险的双重困境2026
- 成都七初天环2025初一入学数学分班考试真题含答案
- 四川省泸州市2025-2026学年高一下学期期末考试地理试卷
- 2026年消防局文员考试试题题库及答案解析
- 2026年高考物理真题完全解读(河南卷)
- 水生产处理工(初级工)理论考试题库附答案(新版)
- (北师大版)小升初数学试卷
- 矿区水工环地质工作方法及要求
评论
0/150
提交评论