机器学习数学基础速查-线性代数概率微积分_第1页
机器学习数学基础速查-线性代数概率微积分_第2页
机器学习数学基础速查-线性代数概率微积分_第3页
机器学习数学基础速查-线性代数概率微积分_第4页
机器学习数学基础速查-线性代数概率微积分_第5页
已阅读5页,还剩5页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

机器学习数学基础速查——线性代数/概率/微积分

标签:机器学习数学|线性代数|概率论|微积分|公式速查|2026最新

日期:2026年9月22日

一句话简介:按线性代数、概率论、微积分三大板块,逐一整理机器学习核心数学公式——每个公式附有含义解释、

ML应用场景和直觉理解,可直接作为日常查用手册。

关键词/标签:机器学习数学基础、线性代数速查、概率论速查、微积分速查、矩阵分解、贝叶斯定理、梯度下降、KL

散度

适用人群:机器学习初学者、数据科学家、算法工程师、需要复习数学基础的从业者、准备面试的求职者

文档类型:清单表格类

目录

第一章:线性代数速查

第二章:概率论速查

第三章:微积分速查

第四章:三大板块在ML中的交叉应用

第五章:公式速查总表

附录:隐私安全规范

第一章:线性代数速查

1.1向量基础

概念公式ML应用直觉理解

向量内积a·b=Σaᵢbᵢ相似度计算、注意力分数两个向量的对齐程度

向量范数(L2)‖a‖₂=√(Σaᵢ²)正则化、距离度量向量的长度

向量范数(L1)‖a‖₁=Σ|aᵢ|Lasso正则化绝对值之和

余弦相似度cos(θ)=a·b/(‖a‖‖b‖)文本相似度、推荐系统只看方向不看长度

单位向量â=a/‖a‖归一化、嵌入向量长度为1的向量

关键理解:在ML中,一切数据最终都变成向量。一张图片是一个向量,一个词是一个向量,一个用户也是一个向量。

向量之间的运算就是ML的基本操作。

1.2矩阵运算

运算公式ML应用直觉理解

矩阵乘法(AB)ᵢⱼ=ΣₖAᵢₖBₖⱼ线性变换、神经网络前向传播复合变换

运算公式ML应用直觉理解

转置(Aᵀ)ᵢⱼ=Aⱼᵢ梯度计算、注意力机制行列互换

逆矩阵AA⁻¹=I线性回归闭式解撤销变换

迹tr(A)=ΣᵢAᵢᵢ矩阵范数、概率分布对角线元素之和

行列式det(A)概率密度变换、可逆性判断变换的体积缩放因子

矩阵乘法的核心:矩阵A乘以向量x,本质是对x做一次线性变换——旋转、缩放或投影。神经网络每一层都在做这件

事。

1.3特殊矩阵

矩阵类型定义ML应用

单位矩阵对角线为1,其余为0初始化、残差连接

对角矩阵非对角线元素全为0特征缩放、协方差矩阵

对称矩阵A=Aᵀ核矩阵、协方差矩阵、海森矩阵

正交矩阵AAᵀ=I特征分解、SVD

正定矩阵xᵀAx>0(∀x≠0)凸优化判断、核函数

稀疏矩阵大部分元素为0自然语言处理、推荐系统

1.4矩阵分解

分解方法公式ML应用核心价值

特征值分解A=QΛQ⁻¹PCA、谱聚类找到矩阵的“主方向”

SVDA=UΣVᵀ降维、推荐系统、图像压缩任意矩阵的分解

LU分解A=LU线性方程组求解加速计算

QR分解A=QR最小二乘、特征值计算正交化

Cholesky分解A=LLᵀ高斯过程、采样正定矩阵的“平方根”

SVD的ML意义:SVD将矩阵分解为“旋转→缩放→旋转”三步。在推荐系统中,SVD将用户-物品评分矩阵分解为用户特

征和物品特征,用低维向量表示用户偏好和物品属性。

特征值分解的ML意义:PCA通过特征值分解找到数据方差最大的方向。特征值越大,说明该方向包含的信息越多。降

维就是丢弃小特征值对应的方向。

1.5范数与正则化

范数公式正则化名称效果

L0非零元素个数L0正则稀疏但不可导

L1Σ|xᵢ|Lasso稀疏解(部分权重为0)

L2√(Σxᵢ²)Ridge权重平滑(权重趋近于0)

L∞max(|xᵢ|)—限制最大权重

Frobenius√(ΣᵢⱼAᵢⱼ²)矩阵正则矩阵版本的L2

L1vsL2的核心区别:L1倾向于将不重要的权重直接置为0(特征选择),L2倾向于将所有权重都变小但不为0(防止

过拟合)。

第二章:概率论速查

2.1概率基础

概念公式ML应用直觉理解

条件概率P(A|B)=P(A∩B)/P(B)朴素贝叶斯、HMM已知B发生,A发生的概率

乘法规则P(A∩B)=P(A|B)P(B)联合概率分解两件事同时发生的概率

全概率公式P(A)=ΣP(A|Bᵢ)P(Bᵢ)混合模型、边缘化穷举所有可能的原因

贝叶斯定理P(A|B)=P(B|A)P(A)/P(B)贝叶斯推断、垃圾邮件过滤用新证据更新信念

独立性P(A∩B)=P(A)P(B)朴素贝叶斯假设一件事不影响另一件

贝叶斯定理的ML意义:贝叶斯定理是“从数据中学习”的数学基础。P(A)是先验(看到数据前的信念),P(B|A)是似然

(假设A成立时观测到B的概率),P(A|B)是后验(看到数据后更新的信念)。

2.2随机变量与分布

离散分布:

分布概率质量函数ML应用

伯努利P(X=1)=p,P(X=0)=1-p二分类

二项分布P(X=k)=C(n,k)pᵏ(1-p)ⁿ⁻ᵏ多次伯努利试验

类别分布P(X=k)=pₖ多分类

泊松分布P(X=k)=λᵏe⁻λ/k!计数数据、事件频率

连续分布:

分布概率密度函数ML应用

均匀分布f(x)=1/(b-a)初始化、采样

高斯分布f(x)=1/(√(2π)σ)·exp(-(x-μ)²/(2σ²))噪声建模、VAE

指数分布f(x)=λe⁻λˣ生存分析、等待时间

Beta分布f(x)=x(α-1)(1-x)(β-1)/B(α,β)贝叶斯先验、A/B测试

Dirichlet分布Beta的多维推广LDA主题模型

高斯分布的ML意义:高斯分布是ML中最常用的分布。中心极限定理告诉我们,大量独立随机变量之和趋近于高斯分

布。这就是为什么噪声通常建模为高斯分布。

2.3期望、方差与协方差

概念公式ML应用

期望E[X]=ΣxP(X=x)或∫xf(x)dx损失函数的期望风险

方差Var(X)=E[(X-E[X])²]数据分布宽度、偏差-方差分解

协方差Cov(X,Y)=E[(X-E[X])(Y-E[Y])]特征相关性

协方差矩阵Σᵢⱼ=Cov(Xᵢ,Xⱼ)PCA、高斯分布

相关系数ρ=Cov(X,Y)/(σₓσᵧ)特征选择

期望的线性性质:E[aX+bY]=aE[X]+bE[Y],无论X和Y是否独立。这是ML中许多推导的基础。

方差的性质:Var(aX)=a²Var(X)。Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)。当X和Y独立时,Cov(X,Y)=0。

2.4贝叶斯推断

概念公式说明

先验P(θ)看到数据前对参数的信念

似然P(D|θ)给定参数时观测到数据的概率

后验P(θ|D)∝P(D|θ)P(θ)看到数据后更新的信念

最大似然估计θ̂=argmaxP(D|θ)频率学派方法

最大后验估计θ̂=argmaxP(D|θ)P(θ)贝叶斯学派方法

MLEvsMAP的区别:MLE只看数据,MAP同时考虑先验。当先验是均匀分布时,MAP等价于MLE。当数据量很大

时,先验的影响被稀释,MAP趋近于MLE。

2.5信息论

概念公式ML应用

信息量I(x)=-logP(x)衡量事件的不确定性

熵H(X)=-ΣP(x)logP(x)决策树分裂、不确定性度量

交叉熵H(p,q)=-Σp(x)logq(x)分类损失函数

KL散度KL(p‖q)=Σp(x)log(p(x)/q(x))VAE损失、分布对齐

互信息I(X;Y)=H(X)-H(X|Y)特征选择

交叉熵损失的ML意义:分类任务中最常用的损失函数就是交叉熵。它衡量的是“用预测分布q去编码真实分布p所需的

额外信息量”。当q=p时,交叉熵最小。

KL散度的关键性质:KL(p‖q)≥0,当且仅当p=q时等号成立。KL散度不对称——KL(p‖q)≠KL(q‖p)。

第三章:微积分速查

3.1导数基础

概念公式ML应用

导数定义f‘(x)=lim(h→0)[f(x+h)-f(x)]/h变化率

常见导数(xⁿ)’=nxⁿ⁻¹多项式求导

指数导数(eˣ)’=eˣSoftmax、Sigmoid

对数导数(lnx)’=1/x交叉熵损失

乘积法则(fg)’=f‘g+fg’反向传播

链式法则(f(g(x)))’=f‘(g(x))·g’(x)反向传播核心

链式法则的ML意义:链式法则是反向传播算法的数学基础。神经网络的每一层都是一个函数,整个网络是这些函数的

复合。计算梯度时,从输出层向输入层逐层应用链式法则。

3.2偏导数与梯度

概念公式ML应用

偏导数∂f/∂xᵢ多元函数对单个变量的导数

梯度∇f=(∂f/∂x₁,...,∂f/∂xₙ)梯度下降

方向导数D_vf=∇f·v沿方向v的变化率

梯度性质梯度指向函数增长最快的方向优化

梯度的ML意义:梯度告诉我们在参数空间中,往哪个方向走函数值下降最快。梯度下降就是沿着负梯度方向更新参

数。

3.3梯度下降

变体更新公式特点

批量梯度下降θ=θ-η∇L(θ)用全部数据计算梯度

随机梯度下降θ=θ-η∇L(θ;xᵢ,yᵢ)用单个样本计算梯度

小批量梯度下降θ=θ-η∇L(θ;B)用一批样本计算梯度

动量法v=βv+(1-β)∇L;θ=θ-ηv加速收敛、减少震荡

Adam结合动量和自适应学习率最常用的优化器

学习率η的作用:η太大,可能跳过最优解甚至发散;η太小,收敛太慢。学习率调度策略(如余弦衰减、Warmup)

可以动态调整学习率。

3.4高阶导数

概念公式ML应用

二阶导数f’‘(x)判断凹凸性

海森矩阵Hᵢⱼ=∂²f/∂xᵢ∂xⱼ牛顿法、二阶优化

雅可比矩阵Jᵢⱼ=∂fᵢ/∂xⱼ向量值函数的导数

拉普拉斯算子∇²f=Σ∂²f/∂xᵢ²图像处理、扩散模型

海森矩阵的ML意义:海森矩阵描述函数的曲率。如果海森矩阵正定,函数是凸的,局部最小值就是全局最小值。牛顿

法利用海森矩阵信息加速收敛,但计算成本高。

3.5泰勒展开

阶数公式ML应用

一阶f(x)≈f(a)+f’(a)(x-a)梯度下降的推导

二阶f(x)≈f(a)+f‘(a)(x-a)+f’‘(a)(x-a)²/2牛顿法

一般形式f(x)=Σf⁽ⁿ⁾(a)(x-a)ⁿ/n!函数近似

3.6拉格朗日乘子法

概念公式ML应用

拉格朗日函数L(x,λ)=f(x)+λg(x)约束优化

KKT条件∇f+λ∇g=0,g(x)=0等式约束最优解

概念公式ML应用

对偶问题min_xmax_λL(x,λ)SVM推导

拉格朗日乘子法的ML意义:SVM的推导核心就是拉格朗日乘子法。通过引入拉格朗日乘子,将有约束的优化问题转化

为无约束问题。

第四章:三大板块在ML中的交叉应用

4.1线性回归——三者的综合应用

数学工具在其中的作用

线性代数用矩阵表示数据和参数:y=Xw

微积分对损失函数求导得到梯度:∇L=Xᵀ(Xw-y)

概率论假设噪声服从高斯分布,推导出最小二乘损失

完整推导链条:

假设y=Xw+ε,ε~N(0,σ²)→似然函数P(y|X,w)=N(Xw,σ²I)→最大似然估计→最小化‖y-Xw‖²→对w求导令为0

→w=(XᵀX)⁻¹Xᵀy。

4.2PCA——线性代数与概率论的结合

步骤数学工具具体操作

数据中心化概率论减去均值

计算协方差矩阵概率论+线性代数Σ=(1/n)XᵀX

特征值分解线性代数Σ=QΛQᵀ

选择主成分线性代数取前k个最大特征值对应的特征向量

投影降维线性代数Z=XQₖ

4.3神经网络训练——微积分与线性代数的结合

步骤数学工具具体操作

前向传播线性代数矩阵乘法+激活函数

损失计算概率论交叉熵/均方误差

反向传播微积分(链式法则)逐层计算梯度

参数更新微积分(梯度下降)θ=θ-η∇L

4.4贝叶斯神经网络——概率论与微积分的结合

概念数学工具说明

权重分布概率论权重不再是固定值,而是分布

变分推断微积分+概率论用简单分布近似复杂后验

ELBO概率论+微积分证据下界,变分推断的目标函数

重参数化技巧微积分使采样过程可导

第五章:公式速查总表

5.1线性代数核心公式

序号公式名称

1a·b=Σaᵢbᵢ内积

2‖a‖₂=√(Σaᵢ²)L2范数

3cos(θ)=a·b/(‖a‖‖b‖)余弦相似度

4(AB)ᵢⱼ=ΣₖAᵢₖBₖⱼ矩阵乘法

5A=QΛQ⁻¹特征值分解

6A=UΣVᵀSVD

7xᵀAx>0正定矩阵

5.2概率论核心公式

序号公式名称

1P(A|B)=P(A∩B)/P(B)条件概率

2P(A|B)=P(B|A)P(A)/P(B)贝叶斯定理

3E[X]=ΣxP(X=x)期望

4Var(X)=E[(X-E[X])²]方差

5H(X)=-ΣP(x)logP(x)熵

6KL(p‖q)=Σp(x)log(p(x)/q(x))KL散度

7θ̂=argmaxP(D|θ)最大似然估计

5.3微积分核心公式

序号公式名称

1f‘(x)=lim(h→0)[f(x+h)-f(x)]/h导数定义

2(f(g(x)))’=f‘(g(x))·g’(x)链式法则

3∇f=(∂f/∂x₁,...,∂f/∂xₙ)梯度

4θ=θ-η∇L(θ)梯度下降

5Hᵢⱼ=∂²f/∂xᵢ∂xⱼ海森矩阵

6f(x)≈f(a)+f’(a)(x-a)一阶泰勒展开

7L(x,λ)=f(x)+λg(x)拉格朗日函数

5.4常见分布速查表

分布参数期望方差ML应用

伯努利ppp(1-p)二分类

二项n,pnpnp(1-p)多次试验

泊松λλλ计数数据

均匀a,b(a+b)/2(b-a)²/12初始化

高斯μ,σ²μσ²噪声建模

指数λ1/λ1/λ²等待时间

Betaα,βα/(α+β)

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论